Короткий ответ на вопрос «сколько иероглифов в китайском языке» не существует — любая цифра будет верной только в контексте конкретного словаря или стандарта. Язык не имеет фиксированного алфавита, а его письменность представляет собой открытую систему знаков, пополняемую веками. Понимание разницы между историческим набором, современным стандартом кодировки и рабочим минимумом для чтения газеты — ключ к ориентации в этом многообразии.
Лингвисты отличают графемы (минимальные различимые единицы письма), лексемы (слова) и варианты написания одного и того же знака. Один иероглиф может иметь десятки исторических форм — от надписей на гадательных костях цзягувэнь до современного упрощённого образа. Именно поэтому подсчёт «всех иероглифов» превращается в задачу по определению границ выборки.
Исторические словари: от Канси до «Моря иероглифов»
Классическим эталоном полноты долгое время оставался Словарь Канси (1716 г.), собравший 47 035 знаков. Однако значительная их часть — архаизмы, варианты написания и ошибки копистов, никогда не использовавшиеся в живой речи. Этот словарь зафиксировал состояние письменности XVII века, но не стал пределом.
В XX веке вышло Да цзюань («Большой словарь», 1915) с ~48 000 знаками, а позже — фундаментальный Ханьюй да цзэдиэнь («Большой словарь китайского языка», 1986–1989), объединивший 54 678 головных иероглифов. Рекордсменом по объёму стал Чжунхуа цзыхай («Море китайских иероглифов», 1994) — 85 568 знаков, включая диалектные, буддийские и уникальные собственные имена.
- 📜 Словарь Канси (1716) — 47 035 знаков, 214 ключей, эталон классической филологии.
- 📚 Ханьюй да цзэдиэнь (1989) — 54 678 знаков, академический стандарт PRC.
- 🌊 Чжунхуа цзыхай (1994) — 85 568 знаков, максимально полная компиляция на сегодня.
- 🏛 Сыкуань цзэдиэнь (2017) — ~98 000 знаков, включает редчайшие вариативные формы.
Unicode и цифровая реальность: сколько знаков в стандарте
Для современного IT-инженера или веб-разработчика авторитетом является не бумажный том, а стандарт Unicode. Консорциум координирует работу с идеографическим исследовательским комитетом (IRG), систематизируя знаки из Китая, Японии, Кореи и Вьетнама в блок CJK Unified Ideographs. На момент версии 15.1 (сентябрь 2023) стандарт включает 98 682 уникальных кодовых позиции для единых иероглифов.
Важно понимать: Unicode объединяет региональные варианты (китайское упрощённое, китайское традиционное, японское кандзи, корейское ханча, вьетнамское чы нома) под одним кодом, если их структура тождественна. Визуальные различия решаются через шрифты и механизм IVS (Ideographic Variation Sequences). Поэтому цифра Unicode — это не сумма уникальных китайских слов, а число абстрактных графических единиц для межнационального обмена данными.
При работе с базами данных используйте нормализацию NFC/NFD: один и тот же визуальный иероглиф может кодироваться разными последовательностями кодовых точек, что ломает поиск и дедупликацию.
| Источник / Стандарт | Год / Версия | Количество иероглифов | Примечание |
|---|---|---|---|
| Словарь Канси | 1716 | 47 035 | Классический канон, 214 ключей |
| Ханьюй да цзэдиэнь | 1989 | 54 678 | Академический стандарт КНР |
| Чжунхуа цзыхай | 1994 | 85 568 | Максимальная энциклопедическая полнота |
| Unicode (CJK Unified) | v15.1 (2023) | 98 682 | Международный стандарт кодировки |
| ГОСТ / GB 18030-2022 | 2022 | ~87 000 | Национальный стандарт КНР (обязателен для ПО) |
Рабочий минимум: HSK, грамотность и чтение новостей
Для повседневной жизни и профессиональной деятельности не нужны десятки тысяч знаков. Официальный стандарт Таблица частотности современных китайских иероглифов (, 1988) выделяет 3 500 «часто используемых» знаков — они покрывают ~99% текстов СМИ, офисной переписки и художественной литературы. Расширенный список «общего употребления» (, 2013) включает уже 8 105 знаков, что достаточно для чтения специализированной литературы и классики.
Система экзамена HSK (новый формат 2021 — «3.0») ориентирована на лексику, а не на изолированные иероглифы, но ориентировочно: HSK 1–3 требуют знания ~600–900 знаков, HSK 4–6 — ~1 500–2 500, а высшие уровни 7–9 подразумевают свободное владение ~3 000+ знаками и понимание ~11 000 лексических единиц. Обычный китайский университетский выпускник пассивно узнаёт 5 000–7 000 знаков.
Официальный стандарт грамотности в КНР — 3 500 иероглифов; зная их, вы понимаете 99% современных текстов без словаря.
⚠️ Внимание: Не путайте «знание иероглифа» (узнавание формы и значения) с «знанием слова». Большинство современных слов — двусложные (биграммы), и смысл составного слова часто не дедуцируется от значений составляющих.
Региональные стандарты: упрощённые, традиционные, кандзи и ханча
Китайская письменность вы गई за пределы КНР. В Тайване, Гонконге, Макао используется традиционное письмо — формы, зафиксированные в словаре Канси и стандартизованные в Таблице стандартных форм национальных иероглифов (Тайвань, ~4 800 часто используемых). В Японии — кандзи: список ёдзи содержит 2 136 знаков для повседневного использования, но в именах и литературе встречаются тысячи других (стандарт JIS X 0208/0213 — ~10 000+).
В Корее — ханча: официальный список для образования — 1 800 базовых + ~2 000 для имен собственных. Вьетнам исторически использовало чы нома — собственную систему на базе иероглифов, насчитывавшую десятки тысяч уникальных знаков для записи вьетнамского языка, но с XX века полностью перешло на латиницу куок нгу.
Почему в Японии меньше официальных иероглифов, чем в Китае?
Япония провела радикальную реформу письменности после WWII (�946 г.), создав список «тёё кандзи» (1850 знаков, позже расширен до 2136). Знаки вне списка в официальных документах заменяются хираганой или упрощаются. Китай же сохранил непрерывность традиции и расширил репертуар для научной терминологии.
- 🇨🇳 КНР (упрощённые) — 3 500 базовых, 8 105 общих (GB 18030 ~87 тыс. для ПО).
- 🇹🇼 Тайвань / Гонконг (традиционные) — ~4 800 часто используемых, стандарты CNS 11643 / Big5.
- 🇯🇵 Япония (кандзи) — 2 136 ёдзи, JIS X 0213 ~10 000+ для печати.
- 🇰🇷 Корея (ханча) — 1 800 базовых для школы, ~4 500 для имен и юриспруденции.
Появляются ли новые иероглифы сегодня?
Да, китайская письменность — живая система. Основной источник новых знаков — химическая номенклатура. По системе фоноидеографического построения (семантический ключ + фонетик) для каждого нового химического элемента создаётся уникальный иероглиф. Все 118 известных элементов имеют свои знаки (например, тянь ☉ для гелия, вюй ☿ для ртути — исторические, а для трансурановых — неологизмы 1950–2000-х).
Второй источник — интернет-сленг и диалекты. Пользователи изобретают знаки для выражения эмоций или диалектных слов, отсутствующих в путунхуа. Пример: иероглиф дуан (𰻝𰻝 — «бианбиан», название лапши) состоит из 56–58 черт и не входит ни в один стандартный словарь, но широко известен. Такие знаки попадают в Unicode только после доказательства устойчивого употребления (процесс занимает годы).
⚠️ Внимание: Изобретение «личного» иероглифа для татуировки или бренда не делает его частью языка. Признание требует частотности в открытых текстах, наличия в авторитетных словарях и включения в национальные стандарты кодировки.
Методология подсчёта: почему цифры расходятся
Разница между 50 000 и 100 000 обусловлена критериями отбора. Считаем ли мы варианты написания как отдельные иероглифы? Словарь Канси даёт им отдельные номера, Unicode — объединяет в одну кодовую позицию с селекторами вариации. Считаем ли иероглифы-слова (один знак = одно слово) и иероглифы-морфемы (знак как часть слова) раздельно? В современной лексикографии единица учёта — цзы, графическая единица, а не цзю, слово.
Кроме того, существуют супер-редкие знаки (хэпекс легомена), встреченные в единственном историческом источнике. Включать их в «язык» или считать ошибками писца — решение редактора словаря. Чжунхуа цзыхай включил их максимально широко, Ханьюй да цзэдиэнь — отсеял явные ошибки, Unicode — ждёт экспертного консенсуса IRG.
Цифра «количества иероглифов» бесполезна без указания источника: словарь Канси (исторический корпус), Unicode (цифровой обмен), стандарт GB (правовой минимум для ПО в КНР) или список HSK (обучающая цель).
Практический чек-лист: на какую цифру ориентироваться вам
Выбор цели определяет нужный объём. Турист и начинающий студент фокусируется на частоте, переводчик технической документации — на покрытии стандартов кодировки, лингвист-историк — на полноте словарных корпусов. Ниже — ориентировочная карта целей и цифр.
☑️ Целевые показатели знания иероглифов
- 🎯 Начинающий — 500–1 000 знаков (базовая навигация, приветствия).
- 📰 Читатель новостей — 3 000–3 500 знаков (стандарт грамотности PRC).
- 💼 Профессионал — 5 000–8 000 знаков (документация, контракты, наука).
- 🖥 Инженер Unicode — работа с 98 000+ кодовыми позициями и селекторами вариации.
Итог: «всего существует» — это диапазон от 3 500 (функциональный минимум современности) до 98 682 (Unicode v15.1) и 85 568 (энциклопедический максимум «Моря иероглифов»). Для 99% задач достаточно первых двух тысяч; остальные нужны специалистам и энтузиастам.
FAQ: Частые вопросы о количестве китайских иероглифов
Сколько иероглифов знает средний китайец?
Средний выпускник средней школы в КНР пассивно узнаёт 4 500–5 500 знаков, университетский — 6 000–7 500. Активное письмо требует меньше — около 3 000–3 500 для 99% бытовых задач. Старое поколение, выучившееся на традиционных знаках, может узнавать больше исторических форм.
Правда ли, что для чтения газеты достаточно 3000 иероглифов?
Да, это статистически подтверждённый факт. Список 3 500 «часто используемых иероглифов» покрывает ~99,5% текстов и иных СМИ. Оставшиеся 0,5% — имена собственные, термины, диалектизмы, которые и носители читают по контексту или проверяют в словаре.
Почему в Unicode больше иероглифов, чем в самом полном бумажном словаре?
Unicode накапливает знаки из четырёх традиций (Китай, Япония, Корея, Вьетнам) и не удаляет устаревшие коды для совместимости. Бумажные словари (например, «Море иероглифов») фокусируются на китайской лексике и могут не включать редкие японские кандзи или вьетнамские чы нома, которые в Unicode имеют свои коды.
Нужно ли учить традиционные иероглифы, если я учу упрощённые?
Для работы в КНР, Сингапуре, Малайзии — достаточно упрощённых. Для работы с Тайванем, Гонконгом, классической литературой, искусством, японскими текстами — желательно знать традиционные формы. Правила упрощения системны: зная ~500 ключевых замен и принцип «ключ + фонетик», можно восстанавливать традиционную графику пассивно.
Есть ли иероглифы, которые не входят в Unicode?
Да, существуют тысячи исторических вариативных форм, уникальных диалектных знаков (например, для Kantonese или Hakka) и свежих интернет-неологизмов (как «бианбиан»), которые ещё не прошли процедуру стандартизации IRG. Их кодируют через частные зоны использования (PUA) или собирают в следующие версии стандарта.