Короткий ответ на вопрос «сколько иероглифов в китайском языке» не существует — любая цифра будет верной только в контексте конкретного словаря или стандарта. Язык не имеет фиксированного алфавита, а его письменность представляет собой открытую систему знаков, пополняемую веками. Понимание разницы между историческим набором, современным стандартом кодировки и рабочим минимумом для чтения газеты — ключ к ориентации в этом многообразии.

Лингвисты отличают графемы (минимальные различимые единицы письма), лексемы (слова) и варианты написания одного и того же знака. Один иероглиф может иметь десятки исторических форм — от надписей на гадательных костях цзягувэнь до современного упрощённого образа. Именно поэтому подсчёт «всех иероглифов» превращается в задачу по определению границ выборки.

Исторические словари: от Канси до «Моря иероглифов»

Классическим эталоном полноты долгое время оставался Словарь Канси (1716 г.), собравший 47 035 знаков. Однако значительная их часть — архаизмы, варианты написания и ошибки копистов, никогда не использовавшиеся в живой речи. Этот словарь зафиксировал состояние письменности XVII века, но не стал пределом.

В XX веке вышло Да цзюань («Большой словарь», 1915) с ~48 000 знаками, а позже — фундаментальный Ханьюй да цзэдиэнь («Большой словарь китайского языка», 1986–1989), объединивший 54 678 головных иероглифов. Рекордсменом по объёму стал Чжунхуа цзыхай («Море китайских иероглифов», 1994) — 85 568 знаков, включая диалектные, буддийские и уникальные собственные имена.

  • 📜 Словарь Канси (1716) — 47 035 знаков, 214 ключей, эталон классической филологии.
  • 📚 Ханьюй да цзэдиэнь (1989) — 54 678 знаков, академический стандарт PRC.
  • 🌊 Чжунхуа цзыхай (1994) — 85 568 знаков, максимально полная компиляция на сегодня.
  • 🏛 Сыкуань цзэдиэнь (2017) — ~98 000 знаков, включает редчайшие вариативные формы.

Unicode и цифровая реальность: сколько знаков в стандарте

Для современного IT-инженера или веб-разработчика авторитетом является не бумажный том, а стандарт Unicode. Консорциум координирует работу с идеографическим исследовательским комитетом (IRG), систематизируя знаки из Китая, Японии, Кореи и Вьетнама в блок CJK Unified Ideographs. На момент версии 15.1 (сентябрь 2023) стандарт включает 98 682 уникальных кодовых позиции для единых иероглифов.

Важно понимать: Unicode объединяет региональные варианты (китайское упрощённое, китайское традиционное, японское кандзи, корейское ханча, вьетнамское чы нома) под одним кодом, если их структура тождественна. Визуальные различия решаются через шрифты и механизм IVS (Ideographic Variation Sequences). Поэтому цифра Unicode — это не сумма уникальных китайских слов, а число абстрактных графических единиц для межнационального обмена данными.

💡

При работе с базами данных используйте нормализацию NFC/NFD: один и тот же визуальный иероглиф может кодироваться разными последовательностями кодовых точек, что ломает поиск и дедупликацию.

Источник / СтандартГод / ВерсияКоличество иероглифовПримечание
Словарь Канси171647 035Классический канон, 214 ключей
Ханьюй да цзэдиэнь198954 678Академический стандарт КНР
Чжунхуа цзыхай199485 568Максимальная энциклопедическая полнота
Unicode (CJK Unified)v15.1 (2023)98 682Международный стандарт кодировки
ГОСТ / GB 18030-20222022~87 000Национальный стандарт КНР (обязателен для ПО)

Рабочий минимум: HSK, грамотность и чтение новостей

Для повседневной жизни и профессиональной деятельности не нужны десятки тысяч знаков. Официальный стандарт Таблица частотности современных китайских иероглифов (, 1988) выделяет 3 500 «часто используемых» знаков — они покрывают ~99% текстов СМИ, офисной переписки и художественной литературы. Расширенный список «общего употребления» (, 2013) включает уже 8 105 знаков, что достаточно для чтения специализированной литературы и классики.

Система экзамена HSK (новый формат 2021 — «3.0») ориентирована на лексику, а не на изолированные иероглифы, но ориентировочно: HSK 1–3 требуют знания ~600–900 знаков, HSK 4–6 — ~1 500–2 500, а высшие уровни 7–9 подразумевают свободное владение ~3 000+ знаками и понимание ~11 000 лексических единиц. Обычный китайский университетский выпускник пассивно узнаёт 5 000–7 000 знаков.

📊 Сколько иероглифов вы считаете необходимым минимумом для комфортного чтения новостей на китайском?
500–1000
2000–3000
3500 (официальный стандарт)
5000+ (профессиональный уровень)
💡

Официальный стандарт грамотности в КНР — 3 500 иероглифов; зная их, вы понимаете 99% современных текстов без словаря.

⚠️ Внимание: Не путайте «знание иероглифа» (узнавание формы и значения) с «знанием слова». Большинство современных слов — двусложные (биграммы), и смысл составного слова часто не дедуцируется от значений составляющих.

Региональные стандарты: упрощённые, традиционные, кандзи и ханча

Китайская письменность вы गई за пределы КНР. В Тайване, Гонконге, Макао используется традиционное письмо — формы, зафиксированные в словаре Канси и стандартизованные в Таблице стандартных форм национальных иероглифов (Тайвань, ~4 800 часто используемых). В Японии — кандзи: список ёдзи содержит 2 136 знаков для повседневного использования, но в именах и литературе встречаются тысячи других (стандарт JIS X 0208/0213 — ~10 000+).

В Корее — ханча: официальный список для образования — 1 800 базовых + ~2 000 для имен собственных. Вьетнам исторически использовало чы нома — собственную систему на базе иероглифов, насчитывавшую десятки тысяч уникальных знаков для записи вьетнамского языка, но с XX века полностью перешло на латиницу куок нгу.

Почему в Японии меньше официальных иероглифов, чем в Китае?

Япония провела радикальную реформу письменности после WWII (�946 г.), создав список «тёё кандзи» (1850 знаков, позже расширен до 2136). Знаки вне списка в официальных документах заменяются хираганой или упрощаются. Китай же сохранил непрерывность традиции и расширил репертуар для научной терминологии.

  • 🇨🇳 КНР (упрощённые) — 3 500 базовых, 8 105 общих (GB 18030 ~87 тыс. для ПО).
  • 🇹🇼 Тайвань / Гонконг (традиционные) — ~4 800 часто используемых, стандарты CNS 11643 / Big5.
  • 🇯🇵 Япония (кандзи) — 2 136 ёдзи, JIS X 0213 ~10 000+ для печати.
  • 🇰🇷 Корея (ханча) — 1 800 базовых для школы, ~4 500 для имен и юриспруденции.

Появляются ли новые иероглифы сегодня?

Да, китайская письменность — живая система. Основной источник новых знаков — химическая номенклатура. По системе фоноидеографического построения (семантический ключ + фонетик) для каждого нового химического элемента создаётся уникальный иероглиф. Все 118 известных элементов имеют свои знаки (например, тянь ☉ для гелия, вюй ☿ для ртути — исторические, а для трансурановых — неологизмы 1950–2000-х).

Второй источник — интернет-сленг и диалекты. Пользователи изобретают знаки для выражения эмоций или диалектных слов, отсутствующих в путунхуа. Пример: иероглиф дуан (𰻝𰻝 — «бианбиан», название лапши) состоит из 56–58 черт и не входит ни в один стандартный словарь, но широко известен. Такие знаки попадают в Unicode только после доказательства устойчивого употребления (процесс занимает годы).

⚠️ Внимание: Изобретение «личного» иероглифа для татуировки или бренда не делает его частью языка. Признание требует частотности в открытых текстах, наличия в авторитетных словарях и включения в национальные стандарты кодировки.

Методология подсчёта: почему цифры расходятся

Разница между 50 000 и 100 000 обусловлена критериями отбора. Считаем ли мы варианты написания как отдельные иероглифы? Словарь Канси даёт им отдельные номера, Unicode — объединяет в одну кодовую позицию с селекторами вариации. Считаем ли иероглифы-слова (один знак = одно слово) и иероглифы-морфемы (знак как часть слова) раздельно? В современной лексикографии единица учёта — цзы, графическая единица, а не цзю, слово.

Кроме того, существуют супер-редкие знаки (хэпекс легомена), встреченные в единственном историческом источнике. Включать их в «язык» или считать ошибками писца — решение редактора словаря. Чжунхуа цзыхай включил их максимально широко, Ханьюй да цзэдиэнь — отсеял явные ошибки, Unicode — ждёт экспертного консенсуса IRG.

💡

Цифра «количества иероглифов» бесполезна без указания источника: словарь Канси (исторический корпус), Unicode (цифровой обмен), стандарт GB (правовой минимум для ПО в КНР) или список HSK (обучающая цель).

Практический чек-лист: на какую цифру ориентироваться вам

Выбор цели определяет нужный объём. Турист и начинающий студент фокусируется на частоте, переводчик технической документации — на покрытии стандартов кодировки, лингвист-историк — на полноте словарных корпусов. Ниже — ориентировочная карта целей и цифр.

☑️ Целевые показатели знания иероглифов

Выполнено: 0 / 5
  • 🎯 Начинающий — 500–1 000 знаков (базовая навигация, приветствия).
  • 📰 Читатель новостей — 3 000–3 500 знаков (стандарт грамотности PRC).
  • 💼 Профессионал — 5 000–8 000 знаков (документация, контракты, наука).
  • 🖥 Инженер Unicode — работа с 98 000+ кодовыми позициями и селекторами вариации.

Итог: «всего существует» — это диапазон от 3 500 (функциональный минимум современности) до 98 682 (Unicode v15.1) и 85 568 (энциклопедический максимум «Моря иероглифов»). Для 99% задач достаточно первых двух тысяч; остальные нужны специалистам и энтузиастам.

FAQ: Частые вопросы о количестве китайских иероглифов
Сколько иероглифов знает средний китайец?

Средний выпускник средней школы в КНР пассивно узнаёт 4 500–5 500 знаков, университетский — 6 000–7 500. Активное письмо требует меньше — около 3 000–3 500 для 99% бытовых задач. Старое поколение, выучившееся на традиционных знаках, может узнавать больше исторических форм.

Правда ли, что для чтения газеты достаточно 3000 иероглифов?

Да, это статистически подтверждённый факт. Список 3 500 «часто используемых иероглифов» покрывает ~99,5% текстов и иных СМИ. Оставшиеся 0,5% — имена собственные, термины, диалектизмы, которые и носители читают по контексту или проверяют в словаре.

Почему в Unicode больше иероглифов, чем в самом полном бумажном словаре?

Unicode накапливает знаки из четырёх традиций (Китай, Япония, Корея, Вьетнам) и не удаляет устаревшие коды для совместимости. Бумажные словари (например, «Море иероглифов») фокусируются на китайской лексике и могут не включать редкие японские кандзи или вьетнамские чы нома, которые в Unicode имеют свои коды.

Нужно ли учить традиционные иероглифы, если я учу упрощённые?

Для работы в КНР, Сингапуре, Малайзии — достаточно упрощённых. Для работы с Тайванем, Гонконгом, классической литературой, искусством, японскими текстами — желательно знать традиционные формы. Правила упрощения системны: зная ~500 ключевых замен и принцип «ключ + фонетик», можно восстанавливать традиционную графику пассивно.

Есть ли иероглифы, которые не входят в Unicode?

Да, существуют тысячи исторических вариативных форм, уникальных диалектных знаков (например, для Kantonese или Hakka) и свежих интернет-неологизмов (как «бианбиан»), которые ещё не прошли процедуру стандартизации IRG. Их кодируют через частные зоны использования (PUA) или собирают в следующие версии стандарта.