Вопрос о количестве слов в санскрите не имеет единого числового ответа, и это не недостаток документации, а следствие самой структуры языка. В отличие от английского или русского, где словарный состав относительно статичен, санскрит функционирует как генеративная система: новые лексемы рождаются по строгим правилам в процессе речи. Традиционные словари фиксируют лишь устойчившие формы, а современные корпусные исследования показывают другие порядки величин.
Классический словарь Моньера-Вильямса содержит около 160 000 записей, но лингвисты согласны: это лишь вершина айсберга. Если учитывать все грамматически возможные формы, образованные по правилам Панини, число подходов к подсчёту даёт результаты от нескольких миллионов до «бесконечности» в теоретическом смысле. Понимание этой разницы критично для любого, кто изучает индоарийскую филологию или компьютерную лингвистику.
Почему нельзя назвать точное число: природа санскрита
Санскрит — это самскрита («совершенный, отточенный»), язык, зафиксированный грамматикой Панини (~IV в. до н.э.) задолго до появления письменности. Его ключевая особенность — агглютинативная морфология на стероидах: корни (дхату) объединяются с суффиксами, префиксами и окончаниями по строгим алгоритмам. Каждое сочетание порождает грамматически корректное слово, существующее в языке потенциально.
Представьте конструктор LEGO: корни — это кирпичики, а правила сандхи (фонетических слияний) и составления слов (самаса) — инструкции. Словарь фиксирует только те фигуры, которые кто-то уже собрал и использовал в текстах. Но потенциальных фигур — миллионы. Именно поэтому лингвистика отличает лексикон (словарный запас) от лексического потенциала языка.
⚠️ Внимание: Любая статья, утверждающая «в санскрите 102 миллиарда 785 миллионов слов», цитирует популярный миф, а не научные данные. Такого точного подсчёта не существует и не может существовать по определению генеративной грамматики.
Традиционная лексикография: от «Амаркоши» до Моньера-Вильямса
История подсчёта слов начинается с Амаркоши (V–VI в. н.э.) — тезауруса-самгахи, сгруппировавшего синонимы по семантическим категориям. Он содержит около 10 000 слов, но это не словарь в современном понимании, а пособие для запоминания. Европейская традиция дала масштабные работы: словарь Бётлинга и Ротха (1855–1875) и, конечно, «Санскритско-английский словарь» Моньера-Вильямса (1899).
Словарь Моньера-Вильямса остаётся золотым стандартом: ~160 000 главных статей (headwords). Однако он включает ведические формы, буддийскую гибридную лексику, технические термины аюрведы, йотиши и дхармашастр. Для классической эпохи (кави) активный словарь поэтов был значительно скромнее — по оценкам, 20–30 тысяч корней и базовых форм.
- 📜 Амаркоши — ~10 000 лемм, тематическая структура
- 📚 Шабдакалпадрума — энциклопедический словарь XIX в., ~150 000 статей
- 🔤 Моньер-Вильямс — 160 000+ записей, этимология, падежи
- 💻 Digital Dictionaries of South Asia — оцифрованные версии с поиском по корням
Корпусная лингвистика и цифровые подходы
С появлением Sanskrit Heritage Engine (Жерар Юэне) и Sanskrit Library (Питер Шарф) стало возможным автоматическое морфологическое разбор. Корпус Digital Corpus of Sanskrit (DCS) содержит более 11 млн слов (токенов), но уникальных лемм — около 120 000. Это близко к Моньеру-Вильямсу, но с важным отличием: корпус отражает реальное употребление в текстах, а не потенциал.
Интересный эксперимент: генерация всех форм глагола √kṛ (делать) в настоящем времени, активном залоге, единственном числе даёт 1 форму (karoti), а если перебрать все лакары (времена/наклонения), числа, залоги и лица — уже сотни форм от одного корня. А корней в Дхатупатхе Панини — около 2000. Умножьте на производные суффиксы (крит, твиддита) — и получите миллионы отсловленных форм.
Современные NLP-модели для санскрита (например, SanskritBERT) работают с словарями в 50–100 тысяч субслов (subword tokens), что подтверждает: для практических задач «бесконечность» сворачивается в управляемое множество.
Самаса: сила составных слов
Главный «инфлятор» словарного запаса — самаса (составные слова). Санскрит позволяет объединять слова в цепочки неограниченной длины без потери грамматической корректности. Классический пример — название блюда из «Махабхараты» (или позже аюрведических текстов), насчитывающее десятки слогов. Каждая такая цепочка — отдельное слово с уникальным значением, отсутствующим в словарях.
Типы самаса (двандва, татпуруша, бауврихи, каармадхарая) описывают семантические отношения между компонентами. Rāja-puruṣa (царский человек/слуга) — татпуруша, rāja-rṣi (царь-риши) — двандва. Понимание этих типов позволяет «на лету» разбирать невидимые в словарях неологизмы. Именно самаса делает санскрит уникальным: он кодирует целые предложения в одно слово.
Пример гигантского самаса
Слово pāṇinīya-mahābhāṣya-vivaraṇa-ṭīkā-vyākhyāna-saṃgraha — «сборник комментариев к разъяснению Махабхаши Панини». В текстах встречаются цепочки из 10–15 основ. Каждая теоретически возможна, но лишь единицы зафиксированы в манускриптах.
⚠️ Внимание: Не пытайтесь учить «слова» из самаса как отдельные лексические единицы. Их смысл полностью детерминирован компонентами и типом композиции. Освойте анализ самаса — и вы «будете знать» миллионы слов без зубрежки.
Ведический, классический и буддийский гибридный санскрит: три лексикона
Ошибка новичка — думать, что «санскрит» — это монолит. Существует как минимум три слоя с разной лексикой:
- Ведический санскрит (Ригведа, ~1500–1000 г. до н.э.): архаичные корни, уникальные глагольные формы (иньюнктив, субъюнктив), ритуальная терминология (hotṛ, adhvaryu, udgātṛ). Многие слова исчезли к эпохе Панини.
- Классический санскрит (после Панини, ~500 г. до н.э. – 1000 н.э.): стандартизированная грамматика, кави-литература (Калидаса, Баха, Магха), научные трактаты (Ньяя, Вайшешика, Аюрведа). База для Моньера-Вильямса.
- Буддийский гибридный санскрит (BHS): средний индоарийский слой, санскритизированный по морфологии, но с пракритскими лексическими заимствованиями и синтаксисом. Словари Эджертона и Фклина фиксируют тысячи форм, отсутствующих в классике.
Пересечение этих лексиконов частично. Если вы читаете «Бхагавад-гиту» — это классика с ведическими архаизмами. Если «Лалктавистару» — это BHS. Словарь Моньера-Вильямса охватывает все три, но не разделяет их частотно.
☑️ Что проверить перед работой с текстом
Сравнение с другими языками: аппетит приходит во время еды
Часто приводят сравнение: в Оксфордском словаре английского языка ~600 000 лемм, в ГРАМОТЕ русского — ~150 000, в санскрите (Моньер-Вильямс) — ~160 000. Но это сравнение тёплого с мягким. Английский и русский — языки с фиксированным словарным запасом (лексикон закрыт для продуктивного словообразования в момент речи). Санскрит — язык с открытым лексиконом.
Более честное сравнение — с агглютинативными языками (турецкий, финский, японский), где число словформа тоже теоретически неограничено. Лингвисты там тоже считают леммы, а не токены. Для санскрита уникален фактор: грамматика Панини формализована так строго, что генерация слов полностью алгоритмизируема, что делает его идеальным для компьютерной лингвистики и NLP.
| Язык / Словарь | Кол-во лемм (статей) | Тип морфологии | Потенциал словообразования |
|---|---|---|---|
| Моньер-Вильямс (Санскрит) | ~160 000 | Флективная + самаса | Теоретически неограничен |
| OED (Английский) | ~600 000 | Аналитическая | Ограничен аффиксацией |
| Большой академический (Русский) | ~150 000 | Флективная | Ограничен производством |
| TDK (Турецкий) | ~100 000 | Агглютинативная | Очень высокий |
| Кандзё (Японский) | ~240 000 | Агглютинативная + иероглифы | Высокий (кандзи-комбинации) |
Практический словарь: сколько слов нужно для чтения текстов
Для чтения классической прозы (хитопадеша, панчатантра) достаточно 2 000–3 000 самых частотных лемм. Это покроет 80–90% токенов. Для вед — специфический набор из ~5 000 ритуальных терминов. Для шастр (Ньяя, Веданта, Вьякарана) — техническая терминология ~10 000 понятий, но грамматика базовая.
Стратегия обучения: не учите словарь. Учите корни (дхату) — их ~2000 в Дхатупатхе, но топ-300 покрывают 70% глагольных форм. Учите крит- и твиддита-суффиксы (производные) — их несколько десятков. Учите анализ самаса. Это даст доступ к 99% текстов быстрее, чем зубрежка 50 000 изолированных слов.
Начните с частотного списка лемм из DCS (Digital Corpus of Sanskrit). Топ-500 слов даст понимание структуры простых шлок. Добавьте 200 самых частых самаса-паттернов — и вы начнёте читать Махабхарату со словарем только для уточнений.
Ключевой вывод: «Сколько слов в санскрите?» — неверный вопрос. Правильный: «Какой лексический потенциал мне нужен для моей задачи?». Для чтения кавьи — 3к лемм. Для лингвистического моделирования — генеративная грамматика Панини. Для исторической семантики — ведический конкорданс.
Часто задаваемые вопросы (FAQ)
Есть ли официальный подсчёт слов в санскрите от правительства Индии или Академии наук?
Нет. Ни одна официальная организация не публикует такой цифры, так как язык не имеет регулирующего органа вроде Академии французского языка. Существуют только академические оценки на основе конкретных корпусов или словарей.
Правда ли, что в санскрите больше слов, чем в любом другом языке?
В смысле потенциальных словформ — да, из-за продуктивной морфологии и самаса он превосходит большинство языков. В смысле зафиксированных лемм в словарях — он уступает английскому, немецкому, китайскому и многим другим.
Как компьютеры считают слова в санскрите?
Используют морфологические анализаторы (например, Heritage Engine или Sanskrit Tagger), которые разбирают текст на морфемы по правилам Панини. Подсчёт ведётся либо по токенам (словоформам в тексте), либо по леммам (словарным формам), либо по уникальным корням.
Почему в разных статьях в интернете называются разные цифры: 102 миллиарда, 30 миллионов, 160 тысяч?
160 тысяч — лемм в словаре Моньера-Вильямса. Миллионы — оценка всех возможных отсловленных форм существующих лемм. 102 миллиарда — вирусный миф, вероятно, ошибочная экстраполяция комбинаторики самаса на все корни. Научной основы у этой цифры нет.
Нужно ли мне знать все эти миллионы слов, чтобы изучать санскрит?
Категорически нет. Как и в любом языке, активный словарь носителя/читателя — это тысячи лемм. Освоение механизма словообразования (вякарына) даёт возможность понимать незнакомые слова без словаря, что и является целью обучения.