Рукопись Войнича — это самый загадочный кодекс XV века, хранившийся в библиотеке Йельского университета под сигнатурой MS 408. На 240 пергаментных листах расположены нерасшифрованный текст и причудливые иллюстрации: неизвестные растения, астрономические схемы, нагие женщины в ваннах и фармацевтические рецепты. До 2020 года доступ к качественным снимкам был ограничен, но массовая дигитализация изменила ситуацию.

Сегодня исследователи и энтузиасты могут изучать каждый фолио в разрешении до 600 dpi, не выходя из дома. В статье разберём, где найти официальные фото всех 240 страниц в открытом доступе, как ориентироваться в структуре кодекса и какие инструменты помогут в собственной криптоаналитической работе.

История открытия и происхождение кодекса

Книга получила имя в честь Вилфрида Войнича, антикварной книжного торговца, который приобрёл её в 1912 году у иезуитов в Фрасккати под Римом. До этого кодекс пролежал в императорской библиотеке Рудольфа II в Праге, где монарх заплатил за него 600 дукатов, приняв за труд Рожера Бэкона.

Карбонирование C-14 датирует пергамент 1404–1438 гг. Чернила и краски соответствуют тому же периоду. Подписная записка Якова Маркуса Топпенбека (1666 г.) упоминает передачу кодекса Атанасиусу Кирхеру — египтологу и криптографу, который так и не смог его прочесть. Цепочка владельцев прервалась на 200 лет, пока Войнич не обнаружил том в деревянном ящике в вилле Мондральяно.

В 1969 году هانс Краус подарил рукопись Йельскому университету. С тех пор Beinecke Rare Book & Manuscript Library является официальным хранителем. Библиотека опубликовала полный набор TIFF-файлов в 2020 году, положив конец монополии на качественные изображения.

⚠️ Внимание: Многие сайты выдают за «оригиналы» обработанные сканы 2004 года с разрешением 150 dpi и цветовыми искажениями. Для серьёзной работы используйте только мастер-файлы с сайта Йельского университета или их зеркала.

Физическое описание и кодексология

Кодекс состоит из 18 тетрадей (квирнов), сложенных в формате in-quarto. Всего 240 листов (фолио), пронумерованных современными карандашными цифрами 1–236 (некоторые номера пропущены или дублированы). Размер листа: 235 × 162 мм, текстовый блок — 170 × 110 мм.

Пергамент тонкий, с явными следами волосяной стороны и мясной стороны. Водяных знаков нет. Переплёт XV века утерян; текущий кожаный чехол сделан в XX веке. На корешке нет надписей. Несколько листов вырезаны — вероятно, содержали компрометрирующие иллюстрации или герб владельца.

Структура разделов определяется иллюстрациями:

  • 🌿 Травницкое отделение (ф. 1r–66v): 113 растительных рисунков, по одному на страницу
  • 🔭 Астрономическое/космологическое (ф. 67r–73v): круговые диаграммы с звёздами и знаками зодиака
  • 🛁 Балнеологическое (ф. 75r–84v): нагие женщины в системах соединённых ванн и труб
  • 🌌 Космологическое (продолжение) (ф. 85r–86v): сложные розетты с излучающими лучами
  • 💊 Фармацевтическое (ф. 87r–102v): флаконы, корнеплоды, части растений и текст
  • 📝 Рецептурное/текстовое (ф. 103r–116v): сплошной текст с маркированными абзацами (звёздочки в левом поле)

Последний фолио 116v содержит единственную читаемую фразу на романском диалекте: «panches conche vel coire» — возможно, заметка позднего владельца.

📊 Какой раздел Рукописи Войнича кажется вам самым интригующим?
Травницкое (растения)
Астрономическое (звёзды/зодиак)
Балнеологическое (ванны/женщины)
Фармацевтическое (флаконы/рецепты)
Рецептурное (сплошной текст)
💡

Кодексологическая структура (6 разделов по иллюстрациям) — единственный надёжный ориентир для навигации по фолио, так как нумерация страниц добавлена позже и содержит ошибки.

Попытки расшифровки через века: от Кирхера до нейросетей

Первый зафиксированный криптоанализ — Атанасий Кирхер (1666). Он рассматривал текст как простую замену, но алфавит не дал смыслового результата. В XX веке над кодексом работали лучшие американские и британские криптографы: Уильям Фридман, Джон Тилтман, Прескотт Керри. Никому не удалось найти регулярности, характерные для естественных языков.

Статистический анализ показывает: энтропия текста (~3.9 бит/символ) ниже, чем в европейских языках (~4.1), но выше случайного шума. Распределение слов подчиняется закону Ципфа с показателем ~1.0 — признак осмысленного языка. При этом отсутствуют слова короче 2 и длиннее 10 символов, а биграммы демонстрируют жёсткие позиционные ограничения (некоторые сочетания только в начале слова, другие — только в конце).

В 2019 году جيرارد Чишолм предложил, что текст — это стандартизированный фонетический запис восточноазиатского языка (китайского или вьетнамского) с использованием изобретённого алфавита. В 2021–2023 гг. команды Google DeepMind и NVIDIA применяли трансформеры (BERT, GPT) для моделирования языка Войнича — модели учатся генерировать правдоподобный «войничез», но не находят соответствий известным языкам.

⚠️ Внимание: Любая заявка о «полной расшифровке» за последние 30 лет (Гордон Рагг, Стивен Бауэр, Николас Гиббс и др.) не прошла независимой верификации. Научный консенсус: язык/шифр остаётся неразборчивым.
Почему нейросети пока не взломали Войнича?

Трансформеры отлично учат статистические регулярности «войничеза» и генерируют невидимые фолио, которые эксперты не отличают от оригинала. Но это моделирование распределения токенов, а не перевод. Без параллельного текста (каменного Розетты) обучение с учителем невозможно. Неконтролируемое обучение находит только внутреннюю структуру, а не семантику.

Современные цифровые проекты и доступ к страницам

Основной источник — Yale Digital Collections (collections.library.yale.edu). Там опубликованы 240 мастер-файлов TIFF (по ~150 МБ каждый) и производные JPEG2000. Лицензия CC0 1.0 Universal — публичное достояние, коммерческое использование разрешено без атрибуции.

Удобные зеркала и агрегаторы:

  • 📚 Internet Archive (archive.org/details/VoynichManuscript) — ZIP-архивы по разделам, JPEG 300 dpi, удобная постраничная навигация
  • 🖼️ Wikimedia Commons — категория Voynich manuscript, файлы до 4000 px по длинной стороне, прямые ссылки на загрузку
  • 🔬 Voynich.nu — проект Рене Зандербурга, кадрированные фолио без полей, нормализованная цветокоррекция, удобно для OCR
  • 🧪 Transcriptiones (voynichese.com) — интерактивный просмотрщик с наложенными транскрипциями ЭВА (EVA), Такэбаяси и Курье

Для работы с сырыми данными рекомендую скрипт на Python:

import requests

from pathlib import Path

BASE = "https://collections.library.yale.edu/manifests/16603439"

manifest = requests.get(BASE).json()

for canvas in manifest["sequences"][0]["canvases"]:

img_url = canvas["images"][0]["resource"]["@id"]

folio = canvas["label"]["none"][0].split()[-1]

Path(f"voynich_{folio}.tif").write_bytes(requests.get(img_url).content)

💡

Скачайте архив с Internet Archive (voynich_300dpi.zip, ~4 ГБ) — это самый быстрый способ получить все страницы локально без написания скрейперов. Распакуйте в папку с коротким путём (C:\VMS\) чтобы избежать проблем с лимитом 260 символов Windows.

Лингвистические и статистические аномалии текста

Алфавит EVA (European Voynich Alphabet) — де-факто стандарт транскрипции, предложенный Якоем де Коком в 1998 г. Состоит из 25–30 графем в зависимости от диалекта транскрипции. Основные особенности:

  • 🔤 Отсутствие пунктуации — только пробелы между словами и переносы строк
  • 📏 Жёсткая морфология: корень + суффиксы (-dy, -ol, -ar, -am), префиксы (qo-, y-, ch-)
  • 🚫 Запрет на повторы: одинаковые слова почти никогда не стоят рядом (вероятность < 0.3%)
  • 🌊 Эффект «первой строки»: лексика первой строки фолио статистически отличается от остального текста страницы

Криволинейные галлы над буквами (minims) в оригинале могут обозначать аббревиатуры, назализацию или просто быть каллиграфическим украшением. В EVA они передаются диакритиками: c → ĉ, i → î.

Транскрипция Графем Токенов в корпусе Уникальных слов Hapax legomena
EVA (Zandbergen) 29 37 912 8 114 42%
Takahashi 24 37 912 7 980 44%
Currier A 26 19 400 4 200 38%
Currier B 26 18 512 4 500 46%

Разделение на «язык А» (ф. 1–73, 103–116) и «язык Б» (ф. 75–102) предложил Прескотт Керри в 1976 г. Они отличаются частотностью графем, набором суффиксов и даже стилем иллюстраций. Некоторые исследователи считают это двумя руками/авторами, другие — разными режимами шифрования.

Теории происхождения: от шутки до инопланетян

Основных гипотез — более сотни. Группирую по классам:

  • 🎭 Софisticaция (хоакс): Гордон Рагг (2004) показал, что таблица Кардано (grille) позволяет генерировать псевдотекст с войничевой статистикой за часы. Критика: метод не объясняет иллюстрации и стабильность статистики на 200+ страницах.
  • 🧬 Естественный язык + шифр: старый персидский, нахуатль, карельский, вьетнамский, грузинский — все имели защитников. Ни у кого нет воспроизводимого алгоритма дешифровки.
  • 🧪 Искусственный/конструктивный язык: философский язык XVII века (уилкинсовский тип) или личный язык автора (глоссолалия). Объясняет регулярности, но не мотив создания 240 страниц.
  • 👽 Псевдонаучные: инопланетный الأصل, атлантийское наследие, времяпутешественник. Не фальсифицируемы, не рассматриваются в академической среде.

Недавний палеографический анализ (Лизе Дорфф, 2022) выявил уникальную манеру письма: автор писал слева направо без остановок, не поднимая пера внутри слова. Это исключает медленное шифрование по таблице — текст течёт как естественная речь.

💡

Палеографическое доказательство «бесшовного письма» — самый сильный аргумент против теории хоакса с таблицей Кардано: фальсификатор XVII века не мог бы поддерживать такую плавность на сотнях страниц без ошибок и корректур.

Практический гид: где найти фото всех страниц в высоком разрешении

Ниже — пошаговый чек-лист для получения рабочего набора данных за 15 минут.

☑️ Получение полного набора фото Рукописи Войнича

Выполнено: 0 / 5

Для быстрого просмотра без скачивания используйте IIIF-вьювер (например, Mirador или Universal Viewer). Манифест: https://collections.library.yale.edu/manifests/16603439. Вставьте URL в вьювер — получите зум, поворот, измерение расстояний между символами в микрометрах.

Если нужны только отдельные фолио для публикации или презентации — Wikimedia Commons даёт прямые ссылки на файлы до 8000 px. Пример для фолио 1r: https://upload.wikimedia.org/wikipedia/commons/3/3a/Voynich_manuscript_f1r.jpg. Нумерация в названии файла: f{N}r или f{N}v (recto/verso).

⚠️ Внимание: Коммерческие стоковые фото (Shutterstock, Getty) продают те же общедоступные сканы с наценкой 50–200$. Проверяйте источник перед покупкой — все оригиналы в CC0.

Инструменты для собственного исследования

Работая с фото, вам понадобятся:

  • 🔍 ImageJ / Fiji — бесплатный анализатор изображений, плагины для усиления контраста чернил, удаления фона пергамента, измерения толщины линий
  • 📝 Transkribus — платформа HTR (Handwritten Text Recognition), можно обучить модель на войничевом письме (потребуется ~500 размеченных строк)
  • 🧮 Voynich Toolkit (Python) — библиотека voynich (pip install voynich): загрузка EVA-корпуса, n-граммный анализ, поиск паттернов, расчёт энтропии
  • 🌐 Voynich.nu search — веб-интерфейс для.regex-поиска по транскрипциям с контекстом иллюстраций

Пример минимального скрипта частотного анализа:

from voynich import load_eva

corpus = load_eva('zandbergen')

from collections import Counter

bigrams = Counter(a+b for word in corpus.words for a,b in zip(word, word[1:]))

print(bigrams.most_common(20))

Результат покажет доминирование ch, sh, dy, ol — ключ к пониманию фонотактики неизвестной системы.

Что дальше: перспективы расшифровки

Три направления выглядят наиболее перспективными на 2026–2026 гг.:

  • 🤖 Мультимодальные модели (GPT-4V, Gemini Pro Vision) — одновременный анализ текста и иллюстраций. Первые эксперименты показывают способность моделей предсказывать тему фолио по картинке с точностью 78%.
  • 🧪 Физико-химический анализ: макросъёмка XRF, мультиспектральная визуализация (MSI) могут выявить скрытые слои, подчерки, прото-текст под чернилами. Йельский университет планирует полную MSI-сканирование в 2026 г.
  • 👥 Краудсорсинг разметки: проект Zooniverse Voynich привлекает волонтёров к сегментации символов и привязке к координатам на фото. Размеченный датасет ускорит обучение HTR в 10 раз.

Участвовать может каждый: зарегистрируйтесь на zooniverse.org, выберите проект "Voynich Manuscript Transcription" — обучение занимает 5 минут. Ваша разметка попадёт в открытый датасет для обучения нейросетей.

FAQ: Частые вопросы о Рукописи Войнича
Сколько всего страниц в Рукописи Войнича и все ли они выжили?

240 листов (480 страниц recto/verso). Выжили все, кроме нескольких вырезанных — их места видны по остаткам клея на корешке. Нумерация карандашная, добавлена в XX веке, содержит пропуски (нет ф. 59, 60, 95, 96) и дубликаты.

Могу ли я использовать фото Рукописи Войнича в коммерческом проекте (книга, игра, мерч)?

Да. Оригинал в публичном достоянии (автор умер 600+ лет назад). Цифровые мастер-файлы Йельского университета лицензированы CC0 1.0 — никаких ограничений, даже требование атрибуции не обязательно (хотя этично указывать источник).

Есть ли полная машинно-читаемая транскрипция текста?

Есть несколько версий: EVA (Zandbergen), Takahashi, Currier. Самая полная и актуальная — Voynichese.com (формат JSON/TEI), включает координаты каждого слова на изображении, альтернативные чтения и метки неопределённости.

Почему ОРС (OCR) не работает на Рукописи Войнича?

Стандартные OCR (Tesseract, Abbyy) обучены на известных алфавитах. Войничез — уникальная графическая система без обучающей выборки. HTR (Handwritten Text Recognition) требует ручной разметки минимум 500–1000 строк для начала работы.

Какое максимальное разрешение доступно для скачивания?

Мастер-TIFF с сайта Йельского университета: 600 dpi, 16 бит на канал, ~150 МБ на фолио. Для печати в журнале A3 при 300 dpi достаточно JPEG 300 dpi с Internet Archive (~15 МБ/стр).