|
|
||
Рукопись Войнича держится непрочтённой сто двенадцать лет. С тех пор как в 1912 году польский книготорговец Вильфрид Войнич купил её у иезуитского коллегиума в Италии, к ней прикладывали руки лучшие криптографы XX века - Фридманы, Тилтман, Курриер - и все отступили. Ультрафиолетовое датирование пергамента, сделанное в Аризоне в 2009 году, отодвинуло создание кодекса в 1404-1438 годы. Это эпоха раннего Ренессанса, и шифровальная инженерия в то время была не развлечением, а профессией. За сто лет предложены десятки решений: средневековый иврит, провансальский, чешский, абстрактный язык, шизофреническая глоссолалия, эзопов "язык сукна" и даже полностью синтетическая подделка. Ни одно из них не прошло независимой проверки.
В ноябре 2025 года в журнале Cryptologia вышла работа, которая подействовала на сообщество отрезвляюще. Научный журналист Майкл Грешко опубликовал описание шифра, который он назвал Naibbe (по-русски его часто транслитерируют как "Найоббе", реже - "Найббе"). Шифр не расшифровывает рукопись. Он делает кое-что более раздражающее для традиционалистов: доказывает, что её статистические странности можно воспроизвести вручную, с материалами XV века. То, что казалось слишком сложным для средневекового писца, оказывается технологически достижимым при наличии колоды карт и пары костей.
Параллельно в 2025-2026 годах вышла серия работ по вычислительной расшифровке. Грузинский биолог Яба Ткемаладзе предложил "алгоритмическую гипотезу кодирования" и "компрессионную гипотезу". Группа под руководством Джозефа Реддер в мае 2026 года анонсировала "вычислительное расшифрование и объяснение рукописи Войнича". Кармин Де Стефано в июле 2026 года опубликовал "генеративный рубеж" рукописи - попытку синтезировать Voynichese с помощью нейросетей. Все эти подходы так или иначе упираются в один вопрос: какой тип "процедуры" генерировал текст? Шифр, язык, числовой алгоритм или автопоэтический поток сознания?
Статья, которую вы читаете, разбирает, как шифр Naibbe сочетается с современными ИИ-подходами к Voynich. Я утверждаю, что эти два направления не соперничают, а дополняют друг друга. Naibbe задаёт границы того, что средневековый писец мог сделать вручную. ИИ-модели проверяют, какие из этих гипотез выживают при статистическом давлении. Без первого у нас нет исторической плоскости. Без второго нет проверки на естественность. Рукопись держится в тени ровно потому, что у нас долгое время было только одно из двух.
Кодекс MS 408 из Библиотеки редких книг и рукописей Бейнеке Йельского университета содержит около 240 страниц пергамента, испещрённых незнакомыми глифами и иллюстрациями растений, астрологических диаграмм, купающихся женщин и фармацевтических рецептов. Текст написан слева направо, без явной пунктуации,плавноно - настолько, что кажется, будто писец не "шифровал", а писал как естественным письмом. Это первый намёк на проблему: голос не выглядит затруднённым, как у человека, переводящего каждое слово через таблицу.
Статистические странности накопились за десятилетия анализа. Распределение частот символов подчиняется закону Ципфа: самое частое "слово" встречается примерно вдвое чаще второго и втрое чаще третьего. Это свойство естественных языков, а не случайных последовательностей. Длина "слов" колеблется от двух до десяти глифов, распределение логнормальное, как в индоевропейских языках. Есть глифы, которые встречаются только в начале слова (как греческая сигма-конечная форма, но наоборот), и глифы, которые никогда не соседствуют. Всё это выглядит как язык.
Но есть и неестественное. Слово встречается подряд пять раз - это бывает в естественных языках, но редко. Два слова отличаются ровно на одну букву и повторяются с пугающей частотой, словно писец менял один глиф, сохраняя остальное. В 2013 году команда Диего Аманчио из Университета Сан-Паулу показала, что в 90% случаев текст ведёт себя как естественный язык, а в 10% - как числовой алгоритм. В том же году Марсело Монтемурро и Дамиан Занетт в PLoS ONE выделили ключевые слова рукописи и показали, что информационная структура не случайна. Но и не уникальна - её можно воспроизвести рядом алгоритмов.
Криптограф Элизабет Фридман в 1962 году назвала частотный анализ Voynichese "обречённым на полное разочарование". Её муж Уильям Фридман и его команда военного времени попробовали сорок лет подряд - и пришли к выводу, что текст, скорее всего, искусственный язык, а не шифр. Прескотт Курриер в 1976 году доказал, что статистика не соответствует ни одному известному естественному языку. Хорхе Стольфи и Габриэль Ландини в 2007 году показали, что слова генерируются из соседних - меняется один глиф, остальные переносятся. То есть внутри Voynichese работает локальный алгоритм, а не грамматика естественного языка.
И всё-таки рукопись не пустышка. Пергамент дорогой - четырнадцать-пятнадцать телячьих кож на один кодекс, что по деньгам XV века равно годовому доходу ремесленника. Краски дешёвые, но минеральные (азурит, гематит, охра), и анализ чернил показывает однородность текста и иллюстраций - их делал один человек или одна мастерская. Идея, что шизофреник написал 240 страниц на дорогом пергаменте, психологически возможна, но экономически невероятна. Если это подделка, то очень дорогая и продуманная. Если это шифр, то очень хитрый.
Майкл Грешко подошёл к проблеме с непривычной стороны. Вместо того чтобы расшифровывать Voynichese, он попробовал зашифровать обычный текст так, чтобы результат выглядел как Voynichese. Это инженерный ход: если я могу построить машину, которая выдаёт нужную статистику из латинского или итальянского исходника, значит, эта статистика совместима с гипотезой шифра. Не доказывает её - но снимает аргумент "такого не могло быть в XV веке".
Получившийся шифр Грешко назвал Naibbe - по имени итальянской карточной игры XV века (Naibbe - одно из ранних названий колоды, от арабского na"ib, "заместитель"). Название символично: ключевой инструмент шифра - игральные карты. Грешко доказывает, что средневековый писец не нуждался в компьютере для генерации псевдослучайных последовательностей. Колода карт и пара костей в тюке монастыря дают достаточную энтропию для шифрования длинного текста.
Технически Naibbe - это "verbose homophonic substitution cipher", подробный гомофонный шифр замены. Классический гомофонный шифр заменяет каждую букву открытого текста одной из нескольких букв шифртекста - это маскирует частоты. "Verbose" означает, что одна буква открытого текста может перейти в несколько глифов шифртекста. Это критически важно: классический гомофонный шифр сохраняет длину слов, но Voynichese имеет слова переменной длины с характерным распределением. Чтобы воспроизвести это, шифр должен уметь "растягивать" букву в последовательность глифов.
Шифр работает так. Открытый текст разбивается на униграммы и биграммы случайным образом. Например, "HELLO WORLD" может стать "H EL L OW OR L D". Разбиение делается бросанием двух костей - есть "упрощённая" и "стандартная" схема, последняя чуть чаще выбирает биграммы. Каждая полученная единица (одиночная буква или пара) затем заменяется по одной из шести таблиц. Таблицу выбирают тоже случайно - здесь и нужны игральные карты, которые в XV веке уже были широко распространены в Италии.
В результате униграмма может быть представлена шестью способами (по числу таблиц), а биграмма - тридцатью шестью (шесть таблиц для префикса биграммы и шесть для суффикса). Один и тот же открытый текст может породить очень разные шифртексты - это воспроизводит ключевую странность Voynichese: два близких слова в рукописи могут выглядеть совершенно по-разному, хотя и означают одно и то же. Это объясняет, почему классический частотный анализ буксует: одна латинская "e" может выглядеть как один из шести глифов, а латинское "or" - как одна из тридцати шести пар.
И вот важный нюанс, который комментаторы часто пропускают. Грешко настаивает: Naibbe - это не расшифровка рукописи Войнича. Это инженерное доказательство. Шифр показывает, что "гипотеза шифра" остаётся жизнеспособной - но и накладывает ограничения. Любой реальный шифр, лежащий в основе рукописи, должен быть очень сложным и совсем не похожим на стандартный шифр подстановки. Границы очерчены: простой шифр Цезаря или простой гомофонный шифр не дадут нужной статистики. Нужен многоуровневый механизм с ветвлением.
Чтобы было наглядно, разберём шаг за шагом, как Naibbe шифрует короткий фрагмент. Возьмём английское "HELLO WORLD" (хотя в оригинальной статье Грешко работает с латынью и итальянским - мы берём английский ради наглядности). Первым делом шифр выбирает схему разбиения на униграммы и биграммы. Бросаем две кости. Если выпадает, скажем, 4 и 6, мы идём по "стандартной" схеме и разбиваем "HELLO WORLD" как "H EL L OW OR L D".
Открытый текст: H EL L OW OR L D
Далее для каждой единицы выбираем одну из шести таблиц шифрования. Для униграммы (одиночной буквы) тянем одну карту. Для биграммы тянем две карты - одну для префикса, одну для суффикса. Каждая таблица отображает свой входной символ в один из нескольких Voynichese-глифов. Например, "H" из таблицы 3 может перейти в глиф, который в EVA-нотации записывается как "8am". А "H" из таблицы 5 - в "sho". Один и тот же латинский H в шифртексте выглядит по-разному в зависимости от того, какая карта была вытянута.
Возможный шифртекст: 8am oKee chedy qokeey 4hKee dy shey yKee
Это вымышленный пример, но он передаёт суть. Шифртекст состоит из "слов" Voynichese - групп глифов, разделённых пробелами. Эти пробелы не соответствуют пробелам исходного текста! "HELLO WORLD" (два слова) превратилось в восемь "слов" шифртекста. Это объясняет, почему позиции пробелов в Voynichese выглядят статистически странно - они неразделяают слова, ониразделяают "единицы шифрования".
Если теперь другой раз зашифровать тот же "HELLO WORLD" с другими бросками костей и другими картами, мы получим совершенно другую последовательность глифов. И всё-таки обе расшифровываются тем же ключом обратно в "HELLO WORLD". Это и есть "verbose homophonic": одна и та же буква открытого текста размножается в разные глифы, и один и тот же текст имеет много валидных шифртекстов. Именно так Voynichese и ведёт себя: одно и то же понятие в разных местах рукописи пишется по-разному.
Грешко в своей статье показывает, что на различных выборках латинских и итальянских текстов его шифр воспроизводит ключевые статистические свойства рукописи Войнича одновременно: частоты глифов, длины "слов", позиционные ограничения, характерные "повторы" слов, отличающихся на одну букву. Это важно. До него исследователи могли воспроизвести одно свойство, но не всё сразу. Naibbe делает всё сразу - и при этом может быть выполнен вручную, с инструментами, которые были у любого монастырского писца.
Здесь нужно быть точным. Naibbe не доказывает, что рукопись Войнича - это шифр. Он доказывает нечто более узкое: что статистические "странности" рукописи не противоречат гипотезе шифра. Это снимает с гипотезы шифра обвинение в неосуществимости. Долгое время аргумент против шифра был таким: "ни один известный средневековый шифр не даёт такой статистики, значит, рукопись не шифр, а бессмыслица или естественный язык". Грешко демонтирует этот аргумент. Теперь критик шифра должен доказать, что никакой сложный шифр не может дать Voynichese-подобную статистику. А это уже гораздо труднее.
Параллельно Грешко накладывает ограничения на то, каким мог быть реальный шифр. Простой шифр подстановки не подойдёт - не даст гомофонности нужной плотности. Простой шифр перестановки не подойдёт - не даст позиционных ограничений. Шифр должен совмещать подстановку с переменной длиной выхода (verbose) и с ветвлением (несколько таблиц). Это серьёзное инженерное требование. Если рукопись действительно шифр, её создатель был криптографом изрядного уровня - не любителем, не монахом-одиночкой, а кем-то, кто знал теорию шифрования на уровне, скажем, Альберти или Тритемия.
Одновременно работа Грешко оставляет место для конкурирующих объяснений. Текст может быть и шифром, и конструктированным языком (в духе эсперанто XV века), и сложным алгоритмом без смысла (палеографической "машиной" для генерации благообразных глифов), и подделкой, имитирующей шифр. Naibbe не различает эти сценарии. Он лишь показывает, что сценарий "сложный шифр" не отбрасывается статистикой.
Это важная позиция. Рецензенты и комментаторы - в том числе Брюс Шнайер на своём блоге - приняли работу как "полезный бенчмарк, а не окончательный ответ". Шнайер подчёркивает, что шифр Naibbe сохраняет надежду для тех, кто хочет расшифровать рукопись, - но не даёт самой расшифровки. Сам Грешко в презентации на "Дне рукописи Войнича" в 2025 году прямо говорит: "Я не решил рукопись. Я показал, что её можно было сделать вручную".
Скептики в комментариях на Schneier on Security идут дальше. Рэй Диллинджер подсчитывает: энтропия Voynichese - около трети бита на букву, тогда как у английского - около 1,25. То есть если это язык, то крайне низкоэффективная кодировка - один бит смысла растянут на три бита шифртекста. Это, по его мнению, аргумент против "осмысленного языка" и за "подделку, имитирующую шифр". Клайв Робинсон добавляет: статистика OTP (одноразового блокнота) "плоская", и Voynichese "плоская" - но Voynichese, в отличие от OTP, имеет циклы. Это может означать, чтоавтор оригинала использовал straddling checkerboard поверх OTP, чтобы скрыть характер шифра. Это уже гипотеза второго порядка, но она показывает, что пространство для объяснений не закрыто.
Параллельно с криптографическим направлением развивается вычислительное. Его история начинается задолго до Naibbe. В 2013 году сразу две команды независимо применили методы теории сложности к рукописи. Диего Аманчио с соавторами в PLoS ONE показал, что текст не является случайным набором символов: ключевые слова ведут себя как ключевые слова естественных языков. Марсело Монтемурро и Дамиан Занетт в том же журнале выделили "информационные кластеры" - группы глифов, которые несут больше информации, чем другие. Это аналоги "корней" и "аффиксов" в естественных языках. Если рукопись бессмысленна, она бессмысленна очень хитроумно.
В 2016 году в журнале Transactions of the Association for Computational Linguistics вышла статья Брэдли Хауэра и Гжегожа Кондрака "Декодирование анаграммированных текстов, написанных на неизвестном языке и письме". Они разработали алгоритм, который по шифртексту угадывает язык открытого текста. Применив его к фрагменту рукописи Войнича, алгоритм выдал наиболее вероятный язык - иврит. Это разбудило волну публикаций о "древнееврейской расшифровке", но профессиональное сообщество отнеслось скептически: алгоритм проверял гипотезу "анаграммированный текст", а рукопись Войнича анаграмм не содержит в строгом смысле. Хауэр и Кондрак сами подчеркнули, что их метод - не доказательство, а подсказка для дальнейшего поиска.
Десять лет спустя, в 2025-2026 годах, появилось сразу несколько вычислительных наступлений. Яба Ткемаладзе из Грузии предложил "алгоритмическую гипотезу кодирования": рукопись якобы сгенерирована рекурсивным алгоритмом сжатия, где каждый глиф - результат итерации над предыдущими. В сентябре 2025 года он опубликовал в Preprints.org статью "Voynich Manuscript Decryption: A Novel Compression-Based Hypothesis and Computational Framework". В январе того же года вышла его же работа "Unlocking the Voynich Cipher via the New Algorithmic Coding Hypothesis". Эти статьи встретили сдержанную реакцию: автор - биолог-теоретик, а не криптограф, и его гипотеза пока не прошла рецензирования в профильном журнале.
В мае 2026 года в OpenAlex появилась запись "A Computational Decipherment and Explanation of the Voynich Manuscript" под авторством Джозефа Реддер и Юсры Шахкулубей Реддер. Текст статьи недоступен - только метаданные. Это типичный паттерн недавних "дешифровок": громкое название, отсутствие открытой версии. Профессиональное сообщество к ним относится как к гипотезам нулевого уровня, пока не будет воспроизводимого результата.
В июле 2026 года Кармин Де Стефано опубликовал "The Generative Frontier of the Voynich Manuscript" - попытку синтезировать Voynichese-подобный текст с помощью генеративных моделей. Это интересное направление: если нейросеть может генерировать текст с распределением как у рукописи, мы получаем "генеративный двойник" Voynichese. Де Стефано работает в парадигме диффузионных и авторегрессионных моделей - то есть подходит к рукописи не как к шифру, а как к генеративному артефакту. Это близко к гипотезе "глоссолалии" или "асемической письменности" - непроизвольному потоку значащих на вид, но бессмысленных глифов.
С появлением ChatGPT, Gemini и Claude в 2022-2025 годах сообщество получило новый инструмент: можно "скормить" модели фрагмент Voynichese и попросить перевести. В комментариях к публикации archaeologymag от января 2026 года - десяток людей рассказывают, как "расшифровали" рукопись через Gemini или ChatGPT. Один пользователь пишет: "Я загрузил текст в Gemini и попросил проанализировать. Оказалось, это латинский с итальянскими вставками, согласные без гласных, с модификаторами в начале слов. Я расшифровал словарь - медицинская книга". Другие "открывали", что это старочешский, сербский, эзопов язык.
Такие "дешифровки" имеют одну общую черту: они не воспроизводимы. LLM работает как вероятностная машина - она выдаёт текст, который выглядит правдоподобно. Если попросить её "перевести Voynichese на английский", она произведёт английский текст, похожий на медицинскую книгу. Это потому, что в её обучающей выборке есть медицинские тексты, и контекст "рукопись с растениями и купающимися женщинами" подталкивает её к медицинской/фармакопейной тематике. Но та же модель, спрошенная в другой сессии, даст другой "перевод". Воспроизводимость - фундамент научной проверки. LLM без неё - это не расшифровка, а генеративное галлюцинирование в контексте темы.
Это не значит, что LLM бесполезны. Их можно использовать как инструмент гипотез: подать фрагмент, получить несколько "кандидатов" на перевод, проверить их статистически на соответствие другим фрагментам. Но без проверки LLM-перевод - не результат, а подсказка. Брюс Шнайер в своем блоге в 2025 году упоминал измерение "способности LLM к криптоанализу": нейросети умеют ломать классические шифры, но Voynichese для них сложнее, чем шифр Виженера, - потому что у них нет обучающего корпуса Voynichese с разметкой.
Параллельно с коммерческими LLM развиваются специализированные подходы. Группа Ивана Зелинки (Чехия) в 2019 и 2023 годах применяла эволюционные алгоритмы и мягкие вычисления к сравнению Voynichese с древними диалектами. Их подход ближе к "биологической эволюции" популяций гипотез: алгоритм порождает сотни гипотез о языке рукописи, оценивает их по статистике и скрещивает лучшие. Это даёт скорее ранжирование кандидатов, чем расшифровку. На вершине списка у Зелинки в 2023 году оказались древние ближневосточные языки - но статистическая значимость остаётся под вопросом.
Главная слабость всех ИИ-подходов к Voynichese - отсутствие "оракула". Чтобы натренировать нейросеть переводить с языка A на язык B, нужны параллельные тексты. Для Voynichese их нет: ни одной строки рукописи не переведено достоверно. Поэтому любая модель учится не "переводить Voynichese", а "генерировать текст, похожий на Voynichese" или "угадывать язык открытого текста по статистике". Это задачи ранжирования гипотез, а не расшифровки. Без оракула - то есть без хотя бы одного надёжно переведённого фрагмента - ИИ остаётся инструментом разведки, а не переводчиком.
Если сложить вместе шифр Naibbe и ИИ-подходы, возникает нетривиальная стратегия. Шифр Грешко даёт "генеративную модель" в криптографическом смысле: параметризованный алгоритм, который производит Voynichese-подобный шифртекст из известного открытого текста. ИИ-модели дают статистический классификатор, который ранжирует гипотезы о языке открытого текста. Можно соединить их: для каждого из тысяч гипотетических открытых текстов (латынь, тосканский диалект, провансальский, иврит, чешский) применять Naibbe-подобный шифр с разными параметрами, получать шифртекст и сравнивать с настоящей рукописью Войнича статистически.
Это вычислительно тяжёлая задача, но разрешимая. Если какая-то комбинация "открытый текст + параметры шифра" даёт шифртекст, статистически неотличимый от Voynichese, мы получаем конкретного кандидата на расшифровку. Затем можно применить LLM для проверки связности полученного открытого текста: действительно ли это осмысленная латынь или итальянский, а не случайный набор букв. Это уже воспроизводимый процесс, не галлюцинация. Граница, на которой встречаются криптография и вычислительная лингвистика - именно точка проверки.
Есть и альтернативный путь. Возможно, рукопись Войнича - не шифр, а конструктированный язык. Тогда Naibbe-подобный подход не подойдёт - там нет "открытого текста", который переводится в шифртекст. В этом случае нужны генеративные модели типа тех, что описывает Де Стефано: нейросеть учится порождать Voynichese с нуля, без шифра-посредника. Тогда текст рукописи - это "языковая игра" по определённым правилам, и задача исследователя - восстановить правила, а не ключ.
Третий сценарий, который нельзя сбрасывать со счетов: рукопись - это автопоэтический поток. Писец генерировал глифы по локальному алгоритму (менял один глиф в соседнем слове), без отсылки к смыслу. Это объясняет "статистику без грамматики", которую находили Стольфи и Ландини. В этом случае никакая нейросеть не найдёт перевод, потому что переводить нечего. Тогда Naibbe и ИИ-расшифровка - оба пути тупиковые. Но и это сценарий надо проверять, а не принимать по умолчанию.
Шифр Naibbe - не конец истории рукописи Войнича. Это начало нового её этапа. Впервые за сто лет у нас есть параметризованная криптографическая модель, которая воспроизводит несколько ключевых статистических странностей Voynichese одновременно, и при этом не требует ничего, чего не было в XV веке. Это переводит дискуссию из плоскости "а могло ли такое быть" в плоскость "как именно это было сделано". Это сужает пространство гипотез.
ИИ-подходы, в свою очередь, превращают "гадание" в ранжирование. Без обучающего оракула LLM не расшифруют Voynichese, но они могут оценивать гипотезы, генерировать кандидатов на открытый текст, проверять связность переводов. В сочетании с Naibbe-подобными шифрами это даёт воспроизводимый исследовательский цикл: генерация шифртекста из гипотезы - статистическое сравнение с Voynichese - оценка качества - корректировка гипотезы. Каждый шаг можно проверить, в отличие от "я загрузил в Gemini, и она сказала".
Главное, что нужно усвоить из этой истории: научное знание не движется прорывами, оно движется границами. Шифр Naibbe очерчивает границу "что технически возможно в XV веке". ИИ-модели очерчивают границу "что статистически правдоподобно". Пересечение этих границ - узкое, но конкретное место. Рукопись Войнича держится сто двенадцать лет не потому, что она слишком сложна, а потому, что у нас долго не было обоих инструментов сразу. Сейчас они есть.
И последнее. Границы, о которых идёт речь, - не границы рукописи, а границы нашего внимания. Грешко показал, что один человек, с пергаментом, чернилами, костями и колодой карт, может породить статистически сложный шифртекст, который держится столетие. Это не означает, что так и было. Но это означает, что средневековый ум был не слабее нашего - просто у него были другие инструменты. Когда мы недооцениваем возможности прошлого, мы недооцениваем сложность задачи. И продолжаем её не решать. Сто двенадцать лет - достаточный срок, чтобы начать относиться к автору рукописи как к равному по уму собеседнику, а не как к наивному монаху, оставившему нам картинку для разгадывания.
|