tenzorНачать
Все статьи

Нейросети начали читать архивы, которые историки не могли расшифровать

Историк науки прогнал через современные модели несколько задач из своей области, которые лежали нерешёнными. Claude частично расшифровал два испанских письма XVI века, зашифрованных кодом времён Карла V. На архиве Сэмюэла Хартлиба из более чем пяти тысяч документов модель заметила, что Ньютон и Хартлиб пользовались одинаковыми анаграммами для одного и того же вещества: похоже на факт, которого в литературе не было.

Что именно сделали модели

Три разные задачи, три разных результата. Разница между ними как раз и интересна.

Шифрованные письма XVI века. Два письма на испанском, зашифрованных дипломатическим кодом эпохи Карла V. Модель вскрыла их частично: не весь текст, но достаточно, чтобы понять содержание. Полностью задача пока не закрыта.

Архив Хартлиба. Сэмюэл Хартлиб вёл огромную переписку в XVII веке, архив насчитывает больше пяти тысяч документов. Модель просеяла его и нашла, что анаграмма, которой Ньютон обозначал венгерский купорос, встречается у Хартлиба в том же значении. Связь между этими двумя людьми через общий алхимический шифр раньше не описывали.

Рукопись Джона Ди. «Liber Loagaeth», знаменитый текст на «ангельском языке», модель разобрала и пришла к выводу, что это почти полностью бессмысленные слоги. Один закодированный фрагмент она всё же выделила.

Почему третий результат тоже результат

Ответ «здесь нечего расшифровывать» для архивной работы полезен не меньше расшифровки. Он снимает задачу, на которую энтузиасты тратят годы. Правда, доверять такому выводу можно только после проверки специалистом, как и любому другому.

Почему это получается именно сейчас

Расшифровка рукописей складывается из двух вещей, и модели закрывают обе.

Первая — перебор. Гипотез о шифре может быть десятки тысяч, каждую нужно проверить вычислением. Раньше это требовало отдельной программы под каждую идею, теперь модель пишет код сама и прогоняет его.

Вторая — эрудиция по контексту. Чтобы догадаться, что в письме встретится конкретное название местности или обращение к чиновнику, нужно знать эпоху. Модель знает её по тысячам текстов, и подсказка из этого знания сокращает перебор в разы.

Похоже сработала история с сообщением Энигмы 1941 года: модель нашла зацепку в уже расшифрованном сообщении того же дня и использовала её как подсказку.

Чего не будет

Два ограничения, которые стоит держать в голове, читая такие новости.

Проверка остаётся за человеком. Правдоподобная расшифровка и правильная расшифровка выглядят одинаково, если не знать предмет. В историях выше результат каждый раз смотрел специалист.

Модель не заменяет архив. Ни один перебор не поможет, если документ не оцифрован и лежит в хранилище без описания. Именно поэтому автор разбора настаивает: главное узкое место не модели, а доступ к материалу.

Что он предлагает лабораториям

Три пункта, все практичные.

  • Оцифровать архивы, которые сейчас недоступны никому, кроме приехавшего лично исследователя.
  • Дать историкам бесплатный доступ к вычислениям: у гуманитарных кафедр нет бюджета на прогон тысяч гипотез.
  • Составить реестр открытых исторических задач, как это давно сделано в математике, чтобы усилия не распылялись.

Идея с реестром самая любопытная. В математике список нерешённых проблем организует работу десятилетиями, а в истории нет даже общего перечня непрочитанных документов.

Что из этого применимо в обычной работе

Задача «прочитать неразборчивое» встречается далеко за пределами архивов: рукописные пометки в акте, скан договора девяностых, накладная с печатью поверх текста, справка из поликлиники.

Работает тот же порядок. Сначала распознать текст как есть, не пытаясь угадать смысл. Потом отдельным шагом попросить восстановить пропуски с пометкой, где именно модель предполагает, а где читает. И проверить критичные места глазами: суммы, даты, фамилии.

В tenzor сканы и фотографии читаются в чате и в базе знаний проекта: распознавание отдельных страниц идёт автоматически, включая те, где текстового слоя нет.

Что нейросеть смогла расшифровать?+

Частично два испанских письма XVI века, зашифрованных дипломатическим кодом эпохи Карла V. Кроме того, в архиве Сэмюэла Хартлиба из более чем пяти тысяч документов она обнаружила совпадение алхимических анаграмм с Ньютоном.

Почему это не удавалось раньше?+

Расшифровка требует перебора десятков тысяч гипотез и знания эпохи, чтобы сократить этот перебор. Раньше под каждую идею нужно было писать отдельную программу, теперь модель пишет и запускает код сама.

Можно ли доверять такой расшифровке?+

Только после проверки специалистом. Правдоподобный и правильный результат выглядят одинаково для неспециалиста, поэтому в описанных случаях выводы каждый раз смотрел человек, знающий предмет.

Что мешает применять это шире?+

Доступ к материалу. Большинство архивов не оцифрованы, а у гуманитарных кафедр нет бюджета на вычисления. Автор разбора предлагает оцифровку, бесплатный доступ историков к ресурсам и реестр открытых исторических задач.

Что дальше почитать

Загрузите скан и посмотрите, что модель прочтёт

Сначала распознавание как есть, потом восстановление пропусков. Критичные места проверяйте глазами.

Открыть чат