Ars Technica→ оригинал

ИИ берётся за расшифровку мёртвых языков: находит паттерны, смысл — за учёным

Нейросети взялись за расшифровку мёртвых языков — и уже показывают результаты. ИИ находит статистические паттерны в неизвестных письменах быстрее любого учёного. Но там, где алгоритм видит частоту символов, лингвист видит грамматику и смысл. Проект Ithaca от DeepMind восстанавливал древнегреческие надписи с точностью 62% — вдвое точнее историков без ИИ.

AI-обработка оригинала Ars Technica; редакция Hamidun News
ИИ берётся за расшифровку мёртвых языков: находит паттерны, смысл — за учёным
Источник: Ars Technica. Коллаж: Hamidun News.
◐ Слушать статью

Нейросети уже помогают историкам читать тексты, которые тысячелетиями оставались непонятными. Но при всей мощи алгоритмов расшифровка по-прежнему требует человека: ИИ превосходно находит закономерности в символах, а вот придать им смысл способен только лингвист.

Что умеет нейросеть в лингвистике

Главное преимущество нейросетей перед исследователем — скорость и масштаб статистического анализа. За несколько часов алгоритм обрабатывает корпус, на который у учёного ушли бы годы: подсчитывает частоту символов, строит матрицы совместной встречаемости, выявляет структурные паттерны.

Один из наиболее показательных примеров — проект Ithaca, разработанный командой DeepMind совместно с историками и опубликованный в журнале Nature в 2022 году. Система восстанавливала повреждённые фрагменты надписей на древнегреческом. Точность алгоритма составила около 62%, тогда как специалисты без ИИ угадывали верный вариант лишь в 25% случаев. Когда историки работали в тандеме с нейросетью, результат вырастал до 72%.

Ithaca работала эффективно именно потому, что для древнегреческого уже существовал большой корпус расшифрованных текстов. Алгоритм опирался на тысячи надписей, изученных учёными прежде, — и строил предсказания для неизвестных фрагментов на основе этого фундамента.

  • Ithaca (DeepMind, Nature, 2022) — 62% точности при восстановлении надписей
  • Историки без ИИ — около 25% верных вариантов
  • Историки + Ithaca — 72%
  • Крупнейшие нерасшифрованные системы: линейное А (Крит), протоэламский (Иран), ронгоронго (о. Пасхи), индская письменность (Мохенджо-Даро)

Почему без лингвиста не обойтись?

ИИ умеет описать структуру текста, но не может связать её со значением. Особенно это проявляется там, где нет «якоря» — параллельного текста, подобного Розеттскому камню для египетских иероглифов. Для линейного А, протоэламского или ронгоронго такой точки входа не существует, и без неё расшифровка превращается в угадывание.

Алгоритм обнаружит, что определённые символы встречаются рядом чаще других, — но назвать их словами без культурного контекста невозможно. Лингвист привносит то, чего нет в данных: знание типологии языков, понимание того, чем торговые записи отличаются от религиозных текстов, интуицию о грамматических категориях — всё то, что не поддаётся прямому обучению на корпусе.

«ИИ фантастически хорош в распознавании паттернов, но человеческая интуиция остаётся ключевой» — именно это подчёркивают исследователи в области вычислительной лингвистики, опрошенные

Ars Technica.

Как меняется работа учёных

Связка «нейросеть + лингвист» не заменяет учёного — она меняет темп его работы. Алгоритм берёт на себя рутину: частотный анализ, восстановление пропущенных символов, поиск структурных совпадений в параллельных корпусах. Специалист концентрируется на интерпретации — том этапе, где нужно понимание мира, а не только текста.

Ряд исследователей сравнивает этот сдвиг с тем, как МРТ изменило диагностику: врач по-прежнему ставит диагноз, но видит детали, недоступные прежде. Команды, которые раньше тратили месяцы на ручную кодировку корпусов, теперь получают первичные паттерны за дни. Нерасшифрованных письменностей в мире остаётся несколько десятков — часть из них, по мнению специалистов, может быть прочитана в ближайшие годы именно благодаря этому партнёрству.

Что это значит

Применение ИИ в лингвистике — пример того, как нейросети усиливают экспертизу, а не вытесняют её. Там, где есть параллельные тексты и достаточный объём данных, алгоритм работает как ускоритель. Там, где культурный контекст непрозрачен или данных мало, последнее слово остаётся за учёным.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…