The Decoder→ оригинал

FineBooks от Hugging Face: лучший OCR для исторических книг стоит менее $2 за тысячу страниц

Hugging Face и EleutherAI запустили FineBooks — бенчмарк OCR для исторических книг. Из 14 протестированных открытых моделей лучшей оказалась dots.mocr: 97,6% точности при стоимости менее $2 за тысячу страниц. Этого достаточно для датасетов обучения ИИ, но команда признаёт — до стандартов академических транскрипций пока не дотягивает.

AI-обработка оригинала The Decoder; редакция Hamidun News
FineBooks от Hugging Face: лучший OCR для исторических книг стоит менее $2 за тысячу страниц
Источник: The Decoder. Коллаж: Hamidun News.
◐ Слушать статью

Hugging Face совместно с EleutherAI опубликовал результаты проекта FineBooks: команда протестировала 14 открытых OCR-моделей на свыше 2000 страниц исторических книг. Лучшее из найденных решений — модель dots.mocr — достигает 97,6% точности на уровне символов при стоимости менее двух долларов за тысячу страниц.

Зачем нужна переоцифровка исторических книг

Языковые модели обучаются на огромных текстовых корпусах, значительную часть которых составляют оцифрованные книги из публичных архивов. Проблема в том, что большинство этих книг сканировалось в 1990-е и 2000-е годы с помощью примитивных OCR-программ. Результат — тысячи систематических ошибок: перепутанные буквы, разорванные слова, потерянные строки, нечитаемые аббревиатуры.

Когда такой «грязный» OCR-текст попадает в обучающую выборку, модель учится на искажённых паттернах. Это снижает качество генерации — особенно в доменах, где исторические тексты занимают значительную долю: юриспруденция, медицина, классическая литература, история науки.

FineBooks — попытка Hugging Face и EleutherAI системно решить эту проблему. Команда намеренно выбрала исторические книжные страницы как наиболее сложный объект для OCR: нестандартные старые шрифты, пожелтевшая бумага, неравномерные чернила, типографский брак изданий прошлых веков. До появления FineBooks не существовало систематического сравнения открытых OCR-решений именно на историческом материале.

Какая модель вышла лидером

Тестирование охватило 14 открытых OCR-систем на выборке свыше 2000 страниц исторических изданий. Победитель — модель dots.mocr — показала 97,6% точности на уровне символов. Это означает менее 3 ошибочных символов из каждых 100 — порог, при котором текст становится пригодным для формирования обучающих датасетов для больших языковых моделей.

Ключевые цифры проекта FineBooks:

  • 14 открытых OCR-моделей сравнивались в единой методологии
  • Более 2000 исторических книжных страниц в тестовой выборке
  • Лидер — dots.mocr: 97,6% точности на уровне символов
  • Себестоимость обработки — менее $2 за тысячу страниц

Экономическая сторона принципиально важна. При стоимости ниже $2 за тысячу страниц переработка корпуса в миллион страниц обходится менее чем в $2000 — реалистичный бюджет для некоммерческих AI-исследовательских организаций, работающих над созданием открытых датасетов.

Где точности пока не хватает

Авторы FineBooks честно признают ограничения. Показатель 97,6% достаточен для подготовки обучающих данных ИИ, но недостаточен для академических транскрипций. Научные транскрипции требуют практически идеального воспроизведения оригинала: специалисты по истории и текстологии работают с текстами, где каждая запятая несёт смысловую нагрузку, а допустимый порог ошибок на порядок ниже, чем для AI-датасетов.

«Результаты достаточно хороши для данных обучения ИИ, но ещё не достигают уровня, необходимого для научных транскрипций», — как говорится в материалах проекта

FineBooks, совместно опубликованных Hugging Face и EleutherAI.

Это важное разграничение: исследование честно указывает границу применимости dots.mocr, не претендуя на универсальное решение. dots.mocr закрывает потребности AI-индустрии, но академическое сообщество ждёт более высокой точности.

Что это значит

FineBooks даёт индустрии конкретный рабочий ориентир: dots.mocr — экономически обоснованный инструмент для масштабной переоцифровки исторических архивов в целях обучения LLM. По данным Hugging Face и EleutherAI, проблема «грязного» OCR-текста в обучающих корпусах реальна и решаема уже сейчас — без ожидания дорогих коммерческих решений. FineBooks открывает путь к тому, чтобы миллионы страниц исторических книг наконец стали полноценной частью обучающих корпусов открытых языковых моделей.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…