The Decoder→ original

FineBooks от Hugging Face: лучший OCR для исторических книг стоит менее $2 за тысячу страниц

Hugging Face и EleutherAI запустили FineBooks — бенчмарк OCR для исторических книг. Из 14 протестированных открытых моделей лучшей оказалась dots.mocr: 97,6% точности при стоимости менее $2 за тысячу страниц. Этого достаточно для датасетов обучения ИИ, но команда признаёт — до стандартов академических транскрипций пока не дотягивает.

Procesado por IA desde The Decoder; editado por Hamidun News
FineBooks от Hugging Face: лучший OCR для исторических книг стоит менее $2 за тысячу страниц
Fuente: The Decoder. Collage: Hamidun News.
◐ Escuchar artículo

Hugging Face, junto con EleutherAI, ha publicado los resultados del proyecto FineBooks: el equipo evaluó 14 modelos de OCR de código abierto en más de 2.000 páginas de libros históricos. La mejor solución encontrada — el modelo dots.mocr — alcanza una precisión del 97,6% a nivel de caracteres a un coste inferior a dos dólares por cada mil páginas.

Por qué es necesaria la redigitalización de libros históricos

Los modelos de lenguaje se entrenan con enormes corpus de texto, una parte significativa de los cuales está compuesta por libros digitalizados procedentes de archivos públicos. El problema es que la mayoría de estos libros fueron escaneados en los años noventa y dos mil con programas de OCR rudimentarios. El resultado son miles de errores sistemáticos: letras confundidas, palabras partidas, líneas perdidas y abreviaturas ilegibles.

Cuando ese texto de OCR «sucio» entra en un conjunto de datos de entrenamiento, el modelo aprende a partir de patrones distorsionados. Esto reduce la calidad de la generación, especialmente en dominios donde los textos históricos representan una proporción significativa: derecho, medicina, literatura clásica e historia de la ciencia.

FineBooks es un intento de Hugging Face y EleutherAI de resolver este problema de forma sistemática. El equipo eligió deliberadamente páginas de libros históricos como el objeto más exigente para el OCR: tipografías antiguas no estándar, papel amarillento, tinta irregular y defectos tipográficos de publicaciones de siglos pasados. Antes de FineBooks, no existía ninguna comparación sistemática de soluciones de OCR de código abierto sobre material histórico en concreto.

Qué modelo resultó ganador

Las pruebas abarcaron 14 sistemas de OCR de código abierto sobre una muestra de más de 2.000 páginas de publicaciones históricas. El ganador — el modelo dots.mocr — demostró una precisión del 97,6% a nivel de caracteres. Esto significa menos de 3 caracteres erróneos por cada 100, un umbral a partir del cual el texto resulta apto para formar conjuntos de datos de entrenamiento para grandes modelos de lenguaje.

Cifras clave del proyecto FineBooks:

  • 14 modelos de OCR de código abierto comparados con una metodología unificada
  • Más de 2.000 páginas de libros históricos en la muestra de prueba
  • Líder — dots.mocr: 97,6% de precisión a nivel de caracteres
  • Coste de procesamiento — menos de 2 $ por cada mil páginas

El aspecto económico es fundamentalmente relevante. Con un coste inferior a 2 $ por cada mil páginas, el reprocesamiento de un corpus de un millón de páginas cuesta menos de 2.000 $, un presupuesto realista para organizaciones de investigación en IA sin ánimo de lucro que trabajan en la creación de conjuntos de datos abiertos.

Dónde la precisión aún es insuficiente

Los autores de FineBooks reconocen honestamente las limitaciones. El 97,6% es suficiente para preparar datos de entrenamiento de IA, pero insuficiente para transcripciones académicas. Las transcripciones científicas exigen una reproducción prácticamente perfecta del original: los especialistas en historia y crítica textual trabajan con textos en los que cada coma tiene carga de significado, y el umbral de error aceptable es un orden de magnitud inferior al de los conjuntos de datos de IA.

«Los resultados son suficientemente buenos para los datos de

entrenamiento de IA, pero aún no alcanzan el nivel necesario para las transcripciones científicas», según se indica en los materiales del proyecto FineBooks, publicados conjuntamente por Hugging Face y EleutherAI.

Esta es una distinción importante: el estudio identifica honestamente el límite de aplicabilidad de dots.mocr, sin pretender ser una solución universal. dots.mocr cubre las necesidades de la industria de la IA, pero la comunidad académica espera una precisión mayor.

Qué significa todo esto

FineBooks proporciona a la industria un punto de referencia concreto y operativo: dots.mocr es una herramienta económicamente viable para la redigitalización a gran escala de archivos históricos con el fin de entrenar LLMs. Según Hugging Face y EleutherAI, el problema del texto de OCR «sucio» en los corpus de entrenamiento es real y ya puede resolverse hoy, sin necesidad de esperar a costosas soluciones comerciales. FineBooks abre el camino para que millones de páginas de libros históricos se conviertan por fin en una parte plena de los corpus de entrenamiento de los modelos de lenguaje abiertos.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…