The Decoder→ المصدر

FineBooks от Hugging Face: лучший OCR для исторических книг стоит менее $2 за тысячу страниц

Hugging Face и EleutherAI запустили FineBooks — бенчмарк OCR для исторических книг. Из 14 протестированных открытых моделей лучшей оказалась dots.mocr: 97,6% точности при стоимости менее $2 за тысячу страниц. Этого достаточно для датасетов обучения ИИ, но команда признаёт — до стандартов академических транскрипций пока не дотягивает.

معالج بواسطة الذكاء الاصطناعي من The Decoder؛ بتحرير Hamidun News
FineBooks от Hugging Face: лучший OCR для исторических книг стоит менее $2 за тысячу страниц
المصدر: The Decoder. كولاج: Hamidun News.
◐ استمع للمقال

نشر Hugging Face بالتعاون مع EleutherAI نتائج مشروع FineBooks: اختبر الفريق 14 نموذجاً مفتوح المصدر لتقنية التعرف الضوئي على الحروف (OCR) على أكثر من 2000 صفحة من الكتب التاريخية. وقد حقق أفضل حل تم اكتشافه — وهو نموذج dots.mocr — دقةً تبلغ 97.6% على مستوى الأحرف بتكلفة تقل عن دولارين لكل ألف صفحة.

لماذا تُعدّ إعادة رقمنة الكتب التاريخية ضرورةً ملحّة

تُدرَّب نماذج اللغة على مجموعات نصية ضخمة، يُشكّل الكتب المُرقمَّنة المأخوذة من الأرشيفات العامة نسبةً كبيرةً منها. والمشكلة أن غالبية هذه الكتب قد جرى مسحها ضوئياً في تسعينيات القرن الماضي ومطلع الألفية الثالثة باستخدام برامج OCR بدائية، مما أفضى إلى آلاف الأخطاء المنهجية: حروف مختلطة، وكلمات مقطوعة، وأسطر مفقودة، واختصارات غير مقروءة.

حين يُدرج هذا النص المُستخرَج بتقنية OCR «الملوّثة» في مجموعة بيانات التدريب، يتعلم النموذج من أنماط مشوّهة، مما يُضعف جودة التوليد — لا سيما في المجالات التي تحتل فيها النصوص التاريخية حصةً وافرة، كالقانون والطب والأدب الكلاسيكي وتاريخ العلوم.

يمثّل FineBooks محاولةً من Hugging Face وEleutherAI لمعالجة هذه المشكلة بصورة منهجية. اختار الفريق عمداً صفحات الكتب التاريخية بوصفها الأصعب للتعرف الضوئي على الحروف: خطوط قديمة غير معيارية، وورق متصفّر، وحبر غير متساوٍ، وعيوب طباعية في مطبوعات تعود لقرون سالفة. وقبل FineBooks، لم يكن ثمة مقارنة منهجية بين حلول OCR مفتوحة المصدر على مادة تاريخية تحديداً.

أي النماذج تصدّر القائمة

شمل الاختبار 14 نظاماً مفتوح المصدر لتقنية OCR على عيّنة تضم أكثر من 2000 صفحة من المطبوعات التاريخية. وجاء الفائز — نموذج dots.mocr — بدقة 97.6% على مستوى الأحرف، أي بما لا يزيد عن 3 أحرف خاطئة من كل 100 حرف، وهو العتبة التي يغدو عندها النص صالحاً لبناء مجموعات بيانات تدريب نماذج اللغة الكبيرة.

الأرقام الرئيسية لمشروع FineBooks:

  • 14 نموذجاً مفتوح المصدر لتقنية OCR جرت مقارنتها وفق منهجية موحّدة
  • أكثر من 2000 صفحة من الكتب التاريخية في عيّنة الاختبار
  • المتصدر — dots.mocr: دقة 97.6% على مستوى الأحرف
  • تكلفة المعالجة — أقل من 2 دولار لكل ألف صفحة

الجانب الاقتصادي بالغ الأهمية؛ إذ تبلغ تكلفة إعادة معالجة مجموعة مؤلفة من مليون صفحة بسعر أقل من دولارين لكل ألف صفحة ما يقل عن ألفي دولار — وهو ميزانية واقعية للمؤسسات البحثية غير الربحية في مجال الذكاء الاصطناعي العاملة على إنشاء مجموعات بيانات مفتوحة.

أين لا تزال الدقة قاصرة

يُقرّ مؤلفو FineBooks بصراحة بالقيود القائمة. فنسبة 97.6% كافية لإعداد بيانات تدريب الذكاء الاصطناعي، غير أنها غير كافية للنسخ الأكاديمي. فالنسخ العلمي يستلزم استنساخاً شبه مثالي للأصل؛ إذ يتعامل المتخصصون في التاريخ والنقد النصي مع نصوص تحمل فيها كل فاصلة ثقلاً دلالياً، وتكون نسبة الخطأ المقبولة أدنى بمرتبة كاملة مقارنةً بمجموعات بيانات الذكاء الاصطناعي.

«النتائج جيدة بما يكفي لبيانات تدريب الذكاء الاصطناعي، لكنها لم تبلغ بعد المستوى المطلوب للنسخ العلمي»، كما ورد في مواد مشروع

FineBooks التي نشرها Hugging Face وEleutherAI مشتركَين.

هذا تمييز جوهري: تُحدد الدراسة بصدق حدود تطبيق نموذج dots.mocr، دون أن تدّعي أنه حل شامل. فـdots.mocr يلبّي احتياجات صناعة الذكاء الاصطناعي، بينما ينتظر المجتمع الأكاديمي مستوى أعلى من الدقة.

ما الذي يعنيه هذا

يمنح FineBooks الصناعةَ مرجعاً عملياً واضحاً: dots.mocr أداة مُجدية اقتصادياً لإعادة رقمنة الأرشيفات التاريخية على نطاق واسع بغرض تدريب نماذج اللغة الكبيرة. ووفق ما أفاد به Hugging Face وEleutherAI، فإن مشكلة نص OCR «الملوّث» في مجموعات بيانات التدريب حقيقية وقابلة للحل الآن — دون انتظار حلول تجارية مكلفة. يفتح FineBooks الطريقَ أمام ملايين صفحات الكتب التاريخية لتصبح أخيراً جزءاً حقيقياً من مجموعات بيانات تدريب نماذج اللغة المفتوحة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟

AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.

ما رأيك؟
جارٍ تحميل التعليقات…