AI-компании скупают старые книги: последние данные для обучения без ИИ-слопа
AI-компании начали скупать старые бумажные книги как источник тренировочных данных: тексты, написанные до массового прихода генеративного ИИ, — последний крупный пул, не отравленный машинным «слопом». Дата-брокер ISBNdb предлагает лабораториям доступ к миллионам изданий, но чтобы их оцифровать, корешки книг срезают, а покупатели не раскрывают, кто оплатил заказ.
معالج بواسطة الذكاء الاصطناعي من TNW؛ بتحرير Hamidun News
بدأت مختبرات الذكاء الاصطناعي في شراء الكتب الورقية القديمة بكميات كبيرة لتدريب النماذج عليها: النصوص الصادرة قبل ظهور الذكاء الاصطناعي التوليدي تظل آخر مجموعة بيانات كبيرة غير ملوثة بـ"سلوب" الآلات. تبيع شركة الوساطة في البيانات ISBNdb حق الوصول إلى الكتالوج، بينما لا تكشف المختبرات نفسها عن الجهة الممولة للشراء — وفق ما ذكرته صحيفة The Next Web في يوليو 2026.
لماذا تكتسب الكتب الخالية من سلوب الذكاء الاصطناعي قيمتها؟
تكتسب الكتب القديمة قيمتها لأنها مضمونة الكتابة من قبل بشر: أي نص صدر قبل إطلاق ChatGPT في نوفمبر 2022 لا يمكن ماديًا أن يحتوي على محتوى مُولَّد بواسطة شبكة عصبية. هذه "النقاوة" بالتحديد هي ما يحوّل رفوف المكتبات إلى مورد نادر لتدريب النماذج.
تكمن المشكلة في طريقة الاستخلاص. لرقمنة كتاب باستخدام ماسح ضوئي صناعي، يُقطع عموده الفقري وتُمرَّر الصفحات عبر وحدة تغذية أوتوماتيكية، أي أنه يُدمَّر فعليًا. ووفقًا لـ The Next Web، يتعلق الأمر بملايين المجلدات، ولا يظهر اسم المختبر الطالب في الصفقات.
- ISBNdb — شركة وساطة في البيانات تبيع للمختبرات إمكانية الوصول إلى كتالوج الكتب
- نوفمبر 2022 — إطلاق ChatGPT، الخط الفاصل بين البيانات "النظيفة" والملوثة
- الرقمنة مدمّرة: تُقطع الأعمدة الفقرية، وتُتلف الكتب الورقية
- ملايين الإصدارات قيد التداول
- لا يكشف المشترون عن هوية شركة الذكاء الاصطناعي التي دفعت ثمن الطلب
لماذا تنفد البيانات؟
استنفدت المختبرات الكبرى بالفعل، من الناحية العملية، الإنترنت المفتوح كمصدر للنصوص عالية الجودة. وقد قدّر محللو Epoch AI منذ عام 2024 أن مخزون البيانات البشرية العامة عالية الجودة قد ينفد في النصف الثاني من عقد العشرينيات، ومنذ ذلك الحين لم يزدد السباق نحو المجموعات "النظيفة" المتبقية إلا حدّة.
تُعد الكتب أصلًا متميزًا في هذا السباق. يقدّم الكتاب نصًا طويلًا ومتماسكًا ومحرَّرًا بلغة غنية، بدلًا من منشورات وتعليقات متفرقة، ولهذا يستحق المجلد الواحد الجودة التي تكون المختبرات مستعدة لدفع ثمنها لشركات وساطة مثل ISBNdb.
ما هو تلوث البيانات؟
تلوث البيانات هو الوضع الذي تتألف فيه نصوص التدريب المستقاة من الإنترنت بشكل متزايد من نواتج الشبكات العصبية نفسها، بدلًا من مواد كتبها بشر. النموذج المدرَّب على "سلوبه" الخاص يتدهور تدريجيًا: يفقد التنوع والدقة. وصف الباحثون هذا التأثير في مجلة Nature منذ عام 2024 وأطلقوا عليه اسم model collapse — انهيار النموذج.
من هنا تأتي المطاردة وراء الكتب المادية. يمتلئ الإنترنت بسرعة بنصوص الذكاء الاصطناعي منذ عام 2022، ويصبح فصل المحتوى البشري عن الآلي على الويب أكثر صعوبة، في حين يُعد تاريخ نشر الكتاب مؤشرًا موثوقًا على أن النص الذي أمامك سابق للرقمنة وبشري المصدر.
"أفضل بيانات في العالم لتدريب الذكاء الاصطناعي موجودة على الرف" — هكذا يبدو، وفقًا لـ
The Next Web، عرض شركة الوساطة في البيانات ISBNdb.
يبقى الجانب القانوني منطقة رمادية: شراء ومسح كتب الغير لتدريب نماذج تجارية موضوع دعاوى قضائية من أصحاب الحقوق، وتزيد عدم الكشف عن هوية الجهات الطالبة من حدة التساؤلات حول الشفافية.
ماذا يعني هذا؟
بالنسبة للصناعة، هذا مؤشر على ندرة هيكلية: البيانات البشرية عالية الجودة محدودة، وكل ما أُنتج بعد عام 2022 تتراجع قيمته باستمرار بسبب اختلاطه بمحتوى الذكاء الاصطناعي. وبينما تتطلب النماذج كمًا متزايدًا من النصوص، يتحول الإرث "السابق للرقمنة" — الكتب القديمة والأرشيفات والصحف — إلى مورد استراتيجي وقابل للنفاد ماديًا.
هل تريد التوقف عن قراءة الذكاء الاصطناعي والبدء باستخدامه؟
AI News هو موجز منسق لأخبار الذكاء الاصطناعي. تعلمك Hamidun Academy استخدام الذكاء الاصطناعي في عملك.
أهم ما في عالم الذكاء الاصطناعي — مرة كل أسبوع
سبع قصص مهمة فعلاً هذا الأسبوع، مختارة بعناية. بلا ضجيج ولا بيانات صحفية.
تم! تحقق من بريدك للتأكيد.