The Decoder→ المصدر

Qwen-Image-3.0 от Alibaba: читаемый текст в 10 пикселей и инфографика за один проход

Команда Qwen (Alibaba) представила Qwen-Image-3.0 — генератор изображений, который разборчиво рендерит текст размером от 10 пикселей, принимает промпты до 4500 токенов и поддерживает 12 языков. За один проход модель собирает инфографику, LaTeX-статьи и газетные полосы — правда, на выходе плоская картинка, а не редактируемый макет.

معالج بواسطة الذكاء الاصطناعي من The Decoder؛ بتحرير Hamidun News
Qwen-Image-3.0 от Alibaba: читаемый текст в 10 пикселей и инфографика за один проход
المصدر: The Decoder. كولاج: Hamidun News.
◐ استمع للمقال

كشف فريق Qwen (Alibaba) في يوليو 2026 عن Qwen-Image-3.0 — مولّد صور يقبل موجهات (prompts) يصل طولها إلى 4500 توكن، ويعرض نصًا مقروءًا بحجم 10 بكسل فأكثر، ويدعم بشكل أصلي 12 لغة.

ما الذي يستطيع Qwen-Image-3.0 فعله

يُنشئ Qwen-Image-3.0 تخطيطات معقدة في مرور واحد: إنفوغرافيك، صفحات بأسلوب المقالات العلمية بصيغة LaTeX، وصفحات جرائد كاملة. الفرق الرئيسي عن المولّدات السابقة هو وضوح الخط الصغير: يُخرج النموذج نصوصًا مقروءة بارتفاع 10 بكسل فقط، في حين تحوّل معظم نماذج الانتشار (diffusion) مثل هذا النص إلى خليط غير مقروء.

أهم الخصائص بحسب فريق Qwen:

  • طول الموجه — حتى 4500 توكن
  • الحد الأدنى للنص المقروء — من 10 بكسل
  • دعم أصلي لـ 12 لغة
  • في مرور واحد — إنفوغرافيك، مقالات LaTeX، صفحات جرائد

أين تكمن مشكلة التخطيطات المعقدة

تبقى القيمة العملية لهذه التخطيطات موضع شك. يُخرج Qwen-Image-3.0 صورة جاهزة، وليس مستندًا قابلًا للتحرير: لا يمكن فتح إنفوغرافيك أو صفحة جريدة تم إنشاؤها وتصحيحها — بل إعادة رسمها فقط بموجه جديد. بالنسبة لمهام التنضيد الحقيقية، حيث يُعدَّل النص عشرات المرات، تُعد هذه القيود أهم من مجرد كون نص بحجم 10 بكسل مقروءًا.

«تبقى القيمة العملية لهذه التخطيطات موضع شك عندما يكون الناتج صورة بكسلية وليس صيغة قابلة للتحرير»، بحسب موقع

The Decoder.

مع ذلك، فإن دعم الموجهات ذات 4500 توكن يوسّع فعليًا نطاق التحكم: يمكن في طلب واحد وصف بنية الصفحة، ونصوص الكتل، والأسلوب دفعة واحدة، دون تقسيم المهمة إلى عدة خطوات.

كيف يبدو هذا في مقابل السوق

يواصل Qwen-Image-3.0 مسار النماذج المفتوحة لدى Alibaba، التي تنافس مولّدات مغلقة مثل Google Nano Banana وحلول OpenAI. الرهان على النص داخل الصورة وتعدد اللغات عبر 12 لغة هو رد مباشر على نقطة الضعف لدى معظم نماذج الصور: حتى الآن كان يتعين تصحيح النصوص على الصور المولَّدة يدويًا أو وضعها فوقها في محرر.

ما الذي يعنيه هذا

تقترب مولّدات الصور من مجال كان يعمل فيه سابقًا المصممون والمنضّدون فقط: الملصقات، الإنفوغرافيك، الأغلفة الكثيفة بالنص. وطالما ظل الناتج صورة "مسطحة" بلا طبقات، يبقى Qwen-Image-3.0 أداة للمسودات والمعاينات أكثر منه بديلًا لتخطيط قابل للتحرير، لكن النموذج يرفع بشكل ملحوظ سقف وضوح النص الصغير.

الأسئلة الشائعة

ما الذي يستطيع Qwen-Image-3.0 فعله مباشرة؟

يُنشئ النموذج في مرور واحد إنفوغرافيك، وصفحات بأسلوب مقالات LaTeX، وصفحات جرائد، ويقبل موجهات حتى 4500 توكن، ويعرض نصًا مقروءًا من 10 بكسل بـ 12 لغة.

لماذا يُنتقد إنشاء التخطيطات المعقدة؟

لأن الناتج صورة بكسلية، وليس ملفًا قابلًا للتحرير. لا يمكن تحرير إنفوغرافيك أو صفحة جريدة جاهزة كمستند، بل فقط إعادة إنشائها بالكامل بموجه جديد.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…