Habr AI→ المصدر

Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы

МТС в RnD-направлении Physical AI разрабатывает VLA-политику (Vision-Language-Action) для полноростового гуманоида. Главная проблема: робот уверенно берёт предмет со стола в статичной сцене, но начинает промахиваться, когда объект едет по конвейеру. Полноростовой робот при этом должен ещё и делать шаги, удерживая баланс тела, — а это многократно усложняет расчёт движений.

معالج بواسطة الذكاء الاصطناعي من Habr AI؛ بتحرير Hamidun News
Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы
المصدر: Habr AI. كولاج: Hamidun News.
◐ استمع للمقال

في 22 يوليو 2026، نشرت داريا (Dania)، مهندسة تعلم الآلة في MTS، في مدونة الشركة على منصة Habr تحليلاً لكيفية قيام فريق البحث والتطوير Physical AI في الشركة بتدريب إنسان آلي بالحجم الكامل على التقاط الأجسام المتحركة على سير ناقل باستخدام سياسة VLA (Vision-Language-Action، أي "الرؤية - اللغة - الفعل").

ما هي المشكلة الرئيسية

يلتقط الإنسان الآلي بثقة جسمًا من على طاولة، لكنه يبدأ بالإخفاق عندما يتحرك الجسم نفسه على سير ناقل — وهذه بالضبط هي المهمة التي يركز عليها فريق MTS. في المشهد الثابت يكون الجسم بلا حركة، والإضاءة مستقرة، والكاميرا موجهة نحو منطقة العمل، لذلك تُظهر نماذج VLA الحديثة جودة تحكم عالية. وبمجرد أن يبدأ الجسم بالحركة، تختفي دقة الإمساك المعتادة: فالنموذج المدرَّب على مشاهد ثابتة لا يواكب الهندسة المتغيرة للمهمة.

وبحسب المهندسة، فإن هذا ليس خللاً معزولاً، بل قيداً بنيوياً في نهج يعمل بشكل ممتاز في العروض التجريبية المخبرية، لكنه لا ينتقل بشكل جيد إلى سير ناقل حقيقي.

الروبوت يلتقط بثقة جسمًا من على طاولة، لكنه يبدأ بالإخفاق عندما يتحرك

الجسم على سير ناقل.

— داريا، مهندسة تعلم الآلة، MTC Web Services

لماذا يكون المشهد الديناميكي أصعب من المشهد الثابت

تضيف البيئة الديناميكية مستويين من التعقيد دفعة واحدة: يتحرك الجسم نفسه، ويتحرك الروبوت الذي يجب أن يتكيف معه. لا تزال معظم عروض الروبوتات المبهرة تُصوَّر في وضع ثابت — حيث تُرتَّب الأجسام بعناية على طاولة، ولا يتغير المشهد إلا قليلاً. أما المهام الواقعية، سواء في الحياة اليومية أو في الإنتاج، فلا تبدو كذلك: فعلى الأقل تتحرك الأجسام على سير ناقل، ويجب حساب الإمساك مع مراعاة سرعتها ومسارها.

أبرز معطيات المشروع:

  • الفريق — وحدة البحث والتطوير Physical AI في MTC Web Services
  • التقنية — سياسة VLA (Vision-Language-Action) لإنسان آلي
  • مُعِدّة التحليل — داريا، مهندسة تعلم الآلة في MTS
  • التركيز — الإمساك بأجسام تتحرك على سير ناقل، وليس أجسامًا موضوعة على طاولة
  • تاريخ نشر التحليل — 22 يوليو 2026

لماذا يكون الأمر أصعب على الإنسان الآلي مقارنة بالذراع الآلية

لا يحتاج الروبوت بالحجم الكامل إلى مد يده نحو الجسم فحسب، بل يجب عليه أيضًا الحفاظ على توازن جسمه بالكامل. أما الذراع الآلية الثابتة فتحل مهمة أبسط: قاعدتها ثابتة، والنموذج بأكمله مسؤول فقط عن حركة الذراع. في المقابل، يضطر الإنسان الآلي، لتحقيق الإمساك نفسه، إلى اتخاذ خطوات وتعويض إزاحة مركز الثقل بحركات إضافية للجسم.

كل حركة من هذا القبيل تغيّر موضع الكاميرا والذراع بالنسبة إلى الجسم الذي يكون في تلك اللحظة أيضًا في حالة حركة. ونتيجة لذلك، يصبح حساب الحركات أكثر تعقيدًا بشكل كبير: إذ يجب على النموذج أن يتنبأ في الوقت نفسه بمسار الجسم، ويخطط للإمساك، ويحافظ على استقرار الروبوت. وهذا بالضبط هو المزيج الذي يحاول فريق MTS تجميعه الآن في إطار اتجاه Physical AI.

ماذا يعني هذا

يُعد الانتقال من العروض الثابتة إلى العمل مع أجسام متحركة أحد أهم العقبات في طريق الروبوتات الشبيهة بالإنسان من المختبر إلى الإنتاج الفعلي. ويُظهر تحليل MTS أن حتى العملية الأساسية المتمثلة في "التقاط جسم" تتوقف عن كونها بديهية بمجرد أن يدبّ المشهد بالحياة، وأن التطبيق الصناعي لروبوتات VLA لا يصطدم بقوة الإمساك، بل بديناميكية البيئة.

أسئلة شائعة

ما هي سياسة VLA؟

VLA (Vision-Language-Action) هو نموذج للتحكم في الروبوت يربط بين الرؤية والتعليمات اللغوية والفعل: يرى الروبوت المشهد، ويفهم المهمة، ويخطط للحركة. وفي المشاهد الثابتة، وبحسب تحليل MTS، تُظهر هذه النماذج جودة إمساك عالية.

لماذا تكون البيئة الديناميكية أصعب بالنسبة للإنسان الآلي؟

لأن الجسم والروبوت نفسه يتحركان معًا. فللإمساك بالجسم، يضطر الإنسان الآلي بالحجم الكامل إلى اتخاذ خطوات والحفاظ على توازن جسمه بحركات إضافية، ولذلك يصبح حساب الحركات أكثر تعقيدًا بشكل كبير مقارنة بالذراع الآلية الثابتة.

ZK
Hamidun News
أخبار الذكاء الاصطناعي بدون ضوضاء. اختيار تحريري يومي من أكثر من 50 مصدر. منتج من جمال حميدون، رئيس الذكاء الاصطناعي في Alpina Digital.

هل تحتاج إلى ذكاء اصطناعي يعمل داخل شركتك — وليس فقط في موجز الأخبار؟

أبني ذكاءً اصطناعياً جاهزاً للإنتاج للشركات — أنظمة CRM مخصّصة، أدوات داخلية، وكلاء مستقلون، أتمتة سير العمل. ملك لك، مصمّم وفق عمليتك، دون رسوم لكل مستخدم. من إعداد جمال خميدون، مدير المنتجات في AlpinaGPT (منصة ذكاء اصطناعي، أكثر من 6000 مستخدم).

ما رأيك؟
جارٍ تحميل التعليقات…