TechCrunch→ оригинал

Физический ИИ и мозговые волны: почему видео с YouTube уже мало для обучения роботов

Передовым моделям физического ИИ больше не хватает видео с YouTube. Как пишет TechCrunch, для обучения роботов теперь нужны съёмка с нескольких ракурсов и плотная аннотация каждого кадра, а следующим рубежом становится считывание мозговых волн человека — чтобы модель училась не только на движениях, но и на намерениях.

AI-обработка оригинала TechCrunch; редакция Hamidun News
Физический ИИ и мозговые волны: почему видео с YouTube уже мало для обучения роботов
Источник: TechCrunch. Коллаж: Hamidun News.
◐ Слушать статью

Издание TechCrunch 26 июля 2026 года описало новый рубеж в обучении физического ИИ (physical AI): передовым моделям для роботов уже недостаточно видеороликов с YouTube — им нужны съёмка с нескольких ракурсов, плотная покадровая аннотация, а вскоре и считывание мозговых волн человека.

Почему видео с YouTube больше не хватает

Видеоролики с YouTube дают роботу плоскую и обеднённую картину действия: один ракурс, отсутствие глубины и никакой разметки усилий и контактов. Как пишет TechCrunch, такого материала хватало ранним моделям, которые лишь распознавали объекты и жесты, но не передовым системам физического ИИ, которым нужно управлять реальным телом в трёхмерном пространстве.

Физический ИИ — это класс моделей, которые управляют роботами и устройствами в реальном мире, а не только генерируют текст или картинки. Чтобы такая модель научилась брать кружку или открывать дверь, ей важно понимать не только как выглядит движение со стороны, но и с какой силой, скоростью и под каким углом оно совершается. Обычный ролик из интернета этих данных не несёт: камера видит результат, но не физику за ним.

Ранние подходы к обучению роботов действительно опирались на массивы видео из открытых источников: модель смотрела, как человек выполняет задачу, и пыталась воспроизвести движение. Проблема в том, что имитация внешней картинки без данных о силе, глубине и контексте плохо переносится на настоящего робота в новой обстановке.

Какие данные нужны роботам

Передовым моделям физического ИИ нужны сразу несколько типов данных вместо одного видеопотока, следует из материала TechCrunch. Действие снимают одновременно с нескольких камер, каждый кадр вручную размечают, а следующим источником становятся биосигналы человека.

  • Материал вышел 26 июля 2026 года на TechCrunch
  • Проблема: видео с YouTube даёт лишь один ракурс без глубины и разметки
  • Решение 1 — съёмка действия с нескольких ракурсов камер одновременно
  • Решение 2 — плотная (dense) покадровая аннотация каждого движения
  • Следующий рубеж — считывание мозговых волн (brain wave readings) человека

Несколько ракурсов одновременно позволяют восстановить трёхмерную геометрию сцены: то, что на одной камере скрыто рукой или объектом, видно на другой. Так модель получает объём и глубину, недоступные в одиночном ролике.

Плотная аннотация — самая трудоёмкая часть: разметчик описывает каждый кадр (какой объект, какое действие, какая фаза захвата), и на длинной записи это тысячи размеченных элементов. Именно поэтому бесплатные ролики уступают место дорогим студийным съёмкам, где сцену контролируют от начала до конца.

Зачем считывать мозговые волны

Мозговые волны — третий и самый необычный тип данных в новом наборе — нужны, чтобы захватить намерение человека, а не только внешнюю картинку движения. Считывание сигналов мозга — по сути электроэнцефалограмма (ЭЭГ) — добавляет к записи слой, который камера физически не видит: что человек планировал сделать и как распределял внимание в момент задачи.

«Забудьте про видео с

YouTube — передовым моделям физического ИИ нужны несколько ракурсов камер, плотная аннотация и, вскоре, считывание мозговых волн», — так формулирует новый стандарт данных TechCrunch.

Для индустрии это означает резкое удорожание и усложнение сбора данных. Вместо почти бесплатных роликов из сети приходят многокамерные студийные записи, ручная разметка и нейроинтерфейсы — а значит, доступ к качественным данным становится таким же барьером, как вычислительные мощности.

Что это значит

Гонка в робототехнике смещается с алгоритмов на данные: преимущество получит тот, кто соберёт более богатый и размеченный датасет движений и намерений. Дешёвые видео из интернета перестают быть топливом для физического ИИ — на их место приходят дорогие многокамерные записи и биосигналы человека.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…