Физический ИИ и мозговые волны: почему видео с YouTube уже мало для обучения роботов
Передовым моделям физического ИИ больше не хватает видео с YouTube. Как пишет TechCrunch, для обучения роботов теперь нужны съёмка с нескольких ракурсов и плотная аннотация каждого кадра, а следующим рубежом становится считывание мозговых волн человека — чтобы модель училась не только на движениях, но и на намерениях.
AI-обработка оригинала TechCrunch; редакция Hamidun News
Издание TechCrunch 26 июля 2026 года описало новый рубеж в обучении физического ИИ (physical AI): передовым моделям для роботов уже недостаточно видеороликов с YouTube — им нужны съёмка с нескольких ракурсов, плотная покадровая аннотация, а вскоре и считывание мозговых волн человека.
Почему видео с YouTube больше не хватает
Видеоролики с YouTube дают роботу плоскую и обеднённую картину действия: один ракурс, отсутствие глубины и никакой разметки усилий и контактов. Как пишет TechCrunch, такого материала хватало ранним моделям, которые лишь распознавали объекты и жесты, но не передовым системам физического ИИ, которым нужно управлять реальным телом в трёхмерном пространстве.
Физический ИИ — это класс моделей, которые управляют роботами и устройствами в реальном мире, а не только генерируют текст или картинки. Чтобы такая модель научилась брать кружку или открывать дверь, ей важно понимать не только как выглядит движение со стороны, но и с какой силой, скоростью и под каким углом оно совершается. Обычный ролик из интернета этих данных не несёт: камера видит результат, но не физику за ним.
Ранние подходы к обучению роботов действительно опирались на массивы видео из открытых источников: модель смотрела, как человек выполняет задачу, и пыталась воспроизвести движение. Проблема в том, что имитация внешней картинки без данных о силе, глубине и контексте плохо переносится на настоящего робота в новой обстановке.
Какие данные нужны роботам
Передовым моделям физического ИИ нужны сразу несколько типов данных вместо одного видеопотока, следует из материала TechCrunch. Действие снимают одновременно с нескольких камер, каждый кадр вручную размечают, а следующим источником становятся биосигналы человека.
- Материал вышел 26 июля 2026 года на TechCrunch
- Проблема: видео с YouTube даёт лишь один ракурс без глубины и разметки
- Решение 1 — съёмка действия с нескольких ракурсов камер одновременно
- Решение 2 — плотная (dense) покадровая аннотация каждого движения
- Следующий рубеж — считывание мозговых волн (brain wave readings) человека
Несколько ракурсов одновременно позволяют восстановить трёхмерную геометрию сцены: то, что на одной камере скрыто рукой или объектом, видно на другой. Так модель получает объём и глубину, недоступные в одиночном ролике.
Плотная аннотация — самая трудоёмкая часть: разметчик описывает каждый кадр (какой объект, какое действие, какая фаза захвата), и на длинной записи это тысячи размеченных элементов. Именно поэтому бесплатные ролики уступают место дорогим студийным съёмкам, где сцену контролируют от начала до конца.
Зачем считывать мозговые волны
Мозговые волны — третий и самый необычный тип данных в новом наборе — нужны, чтобы захватить намерение человека, а не только внешнюю картинку движения. Считывание сигналов мозга — по сути электроэнцефалограмма (ЭЭГ) — добавляет к записи слой, который камера физически не видит: что человек планировал сделать и как распределял внимание в момент задачи.
«Забудьте про видео с
YouTube — передовым моделям физического ИИ нужны несколько ракурсов камер, плотная аннотация и, вскоре, считывание мозговых волн», — так формулирует новый стандарт данных TechCrunch.
Для индустрии это означает резкое удорожание и усложнение сбора данных. Вместо почти бесплатных роликов из сети приходят многокамерные студийные записи, ручная разметка и нейроинтерфейсы — а значит, доступ к качественным данным становится таким же барьером, как вычислительные мощности.
Что это значит
Гонка в робототехнике смещается с алгоритмов на данные: преимущество получит тот, кто соберёт более богатый и размеченный датасет движений и намерений. Дешёвые видео из интернета перестают быть топливом для физического ИИ — на их место приходят дорогие многокамерные записи и биосигналы человека.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.