TechCrunch→ original

Физический ИИ и мозговые волны: почему видео с YouTube уже мало для обучения роботов

Передовым моделям физического ИИ больше не хватает видео с YouTube. Как пишет TechCrunch, для обучения роботов теперь нужны съёмка с нескольких ракурсов и плотная аннотация каждого кадра, а следующим рубежом становится считывание мозговых волн человека — чтобы модель училась не только на движениях, но и на намерениях.

Procesado por IA desde TechCrunch; editado por Hamidun News
Физический ИИ и мозговые волны: почему видео с YouTube уже мало для обучения роботов
Fuente: TechCrunch. Collage: Hamidun News.
◐ Escuchar artículo

TechCrunch informó el 26 de julio de 2026 sobre una nueva frontera en el entrenamiento de la IA física (physical AI): a los modelos de vanguardia para robots ya no les basta con videos de YouTube; necesitan grabaciones desde varios ángulos, anotación densa cuadro por cuadro y, pronto, lectura de ondas cerebrales humanas.

Por qué los videos de YouTube ya no bastan

Los videos de YouTube le dan al robot una imagen plana y empobrecida de la acción: un solo ángulo, sin profundidad y sin ninguna anotación de esfuerzo o contacto. Como escribe TechCrunch, ese tipo de material era suficiente para los modelos tempranos, que solo reconocían objetos y gestos, pero no para los sistemas de vanguardia de IA física, que necesitan controlar un cuerpo real en un espacio tridimensional.

La IA física es una clase de modelos que controlan robots y dispositivos en el mundo real, y no solo generan texto o imágenes. Para que un modelo así aprenda a tomar una taza o abrir una puerta, necesita entender no solo cómo se ve el movimiento desde afuera, sino con qué fuerza, velocidad y en qué ángulo se realiza. Un video común de internet no aporta estos datos: la cámara ve el resultado, pero no la física detrás de él.

Los primeros enfoques para entrenar robots sí se apoyaban en grandes cantidades de video de fuentes abiertas: el modelo observaba a una persona realizar una tarea e intentaba reproducir el movimiento. El problema es que imitar la imagen externa sin datos de fuerza, profundidad y contexto se traslada mal a un robot real en un entorno nuevo.

Qué datos necesitan los robots

Los modelos de vanguardia de IA física necesitan varios tipos de datos a la vez en lugar de un solo flujo de video, según el material de TechCrunch. La acción se filma simultáneamente desde varias cámaras, cada cuadro se anota manualmente, y la siguiente fuente pasa a ser las bioseñales humanas.

  • El material se publicó el 26 de julio de 2026 en TechCrunch
  • El problema: el video de YouTube ofrece un solo ángulo sin profundidad ni anotación
  • Solución 1: grabar la acción desde varios ángulos de cámara simultáneamente
  • Solución 2: anotación densa (dense) cuadro por cuadro de cada movimiento
  • La siguiente frontera: lectura de ondas cerebrales (brainwave readings) humanas

Varios ángulos simultáneos permiten reconstruir la geometría tridimensional de la escena: lo que una cámara oculta con una mano o un objeto, otra lo muestra. Así el modelo obtiene volumen y profundidad que un video único no puede ofrecer.

La anotación densa es la parte más laboriosa: el anotador describe cada cuadro (qué objeto, qué acción, qué fase del agarre), y en una grabación larga esto suma miles de elementos anotados. Precisamente por eso los videos gratuitos están cediendo su lugar a costosas grabaciones de estudio, donde la escena se controla de principio a fin.

Para qué leer las ondas cerebrales

Las ondas cerebrales —el tercer y más inusual tipo de dato del nuevo conjunto— son necesarias para captar la intención humana, y no solo la imagen externa del movimiento. La lectura de señales cerebrales —en esencia un electroencefalograma (EEG)— añade a la grabación una capa que la cámara físicamente no puede ver: qué planeaba hacer la persona y cómo distribuía su atención en el momento de la tarea.

«Olvídense de los videos de

YouTube: los modelos de vanguardia de IA física necesitan varios ángulos de cámara, anotación densa y, pronto, lectura de ondas cerebrales», así formula TechCrunch el nuevo estándar de datos.

Para la industria, esto implica un fuerte encarecimiento y una mayor complejidad en la recopilación de datos. En lugar de videos casi gratuitos de internet, llegan grabaciones de estudio con múltiples cámaras, anotación manual e interfaces neuronales; es decir, el acceso a datos de calidad se convierte en una barrera tan grande como la capacidad de cómputo.

Qué significa esto

La carrera en robótica se está desplazando de los algoritmos hacia los datos: la ventaja la tendrá quien reúna el conjunto de datos más rico y mejor anotado de movimientos e intenciones. Los videos baratos de internet dejan de ser el combustible de la IA física; en su lugar llegan las costosas grabaciones multicámara y las bioseñales humanas.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…