IEEE Spectrum AI→ original

Robots entrenados con VLM para leer emociones humanas — la confianza es más importante que la cortesía

Científicos de la Universidad de Melbourne entrenaron a un robot para leer emociones usando un modelo de visión-lenguaje — analiza toda la escena, no solo expresiones faciales. El VLM alcanzó una precisión de 0,86 contra 0,77 del algoritmo clásico. De 40 participantes, 31 prefirieron las disculpas personalizadas del robot a las programadas. Pero el hallazgo principal: la cortesía después de un fallo no restaura la confianza — las personas quieren un socio competente.

Procesado por IA desde IEEE Spectrum AI; editado por Hamidun News
Robots entrenados con VLM para leer emociones humanas — la confianza es más importante que la cortesía
Fuente: IEEE Spectrum AI. Collage: Hamidun News.
◐ Escuchar artículo

Científicos de la Universidad de Melbourne entrenaron robots colaborativos para leer emociones humanas usando un modelo de visión-lenguaje (VLM). La investigación publicada en IEEE Robotics and Automation Letters muestra: los robots se vuelven más atentos con las personas, pero la confianza en ellos sigue siendo determinada no por la forma de comunicación, sino por la capacidad de realizar tareas.

Contexto en lugar de expresiones faciales

Los sistemas estándar de interacción humano-máquina se basan en el análisis de expresiones faciales y el seguimiento de objetos en fotogramas. Los investigadores liderados por Sung Chan Hong decidieron ir más allá y usar VLM — una clase de modelos que procesan tanto texto como datos visuales simultáneamente.

Para entrenar el modelo, los voluntarios vieron grabaciones de vídeo donde los robots entregaban objetos a personas con varios grados de éxito y describían las emociones de los participantes de la escena. Crucialmente, los evaluadores tenían en cuenta el contexto completo: una frente fruncida en una persona golpeando los dedos en la mesa significa irritación; la misma frente fruncida en una persona enfocada en una tarea simplemente significa concentración.

La comparación con un algoritmo clásico produjo resultados convincentes: VLM logró una precisión de 0,86 en una escala de 0 a 1, mientras que el enfoque tradicional obtuvo 0,77. Según Hong, el modelo "vio toda la escena: dónde se encuentra la persona, qué está haciendo, cómo interactúa con el robot" — esto es exactamente lo que le dio la ventaja.

Las disculpas personalizadas funcionan — pero no siempre

En el segundo experimento, 40 voluntarios trabajaron colaborativamente con un robot que fue programado previamente para cometer un error. Después del fallo, el robot respondió de una de dos maneras:

  • Disculpa adaptativa — formulada según la lectura del estado emocional de la persona por parte del robot
  • Frase estándar — una respuesta predeterminada escrita previamente

31 de los 40 participantes prefirieron la respuesta personalizada. Esto confirma: a las personas les importa sentir que el robot percibe su estado y responde de manera significativa.

Sin embargo, los datos de la encuesta revelaron otro lado de la historia: las calificaciones de confianza de la mayoría de los participantes en el robot disminuyeron después del error independientemente del tipo de disculpa.

"La disculpa personalizada funciona como un lubricante social, pero no restaura la confianza perdida debido al fracaso en una tarea física", explica

Hong.

Dónde terminan las capacidades de VLM

El análisis de los datos del segundo experimento reveló una limitación importante. Cuando las calificaciones de emociones de VLM se compararon con lo que los propios participantes reportaron sobre su estado emocional, la precisión del modelo cayó drásticamente. El modelo se alineó bien con las percepciones de observadores externos, pero predijo mal las experiencias internas de los propios participantes.

"VLM es un buen observador de señales sociales externas, pero no puede leer mentes", explicó Hong. En otras palabras, el modelo nota lo que un observador externo mirando desde afuera notaría. En situaciones donde una persona oculta sus emociones o experimenta algo que no se refleja en sus expresiones faciales y gestos, el sistema falla.

Qué significa esto

La investigación establece una prioridad clara para los desarrolladores: primero confiabilidad y precisión en la ejecución de tareas, luego la capa de interacción emocional. Las personas están dispuestas a colaborar con robots que pueden disculparse de manera humanista, — pero ante todo quieren socios competentes que no cometan errores.

A medida que se desarrollan los enfoques basados en VLM, la brecha con los sistemas tradicionales de reconocimiento de emociones crecerá, pero esto no resuelve la cuestión fundamental de la confianza.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…