arXiv cs.LG→ original

Datos tabulares e imágenes: por qué la elección del codificador es crítica

Investigadores de arXiv probaron por primera vez modelos tabulares como codificadores en el procesamiento conjunto de tablas e imágenes. Resultó que la elección del codificador es un factor crítico para la calidad. El problema principal: los mejores modelos tabulares (In-Context Learning) requieren etiquetas para procesar ejemplos, creando complejidad al codificar datos de entrenamiento y prueba idénticamente. Los autores resolvieron este problema y enfatizaron la importancia de la selección del codificador en sistemas multimodales.

Procesado por IA desde arXiv cs.LG; editado por Hamidun News
Datos tabulares e imágenes: por qué la elección del codificador es crítica
Fuente: arXiv cs.LG. Collage: Hamidun News.
◐ Escuchar artículo

Los investigadores evaluaron sistemáticamente por primera vez modelos tabulares como codificadores en tareas de aprendizaje multimodal, donde una red neuronal debe entender simultáneamente tablas e imágenes. El enfoque tradicional — usar un MLP simple para tablas — resultó ser subóptimo.

¿Por qué el MLP es insuficiente para datos tabulares?

El aprendizaje multimodal requiere un codificador separado para cada tipo de dato. Si un modelo trabaja con imágenes y tablas simultáneamente, necesita redes especializadas para procesar cada una. Para imágenes, se han utilizado durante mucho tiempo potentes CNN o Vision Transformers; para texto — modelos de lenguaje. Pero para datos tabulares, la mayoría de los investigadores simplemente tomaron un MLP simple.

Los datos tabulares (tablas de bases de datos, archivos CSV, hojas de cálculo) es un área problemática conocida para el aprendizaje profundo. Se llama "la última cerradura sin resolver del aprendizaje automático". Existen mejores modelos para trabajar con tablas — por ejemplo, arquitecturas especializadas basadas en atención y aprendizaje en contexto, pero rara vez se utilizan como codificadores en contextos multimodales.

  • Por primera vez, modelos tabulares de última generación evaluados como codificadores en tareas multimodales
  • MLP simple es el estándar de facto en muchos estudios, pero lejos de ser óptimo
  • Los modelos de In-Context Learning se encuentran entre los mejores para datos tabulares

¿Qué problema crean los modelos mejores?

El desafío principal es que los mejores modelos tabulares, especialmente aquellos basados en In-Context Learning, requieren conocer la variable objetivo (etiqueta) para procesar correctamente un ejemplo. Esto crea una paradoja práctica: ¿cómo codificar ejemplos de entrenamiento (que tienen etiquetas durante el entrenamiento) y ejemplos de prueba (que no tienen etiquetas) de la misma manera?

Los modelos de In-Context Learning funcionan observando algunos ejemplos etiquetados para entender la tarea. Cuando aplicas tal modelo como un codificador para pares imagen-tabla, surge una desajuste. Durante el entrenamiento, el modelo ve etiquetas; durante la prueba, no. Los autores del estudio desarrollaron métodos para resolver este problema, adaptando varias familias de modelos de In-Context Learning para que funcionen consistentemente tanto durante el entrenamiento como durante la prueba.

Lo que significa para los ingenieros

La investigación enfatiza que la elección del codificador es a menudo un factor crítico subestimado en el aprendizaje multimodal. Usar modelos tabulares más potentes en lugar de un MLP simple puede mejorar significativamente la calidad de todo el sistema.

Esto es importante para aplicaciones del mundo real donde los datos tabulares a menudo se combinan con otras modalidades: datos del cliente en una tabla + foto de producto en comercio electrónico, tabla de parámetros de dispositivo + visualización de estado en industria, tabla de pacientes + escaneo médicos en sanitario.

Lo que significa

Los resultados muestran que los datos tabulares se vuelven más competitivos en sistemas multimodales con la elección correcta del codificador. Los ingenieros de ML pueden lograr mejores resultados si dejan de economizar en la calidad de la parte tabular de la arquitectura. Esto es especialmente relevante en aplicaciones donde las tablas y la información tabular son críticas: fintech, medicina, logística, finanzas. La investigación abre el camino hacia un diseño de modelo multimodal más reflexivo.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…