Données tabulaires et images : pourquoi le choix de l'encodeur est critique
Des chercheurs d'arXiv ont pour la première fois testé des modèles tabulaires comme encodeurs lors du traitement conjointe de tableaux et d'images. Il s'avère que le choix de l'encodeur est un facteur critique pour la qualité. Le problème principal : les meilleurs modèles tabulaires (In-Context Learning) nécessitent des étiquettes pour traiter les exemples, créant une complexité lors du codage identique des données d'entraînement et de test. Les auteurs ont résolu ce problème et ont souligné l'importance de la sélection de l'encodeur dans les systèmes multimodaux.
Traité par IA depuis arXiv cs.LG ; édité par Hamidun News
Les chercheurs ont évalué systématiquement pour la première fois les modèles tabulaires comme encodeurs dans les tâches d'apprentissage multimodal, où un réseau de neurones doit comprendre simultanément les tableaux et les images. L'approche traditionnelle — utiliser un simple MLP pour les tableaux — s'est avérée être sous-optimale.
Pourquoi le MLP est-il insuffisant pour les données tabulaires?
L'apprentissage multimodal nécessite un encodeur séparé pour chaque type de données. Si un modèle travaille avec des images et des tableaux simultanément, il a besoin de réseaux spécialisés pour traiter chacun. Pour les images, des CNN puissants ou des Vision Transformers sont utilisés depuis longtemps; pour le texte — des modèles de langage. Mais pour les données tabulaires, la plupart des chercheurs ont simplement pris un MLP simple.
Les données tabulaires (tables de bases de données, fichiers CSV, feuilles de calcul) sont un domaine connu problématique pour l'apprentissage profond. C'est appelé "le dernier cadenas non résolu de l'apprentissage automatique". Il existe de meilleurs modèles pour travailler avec les tableaux — par exemple, des architectures spécialisées basées sur l'attention et l'apprentissage en contexte, mais elles sont rarement utilisées comme encodeurs dans des contextes multimodaux.
- Pour la première fois, les modèles tabulaires de pointe ont été évalués comme encodeurs dans les tâches multimodales
- Le MLP simple est la norme de facto dans de nombreuses études, mais loin d'être optimal
- Les modèles d'In-Context Learning se classent parmi les meilleurs pour les données tabulaires
Quel problème posent les meilleurs modèles?
Le principal défi est que les meilleurs modèles tabulaires, notamment ceux basés sur l'apprentissage en contexte, nécessitent de connaître la variable cible (l'étiquette) pour traiter correctement un exemple. Cela crée un paradoxe pratique: comment coder les exemples d'entraînement (qui ont des étiquettes pendant l'entraînement) et les exemples de test (qui n'ont pas d'étiquettes) de la même manière?
Les modèles d'In-Context Learning fonctionnent en regardant quelques exemples étiquetés pour comprendre la tâche. Lorsque vous appliquez un tel modèle comme un encodeur pour les paires image-tableau, un décalage survient. Pendant l'entraînement, le modèle voit les étiquettes; pendant les tests, il ne les voit pas. Les auteurs de l'étude ont développé des méthodes pour résoudre ce problème, en adaptant plusieurs familles de modèles d'In-Context Learning pour qu'ils fonctionnent de manière cohérente à la fois pendant l'entraînement et les tests.
Ce que cela signifie pour les ingénieurs
La recherche souligne que le choix de l'encodeur est souvent un facteur critique sous-estimé dans l'apprentissage multimodal. L'utilisation de modèles tabulaires plus puissants au lieu d'un simple MLP peut améliorer considérablement la qualité de l'ensemble du système.
C'est important pour les applications réelles où les données tabulaires sont souvent combinées avec d'autres modalités: données client dans un tableau + photo de produit en e-commerce, tableau de paramètres de l'appareil + visualisation de l'état en industrie, tableau du patient + examens médicaux en santé.
Ce que cela signifie
Les résultats montrent que les données tabulaires deviennent plus compétitives dans les systèmes multimodaux avec le bon choix d'encodeur. Les ingénieurs ML peuvent obtenir de meilleurs résultats s'ils arrêtent d'économiser sur la qualité de la partie tabulaire de l'architecture. Ceci est particulièrement pertinent dans les applications où les tableaux et l'information tabulaire sont critiques: fintech, médecine, logistique, finance. La recherche ouvre la voie vers une conception plus réfléchie des modèles multimodaux.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.