arXiv cs.LG→ original

Dados tabulares e imagens: por que a escolha do codificador é crítica

Pesquisadores do arXiv testaram pela primeira vez modelos tabulares como codificadores no processamento conjunto de tabelas e imagens. Descobriu-se que a escolha do codificador é um fator crítico para a qualidade. O principal problema: os melhores modelos tabulares (In-Context Learning) exigem rótulos para processar exemplos, criando complexidade ao codificar dados de treinamento e teste identicamente. Os autores resolveram esse problema e enfatizaram a importância da seleção do codificador em sistemas multimodais.

Processado por IA de arXiv cs.LG; editado por Hamidun News
Dados tabulares e imagens: por que a escolha do codificador é crítica
Fonte: arXiv cs.LG. Colagem: Hamidun News.
◐ Ouvir artigo

Os pesquisadores avaliaram sistematicamente pela primeira vez modelos tabulares como codificadores em tarefas de aprendizagem multimodal, onde uma rede neural deve entender simultaneamente tabelas e imagens. A abordagem tradicional — usar um MLP simples para tabelas — provou ser subótima.

Por que o MLP é insuficiente para dados tabulares?

O aprendizagem multimodal requer um codificador separado para cada tipo de dado. Se um modelo trabalha com imagens e tabelas simultaneamente, precisa de redes especializadas para processar cada uma. Para imagens, CNNs poderosos ou Vision Transformers têm sido usados há muito tempo; para texto — modelos de linguagem. Mas para dados tabulares, a maioria dos pesquisadores simplesmente usou um MLP simples.

Dados tabulares (tabelas de banco de dados, arquivos CSV, planilhas) é uma área problemática conhecida para aprendizado profundo. É chamado "a última fechadura não resolvida do aprendizado de máquina". Existem melhores modelos para trabalhar com tabelas — por exemplo, arquiteturas especializadas baseadas em atenção e aprendizagem em contexto, mas raramente são usadas como codificadores em contextos multimodais.

  • Pela primeira vez, modelos tabulares de última geração avaliados como codificadores em tarefas multimodais
  • MLP simples é o padrão de fato em muitos estudos, mas longe de ser ideal
  • Modelos de In-Context Learning estão entre os melhores para dados tabulares

Que problema os melhores modelos criam?

O principal desafio é que os melhores modelos tabulares, especialmente aqueles baseados em In-Context Learning, exigem conhecer a variável de destino (rótulo) para processar corretamente um exemplo. Isso cria um paradoxo prático: como codificar exemplos de treinamento (que têm rótulos durante treinamento) e exemplos de teste (que não têm rótulos) da mesma forma?

Os modelos de In-Context Learning funcionam observando alguns exemplos rotulados para entender a tarefa. Quando você aplica tal modelo como um codificador para pares imagem-tabela, surge uma incompatibilidade. Durante o treinamento, o modelo vê rótulos; durante testes, não. Os autores do estudo desenvolveram métodos para resolver esse problema, adaptando várias famílias de modelos de In-Context Learning para que funcionem consistentemente tanto durante treinamento quanto durante testes.

O que isso significa para os engenheiros

A pesquisa enfatiza que a escolha do codificador é frequentemente um fator crítico subestimado em aprendizagem multimodal. Usar modelos tabulares mais poderosos em vez de um MLP simples pode melhorar significativamente a qualidade de todo o sistema.

Isso é importante para aplicações no mundo real, onde dados tabulares são frequentemente combinados com outras modalidades: dados do cliente em tabela + foto do produto em e-commerce, tabela de parâmetros do dispositivo + visualização de status na indústria, tabela do paciente + exames médicos em saúde.

O que isto significa

Os resultados mostram que dados tabulares se tornam mais competitivos em sistemas multimodais com a escolha correta do codificador. Engenheiros de ML podem alcançar melhores resultados se pararem de economizar na qualidade da parte tabular da arquitetura. Isso é especialmente relevante em aplicações onde tabelas e informações tabulares são críticas: fintech, medicina, logística, finanças. A pesquisa abre o caminho para um design de modelo multimodal mais reflexivo.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…