TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год
TriAgent — многоагентный комитет для анализа финансовых настроений: запросы распределяются между тремя уровнями — словарь VADER, трансформер FinBERT и LLM Qwen2.5. Индекс расхождения SDI решает, кому отдать запрос, и дорогой LLM подключается только к спорным случаям. На масштабе 10 млн пользователей это экономит $9,3 млн в год против базы на GPT-4o-mini.
Processado por IA de arXiv cs.CL; editado por Hamidun News
Como é montado o comitê do TriAgent
O TriAgent distribui as consultas entre três níveis de "visão" do texto, cada um mais caro que o anterior. Os níveis baratos resolvem a maioria dos casos simples, e o LLM caro só entra em ação nos casos controversos. A ideia se baseia em uma armadilha estrutural de custos: a maioria das consultas é classificada de forma trivial, mas o reasoner em nuvem processa todas elas, e a conta cresce linearmente com o número de usuários.
- Léxico VADER — análise no nível de palavras individuais
- Transformer FinBERT — análise no nível de frase
- Qwen2.5 (de 0.5B a 14B, 4 bits) como reasoner sobre várias frases, com verificações cruzadas do Mistral-7B e do Phi-3.5-mini
- O Índice de Divergência Semântica (SDI) mede o quanto os níveis divergem e decide para quem enviar a consulta
- Economia — US$ 9,3 milhões por ano com 10 milhões de usuários em comparação com o GPT-4o-mini
"A maioria das consultas é classificada de forma trivial, mas os caros
reasoners em nuvem processam todas elas" — do resumo do trabalho no arXiv.
O que é o "critic plateau"
A principal conclusão do trabalho é o "platô do crítico" (critic plateau): quando aos LLMs é atribuído o papel de crítico sobre as saídas de agentes menores, a métrica F1 atinge um platô em torno de 0.87 para os modelos Qwen de 1.5B a 7B (os intervalos de confiança se sobrepõem). Em comparação, a votação de três "personas" do mesmo tamanho gera apenas F1=0.66.
Segundo os autores, a diferença se explica pela diversidade dada pela granularidade diferente da análise: os três níveis "enxergam" o texto de formas diferentes, e isso se mostra mais útil do que três modelos idênticos com papéis diferentes.
Três achados secundários do SDI
A partir do mesmo sinal do SDI, os autores derivam três consequências adicionais. Um vocabulário de consenso compartilhado sobre um sentence-BERT multilíngue responde a 95% das consultas em chinês a partir de um cache em inglês com F1=0.99 — ou seja, transfere a rotulagem entre idiomas quase sem custo adicional.
O SDI também funciona como detector de alucinações de LLM a posteriori, com AUC=0.90. E em um backtest com 20 tickers, uma estratégia baseada no SDI apresentou o melhor retorno ajustado ao risco: Sharpe 3.50 contra 1.36 da estratégia "sempre FinBERT" e 0.11 da estratégia "sempre LLM".
O que isso significa
O TriAgent mostra uma receita prática: não fazer cada consulta passar por um modelo caro, e sim roteá-la conforme a complexidade. Para um ambiente de produção com milhões de usuários, essa é a diferença entre uma conta que cresce linearmente e uma economia de milhões de dólares — sem perda de qualidade. Os autores disponibilizaram o código, os léxicos e o vocabulário de consenso em acesso aberto.
Perguntas frequentes
Quanto o TriAgent economiza?
Segundo os cálculos dos autores, com 10 milhões de usuários o sistema economiza US$ 9,3 milhões por ano em comparação com uma base no GPT-4o-mini — graças ao fato de que o LLM caro só é acionado para consultas controversas.
O que é o índice SDI?
O Semantic Divergence Index (SDI) é uma métrica de divergência par a par entre os três níveis de análise (palavra, frase, várias frases). Ele roteia as consultas e também serve como detector de alucinações de LLM com precisão AUC=0.90.
Quais modelos o TriAgent usa?
O léxico VADER, o transformer FinBERT e o reasoner Qwen2.5 (0.5B–14B em 4 bits), com verificações cruzadas do Mistral-7B e do Phi-3.5-mini.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.