arXiv cs.CL→ original

TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год

TriAgent — многоагентный комитет для анализа финансовых настроений: запросы распределяются между тремя уровнями — словарь VADER, трансформер FinBERT и LLM Qwen2.5. Индекс расхождения SDI решает, кому отдать запрос, и дорогой LLM подключается только к спорным случаям. На масштабе 10 млн пользователей это экономит $9,3 млн в год против базы на GPT-4o-mini.

Processado por IA de arXiv cs.CL; editado por Hamidun News
TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Como é montado o comitê do TriAgent

O TriAgent distribui as consultas entre três níveis de "visão" do texto, cada um mais caro que o anterior. Os níveis baratos resolvem a maioria dos casos simples, e o LLM caro só entra em ação nos casos controversos. A ideia se baseia em uma armadilha estrutural de custos: a maioria das consultas é classificada de forma trivial, mas o reasoner em nuvem processa todas elas, e a conta cresce linearmente com o número de usuários.

  • Léxico VADER — análise no nível de palavras individuais
  • Transformer FinBERT — análise no nível de frase
  • Qwen2.5 (de 0.5B a 14B, 4 bits) como reasoner sobre várias frases, com verificações cruzadas do Mistral-7B e do Phi-3.5-mini
  • O Índice de Divergência Semântica (SDI) mede o quanto os níveis divergem e decide para quem enviar a consulta
  • Economia — US$ 9,3 milhões por ano com 10 milhões de usuários em comparação com o GPT-4o-mini
"A maioria das consultas é classificada de forma trivial, mas os caros

reasoners em nuvem processam todas elas" — do resumo do trabalho no arXiv.

O que é o "critic plateau"

A principal conclusão do trabalho é o "platô do crítico" (critic plateau): quando aos LLMs é atribuído o papel de crítico sobre as saídas de agentes menores, a métrica F1 atinge um platô em torno de 0.87 para os modelos Qwen de 1.5B a 7B (os intervalos de confiança se sobrepõem). Em comparação, a votação de três "personas" do mesmo tamanho gera apenas F1=0.66.

Segundo os autores, a diferença se explica pela diversidade dada pela granularidade diferente da análise: os três níveis "enxergam" o texto de formas diferentes, e isso se mostra mais útil do que três modelos idênticos com papéis diferentes.

Três achados secundários do SDI

A partir do mesmo sinal do SDI, os autores derivam três consequências adicionais. Um vocabulário de consenso compartilhado sobre um sentence-BERT multilíngue responde a 95% das consultas em chinês a partir de um cache em inglês com F1=0.99 — ou seja, transfere a rotulagem entre idiomas quase sem custo adicional.

O SDI também funciona como detector de alucinações de LLM a posteriori, com AUC=0.90. E em um backtest com 20 tickers, uma estratégia baseada no SDI apresentou o melhor retorno ajustado ao risco: Sharpe 3.50 contra 1.36 da estratégia "sempre FinBERT" e 0.11 da estratégia "sempre LLM".

O que isso significa

O TriAgent mostra uma receita prática: não fazer cada consulta passar por um modelo caro, e sim roteá-la conforme a complexidade. Para um ambiente de produção com milhões de usuários, essa é a diferença entre uma conta que cresce linearmente e uma economia de milhões de dólares — sem perda de qualidade. Os autores disponibilizaram o código, os léxicos e o vocabulário de consenso em acesso aberto.

Perguntas frequentes

Quanto o TriAgent economiza?

Segundo os cálculos dos autores, com 10 milhões de usuários o sistema economiza US$ 9,3 milhões por ano em comparação com uma base no GPT-4o-mini — graças ao fato de que o LLM caro só é acionado para consultas controversas.

O que é o índice SDI?

O Semantic Divergence Index (SDI) é uma métrica de divergência par a par entre os três níveis de análise (palavra, frase, várias frases). Ele roteia as consultas e também serve como detector de alucinações de LLM com precisão AUC=0.90.

Quais modelos o TriAgent usa?

O léxico VADER, o transformer FinBERT e o reasoner Qwen2.5 (0.5B–14B em 4 bits), com verificações cruzadas do Mistral-7B e do Phi-3.5-mini.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…