arXiv cs.CL→ original

TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год

TriAgent — многоагентный комитет для анализа финансовых настроений: запросы распределяются между тремя уровнями — словарь VADER, трансформер FinBERT и LLM Qwen2.5. Индекс расхождения SDI решает, кому отдать запрос, и дорогой LLM подключается только к спорным случаям. На масштабе 10 млн пользователей это экономит $9,3 млн в год против базы на GPT-4o-mini.

Procesado por IA desde arXiv cs.CL; editado por Hamidun News
TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год
Fuente: arXiv cs.CL. Collage: Hamidun News.
◐ Escuchar artículo

Cómo está construido el comité de TriAgent

TriAgent distribuye las consultas entre tres niveles de "visión" del texto, cada uno más caro que el anterior. Los niveles baratos cubren la mayoría de los casos simples, y el LLM caro solo entra en acción con los casos discutibles. La idea se basa en una trampa estructural de costos: la mayoría de las consultas se clasifican de forma trivial, pero el reasoner en la nube las procesa todas, y la factura crece linealmente con el número de usuarios.

  • Léxico VADER: análisis a nivel de palabra individual
  • Transformador FinBERT: análisis a nivel de oración
  • Qwen2.5 (de 0.5B a 14B, 4 bits) como reasoner sobre varias oraciones, con verificaciones cruzadas de Mistral-7B y Phi-3.5-mini
  • El Índice de Divergencia Semántica (SDI) mide cuánto difieren los niveles entre sí y decide a quién enviar la consulta
  • Ahorro: $9,3 millones al año con 10 millones de usuarios frente a GPT-4o-mini
«La mayoría de las consultas se clasifican de forma trivial, pero los

costosos reasoners en la nube las procesan todas» — del resumen del trabajo en arXiv.

Qué es el "critic plateau"

La principal conclusión del trabajo es la "meseta del crítico" (critic plateau): cuando a los LLM se les asigna el rol de crítico sobre las salidas de agentes más pequeños, la métrica F1 alcanza una meseta de alrededor de 0.87 para los modelos Qwen de 1.5B a 7B (los intervalos de confianza se superponen). En comparación, la votación de tres "personas" del mismo tamaño solo da F1=0.66.

Según los autores, la diferencia se explica por la diversidad que aporta la distinta granularidad del análisis: los tres niveles "ven" el texto de forma diferente, y eso resulta más útil que tres modelos idénticos con roles distintos.

Tres hallazgos secundarios del SDI

De la misma señal del SDI, los autores derivan tres consecuencias adicionales. Un vocabulario de consenso compartido sobre un sentence-BERT multilingüe responde al 95% de las consultas en chino a partir de una caché en inglés con F1=0.99, es decir, transfiere el etiquetado entre idiomas casi sin costo adicional.

El SDI también funciona como detector de alucinaciones de LLM a posteriori, con AUC=0.90. Y en un backtest sobre 20 tickers, una estrategia basada en SDI dio un mejor retorno ajustado al riesgo: Sharpe 3.50 frente a 1.36 de la estrategia "siempre FinBERT" y 0.11 de "siempre LLM".

Qué significa esto

TriAgent muestra una receta práctica: no hacer pasar cada consulta por un modelo caro, sino enrutarla según su complejidad. Para un entorno de producción con millones de usuarios, esto marca la diferencia entre una factura que crece linealmente y un ahorro de millones de dólares, sin perder calidad. Los autores publicaron el código, los léxicos y el vocabulario de consenso en acceso abierto.

Preguntas frecuentes

¿Cuánto ahorra TriAgent?

Según los cálculos de los autores, con 10 millones de usuarios el sistema ahorra $9,3 millones al año en comparación con una base sobre GPT-4o-mini, gracias a que el LLM caro solo se activa para las consultas discutibles.

¿Qué es el índice SDI?

El Índice de Divergencia Semántica (SDI) es una métrica de divergencia por pares entre los tres niveles de análisis (palabra, oración, varias oraciones). Enruta las consultas y, además, sirve como detector de alucinaciones de LLM con una precisión AUC=0.90.

¿Qué modelos usa TriAgent?

El léxico VADER, el transformador FinBERT y el reasoner Qwen2.5 (0.5B–14B en 4 bits), con verificaciones cruzadas de Mistral-7B y Phi-3.5-mini.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…