TriAgent: комитет мелких моделей вместо дорогого LLM экономит $9,3 млн в год
TriAgent — многоагентный комитет для анализа финансовых настроений: запросы распределяются между тремя уровнями — словарь VADER, трансформер FinBERT и LLM Qwen2.5. Индекс расхождения SDI решает, кому отдать запрос, и дорогой LLM подключается только к спорным случаям. На масштабе 10 млн пользователей это экономит $9,3 млн в год против базы на GPT-4o-mini.
Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
Comment est construit le comité de TriAgent
TriAgent répartit les requêtes entre trois niveaux de « vision » du texte, chacun plus coûteux que le précédent. Les niveaux bon marché traitent la plupart des cas simples, et le LLM coûteux n'intervient que sur les cas litigieux. L'idée repose sur un piège structurel de coûts : la plupart des requêtes sont classées de façon triviale, mais le reasoner cloud les traite toutes, et la facture augmente linéairement avec le nombre d'utilisateurs.
- Lexique VADER — analyse au niveau du mot
- Transformeur FinBERT — analyse au niveau de la phrase
- Qwen2.5 (de 0.5B à 14B, en 4 bits) comme reasoner sur plusieurs phrases, avec des vérifications croisées par Mistral-7B et Phi-3.5-mini
- L'indice de divergence sémantique (SDI) mesure à quel point les niveaux divergent et décide à qui confier la requête
- Économies — 9,3 millions de dollars par an pour 10 millions d'utilisateurs, par rapport à GPT-4o-mini
«
La plupart des requêtes sont classées de façon triviale, pourtant les coûteux reasoners cloud les traitent toutes » — extrait du résumé de l'article sur arXiv.
Qu'est-ce que le « critic plateau »
La principale conclusion de l'article est le « plateau du critique » (critic plateau) : lorsque le rôle de critique des sorties d'agents plus petits est confié à des LLM, la métrique F1 atteint un plateau autour de 0.87 pour les modèles Qwen de 1.5B à 7B (les intervalles de confiance se chevauchent). En comparaison, le vote de trois « personas » de même taille ne donne qu'un F1 = 0.66.
Selon les auteurs, la différence s'explique par la diversité apportée par la granularité différente de l'analyse : les trois niveaux « voient » le texte différemment, ce qui s'avère plus utile que trois modèles identiques dotés de rôles différents.
Trois résultats secondaires du SDI
À partir du même signal SDI, les auteurs tirent trois conséquences supplémentaires. Un vocabulaire de consensus commun, construit sur un sentence-BERT multilingue, répond à 95 % des requêtes en chinois à partir d'un cache en anglais avec un F1 = 0.99 — c'est-à-dire qu'il transfère l'étiquetage entre langues à un coût supplémentaire quasi nul.
Le SDI fonctionne également comme détecteur d'hallucinations des LLM a posteriori, avec une AUC = 0.90. Et dans un backtest portant sur 20 titres, une stratégie basée sur le SDI a donné un meilleur rendement ajusté au risque : Sharpe 3.50 contre 1.36 pour la stratégie « toujours FinBERT » et 0.11 pour « toujours LLM ».
Ce que cela signifie
TriAgent illustre une recette pratique : ne pas faire passer chaque requête par un modèle coûteux, mais l'orienter selon sa complexité. Pour une production comptant des millions d'utilisateurs, c'est la différence entre une facture qui croît linéairement et des économies de plusieurs millions de dollars — sans perte de qualité. Les auteurs ont mis le code, les lexiques et le vocabulaire de consensus en libre accès.
Questions fréquentes
Combien TriAgent économise-t-il ?
Selon les calculs des auteurs, avec 10 millions d'utilisateurs, le système économise 9,3 millions de dollars par an par rapport à une base sur GPT-4o-mini — grâce au fait que le LLM coûteux n'est sollicité que pour les requêtes litigieuses.
Qu'est-ce que l'indice SDI ?
Le Semantic Divergence Index (SDI) est une métrique de divergence par paires entre les trois niveaux d'analyse (mot, phrase, plusieurs phrases). Il oriente les requêtes et sert également de détecteur d'hallucinations des LLM avec une précision AUC = 0.90.
Quels modèles utilise TriAgent ?
Le lexique VADER, le transformeur FinBERT et le reasoner Qwen2.5 (0.5B–14B en 4 bits), avec des vérifications croisées par Mistral-7B et Phi-3.5-mini.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.