PEARL: как модель на 4B обошла DeepSeek-V3.2 685B в моделировании оптимизации
Исследователи показали PEARL — систему, которая превращает задачу оптимизации из обычного текста в математическую модель и код для солвера, а затем правит ошибки в цикле «реши-отладь-перепиши». Её компактная версия PEARL-Qwen3-4B на 4 млрд параметров обошла DeepSeek-V3.2 на 685 млрд параметров по точности моделирования оптимизации.
Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
PEARL : comment un modèle de 4B a battu les 685B de DeepSeek-V3.2 en modélisation d'optimisation
Des chercheurs ont présenté PEARL, un système qui transforme un problème d'optimisation décrit en langage courant en un modèle mathématique et un code fonctionnel pour un solveur, en vérifiant et en corrigeant la solution dans une boucle. Sa version compacte, PEARL-Qwen3-4B, avec 4 milliards de paramètres, a surpassé en précision le modèle DeepSeek-V3.2, fort de 685 milliards de paramètres, sur des tâches de modélisation d'optimisation ; les travaux ont été publiés sur arXiv en juillet 2026.
Qu'est-ce que PEARL et comment fonctionne-t-il
PEARL est un système de modélisation d'optimisation interactive qui exécute Python et des solveurs mathématiques directement à l'intérieur de la boucle de résolution, plutôt que de produire une formulation en une seule fois. La plupart des approches antérieures fondées sur de grands modèles de langage fonctionnaient en mode one-shot : le modèle construisait la formulation une seule fois, sans la vérifier en l'exécutant, sans examiner la réponse du solveur et sans corriger les erreurs de manière itérative.
PEARL reproduit la façon dont l'optimisation est résolue dans la réalité — par des cycles répétés « résoudre — déboguer — réécrire ». Le système apprend lui-même quand tester un modèle partiel, comment le réécrire en fonction du diagnostic du solveur, et quand il est temps de s'arrêter.
- Fonctionne en mode multi-tours avec intégration d'outils — Python et les solveurs sont appelés au fil du processus
- Utilise les résultats intermédiaires d'exécution, les signaux de faisabilité de la solution et les vérifications de correction avant la finalisation
- Apprend trois choses : quand tester, comment réviser à partir du diagnostic, quand s'arrêter
- PEARL-Qwen3-4B (4 milliards de paramètres) a surpassé DeepSeek-V3.2 (685 milliards) en précision moyenne macro et micro
- Augmente nettement la proportion de tâches résolues de manière vérifiée par rapport aux références one-shot et avec outils
Pourquoi un modèle de 4B a battu un géant de 685B
PEARL-Qwen3-4B a surpassé DeepSeek-V3.2-685B parce qu'il apprend non seulement à formuler le problème, mais aussi à le déboguer à partir des signaux du solveur — ce qui s'avère plus précieux que la taille brute du modèle. L'écart de paramètres entre les deux est d'environ 171 fois, mais sur les tâches de modélisation d'optimisation, ce qui compte n'est pas le volume de poids mais la capacité à exécuter la solution, à repérer une erreur et à réécrire le code.
La métrique clé des travaux est le verified solve rate, c'est-à-dire la proportion de tâches où la solution finale a réellement passé la vérification du solveur, et non simplement semblé plausible. Sur cet indicateur, PEARL surpasse à la fois les modèles one-shot classiques et les approches avec accès à des outils dépourvues de stratégie de réparation entraînable.
«
Notre modèle PEARL-Qwen3-4B surpasse le DeepSeek-V3.2-685B, nettement plus grand, à la fois en précision moyenne macro et micro sur des tâches de modélisation d'optimisation », indique le résumé des travaux sur arXiv.
Ce que cela signifie
Le résultat de PEARL constitue un argument de plus en faveur de l'idée que, pour des tâches appliquées à résultat vérifiable, une boucle entraînable « action — retour — correction » l'emporte sur la simple mise à l'échelle. Un petit modèle disposant d'un accès à un solveur et d'une stratégie d'autovérification résout davantage de tâches d'optimisation qu'un modèle 171 fois plus grand travaillant en une seule passe.
Questions fréquentes
Qu'est-ce que la modélisation d'optimisation ?
C'est la traduction d'un problème réel de prise de décision, décrit en langage courant, en une formulation mathématique formelle et un code exécutable pour un solveur. Par exemple, l'allocation de ressources ou la logistique — en sortie, le solveur produit la solution optimale.
En quoi PEARL diffère-t-il des approches LLM classiques ?
Les approches classiques fonctionnent en one-shot : le modèle construit la formulation une seule fois, sans exécution et sans corrections. PEARL exécute Python et des solveurs en boucle, lit le diagnostic, corrige le modèle et le code, et décide lui-même quand s'arrêter.
De combien PEARL-Qwen3-4B est-il plus petit que
DeepSeek-V3.2 ?
PEARL-Qwen3-4B compte 4 milliards de paramètres contre 685 milliards pour DeepSeek-V3.2 — soit environ 171 fois moins, tout en étant plus précis sur les tâches de modélisation d'optimisation.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.