PEARL: как модель на 4B обошла DeepSeek-V3.2 685B в моделировании оптимизации
Исследователи показали PEARL — систему, которая превращает задачу оптимизации из обычного текста в математическую модель и код для солвера, а затем правит ошибки в цикле «реши-отладь-перепиши». Её компактная версия PEARL-Qwen3-4B на 4 млрд параметров обошла DeepSeek-V3.2 на 685 млрд параметров по точности моделирования оптимизации.
Processado por IA de arXiv cs.AI; editado por Hamidun News
PEARL: como um modelo de 4B superou o DeepSeek-V3.2 de 685B na modelagem de otimização
Pesquisadores apresentaram o PEARL — um sistema que transforma um problema de otimização descrito em linguagem comum em um modelo matemático e código funcional para um solver, verificando e corrigindo a solução em um ciclo. Sua versão compacta, o PEARL-Qwen3-4B, com 4 bilhões de parâmetros, superou em precisão o modelo DeepSeek-V3.2, de 685 bilhões de parâmetros, em tarefas de modelagem de otimização; o trabalho foi publicado no arXiv em julho de 2026.
O que é o PEARL e como ele funciona
O PEARL é um sistema de modelagem de otimização interativa que executa Python e solvers matemáticos diretamente dentro do ciclo de resolução, em vez de entregar uma formulação de uma só vez. A maioria das abordagens anteriores baseadas em grandes modelos de linguagem funcionava em modo one-shot: o modelo construía a formulação uma única vez e não a verificava executando-a, não observava a resposta do solver nem corrigia erros de forma iterativa.
O PEARL reproduz como a otimização é resolvida na realidade — por meio de ciclos repetidos de "resolver — depurar — reescrever". O próprio sistema aprende quando testar um modelo parcial, como reescrevê-lo com base no diagnóstico do solver e quando é hora de parar.
- Opera em modo multi-turn com integração de ferramentas — Python e solvers são chamados ao longo do processo
- Usa resultados intermediários da execução, sinais de viabilidade da solução e verificações de correção antes de finalizar
- Aprende três coisas: quando testar, como revisar com base no diagnóstico, quando parar
- O PEARL-Qwen3-4B (4 bilhões de parâmetros) superou o DeepSeek-V3.2 (685 bilhões) na precisão média macro e micro
- Eleva sensivelmente a proporção de tarefas resolvidas de forma verificada em relação às linhas de base one-shot e com ferramentas
Por que um modelo de 4B superou um gigante de 685B
O PEARL-Qwen3-4B superou o DeepSeek-V3.2-685B porque aprende não apenas a formular o problema, mas a depurá-lo a partir dos sinais do solver — o que se mostra mais valioso do que o tamanho bruto do modelo. A diferença de parâmetros entre eles é de aproximadamente 171 vezes, mas nas tarefas de modelagem de otimização o que decide não é o volume de pesos, e sim a capacidade de executar a solução, identificar um erro e reescrever o código.
A métrica-chave do trabalho é o verified solve rate, ou seja, a proporção de tarefas em que a solução final realmente passou pela verificação do solver, e não apenas parecia plausível. Nesse indicador, o PEARL supera tanto os modelos one-shot comuns quanto as abordagens com acesso a ferramentas que não têm uma estratégia de reparo treinável.
"Nosso modelo PEARL-Qwen3-4B supera o
DeepSeek-V3.2-685B, significativamente maior, tanto na precisão média macro quanto na micro em tarefas de modelagem de otimização", afirma o resumo do trabalho no arXiv.
O que isso significa
O resultado do PEARL é mais um argumento a favor da ideia de que, para tarefas aplicadas com resultado verificável, um ciclo treinável de "ação — feedback — correção" supera a simples escala. Um modelo pequeno com acesso a um solver e uma estratégia de autoverificação resolve mais tarefas de otimização do que um modelo 171 vezes maior que trabalha em uma única tentativa.
Perguntas frequentes
O que é modelagem de otimização?
É a tradução de um problema real de tomada de decisão, descrito em linguagem comum, para uma formulação matemática formal e um código executável para um solver. Por exemplo, alocação de recursos ou logística — o solver gera a solução ótima como saída.
Em que o PEARL se diferencia das abordagens comuns de LLM?
As abordagens comuns funcionam em modo one-shot: o modelo constrói a formulação uma única vez, sem executá-la e sem correções. O PEARL executa Python e solvers em ciclo, lê o diagnóstico, corrige o modelo e o código, e decide sozinho quando parar.
Quanto o PEARL-Qwen3-4B é menor que o DeepSeek-V3.2?
O PEARL-Qwen3-4B tem 4 bilhões de parâmetros, contra 685 bilhões do DeepSeek-V3.2 — cerca de 171 vezes menor, mas ainda assim mais preciso em tarefas de modelagem de otimização.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.