arXiv cs.AI→ original

PEARL: как модель на 4B обошла DeepSeek-V3.2 685B в моделировании оптимизации

Исследователи показали PEARL — систему, которая превращает задачу оптимизации из обычного текста в математическую модель и код для солвера, а затем правит ошибки в цикле «реши-отладь-перепиши». Её компактная версия PEARL-Qwen3-4B на 4 млрд параметров обошла DeepSeek-V3.2 на 685 млрд параметров по точности моделирования оптимизации.

Processado por IA de arXiv cs.AI; editado por Hamidun News
PEARL: как модель на 4B обошла DeepSeek-V3.2 685B в моделировании оптимизации
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

PEARL: como um modelo de 4B superou o DeepSeek-V3.2 de 685B na modelagem de otimização

Pesquisadores apresentaram o PEARL — um sistema que transforma um problema de otimização descrito em linguagem comum em um modelo matemático e código funcional para um solver, verificando e corrigindo a solução em um ciclo. Sua versão compacta, o PEARL-Qwen3-4B, com 4 bilhões de parâmetros, superou em precisão o modelo DeepSeek-V3.2, de 685 bilhões de parâmetros, em tarefas de modelagem de otimização; o trabalho foi publicado no arXiv em julho de 2026.

O que é o PEARL e como ele funciona

O PEARL é um sistema de modelagem de otimização interativa que executa Python e solvers matemáticos diretamente dentro do ciclo de resolução, em vez de entregar uma formulação de uma só vez. A maioria das abordagens anteriores baseadas em grandes modelos de linguagem funcionava em modo one-shot: o modelo construía a formulação uma única vez e não a verificava executando-a, não observava a resposta do solver nem corrigia erros de forma iterativa.

O PEARL reproduz como a otimização é resolvida na realidade — por meio de ciclos repetidos de "resolver — depurar — reescrever". O próprio sistema aprende quando testar um modelo parcial, como reescrevê-lo com base no diagnóstico do solver e quando é hora de parar.

  • Opera em modo multi-turn com integração de ferramentas — Python e solvers são chamados ao longo do processo
  • Usa resultados intermediários da execução, sinais de viabilidade da solução e verificações de correção antes de finalizar
  • Aprende três coisas: quando testar, como revisar com base no diagnóstico, quando parar
  • O PEARL-Qwen3-4B (4 bilhões de parâmetros) superou o DeepSeek-V3.2 (685 bilhões) na precisão média macro e micro
  • Eleva sensivelmente a proporção de tarefas resolvidas de forma verificada em relação às linhas de base one-shot e com ferramentas

Por que um modelo de 4B superou um gigante de 685B

O PEARL-Qwen3-4B superou o DeepSeek-V3.2-685B porque aprende não apenas a formular o problema, mas a depurá-lo a partir dos sinais do solver — o que se mostra mais valioso do que o tamanho bruto do modelo. A diferença de parâmetros entre eles é de aproximadamente 171 vezes, mas nas tarefas de modelagem de otimização o que decide não é o volume de pesos, e sim a capacidade de executar a solução, identificar um erro e reescrever o código.

A métrica-chave do trabalho é o verified solve rate, ou seja, a proporção de tarefas em que a solução final realmente passou pela verificação do solver, e não apenas parecia plausível. Nesse indicador, o PEARL supera tanto os modelos one-shot comuns quanto as abordagens com acesso a ferramentas que não têm uma estratégia de reparo treinável.

"Nosso modelo PEARL-Qwen3-4B supera o

DeepSeek-V3.2-685B, significativamente maior, tanto na precisão média macro quanto na micro em tarefas de modelagem de otimização", afirma o resumo do trabalho no arXiv.

O que isso significa

O resultado do PEARL é mais um argumento a favor da ideia de que, para tarefas aplicadas com resultado verificável, um ciclo treinável de "ação — feedback — correção" supera a simples escala. Um modelo pequeno com acesso a um solver e uma estratégia de autoverificação resolve mais tarefas de otimização do que um modelo 171 vezes maior que trabalha em uma única tentativa.

Perguntas frequentes

O que é modelagem de otimização?

É a tradução de um problema real de tomada de decisão, descrito em linguagem comum, para uma formulação matemática formal e um código executável para um solver. Por exemplo, alocação de recursos ou logística — o solver gera a solução ótima como saída.

Em que o PEARL se diferencia das abordagens comuns de LLM?

As abordagens comuns funcionam em modo one-shot: o modelo constrói a formulação uma única vez, sem executá-la e sem correções. O PEARL executa Python e solvers em ciclo, lê o diagnóstico, corrige o modelo e o código, e decide sozinho quando parar.

Quanto o PEARL-Qwen3-4B é menor que o DeepSeek-V3.2?

O PEARL-Qwen3-4B tem 4 bilhões de parâmetros, contra 685 bilhões do DeepSeek-V3.2 — cerca de 171 vezes menor, mas ainda assim mais preciso em tarefas de modelagem de otimização.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…