arXiv cs.AI→ оригинал

PEARL: как модель на 4B обошла DeepSeek-V3.2 685B в моделировании оптимизации

Исследователи показали PEARL — систему, которая превращает задачу оптимизации из обычного текста в математическую модель и код для солвера, а затем правит ошибки в цикле «реши-отладь-перепиши». Её компактная версия PEARL-Qwen3-4B на 4 млрд параметров обошла DeepSeek-V3.2 на 685 млрд параметров по точности моделирования оптимизации.

AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
PEARL: как модель на 4B обошла DeepSeek-V3.2 685B в моделировании оптимизации
Источник: arXiv cs.AI. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи представили PEARL — систему, которая превращает описанную обычными словами задачу оптимизации в математическую модель и рабочий код для солвера, проверяя и исправляя решение в цикле. Её компактная версия PEARL-Qwen3-4B на 4 млрд параметров обошла модель DeepSeek-V3.2 на 685 млрд параметров по точности на задачах моделирования оптимизации; работа опубликована на arXiv в июле 2026 года.

Что такое PEARL и как он работает

PEARL — это система интерактивного моделирования оптимизации, которая запускает Python и математические солверы прямо внутри цикла решения, а не выдаёт формулировку одним махом. Большинство прежних подходов на больших языковых моделях работали в режиме one-shot: модель один раз строила формулировку и не проверяла её запуском, не смотрела на отклик солвера и не исправляла ошибки итеративно.

PEARL повторяет то, как оптимизацию решают в реальности — через повторяющиеся циклы «реши — отладь — перепиши». Система сама учится, когда протестировать частичную модель, как переписать её по диагностике солвера и когда пора остановиться.

  • Работает в multi-turn режиме с интеграцией инструментов — Python и солверы вызываются по ходу
  • Использует промежуточные результаты запуска, сигналы о допустимости решения и проверки корректности до финализации
  • Учится трём вещам: когда тестировать, как ревизить по диагностике, когда остановиться
  • PEARL-Qwen3-4B (4 млрд параметров) обошла DeepSeek-V3.2 (685 млрд) по macro- и micro-усреднённой точности
  • Заметно поднимает долю верифицированно решённых задач над one-shot и tool-augmented базлайнами

Почему модель на 4B обошла гиганта на 685B

PEARL-Qwen3-4B превзошла DeepSeek-V3.2-685B потому, что учится не просто формулировать задачу, а отлаживать её по сигналам солвера — а это ценнее, чем сырой размер модели. Разрыв в параметрах между ними — примерно 171-кратный, но на задачах моделирования оптимизации решает не объём весов, а способность прогнать решение, увидеть ошибку и переписать код.

Ключевая метрика работы — verified solve rate, то есть доля задач, где итоговое решение реально прошло проверку солвером, а не просто выглядело правдоподобно. По этому показателю PEARL обходит и обычные one-shot модели, и подходы с доступом к инструментам без обучаемой стратегии ремонта.

«Наша модель PEARL-Qwen3-4B превосходит значительно более крупную

DeepSeek-V3.2-685B и по macro-, и по micro-усреднённой точности на задачах моделирования оптимизации», — говорится в аннотации работы на arXiv.

Что это значит

Результат PEARL — ещё один аргумент в пользу того, что для прикладных задач с проверяемым результатом обучаемый цикл «действие — обратная связь — правка» бьёт голое масштабирование. Маленькая модель с доступом к солверу и стратегией самопроверки решает больше задач оптимизации, чем модель в 171 раз крупнее, работающая с одного захода.

Частые вопросы

Что такое моделирование оптимизации?

Это перевод реальной задачи о принятии решений, описанной обычным языком, в формальную математическую постановку и исполняемый код для солвера. Например, распределение ресурсов или логистики — на выходе солвер выдаёт оптимальное решение.

Чем PEARL отличается от обычных LLM-подходов?

Обычные подходы работают one-shot: модель строит формулировку один раз, без запуска и без правок. PEARL запускает Python и солверы в цикле, читает диагностику, исправляет модель и код и сам решает, когда остановиться.

Насколько PEARL-Qwen3-4B меньше DeepSeek-V3.2?

PEARL-Qwen3-4B имеет 4 млрд параметров против 685 млрд у DeepSeek-V3.2 — примерно в 171 раз меньше, но при этом точнее на задачах моделирования оптимизации.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…