NVIDIA взяла 100% на ARC-AGI-3: главным героем оказалась не модель, а обвязка
NVIDIA сообщила, что её агентная архитектура AVO достигла 100% на ARC-AGI-3 — интерактивном бенчмарке общего интеллекта, где ещё недавно лучшие результаты не дотягивали и до 40%. Главный вывод инженеров: решающим оказался не выбор модели, а harness — обвязка, которая управляет контекстом, инструментами, состоянием и восстановлением после ошибок.
AI-обработка оригинала NVIDIA Developer Blog; редакция Hamidun News
NVIDIA сообщила, что её агентная архитектура AVO достигла 100% на бенчмарке ARC-AGI-3, и назвала это демонстрацией «архитектуры общего назначения фронтирного уровня для длинных агентных задач». Подробности инженеры компании изложили в блоге NVIDIA Developer.
Что произошло
ARC-AGI-3 — третье поколение бенчмарка Франсуа Шолле на абстрактное рассуждение и один из самых упрямых тестов индустрии: в отличие от предшественников, это интерактивные игровые среды, где агент должен сам понять правила мира, экспериментируя с ним, — без инструкций и подсказок. Результаты фронтирных моделей здесь долго оставались скромными: ещё недавно заметным достижением считались цифры ниже 40%.
На этом фоне 100% от AVO — резкий разрыв. Но ключевая часть анонса не цифра, а объяснение, за счёт чего она достигнута.
- ARC-AGI-3 — интерактивный бенчмарк: агент выводит правила среды сам, методом проб
- AVO показала абсолютный результат — 100%
- По оценке NVIDIA, решающий вклад внесла архитектура агента, а не «сырая» мощность модели
Harness — новый центр тяжести
Главный тезис NVIDIA: фронтирная языковая модель — лишь один компонент AI-агента. Всё остальное решает окружающая система, которую индустрия называет harness: она определяет, как модель получает контекст, как вызывает инструменты, как сохраняет состояние между шагами, как реагирует на обратную связь среды, как восстанавливается после сбоев и как удерживает прогресс в задачах на десятки и сотни шагов.
TechCrunch сформулировал вывод ещё жёстче: NVIDIA показала, что настоящий герой теперь — harness, а не модель. Один и тот же «мозг» в разной обвязке даёт кардинально разные результаты — и это объясняет, почему компании, строящие агентные продукты, всё чаще конкурируют инженерией контура, а не доступом к очередной модели.
Что это значит
Результат AVO переносит фокус гонки с обучения моделей на системную инженерию вокруг них — а это дисциплина, в которой преимущество получают команды с сильной инфраструктурной культурой, а не только лаборатории с крупнейшими кластерами. Есть и обратная сторона: когда бенчмарк закрыт на 100%, он перестаёт измерять прогресс. ARC-AGI-3 ждёт судьба предшественников — индустрии снова нужен тест, который ещё никто не решил.
Частые вопросы
Что такое ARC-AGI-3?
Интерактивный бенчмарк общего интеллекта из серии ARC Франсуа Шолле: набор игровых сред, правила которых агент должен вывести самостоятельно, взаимодействуя с миром. Считается одним из самых сложных тестов на обобщение, а не на заученные знания.
Что такое harness?
Программная обвязка AI-агента: подсистемы подачи контекста, вызова инструментов, памяти, обработки ошибок и контроля длинных задач. Результат NVIDIA показывает, что качество harness влияет на итог не меньше, чем качество самой модели.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.