GitLab Blog→ оригинал

Claude Sonnet 5 стал первой моделью, прошедшей все тесты GitLab Duo Agent Platform

Claude Sonnet 5 от Anthropic стал доступен на GitLab Duo Agent Platform на всех тарифах и во всех вариантах развёртывания через AI Gateway. Модель — первая в оценочном наборе GitLab, прошедшая все бенчмарк-задачи; предшественница Sonnet 4.6 закрывала 93,8% задач. GitLab также сообщает о росте числа решённых issue на 8,8%.

AI-обработка оригинала GitLab Blog; редакция Hamidun News
Claude Sonnet 5 стал первой моделью, прошедшей все тесты GitLab Duo Agent Platform
Источник: GitLab Blog. Коллаж: Hamidun News.
◐ Слушать статью

Anthropic и GitLab объявили о выходе модели Claude Sonnet 5 на платформе GitLab Duo Agent Platform: она доступна на всех тарифах и во всех вариантах развёртывания через AI Gateway GitLab и стала первой моделью в оценочном наборе GitLab, прошедшей все бенчмарк-задачи.

Насколько лучше Sonnet 5 предыдущей модели

GitLab тестирует модели на собственном наборе задач, отражающих реальную работу ИИ-агентов в разработке: многошаговые задачи, генерация кода, который выдерживает код-ревью, и выполнение рабочих процессов с приемлемыми затратами. Claude Sonnet 5 стала первой моделью, завершившей все задачи этого набора; её предшественница, Sonnet 4.6, закрывала 93,8% задач того же набора.

  • Claude Sonnet 5 — первая модель в оценочном наборе GitLab, прошедшая 100% бенчмарк-задач
  • Sonnet 4.6, предыдущая модель, закрывала 93,8% задач того же набора
  • Число решённых issue выросло на 8,8%
  • Модель доступна на всех тарифах и во всех вариантах развёртывания GitLab Duo через AI Gateway

Что меняется для команд разработки

Для пользователей GitLab Duo Agentic Chat это меняет привычный цикл «промпт — ожидание — оценка результата». Многофайловый рефакторинг теперь даёт результат, пригодный для ревью, вместо оборванной на середине задачи. Генерация тестов возвращает покрытие, которое можно реально использовать. Расследования по безопасности прослеживают историю репозитория глубже. Базовые агенты Duo справляются с большей частью назначенной работы без вмешательства человека, поэтому время команды уходит на проверку результатов, а не на перезапуск сорвавшихся задач. GitLab приводит конкретный пример такого агентного сценария: в инструменте GitLab Orbit модель уже применяют, чтобы расследовать сбои pipeline за последние два месяца, — то есть анализировать историю падений сборок и искать причину прямо в диалоге с агентом.

«Claude Sonnet 5 справилась со всем спектром задач по написанию кода, которые мы тестировали, и при этом решает больше проблем.

Это ощутимое улучшение и в качестве, и в эффективности. Мы сделали её доступной в GitLab Duo Agent Platform уже сегодня, на всех тарифах и во всех вариантах развёртывания», — Манав Хурана (Manav Khurana), директор по продукту и маркетингу GitLab.

Что это значит

Самая дорогая неудача агента — та, что останавливается на полпути: издержки складываются не только из потерянной работы, но и из диагностики, повторного промпта и проверки того, что всё же вернулось. Модель, способная пройти весь набор бенчмарк-задач GitLab без сбоя, превращает агента из инструмента, который нужно постоянно контролировать, в инструмент, которому можно по-настоящему делегировать работу. Именно на этом рубеже — надёжности, а не только качества отдельного ответа — GitLab и Anthropic предлагают оценивать прогресс агентных моделей в разработке ПО.

Частые вопросы

Чем

Claude Sonnet 5 отличается от Sonnet 4.6 на тестах GitLab?

Claude Sonnet 5 стала первой моделью, прошедшей все бенчмарк-задачи оценочного набора GitLab, тогда как Sonnet 4.6 закрывала 93,8% задач того же набора, а число решённых issue выросло на 8,8%.

На каких тарифах GitLab доступен Claude Sonnet 5?

Модель доступна на всех тарифах и во всех вариантах развёртывания GitLab Duo Agent Platform через AI Gateway GitLab — специального повышенного тарифа для доступа к Sonnet 5 не потребовалось.

Где уже применяют Claude Sonnet 5 в GitLab на практике?

GitLab приводит пример инструмента GitLab Orbit, где модель используют для расследования сбоев pipeline за последние два месяца — то есть для анализа истории падений сборок прямо в диалоге с агентом.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…