Microsoft Research→ оригинал

Microsoft Research представила SkillOpt — обучаемые skills для AI-агентов

Microsoft Research представила SkillOpt — подход, который превращает ручную донастройку skills (инструкций) AI-агентов в полноценный тренировочный процесс. Раньше правки инструкций вносили вручную без гарантии, что агент станет работать лучше. SkillOpt делает поведение агента более предсказуемым, не меняя веса самой модели.

AI-обработка оригинала Microsoft Research; редакция Hamidun News
Microsoft Research представила SkillOpt — обучаемые skills для AI-агентов
Источник: Microsoft Research. Коллаж: Hamidun News.
◐ Слушать статью

Microsoft Research представила SkillOpt — метод, который превращает ручное редактирование skills (инструкций) AI-агентов в управляемый процесс обучения, не затрагивая веса самой модели.

В чём проблема ручных правок

AI-агенты выполняют задачи, следуя набору skills — текстовых инструкций, которые описывают, как решать конкретный тип задачи: как оформить отчёт, как обработать заявку клиента, как пройти многошаговый рабочий процесс. Когда агент ошибается, разработчики обычно правят эти инструкции вручную: переформулируют шаг, добавляют оговорку, убирают лишнее условие.

По данным исследователей Microsoft, у такой правки нет никакой гарантии, что поведение агента реально улучшится. Изменения вносятся на глаз, часто по итогам разбора одного-двух неудачных примеров, а не системной проверки на широком наборе сценариев. В результате одна правка может закрыть конкретный частный случай и одновременно незаметно сломать поведение в десятке других — просто потому, что никто не измерял эффект изменения в целом.

Как работает SkillOpt

SkillOpt меняет сам процесс редактирования skills, превращая его в подобие тренировки модели. Вместо разовой ручной правки инструкция обрабатывается как обучаемый параметр — к ней применяется тот же общий принцип, что и при оптимизации весов нейросети: изменение проверяется, оценивается по эффекту и принимается или отклоняется на основе измеримого результата. При этом сама базовая языковая модель, на которой построен агент, остаётся неизменной — меняется только текстовый слой инструкций поверх неё.

  • SkillOpt разработан исследовательской командой Microsoft Research
  • Инструкции агента (skills) переводятся в разряд обучаемых параметров
  • Веса базовой языковой модели при этом не меняются
  • Цель метода — сделать поведение агента более надёжным и предсказуемым

Почему это важно для агентных систем

Чем больше практических задач делегируют AI-агентам, тем дороже обходится каждая непредсказуемая ошибка в их поведении. Ручное редактирование инструкций хорошо работает, пока агент решает узкий набор простых задач и каждую правку можно перепроверить глазами. Но по мере роста числа skills и сценариев их применения такой подход перестаёт масштабироваться — именно с этой проблемой, судя по описанию Microsoft Research, и работает SkillOpt, предлагая систематический и воспроизводимый способ улучшать инструкции агента.

Чем это отличается от привычного дообучения

В классическом машинном обучении улучшение модели почти всегда означает работу с её весами: дообучение, файн-тюнинг, обучение с подкреплением. SkillOpt предлагает альтернативный рычаг — оптимизировать не саму модель, а текстовый слой инструкций поверх неё. Это заметно дешевле и быстрее классического дообучения, поскольку не требует пересчёта весов модели, но при этом, в отличие от разовой ручной правки промпта, использует принципы, заимствованные из обучения: измеримую проверку эффекта и итеративное улучшение вместо интуитивной подгонки.

Что это значит

Если правка инструкций агента станет измеримым и воспроизводимым процессом, а не ручной подгонкой методом проб и ошибок, разработчикам будет проще делать поведение AI-агентов стабильным по мере того, как агенты берут на себя всё больше практических задач. Это также снижает риск скрытых регрессий: правка одного skill, прошедшая через систематическую проверку, с меньшей вероятностью незаметно сломает поведение агента в других сценариях.

Для команд, которые сейчас строят собственных агентов на базе больших языковых моделей, это ещё один сигнал: набор инструкций агента стоит проектировать и версионировать так же аккуратно, как и код, — с проверками, метриками качества и понятной историей изменений, а не как разовый текстовый файл, который правят по наитию.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…