МТС AI открыла код AVI — внешнего фильтра, который держит LLM в рамках закона без дообучения
МТС AI выложила в открытый доступ AVI (Aligned/Agreement Validation Interface) — внешний фильтр для LLM на Python и FastAPI. Он проверяет запросы на промпт-атаки, а ответы модели — на токсичность, этичность и нарушение закона. В сборке — RAG-модуль и Docker с мониторингом; новые правила добавляются одной фразой на естественном языке. Систему протестировали на бенчмарке FinanceBench.
AI-обработка оригинала Habr AI; редакция Hamidun News
Компания МТС AI выложила в открытый доступ на GitHub рабочий сервис AVI (Aligned/Agreement Validation Interface) — независимый от модели внешний фильтр, который проверяет промпты на атаки, а ответы LLM — на токсичность, этичность и нарушение закона, не трогая веса самой модели.
Что за архитектура у AVI
Концепцию AVI компания представляла ещё в прошлом году как «умный файрвол» для LLM: входной фильтр отбивает промпт-атаки до того, как запрос попадёт в модель, а выходной — проверяет уже сгенерированный ответ на токсичность, этичность и нарушение закона. Теперь МТС AI доработала архитектуру и выложила рабочую реализацию: сервис на Python и FastAPI с входным и выходным фильтрами, RAG-модулем и докер-сборкой с мониторингом.
- Открытый код опубликован на GitHub
- Стек — Python и FastAPI
- В сборке — входной и выходной фильтры, RAG-модуль, Docker с мониторингом (Prometheus, Grafana, Jaeger)
- Новые правила фильтрации добавляются одной фразой на естественном языке
- Систему протестировали на бенчмарке FinanceBench
- Научное описание архитектуры опубликовано в журнале MDPI Electronics
Зачем нужен внешний фильтр, если можно дообучить модель
Ключевая идея AVI — не переобучать саму LLM под каждое новое требование закона или этики, а держать правила снаружи, в отдельном сервисе. По словам разработчиков, это позволяет добавлять и менять правила без цикла дообучения — новое требование формулируется одной фразой на естественном языке, а не набором новых обучающих примеров. Это же, по их словам, помогает экономить на обучении ИИ-моделей: не нужно перезапускать дорогостоящий процесс дообучения каждый раз, когда меняется регуляторная норма.
При этом AVI не привязан к конкретной модели: поскольку фильтр работает снаружи, на уровне входящих запросов и исходящих ответов, его в теории можно поставить перед любой LLM, а не только перед той, для которой он изначально разрабатывался в МТС AI.
Что это значит
AVI — пример того, как соответствие закону и этическим нормам всё чаще выносится в отдельный контролируемый слой поверх модели, а не встраивается в её веса. Для компаний, которые эксплуатируют LLM в регулируемых отраслях вроде финансов, это способ быстрее адаптироваться к новым требованиям, не перезапуская дорогостоящее дообучение при каждом изменении правил.
Частые вопросы
Что такое AVI?
AVI (Aligned/Agreement Validation Interface) — независимый от модели внешний фильтр для LLM, который проверяет входящие запросы на промпт-атаки, а ответы — на токсичность, этичность и нарушение закона.
На чём тестировали AVI?
Разработчики воспроизвели эксперименты на бенчмарке FinanceBench и опубликовали научное описание архитектуры в журнале MDPI Electronics.
Где взять код AVI?
Рабочий сервис на Python и FastAPI выложен в открытый доступ на GitHub — включая входной и выходной фильтры, RAG-модуль и Docker-сборку с мониторингом Prometheus, Grafana и Jaeger.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.