Яндекс: Алиса обрабатывает команды умного дома прямо на колонке — в среднем в 6 раз быстрее облака
По данным команды Яндекса, локальная обработка команд умного дома работает в среднем в 6 раз быстрее облачной — выигрыш складывается из устранения сетевого круга и потоковой обработки на устройстве; точные миллисекунды компания не публиковала, а скорость распознавания зависит от сложности фразы. Управление светом и другими Zigbee-устройствами продолжает работать при отключении интернета — офлайн-устойчивость стала не побочным эффектом, а вторым главным результатом проекта. Подход закрепился в линейке: локальную обработку голосовых команд получили и новые устройства, включая Станцию Мини 3 Про (TAdviser), — то есть Миди была не экспериментом, а обкаткой архитектуры для всей платформы. Экосистема при этом продолжила рост: 5,3 миллиона активных устройств YaOS/YaOS X и 2,9 миллиарда запросов к Алисе за 2025 год. Отдельно показателен масштаб сжатия, который команда задокументировала цифрами: NLU — с минимум 30 гигабайт оперативной памяти до 90 мегабайт; бэкенд умного дома — с 500+ до ~200 мегабайт; ASR — до модели в ~10 миллионов параметров, на порядки меньше облачных аналогов. Эти цифры — редкий публичный ориентир для всех, кто оценивает реалистичность on-device ИИ на дешёвом железе. На наш взгляд, главный переносимый урок кейса — правильная декомпозиция гибрида: Яндекс не пытался затащить «всю Алису» на колонку, а выделил узкий домен, где локальность даёт максимум пользы (типовые команды умного дома — высокочастотные, короткие, с ограниченным словарём), и оставил всё остальное облаку. Такая постановка — «локально то, что часто и просто; в облаке то, что редко и сложно» — применима далеко за пределами умного дома: от банковских голосовых меню до автомобильных ассистентов. Второе наблюдение: on-device ИИ начинается с железа. NPU в SoC и гигабайт памяти были заложены в Миди на этапе проектирования — на слабом чипе этой архитектуры бы не случилось. Командам, планирующим локальные модели в устройствах, стоит закладывать вычислительный запас за поколение до того, как модели будут готовы, — иначе к моменту готовности софта железо в проданных устройствах уже не потянет.
- Станция Миди и голосовое управление Zigbee-устройствами без интернета. История разработки — Habr (блог Яндекса), 2023-11
- Итоги Яндекса за 2025: 5,3 млн активных устройств YaOS/YaOS X, 2,9 млрд запросов к Алисе — Habr, 2025
- Яндекс.Станция — линейка устройств, включая Станцию Мини 3 Про с локальной обработкой команд — TAdviser, n/a
- Яндекс Станция Миди — официальная страница продукта (Zigbee-хаб, локальные команды) — Яндекс, n/a
Контекст
Алиса — голосовой ассистент Яндекса, живущий в умных колонках и телевизорах на платформах YaOS и YaOS X. Масштаб экосистемы по итогам 2025 года: 5,3 миллиона активных устройств, 2,9 миллиарда обработанных запросов за год и 14 новых умных гаджетов в линейке (данные Яндекса, опубликованные на Habr). Это одна из крупнейших голосовых экосистем за пределами англоязычного мира.
В ноябре 2023 года Яндекс выпустил Станцию Миди — первую колонку, в которой Алиса научилась понимать и выполнять команды умного дома локально, прямо на устройстве, без обращения в облако. Миди при этом сама выступает Zigbee-хабом: датчики, лампочки и розетки подключаются к колонке напрямую, минуя облачные сервисы.
Инженерная особенность этого кейса в том, что Яндекс — редкий пример компании, которая публично и подробно разобрала свою on-device архитектуру: команда описала её в техническом посте на Habr в ноябре 2023 года, с конкретными размерами моделей, объёмами памяти и историей оптимизаций. Для сравнения: Amazon и Google тоже переносили обработку голосовых команд на устройства, но такой детальной публичной инженерной документации своих решений не давали.
Эта открытость делает кейс проверяемым и учебным: по нему можно проследить, как серверный стек распознавания и понимания речи, занимающий десятки гигабайт, ужимается до размеров, помещающихся в колонку с одним гигабайтом оперативной памяти.
Проблема
Классическая архитектура голосового ассистента гоняет каждую команду через облако: запись голоса уходит на сервер, там распознаётся и интерпретируется, ответ возвращается на устройство. Для умного дома это означает две проблемы. Первая — задержка между фразой «выключи свет» и самим выключением: даже при хорошем интернете команда проходит полный сетевой круг, хотя и колонка, и лампочка находятся в одной комнате. Вторая — полная неработоспособность умного дома при падении интернета: выключатель, который перестаёт работать вместе с Wi-Fi, подрывает доверие к самой идее умного дома.
Перенести обработку на устройство мешала жёсткая арифметика ресурсов. Серверный стек Алисы проектировался под датацентр: одному только сервису понимания естественного языка «Бегемот» в облаке требуется минимум 30 гигабайт оперативной памяти и около 30 гигабайт на диске. У типичной умной колонки (Станция Мини) — 256 мегабайт оперативной памяти и 256 мегабайт флеша: разрыв в сотню с лишним раз. Распознавание речи на устройстве должно к тому же работать в потоковом режиме — начинать разбирать фразу до того, как человек её договорил, иначе выигрыша в скорости не будет.
То есть задача формулировалась не как «поставить модель на колонку», а как полноценная инженерная программа: пересобрать три подсистемы — распознавание речи (ASR), понимание языка (NLU) и бэкенд умного дома — в версии, укладывающиеся в единицы и десятки мегабайт, без потери качества на целевом классе команд.
Решение
Фундамент заложили на этапе проектирования железа. Станция Миди построена на SoC Amlogic A113X2 со встроенным нейропроцессором (NPU), 1 гигабайтом оперативной памяти и 8 гигабайтами флеша — против 256 мегабайт и того и другого у Мини. NPU и запас памяти — это осознанная ставка на локальные модели, сделанная до того, как эти модели были готовы.
Распознавание речи (ASR) собрали на основе трансформерного энкодера с переходом от CTC к RNN-T — архитектуре, которая позволяет потоковое распознавание в реальном времени: колонка разбирает фразу по мере произнесения. Модель размером примерно в десяток миллионов параметров обучали на том же датасете, что и облачное распознавание, добавив примеры команд умного дома. Для сравнения: облачные ASR-модели на порядки больше.
Понимание языка решили адаптацией серверного сервиса «Бегемот» — так появился «Бегемотик». Из сервиса, требующего минимум 30 гигабайт оперативной памяти, вырезали всё, что не нужно для домена умного дома: тяжёлые ML-компоненты, распознавание географии и дат. Результат — 90 мегабайт оперативной памяти и 73 мегабайта флеша: сжатие на два-три порядка при сохранении качества на целевых командах.
Третий компонент — локальный бэкенд умного дома на Go: логика исполнения команд, которая в облаке потребляла более 500 мегабайт, ужата до ~200 мегабайт оперативной памяти и 90 мегабайт флеша — в том числе за счёт выноса синтеза речи и локального хранения конфигурации умного дома с синхронизацией.
Связующее звено — встроенный Zigbee-хаб: устройства умного дома подключены к колонке напрямую, поэтому весь путь «голос → распознавание → интерпретация → команда устройству» проходит внутри квартиры. Интернет для этих сценариев не нужен вовсе. При этом архитектура гибридная: всё, что выходит за рамки типовых команд умного дома — музыка, поиск, разговор с Алисой, — по-прежнему уходит в облако, где работают полноразмерные модели.
Важно, что команда опубликовала не только результат, но и историю разработки с промежуточными неудачами и развилками (например, почему отказались от CTC в пользу RNN-T) — это редкий уровень инженерной прозрачности для потребительского продукта.
Результат
По данным команды Яндекса, локальная обработка команд умного дома работает в среднем в 6 раз быстрее облачной — выигрыш складывается из устранения сетевого круга и потоковой обработки на устройстве; точные миллисекунды компания не публиковала, а скорость распознавания зависит от сложности фразы. Управление светом и другими Zigbee-устройствами продолжает работать при отключении интернета — офлайн-устойчивость стала не побочным эффектом, а вторым главным результатом проекта.
Подход закрепился в линейке: локальную обработку голосовых команд получили и новые устройства, включая Станцию Мини 3 Про (TAdviser), — то есть Миди была не экспериментом, а обкаткой архитектуры для всей платформы. Экосистема при этом продолжила рост: 5,3 миллиона активных устройств YaOS/YaOS X и 2,9 миллиарда запросов к Алисе за 2025 год.
Отдельно показателен масштаб сжатия, который команда задокументировала цифрами: NLU — с минимум 30 гигабайт оперативной памяти до 90 мегабайт; бэкенд умного дома — с 500+ до ~200 мегабайт; ASR — до модели в ~10 миллионов параметров, на порядки меньше облачных аналогов. Эти цифры — редкий публичный ориентир для всех, кто оценивает реалистичность on-device ИИ на дешёвом железе.
На наш взгляд, главный переносимый урок кейса — правильная декомпозиция гибрида: Яндекс не пытался затащить «всю Алису» на колонку, а выделил узкий домен, где локальность даёт максимум пользы (типовые команды умного дома — высокочастотные, короткие, с ограниченным словарём), и оставил всё остальное облаку. Такая постановка — «локально то, что часто и просто; в облаке то, что редко и сложно» — применима далеко за пределами умного дома: от банковских голосовых меню до автомобильных ассистентов.
Второе наблюдение: on-device ИИ начинается с железа. NPU в SoC и гигабайт памяти были заложены в Миди на этапе проектирования — на слабом чипе этой архитектуры бы не случилось. Командам, планирующим локальные модели в устройствах, стоит закладывать вычислительный запас за поколение до того, как модели будут готовы, — иначе к моменту готовности софта железо в проданных устройствах уже не потянет.
Уроки для индустрии
- Латентность — продуктовая метрика умного дома: выигрыш «в среднем в 6 раз» пользователь чувствует каждым щелчком выключателя.
- On-device ИИ — это прежде всего дисциплина сжатия: ASR на ~10 млн параметров и NLU, ужатый с 30 ГБ до 90 МБ, достаточны для типовых команд — гигантская модель не нужна.
- Сжимайте через отсечение домена, а не только квантизацию: «Бегемотик» стал в сотни раз меньше «Бегемота» потому, что из него вырезали всё, что не нужно умному дому (география, даты, тяжёлые ML-компоненты).
- Гибрид декомпозируется по частоте и сложности: локально — частые простые команды, в облаке — редкие сложные запросы; не пытайтесь затащить весь ассистент на устройство.
- Офлайн-устойчивость — самостоятельная ценность: умный дом, который умирает вместе с Wi-Fi, подрывает доверие ко всей категории.
- Специализированное железо (NPU в SoC, запас памяти) планируется на этапе проектирования устройства — за поколение до готовности моделей; on-device модели не «добавишь потом» на слабый чип.
- Публичный инженерный разбор (Habr) с конкретными размерами моделей и историей неудач — редкая и правильная практика: он делает заявленные результаты проверяемыми.
Частые вопросы
Сколько устройств с Алисой сейчас работает?
По данным Яндекса за 2025 год — 5,3 млн активных устройств на платформах YaOS и YaOS X. За год Алиса обработала 2,9 млрд запросов.
Работает ли умный дом Яндекса без интернета?
Да, частично: Станция Миди (и более новые устройства с локальной обработкой, включая Мини 3 Про) выступает Zigbee-хабом и выполняет типовые команды умного дома локально — свет включится, даже если интернет упал. Музыка, поиск и разговоры с Алисой по-прежнему требуют облака.
Насколько локальная обработка быстрее облачной?
По данным команды Яндекса (технический пост на Habr) — в среднем в 6 раз быстрее. Точных миллисекунд компания не публиковала; скорость распознавания зависит от сложности фразы.
Как Яндекс уместил распознавание речи и NLU в колонку?
Тремя ходами: потоковая ASR-модель на трансформерном энкодере с RNN-T (~10 млн параметров); NLU «Бегемотик» — адаптация серверного «Бегемота» с 30+ ГБ до 90 МБ оперативной памяти за счёт вырезания ненужных умному дому компонентов; локальный бэкенд умного дома на Go, ужатый с 500+ до ~200 МБ. Плюс NPU в SoC Amlogic A113X2 и 1 ГБ оперативной памяти, заложенные при проектировании.
Все ли команды Алиса обрабатывает локально?
Нет. Локально обрабатываются типовые команды умного дома для Zigbee-устройств; всё остальное — музыка, поиск, свободный диалог — уходит в облако, где работают полноразмерные модели. Это осознанная гибридная архитектура.