Yandex: Alice procesa comandos para el hogar inteligente en el altavoz mismo — en promedio 6x más rápido que en la nube
Según el equipo de Yandex, el procesamiento local de comandos para el hogar inteligente es en promedio 6x más rápido que la ruta en la nube — la ganancia proviene de eliminar el viaje redondo de la red más procesamiento de transmisión en dispositivo; la empresa no publicó milisegundos exactos, y la velocidad de reconocimiento varía con la complejidad de la frase. Las luces y otros dispositivos Zigbee siguen funcionando cuando la conexión a internet se cae — la resiliencia sin conexión se convirtió no en un efecto secundario sino en el segundo resultado titular del proyecto. El enfoque se mantuvo en toda la línea de productos: dispositivos más nuevos, incluyendo Station Mini 3 Pro, también obtuvieron procesamiento local de comandos de voz (TAdviser) — Midi no fue un experimento sino una prueba de la arquitectura para toda la plataforma. El ecosistema siguió creciendo mientras tanto: 5.3 millones de dispositivos YaOS/YaOS X activos y 2.9 mil millones de solicitudes de Alice en 2025. La escala de compresión que el equipo documentó en números es reveladora en sí misma: NLU — de al menos 30 gigabytes de RAM a 90 megabytes; el backend del hogar inteligente — de 500+ a ~200 megabytes; ASR — hasta un modelo de ~10 millones de parámetros, órdenes de magnitud más pequeño que sus homólogos en la nube. Estas cifras son un punto de referencia público raro para cualquiera que evalúe la viabilidad de IA en dispositivo en hardware económico. En nuestra opinión, la lección principal transferible del caso es la descomposición correcta del híbrido: Yandex no intentó arrastrar 'todo Alice' al altavoz; aisló el dominio estrecho donde la localidad produce el mayor valor (comandos rutinarios del hogar inteligente — alta frecuencia, cortos, con vocabulario limitado) y dejó todo lo demás en la nube. Ese marco — 'local para lo que es frecuente y simple; nube para lo que es raro y complejo' — se aplica mucho más allá del hogar inteligente: desde menús de voz bancarios hasta asistentes automotrices. La segunda observación: la IA en dispositivo comienza con el hardware. El NPU en el SoC y el gigabyte de memoria fueron diseñados en Midi desde el principio — en un chip débil esta arquitectura no habría sucedido. Los equipos que planean modelos locales en dispositivos deben presupuestar espacio de cálculo una generación antes de que los modelos estén listos — de lo contrario, cuando el software madure, el hardware en dispositivos ya vendidos no podrá manejarlo.
- Станция Миди и голосовое управление Zigbee-устройствами без интернета. История разработки — Habr (блог Яндекса), 2023-11
- Итоги Яндекса за 2025: 5,3 млн активных устройств YaOS/YaOS X, 2,9 млрд запросов к Алисе — Habr, 2025
- Яндекс.Станция — линейка устройств, включая Станцию Мини 3 Про с локальной обработкой команд — TAdviser, n/a
- Яндекс Станция Миди — официальная страница продукта (Zigbee-хаб, локальные команды) — Яндекс, n/a
Contexto
Alice es el asistente de voz de Yandex que reside en altavoces inteligentes y televisores en las plataformas YaOS e YaOS X. La escala del ecosistema a finales de 2025: 5.3 millones de dispositivos activos, 2.9 mil millones de solicitudes procesadas durante el año, y 14 nuevos gadgets inteligentes en la línea de productos (datos de Yandex publicados en Habr). Es uno de los ecosistemas de voz más grandes fuera del mundo de habla inglesa.
En noviembre de 2023, Yandex lanzó Station Midi — el primer altavoz en el que Alice aprendió a comprender y ejecutar comandos para el hogar inteligente localmente, directamente en el dispositivo, sin un viaje redondo a la nube. Midi también actúa como un hub Zigbee en sí mismo: los sensores, bombillas y enchufes se conectan directamente al altavoz, sin pasar por los servicios en la nube.
Lo que hace notable este caso desde el punto de vista ingenieril: Yandex es una empresa rara que detalló públicamente su arquitectura en dispositivo — el equipo la describió en una publicación técnica de Habr en noviembre de 2023, con tamaños de modelo concretos, huella de memoria e historial de optimizaciones. Para comparar: Amazon y Google también trasladaron el procesamiento de comandos de voz a dispositivos, pero nunca proporcionaron documentación técnica pública tan detallada de sus soluciones.
Esa apertura hace que el caso sea verificable e instructivo: puedes rastrear cómo una pila de reconocimiento de voz y comprensión del lado del servidor que ocupa decenas de gigabytes se comprime en un altavoz con un gigabyte de RAM.
Problema
La arquitectura clásica del asistente de voz encamina cada comando a través de la nube: la grabación de voz va a un servidor, se reconoce e interpreta allí, y la respuesta regresa al dispositivo. Para un hogar inteligente esto significa dos problemas. Primero, la latencia entre decir 'apaga la luz' y que la luz se apague realmente: incluso con buena conexión el comando hace un viaje redondo completo de la red, aunque el altavoz y la bombilla estén en la misma habitación. Segundo, un hogar inteligente completamente no funcional durante interrupciones de internet: un interruptor de luz que muere con el Wi-Fi socava la confianza en la idea misma de un hogar inteligente.
Traladar el procesamiento al dispositivo se enfrentó a una aritmética de recursos difícil. La pila de servidor de Alice fue diseñada para un centro de datos: el servicio NLU en la nube 'Begemot' requiere por sí solo al menos 30 gigabytes de RAM y alrededor de 30 gigabytes de disco. Un altavoz inteligente típico (Station Mini) tiene 256 megabytes de RAM y 256 megabytes de flash — una brecha de más de cien veces. El reconocimiento de voz en dispositivo también debe funcionar en modo de transmisión — comenzar a analizar la frase antes de que la persona la termine, de lo contrario no hay ganancia de velocidad.
Por lo tanto, la tarea se planteó no como 'poner un modelo en un altavoz' sino como un programa ingenieril completo: reconstruir tres subsistemas — reconocimiento de voz (ASR), comprensión del lenguaje (NLU), y el backend del hogar inteligente — en versiones que se ajusten a megabytes de uno o dos dígitos, sin pérdida de calidad en la clase objetivo de comandos.
Solución
Los cimientos se sentaron en el momento del diseño del hardware. Station Midi se construye sobre un SoC Amlogic A113X2 con un procesador neural integrado (NPU), 1 gigabyte de RAM y 8 gigabytes de flash — versus 256 megabytes de cada uno en Mini. El NPU y el espacio de memoria fueron una apuesta deliberada en modelos locales, hecha antes de que esos modelos estuvieran listos.
El reconocimiento de voz (ASR) se construyó en un codificador de transformador con un movimiento de CTC a RNN-T — una arquitectura que permite reconocimiento en tiempo real de transmisión: el altavoz analiza la frase mientras se está hablando. El modelo, aproximadamente diez millones de parámetros, fue entrenado en el mismo conjunto de datos que el reconocedor en la nube, con ejemplos de comandos para el hogar inteligente agregados. Para comparar: los modelos ASR en la nube son órdenes de magnitud más grandes.
La comprensión del lenguaje se resolvió adaptando el servicio 'Begemot' del lado del servidor — así nació 'Begemotik'. De un servicio que requería al menos 30 gigabytes de RAM, se cortó todo lo innecesario para el dominio del hogar inteligente: componentes ML pesados, reconocimiento de geografía y fecha. El resultado — 90 megabytes de RAM y 73 megabytes de flash: compresión de dos a tres órdenes de magnitud mientras se preserva la calidad en los comandos objetivo.
El tercer componente es el backend local del hogar inteligente en Go: la lógica de ejecución de comandos que consumía 500+ megabytes en la nube se comprimió a ~200 megabytes de RAM y 90 megabytes de flash — en parte eliminando síntesis de voz y manteniendo almacenamiento de configuración local del hogar inteligente con sincronización.
El vínculo de conexión es el hub Zigbee integrado: los dispositivos del hogar inteligente se conectan directamente al altavoz, por lo que toda la ruta 'voz → reconocimiento → interpretación → comando del dispositivo' permanece dentro del apartamento. Internet no es necesario para estos escenarios en absoluto. La arquitectura es híbrida, sin embargo: cualquier cosa más allá de los comandos rutinarios del hogar inteligente — música, búsqueda, conversación con Alice — todavía va a la nube, donde se ejecutan los modelos de tamaño completo.
Es notable que el equipo publicó no solo el resultado sino el historial de desarrollo con fallos intermedios y bifurcaciones (por ejemplo, por qué CTC fue abandonado en favor de RNN-T) — un nivel raro de transparencia ingenieril para un producto de consumidor.
Resultado
Según el equipo de Yandex, el procesamiento local de comandos para el hogar inteligente es en promedio 6x más rápido que la ruta en la nube — la ganancia proviene de eliminar el viaje redondo de la red más procesamiento de transmisión en dispositivo; la empresa no publicó milisegundos exactos, y la velocidad de reconocimiento varía con la complejidad de la frase. Las luces y otros dispositivos Zigbee siguen funcionando cuando la conexión a internet se cae — la resiliencia sin conexión se convirtió no en un efecto secundario sino en el segundo resultado titular del proyecto.
El enfoque se mantuvo en toda la línea de productos: dispositivos más nuevos, incluyendo Station Mini 3 Pro, también obtuvieron procesamiento local de comandos de voz (TAdviser) — Midi no fue un experimento sino una prueba de la arquitectura para toda la plataforma. El ecosistema siguió creciendo mientras tanto: 5.3 millones de dispositivos YaOS/YaOS X activos y 2.9 mil millones de solicitudes de Alice en 2025.
La escala de compresión que el equipo documentó en números es reveladora en sí misma: NLU — de al menos 30 gigabytes de RAM a 90 megabytes; el backend del hogar inteligente — de 500+ a ~200 megabytes; ASR — hasta un modelo de ~10 millones de parámetros, órdenes de magnitud más pequeño que sus homólogos en la nube. Estas cifras son un punto de referencia público raro para cualquiera que evalúe la viabilidad de IA en dispositivo en hardware económico.
En nuestra opinión, la lección principal transferible del caso es la descomposición correcta del híbrido: Yandex no intentó arrastrar 'todo Alice' al altavoz; aisló el dominio estrecho donde la localidad produce el mayor valor (comandos rutinarios del hogar inteligente — alta frecuencia, cortos, con vocabulario limitado) y dejó todo lo demás en la nube. Ese marco — 'local para lo que es frecuente y simple; nube para lo que es raro y complejo' — se aplica mucho más allá del hogar inteligente: desde menús de voz bancarios hasta asistentes automotrices.
La segunda observación: la IA en dispositivo comienza con el hardware. El NPU en el SoC y el gigabyte de memoria fueron diseñados en Midi desde el principio — en un chip débil esta arquitectura no habría sucedido. Los equipos que planean modelos locales en dispositivos deben presupuestar espacio de cálculo una generación antes de que los modelos estén listos — de lo contrario, cuando el software madure, el hardware en dispositivos ya vendidos no podrá manejarlo.
Lecciones aprendidas
- La latencia es una métrica de producto del hogar inteligente: los usuarios sienten la ganancia de 'en promedio 6x' con cada cambio de interruptor.
- La IA en dispositivo es ante todo una disciplina de compresión: un ASR de ~10M parámetros y un NLU comprimido de 30 GB a 90 MB son suficientes para comandos rutinarios — no se requiere un modelo gigante.
- Comprime cortando el dominio, no solo mediante cuantización: 'Begemotik' se volvió cientos de veces más pequeño que 'Begemot' porque se eliminó todo lo que el hogar inteligente no necesita (geografía, fechas, componentes ML pesados).
- Descompón el híbrido por frecuencia y complejidad: local para comandos frecuentes simples, nube para consultas raras complejas; no intentes arrastrar todo el asistente al dispositivo.
- La resiliencia sin conexión es un valor en sí misma: un hogar inteligente que muere con el Wi-Fi socava la confianza en toda la categoría.
- El hardware especializado (un NPU en el SoC, espacio de memoria) debe planificarse en el momento del diseño del dispositivo — una generación antes de que los modelos estén listos; no puedes adaptar modelos en dispositivo a un chip débil.
- Un artículo de ingeniería público (Habr) con tamaños de modelo concretos e historial de fallos es una práctica rara y correcta: hace que los resultados reclamados sean verificables.
Preguntas frecuentes
¿Cuántos dispositivos Alice hay en uso?
Según datos de Yandex de 2025 — 5.3 millones de dispositivos activos en las plataformas YaOS e YaOS X. Alice procesó 2.9 mil millones de solicitudes durante el año.
¿Funciona el hogar inteligente de Yandex sin internet?
Sí, parcialmente: Station Midi (y dispositivos más nuevos con procesamiento local, incluyendo Mini 3 Pro) actúa como un hub Zigbee y ejecuta comandos rutinarios del hogar inteligente localmente — las luces se encienden incluso si la conexión a internet está caída. La música, búsqueda y conversaciones con Alice aún requieren la nube.
¿Cuánto más rápido es el procesamiento local que en la nube?
Según el equipo de Yandex (publicación técnica de Habr) — en promedio 6x más rápido. La empresa no ha publicado milisegundos exactos; la velocidad de reconocimiento varía con la complejidad de la frase.
¿Cómo ajustó Yandex el reconocimiento de voz y NLU en un altavoz?
Tres movimientos: un modelo ASR de transmisión en un codificador de transformador con RNN-T (~10M parámetros); el NLU 'Begemotik' — una adaptación del 'Begemot' del lado del servidor de 30+ GB a 90 MB de RAM eliminando componentes que el hogar inteligente no necesita; y un backend local del hogar inteligente en Go comprimido de 500+ a ~200 MB. Más el NPU en el SoC Amlogic A113X2 y 1 GB de RAM diseñados desde el principio.
¿Alice procesa todos los comandos localmente?
No. Los comandos rutinarios del hogar inteligente para dispositivos Zigbee se procesan localmente; todo lo demás — música, búsqueda, diálogo abierto — va a la nube donde se ejecutan los modelos de tamaño completo. Es una arquitectura híbrida deliberada.