Как Яндекс профилирует память миллионов колонок с Алисой: борьба за 256 МБ
Яндекс рассказал, как борется за память на умных колонках с Алисой: у младших моделей всего 256 МБ оперативки на всё устройство сразу. Команда, которая пишет код на C/C++ для колонок, телевизоров и автомобилей, построила инструмент семплирующего профилирования и ежедневно собирает дампы памяти с миллионов устройств в проде — чтобы точно знать, куда уходит каждый мегабайт: на бизнес-логику, обработку звука или локальные нейросети.
Processado por IA de Habr: Яндекс; editado por Hamidun News
A equipe da Yandex que escreve o código de aplicação em C/C++ para os dispositivos inteligentes com a Alice explicou em julho de 2026 como construiu uma ferramenta de profiling de memória por amostragem e coleta dumps de memória diariamente de milhões de smart speakers em produção. O motivo da disputa é simples: os modelos de entrada dos speakers têm apenas 256 MB de RAM para o dispositivo inteiro de uma vez.
Por que a memória é o principal recurso escasso
Os smart speakers de entrada com a Alice têm apenas 256 MB de RAM para todo o dispositivo — e esse volume precisa ser dividido simultaneamente entre a lógica de negócio, o processamento de áudio e as redes neurais locais. Segundo a equipe da Yandex, cada megabyte é disputado de verdade entre os componentes: o que um módulo ocupa a mais já não fica disponível para outro.
Diferente dos servidores, onde é possível comprar mais memória, um smart speaker é hardware barato e fixo. O desenvolvedor não pode "simplesmente adicionar mais um gigabyte": o volume está embutido em um dispositivo que já está na casa do usuário. Por isso a pergunta "para onde vão os megabytes" não é abstrata aqui — ela determina quais funções cabem no dispositivo.
- 256 MB de RAM nos modelos de entrada dos speakers — para o dispositivo inteiro de uma vez
- Dumps de memória são coletados diariamente de milhões de speakers
- O código de aplicação dos dispositivos é escrito em C/C++
- Uma única plataforma atende não só os speakers, mas também TVs e carros com a Alice
- A frota de dispositivos roda em Linux
Por que fazer profiling de memória em produção?
A Yandex precisa do profiling justamente em produção para ver o consumo real de memória nos dispositivos reais dos usuários, e não um retrato médio de bancada de testes. Um cenário de laboratório raramente reproduz como um speaker se comporta durante dias e semanas seguidas em um apartamento real, com pedidos reais à Alice.
A chave para a escala está na palavra "amostragem". Um dump completo e um tracing detalhado de cada alocação de memória em um hardware fraco de 256 MB consumiriam parte dos próprios recursos que tentam medir. A abordagem por amostragem coleta dados de forma seletiva e com baixo overhead, por isso pode ficar ativa em milhões de dispositivos ao mesmo tempo sem atrapalhar o funcionamento do speaker.
Milhões de fontes fornecem uma estatística impossível de obter em uma única bancada: a equipe enxerga não um caso isolado, mas uma distribuição — quais componentes consomem memória de forma consistente em toda a frota, e quais vazam apenas em cenários raros.
"Por cada megabyte há uma disputa real entre várias equipes e componentes: lógica de negócio, processamento de áudio, redes neurais locais", —
Sergey, desenvolvedor da equipe de dispositivos inteligentes da Yandex, no blog da empresa no Habr.
O que isso significa
À medida que as redes neurais locais migram para os dispositivos, a memória está se tornando um recurso tão crítico quanto antes era o poder de processamento. O caso da Yandex mostra que, para encaixar um assistente de voz e modelos on-device em 256 MB, não basta escrever código cuidadoso — é preciso uma ferramenta que meça continuamente o consumo real em toda a frota de dispositivos em produção.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.