Habr: Яндекс→ original

Как Яндекс профилирует память миллионов колонок с Алисой: борьба за 256 МБ

Яндекс рассказал, как борется за память на умных колонках с Алисой: у младших моделей всего 256 МБ оперативки на всё устройство сразу. Команда, которая пишет код на C/C++ для колонок, телевизоров и автомобилей, построила инструмент семплирующего профилирования и ежедневно собирает дампы памяти с миллионов устройств в проде — чтобы точно знать, куда уходит каждый мегабайт: на бизнес-логику, обработку звука или локальные нейросети.

Processado por IA de Habr: Яндекс; editado por Hamidun News
Как Яндекс профилирует память миллионов колонок с Алисой: борьба за 256 МБ
Fonte: Habr: Яндекс. Colagem: Hamidun News.
◐ Ouvir artigo

A equipe da Yandex que escreve o código de aplicação em C/C++ para os dispositivos inteligentes com a Alice explicou em julho de 2026 como construiu uma ferramenta de profiling de memória por amostragem e coleta dumps de memória diariamente de milhões de smart speakers em produção. O motivo da disputa é simples: os modelos de entrada dos speakers têm apenas 256 MB de RAM para o dispositivo inteiro de uma vez.

Por que a memória é o principal recurso escasso

Os smart speakers de entrada com a Alice têm apenas 256 MB de RAM para todo o dispositivo — e esse volume precisa ser dividido simultaneamente entre a lógica de negócio, o processamento de áudio e as redes neurais locais. Segundo a equipe da Yandex, cada megabyte é disputado de verdade entre os componentes: o que um módulo ocupa a mais já não fica disponível para outro.

Diferente dos servidores, onde é possível comprar mais memória, um smart speaker é hardware barato e fixo. O desenvolvedor não pode "simplesmente adicionar mais um gigabyte": o volume está embutido em um dispositivo que já está na casa do usuário. Por isso a pergunta "para onde vão os megabytes" não é abstrata aqui — ela determina quais funções cabem no dispositivo.

  • 256 MB de RAM nos modelos de entrada dos speakers — para o dispositivo inteiro de uma vez
  • Dumps de memória são coletados diariamente de milhões de speakers
  • O código de aplicação dos dispositivos é escrito em C/C++
  • Uma única plataforma atende não só os speakers, mas também TVs e carros com a Alice
  • A frota de dispositivos roda em Linux

Por que fazer profiling de memória em produção?

A Yandex precisa do profiling justamente em produção para ver o consumo real de memória nos dispositivos reais dos usuários, e não um retrato médio de bancada de testes. Um cenário de laboratório raramente reproduz como um speaker se comporta durante dias e semanas seguidas em um apartamento real, com pedidos reais à Alice.

A chave para a escala está na palavra "amostragem". Um dump completo e um tracing detalhado de cada alocação de memória em um hardware fraco de 256 MB consumiriam parte dos próprios recursos que tentam medir. A abordagem por amostragem coleta dados de forma seletiva e com baixo overhead, por isso pode ficar ativa em milhões de dispositivos ao mesmo tempo sem atrapalhar o funcionamento do speaker.

Milhões de fontes fornecem uma estatística impossível de obter em uma única bancada: a equipe enxerga não um caso isolado, mas uma distribuição — quais componentes consomem memória de forma consistente em toda a frota, e quais vazam apenas em cenários raros.

"Por cada megabyte há uma disputa real entre várias equipes e componentes: lógica de negócio, processamento de áudio, redes neurais locais", —

Sergey, desenvolvedor da equipe de dispositivos inteligentes da Yandex, no blog da empresa no Habr.

O que isso significa

À medida que as redes neurais locais migram para os dispositivos, a memória está se tornando um recurso tão crítico quanto antes era o poder de processamento. O caso da Yandex mostra que, para encaixar um assistente de voz e modelos on-device em 256 MB, não basta escrever código cuidadoso — é preciso uma ferramenta que meça continuamente o consumo real em toda a frota de dispositivos em produção.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…