Habr: Яндекс→ original

Как Яндекс профилирует память миллионов колонок с Алисой: борьба за 256 МБ

Яндекс рассказал, как борется за память на умных колонках с Алисой: у младших моделей всего 256 МБ оперативки на всё устройство сразу. Команда, которая пишет код на C/C++ для колонок, телевизоров и автомобилей, построила инструмент семплирующего профилирования и ежедневно собирает дампы памяти с миллионов устройств в проде — чтобы точно знать, куда уходит каждый мегабайт: на бизнес-логику, обработку звука или локальные нейросети.

Traité par IA depuis Habr: Яндекс ; édité par Hamidun News
Как Яндекс профилирует память миллионов колонок с Алисой: борьба за 256 МБ
Source : Habr: Яндекс. Collage: Hamidun News.
◐ Écouter l'article

L'équipe de Yandex qui écrit le code applicatif en C/C++ pour les appareils intelligents avec Alice a expliqué en juillet 2026 comment elle a construit un outil de profilage de mémoire par échantillonnage et collecte quotidiennement des dumps mémoire depuis des millions d'enceintes en production. La raison de cette lutte est simple : les modèles d'enceintes d'entrée de gamme n'ont que 256 Mo de RAM pour l'ensemble de l'appareil.

Pourquoi la mémoire est la ressource la plus rare

Les enceintes intelligentes d'entrée de gamme avec Alice n'ont que 256 Mo de RAM pour tout l'appareil — et ce volume doit être partagé simultanément entre la logique métier, le traitement du son et les réseaux de neurones locaux. Selon l'équipe de Yandex, chaque mégaoctet fait l'objet d'une véritable concurrence entre les composants : ce qu'un module occupe en trop devient indisponible pour un autre.

Contrairement aux serveurs, où l'on peut acheter plus de mémoire, une enceinte intelligente est un matériel bon marché et figé. Un développeur ne peut pas « simplement ajouter un gigaoctet de plus » : le volume est intégré dans un appareil déjà installé chez l'utilisateur. C'est pourquoi la question de savoir « où passent les mégaoctets » n'est pas abstraite ici — elle détermine quelles fonctions peuvent même tenir sur l'appareil.

  • 256 Mo de RAM sur les modèles d'enceintes d'entrée de gamme — pour l'ensemble de l'appareil
  • Des dumps mémoire sont collectés quotidiennement depuis des millions d'enceintes
  • Le code applicatif des appareils est écrit en C/C++
  • Une seule plateforme dessert non seulement les enceintes, mais aussi les téléviseurs et les voitures avec Alice
  • La flotte d'appareils fonctionne sous Linux

Pourquoi profiler la mémoire en production ?

Yandex a besoin de profiler précisément en production pour voir la consommation réelle de mémoire sur les appareils réels des utilisateurs, et non une image moyenne obtenue sur un banc de test. Un scénario de laboratoire reproduit rarement la façon dont une enceinte se comporte pendant des jours et des semaines d'affilée dans un véritable appartement, avec de vraies requêtes adressées à Alice.

La clé de l'échelle est le mot « échantillonnage ». Un dump complet et un traçage détaillé de chaque allocation de mémoire sur un matériel faible de 256 Mo consommeraient une partie des ressources mêmes que l'on cherche à mesurer. L'approche par échantillonnage relève les données de façon sélective et avec une faible surcharge, ce qui permet de la maintenir active sur des millions d'appareils à la fois sans gêner le fonctionnement de l'enceinte.

Des millions de sources fournissent une statistique impossible à obtenir sur un seul banc de test : l'équipe ne voit pas un cas isolé, mais une distribution — quels composants consomment durablement de la mémoire sur toute la flotte, et lesquels ne fuient que dans des scénarios rares.

«

Pour chaque mégaoctet, il y a une véritable lutte entre de multiples équipes et composants : logique métier, traitement du son, réseaux de neurones locaux », — Sergueï, développeur au sein de l'équipe des appareils intelligents de Yandex, sur le blog de l'entreprise sur Habr.

Ce que cela signifie

À mesure que les réseaux de neurones locaux migrent vers les appareils, la mémoire devient une ressource aussi critique que l'était autrefois la puissance de calcul. Le cas de Yandex montre que pour faire tenir un assistant vocal et des modèles on-device dans 256 Mo, il ne suffit pas d'écrire un code soigné — il faut un outil qui mesure en permanence la consommation réelle sur l'ensemble du parc d'appareils en production.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…