📹
Retail · М.Видео-Эльдорадо

M.Video-Eldorado: análisis de video en tienda — una mirada honesta a un piloto, no a un 'despliegue en toda la cadena'

Los resultados de este caso existen en dos géneros, y es importante no mezclarlos. Género uno — el blog de ingeniería (Habr, marzo de 2021). La única métrica de impacto publicada allí concierne la alerta misma: en 1,5 meses del piloto, las alertas de 'comprador solitario' cayeron de 25 a 5 por día; el sistema aprendió a filtrar señales falsas e importunar al personal solo cuando importaba. En métricas de negocio el artículo es explícito: el seguimiento de múltiples cámaras solo las haría medibles — conversión de visita a compra, impacto en el recibo promedio. Género dos — el comunicado de prensa corporativo (agosto de 2021). Las cifras allí son más atrevidas: 'el coeficiente de atracción de clientes en las tiendas piloto creció un tercio más rápido', 'el coeficiente de conversión creció 35% versus tiendas comparables', las notificaciones sobre ayudar a un cliente o abrir cajas cayeron 75%, las instalaciones se pagan en el primer mes, y la construcción interna cuesta una quinta parte de los análogos del mercado. El comunicado llama al proyecto 'el primer sistema de análisis de video de Rusia con eficiencia económica comprobada'. La metodología de estas comparaciones (cuántas tiendas, qué período, cómo se seleccionaron las 'comparables') no se divulga, y no hay verificación independiente. En nuestra opinión, la brecha entre los dos géneros es la parte más instructiva del caso. En marzo los ingenieros escriben 'solo ahora aprenderemos a medir la conversión'; en agosto la oficina de prensa reporta '+35% conversión'; hablando estrictamente, ambos textos pueden ser verdaderos (las tiendas piloto efectivamente pueden haber superado a un grupo de control), pero la confianza en un número depende directamente del género en que se publicó. Construiríamos un caso de negocio en la versión de ingeniería y trataríamos la de comunicado de prensa como un límite superior. La segunda observación: incluso según los datos públicos más atrevidos, el proyecto llegó a 50 tiendas de 1.200+ — aproximadamente 4% de la cadena — y no ha aparecido confirmación pública de un despliegue de red completa desde entonces. La distancia entre 'eficiencia económica comprobada' en un piloto y despliegue total es de años y miles de millones (30.000 cámaras versus 250 conectadas al momento del comunicado de prensa). Por eso deliberadamente mantenemos este caso a su escala real: un piloto sólido y bien documentado con escalado temprano — y una regla útil para todos leyendo 'despliegues en toda la cadena' de otras empresas.

1 → 50
tiendas: piloto (octubre de 2020) → plan de escalado (agosto de 2021)
25 → 5
alertas de 'comprador solitario' por día en 1,5 meses
~$50
dispositivo de borde por cámara (Raspberry; filtro RTSP: 3 Mbit/s por 30 cámaras)
30 000
cámaras — escala objetivo (1.000+ tiendas)
Fuentes
Verificado: 2026-07-11

Contexto

M.Video-Eldorado es el minorista de electrónica de consumo más grande de Rusia: más de 1.200 tiendas a principios de 2025; en 2024 la cadena agregó 100 tiendas e ingresó a 25 nuevas ciudades, con GMV en aumento del 5% (CNews). La base tecnológica se adapta a la escala: el presupuesto de TI del grupo para 2026 es de 9 mil millones de rublos (TAdviser), y la función de TI ha sido dirigida desde agosto de 2020 por el CIO Alexander Sokolovsky.

La empresa comenzó a construir su sistema de análisis de video en el verano de 2020 con su propia oficina de datos — sin plataformas de terceros. La decisión fue tanto principista como forzada: la cadena tiene más de mil tiendas con aproximadamente 30 cámaras de vigilancia cada una, lo que pone la escala objetivo en aproximadamente 30.000 cámaras. Reemplazar toda la flota de cámaras para adaptarse a los requisitos de una solución de proveedor es económicamente irreal en esa cantidad; el sistema tenía que construirse sobre el 'zoo' heterogéneo de cámaras CCTV ya colgadas del techo. La posición de partida, registrada en el blog de Habr de la empresa, fue notablemente honesta: nadie podría estimar el efecto económico con anticipación — había solo hipótesis de optimización, y la única forma de probarlas fue a través de un piloto.

El contexto de la industria agudiza la historia. El análisis de video minorista es uno de los segmentos más sobrecalentados del mercado de IA: los proveedores prometen 'crecimiento de conversión de dos dígitos' fuera de caja, mientras que la mayoría de despliegues visibles públicamente nunca van más allá de un piloto de pocas tiendas. Contra ese telón de fondo, M.Video-Eldorado eligió la estrategia opuesta — construir en lugar de comprar, con un pequeño equipo de oficina de datos de dos a cuatro personas, pero en una arquitectura diseñada desde el primer día para 30.000 cámaras.

Lo que hace interesante este caso es precisamente su documentación en cada etapa: un desglose de ingeniería detallado del piloto en Habr y Retail.ru (marzo de 2021), luego un comunicado de prensa de escalado con los primeros números de negocio (agosto de 2021). A través de estos dos géneros — ingeniería y corporativo — puedes ver el mismo proyecto sonar diferente, lo cual es en sí una lección útil para leer estudios de casos de IA.

Problema

Una tienda sin conexión es 'ciega' en comparación con una en línea: nadie sabe dónde van los compradores, dónde se atascan, cuánto tiempo hacen cola, y cuántos se van sin nunca llegar a un consultor. El personal de ventas físicamente no puede ver a cada visitante, y los contadores de puertas clásicos no pueden responder qué le pasó a una persona entre la entrada y la caja. Para una tienda de electrónica esto es especialmente doloroso: los electrodomésticos son un producto impulsado por consulta, y un visitante que ha estado sin atender en el estante de lavadoras durante diez minutos es, con alta probabilidad, una venta perdida.

El lado de ingeniería del problema no es más fácil que el lado de negocio. Las cámaras de la tienda son heterogéneas, antiguas e instaladas para seguridad en lugar de análisis; la configuración estándar deja zonas ciegas, y algunas cámaras tuvieron que ser reorientadas mientras se añadían nuevas. La secuencia de video de 30 cámaras a 1080p y 25 fps es aproximadamente 6 Mbit/s por cámara: empujar ese tráfico de mil tiendas a una nube central es imposible tanto en términos de ancho de banda como financieramente. Finalmente, la red neuronal debe distinguir compradores del personal, y las imágenes de la cámara deben mapearse al planograma de la tienda — hacer eso manualmente toma demasiado tiempo.

Un debate separado fue construir versus comprar. Existían plataformas de análisis de video listas, pero a 30.000 cámaras la economía de la solución se define por costo por cámara, y la empresa apostó por desarrollo interno por un pequeño equipo — en palabras del blog mismo, 'esencialmente estudiantes' trabajando 'de manera improvisada'.

Solución

La arquitectura resultó ser enfáticamente barata — e interesante precisamente por eso.

En el lado de la tienda, cada cámara se conecta a un dispositivo de 'familia Raspberry' económico (aproximadamente $50) que toma la secuencia RTSP y la ejecuta a través de un filtro casero: solo se extraen fotogramas clave — un fotograma cada dos segundos en lugar de 25 fotogramas por segundo. Como resultado, el tráfico de 30 cámaras de una tienda se ajusta a aproximadamente 3 Mbit/s — menos que la secuencia sin procesar de una sola cámara. Los fotogramas van a una nube privada en el propio centro de datos de la empresa, donde un motor de análisis único basado en la red YOLO (elegido por su bajo consumo de recursos y reentrenado para la tarea) detecta personas, convierte sus posiciones en coordenadas cartesianas, y las mapea al planograma de la tienda (Habr, Retail.ru).

Los escenarios de la primera onda: la alerta de 'comprador solitario' — si un visitante permanece de pie o se mueve solo por el piso demasiado tiempo, un mensaje va al chatbot de la tienda y un consultor va a ayudar; 'cola de caja' — una notificación cuando los compradores en el área de recogida exceden la norma; y el 'mapa de calor de la tienda' — una distribución de densidad de visitantes para analizar rutas y merchandising. Distinguir personal de compradores se resolvió con pragmatismo casi cómico al principio: las personas con camisetas rojas (uniforme de M.Video) se ignoran; la solución 'elegante' a través del seguimiento de múltiples cámaras se aplazó a la siguiente etapa.

El piloto comenzó en una tienda en octubre de 2020 — apenas tres meses después de que comenzó el desarrollo. Un mes y medio se dedicó a ajustar las alertas: al principio el sistema disparaba 25 alertas de 'comprador solitario' al día, la mayoría falsas — los consultores rápidamente habrían aprendido a saltarse tales mensajes. Al final del período, quedaban 5 alertas al día, que el blog de la empresa interpreta como 'un aumento nítido de la atención del personal': las señales se volvieron raras y precisas, haciendo que fuera significativo responder. En paralelo el equipo resolvió problemas terrenales: zonas ciegas, reorientación de cámaras, mapeo manual de planogramas — para escalar escribieron instrucciones estándar que permitían al personal de la tienda implementar la solución ellos mismos en un día, más un portal web automatizando el mapeo.

En junio de 2021 la solución se configuró en cinco ubicaciones más de Moscú, y el 6 de agosto de 2021 la empresa anunció escalar a 50 tiendas en Moscú y la región antes de fin de año — con cámaras conectadas a la red neuronal creciendo de 50 a 250. El comunicado de prensa llamó al proyecto 'el primer sistema de análisis de video de Rusia con eficiencia económica comprobada' y valoró la construcción interna a una quinta parte del costo de análogos del mercado, con instalaciones pagándose en el primer mes.

Resultado

Los resultados de este caso existen en dos géneros, y es importante no mezclarlos.

Género uno — el blog de ingeniería (Habr, marzo de 2021). La única métrica de impacto publicada allí concierne la alerta misma: en 1,5 meses del piloto, las alertas de 'comprador solitario' cayeron de 25 a 5 por día; el sistema aprendió a filtrar señales falsas e importunar al personal solo cuando importaba. En métricas de negocio el artículo es explícito: el seguimiento de múltiples cámaras solo las haría medibles — conversión de visita a compra, impacto en el recibo promedio.

Género dos — el comunicado de prensa corporativo (agosto de 2021). Las cifras allí son más atrevidas: 'el coeficiente de atracción de clientes en las tiendas piloto creció un tercio más rápido', 'el coeficiente de conversión creció 35% versus tiendas comparables', las notificaciones sobre ayudar a un cliente o abrir cajas cayeron 75%, las instalaciones se pagan en el primer mes, y la construcción interna cuesta una quinta parte de los análogos del mercado. El comunicado llama al proyecto 'el primer sistema de análisis de video de Rusia con eficiencia económica comprobada'. La metodología de estas comparaciones (cuántas tiendas, qué período, cómo se seleccionaron las 'comparables') no se divulga, y no hay verificación independiente.

En nuestra opinión, la brecha entre los dos géneros es la parte más instructiva del caso. En marzo los ingenieros escriben 'solo ahora aprenderemos a medir la conversión'; en agosto la oficina de prensa reporta '+35% conversión'; hablando estrictamente, ambos textos pueden ser verdaderos (las tiendas piloto efectivamente pueden haber superado a un grupo de control), pero la confianza en un número depende directamente del género en que se publicó. Construiríamos un caso de negocio en la versión de ingeniería y trataríamos la de comunicado de prensa como un límite superior.

La segunda observación: incluso según los datos públicos más atrevidos, el proyecto llegó a 50 tiendas de 1.200+ — aproximadamente 4% de la cadena — y no ha aparecido confirmación pública de un despliegue de red completa desde entonces. La distancia entre 'eficiencia económica comprobada' en un piloto y despliegue total es de años y miles de millones (30.000 cámaras versus 250 conectadas al momento del comunicado de prensa). Por eso deliberadamente mantenemos este caso a su escala real: un piloto sólido y bien documentado con escalado temprano — y una regla útil para todos leyendo 'despliegues en toda la cadena' de otras empresas.

Stack tecnológico
Собственная CV-система дата-офиса (с июля 2020)~30 IP-камер на магазин (1080p, H.264, RTSP)Edge-устройства Raspberry (~$50) с фильтром опорных кадров (1 кадр/2 сек)Нейросеть YOLO (детекция людей, переобучена)Частное облако на базе собственного ЦОДаПривязка координат к планограмме магазинаАлерты персоналу через чат-бот («одинокий покупатель», очереди)Тепловые карты зала
Cronología
Julio de 2020 — la oficina de datos comienza a construir análisis de video interno; octubre de 2020 — primer caso en funcionamiento en la tienda piloto; octubre–noviembre de 2020 — alertas ajustadas de 25 a 5 por día en 1,5 meses; marzo de 2021 — artículo de ingeniería en Habr, comienza el uso de mapas de calor; junio de 2021 — 5 tiendas más de Moscú conectadas; 6 de agosto de 2021 — escalado anunciado a 50 tiendas y 250 cámaras antes de fin de año (conversión +35% versus tiendas comparables — datos de la empresa); el horizonte objetivo es 1.000+ tiendas y ~30.000 cámaras (sin confirmación pública de un despliegue completo).

Lecciones aprendidas

  1. Un piloto no es un despliegue: 'funciona en 1 tienda', 'escalado a 50', y 'funciona en 1.200' están separados por diferentes años y presupuestos; un caso honesto nombra su etapa.
  2. El trabajo real en un proyecto de CV es la precisión de alertas: reducir de 25 a 5 alertas por día es el despliegue, porque el personal deja de ignorar el sistema.
  3. La economía de escala se decide por la ingeniería de borde: un filtro de fotograma clave en un dispositivo de $50 comprimió el tráfico de 30 cámaras en 3 Mbit/s — sin él, un proyecto de 30.000 cámaras falla tanto en ancho de banda como en dinero.
  4. Construye sobre la infraestructura existente: la solución se ejecuta en las cámaras de seguridad heterogéneas ya colgadas en tiendas — reemplazar la flota habría matado el proyecto antes del lanzamiento.
  5. Los hacks pragmáticos vencen las soluciones perfectas al inicio: 'ignorar personas con camisetas rojas' es identificación de personal en funcionamiento para un piloto; el seguimiento de múltiples cámaras puede esperar.
  6. Distingue géneros de reporteo: el blog de ingeniería publica calidad de alertas y dice 'solo ahora aprenderemos a medir la conversión'; el comunicado de prensa dice '+35% conversión' sin metodología; construye tu caso de negocio en el primero y trata el segundo como un límite superior.
  7. La ausencia de datos de despliegue también es información: desde agosto de 2021 no ha aparecido confirmación pública de un despliegue en toda la cadena, y el caso debe terminar donde terminan las fuentes.

Preguntas frecuentes

¿En cuántas tiendas de M.Video se ejecuta el análisis de video?

La trayectoria documentada: un piloto de una tienda desde octubre de 2020, cinco ubicaciones más de Moscú desde junio de 2021, y un anuncio de agosto de 2021 de escalar a 50 tiendas en Moscú y la región (250 cámaras). El objetivo es 1.000+ tiendas (~30.000 cámaras), pero no hay confirmación pública de un despliegue en toda la cadena.

¿Qué puede hacer el análisis de video de M.Video?

Tres escenarios de la primera onda: la alerta de 'comprador solitario' (un mensaje al chatbot de la tienda para que un consultor pueda ayudar), detección de cola de caja, y mapas de calor del piso. Técnicamente: YOLO detecta personas en fotogramas clave, las coordenadas se mapean al planograma; el personal fue filtrado inicialmente por sus camisetas rojas.

¿El análisis de video aumentó la conversión de la tienda?

Depende de qué fuente confíes. El blog de ingeniería (marzo de 2021) divulgó solo calidad de alertas (25 → 5 por día) y afirmó que el sistema simplemente haría medible la conversión. El comunicado de prensa (agosto de 2021) afirmó un coeficiente de conversión 35% más alto versus tiendas comparables y 75% menos notificaciones — datos de la empresa sin metodología divulgada ni verificación independiente.

¿Por qué la empresa construyó el sistema ella misma en lugar de comprar uno?

Economía de escala: a ~30 cámaras por tienda en 1.000+ tiendas, el costo de la solución se define por cámara. La construcción interna — dispositivos Raspberry (~$50), un filtro de fotograma clave, y YOLO — resultó, según la estimación de la empresa, cinco veces más barato que los análogos del mercado, con instalaciones pagándose en el primer mes.

¿Cuáles fueron los principales problemas técnicos del proyecto?

Zonas ciegas en la disposición estándar de cámaras de seguridad (las cámaras tuvieron que reorientarse y añadirse), mapeo manual de planogramas (automatizado a través de un portal web), distinguir personal de compradores (la solución provisional — filtrado de camisetas rojas), y tráfico: la secuencia sin procesar de 30 cámaras (~6 Mbit/s cada una) fue comprimida por el filtro de fotograma clave a ~3 Mbit/s por tienda.

← Casos