Авито устроило турнир uplift-моделей: победил X-learner, а не Causal Forest
Аналитик Авито Гриша Крюков устроил «чемпионат» среди четырёх uplift-моделей: S-learner, T-learner, X-learner и Causal Forest. Формат — групповой этап на синтетике плюс плей-офф на реальных данных, метрика PEHE. Неожиданный итог: X-learner вышел из группы лишь третьим, но выиграл оба полуфинала и финал — PEHE 0.579 против 1.135 у T-learner.
Procesado por IA desde Habr: Avito; editado por Hamidun News
El analista del equipo de confianza y seguridad de Avito, Grisha Kryukov, organizó en julio de 2026 un «campeonato» entre cuatro modelos uplift populares — S-learner, T-learner, X-learner y CausalForest — con una fase de grupos y playoffs. El oro se lo llevó, sorprendentemente, X-learner, que salió de la fase de grupos en tercer lugar, pero ganó ambas semifinales y la final.
Para qué sirven los modelos uplift
El modelado uplift estima el efecto individual de una intervención: cuánto cambiará el comportamiento de una persona concreta a causa de una promoción, en lugar de la reacción promedio del grupo. La principal dificultad es que para un mismo objeto no se pueden observar ambos resultados a la vez: con intervención y sin ella.
«El principal problema: para un mismo jugador nunca conocemos ambas situaciones al mismo tiempo», —
Grisha Kryukov, analista del equipo de confianza y seguridad de Avito.
Los cuatro enfoques resuelven esta tarea de manera diferente: S-learner introduce la bandera de intervención como una característica más, T-learner entrena dos modelos separados, X-learner añade entrenamiento sobre pseudoefectos y ponderación por propensity, y CausalForest construye árboles que maximizan la diferencia en el efecto.
Cómo se organizó el torneo
El torneo constó de una fase de grupos con datos sintéticos y unos playoffs con datos reales. El autor midió la calidad de los modelos con la métrica PEHE (Precision in Estimation of Heterogeneous Effect): cuanto más baja, más precisa la estimación del efecto.
- Modelos: S-learner, T-learner, X-learner, CausalForest
- Métrica — PEHE, puntos en el grupo por posición: 3-2-1-0
- Fase de grupos — sintética, 5000 observaciones, 10 características, división 70/30
- Semifinales — dataset Hillstrom Mine That Data, 64 mil clientes de e-commerce
- Final — dataset FIFA21, alrededor de 10 mil futbolistas y 26 atributos
Al término de las tres rondas de grupos, CausalForest iba primero con 6 puntos, S-learner y X-learner sumaron 5 cada uno, y T-learner cerró la tabla con 2 puntos.
Por qué ganó X-learner
X-learner ganó porque su arquitectura aprende precisamente de la diferencia entre los escenarios con intervención y sin ella, y no del nivel general de respuesta. En semifinales aplastó a S-learner (PEHE 0.215 frente a 0.747), y en la final superó a T-learner con un resultado de PEHE 0.579 frente a 1.135.
«La arquitectura funciona según lo previsto: en lugar del nivel general, el modelo aprende justamente la diferencia entre los mundos con intervención y sin ella», —
Grisha Kryukov.
El autor explica así la razón de la derrota del favorito: en los datos sintéticos, donde la distribución es perfecta, la ventaja la obtenía el robusto CausalForest, pero en los datos reales «sucios» ganaba la arquitectura más flexible. T-learner salió especialmente perjudicado: sus dos modelos independientes no intercambian información, y eso resultó fatal en la final.
Qué significa esto
No existe un ganador universal en el modelado uplift: en datos sintéticos limpios y muestras pequeñas gana CausalForest, mientras que en datos reales ruidosos gana X-learner. La elección del modelo debe hacerse según el dataset concreto, no según la reputación del método.
Preguntas frecuentes
¿Qué es el modelado uplift?
Es un método para estimar el efecto individual de una intervención: cuánto cambiará el comportamiento de un usuario concreto a causa de una promoción o un correo, en lugar del efecto promedio en toda la audiencia. Se aplica en marketing, retención y antifraude.
¿Qué modelo ganó el torneo de Avito?
El campeón fue X-learner: salió de la fase de grupos apenas en tercer lugar, pero ganó ambas semifinales y la final con un resultado de PEHE 0.579 frente a 1.135 de T-learner. La razón es su arquitectura, que aprende de la diferencia de efectos.
¿Qué significa la métrica PEHE?
PEHE (Precision in Estimation of Heterogeneous Effect) mide con qué precisión el modelo estima el efecto individual: cuanto más bajo el valor, más cercana está la predicción a la real. En el torneo se usó para repartir los puestos.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.