Авито устроило турнир uplift-моделей: победил X-learner, а не Causal Forest
Аналитик Авито Гриша Крюков устроил «чемпионат» среди четырёх uplift-моделей: S-learner, T-learner, X-learner и Causal Forest. Формат — групповой этап на синтетике плюс плей-офф на реальных данных, метрика PEHE. Неожиданный итог: X-learner вышел из группы лишь третьим, но выиграл оба полуфинала и финал — PEHE 0.579 против 1.135 у T-learner.
Processado por IA de Habr: Avito; editado por Hamidun News
O analista da equipe de confiança e segurança do Avito, Grisha Kryukov, organizou em julho de 2026 um "campeonato" entre quatro modelos uplift populares — S-learner, T-learner, X-learner e CausalForest — com fase de grupos e mata-mata. O ouro foi parar, surpreendentemente, com o X-learner, que saiu da fase de grupos apenas em terceiro lugar, mas venceu as duas semifinais e a final.
Para que servem os modelos uplift
A modelagem uplift estima o efeito individual de uma intervenção — o quanto o comportamento de uma pessoa específica vai mudar por causa de uma promoção, e não a reação média do grupo. A principal dificuldade é que, para um mesmo objeto, não é possível observar os dois resultados ao mesmo tempo: com intervenção e sem ela.
«O principal problema: para um mesmo jogador, nunca sabemos as duas situações ao mesmo tempo», —
Grisha Kryukov, analista da equipe de confiança e segurança do Avito.
As quatro abordagens resolvem essa tarefa de formas diferentes: o S-learner insere a flag de intervenção como um atributo comum, o T-learner treina dois modelos separados, o X-learner acrescenta treinamento sobre pseudoefeitos e ponderação por propensity, e o CausalForest constrói árvores que maximizam a diferença no efeito.
Como o torneio foi estruturado
O torneio foi composto por uma fase de grupos com dados sintéticos e por playoffs com dados reais. O autor mediu a qualidade dos modelos pela métrica PEHE (Precision in Estimation of Heterogeneous Effect) — quanto menor o valor, mais precisa a estimativa do efeito.
- Modelos: S-learner, T-learner, X-learner, CausalForest
- Métrica — PEHE, pontos no grupo por colocação: 3-2-1-0
- Fase de grupos — dados sintéticos, 5000 observações, 10 atributos, divisão 70/30
- Semifinais — dataset Hillstrom Mine That Data, 64 mil clientes de e-commerce
- Final — dataset FIFA21, cerca de 10 mil jogadores de futebol e 26 atributos
Ao final das três rodadas de grupo, o CausalForest liderava com 6 pontos, S-learner e X-learner somaram 5 cada, e o T-learner fechou a tabela com 2 pontos.
Por que o X-learner venceu
O X-learner venceu porque sua arquitetura aprende justamente a diferença entre os cenários com intervenção e sem ela, e não o nível geral de resposta. Na semifinal, ele arrasou o S-learner (PEHE 0.215 contra 0.747), e na final superou o T-learner com resultado de PEHE 0.579 contra 1.135.
«A arquitetura funciona conforme o previsto: em vez do nível geral, o modelo aprende justamente a diferença entre os mundos com intervenção e sem ela», —
Grisha Kryukov.
O autor explica assim o motivo da derrota do favorito: nos dados sintéticos, em que a distribuição é perfeita, a vantagem ficava com o robusto CausalForest, mas nos dados reais "sujos" vencia a arquitetura mais flexível. O T-learner saiu especialmente prejudicado: seus dois modelos independentes não trocam informação entre si, e isso foi fatal na final.
O que isso significa
Não existe um vencedor universal na modelagem uplift: em dados sintéticos limpos e amostras pequenas, vence o CausalForest, enquanto em dados reais e ruidosos, vence o X-learner. A escolha do modelo deve ser feita de acordo com o dataset específico, e não pela reputação do método.
Perguntas frequentes
O que é modelagem uplift?
É um método de avaliação do efeito individual de uma intervenção — o quanto o comportamento de um usuário específico vai mudar por causa de uma promoção ou de um e-mail, e não o efeito médio em toda a audiência. É aplicado em marketing, retenção e antifraude.
Qual modelo venceu o torneio do Avito?
O campeão foi o X-learner: ele saiu da fase de grupos apenas em terceiro lugar, mas venceu as duas semifinais e a final com resultado de PEHE 0.579 contra 1.135 do T-learner. O motivo é a arquitetura, que aprende a partir da diferença de efeitos.
O que significa a métrica PEHE?
A PEHE (Precision in Estimation of Heterogeneous Effect) mede o quão precisamente o modelo estima o efeito individual: quanto menor o valor, mais próxima a previsão está da real. No torneio, ela foi usada para distribuir as colocações.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.