Yandex Lavka Resolveu o Problema do Loop de Recomendações com Exploração Personalizada
Ramil Boyarchenkov, engenheiro de aprendizado de máquina do Yandex Lavka, descreveu no Habr como o serviço enfrentou o problema de loop de recomendação — quando o sistema prevê as escolhas do usuário com muita precisão e para de mostrar itens novos. A equipe construiu um mecanismo de exploração personalizado: a probabilidade de mostrar novos produtos é calculada individualmente para cada usuário.
Processado por IA de Habr AI; editado por Hamidun News
Ramil Boyarchenkov, especialista em aprendizado de máquina no time do Yandex Lavka, explicou no Habr como o serviço lidou com o problema de loops de feedback de recomendação — um efeito em que um sistema de recomendação bem treinado se torna prisioneiro de sua própria precisão.
O Problema Com Boas Recomendações
Segundo o autor, quanto mais precisamente o sistema prevê o que um usuário colocará em seu carrinho, menos frequentemente mostra algo desconhecido — afinal, é mais lucrativo sugerir produtos comprovados do ponto de vista de vendas de curto prazo. Com o tempo, o sistema de recomendação fica preso em hábitos de usuário já estabelecidos e deixa de empurrar o usuário além desses hábitos, mesmo quando os interesses do usuário mudam. O sistema simplesmente não percebe essas mudanças porque não vê sinais além do conjunto familiar de produtos.
Uma tentativa de resolver esse problema de frente — adicionar produtos desconhecidos aos resultados — quase sempre prejudica as métricas: o volume de compras imediatas inevitavelmente diminui se você sugerir ao usuário algo em que o sistema não tem certeza.
Como o Novo Mecanismo Funciona
O time do Yandex Lavka construiu um mecanismo que adiciona produtos desconhecidos não aleatoriamente, mas pessoalmente — para aqueles usuários que estão estatisticamente dispostos a experimentar algo novo.
- Produtos desconhecidos são adicionados pessoalmente, não uniformemente para todos os usuários
- Para cada usuário, uma probabilidade individual de mostrar novos itens é calculada
- O time calibrou a "agressividade" da exploração — o equilíbrio entre o risco de mostrar uma novidade malsucedida e o benefício de expandir horizontes de recomendação
- O autor do material — Ramil Boyarchenkov, engenheiro de aprendizado de máquina no Yandex Lavka
A ideia é direcionar a exploração para onde o benefício potencial de apresentar o usuário a um novo produto é maior que a provável perda de curto prazo em vendas — em vez de adicionar uniformemente e portanto mais arriscadamente novidades em toda a audiência.
Por Que Isso Não Pode Ser Resolvido Com Uma Fórmula
O equilíbrio entre exploração (tentar mostrar aos usuários algo novo, arriscando precisão) e exploração (confiar em preferências já comprovadas) é um problema clássico familiar a qualquer sistema de recomendação, de serviços de música em streaming a mercados. Formalmente pode ser descrito matematicamente, mas na prática a configuração correta depende das especificidades de um negócio particular: em entrega de produtos, onde as decisões de compra são tomadas rapidamente e emocionalmente, uma exploração muito agressiva corre o risco de decepcionar o usuário com um produto desconhecido e desapetitoso, enquanto uma exploração muito cautelosa deixa o sistema trancado em sortimento já familiar. É por isso que o time do Yandex Lavka teve que calibrar empiricamente o grau de agressividade da exploração em vez de pegar uma solução universal pronta.
Como Isso Se Parece para o Usuário Final
Do ponto de vista de um comprador do Yandex Lavka, as mudanças não são diretamente perceptíveis: ele simplesmente vê de vez em quando na seleção de recomendações um produto que não tinha comprado anteriormente e possivelmente nem procurou. Mas por trás dessa única exibição há um cálculo da probabilidade de que esse usuário em particular esteja pronto para tentar algo novo sem se decepcionar com o serviço. Tal personalização de exploração direcionada distingue a abordagem do Yandex Lavka de esquemas mais grosseiros onde novidades são simplesmente adicionadas uniformemente ao feed para todos os usuários seguidos, perdendo algumas vendas para aqueles que não recebem bem tais experimentos.
O Que Isso Significa
Este caso é um exemplo característico de como uma tarefa familiar a qualquer sistema de recomendação — o equilíbrio entre exploração e exploração — é resolvida não por uma fórmula abstrata, mas por calibração prática para um negócio específico e usuário específico. A personalização da exploração permite expandir horizontes de recomendação sem sacrificar vendas de curto prazo, e tal abordagem é aplicável muito além da entrega de produtos — em qualquer serviço onde um sistema de recomendação corre o risco de ficar preso em produtos já familiares para o usuário.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.