Simon Willison→ original

Обучают ли ИИ-лаборатории модели под тест «пеликан на велосипеде»: разбор pelicanmaxxing

Исследователь Дилан Кастильо проверил популярную гипотезу: не обучают ли AI-лаборатории модели специально хорошо рисовать пеликана на велосипеде — ненаучный бенчмарк Саймона Уиллисона. Он прогнал 48 промптов (8 животных × 6 видов транспорта) трижды через 7 моделей и оценил итог ещё двумя. Вывод: следов такой подгонки нет. Ближе всех подошла GLM-5.2, но эффект мал и статистически незначим.

Processado por IA de Simon Willison; editado por Hamidun News
Обучают ли ИИ-лаборатории модели под тест «пеликан на велосипеде»: разбор pelicanmaxxing
Fonte: Simon Willison. Colagem: Hamidun News.
◐ Ouvir artigo

Em 22 de julho de 2026, o desenvolvedor Dylan Castillo publicou um estudo que testa a hipótese do "pelicanmaxxing" — se os laboratórios de IA treinam especificamente seus modelos para desenhar de forma bonita um pelicano de bicicleta para o benchmark não científico de Simon Willison. Castillo rodou 48 prompts três vezes em 7 modelos e não encontrou nenhum vestígio desse ajuste.

O que é o benchmark "pelicano de bicicleta"

O benchmark "pelicano de bicicleta" é um teste pessoal e informal de Simon Willison, no qual ele pede a cada novo modelo de linguagem que gere um desenho SVG de um pelicano andando de bicicleta. O próprio Willison o chama de "profundamente não científico", mas, ao longo de alguns anos, o teste se tornou tão reconhecível na comunidade que surgiu a suspeita: os laboratórios poderiam ter começado a otimizar seus modelos especificamente para ele, a fim de parecerem bem-sucedidos. Esse fenômeno ganhou o nome jocoso de pelicanmaxxing (no texto de Castillo, pelimaxxing).

Como o experimento foi montado

Castillo construiu uma grade de 8 animais e 6 tipos de transporte — 48 combinações de prompts — e rodou cada uma três vezes em 7 modelos diferentes. Essa matriz permite comparar se os modelos desenham o par "pelicano + bicicleta" de forma anormalmente melhor do que qualquer outra combinação, como "flamingo de patinete" ou "garça de barco".

  • Data de publicação: 22 de julho de 2026
  • 8 animais × 6 tipos de transporte = 48 prompts, cada um rodado 3 vezes
  • Foram testados 7 modelos: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen 3.7-Max, GLM-5.2 e DeepSeek V4 Pro
  • Dois modelos separados avaliaram os resultados — GPT-5.6 Luna e Gemini 3.1 Flash-Lite
  • Para visualizar todas as gerações, o autor montou uma grade interativa com filtros

Foram encontrados vestígios de ajuste?

Castillo não encontrou vestígios de pelicanmaxxing em nenhuma das cinco linhas de verificação. Pelicanos de bicicleta não parecem melhores do que outras cenas, pelicanos não são desenhados com mais capricho do que outros animais, bicicletas não são desenhadas com mais capricho do que outros meios de transporte, e a própria combinação não sai melhor do que o previsto pelas habilidades individuais do modelo, mesmo ajustando pela dificuldade. A quinta verificação mostrou que as cenas não parecem decoradas de memória.

A que mais se aproximou de uma anomalia foi a GLM-5.2: ela registrou o maior ganho de qualidade justamente na célula "pelicano + bicicleta", e sua primeira amostra já chamou a atenção do autor. Mas, segundo os dados de Castillo, o efeito continua pequeno e estatisticamente não significativo.

"A GLM-5.2 foi a que mais se aproximou: ela tem o maior ganho justamente na célula do 'pelicano de bicicleta'.

Mas o efeito é pequeno e estatisticamente não significativo, então eu não daria muito peso a isso", — Dylan Castillo, autor do estudo.

O que isso significa

Simon Willison, cujo benchmark deu origem a toda a discussão, chamou o trabalho de Castillo de "excelente" e observou que ele próprio antes só verificava os modelos de forma seletiva, sem tanta metodologia. A conclusão do estudo tranquiliza os céticos: por enquanto não há dados de que os laboratórios estejam "colando" para um teste viral específico — os modelos desenham o pelicano de bicicleta exatamente na medida em que suas habilidades gerais de geração permitem.

Perguntas frequentes

O que é pelicanmaxxing?

É a suposição de que os laboratórios de IA treinam deliberadamente seus modelos para se sair bem justamente no teste do "pelicano de bicicleta" de Simon Willison. O estudo de Dylan Castillo de 22 de julho de 2026 não encontrou confirmação disso.

Quais modelos apresentaram o melhor resultado?

Na matriz de 48 prompts, o que mais se aproximou de um resultado "suspeito" foi a GLM-5.2 — com o ganho máximo no par "pelicano + bicicleta". No entanto, o efeito não é estatisticamente significativo, então o autor não o considera prova de ajuste.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…