Simon Willison→ original

Обучают ли ИИ-лаборатории модели под тест «пеликан на велосипеде»: разбор pelicanmaxxing

Исследователь Дилан Кастильо проверил популярную гипотезу: не обучают ли AI-лаборатории модели специально хорошо рисовать пеликана на велосипеде — ненаучный бенчмарк Саймона Уиллисона. Он прогнал 48 промптов (8 животных × 6 видов транспорта) трижды через 7 моделей и оценил итог ещё двумя. Вывод: следов такой подгонки нет. Ближе всех подошла GLM-5.2, но эффект мал и статистически незначим.

Traité par IA depuis Simon Willison ; édité par Hamidun News
Обучают ли ИИ-лаборатории модели под тест «пеликан на велосипеде»: разбор pelicanmaxxing
Source : Simon Willison. Collage: Hamidun News.
◐ Écouter l'article

Le 22 juillet 2026, le développeur Dylan Castillo a publié une étude testant l'hypothèse du « pelicanmaxxing » — les laboratoires d'IA entraînent-ils spécifiquement leurs modèles à dessiner joliment un pélican à vélo pour le benchmark non scientifique de Simon Willison. Castillo a fait tourner 48 prompts trois fois sur 7 modèles et n'a trouvé aucune trace d'un tel ajustement.

Qu'est-ce que le benchmark « pélican à vélo »

Le benchmark « pélican à vélo » est un test personnel et informel de Simon Willison, dans lequel il demande à chaque nouveau modèle de langage de générer un dessin SVG d'un pélican à vélo. Willison lui-même le qualifie de « profondément non scientifique », mais en quelques années le test est devenu si reconnaissable dans la communauté qu'un soupçon est apparu : les laboratoires auraient pu commencer à optimiser leurs modèles spécifiquement pour lui, afin de paraître performants. Ce phénomène a reçu le nom humoristique de pelicanmaxxing (dans le texte de Castillo — pelimaxxing).

Comment l'expérience est construite

Castillo a construit une grille de 8 animaux et 6 types de transport — 48 combinaisons de prompts — et a fait tourner chacune trois fois sur 7 modèles différents. Cette matrice permet de comparer si les modèles dessinent la paire « pélican + vélo » de façon anormalement meilleure que n'importe quelle autre combinaison, comme « flamant en trottinette » ou « héron en barque ».

  • Date de publication : 22 juillet 2026
  • 8 animaux × 6 types de transport = 48 prompts, chacun exécuté 3 fois
  • 7 modèles ont été testés : GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen 3.7-Max, GLM-5.2 et DeepSeek V4 Pro
  • Deux modèles distincts ont évalué les résultats — GPT-5.6 Luna et Gemini 3.1 Flash-Lite
  • Pour parcourir toutes les générations, l'auteur a assemblé une grille interactive avec des filtres

A-t-on trouvé des traces d'ajustement ?

Castillo n'a trouvé aucune trace de pelicanmaxxing sur aucune des cinq lignes de vérification. Les pélicans à vélo n'ont pas l'air meilleurs que les autres scènes, les pélicans ne sont pas dessinés plus soigneusement que les autres animaux, les vélos ne sont pas dessinés plus soigneusement que les autres moyens de transport, et la combinaison elle-même ne s'en sort pas mieux que ce que prédisent les compétences individuelles du modèle, même en corrigeant pour la difficulté. La cinquième vérification a montré que les scènes ne semblent pas apprises par cœur.

C'est GLM-5.2 qui s'est le plus rapprochée d'une anomalie : elle affiche le plus grand gain de qualité justement sur la cellule « pélican + vélo », et son tout premier échantillon avait déjà attiré l'attention de l'auteur. Mais, selon les données de Castillo, l'effet reste faible et statistiquement non significatif.

« GLM-5.2 s'est le plus rapprochée : elle a le plus grand gain justement sur la cellule "pélican à vélo".

Mais l'effet est faible et statistiquement non significatif, donc je ne lui accorderais pas beaucoup de poids », — Dylan Castillo, auteur de l'étude.

Ce que cela signifie

Simon Willison, dont le benchmark est à l'origine de toute la discussion, a qualifié le travail de Castillo d'« excellent » et a noté que lui-même ne vérifiait auparavant les modèles que de façon sélective, sans une telle méthodologie. La conclusion de l'étude rassure les sceptiques : il n'existe pour l'instant aucune donnée montrant que les laboratoires « trichent » pour un test viral précis — les modèles dessinent le pélican à vélo exactement dans la mesure où leurs compétences générales de génération le permettent.

Questions fréquentes

Qu'est-ce que le pelicanmaxxing ?

C'est l'hypothèse selon laquelle les laboratoires d'IA entraîneraient délibérément leurs modèles à bien réussir précisément le test du « pélican à vélo » de Simon Willison. L'étude de Dylan Castillo du 22 juillet 2026 n'en a trouvé aucune confirmation.

Quels modèles ont obtenu le meilleur résultat ?

Sur la matrice de 48 prompts, c'est GLM-5.2 qui s'est le plus rapprochée d'un résultat « suspect » — avec le gain maximal sur la paire « pélican + vélo ». Cependant, l'effet n'est pas statistiquement significatif, donc l'auteur ne le considère pas comme une preuve d'ajustement.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…