Обучают ли ИИ-лаборатории модели под тест «пеликан на велосипеде»: разбор pelicanmaxxing
Исследователь Дилан Кастильо проверил популярную гипотезу: не обучают ли AI-лаборатории модели специально хорошо рисовать пеликана на велосипеде — ненаучный бенчмарк Саймона Уиллисона. Он прогнал 48 промптов (8 животных × 6 видов транспорта) трижды через 7 моделей и оценил итог ещё двумя. Вывод: следов такой подгонки нет. Ближе всех подошла GLM-5.2, но эффект мал и статистически незначим.
Procesado por IA desde Simon Willison; editado por Hamidun News
El 22 de julio de 2026, el desarrollador Dylan Castillo publicó un estudio que pone a prueba la hipótesis del "pelicanmaxxing": si los laboratorios de IA entrenan específicamente a sus modelos para dibujar de forma bonita un pelícano en bicicleta para el benchmark no científico de Simon Willison. Castillo ejecutó 48 prompts tres veces en 7 modelos y no encontró rastro de ese ajuste.
Qué es el benchmark "pelícano en bicicleta"
El benchmark "pelícano en bicicleta" es una prueba personal e informal de Simon Willison, en la que pide a cada nuevo modelo de lenguaje que genere un dibujo SVG de un pelícano montado en una bicicleta. El propio Willison lo llama "profundamente no científico", pero en un par de años la prueba se volvió tan reconocible en la comunidad que surgió la sospecha: los laboratorios podrían haber empezado a optimizar sus modelos específicamente para superarla y así lucir bien. Este fenómeno recibió el nombre jocoso de pelicanmaxxing (en el texto de Castillo, pelimaxxing).
Cómo está diseñado el experimento
Castillo construyó una cuadrícula de 8 animales y 6 tipos de transporte —48 combinaciones de prompts— y ejecutó cada una tres veces en 7 modelos distintos. Esta matriz permite comparar si los modelos dibujan el par "pelícano + bicicleta" de forma anómalamente mejor que cualquier otra combinación, como "flamenco en patinete" o "garza en barca".
- Fecha de publicación: 22 de julio de 2026
- 8 animales × 6 tipos de transporte = 48 prompts, cada uno ejecutado 3 veces
- Se probaron 7 modelos: GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen 3.7-Max, GLM-5.2 y DeepSeek V4 Pro
- Dos modelos independientes evaluaron los resultados: GPT-5.6 Luna y Gemini 3.1 Flash-Lite
- Para ver todas las generaciones, el autor reunió una cuadrícula interactiva con filtros
¿Se encontraron rastros de ajuste?
Castillo no encontró rastros de pelicanmaxxing en ninguna de las cinco líneas de verificación. Los pelícanos en bicicleta no se ven mejor que otras escenas, los pelícanos no se dibujan con más cuidado que otros animales, las bicicletas no se dibujan con más cuidado que otros medios de transporte, y la combinación en sí no resulta mejor de lo que predicen las habilidades individuales del modelo, incluso ajustando por dificultad. La quinta comprobación mostró que las escenas no parecen memorizadas de memoria.
La que más se acercó a una anomalía fue GLM-5.2: registró el mayor incremento de calidad justo en la celda "pelícano + bicicleta", y su primera muestra ya llamó la atención del autor. Pero, según los datos de Castillo, el efecto sigue siendo pequeño y estadísticamente no significativo.
"GLM-5.2 fue la que más se acercó: tiene el mayor incremento justo en la celda de 'pelícano en bicicleta'.
Pero el efecto es pequeño y estadísticamente no significativo, así que yo no le daría mucho peso", — Dylan Castillo, autor del estudio.
Qué significa esto
Simon Willison, cuyo benchmark dio origen a toda la discusión, calificó el trabajo de Castillo de "excelente" y señaló que él mismo antes solo comprobaba los modelos de forma selectiva, sin tanta metodología. La conclusión del estudio tranquiliza a los escépticos: por ahora no hay datos de que los laboratorios estén "haciendo trampa" para una prueba viral concreta; los modelos dibujan al pelícano en bicicleta exactamente en la medida en que lo permiten sus habilidades generales de generación.
Preguntas frecuentes
¿Qué es el pelicanmaxxing?
Es la suposición de que los laboratorios de IA entrenan deliberadamente a sus modelos para superar bien, específicamente, la prueba del "pelícano en bicicleta" de Simon Willison. El estudio de Dylan Castillo del 22 de julio de 2026 no encontró confirmación de esto.
¿Qué modelos obtuvieron el mejor resultado?
Según la matriz de 48 prompts, el que más se acercó a un resultado "sospechoso" fue GLM-5.2, con el mayor incremento en el par "pelícano + bicicleta". Sin embargo, el efecto no es estadísticamente significativo, por lo que el autor no lo considera prueba de ajuste.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.