arXiv cs.LG→ original

Могут ли трансформеры выбирать модель? Байесовский тест arXiv на 2,8M параметров

Трансформер на 2,8 млн параметров научился байесовскому выбору модели — определять, из какого класса гипотез пришли данные — с точностью до 0,01 бита от оптимума. Но как только для различения классов нужна арифметика (сложение или умножение по модулю), модель справляется только с числовыми токенами и полностью проваливается на абстрактных символах. Граница держится даже при росте сети до 316 млн параметров.

Procesado por IA desde arXiv cs.LG; editado por Hamidun News
Могут ли трансформеры выбирать модель? Байесовский тест arXiv на 2,8M параметров
Fuente: arXiv cs.LG. Collage: Hamidun News.
◐ Escuchar artículo

Un transformer de 2,8 millones de parámetros ha aprendido selección bayesiana de modelos — determinar de qué clase de hipótesis se generaron los datos — con una discrepancia de solo 0,01 bits respecto al óptimo teórico. Así lo demuestra el artículo "Bayesian Wind Tunnels for Model Selection", publicado en arXiv en julio de 2026.

Qué son los "túneles de viento bayesianos"

Los "túneles de viento bayesianos" son entornos controlados donde la distribución posterior exacta sobre las clases de hipótesis se conoce en forma cerrada, de modo que la respuesta del modelo se compara directamente con el óptimo bayesiano. Ya se había demostrado que los transformers realizan un filtrado bayesiano exacto dentro de una única clase de hipótesis fija. La nueva pregunta de los autores es si el modelo puede elegir él mismo la clase, es decir, reconocer qué estructura generó los datos.

Las tareas se basan en involuciones sin puntos fijos — funciones con la propiedad f(f(x))=x, que es puramente relacional. El transformer alcanza concordancia con el óptimo incluso cuando los símbolos son opacos y sus valores cambian en cada episodio. Trabajar con símbolos opacos es importante: elimina las pistas a las que el modelo podría "aferrarse" y deja solo la estructura de la tarea.

  • Modelo — un transformer de 2,8 millones de parámetros, probado con 3 seeds
  • Concordancia de entropía con el óptimo bayesiano — 0,01 bits
  • Comparación non-nested (involuciones frente a ciclos de 3) — error MAE del posterior por debajo de 0,001
  • El límite en tareas aritméticas se mantiene al escalar 112 veces (2,8M → 316M parámetros)
  • Brecha de calibración frente a los LLM actuales — alrededor de 55×

Dónde falla la selección de modelos

La selección de modelos falla por completo cuando las clases solo se distinguen mediante aritmética — suma o multiplicación módulo n: en ese caso el transformer maneja bien los tokens enteros, pero falla con símbolos opacos. Según la anotación del artículo, este límite se mantiene al aumentar el modelo 112 veces — de 2,8 a 316 millones de parámetros —, por lo que no se trata del tamaño de la red.

El diagnóstico de subtareas localizó el fallo: surge en la composición de la inversión del encabezado con la aritmética, no en el análisis del encabezado en sí.

La clave está en la semántica estable

La causa del fallo no está en los números en sí, sino en la estabilidad de los valores. Un experimento de control sobre estacionariedad mostró que los tokens opacos con un reetiquetado fijo producen un error de solo 0,009 bits, es decir, funcionan tan bien como los números enteros.

"Una semántica estable, y no una identidad entera, es lo que permite

compilar un esquema computacional", se afirma en la anotación del artículo en arXiv.

La prueba de los LLM de vanguardia actuales en las mismas tareas reveló un comportamiento cualitativamente bayesiano, pero con una brecha de calibración mucho mayor — alrededor de 55×; los autores subrayan que esta estimación se obtuvo mediante sondeos "con pérdida" y, por tanto, marca una dirección y no una cifra exacta.

Qué significa esto

El trabajo traza un límite concreto de las capacidades de los transformers: saben elegir un modelo, pero solo cuando el rasgo distintivo tiene acceso estable a la semántica. Es un punto de referencia para la interpretabilidad mecanicista: muestra qué esquemas computacionales es capaz de "compilar" la red y cuáles permanecen fuera de su alcance, independientemente del número de parámetros.

Preguntas frecuentes

¿Qué es la selección bayesiana de modelos?

Es la capacidad de determinar de qué clase de hipótesis provienen los datos, en lugar de simplemente estimar parámetros dentro de una única clase. En el artículo, el transformer compara, por ejemplo, involuciones con ciclos de 3 y produce un posterior con un error por debajo de 0,001.

¿Por qué el modelo falla en aritmética?

Cuando el rasgo que distingue las clases requiere suma o multiplicación módulo n, el transformer solo funciona con tokens enteros y falla por completo con símbolos abstractos. El control mostró que lo decisivo es la estabilidad de la semántica de los tokens, no su naturaleza numérica.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…