Apple ML Research→ original

Apple ML Research: cómo los modelos de difusión aprenden a seleccionar tokens sin heurísticas manuales

Los modelos de lenguaje por difusión (dLLMs) ya igualan a los modelos tipo GPT en calidad, pero persiste un problema clave: cómo seleccionar qué token revelar en cada paso. Apple ML Research propone sustituir heurísticas manuales como confidence thresholding por políticas aprendidas, para que el modelo aprenda estrategias óptimas por sí solo, sin ajuste manual de parámetros para cada tarea.

Procesado por IA desde Apple ML Research; editado por Hamidun News
Apple ML Research: cómo los modelos de difusión aprenden a seleccionar tokens sin heurísticas manuales
Fuente: Apple ML Research. Collage: Hamidun News.
◐ Escuchar artículo

Investigación de Apple ML: Cómo los Modelos de Difusión Aprenden a Seleccionar Tokens Sin Heurísticas Manuales

Apple ML Research publicó en julio de 2026 un estudio sobre el entrenamiento de políticas de revelación de tokens para modelos de lenguaje por difusión: en lugar de heurísticas manuales que requieren ajuste y muestran resultados inestables, se propone entrenar el proceso de selección de tokens en sí.

¿Qué Son los Modelos de Lenguaje por Difusión?

Los modelos de lenguaje por difusión (dLLMs) difieren fundamentalmente de las arquitecturas autorregresivas familiares como GPT o Claude. Un modelo autorregresivo construye el texto secuencialmente — token por token de izquierda a derecha. Un modelo de difusión funciona de manera diferente: comienza con texto completamente "enmascarado" e iterativamente "revela" posiciones durante varios pasos. Según Apple ML Research, los dLLMs modernos en muchas tareas prácticas ya son comparables en calidad con modelos autorregresivos — mientras prometen ventajas en velocidad de inferencia. Como el modelo puede revelar múltiples tokens en un solo paso, teóricamente se puede lograr un rendimiento más alto con costos computacionales menores.

Por Qué la Selección de Tokens lo Decide Todo

En cada paso de difusión, el modelo debe responder la pregunta: ¿cuál de los tokens enmascarados restantes debe revelarse a continuación? Esta pregunta aparentemente técnica afecta directamente tanto la calidad del texto generado como la velocidad de operación. Un enfoque ingenuo — selección aleatoria de tokens — resulta ser la peor estrategia. Los investigadores de Apple encontraron que la heurística confidence thresholding da resultados significativamente mejores: el modelo prioriza abrir posiciones donde su confianza (puntuación de probabilidad) es más alta.

Hechos clave sobre las heurísticas actuales:

  • Confidence thresholding mejora la calidad de la muestra en comparación con la revelación aleatoria
  • La estrategia aumenta el rendimiento de tokens — el número de tokens por unidad de tiempo
  • La desventaja es la necesidad de ajuste manual de parámetros para cada tarea
  • El rendimiento de la heurística es inestable y varía según la aplicación

Qué Propone Apple en Lugar de Reglas Manuales

La idea central del trabajo es reemplazar heurísticas fijas con una política de revelación entrenable. En lugar de que un desarrollador seleccione manualmente valores umbral y ajuste parámetros para cada escenario, el modelo en sí aprende la estrategia óptima de selección de tokens.

"Tales heurísticas tienen desventajas: requieren ajuste manual, y su rendimiento..." — de la anotación del estudio de

Apple ML Research.

El principio no es nuevo en aprendizaje automático: reemplazar heurísticas humanas con estrategias automáticamente optimizadas es el camino estándar de "ajuste manual" a "aprendizaje de datos". Aplicado a modelos de difusión, tal enfoque potencialmente descubre estrategias de revelación de tokens que un desarrollador humano no habría pensado de antemano, y no requiere recalibración al cambiar a nuevas tareas.

Lo Que Esto Significa

Los modelos de lenguaje por difusión atraen atención como uno de los enfoques alternativos prometedores para la arquitectura de modelos de lenguaje grande — especialmente desde la perspectiva de la eficiencia de inferencia. Si las políticas de revelación de tokens pueden entrenarse automáticamente y consistentemente superan las heurísticas manuales, esto eliminará la barrera práctica clave para aplicar dLLMs en condiciones industriales, donde el costo y la velocidad de generación son críticos.

Preguntas Frecuentes

¿Cómo Difieren los Modelos de Lenguaje por Difusión de GPT?

Los modelos autorregresivos como GPT generan texto secuencialmente — un token a la vez. Los modelos de lenguaje por difusión comienzan con texto completamente enmascarado e iterativamente lo "revelan" en varios pasos, permitiendo el procesamiento paralelo de múltiples posiciones y potencialmente acelerando la inferencia.

¿Qué Es Confidence Thresholding en el Contexto de dLLMs?

Esta es una heurística donde en cada paso de difusión, el modelo primero abre la posición donde su confianza es más alta. Apple ML Research muestra que esto mejora tanto la calidad del texto como la velocidad de generación en comparación con la revelación aleatoria — pero requiere ajuste manual de parámetros.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…