MarkTechPost→ original

Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding

Tencent открыл AngelSpec — torch-native фреймворк для обучения draft-моделей, ускоряющих инференс больших языковых моделей через speculative decoding. Вместо одной универсальной модели он обучает две: MTP для диалогов и block-parallel для кода и математики. На тесте средний уровень принятия черновых токенов вырос с 52,8% до 66,4%, а качество ответов не меняется — метод lossless.

Procesado por IA desde MarkTechPost; editado por Hamidun News
Tencent открыл AngelSpec: фреймворк для ускорения инференса LLM через speculative decoding
Fuente: MarkTechPost. Collage: Hamidun News.
◐ Escuchar artículo

Tencent liberó el código fuente de AngelSpec el 30 de julio de 2026 — un framework torch-native para entrenar modelos borrador (draft) de speculative decoding que, en los modelos Hy3, elevó la tasa media de aceptación de los tokens propuestos del 52,8% al 66,4% sin pérdida de calidad en la generación.

Qué es el speculative decoding

El speculative decoding es una forma de acelerar la generación de un modelo de lenguaje grande sin perder calidad en la respuesta. Un modelo borrador ligero propone varios tokens futuros a la vez, y el modelo principal (target) los verifica todos en un solo paso mediante rejection sampling. El método es lossless: el texto final coincide con el que habría generado el modelo principal por sí solo. La aceleración depende de dos factores: cuántos tokens borrador se aceptan y cuánto dura el ciclo completo de "borrador — verificación".

  • Fecha de lanzamiento: 30 de julio de 2026, licencia open source
  • Framework torch-native, funciona con modelos de la familia Hy3
  • Cubre dos enfoques: MTP autorregresivo y la familia block-parallel DFlash (DFly, D-cut)
  • Tasa media de aceptación de tokens: 52,8% → 66,4% con T=0
  • Longitud media del borrador aceptado: 2,58 → 2,99 tokens

Por qué un único modelo universal pierde

Un único modelo borrador universal pierde porque el tráfico real es heterogéneo, y dos métricas de velocidad tiran en direcciones opuestas. En un diálogo abierto con alta entropía son válidas decenas de continuaciones, por lo que la aceptación cae rápidamente con la profundidad de la propuesta: generar un bloque largo no resulta rentable. El código y las matemáticas se comportan de otra manera: la sintaxis, los identificadores repetidos y los desarrollos paso a paso restringen mucho más los tokens futuros y crean tramos largos y predecibles.

Por eso AngelSpec entrega dos modelos borrador en lugar de un único compromiso: el MTP se entrena con datos de diálogo diversos, mientras que el block-diffusion se refuerza con ejemplos de código y matemáticas.

«AngelSpec trata la heterogeneidad de la carga de trabajo como una restricción de diseño de primer nivel», señala el análisis de

MarkTechPost.

Cómo funciona la vía MTP

La vía MTP resuelve el desajuste entre entrenamiento e inferencia mediante un esquema con parámetros compartidos y varias profundidades. El modelo original Hy3 se entrenó con una única capa MTP sin desenrollado recurrente, por lo que en la segunda y tercera posición del borrador los tokens se aceptaban notablemente peor. AngelSpec mantiene D profundidades lógicas, pero reutiliza un único bloque MTP físico, desenrollándolo en D pasos durante el entrenamiento. Siguiendo el principio Training-Time Test de EAGLE-3, la profundidad k+1 recibe no el token de referencia, sino la predicción argmax de la profundidad k. Además, el backbone principal y la cabeza de lenguaje están congelados, y el entrenamiento se realiza sobre las salidas del propio modelo target.

El efecto se concentra justo donde hace falta. Según datos de Tencent, en el benchmark GSM8K la aceptación en la tercera posición pasó de 0,290 a 0,706, y en HumanEval de 0,387 a 0,757, mientras que la primera posición apenas cambió (0,799 → 0,814).

Qué significa esto

AngelSpec demuestra que resulta más rentable construir la aceleración de la inferencia no en función de un benchmark promediado, sino de la heterogeneidad real de la carga: con distintos modelos borrador para diálogos y para código. Para los equipos que operan LLM en producción, esta es una herramienta abierta para extraer más velocidad del mismo hardware sin sacrificar la calidad.

Preguntas frecuentes

¿Qué es el speculative decoding en términos simples?

Es un método para acelerar los LLM en el que un modelo pequeño adivina varios tokens siguientes por adelantado, y un modelo grande los verifica en un solo paso. Si el acierto es correcto, la generación va más rápido; la calidad del texto no cambia.

¿En qué se diferencia AngelSpec de un único modelo borrador?

AngelSpec entrena dos modelos especializados: MTP para diálogos de alta entropía y block-parallel para código y matemáticas con tramos largos y predecibles. Según las mediciones de Tencent, esto elevó la tasa media de aceptación de tokens del 52,8% al 66,4%.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…