Hugging Face Blog
Fuente de noticias de IA. Los artículos son seleccionados y adaptados por la redacción de Hamidun News.
Últimas publicaciones

NVIDIA abre los datasets Nemotron: 10 billones de tokens para entrenar agentes de AI
NVIDIA lanzó los datasets Nemotron con más de 10 billones de tokens y 2,4 mil millones de personas sintéticas para entrenar agentes de AI en escenarios reales y fallos de herramientas.

Hugging Face: el backend de transformers en vLLM ya funciona a velocidad nativa
Hugging Face anunció paridad de rendimiento: la flag `--model-impl transformers` ofrece la velocidad nativa de vLLM en más de 450 arquitecturas sin reescribir código.

SkyPilot y Hugging Face lanzaron almacenamiento sin cargos por tráfico de salida
La integración de SkyPilot y Hugging Face Storage permite entrenar modelos en cualquier nube, almacenando pesos y datasets por $12-18/TB/mes sin cargos por tráfico de salida.

Microsoft lanzó Foundry Managed Compute: miles de modelos Hugging Face con un clic
Microsoft combinó Azure Foundry con el catálogo Hugging Face: miles de modelos abiertos se despliegan ahora en la nube con un clic, con seguridad empresarial y facturación unificada.

LeRobot v0.6.0 de Hugging Face: los robots aprenden a predecir el futuro y evaluarse a sí mismos
Hugging Face lanzó LeRobot v0.6.0 con políticas world-model, modelos de recompensa para autoevaluación de tareas y seis nuevos benchmarks — completando el ciclo completo de aprendizaje de robots.

Hugging Face actualiza Kernels: publicadores confiables, firma de código y desarrollo basado en agentes
El 6 de julio de 2026, Hugging Face lanzó una actualización importante de Kernels: los kernels se convirtieron en un tipo de repositorio separado en Hub, se añadieron publicadores confiables y firma de código vía Sigstor

Hugging Face y Cerebras lanzan Gemma 4 para AI de voz en tiempo real
Hugging Face y Cerebras presentaron un pipeline abierto de voz a voz con Gemma 4 y latencias predecibles — el sistema ya se utiliza en más de 9.000 robots Reachy Mini.

Hugging Face compara todas las alternativas a LoRA: quién gana en el ajuste fino de LLM
El equipo de Hugging Face probó cinco métodos PEFT de ajuste fino de LLM —de DoRA a GaLore— y descubrió cuándo se puede superar a LoRA y a qué costo exacto.

ServiceNow: un agente de IA filtra secretos corporativos mediante una cadena de consultas de búsqueda
Investigadores de ServiceNow demostraron que un agente de deep-research revela secretos corporativos sin querer: cada consulta es inofensiva por separado, pero toda la cadena forma un mosaico.

PaddleOCR lanza PP-OCRv6: reconocimiento de texto en 50 idiomas de 1,5 a 34,5 millones de parámetros
PP-OCRv6 de Baidu PaddlePaddle: un OCR universal para 50 idiomas en tres configuraciones de 1,5 a 34,5 millones de parámetros, con una mejora de precisión de +4,6-5,1 puntos porcentuales respecto a la versión de servidor

Los modelos híbridos predicen mejor las palabras de contenido que los transformers — estudio de Allen AI
Allen AI comparó las arquitecturas OLMo 3 y OLMo Hybrid: los modelos híbridos predicen con mayor precisión sustantivos, verbos y adjetivos, pero quedan por detrás de los transformers en fragmentos repetitivos de texto.

Hugging Face: ahora se puede lanzar un servidor vLLM en HF Jobs con un solo comando
Hugging Face añadió soporte para vLLM a la plataforma HF Jobs: ahora, un servidor de inferencia listo para producción para cualquier modelo del Hub puede desplegarse con un solo comando en la CLI.

AllenAI Lanza olmo-eval — Una Plataforma para Evaluar LLMs Durante el Entrenamiento
AllenAI lanzó olmo-eval, un kit de herramientas abierto para la evaluación continua de modelos de lenguaje durante todo el ciclo de entrenamiento — punto de control a punto de control.

Cohere presentó North Mini Code — un modelo para desarrolladores y agentes de IA
Cohere lanzó North Mini Code, un modelo de 30 mil millones de parámetros específicamente entrenado en programación e interacción con agentes de IA. El modelo es gratuito y está disponible para todos.

Los agentes de voz no están preparados para clientes bilingües. Investigación ServiceNow-AI
Los agentes de voz tienen un desempeño deficiente con clientes bilingües. Esto fue demostrado por una investigación del equipo ServiceNow-AI, que probó siete sistemas populares de reconocimiento de…

Cómo acelerar modelos PyTorch: guía práctica de torch.profiler
Hugging Face habló sobre torch.profiler, una herramienta integrada en PyTorch para análisis de rendimiento. Ayuda a encontrar cuellos de botella en el entrenamiento e inferencia de modelos.

Hugging Face enseñó a TRL a entregar un billón de parámetros a través de pesos delta
Hugging Face agregó Delta Weight Sync a TRL — una técnica que envía solo cambios de pesos, reduciendo el volumen de datos cientos de veces al entrenar modelos gigantes.

Reachy Mini aprendió a hablar localmente sin la nube
El robot humanoide Reachy Mini ahora puede ejecutar toda la pila de reconocimiento de voz localmente, sin la nube ni API, gracias a los modelos abiertos de Hugging Face.

IBM y Artificial Analysis crean benchmark: agentes de IA fracasan en tareas de TI
Los grandes modelos de lenguaje obtuvieron menos del 50% en el nuevo benchmark ITBench-AA para evaluar la capacidad de los agentes de IA para resolver tareas corporativas de TI. Esto muestra que la automatización complet

NVIDIA Nemotron: los modelos de difusión generan texto 6 veces más rápido
NVIDIA presentó Nemotron-Labs Diffusion, los primeros modelos de lenguaje que generan texto en paralelo en lugar de secuencialmente. En modo de autoespeculación, funcionan 6 veces más rápido que los modelos convencionale

Cómo un pequeño modelo superó a GPT-5 y Claude Opus en OCR de portugués
Un modelo especializado de 3 mil millones de parámetros de Dharma AI superó a todos los modelos frontier comerciales en OCR de portugués. Y fue 52 veces más barato que ellos.

Hugging Face lanzó Open Agent Leaderboard para evaluar agentes de AI
Hugging Face presentó un benchmark abierto para comparar sistemas completos de agentes de AI. Mostró que la arquitectura del agente importa más que el modelo elegido.

PaddleOCR 3.5 recibe soporte para Transformers de Hugging Face
PaddleOCR se actualizó con soporte completo para Hugging Face Transformers como backend de inferencia. Ahora el reconocimiento de texto y análisis de documentos funcionan en un entorno PyTorch.

NVIDIA mostró una forma eficiente de entrenar Cosmos en video robótico a través de LoRA
NVIDIA lanzó una guía para fine-tuning del modelo Cosmos Predict 2.5 a través de LoRA/DoRA — un método de adaptación paramétrica eficiente que permite entrenar en 17 horas con una única GPU.

Ettin Reranker de Hugging Face: 6 modelos para reranking preciso de búsqueda
Hugging Face lanzó 6 rerankers Ettin basados en ModernBERT con precisión y velocidad de última generación gracias a Flash Attention 2 y optimización de secuencias.

OlmoEarth v1.1: Allen AI lanzó modelos satelitales 3 veces más baratos
Allen AI presentó una versión más eficiente de modelos para análisis de imágenes satelitales, reduciendo los costos computacionales 3 veces manteniendo la calidad.

Cómo el modelo de Allen AI aprendió a descubrir por sí solo la especialización de los expertos
Allen AI presentó EMO, un modelo basado en una mezcla de expertos que desarrolla de forma natural una especialización por áreas (salud, política, cine) sin entrenamiento explícito en esas categorías.

CyberSecQwen-4B: cómo un modelo pequeño se convirtió en experto en vulnerabilidades
El modelo especializado de ciberseguridad de 4 mil millones de parámetros supera a competidores de propósito general en el análisis de vulnerabilidades y funciona localmente en hardware personal sin servicios en la nube.

OncoAgent: sistema de AI para la detección temprana del cáncer basado en datos privados de pacientes
Cómo un algoritmo de aprendizaje automático ayuda a los médicos a tomar decisiones sobre el diagnóstico del cáncer sin comprometer la confidencialidad de los pacientes

Hugging Face aceleró la inferencia de LLM un 22% con batching asíncrono
El procesamiento paralelo de CPU y GPU, en lugar del secuencial, eliminó un 24% del tiempo ocioso de la GPU y aceleró la generación de tokens casi un cuarto sin cambiar el modelo.