#LLM
Cobertura curada sobre «LLM»: lanzamientos, investigación, benchmarks, código abierto.

IBM y Artificial Analysis crean benchmark: agentes de IA fracasan en tareas de TI
Los grandes modelos de lenguaje obtuvieron menos del 50% en el nuevo benchmark ITBench-AA para evaluar la capacidad de los agentes de IA par

DeepSeek hace permanente el descuento del 75% en V4 Pro — los precios caen 4 veces
DeepSeek anunció que el descuento del 75% en su modelo insignia V4 Pro se vuelve permanente, complicando significativamente la lucha competi

Modelos del mundo: cómo la IA aprende a entender la realidad en lugar del texto

Anthropic en lista negra del Pentágono, pero la NSA sigue usando Claude

Fuga de Claude Code: Anthropic publicó todo el código fuente en npm público

Spotify añade generación de resúmenes con IA y Q&A para podcasts

Las herramientas de IA inundan a los mantenedores de Linux con duplicados de informes de vulnerabilidades
Los mantenedores del kernel de Linux no pueden hacer frente al flujo de informes automáticos de vulnerabilidades generados por herramientas

Por qué los chatbots RAG funcionan perfectamente en demos pero generan disparates en producción
Los bots RAG brillan en demos de documentación interna pero generan disparates con confianza en el trabajo real. Una historia sobre la brech













