#LLM
Cobertura curada sobre «LLM»: lançamentos, pesquisa, benchmarks, código aberto.

IBM e Artificial Analysis criam benchmark: agentes de IA fracassam em tarefas de TI
Grandes modelos de linguagem obtiveram menos de 50% no novo benchmark ITBench-AA para avaliar a capacidade de agentes de IA em resolver tare

DeepSeek torna desconto de 75% no V4 Pro permanente — preços caem 4 vezes
DeepSeek anunciou que o desconto de 75% em seu modelo flagship V4 Pro se torna permanente, complicando significativamente a luta dos concorr

Modelos do mundo: como a IA aprende a entender a realidade em vez de texto

Anthropic na lista negra do Pentágono, mas NSA segue usando Claude

Vazamento do Claude Code: Anthropic expôs todo o código-fonte no npm público

Spotify adicionou geração de resumos por IA e Q&A para podcasts

Ferramentas de IA inundam mantenedores do Linux com duplicatas de relatórios de vulnerabilidades
Os mantenedores do kernel do Linux não conseguem lidar com o fluxo de relatórios automáticos de vulnerabilidades gerados por ferramentas de

Por que chatbots RAG funcionam perfeitamente em demos mas geram disparates em produção
Bots RAG brilham em demos de documentação interna mas na prática real geram disparates com segurança. Uma história sobre a lacuna entre cinc













