#LLM
Sélection de matériaux sur «LLM»: sorties, recherche, benchmarks, open-source.

IBM et Artificial Analysis créent un benchmark : les agents d'IA échouent aux tâches informatiques
Les grands modèles de langage ont obtenu moins de 50% au nouveau benchmark ITBench-AA pour évaluer la capacité des agents d'IA à résoudre le

DeepSeek rend permanente la réduction de 75% sur V4 Pro — les prix baissent de 4 fois
DeepSeek a annoncé que la réduction de 75% sur son modèle phare V4 Pro devient permanente, compliquant significativement la lutte des concur

Les modèles du monde: comment l'IA apprend à comprendre la réalité plutôt que le texte

Anthropic sur la liste noire du Pentagone, mais la NSA continue d'utiliser Claude

Fuite de Claude Code : Anthropic a publié tout le code source sur npm public

Spotify ajoute des résumés et Q&A générés par IA pour les podcasts

Les outils IA submergent les mainteneurs de Linux avec des rapports de vulnérabilités en doublon
Les mainteneurs du noyau Linux font face à un flux croissant de rapports de vulnérabilités automatisés générés par les outils IA de recherch

Pourquoi les chatbots RAG fonctionnent parfaitement en démo mais produisent du charabia en production
Les bots RAG brillent sur les démos de documentation interne mais génèrent confidemment du charabia dans le travail réel. Une histoire sur l













