Jiqizhixin (机器之心)→ original

ByteDance et Li Han: comment faire travailler les réseaux de neurones au lieu de simplement bavarder

Nous avons trop longtemps traité les grands modèles de langage comme des moteurs de recherche avancés ou des compagnons de conversation amusants. Tandis qu'OpenAI et Google se font concurrence sur le nombre de paramètres, ByteDance a décidé qu'il était temps de passer des paroles aux actes. Le Dr Li Han, dont le nom dans le traitement du langage naturel pèse à peu près autant que toute l'infrastructure serveur d'une startup de taille moyenne, a publié un travail sur la création d'un framework universel pour les agents IA. En bref : l'ère des « simples chatbots » touche officiellement à sa fin. Vous devez comprendre le contexte. Li Han n'est pas simplement un chercheur de plus. Son parcours à travers Microsoft Research Asia et Huawei jusqu'à la direction du laboratoire IA de ByteDance montre qu'il se soucie de la puissance pratique, non de la beauté théorique.

Traité par IA depuis Jiqizhixin (机器之心) ; édité par Hamidun News
ByteDance et Li Han: comment faire travailler les réseaux de neurones au lieu de simplement bavarder
Source : Jiqizhixin (机器之心). Collage: Hamidun News.
◐ Écouter l'article

Le Dr Li Han, responsable du laboratoire d'IA de ByteDance, a publié un article sur un framework universel pour agents IA construit autour de quatre modules — perception, planification, mémoire et action. Selon Jiqizhixin (机器之心), l'objectif de ce développement est de remplacer les systèmes agentiques expérimentaux actuels comme AutoGPT et BabyAGI, qui « tombent en panne dès la deuxième étape et hallucinent dans des boucles infinies », par un outil industriel fiable.

Qui est Li Han

Li Han est une figure dont le nom, dans le monde du traitement du langage naturel, pèse, comme le dit l'article, « à peu près autant que tout le parc de serveurs d'une startup de taille moyenne ». Son parcours professionnel est passé par Microsoft Research Asia et Huawei avant qu'il n'occupe le poste de responsable du laboratoire d'IA de ByteDance. Il s'agit d'un parcours appliqué, et non d'une carrière académique : selon l'auteur de la publication, un tel profil indique que Li Han ne s'intéresse pas à l'élégance théorique des architectures, mais à leur puissance appliquée — c'est-à-dire au transfert des idées des fichiers PDF vers des produits réels.

Quatre nœuds de l'architecture

Le problème clé des modèles de langage actuels que résout ce framework est l'incapacité à planifier à l'avance : le modèle « vit l'instant présent », générant le prochain token plutôt que de construire une stratégie. L'architecture proposée se concentre sur quatre nœuds critiques — perception, planification, mémoire et action. Le modèle construit d'abord un arbre hiérarchique d'objectifs, puis utilise des outils externes pour les atteindre, en se référant constamment à sa mémoire à long terme. L'auteur de l'article décrit ainsi l'effet obtenu : cette approche transforme l'IA « d'un étudiant en lettres en un chef de projet expérimenté ».

Pourquoi cela intéresse les entreprises, et qui est le concurrent

Pour que l'IA génère de l'argent réel dans le secteur B2B, elle doit pouvoir se connecter seule au CRM, analyser des données, rédiger un rapport et l'envoyer au client sans demander d'autorisation à chaque étape — c'est précisément ce scénario que vise le framework de Li Han. ByteDance, qui gère des volumes colossaux de données et des algorithmes de recommandation complexes, est plus intéressée que quiconque par de tels systèmes autonomes. Ce développement est présenté comme un défi direct au projet AutoGen de Microsoft : si les entreprises occidentales, selon l'auteur, s'appuient plus souvent sur la « puissance brute » du calcul, ByteDance mise sur un schéma d'ingénierie structurel, élégant et évolutif.

Questions fréquentes

Qu'a proposé exactement Li Han ?

Un framework universel pour agents IA fondé sur quatre modules — perception, planification, mémoire et action. Au lieu de générer une réponse « dans l'instant », le modèle construit d'abord un arbre hiérarchique d'objectifs, puis les atteint via des outils externes, en se référant constamment à sa mémoire à long terme.

En quoi cela diffère-t-il d'AutoGPT et de BabyAGI ?

Les systèmes agentiques existants comme AutoGPT et BabyAGI, selon la description de l'article, sont instables : ils tombent en panne dès les premières étapes de l'exécution d'une tâche et se retrouvent piégés dans des boucles d'hallucination. Le framework de Li Han introduit une architecture systématique de planification et de mémoire censée transformer ces prototypes d'agents « jouets » en un outil industriel fiable.

Pourquoi cela pourrait-il représenter un défi pour

Microsoft AutoGen ?

Parce que les deux projets résolvent le même problème — la construction d'agents IA autonomes et multi-étapes —, mais, selon l'auteur de la publication, par des chemins différents : AutoGen et d'autres développements occidentaux s'appuient plus souvent sur la puissance de calcul, tandis que ByteDance, à travers Li Han, propose un schéma d'ingénierie structurel. L'issue de cette compétition dépendra de qui parviendra le plus vite à transposer l'architecture d'une publication académique vers la production.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…