Xaira представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров для поиска лекарств
Xaira Therapeutics представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров, обученную на крупнейшем полногеномном датасете пертурбаций X-Atlas/Pisces: 7 скринов, 16 биологических контекстов, 25 млн клеток. Тезис команды: каузальным моделям нужны каузальные данные, а не описательная геномика — и их приходится генерировать самим через CRISPR.
Traité par IA depuis Latent Space ; édité par Hamidun News
Xaira Therapeutics a dévoilé X-Cell le 17 mars 2026 — la première « cellule virtuelle » de l'entreprise : un modèle de 4,9 milliards de paramètres entraîné sur le plus vaste jeu de données génomique complet de perturbations cellulaires de l'histoire, X-Atlas/Pisces.
Qu'est-ce que X-Cell
X-Cell est un modèle qui prédit comment l'expression des gènes change lorsqu'on « éteint » des gènes individuels l'un après l'autre. Selon Xaira, il s'agit du plus grand modèle causal de perturbations à ce jour : il évolue selon une loi de puissance, de la même manière que les grands modèles de langage gagnent en qualité à mesure que croissent le nombre de paramètres et la puissance de calcul.
Le jeu de données d'entraînement a été constitué via des expériences CRISPR, en menant des millions de tests en parallèle.
- Lancement de X-Cell — 17 mars 2026, premier modèle de cellule virtuelle de Xaira Therapeutics
- Jeu de données X-Atlas/Pisces — 7 cribles Perturb-seq à l'échelle du génome dans 16 contextes biologiques, 25 millions de cellules après filtrage qualité
- Taille du modèle — 4,9 milliards de paramètres, le plus grand modèle causal de perturbations
- La mise à l'échelle suit une loi de puissance, comme pour les grands modèles de langage
- Le 6 juillet 2026, Bo Wang a été promu Chief AI Scientist et Si Chu Chief Discovery Officer
Pourquoi les modèles causaux ont besoin de données causales
Xaira affirme que, pour qu'un modèle prédise des relations de cause à effet, il doit être entraîné sur des données causales, et non sur une génomique purement descriptive. Les jeux de données classiques capturent des corrélations — qui se retrouve avec qui dans une cellule ; les données causales montrent ce qui se produit lorsqu'on intervient délibérément sur un gène précis.
«
Les modèles causaux ont besoin de données causales », c'est ainsi que Bo Wang (Chief AI Scientist) et Si Chu (Chief Discovery Officer) formulent la thèse centrale de leur approche dans le podcast Latent Space.
La conclusion pratique de l'entreprise : un modèle entraîné sur des données causales issues de cellules cancéreuses peut être transposé à des cellules de donneurs sains — les règles apprises restent valables.
Comment le modèle a percé le « mur des données »
La première version de X-Cell s'est heurtée à un plafond : à 3,1 milliards de paramètres, l'erreur de test cessait de baisser — le modèle saturait autour de 1,5 milliard de paramètres et ne s'améliorait plus. La cause était le manque de données informatives, et non l'architecture.
Le jeu de données X-Atlas/Pisces a apporté environ une multiplication par 30 de la densité d'information par rapport à l'approche initiale. Le modèle a ensuite recommencé à progresser avec les paramètres et le calcul, et a dépassé la référence linéaire qui surpassait jusque-là les modèles précédents. Il s'appuie sur scGPT — un modèle d'ARN antérieur de Bo Wang, publié dans Nature.
Ce que cela signifie
Xaira, une biotech IA dotée d'un capital de départ de plusieurs milliards, mise non pas sur l'algorithme mais sur les données : sa propre usine à expériences causales s'avère plus importante qu'un modèle tout fait venu d'ailleurs. C'est un renversement de la logique habituelle de l'IA, « données issues d'internet plus grand modèle » — en biologie, les données nécessaires n'existent tout simplement pas en libre accès, il faut les générer soi-même.
Questions fréquentes
Qu'est-ce que X-Cell en termes simples ?
X-Cell est une « cellule virtuelle », un modèle d'IA de 4,9 milliards de paramètres qui prédit la réaction d'une cellule à l'extinction de gènes individuels, sans mener d'expérience réelle.
Sur quoi X-Cell a-t-il été entraîné ?
Sur le jeu de données X-Atlas/Pisces : 7 cribles Perturb-seq à l'échelle du génome dans 16 contextes biologiques, 25 millions de cellules après filtrage. Selon Xaira, il s'agit du plus grand jeu de données de ce type jamais rendu public.
Qui a développé le modèle ?
Le développement a été mené par Bo Wang (Chief AI Scientist, créateur de scGPT) et Si Chu (Chief Discovery Officer) ; tous deux ont été promus le 6 juillet 2026.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.