Xaira представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров для поиска лекарств
Xaira Therapeutics представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров, обученную на крупнейшем полногеномном датасете пертурбаций X-Atlas/Pisces: 7 скринов, 16 биологических контекстов, 25 млн клеток. Тезис команды: каузальным моделям нужны каузальные данные, а не описательная геномика — и их приходится генерировать самим через CRISPR.
Procesado por IA desde Latent Space; editado por Hamidun News
Xaira Therapeutics presentó X-Cell el 17 de marzo de 2026, la primera "célula virtual" de la compañía: un modelo de 4900 millones de parámetros entrenado con el mayor conjunto de datos genómico completo de perturbaciones celulares de la historia, X-Atlas/Pisces.
Qué es X-Cell
X-Cell es un modelo que predice cómo cambia la expresión génica cuando se "desactivan" genes individuales, uno a la vez. Según Xaira, es el mayor modelo causal de perturbaciones hasta la fecha: escala según una ley de potencia, del mismo modo en que los grandes modelos de lenguaje mejoran su calidad a medida que aumentan los parámetros y el cómputo.
El conjunto de datos de entrenamiento se recopiló mediante experimentos CRISPR, ejecutando millones de pruebas en paralelo.
- Lanzamiento de X-Cell — 17 de marzo de 2026, primer modelo de célula virtual de Xaira Therapeutics
- Conjunto de datos X-Atlas/Pisces — 7 cribados Perturb-seq de genoma completo en 16 contextos biológicos, 25 millones de células tras el filtrado de calidad
- Tamaño del modelo — 4900 millones de parámetros, el mayor modelo causal de perturbaciones
- El escalado sigue una ley de potencia, como en los grandes modelos de lenguaje
- El 6 de julio de 2026, Bo Wang fue ascendido a Chief AI Scientist y Si Chu a Chief Discovery Officer
Por qué los modelos causales necesitan datos causales
Xaira sostiene que, para que un modelo prediga relaciones de causa y efecto, debe entrenarse con datos causales y no con genómica meramente descriptiva. Los conjuntos de datos habituales captan correlaciones —qué elementos coinciden en una célula—; los datos causales muestran qué ocurre cuando se interviene deliberadamente sobre un gen concreto.
"Los modelos causales necesitan datos causales", así formulan
Bo Wang (Chief AI Scientist) y Si Chu (Chief Discovery Officer) la tesis central de su enfoque en el podcast Latent Space.
La conclusión práctica de la compañía: un modelo entrenado con datos causales de células cancerosas puede transferirse a células de donantes sanos, ya que las reglas aprendidas se mantienen.
Cómo el modelo rompió el "muro de datos"
La primera versión de X-Cell chocó con un techo: con 3100 millones de parámetros, el error de prueba dejaba de reducirse —el modelo se saturaba en torno a los 1500 millones de parámetros y no mejoraba más—. La causa era la falta de datos informativos, no la arquitectura.
El conjunto de datos X-Atlas/Pisces aportó un aumento de aproximadamente 30 veces en la densidad de información respecto al enfoque original. A partir de ahí, el modelo volvió a escalar junto con los parámetros y el cómputo, y superó a la línea base lineal que hasta entonces había superado a los modelos anteriores. Se basa en scGPT, el modelo de ARN anterior de Bo Wang, publicado en Nature.
Qué significa esto
Xaira, una biotecnológica de IA con miles de millones en capital inicial, apuesta no por el algoritmo sino por los datos: su propia fábrica de experimentos causales resulta más importante que un modelo ajeno ya hecho. Esto invierte la lógica habitual de la IA de "datos de internet más un modelo grande": en biología, los datos necesarios simplemente no existen en abierto y hay que generarlos internamente.
Preguntas frecuentes
¿Qué es X-Cell en pocas palabras?
X-Cell es una "célula virtual", un modelo de IA de 4900 millones de parámetros que predice la reacción de una célula al apagado de genes individuales, sin necesidad de realizar un experimento real.
¿Con qué se entrenó X-Cell?
Con el conjunto de datos X-Atlas/Pisces: 7 cribados Perturb-seq de genoma completo en 16 contextos biológicos, 25 millones de células tras el filtrado. Según Xaira, es el mayor conjunto de este tipo jamás revelado.
¿Quién desarrolló el modelo?
El desarrollo estuvo a cargo de Bo Wang (Chief AI Scientist, creador de scGPT) y Si Chu (Chief Discovery Officer); ambos fueron ascendidos el 6 de julio de 2026.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.