Xaira представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров для поиска лекарств
Xaira Therapeutics представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров, обученную на крупнейшем полногеномном датасете пертурбаций X-Atlas/Pisces: 7 скринов, 16 биологических контекстов, 25 млн клеток. Тезис команды: каузальным моделям нужны каузальные данные, а не описательная геномика — и их приходится генерировать самим через CRISPR.
Processado por IA de Latent Space; editado por Hamidun News
A Xaira Therapeutics apresentou a X-Cell em 17 de março de 2026 — a primeira "célula virtual" da empresa: um modelo de 4,9 bilhões de parâmetros treinado no maior conjunto de dados genômico completo de perturbações celulares da história, o X-Atlas/Pisces.
O que é a X-Cell
A X-Cell é um modelo que prevê como a expressão gênica muda quando genes individuais são "desligados" um de cada vez. Segundo a Xaira, é o maior modelo causal de perturbações até hoje: ele escala segundo uma lei de potência, da mesma forma que os grandes modelos de linguagem melhoram a qualidade à medida que crescem o número de parâmetros e o poder computacional.
O conjunto de dados de treinamento foi reunido por meio de experimentos com CRISPR, rodando milhões de testes em paralelo.
- Lançamento da X-Cell — 17 de março de 2026, primeiro modelo de célula virtual da Xaira Therapeutics
- Conjunto de dados X-Atlas/Pisces — 7 triagens (screens) Perturb-seq de genoma completo em 16 contextos biológicos, 25 milhões de células após a filtragem de qualidade
- Tamanho do modelo — 4,9 bilhões de parâmetros, o maior modelo causal de perturbações
- O escalonamento segue uma lei de potência, assim como nos grandes modelos de linguagem
- Em 6 de julho de 2026, Bo Wang foi promovido a Chief AI Scientist e Si Chu a Chief Discovery Officer
Por que modelos causais precisam de dados causais
A Xaira defende que, para que um modelo preveja relações de causa e efeito, ele precisa ser treinado com dados causais, e não com genômica meramente descritiva. Conjuntos de dados comuns captam correlações — quem se encontra com quem dentro de uma célula; dados causais mostram o que acontece quando se intervém deliberadamente em um gene específico.
"Modelos causais precisam de dados causais" — é assim que
Bo Wang (Chief AI Scientist) e Si Chu (Chief Discovery Officer) formulam a tese central de sua abordagem no podcast Latent Space.
A conclusão prática da empresa: um modelo treinado com dados causais de células cancerígenas pode ser transferido para células saudáveis de doadores — as regras aprendidas continuam válidas.
Como o modelo rompeu o "muro de dados"
A primeira versão da X-Cell esbarrou em um teto: com 3,1 bilhões de parâmetros, o erro de teste parava de cair — o modelo saturava por volta de 1,5 bilhão de parâmetros e não melhorava além disso. A causa era a falta de dados informativos, não a arquitetura.
O conjunto de dados X-Atlas/Pisces trouxe um aumento de cerca de 30 vezes na densidade de informação em comparação com a abordagem original. Depois disso, o modelo voltou a crescer junto com os parâmetros e o poder computacional, e superou a linha de base linear que até então havia superado os modelos anteriores. A base é o scGPT — um modelo de RNA anterior de Bo Wang, publicado na Nature.
O que isso significa
A Xaira, uma biotech de IA com capital inicial bilionário, aposta não no algoritmo, mas nos dados: sua própria fábrica de experimentos causais acaba sendo mais importante do que um modelo pronto de terceiros. Isso inverte a lógica usual da IA de "dados da internet mais um modelo grande" — em biologia, os dados necessários simplesmente não existem em acesso aberto, e é preciso gerá-los internamente.
Perguntas frequentes
O que é a X-Cell em termos simples?
A X-Cell é uma "célula virtual", um modelo de IA com 4,9 bilhões de parâmetros que prevê a reação de uma célula ao desligamento de genes individuais, sem realizar um experimento real.
Com que dados a X-Cell foi treinada?
Com o conjunto de dados X-Atlas/Pisces: 7 triagens Perturb-seq de genoma completo em 16 contextos biológicos, 25 milhões de células após a filtragem. Segundo a Xaira, é o maior conjunto desse tipo já divulgado.
Quem desenvolveu o modelo?
O desenvolvimento foi conduzido por Bo Wang (Chief AI Scientist, criador do scGPT) e Si Chu (Chief Discovery Officer); ambos foram promovidos em 6 de julho de 2026.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.