Latent Space→ original

Xaira представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров для поиска лекарств

Xaira Therapeutics представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров, обученную на крупнейшем полногеномном датасете пертурбаций X-Atlas/Pisces: 7 скринов, 16 биологических контекстов, 25 млн клеток. Тезис команды: каузальным моделям нужны каузальные данные, а не описательная геномика — и их приходится генерировать самим через CRISPR.

Processado por IA de Latent Space; editado por Hamidun News
Xaira представила X-Cell — «виртуальную клетку» на 4,9 млрд параметров для поиска лекарств
Fonte: Latent Space. Colagem: Hamidun News.
◐ Ouvir artigo

A Xaira Therapeutics apresentou a X-Cell em 17 de março de 2026 — a primeira "célula virtual" da empresa: um modelo de 4,9 bilhões de parâmetros treinado no maior conjunto de dados genômico completo de perturbações celulares da história, o X-Atlas/Pisces.

O que é a X-Cell

A X-Cell é um modelo que prevê como a expressão gênica muda quando genes individuais são "desligados" um de cada vez. Segundo a Xaira, é o maior modelo causal de perturbações até hoje: ele escala segundo uma lei de potência, da mesma forma que os grandes modelos de linguagem melhoram a qualidade à medida que crescem o número de parâmetros e o poder computacional.

O conjunto de dados de treinamento foi reunido por meio de experimentos com CRISPR, rodando milhões de testes em paralelo.

  • Lançamento da X-Cell — 17 de março de 2026, primeiro modelo de célula virtual da Xaira Therapeutics
  • Conjunto de dados X-Atlas/Pisces — 7 triagens (screens) Perturb-seq de genoma completo em 16 contextos biológicos, 25 milhões de células após a filtragem de qualidade
  • Tamanho do modelo — 4,9 bilhões de parâmetros, o maior modelo causal de perturbações
  • O escalonamento segue uma lei de potência, assim como nos grandes modelos de linguagem
  • Em 6 de julho de 2026, Bo Wang foi promovido a Chief AI Scientist e Si Chu a Chief Discovery Officer

Por que modelos causais precisam de dados causais

A Xaira defende que, para que um modelo preveja relações de causa e efeito, ele precisa ser treinado com dados causais, e não com genômica meramente descritiva. Conjuntos de dados comuns captam correlações — quem se encontra com quem dentro de uma célula; dados causais mostram o que acontece quando se intervém deliberadamente em um gene específico.

"Modelos causais precisam de dados causais" — é assim que

Bo Wang (Chief AI Scientist) e Si Chu (Chief Discovery Officer) formulam a tese central de sua abordagem no podcast Latent Space.

A conclusão prática da empresa: um modelo treinado com dados causais de células cancerígenas pode ser transferido para células saudáveis de doadores — as regras aprendidas continuam válidas.

Como o modelo rompeu o "muro de dados"

A primeira versão da X-Cell esbarrou em um teto: com 3,1 bilhões de parâmetros, o erro de teste parava de cair — o modelo saturava por volta de 1,5 bilhão de parâmetros e não melhorava além disso. A causa era a falta de dados informativos, não a arquitetura.

O conjunto de dados X-Atlas/Pisces trouxe um aumento de cerca de 30 vezes na densidade de informação em comparação com a abordagem original. Depois disso, o modelo voltou a crescer junto com os parâmetros e o poder computacional, e superou a linha de base linear que até então havia superado os modelos anteriores. A base é o scGPT — um modelo de RNA anterior de Bo Wang, publicado na Nature.

O que isso significa

A Xaira, uma biotech de IA com capital inicial bilionário, aposta não no algoritmo, mas nos dados: sua própria fábrica de experimentos causais acaba sendo mais importante do que um modelo pronto de terceiros. Isso inverte a lógica usual da IA de "dados da internet mais um modelo grande" — em biologia, os dados necessários simplesmente não existem em acesso aberto, e é preciso gerá-los internamente.

Perguntas frequentes

O que é a X-Cell em termos simples?

A X-Cell é uma "célula virtual", um modelo de IA com 4,9 bilhões de parâmetros que prevê a reação de uma célula ao desligamento de genes individuais, sem realizar um experimento real.

Com que dados a X-Cell foi treinada?

Com o conjunto de dados X-Atlas/Pisces: 7 triagens Perturb-seq de genoma completo em 16 contextos biológicos, 25 milhões de células após a filtragem. Segundo a Xaira, é o maior conjunto desse tipo já divulgado.

Quem desenvolveu o modelo?

O desenvolvimento foi conduzido por Bo Wang (Chief AI Scientist, criador do scGPT) e Si Chu (Chief Discovery Officer); ambos foram promovidos em 6 de julho de 2026.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…