Jiqizhixin (机器之心)→ original

SenseNova U1.5-Lite-Preview: SenseTime открыла мультимодальный ИИ с нативной генерацией изображений

SenseTime открыла исходный код SenseNova U1.5-Lite-Preview — лёгкой предварительной версии мультимодальной модели на архитектуре NEO-Unify. В отличие от пайплайнов из отдельных нейросетей, одна модель нативно работает с текстом, визуальным пониманием и генерацией пикселей. Релиз продолжает апрельский запуск SenseNova U1 с улучшенными возможностями редактирования изображений.

Processado por IA de Jiqizhixin (机器之心); editado por Hamidun News
SenseNova U1.5-Lite-Preview: SenseTime открыла мультимодальный ИИ с нативной генерацией изображений
Fonte: Jiqizhixin (机器之心). Colagem: Hamidun News.
◐ Ouvir artigo

A SenseTime (商汤科技) publicou o código-fonte do SenseNova U1.5-Lite-Preview em 3 de agosto de 2026 — uma versão preliminar do modelo multimodal leve e nativamente unificado, baseado na arquitetura NEO-Unify. Trata-se de uma continuação do lançamento de abril do SenseNova U1, com capacidades aprimoradas de geração e edição de imagens.

O que é o SenseNova U1 e a arquitetura NEO-Unify

Em abril de 2026, a SenseTime revelou pela primeira vez de forma completa a abordagem multimodal nativamente unificada baseada na arquitetura NEO-Unify. A ideia central: em vez de uma cadeia de modelos especializados — uma única rede neural treinada conjuntamente em três tipos de dados de forma simultânea.

  • Abril de 2026 — lançamento do SenseNova U1 com a primeira implementação completa do NEO-Unify
  • Uma única rede neural combina semântica linguística, semântica visual e geração de pixels
  • O modelo realiza nativamente compreensão visual, raciocínio e geração de imagens
  • 3 de agosto de 2026 — código aberto para a versão leve U1.5-Lite-Preview

O treinamento conjunto de três modalidades permite ao modelo manter uma representação unificada do contexto. Segundo a concepção dos desenvolvedores, isso oferece vantagem em tarefas complexas nas quais a compreensão da imagem afeta diretamente a qualidade da geração.

O que mudou no U1.5 em comparação com o original

O SenseNova U1.5-Lite-Preview desenvolve o U1 de abril em duas direções principais. Segundo a SenseTime, nos meses seguintes ao lançamento, a equipe se concentrou especificamente na melhoria da geração e edição de imagens — esses componentes sofreram as maiores mudanças.

"Ao longo dos meses passados, fortalecemos consistentemente as

capacidades do modelo para geração e edição de imagens e agora abrimos uma versão preliminar do modelo leve para a comunidade", — declarado no comunicado oficial da SenseTime na plataforma Jiqizhixin.

O sufixo "Lite" indica uma variante mais leve da arquitetura, projetada para um público mais amplo de pesquisadores e desenvolvedores que não dispõem de infraestrutura poderosa para modelos principais. O status "Preview" significa que este é um lançamento preliminar — a versão final ainda está por vir.

Por que a unificação nativa é melhor do que um pipeline

A maioria dos sistemas multimodais ainda funciona como um pipeline: um bloco de compreensão de imagem converte a imagem em texto, um modelo de linguagem o processa, um bloco generativo renderiza o resultado. Em cada junção, o contexto se perde e os erros se acumulam.

A arquitetura nativamente unificada NEO-Unify elimina essas junções: o modelo vê a tarefa como um todo — texto, contexto visual e resultado em pixels — e os processa conjuntamente. Isso permite editar imagens levando em conta um contexto visual sutil que se perderia durante a conversão para texto na abordagem de pipeline.

O que isso significa

O lançamento de código aberto do SenseNova U1.5-Lite-Preview torna os modelos multimodais nativamente unificados disponíveis para pesquisa direta. Os desenvolvedores podem estudar a solução arquitetônica da SenseTime, ajustar o modelo em seus próprios dados ou utilizá-lo como base para experimentos. Para a SenseTime, esta é uma forma de obter feedback da comunidade antes do lançamento comercial final.

Perguntas frequentes

O que é multimodalidade nativamente unificada?

É uma abordagem na qual uma única rede neural é treinada para trabalhar simultaneamente com texto, dados visuais e geração de pixels sem pipelines intermediários. A SenseTime implementou esse princípio na arquitetura NEO-Unify, a partir de abril de 2026 no modelo SenseNova U1.

Como o U1.5-Lite-Preview difere do SenseNova U1?

O U1.5-Lite-Preview é uma versão leve com capacidades aprimoradas de geração e edição de imagens desenvolvidas nos meses seguintes ao lançamento de abril. "Lite" significa tamanho de modelo reduzido para um público mais amplo; "Preview" significa que este é um lançamento preliminar aberto para a comunidade de pesquisa, e não um produto comercial final.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…