Jiqizhixin (机器之心)→ original

SenseNova U1.5-Lite-Preview: SenseTime открыла мультимодальный ИИ с нативной генерацией изображений

SenseTime открыла исходный код SenseNova U1.5-Lite-Preview — лёгкой предварительной версии мультимодальной модели на архитектуре NEO-Unify. В отличие от пайплайнов из отдельных нейросетей, одна модель нативно работает с текстом, визуальным пониманием и генерацией пикселей. Релиз продолжает апрельский запуск SenseNova U1 с улучшенными возможностями редактирования изображений.

Traité par IA depuis Jiqizhixin (机器之心) ; édité par Hamidun News
SenseNova U1.5-Lite-Preview: SenseTime открыла мультимодальный ИИ с нативной генерацией изображений
Source : Jiqizhixin (机器之心). Collage: Hamidun News.
◐ Écouter l'article

SenseTime (商汤科技) a publié le code source de SenseNova U1.5-Lite-Preview le 3 août 2026 — une version préliminaire du modèle multimodal léger et nativement unifié, construit sur l'architecture NEO-Unify. Il s'agit d'une continuation du lancement d'avril de SenseNova U1 avec des capacités améliorées de génération et d'édition d'images.

Qu'est-ce que SenseNova U1 et l'architecture NEO-Unify

En avril 2026, SenseTime a révélé pour la première fois dans son intégralité l'approche multimodale nativement unifiée basée sur l'architecture NEO-Unify. L'idée clé : au lieu d'une chaîne de modèles spécialisés — un seul réseau de neurones entraîné conjointement sur trois types de données simultanément.

  • Avril 2026 — lancement de SenseNova U1 avec la première implémentation complète de NEO-Unify
  • Un seul réseau de neurones combine la sémantique linguistique, la sémantique visuelle et la génération de pixels
  • Le modèle effectue nativement la compréhension visuelle, le raisonnement et la génération d'images
  • 3 août 2026 — publication du code source de la version légère U1.5-Lite-Preview

L'entraînement conjoint sur trois modalités permet au modèle de conserver une représentation unifiée du contexte. Selon la conception des développeurs, cela procure un avantage dans les tâches complexes où la compréhension de l'image influe directement sur la qualité de la génération.

Ce qui a changé dans U1.5 par rapport à l'original

SenseNova U1.5-Lite-Preview fait progresser le U1 d'avril dans deux directions clés. Selon SenseTime, dans les mois suivant le lancement, l'équipe s'est concentrée spécifiquement sur l'amélioration de la génération et de l'édition d'images — ces composants ont subi les changements les plus importants.

«

Au cours des mois écoulés, nous avons régulièrement renforcé les capacités du modèle pour la génération et l'édition d'images et nous ouvrons désormais une version préliminaire du modèle léger à la communauté », — indiqué dans le communiqué officiel de SenseTime sur la plateforme Jiqizhixin.

Le suffixe « Lite » désigne une variante allégée de l'architecture, conçue pour un public plus large de chercheurs et de développeurs ne disposant pas d'une infrastructure puissante pour les modèles phares. Le statut « Preview » signifie qu'il s'agit d'une version préliminaire — la version finale est encore à venir.

Pourquoi l'unification native est préférable à un pipeline

La plupart des systèmes multimodaux fonctionnent encore comme un pipeline : un bloc de compréhension d'image convertit l'image en texte, un modèle de langage le traite, un bloc génératif produit le résultat. À chaque jonction, le contexte se perd et les erreurs s'accumulent.

L'architecture nativement unifiée NEO-Unify supprime ces jonctions : le modèle appréhende la tâche dans son ensemble — texte, contexte visuel et résultat en pixels — et les traite conjointement. Cela permet d'éditer des images en tenant compte d'un contexte visuel subtil qui serait perdu lors de la conversion en texte dans une approche pipeline.

Ce que cela signifie

La publication en open source de SenseNova U1.5-Lite-Preview rend les modèles multimodaux nativement unifiés accessibles pour la recherche directe. Les développeurs peuvent étudier la solution architecturale de SenseTime, affiner le modèle sur leurs propres données ou l'utiliser comme base pour des expériences. Pour SenseTime, c'est un moyen d'obtenir les retours de la communauté avant le lancement commercial final.

Questions fréquentes

Qu'est-ce que la multimodalité nativement unifiée ?

Il s'agit d'une approche dans laquelle un seul réseau de neurones est entraîné à travailler simultanément avec du texte, des données visuelles et la génération de pixels, sans pipelines intermédiaires. SenseTime a implémenté ce principe dans l'architecture NEO-Unify, à partir d'avril 2026 dans le modèle SenseNova U1.

En quoi U1.5-Lite-Preview diffère-t-il de SenseNova U1 ?

U1.5-Lite-Preview est une version allégée avec des capacités améliorées de génération et d'édition d'images développées au cours des mois suivant le lancement d'avril. « Lite » signifie une taille de modèle réduite pour un public plus large ; « Preview » signifie qu'il s'agit d'une version préliminaire ouverte à la communauté de recherche, et non d'un produit commercial final.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…