SenseNova U1.5-Lite-Preview: SenseTime открыла мультимодальный ИИ с нативной генерацией изображений
SenseTime открыла исходный код SenseNova U1.5-Lite-Preview — лёгкой предварительной версии мультимодальной модели на архитектуре NEO-Unify. В отличие от пайплайнов из отдельных нейросетей, одна модель нативно работает с текстом, визуальным пониманием и генерацией пикселей. Релиз продолжает апрельский запуск SenseNova U1 с улучшенными возможностями редактирования изображений.
Procesado por IA desde Jiqizhixin (机器之心); editado por Hamidun News
SenseTime (商汤科技) publicó el código fuente de SenseNova U1.5-Lite-Preview el 3 de agosto de 2026 — una versión preliminar del modelo multimodal ligero y unificado de forma nativa, basado en la arquitectura NEO-Unify. Se trata de una continuación del lanzamiento de abril de SenseNova U1 con capacidades mejoradas de generación y edición de imágenes.
Qué es SenseNova U1 y la arquitectura NEO-Unify
En abril de 2026, SenseTime reveló por primera vez de forma completa el enfoque multimodal unificado de forma nativa basado en la arquitectura NEO-Unify. La idea clave: en lugar de una cadena de modelos especializados — una única red neuronal entrenada conjuntamente sobre tres tipos de datos de forma simultánea.
- Abril de 2026 — lanzamiento de SenseNova U1 con la primera implementación completa de NEO-Unify
- Una única red neuronal combina semántica lingüística, semántica visual y generación de píxeles
- El modelo realiza de forma nativa comprensión visual, razonamiento y generación de imágenes
- 3 de agosto de 2026 — código abierto para la versión ligera U1.5-Lite-Preview
El entrenamiento conjunto de tres modalidades permite al modelo mantener una representación unificada del contexto. Según la concepción de los desarrolladores, esto ofrece ventaja en tareas complejas en las que la comprensión de la imagen afecta directamente la calidad de la generación.
Qué cambió en U1.5 en comparación con el original
SenseNova U1.5-Lite-Preview desarrolla el U1 de abril en dos direcciones clave. Según SenseTime, en los meses posteriores al lanzamiento, el equipo se centró específicamente en mejorar la generación y edición de imágenes — estos componentes experimentaron los cambios más significativos.
"Durante los meses pasados, hemos reforzado de forma constante las
capacidades del modelo para la generación y edición de imágenes y ahora abrimos una versión preliminar del modelo ligero para la comunidad", — indicado en el comunicado oficial de SenseTime en la plataforma Jiqizhixin.
El sufijo "Lite" indica una variante ligera de la arquitectura, diseñada para una audiencia más amplia de investigadores y desarrolladores que no disponen de infraestructura potente para modelos insignia. El estado "Preview" significa que este es un lanzamiento preliminar — la versión final aún está por llegar.
Por qué la unificación nativa es mejor que un pipeline
La mayoría de los sistemas multimodales todavía funcionan como un pipeline: un bloque de comprensión de imagen convierte la imagen en texto, un modelo de lenguaje lo procesa, un bloque generativo renderiza el resultado. En cada unión se pierde contexto y se acumulan errores.
La arquitectura nativement unificada NEO-Unify elimina estas uniones: el modelo ve la tarea en su conjunto — texto, contexto visual y resultado en píxeles — y los procesa conjuntamente. Esto permite editar imágenes teniendo en cuenta un contexto visual sutil que se perdería durante la conversión a texto en el enfoque de pipeline.
Qué significa esto
El lanzamiento de código abierto de SenseNova U1.5-Lite-Preview pone los modelos multimodales unificados de forma nativa a disposición de la investigación directa. Los desarrolladores pueden estudiar la solución arquitectónica de SenseTime, ajustar el modelo con sus propios datos o utilizarlo como base para experimentos. Para SenseTime, esta es una forma de obtener retroalimentación de la comunidad antes del lanzamiento comercial final.
Preguntas frecuentes
¿Qué es la multimodalidad unificada de forma nativa?
Es un enfoque en el que una única red neuronal se entrena para trabajar simultáneamente con texto, datos visuales y generación de píxeles sin pipelines intermedios. SenseTime implementó este principio en la arquitectura NEO-Unify, a partir de abril de 2026 en el modelo SenseNova U1.
¿En qué se diferencia U1.5-Lite-Preview de SenseNova U1?
U1.5-Lite-Preview es una versión ligera con capacidades mejoradas de generación y edición de imágenes desarrolladas durante los meses posteriores al lanzamiento de abril. "Lite" significa un tamaño de modelo reducido para una audiencia más amplia; "Preview" significa que este es un lanzamiento preliminar abierto para la comunidad investigadora, no un producto comercial final.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.