MarkTechPost
Fuente de noticias de IA. Los artículos son seleccionados y adaptados por la redacción de Hamidun News.
Últimas publicaciones

Meta presentó Autodata — un sistema de agentes para crear datos de entrenamiento de alta calidad
Meta presentó Autodata — un framework en el que agentes LLM recopilan, verifican y mejoran datos de entrenamiento por sí mismos para que modelos más capaces aprendan con ejemplos más complejos y precisos.

NeuralSet y deep learning: decodificación de rasgos lingüísticos a partir de señales cerebrales de MEG
En un nuevo análisis de NeuralSet, se muestra cómo convertir señales de MEG sin procesar en un modelo que predice rasgos lingüísticos, incluida la longitud de la palabra, directamente a partir de la actividad cerebral.

Microsoft OpenMementos: cómo trabajar con la compresión de contexto y los datos para entrenar modelos
Un análisis paso a paso del dataset Microsoft OpenMementos muestra cómo hacer streaming de reasoning traces, analizar bloques y mementos, medir la compresión de contexto y preparar datos para fine-tuning.

Stanford presentó OpenJarvis — una stack de agentes de AI locales con memoria y aprendizaje
Stanford presentó OpenJarvis — una plataforma para agentes de AI personales que funcionan directamente en el dispositivo, usan memoria y herramientas y aprenden con datos locales.

Harry Tan lanzó gstack — un sistema de workflow para Claude Code con QA, revisión y release
Harry Tan liberó gstack como open source — un conjunto de modos para Claude Code que separa planificación, revisión, QA y release en comandos distintos y añade un navegador persistente.

Zhipu AI lanza GLM-OCR, un modelo OCR compacto de 0,9 mil millones de parámetros para documentos
Zhipu AI y la Universidad de Tsinghua presentaron GLM-OCR, un modelo OCR multimodal de 0,9 mil millones de parámetros que analiza documentos complejos, tablas y fórmulas sin depender de una escala masiva.

LangChain lanzó Deep Agents para agentes de AI de varios pasos con memoria y aislamiento
LangChain lanzó Deep Agents, una biblioteca para agentes de AI que necesitan planificación, memoria a largo plazo, contexto de archivos y aislamiento de subagentes en tareas largas.

IBM lanzó Granite 4.0 1B Speech — un modelo de voz multilingüe compacto para edge AI
IBM presentó Granite 4.0 1B Speech, un modelo ligero para reconocimiento y traducción de voz, diseñado para un despliegue rápido en entornos empresariales y de edge con recursos limitados.

Moonshot AI presentó Attention Residuals — una alternativa a las conexiones residuales en transformers
Moonshot AI propuso Attention Residuals, un reemplazo de las conexiones residuales estándar en transformers, donde la capa elige por sí misma las señales útiles mediante attention a lo largo de la profundidad de la red.

Mistral lanzó Small 4 — un modelo MoE de 119 mil millones de parámetros para reasoning, código y multimodalidad
El nuevo Mistral Small 4 combina instruct, reasoning, código y manejo de imágenes en un único modelo MoE open-source de 119 mil millones de parámetros con contexto de 256k.

Google lanzó WAXAL, un conjunto de datos abierto de habla para lenguas africanas
Google hizo público WAXAL, un gran corpus de habla para lenguas africanas que debería acelerar el reconocimiento y la síntesis de voz allí donde los datos abiertos llevaban mucho tiempo siendo críticamente escasos.

Nvidia abrió el código de OpenShell, un entorno seguro para agentes autónomos de AI
Nvidia lanzó OpenShell como open source: es un entorno con sandboxes, políticas de acceso y enrutamiento privado para que los agentes autónomos de AI trabajen con código y red de forma más segura.

Baidu lanza Qianfan-OCR — un modelo 4B para el reconocimiento y la comprensión de documentos
Baidu presentó Qianfan-OCR, un modelo 4B unificado que analiza la estructura del documento, reconoce texto y, bajo demanda, extrae tablas o responde preguntas.

MarkTechPost mostró cómo construir un sistema LLM con autoevaluación, confianza y búsqueda web
MarkTechPost presentó un esquema práctico de uncertainty-aware LLM: el modelo primero responde y estima su confianza, luego se verifica a sí mismo y activa la búsqueda web si tiene dudas.

GitAgent propone un formato unificado para agentes de AI en LangChain, AutoGen y Claude Code
GitAgent propone almacenar la lógica, la memoria y las reglas de un agente de AI en un repositorio Git y luego exportar ese mismo agente a LangChain, AutoGen, Claude Code y otros entornos.

Google lanza colab-mcp: cómo los agentes automatizan notebooks Colab en producción
Google presentó un servidor open-source colab-mcp para gestionar notebooks Colab vía MCP: los agentes pueden añadir celdas, ejecutar código y construir workflows resilientes sin rutina manual.

Yann LeCun presenta LeWorldModel — Modelo JEPA sin colapso de representaciones a partir de píxeles
El equipo de Yann LeCun presentó LeWorldModel — un world model que aprende directamente de píxeles con dos funciones de pérdida, evita el colapso de representaciones y planifica hasta 48 veces más rápido que alternativas

HKUDS Presenta OpenSpace en Detalle — Motor de Auto-Evolución de Habilidades para Agentes IA
HKUDS demostró cómo OpenSpace transforma agentes IA en sistemas autoaprendibles: el motor preserva habilidades después de cada tarea, las reutiliza y reduce significativamente el consumo de tokens.

Nvidia presentó PivotRL — un framework para agentes de IA con ahorro 4x en pasos de rollout
Nvidia presentó PivotRL — un enfoque para ajuste fino de agentes de IA que preserva calidad fuera del dominio de entrenamiento y logra precisión comparable a E2E RL con cuatro veces menos pasos de rollout.

Google presenta TurboQuant: compresión de caché KV 6x para LLMs sin pérdida de precisión
Google Research presentó TurboQuant — un algoritmo que comprime la caché KV de grandes modelos de lenguaje un mínimo de seis veces y acelera el cómputo de atención hasta 8 veces sin degradación de calidad.

MolmoWeb-4B de Ai2: Un agente web que ve sitios como humanos, sin parsing de HTML
Ai2 lanzó MolmoWeb-4B — un agente web multimodal de código abierto que controla un navegador usando solo capturas de pantalla, sin acceso a HTML ni árbol DOM.

Tencent abre el código de Covo-Audio — modelo 7B para diálogos de voz y razonamiento de audio
Tencent AI Lab ha publicado en código abierto Covo-Audio — un modelo de audio 7B que acepta habla continua, responde con voz y se orienta a diálogos y razonamiento en tiempo real.

Qwen3.5: Ejecutar Modelos de Reasoning en Formato GGUF y 4-bits a través de Colab
Se presenta un pipeline Colab para ejecutar modelos Qwen3.5 de reasoning, destilados en estilo Claude: con una configuración puedes cambiar entre GGUF de 27B y una versión ligera de 2B de 4-bits.

Google Lanza Gemini 3.1 Flash Live para Agentes IA por Voz y Diálogo Multimodal
Google abrió acceso de vista previa a Gemini 3.1 Flash Live — un modelo para agentes IA de voz y visuales con baja latencia, soporte de herramientas y diálogo más natural.

IWE y OpenAI: Cómo Convertir Notas en Markdown en un Grafo de Conocimiento para Agentes de IA
Usando IWE como ejemplo, mostramos cómo construir un grafo de conocimiento local a partir de markdown, conectar OpenAI function calling y construir un agentic RAG con traversal de relaciones entre notas.

Google explicó la diferencia entre Google-Agent y Googlebot para acceso e indexación de IA
Google describió cómo el nuevo Google-Agent se diferencia de Googlebot: el primero realiza acciones en el sitio a solicitud del usuario, el segundo rastrea automáticamente la web para indexación.

Investigadores afiliados a Amazon presentaron A-Evolve para la evolución automática de agentes de IA
Investigadores afiliados a Amazon presentaron A-Evolve — un sistema que automatiza el desarrollo de agentes de IA y reemplaza la sintonización manual con evolución de estados y autocorrección.

Agent-Infra Presenta AIO Sandbox — Entorno Unificado para Agentes IA con Navegador y Shell
Agent-Infra lanzó AIO Sandbox de código abierto — un entorno containerizado donde navegador, shell, capa de archivo compartido y MCP están integrados en un único runtime para agentes IA.

Cursor lanza SDK TypeScript para coding-agents con sandboxes en nube y facturación por tokens
Cursor abrió la versión beta pública de su SDK TypeScript: ahora los desarrolladores pueden ejecutar coding-agents localmente, en la nube o en sus propios workers—con VMs sandboxed, subagents, hooks y facturación por tok

Alibaba lanza Qwen3.5-Omni — modelo multimodal nativo para texto, audio y vídeo
Alibaba ha presentado Qwen3.5-Omni — un modelo omnimodal nativo que entiende texto, imágenes, audio y vídeo en una única arquitectura y puede responder con voz en tiempo real.