Habr AI→ original

Anthropic Encontró Patrones Neurales en Claude Similares a un \'Espacio de Trabajo Global\'

El 6 de julio de 2026, Anthropic publicó en transformer-circuits.pub el estudio \'Las Representaciones Verbalizables Forman un Espacio de Trabajo Global en Modelos de Lenguaje\'. Los investigadores demostraron: modelos de lenguaje como Claude poseen un pequeño conjunto de patrones neurales internos que pueden expresarse en palabras y controlarse — a diferencia del resto del procesamiento, que ocurre automáticamente.

Procesado por IA desde Habr AI; editado por Hamidun News
Anthropic Encontró Patrones Neurales en Claude Similares a un \'Espacio de Trabajo Global\'
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Anthropic publicó un estudio el 6 de julio de 2026 en su sitio web transformer-circuits.pub titulado "Verbalizable Representations Form a Global Workspace in Language Models" — sobre cómo los modelos de lenguaje como Claude forman una estructura estructuralmente similar a lo que los neurocientíficos llaman el espacio de trabajo global de la conciencia.

Lo que descubrió Anthropic

Los autores del estudio parten de una analogía con el cerebro humano. Mientras un humano lee una oración, el cerebro realiza simultáneamente docenas de procesos que la persona no nota: mantiene la postura, regula la respiración, convierte líneas en la pantalla en palabras reconocibles. Pero parte de esta actividad sigue siendo accesible para la conciencia — una imagen surgida, una decisión considerada, dirección de la atención. Los neurocientíficos llaman a tal actividad conscientemente accesible y la distinguen de los procesos automáticos: tiene propiedades especiales — puede describirse con palabras, puede ser controlada, y el razonamiento puede basarse en ella.

  • Fecha de publicación — 6 de julio de 2026
  • Editorial — Anthropic, desarrollador de la familia de modelos Claude
  • Título del trabajo — Verbalizable Representations Form a Global Workspace in Language Models
  • Lugar de publicación — transformer-circuits.pub, sección de investigación de Anthropic sobre interpretabilidad de modelos

Según el estudio, se encontró una división similar en los modelos de lenguaje: el modelo encontró un pequeño conjunto de patrones neurales internos que, frente a todo lo otro procesamiento, juegan un papel especial — pueden expresarse con palabras (verbalizable), a diferencia de un volumen mucho mayor de cálculos internos que permanecen completamente "no verbalizables" y fluyen por sí solos, análogamente a los procesos automáticos en el cerebro.

Por qué es importante para la interpretabilidad de la IA

Anthropic ha estudiado durante mucho tiempo la estructura interna de sus modelos como parte de un programa de interpretabilidad mecanística — intentos de entender qué sucede exactamente dentro de una red neuronal entre el texto de entrada y la respuesta de salida, en lugar de solo evaluar el modelo por sus respuestas desde afuera. El descubrimiento de una estructura análoga a un espacio de trabajo global proporciona a los investigadores una nueva herramienta: si parte de las representaciones internas del modelo está realmente estructurada como un subsistema "reportable", esto abre una forma más precisa de verificar qué "sabe" realmente el modelo y puede reportar sobre sus propios estados internos, y qué permanece oculto incluso del modelo mismo. Esta distinción es especialmente importante dado que los modelos de lenguaje se utilizan cada vez más en escenarios donde necesitan no solo proporcionar una respuesta, sino explicar el curso de su razonamiento — por ejemplo, en cadenas de pensamiento (chain-of-thought) o cuando se pide a un modelo que explique por qué tomó una decisión particular.

Lo que esto significa

El estudio no afirma que los modelos de lenguaje tengan conciencia en el sentido humano — muestra una analogía estructural: un pequeño conjunto verificable de representaciones internas separadas del resto del procesamiento automático. Para la interpretabilidad de la IA, este es un paso significativo: entender qué parte de los procesos internos del modelo son en principio accesibles para verificación e informe verbal, y cuál no, afecta directamente cuánto puede confiar en las explicaciones que el modelo da sobre su propio razonamiento.

Preguntas frecuentes

¿Cuándo se publicó el estudio de

Anthropic sobre el espacio de trabajo global en LLMs?

El estudio "Verbalizable Representations Form a Global Workspace in Language Models" fue publicado por Anthropic el 6 de julio de 2026 en el sitio web transformer-circuits.pub.

¿Qué es un espacio de trabajo global en el contexto de los modelos de lenguaje?

Este es un pequeño conjunto de patrones neurales internos de un modelo que pueden expresarse con palabras y que pueden ser controlados — por analogía con la parte de la función cerebral humana que es conscientemente accesible, a diferencia de los procesos automáticos que ocurren sin atención.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…