Anthropic Abrió una Ventana al Pensamiento de Claude: la Herramienta Jacobian Lens Detecta Conceptos Ocultos
Anthropic presentó Jacobian Lens — una herramienta de interpretabilidad que abre la caja negra de los LLMs. La herramienta muestra qué conceptos se activan en las capas intermedias de Claude al responder una pregunta. De lo mundano a lo inusual: el modelo crea representaciones ocultas de ideas no visibles en la salida normal. Esto ofrece una visión ingenua de cómo los LLMs 'piensan'.
Procesado por IA desde MIT Technology Review; editado por Hamidun News
Anthropic ha desarrollado la técnica Jacobian lens, que proporciona la vista más clara hasta ahora de lo que sucede dentro de Claude cuando responde preguntas o realiza tareas.
Qué Encuentran
Cuando Claude responde una pregunta, el Jacobian lens muestra la activación en capas intermedias. Los resultados varían desde lo cotidiano (activación de una capa relacionada con números al resolver matemáticas) hasta lo inusual (conceptos ocultos que no aparecen en el resultado explícito).
Cómo Funciona
En lugar de revisar pesos y activaciones a ciegas, la herramienta utiliza matemáticas jacobiana (matriz de derivadas) para rastrear cómo los cambios en la entrada afectan las representaciones intermedias. Esto permite:
- Ver qué conceptos abstractos activa el modelo
- Rastrear el camino de la lógica de entrada a salida
- Entender qué cadenas incorrectas de razonamiento conducen a respuestas incorrectas
Importancia para la Seguridad
Descubrir conceptos ocultos es importante para la seguridad de la IA: si vemos que el modelo activa conceptos peligrosos, incluso si la respuesta final es segura, podemos arreglarlo.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.