Seguridad

IA Constitucional

IA Constitucional es un método de entrenamiento desarrollado por Anthropic en el cual un modelo de IA critica y revisa sus propias salidas de acuerdo con un conjunto escrito de principios, reduciendo la dependencia de anotaciones humanas a gran escala para filtrar comportamiento dañino.

IA Constitucional (IAC) es una técnica de entrenamiento de alineación y seguridad introducida por Anthropic en un artículo de diciembre de 2022. En lugar de confiar enteramente en evaluadores humanos para identificar salidas dañinas, IAC integra una lista de principios—la constitución—directamente en el bucle de entrenamiento. Estos principios pueden incluir directrices como evitar contenido que facilite actividades ilegales o instrucciones derivadas de documentos como la Declaración Universal de Derechos Humanos de la ONU.

El entrenamiento procede en dos etapas. En la etapa de aprendizaje supervisado, el modelo genera respuestas a prompts potencialmente dañinos, luego usa los principios constitucionales para criticar cada respuesta y producir una versión revisada. Estas salidas autorevisadas se convierten en un nuevo conjunto de datos de fine-tuning. En la segunda etapa, aprendizaje por refuerzo a partir de retroalimentación de IA (RLAIF) reemplaza gran parte del aprendizaje por refuerzo tradicional a partir de retroalimentación humana (RLHF): un modelo separado evalúa respuestas candidatas contra la misma constitución y asigna puntuaciones de preferencia, generando una señal de entrenamiento sin requerir un evaluador humano para cada comparación.

El enfoque importa por dos razones. Primero, reduce el costo y el cuello de botella de escalado de la anotación humana para seguridad: generar millones de comparaciones de preferencia con evaluadores humanos es costoso y lento, mientras que un crítico basado en IA puede operar a un rendimiento mucho mayor. Segundo, hace que los estándares normativos que guían el modelo sean explícitos y auditables—cualquiera puede leer la constitución y razonar sobre qué comportamientos el sistema está entrenado para promover o evitar, lo cual es más difícil con canales RLHF opacos.

A partir de 2026, la IA Constitucional respalda la familia de modelos Claude de Anthropic. La investigación posterior ha explorado hacer constituciones configurables por el operador, permitiendo que los negocios definan principios personalizados para sus implementaciones, y combinando IAC con sondas de interpretabilidad y protocolos de debate para detectar comportamientos que la autocrítica sola puede perder.

Ejemplo

Una empresa que implementa un asistente de servicio al cliente basado en Claude puede proporcionar una constitución personalizada especificando que el modelo siempre debe revelar que es una IA y nunca debe compartir datos personalmente identificables del cliente, permitiendo que los equipos de cumplimiento auditen y actualicen estos mecanismos de protección sin reentrenar el modelo desde cero.

Términos relacionados

← Glosario