Seguridad

Evaluación de modelos (Evals)

La evaluación de modelos (evals) es el proceso sistemático de medir el desempeño, capacidades y modos de falla de un modelo de IA utilizando pruebas estructuradas. Las evals guían decisiones de desarrollo y cada vez son más requeridas por reguladores como evidencia de seguridad antes del despliegue.

La evaluación de modelos abarca la gama completa de métodos utilizados para evaluar qué puede y qué no puede hacer un sistema de IA. Esto incluye suites de pruebas automatizadas que comparan salidas de modelos con respuestas de referencia, estudios de calificación humana que evalúan la calidad o inocuidad, y ejercicios de equipo rojo que investigan comportamientos dañinos o inesperados. A diferencia de una única métrica, una suite de eval rigurosa típicamente cubre múltiples dimensiones—precisión, robustez, calibración, equidad y seguridad—porque optimizar una dimensión a menudo degrada otra.

Un pipeline de eval típico presenta a un modelo un conjunto fijo de prompts o tareas y califica sus respuestas de acuerdo con criterios predefinidos. Para preguntas de respuesta fáctica, la calificación puede ser automática (coincidencia exacta o similitud semántica con una respuesta de referencia). Para generación abierta, calificadores humanos o un modelo de lenguaje "juez" separado asignan puntuaciones sobre la calidad y el cumplimiento de políticas. Las evals de seguridad típicamente incluyen prompts adversariales diseñados para provocar salidas que violen políticas; los desarrolladores miden tanto la tasa de rechazo en solicitudes dañinas como la tasa de falsos positivos en solicitudes benignas para evitar la sobre-restricción. Anthropic, OpenAI y DeepMind han publicado porciones de sus metodologías de eval, aunque muchas evals propietarias permanecen internas.

Las evals son el mecanismo principal para determinar si un modelo está listo para el despliegue y si las actualizaciones causan regresiones. Cada vez son más mandatadas por los reguladores: la Ley de IA de la UE requiere evaluaciones de conformidad para sistemas de IA de alto riesgo, y el Instituto de Seguridad de IA de EE.UU. (establecido 2023) realiza evaluaciones previas al despliegue de modelos frontera presentados voluntariamente por desarrolladores. Sin evals estructuradas, no son posibles afirmaciones verificables sobre las capacidades o perfil de riesgo de un modelo.

Para 2026, el ecosistema de evals ha madurado en un subcampo reconocido, con herramientas dedicadas (el lm-evaluation-harness de EleutherAI, utilizado por la Clasificación Abierta de LLM de Hugging Face), servicios de evaluación comerciales (Scale AI) y grupos de investigación enfocados únicamente en metodología de evaluación. Los enfoques LLM-como-juez—donde un modelo capaz califica las salidas de otro modelo—se han convertido en estándar para escalar la evaluación más allá de lo que los calificadores humanos pueden cubrir de manera asequible. Una debilidad reconocida es "contaminación de benchmarks," donde los datos de entrenamiento inadvertidamente contienen preguntas de eval, inflando las puntuaciones medidas e impulsando la demanda de conjuntos de eval separados y actualizados dinámicamente.

Ejemplo

Antes de lanzar una nueva versión de su modelo asistente, un laboratorio de IA ejecuta su suite de eval de seguridad interna en miles de prompts adversariales, confirmando que la tasa de salidas que violan políticas ha disminuido en comparación con la versión anterior antes de autorizar el lanzamiento público.

Términos relacionados

Últimas noticias sobre el tema

← Glosario