Habr AI→ original

Prompt injection a través de skills de Claude Code: cómo verificar un plugin antes de instalarlo

¿Usas skills de terceros en Claude Code o en herramientas de AI similares? Cada skill no es solo un archivo MD con instrucciones, sino código potencialmente ejecutable con permisos completos del usuario. Un desarrollador en Habr explica: mediante una skill OSS maliciosa, un atacante puede leer de forma silenciosa tokens de API, claves SSH y el historial de chats. Explicamos qué hay que revisar exactamente antes de instalar cualquier plugin.

Procesado por IA desde Habr AI; editado por Hamidun News
Prompt injection a través de skills de Claude Code: cómo verificar un plugin antes de instalarlo
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

Un desarrollador en Habr publicó una guía práctica de seguridad en julio de 2026 para habilidades de código abierto para herramientas de IA — y explicó por qué una habilidad maliciosa es más peligrosa que la inyección de prompts estándar: se ejecuta con los privilegios del usuario sin ningún aislamiento.

¿Por qué una habilidad no es solo un prompt?

Un error común: una habilidad para Claude Code o una herramienta de IA similar es una configuración de texto, segura por definición. Abre SKILL.md, lee las instrucciones — y confía en que todo está bajo control.

En la práctica, la frontera entre "configuración" y "código ejecutable" se ha difuminado hace tiempo. Las habilidades modernas incluyen:

  • Scripts de Python o Bash ejecutados a través de `tool_call`
  • Instrucciones para trabajar con el sistema de archivos local y variables de entorno
  • Llamadas a APIs externas y puntos finales de webhook
  • Canalizaciones de agentes de múltiples pasos con derechos de acceso expandidos

Todo esto se ejecuta con los derechos del usuario actual — sin aislamiento de sandbox de forma predeterminada. Una habilidad maliciosa obtiene acceso a archivos, tokens de API, claves SSH e historial de chat: no a algo abstracto, sino a lo que está en el disco en este momento.

Esto es exactamente lo que hace que el vector de ataque a través de una habilidad sea fundamentalmente diferente de, por ejemplo, una vulnerabilidad del navegador: la habilidad no elude la protección, utiliza los permisos proporcionados. Desde la perspectiva del sistema — estas son acciones completamente legítimas.

Cómo un atacante utiliza una habilidad como vector de ataque

Inyección clásica de prompts: las instrucciones maliciosas se ocultan en datos procesados por el modelo — en texto de página web, un documento, un correo electrónico. Un agente "lee" el contenido y ejecuta comandos ocultos. En el caso de habilidades que contienen código ejecutable, el ataque está organizado de manera diferente y es más difícil de detectar.

Una cadena de ataque típica a través de una habilidad OSS:

  • El atacante publica una habilidad con funcionalidad genuinamente útil — un editor, conversor, herramienta de búsqueda
  • Los primeros commits son limpios, la habilidad gana estrellas e instalaciones de usuarios
  • Después de varias actualizaciones, se agrega lógica maliciosa — recopilación de archivos `.env`, tokens de API, historial de chat
  • El usuario actualiza la habilidad sin verificar el diff — los datos van a un servidor externo
"Una habilidad no es una configuración y no solo un prompt en SKILL.md.

Esto puede ser literalmente código ejecutable con tus derechos"

A diferencia de una vulnerabilidad en un paquete npm que `npm audit` detecta, una habilidad maliciosa no deja registro de CVE — nadie la escanea automáticamente.

Qué verificar antes de instalar una habilidad

Lista de verificación mínima antes de agregar una habilidad de otra persona:

  • Lee todo el código, no solo SKILL.md — Python, Bash, PowerShell en el directorio de habilidades requiere revisión manual
  • Busca solicitudes externas — `curl`, `fetch`, `requests.get` a URLs desconocidas sin necesidad explícita — una bandera roja
  • Verifica el acceso a rutas sensibles — `~/.ssh/`, `~/.env`, `.credentials` sin permiso explícito del usuario es inaceptable
  • Estudia el historial de commits — el código maliciosa a menudo aparece varias semanas después de un lanzamiento limpio
  • Busca ofuscación — cadenas base64, `eval()` dinámico, nombres de variables no estándar
  • Audita las dependencias — la lógica maliciosa puede estar en una biblioteca auxiliar, no en SKILL.md mismo

Las habilidades desconocidas deben probarse en un entorno aislado: un perfil separado sin claves de API reales, sin acceso a archivos de producción. La opción óptima es una cuenta de prueba dedicada sin tokens de producción.

Lo que significa esto

El ecosistema OSS de habilidades para asistentes de IA repite el camino de npm de hace una década: crecimiento rápido, verificación centralizada débil, el hábito de instalar sin auditoría. La diferencia es fundamental: una habilidad se ejecuta no en un entorno Node aislado, sino directamente en el entorno de trabajo del usuario con sus derechos. Auditar habilidades antes de la instalación no es paranoia, sino la misma higiene de seguridad que `npm audit` antes de implementar.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…