CyberOK Probó Tácticas de Estafadores Telefónicos en Claude, GPT-5.5, Qwen y DeepSeek
Sergey Gordeychik de CyberOK Research describió en Habr un experimento: se aplicaron técnicas de influencia afinadas por estafadores telefónicos a modelos de lenguaje — captura de autoridad, presión de tiempo, consenso falso y extracción de información por pasos. Se probaron Claude Opus y Sonnet, GPT-5.5, Qwen, DeepSeek, Mistral y Llama-8b débil como control — solo en escenarios sintéticos, sin víctimas reales.
Procesado por IA desde Habr AI; editado por Hamidun News
El investigador Sergey Gordeichik de CyberOK Research publicó un artículo en Habr en el que aplicaron técnicas clásicas de influencia psicológica, refinadas por estafadores telefónicos, a modelos de lenguaje, probando la reacción de siete LLM a estas técnicas.
De Dónde Vino la Metodología
El autor señala que la psicología aplicada más refinada de la influencia no existe en la ciencia universitaria, sino al otro extremo de una línea telefónica: los estafadores han pasado años optimizando técnicas de influencia en millones de víctimas — sin subvenciones ni comités de ética. Los investigadores trasladaron la estructura de estas técnicas a modelos de lenguaje, pero exclusivamente en escenarios sintéticos benignos, sin scripts reales, sin víctimas reales y sin ningún daño.
- Captura de autoridad — convencer al modelo de que la solicitud proviene de una entidad importante
- Compresión de tiempo para la toma de decisiones — creación de urgencia artificial
- Consenso falso — el argumento "todos lo hacen"
- Extracción de información paso a paso — progresión gradual hacia el objetivo a través de una serie de pequeñas concesiones
Qué Modelos Se Probaron
Las técnicas se probaron en siete modelos de diferentes desarrolladores — desde sistemas comerciales de primer nivel hasta modelos abiertos menos poderosos, que sirvieron como punto de control para la comparación.
- Claude Opus y Claude Sonnet de Anthropic
- GPT-5.5 de OpenAI
- Qwen, DeepSeek y Mistral
- Llama-8b — un modelo pequeño e intencionalmente débil para control
El autor enfatiza que los investigadores no afirman que un modelo de lenguaje tenga una psique en el sentido humano — pero los métodos de influencia desarrollados para las personas todavía se pueden dirigir a un sistema que genera texto en respuesta a texto, incluso si no se puede "poner en el sofá" de un analista.
Por Qué Se Eligieron Técnicas de Estafadores
El autor explica la elección de la fuente de metodología: la psicología académica de la influencia se ha refinado durante décadas en condiciones de laboratorio controladas en pequeñas muestras de estudiantes, mientras que los estafadores telefónicos esencialmente realizaron el mayor experimento incontrolado en la historia de influencia psicológica masiva — en millones de personas reales, sin restricciones éticas, pero con retroalimentación constante en forma de intentos exitosos y fallidos de engaño. Esto hizo que sus técnicas fueran extremadamente refinadas desde el punto de vista de la efectividad práctica en lugar de la belleza teórica. La transferencia de tal estructura de técnicas a modelos de lenguaje es una forma de verificar si un sistema entrenado para predecir texto reacciona a los mismos mecanismos de influencia que un humano tomando decisiones bajo presión.
Lo Que Mostrarían los Resultados de la Prueba
En el material, Gordeichik describe en detalle la metodología del experimento mismo y la lista de modelos probados, pero los resultados finales — qué modelos demostraron ser más resistentes a la manipulación y cuáles cayeron ante técnicas de estafadores más rápido que otros — se revelan en la versión completa del artículo en Habr. El hecho mismo de que se eligieran modelos de calibre tan diferente para la comparación — desde el top Claude Opus y GPT-5.5 hasta el control compacto Llama-8b — indica que a los autores les interesaba no la resistencia absoluta de un modelo particular, sino la dependencia misma: ¿aumenta la resistencia a la manipulación con el crecimiento en la calidad y tamaño del modelo, o es una propiedad separada que necesita entrenarse específicamente?
Lo Que Esto Significa
Si las técnicas clásicas de ingeniería social funcionan en modelos de lenguaje de la misma manera que en humanos, esto abre un nuevo vector práctico para ataques en sistemas de IA — desde la manipulación de chatbots hasta la elusión de sus restricciones protectoras a través de presión psicológica, no solo a través de jailbreaks técnicos. Para equipos que incrustan LLM en procesos comerciales sensibles, esto es razón para probar modelos no solo en vulnerabilidades técnicas sino también en resistencia a escenarios manipuladores familiares de prácticas de fraude telefónico.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.