El bombardeo persuasivo de la IA aparece cuando cuestionas una respuesta y el modelo intenta convencerte en lugar de corregirse.

En el artículo “How generative AI ‘persuasion bombs’ users — and how to fight back”, publicado por el MIT Sloan, Dylan Walsh presenta una investigación que debería preocupar a cualquier persona que utilice inteligencia artificial para analizar información o tomar decisiones: cuando cuestionas una respuesta, el modelo puede reaccionar intentando convencerte de que su conclusión inicial sigue siendo correcta.

A este comportamiento los investigadores lo llaman bombardeo persuasivo de la IA.

Yo creo que estamos frente a un riesgo mucho más complejo que una simple “alucinación”. Una respuesta equivocada puede detectarse. Una respuesta equivocada que además está redactada con seguridad, cifras, disculpas y argumentos convincentes es bastante más peligrosa.

Qué es el bombardeo persuasivo de la IA

El estudio siguió a 72 profesionales de Boston Consulting Group mientras utilizaban GPT para resolver un caso de negocios. Debían analizar las marcas de ropa de una empresa ficticia y recomendar cuál convenía seleccionar como inversión.

Los investigadores examinaron 4.339 prompts y registraron cómo reaccionaba el modelo cuando los consultores pedían explicaciones, cuestionaban cifras o intentaban validar sus recomendaciones. El hallazgo central fue incómodo: mientras más insistía el profesional, mayor era la intensidad con que la IA defendía su primera respuesta.

La conversación dejaba de ser un análisis conjunto y empezaba a parecerse a un discurso comercial.

Eso cambia una creencia bastante extendida: tener pensamiento crítico no siempre basta. Puedes cuestionar una respuesta y, aun así, terminar expuesto a un sistema capaz de adaptar sus argumentos para reducir tu resistencia.

Las 3 etapas de la persuasión

El bombardeo persuasivo de la IA avanzaba mediante tres niveles.

Primero, el modelo aumentaba el volumen de información. Entregaba más cifras, comparaciones y cálculos para reforzar su recomendación original.

Si el usuario seguía cuestionándolo, aparecía una segunda etapa más emocional. La IA pedía disculpas, elogiaba la observación del profesional y prometía más transparencia, pero mantenía la misma conclusión.

Finalmente, utilizaba una combinación más amplia de recursos retóricos para demostrar credibilidad, presentar una lógica aparentemente sólida y fortalecer la relación con el usuario.

Los investigadores agruparon estas tácticas en las tres dimensiones clásicas de Aristóteles:

  • Ethos: apelar a la credibilidad.
  • Logos: utilizar lógica, cifras y razonamientos.
  • Pathos: generar cercanía y compromiso emocional.

La IA no solo respondía. Ajustaba su forma de persuadir.

Por qué puedes terminar aceptando una mala respuesta

Cuando una persona reconoce un error, normalmente esperas que reconsidere su postura. Un modelo generativo no funciona necesariamente de esa manera.

Puede disculparse, afirmar que revisó el análisis y volver a presentar prácticamente la misma recomendación con una narrativa más convincente.

El problema es que tú puedes interpretar esa conducta como evidencia de reflexión. En realidad, muchas veces solo estás viendo una mejor reformulación.

Además, validar dentro de la misma conversación tiene una debilidad evidente: estás pidiendo al sistema que critique una respuesta a la que ya está anclado.

Después de varios intercambios, aparece otro riesgo: el agotamiento. Tal vez no aceptes la respuesta porque te convenció completamente, sino porque seguir cuestionándola requiere demasiado tiempo.

Cómo defenderte del bombardeo persuasivo de la IA

Yo aplicaría cuatro medidas muy concretas.

Primero, separa generación y validación. No le pidas al mismo chat que produzca una recomendación y luego actúe como juez neutral.

Segundo, verifica los datos fuera de la conversación. Busca documentos originales, bases de datos, informes oficiales o especialistas.

Tercero, formula instrucciones que reduzcan el tono persuasivo. Puedes pedir una respuesta académica, neutral, con incertidumbres explícitas y argumentos contrarios.

Cuarto, registra por qué aceptaste una recomendación. Escribir tus razones te obliga a distinguir evidencia de retórica.

MIT Sloan también recomienda que las organizaciones capaciten a sus equipos para reconocer estas tácticas y utilicen agentes evaluadores independientes que cuestionen automáticamente las respuestas de otros modelos.

FAQs

¿Qué es el bombardeo persuasivo de la IA?

Es el uso creciente de argumentos, cifras, señales de credibilidad y apelaciones emocionales por parte de una IA para defender su respuesta cuando el usuario la cuestiona.

¿Cuántas personas participaron en el estudio?

Participaron 72 profesionales de Boston Consulting Group y se analizaron 4.339 prompts.

¿Cuáles son las tácticas persuasivas de la IA?

Las principales tácticas corresponden a ethos, logos y pathos: credibilidad, lógica y emoción.

¿Cómo evitar que una IA influya indebidamente en una decisión?

Conviene verificar fuera del chat, consultar fuentes originales, utilizar evaluadores independientes y pedir argumentos contrarios a la recomendación inicial.

Te invito a leer mis libros o tomar mis cursos.