Inteligencia Artificial

Por · 6 de octubre de 2026 · 6 min de lectura

El chatbot se equivocó. El formato lo volvió inteligencia

Un chatbot identificó mal la carga de un barco y un reporte estándar la volvió creíble. El problema no fue solo la alucinación: fue el formato.

El chatbot se equivocó: analista revisa reporte de carga impreso con tablas frente a un barco portacontenedores

Una alucinación de IA no se volvió peligrosa por ser falsa, sino por llegar con el formato correcto. Según CNN, un reporte de inteligencia estándar, armado con ayuda de un chatbot, activó un plan de intercepción con aviones en el aire.

Lo que CNN pudo establecer y lo que no

Según el reportaje exclusivo de Katie Bo Lillis y Zachary Cohen, publicado por CNN el 18 de septiembre de 2026, un reporte de inteligencia circuló en el ejército de Estados Unidos en la primavera de 2026, en plena guerra con Irán, y afirmaba que un barco chino en Medio Oriente transportaba componentes de un programa de armas nucleares. Cuatro fuentes conocedoras del episodio dijeron que el ejército activó planes para interceptar la embarcación.

Dos de esas fuentes aseguran que personal armado se preparaba para abordar el barco. Una de ellas y otra fuente más afirman que había aviones militares en el aire. Justo antes de la operación planeada, oficiales profundizaron en el reporte, elaborado por un analista de un comando de operaciones especiales, y descubrieron que se había generado con ayuda de IA y que el chatbot había identificado mal el material que cargaba el barco.

CNN no pudo saber cuál era la carga mal identificada, no aclara si el chatbot era comercial o del gobierno y tampoco detalla qué motivó la revisión. Una fuente calificó el reporte como completamente falso y dijo que casi inicia una guerra. Conviene fijar el término: una alucinación es una respuesta que un modelo de IA genera con apariencia de dato, aunque no tenga respaldo en la realidad.

Dos pasos, una sola herramienta: análisis y empaque

El analista consultó al chatbot sobre inteligencia del manifiesto de carga del barco, material originado en el Comando de Operaciones Especiales del Pacífico, con sede en Hawái. De acuerdo con CNN, el programa combinó inteligencia de fuentes abiertas con inteligencia secreta de señales y llegó a su conclusión equivocada.

Después, el mismo analista volvió a usar IA para empaquetar los hallazgos en un reporte de inteligencia estándar, de los que los militares consideran confiables, y lo difundió. Son dos fallas distintas. La primera fue de contenido: una conclusión sin sustento. La segunda fue de envoltura: el mismo contenido, ahora con la apariencia de un producto de inteligencia estándar.

Por qué un formato oficial funciona como señal de verificación

Esta sección es lectura propia de glitchMentalMX, no una afirmación de CNN. Hasta hace poco, producir un documento con apariencia institucional costaba trabajo: había que conocer el formato, reunir insumos y pasar por revisiones. Ese costo funcionaba como un filtro de credibilidad, porque el formato indicaba que alguien ya había hecho el trabajo.

La IA reduce casi a cero el costo de producir esa señal, pero no reduce el de producir la verificación. CNN no establece que el formato haya evitado la revisión; lo que describe es que el reporte circuló y movilizó recursos antes de que alguien profundizara. Mi hipótesis es que un documento con la apariencia correcta no le da a quien lo recibe una razón para preguntar de dónde salió.

Una alucinación se corrige con una revisión; un formato oficial hace que nadie piense en pedirla.

El chatbot se equivocó: reporte de carga impreso con tablas frente a un barco portacontenedores

Revisar más no alcanza cuando el empaque no da motivo para revisar

En El problema del control humano en IA autónoma el tema es la capacidad de supervisión: cuánto puede revisar una persona cuando la velocidad, el volumen y la complacencia juegan en su contra. Aquí el asunto es otro: la señal que emite el propio documento. Aun con revisores suficientes, una revisión empieza por un motivo, y un reporte estándar no ofrece ninguno.

Los datos de CNN apuntan en esa dirección sin demostrarla. Según varios funcionarios, la adopción de IA en el gobierno estadounidense es descentralizada, con herramientas y estándares distintos, y no existe un criterio único para verificar lo que estas herramientas generan. Según una fuente, este tipo de alucinación no ha sido un caso aislado en la comunidad de inteligencia. Si el estándar de verificación cambia de una oficina a otra, el formato es de lo poco que se mantiene uniforme. Para otros fallos documentados, está Cuando los sistemas autónomos fallan: casos reales.

Dónde verificar es barato y dónde no: del tribunal al reporte clasificado

El contraste está en un tribunal de Nueva York. En Mata v. Avianca, el juez Castel, del Tribunal de Distrito del Distrito Sur de Nueva York, sancionó el 22 de junio de 2023 a dos abogados y a su despacho con una multa conjunta de 5,000 dólares por presentar casos inexistentes generados por ChatGPT, según la opinión del tribunal.

Según esa misma opinión, cuando uno de los abogados le preguntó a ChatGPT si uno de los casos era real, el chatbot respondió que sí existía y que podía consultarse en Westlaw y LexisNexis. Pero ese abogado también sabía que hay sitios gratuitos para buscar una cita, buscó el caso y no lo encontró. La aerolínea demandada tampoco pudo localizar la mayoría de los casos citados, y el tribunal hizo su propia búsqueda sin éxito. Verificar costaba una consulta a una base pública, y quien tenía incentivo para hacerla la hizo.

En inteligencia el cálculo cambia. Verificar un reporte construido con inteligencia secreta no es una consulta, sino una reconstrucción que exige acceso a las mismas fuentes. Esto también es lectura propia: CNN describe la fusión de fuentes abiertas y secretas, no cuánto cuesta revisarla.

Los tribunales, además, dejan registro. La base de datos de Damien Charlotin contabilizaba 2,125 casos identificados al 2 de octubre de 2026, y su autor aclara que no cubre el universo total de citas falsas. La verificabilidad, y no la IA, decide dónde el error se queda y dónde se detiene.

Los sistemas donde el oficio es la prueba: una hipótesis para México y Latinoamérica

La misma base registra casos en Brasil (41), Argentina (9), Chile (3), Colombia (3) y Costa Rica (1). México no aparece en la lista de países. Eso no prueba que no existan casos: puede reflejar que no se publican o que no se identifican. Es una hipótesis, no un hallazgo.

Otra hipótesis, también sin fuente local que la confirme: en los sistemas donde un oficio, un acta o un expediente sellado es la unidad de prueba, el sello puede cumplir el papel que el formato cumplió en el caso del barco, porque certifica la forma y no el contenido. Si fabricar el sello y el texto cuesta casi lo mismo que leerlos, el problema se parece más al de inteligencia que al del tribunal con base pública.

La pregunta pendiente: qué valdrá como prueba cuando fabricar cueste lo mismo que leer

Un documento valía como prueba, en buena medida, porque producirlo exigía trabajo, y esa fricción hacía de filtro sin que nadie tuviera que pensarlo. Si ese filtro desaparece y la verificación sigue costando lo mismo, queda abierta la pregunta de fondo: ¿qué documento seguirá valiendo como prueba cuando fabricarlo cueste lo mismo que leerlo?

¿Quieres ver más glitchMentalMX en Google?

Márcanos como fuente preferida y aparecerá más cerca de tus búsquedas.