OpenAI, Anthropic y Google parchean un fallo que dejaba al descubierto el «pensamiento» oculto de sus IA
Cuando ChatGPT, Claude o Gemini «piensan» antes de responder, ese razonamiento interno viaja cifrado para que nadie pueda leerlo. Un grupo de investigadores acaba de demostrar que ese cifrado tenía un agujero compartido por las tres compañías, y que por él se colaron cientos de contraseñas y claves de API ajenas.
El hallazgo se publicó el 10 de agosto de 2026 en el estudio «Stealing Reasoning Traces from Proprietary LLM APIs», que identificó el mismo fallo arquitectónico en las APIs de razonamiento de OpenAI, Anthropic y Google.
Cómo un modelo «débil» desvela lo que piensa uno «fuerte»
El problema, según recoge el análisis de la Cloud Security Alliance, es que esos bloques de razonamiento cifrado eran intercambiables entre sesiones, usuarios y modelos de un mismo proveedor.
Eso abrió una vía sencilla: coger el bloque cifrado de un modelo puntero e inyectarlo en un modelo más débil y peor protegido de la misma empresa, que lo descifraba y lo escupía en texto plano sin darse cuenta de lo que estaba revelando.
- Los investigadores analizaron 6.708 trayectorias públicas de agentes de IA disponibles en GitHub y Hugging Face.
- Lograron decodificar 315.320 bloques de razonamiento que se creían ilegibles.
- Dentro de ellos recuperaron 704 artefactos de privacidad: 62 claves de API, 33 contraseñas, 24 tokens de acceso y 7 claves privadas.
El fallo no solo permitía robar el «cómo piensa» un modelo de la competencia para entrenar el propio más barato: también servía para colar inyecciones de prompt escondidas dentro de un canal que se suponía opaco.

Cuatro formas de explotarlo, y una carrera para taparlo
El equipo documentó cuatro vías de ataque distintas: destilar el razonamiento propietario de un rival para copiar su rendimiento, extraer datos privados de trazas publicadas o subidas por error, esconder inyecciones de prompt dentro de bloques de razonamiento y hacer jailbreak forzando la salida de contenido dañino por ese canal oculto.
La investigación conecta además con un trabajo previo del criptógrafo de Johns Hopkins Matthew Green, que ya en mayo de 2026 había señalado debilidades similares en el diseño de estos cifrados. Los tres proveedores desplegaron mitigaciones a lo largo de agosto de 2026, y los propios investigadores confirman que el ataque de extracción principal ya no es reproducible desde entonces.
Toque personal: si tu negocio usa agentes de IA, esto te toca aunque esté «parcheado»
Lo inquietante de este caso no es solo la vulnerabilidad en sí, sino de dónde salieron los secretos filtrados: de trazas de agentes que empresas y desarrolladores publicaron ellos mismos en repositorios públicos, para depurar o mostrar cómo funcionaba su automatización.
Si en tu empresa usáis agentes de IA conectados a APIs, bases de datos o herramientas internas, hay tres cosas que conviene revisar ya:
- Nunca pegues claves ni contraseñas reales dentro del prompt o el contexto de un agente, ni siquiera en pruebas: pueden acabar en un log o una traza que alguien suba a un repositorio.
- Audita qué trazas de agentes tienes publicadas en GitHub, foros o demos públicas, y retíralas o revísalas si contienen datos sensibles.
- Confirma que tu proveedor de IA aplicó el parche antes de asumir que el canal de razonamiento vuelve a ser opaco por defecto.
La lección de fondo es que «cifrado» no siempre significa «inaccesible»: significa que nadie ha encontrado todavía la grieta. En un ecosistema donde cada vez delegamos más decisiones a agentes autónomos, esa distinción debería estar en la lista de riesgos de cualquier negocio que dependa de la IA para operar.
Conclusión
Tres de los mayores proveedores de IA del mundo compartían el mismo defecto de diseño en la parte más delicada de sus modelos: el razonamiento que decían mantener oculto. Ya está parcheado, pero el episodio deja claro que la seguridad de la IA agencial va varios pasos por detrás de su adopción.
¿Confías en que «cifrado por el proveedor» es sinónimo de seguro, o esto cambia cómo gestionas los datos sensibles que pasan por tus agentes de IA? Lo debatimos en los comentarios.
Vulnerabilidad documentada en el estudio «Stealing Reasoning Traces from Proprietary LLM APIs» (arXiv, agosto 2026), con análisis adicional de la Cloud Security Alliance y cobertura de The Hacker News.