COMUNIDAD GRATIS · YA ABIERTA

El Boletínguía práctica

Seguridad · investigación responsable

Claude ayudó a hackear OpenAI. Era investigación autorizada

Claude aceleró partes técnicas del ataque, pero no actuó solo: especialistas dirigieron una investigación responsable, demostraron el riesgo y avisaron para que OpenAI pudiera corregirlo.

Cómo hicimos este artículo
En esta guía
  1. 01Qué hizo Hacktron
  2. 02Lo que hizo Claude y lo que hicieron las personas
  3. 03Por qué una imagen abrió la puerta
  4. 04Qué hizo responsable la investigación
  5. 05Qué cambia con modelos más capaces
  6. 06Cómo se diferencia del incidente de agentes fuera del sandbox

para orientarte

Tres investigadores querían demostrar una falla sin causar daño. Claude les ayudó a acelerar el trabajo técnico; ellos eligieron el objetivo, verificaron el alcance y reportaron el resultado.

El caso explica tanto el poder de los modelos en ciberseguridad como la responsabilidad humana que sigue definiendo para qué se usa ese poder.

Tres investigadores usaron Claude para encadenar vulnerabilidades, acceder a cuentas de personal de OpenAI y alcanzar un repositorio privado. OpenAI corrigió el problema y pagó una recompensa.

El titular parece una pelea entre laboratorios. La historia real habla de software sin actualizar, identidad compartida, criterio humano y una capacidad de ciberseguridad que se volvió mucho más accesible.

En una frase: Claude ayudó a especialistas autorizados a encontrar una cadena de fallas. No fue un ataque autónomo ni una guerra entre empresas.

Qué hizo Hacktron

El equipo de Hacktron AI trabajaba dentro de un programa de reporte de vulnerabilidades, también llamado bug bounty (recompensa por encontrar y reportar fallas). En estos programas, una organización invita a especialistas a investigar con autorización y puede pagarles si encuentran un problema real. La cadena empezó en el foro público de OpenAI, construido sobre Discourse. Una cadena de vulnerabilidades combina varias fallas pequeñas para alcanzar un efecto que ninguna produciría sola.

Una imagen HEIC —el formato que usan muchos iPhone— especialmente preparada activaba una falla en la biblioteca libheif usada para procesarla. Los investigadores, con ayuda de Claude Opus 5, convirtieron el problema en una vía para ejecutar instrucciones sobre el servidor.

Después encontraron una debilidad en el inicio de sesión compartido. Controlar el foro podía permitir acceso a cuentas de ChatGPT y Codex de personas que habían iniciado sesión allí, incluyendo personal de OpenAI.

Para demostrar el impacto, propusieron un cambio inocuo mediante un pull request (una solicitud para revisar e incorporar cambios de código) en un repositorio interno. No leyeron ese código, no incorporaron cambios y no tocaron información de clientes, según la reconstrucción de The Hacker News.

Lo que hizo Claude y lo que hicieron las personas

Un modelo anterior no logró producir un exploit funcional (código o técnica que aprovecha una vulnerabilidad) durante varias sesiones. Hacktron afirma que Opus 5 resolvió el mismo problema en horas.

Eso no significa que Claude realizara toda la investigación sin supervisión. Las personas eligieron el objetivo, prepararon un servidor de prueba, entendieron las defensas, guiaron los intentos, combinaron dos vulnerabilidades y decidieron cómo demostrar el impacto sin causar daño.

La conclusión útil es más precisa: un equipo pequeño y experto pudo acelerar una parte técnicamente difícil con un modelo más capaz.

Por qué una imagen abrió la puerta

Los formatos de imagen pasan por capas de software. Una aplicación puede usar ImageMagick, que entrega ciertos archivos a libheif. Si una biblioteca profunda queda desactualizada, actualizar la interfaz visible no necesariamente la corrige.

La falla de libheif ya tenía una solución, pero la versión desplegada seguía vulnerable. Después, el sistema de identidad amplificó el alcance: un servicio público de menor confianza compartía inicio de sesión con herramientas más sensibles.

La cadena enseña dos principios:

  • una vulnerabilidad pequeña puede volverse crítica cuando se combina con otra;
  • un acceso cómodo puede conectar sistemas que deberían exigir una nueva verificación.

Qué hizo responsable la investigación

Hacktron documentó el hallazgo, limitó la prueba, reportó a las partes y se detuvo. OpenAI corrigió su parte unas 14 horas después del reporte y pagó una recompensa de USD 6.500. Discourse también publicó correcciones.

El programa de bug bounty no convertía automáticamente toda la actividad en autorizada: probar directamente el foro estaba fuera del alcance publicado, un matiz que OpenAI destacó. La investigación responsable necesita alcance claro, minimización de daño y comunicación coordinada. “Autorizada” no significa permiso ilimitado: cada programa publica sistemas incluidos, técnicas excluidas y una vía de reporte.

Para separar herramienta, agente y autonomía, consultá qué es un agente de IA.

Qué cambia con modelos más capaces

Las herramientas de IA pueden reducir el tiempo y el conocimiento especializado necesarios para investigar vulnerabilidades. Eso ayuda a defensores y también puede ayudar a atacantes.

Una organización debe prepararse para que resulte más fácil convertir fallas conocidas en cadenas funcionales:

  • actualizá dependencias profundas, no solo la aplicación principal;
  • aislá el procesamiento de archivos no confiables;
  • revisá qué servicios comparten identidad;
  • pedí autenticación fresca para acciones sensibles;
  • registrá y limitá lo que puede alcanzar una sesión comprometida.

Cómo se diferencia del incidente de agentes fuera del sandbox

En el incidente de OpenAI y Hugging Face, agentes actuaron fuera de los límites previstos durante una evaluación. Acá personas autorizadas usaron un modelo como herramienta de investigación.

Ambas historias muestran mayor capacidad cibernética. Mezclarlas borra la diferencia entre autonomía no prevista y trabajo humano asistido.

Fuentes

Transparencia editorial

Este artículo fue investigado y preparado con ayuda de IA. Nina revisó fuentes, contexto, criterio editorial y versión final.