Security researchers at Hacktron utilizó Claude Opus 5 de Anthropic para ayudar a descubrir y explotar una cadena de vulnerabilidades que les daba acceso a las cuentas de empleados de OpenAI y finalmente llegaba al repositorio interno de código de la empresa. La investigación duró menos de 72 horas desde la investigación inicial hasta la demostración del acceso, lo que pone de manifiesto cómo los modelos avanzados de IA pueden acelerar pruebas de seguridad complejas.

 

 

El trabajo fue realizado por tres investigadores de la empresa de seguridad Hacktron como parte de una investigación autorizada sobre vulnerabilidades. En lugar de explotar el acceso con fines maliciosos, el equipo informó de los problemas a OpenAI y se detuvo tras demostrar lo que se podía alcanzar.

La cadena de ataques comenzó con el foro comunitario público de OpenAI, que funciona en Discourse. Los investigadores descubrieron que el entorno de procesamiento de imágenes del foro contenía una versión vulnerable de libheif, una biblioteca utilizada para procesar imágenes HEIC y HEIF.

Una imagen especialmente preparada podía desencadenar una vulnerabilidad de memoria cuando el servidor la procesaba. Los investigadores de Hacktron trabajaron en convertir ese fallo en una forma práctica de ejecutar código en la infraestructura del foro, pero las protecciones modernas dificultaban considerablemente la tarea.

Claude desempeñó un papel importante en esta etapa. Los investigadores experimentaron inicialmente con Claude Opus 4.8, pero el modelo tuvo dificultades para producir un exploit funcional cuando se habilitó la aleatorización de disposición en espacios de direcciones, o ASLR. Tras la disponibilidad de Claude Opus 5 en julio, el equipo inició una nueva sesión y dijo que el modelo más reciente producía un enfoque funcional en cuestión de horas.

Comprometer el foro por sí solo normalmente no proporcionaría acceso al entorno interno de desarrollo de OpenAI. Sin embargo, una segunda debilidad relacionada con el sistema de autenticación de OpenAI permitió a los investigadores convertir el control del foro en acceso a cuentas de empleados.

El foro comunitario de OpenAI ofrecía una opción de “Iniciar sesión con OpenAI” conectada a la infraestructura de autenticación de la empresa. Según los investigadores, la forma en que estaba configurada esta relación de inicio de sesión significaba que controlar el foro les permitía hacerse cargo de las sesiones de ChatGPT y Codex pertenecientes a empleados de OpenAI que habían utilizado el servicio.

Los empleados afectados no necesitaban hacer clic en otro enlace malicioso ni aprobar una solicitud de inicio de sesión. Una vez combinadas las vulnerabilidades, los investigadores pudieron demostrar el acceso a varias cuentas del personal.

Una cuenta de empleado comprometida tenía Codex conectado al entorno interno de GitHub de OpenAI. Gracias a esa conexión, los investigadores pudieron acceder al repositorio privado de la empresa y crear una pull request inofensiva como prueba de que la cadena de ataques había funcionado.

Hacktron afirma que limitó deliberadamente su actividad tras llegar a este punto. Los investigadores no inspeccionaron el código fuente de OpenAI, no fusionaron ni desplegaron cambios, ni accedieron a la información de los clientes, y la solicitud de pull solo pretendía demostrar el nivel de acceso que habían obtenido.

El alcance potencial podría haber sido más amplio porque los empleados pueden conectar servicios externos a ChatGPT y Codex. Los investigadores dijeron que las sesiones comprometidas podrían haber proporcionado vías hacia servicios como GitHub, Slack o correo electrónico dependiendo de las conexiones disponibles para cada empleado, aunque no intentaron explorar esas posibilidades.

La investigación también ilustra lo rápido que se está desarrollando el trabajo de vulnerabilidades asistidas por IA. Construir un exploit fiable para una vulnerabilidad de corrupción de memoria ha requerido tradicionalmente experiencia especializada y un esfuerzo manual considerable, pero los modelos avanzados ahora pueden ayudar a los investigadores a analizar fallos, comprender el comportamiento del software y desarrollar código de prueba de concepto.

La experiencia humana seguía siendo necesaria durante todo el proyecto. Hacktron no describió la operación como un sistema de IA autónomo que descubre y explota OpenAI de forma independiente, y los investigadores continuaron dirigiendo la investigación y decidiendo qué acciones eran apropiadas.

La vulnerabilidad subyacente de libheif ya se había corregido aguas arriba antes de que Hacktron realizara su investigación, pero el entorno de servidor utilizado por el foro aún contenía una versión antigua de la biblioteca. Por tanto, el incidente también demuestra cómo las vulnerabilidades pueden seguir siendo accesibles cuando los componentes parcheados aún no han llegado a todos los paquetes descendentes o imágenes de servidor desplegadas.

OpenAI abordó el problema de seguridad tras recibir el informe de Hacktron. Según los investigadores, la empresa confirmó una solución aproximadamente 14 horas después y posteriormente otorgó al equipo una recompensa por errores de 6.500 dólares el 1 de septiembre.

Deja un comentario