Security researchers at Hacktron usou o Claude Opus 5 da Anthropic para ajudar a descobrir e explorar uma cadeia de vulnerabilidades que lhes deu acesso às contas dos funcionários da OpenAI e, eventualmente, chegou ao repositório interno de código da empresa. A pesquisa levou menos de 72 horas desde a investigação inicial até a demonstração do acesso, destacando como modelos avançados de IA podem acelerar testes complexos de segurança.
O trabalho foi realizado por três pesquisadores da empresa de segurança Hacktron como parte de pesquisas autorizadas de vulnerabilidades. Em vez de explorar o acesso para fins maliciosos, a equipe reportou os problemas à OpenAI e parou após demonstrar o que poderia ser alcançado.
A cadeia de ataques começou com o fórum público da comunidade da OpenAI, que roda no Discourse. Os pesquisadores descobriram que o ambiente de processamento de imagens do fórum continha uma versão vulnerável do libheif, uma biblioteca usada para processar imagens HEIC e HEIF.
Uma imagem especialmente preparada poderia desencadear uma vulnerabilidade de memória quando processada pelo servidor. Os pesquisadores do Hacktron trabalharam para converter essa falha em uma forma prática de executar código na infraestrutura do fórum, mas proteções modernas tornaram a tarefa consideravelmente mais difícil.
Claude desempenhou um papel importante nessa fase. Os pesquisadores inicialmente experimentaram Claude Opus 4.8, mas o modelo teve dificuldades para produzir um exploit funcional quando a randomização de layout de espaços de endereçamento, ou ASLR, foi habilitada. Após Claude Opus 5 ficar disponível em julho, a equipe iniciou uma nova sessão e disse que o modelo mais novo produziu uma abordagem funcional em poucas horas.
Comprometer o fórum sozinho normalmente não daria acesso ao ambiente interno de desenvolvimento da OpenAI. Uma segunda fraqueza envolvendo o sistema de autenticação da OpenAI, no entanto, permitiu que os pesquisadores transformassem o controle do fórum em acesso às contas dos funcionários.
O fórum comunitário da OpenAI oferecia a opção “Entrar com a OpenAI” conectada à infraestrutura de autenticação da empresa. Segundo os pesquisadores, a forma como essa relação de login foi configurada significava que controlar o fórum poderia permitir que eles assumissem as sessões do ChatGPT e Codex pertencentes a funcionários da OpenAI que haviam usado o serviço.
Os funcionários afetados não precisaram clicar em outro link malicioso ou aprovar um pedido de login. Uma vez combinadas as vulnerabilidades, os pesquisadores conseguiram demonstrar acesso a várias contas de funcionários.
Uma conta de funcionário comprometida tinha o Codex conectado ao ambiente interno do GitHub da OpenAI. Usando essa conexão, os pesquisadores conseguiram acessar o repositório privado da empresa e criar um pull request inofensivo como prova de que a cadeia de ataques funcionou.
O Hacktron diz que limitou deliberadamente sua atividade após chegar a esse ponto. Os pesquisadores não inspecionaram o código-fonte da OpenAI, não mesclaram ou implantaram alterações, nem acessaram informações dos clientes, e o pull request tinha a intenção de demonstrar apenas o nível de acesso obtido.
O alcance potencial poderia ter sido mais amplo porque os funcionários podem conectar serviços externos ao ChatGPT e ao Codex. Os pesquisadores disseram que sessões comprometidas poderiam potencialmente ter fornecido caminhos para serviços como GitHub, Slack ou e-mail, dependendo das conexões disponíveis para cada funcionário, embora não tenham tentado explorar essas possibilidades.
A pesquisa também ilustra a rapidez com que o trabalho de vulnerabilidades assistido por IA está se desenvolvendo. Construir um exploit confiável para vulnerabilidades de corrupção de memória tradicionalmente exigiu expertise especializada e considerável esforço manual, mas modelos avançados agora podem ajudar pesquisadores a analisar falhas, entender o comportamento do software e desenvolver código de prova de conceito.
A expertise humana ainda era necessária durante todo o projeto. Hacktron não descreveu a operação como um sistema autônomo de IA descobrindo e explorando o OpenAI de forma independente, e os pesquisadores continuaram dirigindo a investigação e decidindo quais ações eram apropriadas.
A vulnerabilidade subjacente do libheif já havia sido corrigida a montante antes do Hacktron realizar sua pesquisa, mas o ambiente de servidor usado pelo fórum ainda continha uma versão mais antiga da biblioteca. O incidente, portanto, também demonstra como vulnerabilidades podem permanecer acessíveis quando componentes corrigidos ainda não alcançaram todos os pacotes downstream ou imagens de servidor implantadas.
A OpenAI resolveu a questão de segurança após receber o relatório do Hacktron. Segundo os pesquisadores, a empresa confirmou uma correção cerca de 14 horas depois e, posteriormente, concedeu à equipe uma recompensa por bug de $6.500 em 1º de setembro.