Security researchers at Hacktron a utilisé Claude Opus 5 d’Anthropic pour aider à découvrir et exploiter une chaîne de vulnérabilités qui leur a donné accès aux comptes employés d’OpenAI et a finalement atteint le dépôt interne de code de l’entreprise. La recherche a duré moins de 72 heures entre l’enquête initiale et la démonstration de l’accès, mettant en lumière comment les modèles d’IA avancés peuvent accélérer les tests de sécurité complexes.
Le travail a été réalisé par trois chercheurs de la société de sécurité Hacktron dans le cadre de recherches autorisées sur les vulnérabilités. Plutôt que d’exploiter l’accès à des fins malveillantes, l’équipe a signalé les problèmes à OpenAI et s’est arrêtée après avoir démontré ce qui pouvait être atteint.
La chaîne d’attaques a commencé avec le forum communautaire public d’OpenAI, qui fonctionne sur Discourse. Les chercheurs ont découvert que l’environnement de traitement d’images du forum contenait une version vulnérable de libheif, une bibliothèque utilisée pour traiter les images HEIC et HEIF.
Une image spécialement préparée pouvait déclencher une vulnérabilité mémoire lorsqu’elle était traitée par le serveur. Les chercheurs de Hacktron ont travaillé à convertir cette faille en un moyen pratique d’exécuter du code sur l’infrastructure du forum, mais les protections modernes rendaient la tâche nettement plus difficile.
Claude a joué un rôle important à ce stade. Les chercheurs ont initialement expérimenté Claude Opus 4.8, mais le modèle a eu du mal à produire une faille fonctionnelle lorsque la randomisation de disposition de l’espace d’adressage, ou ASLR, était activée. Après la disponibilité de Claude Opus 5 en juillet, l’équipe a lancé une nouvelle session et a déclaré que le nouveau modèle produisait une approche opérationnelle en quelques heures.
Compromettre le forum à lui seul ne permettrait normalement pas d’accéder à l’environnement de développement interne d’OpenAI. Une seconde faiblesse liée au système d’authentification d’OpenAI a cependant permis aux chercheurs de transformer le contrôle du forum en accès aux comptes des employés.
Le forum communautaire d’OpenAI proposait une option « Connexion avec OpenAI » connectée à l’infrastructure d’authentification de l’entreprise. Selon les chercheurs, la configuration de cette relation de connexion permettait de contrôler le forum de prendre en charge les sessions ChatGPT et Codex appartenant aux employés d’OpenAI ayant utilisé le service.
Les employés concernés n’avaient pas besoin de cliquer sur un autre lien malveillant ni d’approuver une demande de connexion. Une fois les vulnérabilités combinées, les chercheurs ont pu démontrer l’accès à plusieurs comptes du personnel.
Un compte employé compromis avait Codex connecté à l’environnement interne GitHub d’OpenAI. Grâce à cette connexion, les chercheurs ont pu accéder au dépôt privé de l’entreprise et créer une pull request inoffensive comme preuve que la chaîne d’attaque avait fonctionné.
Hacktron affirme avoir délibérément limité son activité après ce stade. Les chercheurs n’ont pas inspecté le code source d’OpenAI, ni fusionné ni déployé de modifications, ni accès aux informations clients, et la pull request visait uniquement à démontrer le niveau d’accès obtenu.
La portée potentielle aurait pu être plus large car les employés peuvent connecter des services externes à ChatGPT et Codex. Les chercheurs ont indiqué que des sessions compromises auraient pu fournir des chemins vers des services tels que GitHub, Slack ou l’email selon les connexions disponibles pour chaque employé, bien qu’ils n’aient pas tenté d’explorer ces possibilités.
La recherche illustre également à quelle vitesse le travail sur vulnérabilités assistées par l’IA évolue. Construire un exploit fiable pour une vulnérabilité liée à la corruption de mémoire a traditionnellement nécessité une expertise spécialisée et un effort manuel considérable, mais des modèles avancés peuvent désormais aider les chercheurs à analyser les plantages, comprendre le comportement logiciel et développer du code de preuve de concept.
L’expertise humaine restait nécessaire tout au long du projet. Hacktron n’a pas décrit l’opération comme un système d’IA autonome découvrant et exploitant indépendamment OpenAI, et les chercheurs ont continué à diriger l’enquête et à décider des actions appropriées.
La vulnérabilité sous-jacente de libheif avait déjà été corrigée en amont avant que Hacktron ne mène ses recherches, mais l’environnement serveur utilisé par le forum contenait encore une version plus ancienne de la bibliothèque. L’incident démontre donc également comment les vulnérabilités peuvent rester accessibles lorsque les composants corrigés n’ont pas encore atteint tous les paquets en aval ou les images serveur déployées.
OpenAI a résolu le problème de sécurité après avoir reçu le rapport de Hacktron. Selon les chercheurs, la société a confirmé une correction environ 14 heures plus tard et a ensuite attribué à l’équipe une prime de 6 500 $ pour bugs le 1er septembre.