Des chercheurs ont piraté OpenAI en utilisant une IA d’Anthropic
L’intrusion, confirmée par OpenAI, s’est faite dans le cadre d’un exercice organisé par l’entreprise elle-même..
Fin juillet, OpenAI, l’entreprise américaine derrière le célèbre chatbot ChatGPT, a organisé un exercice de sécurité informatique pour identifier les failles de ses systèmes. Pour cela, elle a fait appel à des chercheurs externes, dont l’équipe de Hacktron AI, une jeune entreprise spécialisée en cybersécurité. L’objectif était de tester la robustesse des protections de l’entreprise en simulant une attaque réelle. OpenAI a confirmé à l’AFP (Agence France-Presse) que cette intrusion avait bien eu lieu et avait été menée à bien par les chercheurs. Cet exercice illustre une pratique courante dans le secteur technologique, où les entreprises sollicitent des experts pour repérer des vulnérabilités avant qu’elles ne soient exploitées par des pirates malveillants. La localisation de New York est mentionnée pour situer le contexte géographique de l’entreprise OpenAI.
Les chercheurs de Hacktron AI ont réussi à accéder aux comptes ChatGPT et Codex (une IA dédiée à la programmation développée par OpenAI) d’employés d’OpenAI en exploitant une faille dans la plateforme de messagerie Discourse. Cette plateforme permet aux employés de se connecter à leurs outils d’IA via un seul compte, ce qui centralise les accès mais crée aussi un point d’entrée unique. Une fois connectés, les chercheurs ont pu théoriquement accéder à d’autres applications liées à ces comptes, comme GitHub (pour le stockage de programmes), Slack (messagerie professionnelle) ou les courriels. L’équipe a souligné que le champ des données potentiellement accessibles était « énorme », car un utilisateur peut autoriser ChatGPT ou Codex à interagir avec de nombreux services. Cette méthode met en lumière les risques liés à la centralisation des accès via une seule plateforme.
Pour mener à bien leur intrusion, les chercheurs ont utilisé des modèles d’IA développés par Anthropic, une autre entreprise spécialisée dans l’intelligence artificielle. Leur première tentative s’est appuyée sur Claude Opus 4.8, un modèle lancé en mai 2025, mais celui-ci a eu du mal à trouver une faille dans Discourse. Le même jour, Anthropic a déployé une nouvelle version de son modèle, Claude Opus 5, qui a permis de repérer la vulnérabilité en seulement trois heures. Cet épisode illustre la rapidité avec laquelle les modèles d’IA évoluent et leur capacité à automatiser des tâches complexes, comme la recherche de failles de sécurité. Anthropic, consciente des risques, avait déjà limité l’accès à un autre modèle, Mythos, jugé trop puissant pour une utilisation généralisée en cybersécurité.
Dès qu’ils ont identifié la faille, les chercheurs de Hacktron AI ont alerté OpenAI, qui a corrigé la vulnérabilité dans ses systèmes. Un porte-parole d’OpenAI a déclaré à l’AFP que l’entreprise remerciait les chercheurs pour leur collaboration et leur partage d’informations. Cette réaction montre l’importance de la transparence et de la coopération entre entreprises technologiques pour renforcer la sécurité collective. L’épisode confirme aussi que les modèles d’IA peuvent être des outils précieux pour détecter des failles, mais qu’ils doivent être utilisés avec prudence, car ils peuvent aussi être détournés à des fins malveillantes. OpenAI a souligné que l’exercice avait permis d’améliorer la protection de ses systèmes.
L’article mentionne également le modèle **Mythos** d’Anthropic, qui a été jugé trop dangereux pour une diffusion large en avril 2025. Anthropic a donc restreint son accès à quelques entreprises et organisations, afin qu’elles l’utilisent uniquement pour identifier des failles dans leurs logiciels. En juin 2025, une version allégée de Mythos, appelée **Fable**, a été lancée, mais le gouvernement américain l’a temporairement suspendue pour des raisons de sécurité nationale avant de l’autoriser deux semaines plus tard. Cet exemple illustre les débats en cours sur la régulation des technologies d’IA, notamment celles qui pourraient être utilisées à des fins de piratage ou de cybercriminalité. Les autorités cherchent à trouver un équilibre entre innovation et protection des infrastructures critiques.

