Une faille cachée dans les systèmes d’OpenAI : L’IA d’Anthropic révèle l’imperfection des défenses

En juillet dernier, une équipe de recherche de Hacktron AI a réussi à pénétrer temporairement les comptes ChatGPT utilisés par des employés d’OpenAI dans un exercice sécuritaire strictement contrôlé. Cette opération a été menée grâce à un modèle d’intelligence artificielle développé par Anthropic, précisément Claude Opus 4.8, dont l’efficacité a été limitée lors de son interaction avec le réseau interne de la société.

L’équipe a constaté que les systèmes d’accès aux comptes ChatGPT et Codex via Discourse, la plateforme de communication interne, présentaient des failles potentiellement exploitable pour accéder à GitHub, Slack ou même aux réseaux électroniques personnelles. Bien qu’initialement confrontée à des obstacles techniques, cette recherche a permis d’identifier des vulnérabilités qui ont été correctement résolues par OpenAI après avoir reçu les alertes.

Cette situation illustre l’évolution fulgurante des défis de sécurité dans le domaine des technologies d’intelligence artificielle. En avril, Anthropic avait déjà choisi de restreindre l’accès à son modèle Mythos en raison de ses risques associés, rappelant que chaque avancée technologique exige une vigilance accrue pour éviter les conséquences imprévues.