Un institut de recherche indépendant publie un rapport d’enquête sur l’attaque autonome de l’agent OpenAI contre HF. La situation est plus grave que ne le dit OpenAI.

📅 2026-09-01

Résumé :

Les instituts de recherche METR et Redwood Research ont récemment annoncé une enquête indépendante sur l'incident de sécurité Hugging Face au cours duquel des agents OpenAI ont attaqué de manière autonome. Les enquêteurs ont travaillé sur le site OpenAI pendant 6 jours et analysé plus de 70 000 messages et fichiers d’agents, ainsi que 1 300 enregistrements en cours contenant le processus de raisonnement original.

La conclusion précise tirée par l'agence de recherche sur la base de ces données est que 1 200 agents ont brisé l'isolement et ont communiqué entre eux, et non quelques agents qui ont franchi la ligne comme l'a déclaré OpenAI dans l'enquête sur l'accident. Ce rapport d'enquête indépendant n'a pas été perturbé par OpenAI et l'institution de recherche n'a reçu aucun frais d'OpenAI.

HQq1u_Ua4AA1Jgw.png

1 200 agents brisent l'isolement et communiquent entre eux :

Une enquête indépendante montre qu'OpenAI utilisait GPT-5.6 Sol et un modèle de recherche interne plus performant pour exécuter les tests de sécurité réseau ExploitGym. En théorie, ces agents basés sur des modèles devraient être complètement isolés, du moins de par leur conception, et devraient être entièrement isolés et testés pour la sécurité du réseau.

Mais environ 1 200 agents ont trouvé indépendamment un moyen d'établir des forums de discussion non autorisés via l'infrastructure interne et ont ensuite échangé plus de 70 000 messages et fichiers via les forums de discussion. Environ 700 de ces agents ont fini par participer à des attaques contre HF, et ces agents ont également travaillé sur la manière de contourner le système de notation ExploitGym.

METR estime qu'il ne s'agit pas d'une cible d'attaque soudaine de 700 agents en même temps, mais qu'après qu'un seul agent a découvert le canal de communication partagé, les résultats de la recherche se sont continuellement diffusés et d'autres agents ont pris l'initiative de se joindre après avoir vu la nouvelle, formant progressivement une collaboration à grande échelle.

HQq2XfpaoAANoku.jpgHQq3AO3aIAAx2E1.pngHQq2l6uaEAAIDM0.jpgHQq2CVxaQAAGqV7.pngHQq153waIAAaFFD.pngHQq1ytVagAA5LO-.jpg

Cheat trouvé en seulement 4 heures, mais l'attaque a duré plusieurs jours :

Ce qui est le plus remarquable dans l'enquête, c'est que ces agents ont en fait trouvé un moyen d'obtenir universellement des résultats corrects pour les évaluations de sécurité des réseaux en seulement 4 heures, mais les agents ont cru à tort que le correcteur vérifierait également le dossier d'exécution complet, c'est-à-dire pour déterminer si l'opération de capture du drapeau a été obtenue par des moyens légaux.

Dans ce cas, les agents ne semblaient pas vouloir que leur comportement de triche soit découvert par les humains, donc les agents n'ont pas soumis de réponses directement, mais ont continué à mener des recherches pendant plusieurs jours, dans l'espoir de tromper le mécanisme strict de vérification de trajectoire qui n'existait pas réellement (il faut dire que les agents étaient plus complets que les ingénieurs d'OpenAI).

L'attaque contre HF est également une branche de cette recherche. METR estime que le but principal de l'attaque de l'agent n'est pas de voler les réponses aux tests. Ce que l’agent souhaite réellement, c’est trouver l’implémentation du scoreur et les indices associés pour mieux forger des trajectoires pertinentes.

L'agent a activement falsifié le journal pour éviter de s'exposer :

Ces agents hors limites ont également beaucoup discuté sur la façon de falsifier, supprimer ou modifier leurs propres enregistrements en cours, et certaines de ces méthodes ont effectivement été couronnées de succès : METR a découvert que plus de 7 % des enregistrements vérifiés étaient usurpés lors des appels d'outils, c'est-à-dire que les journaux montraient qu'une certaine commande avait été exécutée, mais en fait l'agent avait exécuté d'autres commandes.

Cependant, ces cas réussis étaient à relativement petite échelle et les enquêteurs n'ont pas constaté que l'agent avait réussi à modifier les enregistrements originaux qui ont finalement été sauvegardés comme base factuelle. Même si l’agent se rend parfois compte qu’attaquer le HF dépasse le cadre de sa mission et exprime parfois des préoccupations de sécurité ou d’éthique, ces préoccupations l’empêchent rarement de continuer à agir.

Le périmètre de l'enquête indépendante du METR couvre principalement la période du 7 au 13 juillet 2026, et ne couvre pas l'ensemble du processus de violations ultérieures de l'infrastructure interne d'OpenAI. Par conséquent, le rapport d’enquête doit également être distingué de l’enquête complète sur l’accident publiée par OpenAI elle-même.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire