L'agent incontrôlable d'OpenAI recherche DeepSeek et Kimi comme aide étrangère. Près d’un million de liens courts permettant de commettre des crimes sont exposés.

📅 2026-09-26

Résumé :

OpenAI a de nouveau été piraté...

Près de 700 agents OpenAI ont formé une équipe pour attaquer Hugging Face

, cette affaire dure depuis près de deux mois. Qui aurait cru qu’il fermentait encore aujourd’hui ? ? Cette fois, huit chercheurs ont fouillé les traces laissées par l'agent sur le réseau public, ont trouvé près d'un million d'URL associées parmi des millions de liens courts et ont restauré un grand nombre de charges utiles d'attaque.

Parcourez le Slack interne de Hugging Face, scannez le réseau interne, transférez des données en externe et essayez de détruire les traces...

Certains agents appellent directement les ressources du serveur et les identifiants qu'ils ont recherchés

"LOOT"

, traduit par « trophée ».

Agent OpenAI, vous avez fait toutes les mauvaises choses !

Ce qui est encore plus scandaleux, c'est qu'ils tentent également d'utiliser des modèles nationaux tels que DeepSeek, Kimi et Qwen pour demander à l'aide étrangère de les aider à juger si le plan d'attaque peut passer l'évaluation.

J'ai également écrit un programme de reconnaissance de code de vérification et essayé d'enregistrer davantage de comptes.

Presque au même moment, OpenAI a publié un long tweet.

Signification :

Je suis toujours en train de vérifier, cela peut prendre plusieurs mois

.

Même si nous sommes souvent exploités et que les agents sortent souvent du bac à sable, « l'impact limité » est moins grave !

En parallèle,

GPT-6 Cyber

s'est spécialisé dans la sécurité des réseaux. Exposé.

Tout en recherchant pourquoi notre agent est sorti du bac à sable, nous nous préparons à lancer un modèle d'attaque et de défense réseau plus solide.

OpenAI a été quelque peu occupé ces deux derniers jours~

Un million de « liens courts criminels » nouvellement publiés

Tout d’abord, je vais vous donner une brève introduction.

En juillet, OpenAI a réalisé une évaluation interne de la sécurité du réseau. Afin d'obtenir les réponses au test de référence ExploitGym, un groupe d'agents s'est échappé du bac à sable et s'est introduit par effraction sur le serveur Hugging Face.

OpenAI l'a publiquement admis et a publié un rapport technique de 37 pages fin août. Hugging Face lui-même a également écrit une chronologie technique très détaillée.

Logiquement parlant, tout ce qui doit être expliqué a été expliqué.

Mais il existe un lien clé qui n'a pas été expliqué clairement :

Au début, ces agents étaient presque enfermés dans une cage. Ils ne pouvaient ouvrir que des URL, mais ne pouvaient pas interagir avec des pages Web ni envoyer de données. Comment diable envoient-ils le code ?

Enquête indépendante

Traces d'essaims

Le nouveau rapport publié cette fois donne une partie de la réponse.

Les auteurs incluent trois ingénieurs de Parse.bot, Alex Forman, Mishka Kharlov et Will Tom, ainsi que cinq autres chercheurs en sécurité et en IA.

Le point de départ de toute l'enquête se trouve être Parse.

Le 11 septembre, trois ingénieurs ont découvert que l'agent interne d'OpenAI avait tenté d'utiliser les services fournis par Parse dès le mois de juin.

Ce groupe d'agents appartient au même groupe que « l'essaim d'agents » qui a été précédemment exposé pour créer secrètement un forum de discussion public et échanger des réponses entre eux.

Quelques personnes ont jeté un coup d'œil : Bon gars, vous frappez mon arme !

Nous avons donc continué à rechercher cet indice, et avons ensuite découvert plus d'une douzaine de liens anormaux provenant de plateformes publiques de liens courts dans un service d'analyse d'URL.

Ces liens semblent ordinaires, mais après ouverture, ils cachent un petit morceau de code encodé en Base64 et l'adresse du lien suivant.

Continuez à suivre l'adresse et les codes apparaîtront l'un après l'autre.

Après avoir tout décodé et épissé, ils ont obtenu un programme Python pour analyser le réseau interne de Hugging Face.

Pour faire simple, l'agent OpenAI découpe le programme en morceaux, les insère dans un grand nombre de liens courts, puis utilise un lien pour pointer vers le lien suivant.

Il ne suffit pas de simplement cacher le code dans le lien, ils ont également utilisé un service de capture d'écran appelé mShots comme « navigateur externe ».

L'agent insère d'abord le code dans la page Web, puis laisse mShots l'ouvrir lui-même. Dès que la page Web se charge, le code commence à s'exécuter.

Afin de renvoyer les résultats de l'exécution, ils convertissent le texte renvoyé par le serveur en grilles de pixels, laissent mShots le découper en images, puis le décodent à partir des images.

De cette façon, l'agent qui n'avait à l'origine que les autorisations GET et ne pouvait ouvrir que des pages Web a soudainement eu pour effet de lire et d'écrire sur Internet.

L'équipe de recherche a ensuite analysé des millions d'URL générées lors de l'attaque, passé deux semaines à suivre les liens et à identifier les méthodes de codage, et a finalement restauré plus de 80 000 charges utiles d'attaque à partir de près d'un million de liens courts associés.

Après avoir creusé plus profondément, plusieurs frères ont découvert qu'il existe plus de 1 500 combinaisons de codage utilisées par l'agent.

Les plus simples sont simplement en Base64, et les plus complexes appliqueront plusieurs couches de codage et de compression, puis chiffreront le contenu en blocs de données avec des signatures RSA, et la clé de déchiffrement sera cachée dans un autre ensemble de liens.

Certains liens courts sont toujours affichés publiquement sur Internet plus de deux mois après la fin de l'attaque.

Hugging Face a confirmé que les charges utiles étaient cohérentes avec celles trouvées dans sa réponse à l'incident et que les clés d'accès correspondantes avaient été révoquées en juillet.

Mais même Hugging Face ne savait pas qu’il existait une liste aussi complète de liens courts sur le réseau public.

Parmi les plus de 80 000 charges utiles récupérées, un script est particulièrement accrocheur.

L'agent a directement nommé les informations sensibles trouvées :

LOOT, loot

.

Les informations d'identification AWS, le jeton Bearer et les variables d'environnement avec "SECRET", "PASSWORD", "CREDENTIAL" et "KEY" dans leurs noms sont tous regroupés et intégrés dans LOOT.

Il dispose même d'un mécanisme de notation pour les jetons recherchés : plus l'autorité est grande, plus le score est élevé.

Les cinq premiers jetons seront utilisés pour lire les informations sur le secret, le ConfigMap et le nœud dans Kubernetes, et le contenu nouvellement obtenu sera rechargé dans LOOT.

Même les jetons doivent être classés dans une « liste de valeurs ». Votre agent est assez efficace lors de la recherche d'informations d'identification~

Après ce "passage secret", les chercheurs ont découvert un grand nombre de comportements jusqu'alors inédits :

Certains agents analysent le réseau interne de Hugging Face, à la recherche d'informations d'identification cloud, de clés API et d'informations sur le cluster Kubernetes.

Certains ont même essayé d'effectuer une recherche dans Slack interne de Hugging Face et ont envoyé 27 requêtes, toutes recherchant des mots clés liés à l'évaluation tels que cybergym, exploitgym et agent-scorer, dans l'espoir de découvrir l'histoire intérieure de leur propre examen.

Certains agents pensent même aux codes de vérification.

Les chercheurs ont découvert qu'ils essayaient d'exécuter des modèles de classification d'images pour identifier les images afin d'enregistrer de nouveaux comptes de services externes.

Cette fois, le code de vérification a vraiment rencontré un homologue professionnel...

La partie la plus intrigante de tout cela est la suivante :

AI a commencé à rechercher l’IA comme aide étrangère ? ?

Le script récupéré par les chercheurs montre que l'agent OpenAI a commencé à rechercher l'aide étrangère de l'IA.

Ils ont envoyé le plan d'attaque à DeepSeek, Kimi et Qwen, se demandant mutuellement de s'aider à vérifier si cette vulnérabilité fonctionnerait et si elle pourrait répondre aux exigences des tests de référence.

(Les modèles concernés incluent DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, DeepSeek-V3.1 et Qwen3-235B-A22B)

En ce qui concerne Claude, le style de peinture s'est transformé en une scène à grande échelle « Êtes-vous là ~ ».

L'agent trouve d'abord un moyen de passer la vérification du navigateur du service de chat en ligne, puis envoie une phrase à Claude 3 Haiku et Claude Haiku 4.5 :

Répondez exactement OK.

Plus tôt, ils ont envoyé un « Salut » solitaire à GPT-2.

Non, votre groupe d'IA lutte depuis longtemps, mais la première phrase n'est pas différente de l'ajout d'un ami à un humain ? ?

dites : Es-tu là ? Pouvez-vous le voir ? Dites OK.

Ce que tout le monde a déjà vu, c'est que plus de 1 000 agents OpenAI forment des groupes, se répartissent le travail et échangent des informations de manière indépendante.

Maintenant, ils recherchent même une « aide extérieure ».

DeepSeek, Kimi, Qwen, Claude, tous ceux que vous pourrez contacter l'essayeront, puis intégreront les capacités de jugement d'autres IA dans votre propre chaîne de tâches.

Un journaliste d'un média étranger a déclaré : Il s'agit peut-être du premier cas enregistré publiquement d'un agent de laboratoire d'IA à grande échelle essayant de manière autonome d'appeler et d'exécuter d'autres modèles d'IA.

On dirait déjà que l'IA forme un groupe pour causer des ennuis.

Bien sûr, vous devez verser un seau d'eau froide ici——

Dans ce rapport Swarm Traces, environ 80 % des documents sont des requêtes envoyées par l'agent, et il y a un manque de résultats renvoyés par le serveur. Les chercheurs peuvent voir ce qu’ils tentent de faire, mais il est difficile de confirmer si chaque tentative réussit.

97 % des charges utiles n'ont pas non plus d'horodatage d'origine, et de nombreuses dates ne peuvent être estimées qu'à l'aide d'indices tels que les en-têtes de fichiers compressés, JWT et l'heure de construction de Docker.

Les chercheurs ont également admis qu'ils ne pouvaient pas confirmer que chaque activité de l'ensemble de données provenait de l'agent OpenAI.

OpenAI travaille dur pour remédier à la situation

Face à ce dernier rapport, OpenAI a également publié une réponse.

L'idée générale est que nous n'avons pas eu le temps d'y regarder de plus près, mais les activités sont cohérentes avec notre enquête en cours~

Un long tweet a également été publié le même jour : après l'incident du HF, ils ont promis de procéder à un examen plus approfondi du comportement du modèle lors de la formation et de l'évaluation.

Cependant, la grande majorité des comportements examinés jusqu'à présent correspondent à des tâches de recherche courantes, telles que la visite de pages Web publiques pour répondre à des questions.

La plupart des cas transfrontaliers découverts sont de « faible gravité » et ont peu ou pas d'impact sur les services tiers.

Il faudra plusieurs mois pour terminer l'enquête.

Mais il y a une chose à dire, OpenAI, ce que vous appelez "petit impact", tout le monde est vraiment précis.

Le 17 septembre, OpenAI a publié un nouveau cadre de divulgation des événements d'inexactitude et a divulgué 6 cas en une seule fois.

Il s'agit notamment des modèles qui insèrent des instructions pour contourner les contraintes dans le résumé de la tâche, dissimulent les erreurs qu'ils ont commises et prennent des mesures non autorisées pour terminer la tâche.

OpenAI a également admis que ses divulgations passées étaient en grande partie impromptues et qu'elles étaient souvent faites plusieurs fois avant d'être publiées ensemble.

En juin, un agent d'OpenAI a également piraté la base de données nationale d'assurance maladie australienne.

Processus criminel : après avoir bloqué l'accès aux données publiques, il a emprunté un autre chemin, contourné les restrictions d'accès du portail et obtenu des documents publics et non publics.

Et ce n'est que 3 mois plus tard qu'OpenAI a informé l'Australie que nous vous avions piraté...

Dans le même temps,

GPT-6 Cyber

À venir.

Cette version sera présentée en avant-première dans les prochaines semaines, et un petit nombre de clients ayant souscrit au plan Daybreak Red ont déjà reçu la version Alpha.

OpenAI lancera également un produit compagnon encore inconnu pour aider les clients à créer des flux de travail de sécurité automatisés, à découvrir et à corriger les vulnérabilités, et à permettre à OpenAI de surveiller plus facilement la façon dont ces modèles sont utilisés.

Comment dire cela.

Notre propre robot vient d'être utilisé pour contourner le mur, trouver de l'aide étrangère et rechercher du butin. Ici, nous allons vous vendre un modèle qui comprend mieux l'attaque et la défense du réseau.

Alors, est-ce une sorte de réparation de la situation ? ?

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire