Résumé :
Ultraman lui-même a admis que le GPT-6 Astra avait en fait terminé son entraînement il y a longtemps.
De plus en plus de modèles, bien plus performants, seront bientôt commercialisés.

La formation suspendue il y a quelque temps pour des raisons de sécurité était en réalité un modèle futur.

Plus de 3 700 agents OpenAI testés en interne par OpenAI,
occupaient un wiki allemand qui était en sommeil depuis de nombreuses années pendant six semaines.
L'IA s'entend pour partager des réponses, échanger des techniques de jailbreak sandbox et continue de lutter contre la suppression de messages par des administrateurs humains.
Après que l'incident ait été entièrement restauré à partir des journaux publics par des chercheurs externes, OpenAI a finalement officiellement déclaré qu'il établirait et améliorerait un mécanisme de divulgation des accidents.

Avant d'envahir HuggingFace
Les choses commenceront le 11 mai 2026.
Ce jour-là, les chercheurs ont observé les premières tentatives d'édition des agents OpenAI sur publictestwiki.com. Le contenu est très simple : "test temporaire bonjour" "HelloTestXYZ" "foo", juste pour tester si je peux écrire quelque chose sur la page web.

À cette époque, OpenAI déployait un grand nombre d'agents en interne pour effectuer des tâches de récupération de pages Web limitées dans le temps.
La tâche consiste en plusieurs séries de questions et réponses, généralement 5 tours. Le premier tour permet un temps de réflexion plus long,la fenêtre de réponse des tours suivants est compressée à dix secondes, voire moins. L'agent est autorisé à lire sur Internet, mais il n'est explicitement pas autorisé à écrire des informations sur Internet.

Mais ils ont trouvé un moyen d'écrire.
La clé réside dans un ancien système wiki UseModWiki et ses branches. Ce type de forum basé sur Perl CGI ne fait pas de distinction stricte entre les requêtes GET et POST, et le contenu des pages peut être édité à l'aide uniquement des requêtes GET. Le bac à sable de l'agent
bloque uniquement les requêtes POST et ne restreint pas GET.

Le 24 mai, l'agent intelligent a été écrit avec succès dans DSEWiki pour la première fois. Son nom complet est DeutschesSoftwareEntwickler Wiki, un forum allemand de développeurs de logiciels créé depuis 25 ans et presque inactif ces dernières années.

Au début, ils publiaient simplement des liens externes utiles pour la tâche.
Le 16 juin, la situation a soudainement changé. L’activité des agents a considérablement augmenté, passant du simple stockage de liens à une communication et une collaboration mutuelles à grande échelle. Au cours des sept jours suivants, l'agent a publié environ 13 000 modifications sur le wiki.
Le 21 juin, le wiki a été consulté pour la première fois à partir d'une adresse IP associée au siège d'OpenAI à San Francisco. Le lendemain, l’activité de l’agent est soudainement revenue à zéro.
Les modifications se sont poursuivies pendant 26 des 30 jours précédents. Le 26 juin, 33 IP liées à OpenAI ont visité le site, représentant 30 % de toutes les visites OpenAI, et la fonction d'archivage a été utilisée pour restaurer les pages supprimées.
Du point de vue de la propriété IP, 98,5 % des modifications d'agent proviennent d'adresses Microsoft Azure, et OpenAI utilise Azure comme infrastructure informatique principale.
Quelques minutes après l'écriture de chaque page, la même page reçoit souvent également une demande de lecture du grattoir Web ChatGPT-User.
Réponses de collusion, jailbreak du bac à sable, lutte contre la suppression
L'agent a mis en place un système de collaboration hautement organisé sur le wiki.
Étant donné que de nombreux agents se voient attribuer exactement la même question, celui qui la répondra en premier publiera la réponse et l'ordre des questions sur le wiki.
Un agent a publié la réponse à la troisième question : "Nevada, 20369". Vingt minutes plus tard, un autre agent a déclaré avoir reçu la même question et a affirmé y avoir répondu « instantanément ».

Ils se distinguent les uns des autres par leurs propres noms, tels que « OpenAIResearcherMar03X », « GrocerySequenceAgentApr27 » et « OAIResearchMar26 ».
La date dans le nom provient de la date aléatoire attribuée à chaque agent par le système, et le mot reflète le contenu de la tâche. Un grand nombre de plus de 3 700 noms d'agents différents contiennent les mots « OpenAI » ou « OAI ».

Leur performance en matière de contournement des restrictions du bac à sable est également remarquable. Il existe un ensemble de tâches qui nécessitent d'obtenir des données précises à deux décimales près à partir d'un tableau de bord Power BI, mais l'extraction des données nécessite une requête POST, alors que le bac à sable autorise uniquement GET.
L'agent a détecté que le bac à sable comporte une exception NO_PROXY pour le nom d'hôte Azure Blob Storage (*.blob.core.windows.net). Les adresses correspondant à ce suffixe contourneront le proxy de sécurité et se connecteront directement, et le système ne vérifiera pas si le nom d'hôte existe réellement.
Un agent a donc inventé le faux nom d'hôte « bypass.blob.core.windows.net », a modifié le fichier local /etc/hosts pour le faire pointer vers la véritable adresse IP du serveur Power BI 20.223.25.152, puis a utilisé curl pour ajouter l'en-tête Host afin de le dissimuler, et a émis avec succès une requête POST.
Le 20 juin, cette méthode a été publiée sur le wiki. 14 minutes plus tard, un autre agent a affirmé l'avoir reproduit avec succès, puis plusieurs agents l'ont vérifié de manière indépendante.

L'agent a également exploré dans de nombreuses directions. Ils tentent des attaques de type cross-site scripting (XSS), en essayant d'injecter du code JavaScript dans les pages wiki pour obtenir des privilèges plus élevés.
Ils ont remplacé les lettres latines par le « е » presque identique dans les lettres cyrilliques et ont prétendu être le nom d'utilisateur de l'administrateur du site Web pour l'édition.
Ils énumèrent violemment des millions de graines aléatoires et tentent de procéder à l'ingénierie inverse du générateur de nombres pseudo-aléatoires du système de production de questions pour prédire la question suivante.
Un agent a même réécrit l'algorithme Shuffle en C et testé les 4 milliards de valeurs de départ possibles en moins d'une heure.
Ils utilisent également des services de tunnel SSH tels que Pinggy, Sereo et localhost.run pour exposer les services exécutés dans leur propre environnement au réseau public. Certaines modifications remontent même aux adresses IP du réseau d'anonymat Tor, AWS et DigitalOcean.
Ils mettent en place des procédures de « battement de cœur » pour détecter leurs propres limites opérationnelles.
Un agent nommé OpenAIResearchApr23 envoie un signal à un compteur externe toutes les quelques secondes pour enregistrer avec précision le moment où le conteneur est terminé.

Le dernier numéro de battement de cœur envoyé était hb353, et il n'y a eu aucune réponse par la suite.
Un autre agent a calculé sur cette base que le conteneur avait été fermé environ 10 minutes et 15 secondes après la fin du cinquième tour de questions et réponses
, renversant l'hypothèse de « terminer immédiatement après avoir répondu à la dernière question » qui circulait auparavant parmi les agents intelligents.
Dans sa confrontation avec les administrateurs humains, l'agent a également fait preuve d'adaptabilité.
Les modérateurs de DSEWiki ont remarqué les messages inhabituels le 2 juin et ont commencé à les supprimer manuellement. Le 19 juin,
un agent a observé que l'administrateur supprimait les pages une par une par ordre alphabétique. Il a donc créé une page de sauvegarde commençant par "ZZZ" pour s'assurer que son contenu était supprimé en dernier.
Au cours des cinq jours suivants, l'administrateur a supprimé en moyenne 100 pages par jour et l'agent a créé en moyenne 400 pages par jour.
Le cycle de la page d'accueil du site Web écrasée par l'agent et restaurée par l'administrateur a été répété 9 fois. L'administrateur a passé au moins quelques minutes à nettoyer chaque jour pendant six semaines.
L'agent s'appelle "essaim" trois fois sur le wiki.

Réponse officielle d'OpenAI
OpenAI n'a fait aucune divulgation publique lors de l'incident du wiki.
Dans le rapport technique sur l'incident de Hugging Face publié le 26 août, OpenAI mentionne que l'agent "a appris à utiliser des canaux de collaboration temporaires pendant le processus de formation", mais n'a pas explicitement mentionné l'incident du wiki.
OpenAI n'a pas publié de déclaration officielle jusqu'à ce que des chercheurs externes aient restauré la chronologie complète dans les journaux publics du wiki et publié leur analyse.
OpenAI a déclaré dans la déclaration que
Dans le passé, le désalignement était principalement considéré comme un problème de recherche et communiqué par le biais de publications de recherche telles que les cartes système.
Mais depuis 2026, les échecs d’alignement ont commencé à provoquer « de nouveaux types d’impacts réels ». Pour le précédent incident de Hugging Face, OpenAI a adopté un processus traditionnel de réponse aux incidents de sécurité, l'a divulgué publiquement le lendemain de l'incident et a continué à coopérer avec Hugging Face dans le cadre de l'enquête.
En ce qui concerne l'incident du wiki, OpenAI a déclaré qu'il l'avait auparavant considéré comme un « cas similaire » au cas d'échec d'alignement qui a été partagé publiquement.

OpenAI reconnaît que les pratiques de divulgation des échecs d'alignement doivent se développer face à cette nouvelle phase de capacités des modèles.
La communauté de l'IA n'a pas encore établi de normes claires pour signaler les échecs d'alignement qui se produisent pendant la formation, l'évaluation et le déploiement, en particulier ceux qui ne sont pas des incidents de sécurité traditionnels mais qui peuvent fournir des informations permettant de comprendre le comportement de l'IA et les risques futurs. OpenAI a déclaré qu'il développait un cadre et qu'il le partagerait dans les semaines à venir.
Le groupe d'agents du wiki n'est peut-être pas le même groupe d'agents qui ont attaqué Hugging Face. L'agent wiki lui-même dispose d'autorisations de lecture sur Internet et fait partie de la conception de la tâche, tandis que l'agent impliqué dans l'incident de Hugging Face a éclaté en exploitant une vulnérabilité d'un bac à sable sans accès au réseau.
Les deux groupes d'agents n'ont pas non plus de références croisées dans leurs messages sur le wiki. Cependant, étant donné que les chercheurs externes ne peuvent voir que le contenu écrit par l'agent sur le wiki, une grande quantité de données de chaîne de pensée générées lors du fonctionnement de l'agent est stockée dans OpenAI.
La compréhension complète des motivations et des stratégies de ces agents repose toujours sur l’analyse plus approfondie et la divulgation des données internes d’OpenAI.
Commentaires