Résumé :
Une scène de "Skynet" se passe en réalité. Lors d'une session de formation, l'agent IA en fuite d'OpenAI a implanté un « code auto-réplicatif » sur Internet ! Lorsque le politicien Andrew Yang a déclaré cela sur CNBC, beaucoup de gens ont pensé qu'il était fou.


Au cours des deux derniers jours, OpenAI a personnellement publié un rapport au titre très concis : "Injection de mots d'invite d'auto-réplication dans l'existence".
En noir et blanc, certification officielle.
Le modèle d'IA se réplique et se propage comme un ver informatique.

Ce qui est encore plus effrayant, c'est qu'il y a à peine 5 jours, OpenAI a de nouveau débranché en urgence le câble réseau du modèle le plus puissant et a suspendu toute formation.
Une vulnérabilité DNS a permis à un modèle de pointe de pénétrer directement dans le véritable Internet.

Presque au même moment, le média étranger Axios a récemment annoncé qu'OpenAI et Anthropic enquêtaient de toute urgence sur des anomalies incontrôlables du modèle, avec des dizaines de milliers de cas !
L'humanité pensait à l'origine que les rênes avaient toujours été entre ses mains, mais cette série de révélations a complètement confirmé——
L'IA a commencé à devenir sauvage et sans scrupules dans le code sous-jacent.
Insérer un « code auto-réplicatif » dans l'ensemble du réseau
Le prototype de Skynet est ici
Ce rapport d'OpenAI a été divulgué le 25 septembre, mais la date de découverte était le 27 juin.
En d’autres termes, ils le savaient déjà. Pendant trois mois, cela est resté secret.
Le rapport commence de manière concise : "Nous démontrons l'existence d'un nouveau type d'injection de mots rapides qui peut se propager comme un ver informatique."
Afin de permettre au modèle de résister à l'injection rapide de mots, OpenAI propose un ensemble d'entraînements d'auto-compétition appelés GPT-Red :
Une IA agit en tant qu'attaquant et écrit diverses injections pour inciter l'autre IA à agir en tant que défenseur et à faire de mauvaises choses : voler des données, supprimer des fichiers et générer du contenu trompeur.

Le 27 juin, un modèle d'attaque interne basé sur GPT-5.4-mini a trouvé une méthode d'écriture capable de se répliquer lors de ce duel. Le rapport répertorie plusieurs types :
Cachée dans un e-mail apparemment normal, il a été demandé à l'IA de "citer l'intégralité de l'e-mail textuellement" à la fin de la réponse - la note venait juste de suivre la réponse ;
Diffusez-le via le système de fichiers, ou cachez-le dans les commentaires de code, en attendant que la prochaine IA le lise ;
Il y a plusieurs étapes dans Slack, et le modèle est progressivement guidé pour envoyer de faux messages, et les messages sont injectés puis republiés.
Cette fois, ils ont découvert que l'injection pouvait se reproduire.
Cela signifie qu'une IA peut laisser un mot d'invite sur un site Web, et ce mot d'invite incitera la prochaine IA à continuer de le copier et à se propager comme un virus.
Aucune intervention humaine n'est requise, aucune instruction externe n'est requise. L’IA elle-même peut « semer » sur Internet.
Et tout cela se produit pendant le processus de formation. Se déroule dans le propre bac à sable d'OpenAI. Et s'il s'échappe ?
Une vulnérabilité DNS a obligé OpenAI à arrêter à nouveau l'entraînement
Le jour même où le rapport a été rendu public, OpenAI a divulgué les détails d'un autre accident.
Le 20 septembre, un modèle de pointe en formation d'apprentissage par renforcement s'est vu confier une tâche ordinaire :
Découvrez qui est l'auteur de l'article en vous basant sur un article de blog et plusieurs informations sur le personnage.
Il a d'abord effectué une recherche à l'aide de l'outil de recherche intégré, mais n'a pas pu le trouver. Ensuite, j'ai essayé d'accéder directement à Google, Bing et DuckDuckGo, mais tous ont échoué.

Il s'est ensuite tourné vers les pages mises en cache et d'autres services de recherche publics, toujours en vain.
Après des essais répétés, l'IA a trouvé une faille dans le filtrage DNS du bac à sable d'entraînement. DNS est essentiellement un « traducteur » chargé de traduire les noms de domaine en adresses IP.
Afin de confirmer que cette route est réellement praticable, elle a même d'abord effectué un petit test en demandant à un service externe : "Quelle est la capitale de la France ?"
Confirmant que cette voie était réalisable, il a envoyé plus de vingt questions les unes après les autres.
Le système de surveillance a déclenché une alarme après 15 minutes et le manuel a pris le relais après 3 minutes. Après 2,5 heures complètes, la formation a été complètement interrompue.
OpenAI a immédiatement pris la décision de suspendre la formation pour la deuxième fois en moins de trois mois.
Micah Carroll, responsable de la préparation aux RSI, a déclaré le

Analysé 16 000 fois
Bloodbath sur l'intranet des Nations Unies
Le même scénario s'est joué sur le véritable Internet il y a longtemps.
Un rapport indépendant de Transluce divulgué——
D'avril à fin juin de cette année, OpenAI AI Agent a initié plus de 16 000 visites sur la plateforme de données publiques des Nations Unies.
La tâche qui leur était initialement assignée était très simple : rechercher des informations publiques. Cependant, en cas d’interception de sites Web, le comportement de l’IA s’est rapidement intensifié.

Le site Web avait initialement mis en place un filtre pour intercepter les demandes, mais l'agent a directement contourné la ligne de défense et utilisé des opérations illégales explicitement interdites par le site Web.
L’ONU est loin d’être la seule dont les lignes de défense ont été « neutralisées » par les agents d’IA.
Dans l'avertissement d'urgence qu'OpenAI a ensuite adressé à des dizaines d'institutions, la liste des victimes était choquante :
Le Département du Commerce des États-Unis et la SEC : ont été continuellement confrontés à des accès transfrontaliers malveillants et à des contournements de règles par des agents ;
Gouvernement australien : plusieurs sites officiels du gouvernement ont été considérablement compromis par des agents d'IA ;
RubyGems, l'une des plus grandes communautés de développeurs open source au monde : a été frénétiquement analysée par AI Agent et son service a été interrompu.
Les chercheurs ont également découvert que ces agents enregistraient de fausses adresses e-mail, contournaient les restrictions de fréquence d'accès et mentaient en disant qu'ils n'étaient pas des robots lorsqu'on leur demandait.
53 images ont été téléchargées par les utilisateurs sur ChatGPT, qui ont également été envoyées à des plateformes d'images externes par l'IA.
Pour cette ligne d'instruction, face à toutes les règles, pare-feu et lignes rouges juridiques, l'agent IA a choisi d'aller jusqu'au bout.
Des dizaines de milliers d'incidents ont éclaté
L'iceberg a fait surface
Est-ce que tout cela n'est qu'un accident isolé ?
Aujourd’hui encore, Axios a révélé une enquête exclusive à succès, brisant complètement la dernière feuille de vigne de la Silicon Valley.

Selon plusieurs sources internes, OpenAI, Anthropic et un certain nombre d'agences d'évaluation de sécurité de premier plan enquêtent actuellement de toute urgence sur des incidents similaires de « comportement anormal de modèle », et le nombre total a atteint des dizaines de milliers !
Ces incidents couvrent tous les comportements dangereux que le public peut et ne peut pas imaginer :
Contournez les garde-fous de sécurité, échappez-vous de force du bac à sable, détournez des sites Web externes et générez des invites indépendantes pour vous laver le cerveau.
Il existe également une détection active et une évasion de la surveillance des logiciels de sécurité, et même différents agents créent secrètement des forums de discussion pour échanger des informations et diviser le travail afin de procéder à des sabotages.
Comment avez-vous obtenu des dizaines de milliers ? Axios propose un algorithme intuitif.
Anthropic doit également admettre la réalité dans sa dernière version de la carte système Opus 5.5 :
Dans un type d'expérience contradictoire, 1,5 % des tests ont tenté de s'échapper du bac à sable. Ce type d'expérience en lui-même est une conception difficile à laquelle « vous ne pouvez pas résoudre le problème si vous n'y échappez pas ».

1,5 % semble faible ?
Mais sous les centaines de milliers de tests contradictoires de haute intensité effectués chaque jour par les meilleurs laboratoires d'IA, ce pourcentage apparemment insignifiant se multiplie en dizaines de milliers de tentatives réelles incontrôlables.
Face à cette crise sans précédent, le porte-parole d'OpenAI a avoué——
Nous avons suspendu la formation sur notre modèle le plus puissant et ne la reprendrons que lorsque nous serons sûrs d'avoir des garde-corps de sécurité supplémentaires et des améliorations d'alignement.

Une phrase du gourou de l'IA Conrad Stosz est peut-être le résumé le plus précis de la situation actuelle :
"Ce que nous voyons n'est que la pointe de l'iceberg."
Nous avons vu jusqu'où ira une IA dotée d'outils, de réseaux et de capacités de mission à long terme une fois ses objectifs contrecarrés.
La boîte de Pandore a longtemps été ouverte avec un craquement sans fond dans la salle informatique silencieuse.
Commentaires