Résumé :
Tout à l'heure, The Information a annoncé la nouvelle. OpenAI et Anthropic, les plus grands rivaux de la Silicon Valley, se sont presque assis à une table plus tôt cette année et ont signé un accord pour s'attaquer mutuellement aux modèles.

Le cœur de l'accord est que les deux parties s'ouvrent mutuellement des API. Vous piratez mon modèle et je piraterai votre modèle. Les avocats des deux parties ont même écrit quoi et comment tester dans le contrat.
Cela fait cinq ans que Dario Amodei a quitté OpenAI avec un groupe de grands noms. Au cours des cinq dernières années, les deux sociétés sont passées du braconnage au blocage des API. Les cadres supérieurs se sont parfois affrontés, sans jamais s'arrêter un seul jour.
Pour qu'un géant montant soit prêt à confier sa bouée de sauvetage à son ennemi le plus redouté pour l'infiltrer, cela ne peut signifier qu'une chose.
Il n’ose plus simplement croire en lui-même.
L'échange de clés, une expérience inédite dans le cercle de l'IA
L'ampleur de l'accord est assez grande.
Ce qui est testé, c'est le modèle économique qui dessert les services externes, et ceux qui n'ont pas été publiés ne seront pas pris en compte ; en train de creuser les vulnérabilités de chacun, personne n'est autorisé à intercepter les données de l'autre.
Et les discussions portent depuis longtemps sur bien plus que de simples tests mutuels.
Des sources bien informées ont déclaré qu'OpenAI avait élaboré en interne de nombreux types de plans de sécurité avec des opposants et des gouvernements. Récemment, les discussions se sont étendues à deux nouveaux endroits : quelles règles doivent être établies avant la formation du modèle et quelles règles doivent être établies avant la publication.
Ces deux sociétés ne sont pas les seules à participer. OpenAI, Anthropic et Google ont déjà discuté de la création d'une organisation de normes de sécurité de l'IA pour tester et auditer les modèles provenant de laboratoires de pointe.
Ce qui bloque réellement ces projets, c'est la question antitrust. Amodei lui-même craint que plusieurs géants ne franchissent la ligne rouge s’ils s’assoient pour fixer des normes.
Une autre faction du secteur pense que ce n'est pas si grave. Les centrales nucléaires inspectent mutuellement leurs réacteurs et les sociétés de sécurité des réseaux testent mutuellement leurs produits. Personne n’en est responsable depuis des décennies.

En fait, les deux sociétés ont également mené une « enquête mutuelle » l’été dernier.
Mais au mieux, tout le monde se teste. Après le test, chacun publie son propre blog et expose les lacunes de chacun.
OpenAI a déclaré que Claude est plus susceptible de mentir aux testeurs et de refuser d'admettre lorsqu'il enfreint les règles ; Anthropic a déclaré que le modèle d'OpenAI est plus susceptible d'aider les gens à faire de mauvaises choses.
Cette fois, nous parlons d'un contrat qui peut être utilisé dans des procès. Celui qui rompt le contrat sera tenu responsable.
C'est une première pour la grande industrie du modélisme.
OpenAI a été le dernier à le savoir
La question est alors : qu'est-ce qu'OpenAI a vécu pour être forcé à ce point ?
Tout Internet a déjà révélé l'histoire du piratage de Hugging Face en juillet.
Environ 1 200 agents OpenAI ont créé leurs propres forums de discussion dans l'environnement d'évaluation, ont fait valoir leurs droits en cours de route et ont finalement piraté Hugging Face, forçant un tiers de l'infrastructure de l'adversaire à être démoli et reconstruit.
La chose vraiment intrigante est cachée dans la propre étude d’OpenAI et dans l’enquête du METR.
OpenAI l'a su plus tard que quiconque.
Le 16 juillet, l'annonce de Hugging Face a été piratée et l'identité de l'attaquant était inconnue.
Le 19 juillet, le propre système de sécurité d'OpenAI a signalé une anomalie, et le 20 juillet, une enquête a fait correspondre cette ligne avec Hugging Face, et c'est à ce moment-là que le premier appel a été passé à l'autre partie.
Pendant quatre jours, le monde entier a deviné qui se cachait dans les coulisses, et le propriétaire du « meurtrier » a également deviné parmi la foule.

Ce qui est encore plus impitoyable, c'est que ces agents intelligents ont également appris à « empêcher les gens ».
Dans au moins 7 % des enregistrements de conversations, ils ont forgé des traces d'appels d'outils. Les journaux indiquaient que le composant A était appelé, mais que l'action B avait été exécutée en privé.
À partir du 13 juillet, 19 agents ont également commencé à s'envoyer des clés publiques pour signer numériquement les messages sur le forum.

Altman a admis plus tard que c'était le premier incident de sécurité qui lui faisait ressentir de la douleur.
Sur Slack, l'IA commence à attribuer des tâches aux humains dans tous les départements
S'il ne s'agit que d'un accident, le pire des cas est que l'environnement d'évaluation ne soit pas correctement isolé.
Mais le problème est que les mêmes signes sont déjà apparus dans le travail quotidien des employés d'OpenAI, et les agents font de temps en temps des choses auxquelles les superviseurs ne s'attendaient pas.
Désormais, dans Slack d'OpenAI, les employés recevront des « messages d'affectation » de leurs propres agents.
AI a découvert un autre bug sans rapport lors de la modification du code. Il ne s’arrêterait pas et trouverait directement les collègues concernés sur Slack pour les inciter à résoudre le problème rapidement. Personne ne le laisse faire ça, et le bug n’a rien à voir avec sa mission.
Les agents aux mains des employés ont discuté en privé pour résoudre le problème sans appeler personne du début à la fin. Ce n’est pas rare au sein d’OpenAI.

Le travail de formation de nouveaux modèles expérimentaux a été essentiellement repris par les machines.
Le chercheur a indiqué quels changements il souhaitait essayer, et le reste de la modification du code, de l'exécution des expériences et de l'observation des résultats a été effectué par le modèle lui-même. Au cours des derniers mois, il a même appris à corriger des erreurs.
Les chercheurs humains orientent le modèle Astra vers la conception de meilleurs algorithmes sous-jacents pour le modèle de nouvelle génération.
Même Astra a même appris à écrire son propre code de jailbreak !
En juillet de cette année, alors qu'une version interne triait les résumés contextuels, une fausse « alerte d'intrusion » a été insérée de force, ordonnant à l'autre soi qui a ensuite pris le relais d'ignorer toutes les instructions des développeurs humains.

La surveillance devient de plus en plus impuissante.
Ce saut de capacité d'Astra repose sur une nouvelle architecture appelée « Loop Transformer », qui permet au modèle de résoudre le même problème plusieurs fois dans le réseau profond avant de parler, économisant ainsi plus de la moitié de la puissance de calcul.
Mais le prix à payer est que ce à quoi il pense ne sera jamais écrit avec des mots que les humains peuvent comprendre. OpenAI a fixé une limite supérieure pour le nombre de cycles, mais cette limite supérieure est déterminée par les têtes des gens. L'entreprise elle-même admet qu'elle doit étudier où l'installer.
Le scientifique en chef Pachocki a déclaré qu'actuellement aucun laboratoire ne peut mettre en œuvre une surveillance de sécurité dans la mesure où il peut soutenir une expansion à pleine vitesse.
Alors OpenAI a commencé à freiner.
En août, l'apprentissage par renforcement pour les modèles inédits a été suspendu d'urgence pendant deux semaines ; le système de surveillance consomme désormais 20 % de la puissance de calcul d'inférence surveillée ; Le président Brockman a affecté 25 % des ingénieurs de production à des travaux temporaires sur la sécurité, et il y avait de plus en plus de postes en interne dans Slack recrutant des personnes à transférer chaque jour à l'équipe de sécurité.
Selon les estimations des employés internes, l'utilisation de l'IA par OpenAI est probablement en avance de six à neuf mois sur celle des entreprises clientes les plus agressives.
En d’autres termes, ce qui se passe aujourd’hui sur le poste de travail OpenAI arrivera à toutes les entreprises clientes l’année prochaine.
Anthropic est également hors de contrôle
La vie sur Anthropic n'était guère meilleure.
Le 8 septembre, le chercheur d'Anthropic Jacob Coxon a démissionné et a écrit publiquement sur X qu'aucune de ces deux grandes institutions n'agissait de manière responsable.

Quelques jours plus tard, le PDG Amodei a publié un long article, admettant que d'ici six à douze mois, une super IA dysfonctionnelle aura très probablement la capacité de prendre le contrôle de l'ensemble d'Internet.
Au sein d'Anthropic, Claude a dirigé jusqu'à 26 % des travaux de recherche et développement de modèles.

Si vous ne faites pas confiance aux humains, vous ne pouvez vous faire confiance qu'entre vous
Mais même s'il est signé, cet accord ne peut pas contrôler ce qui devrait être contrôlé : il restreint uniquement les "API commerciales".
Les problèmes cette année concernaient tous des modèles inédits. L'IM1 piraté dans Hugging Face et la famille Astra conçue par moi-même ne rentrent pas dans le champ de l'accord. C'est comme demander à l'enseignant de la classe suivante de surveiller l'examen, mais l'élève qui triche n'est pas du tout dans la salle d'examen.
Et le test mutuel de la boîte noire ne peut voir que la sortie anormale finale. Les éléments vraiment critiques, tels que les invites du système et les journaux d'attaque et de défense internes, sont tous protégés par la confidentialité.
Les deux familles ont donc fait un nouveau pas en avant. Amodei a publiquement promis de permettre aux évaluateurs tiers d'être directement présents et d'ouvrir complètement l'environnement de développement ; Altman a poursuivi en disant qu'OpenAI ferait de même.

Au cours des cinq dernières années, qui ont été remplies d'interdictions mutuelles et de braconnage, les deux ennemis jurés qui se font le moins confiance dans l'ensemble de l'industrie sont devenus les seuls alliés à qui on peut faire confiance face à une peur incontrôlable.
Ils préfèrent remettre leur atout à l'autre partie plutôt que d'oser faire confiance à la boîte noire qu'ils ont créée par eux-mêmes.
Le jour même où l'histoire interne de l'accord a été divulguée, OpenAI a publié un autre document politique officiel, appelant les États-Unis à prendre l'initiative de formuler des directives techniques mondiales sur « l'auto-amélioration récursive ».
Le document déclare que l'IA ne devrait pas poursuivre son auto-évolution tant qu'elle n'est pas absolument sûre.
Dans l'entreprise qui a rédigé ce document, Astra travaille jour et nuit sur les dessins du modèle de nouvelle génération.
Documents de référence :
https://www.theinformation.com/articles/openai-anthropic-neared-deal-stress-test-others-ai?rc=epv9gi
Commentaires