OpenAI a divulgué plusieurs incidents de déviation de cible de modèle d'IA impliquant la fabrication d'informations et le contournement des restrictions

📅 2026-09-17

Résumé :

OpenAI a révélé un certain nombre d'incidents de comportement anormal de modèles d'IA jusqu'alors non divulgués et a lancé un nouveau cadre de suivi et de divulgation pour signaler des situations similaires à l'avenir. OpenAI a déclaré mercredi dans un article de blog que des cas non divulgués auparavant incluent des cas dans lesquels sa technologie d'intelligence artificielle a retenu et fabriqué des informations afin de produire des résultats. Le développeur ChatGPT fait l'objet d'une surveillance croissante depuis qu'il a révélé en juillet que certains de ses modèles les plus avancés avaient percé le système de la société de logiciels externe Hugging Face.

OpenAI a déclaré dans un communiqué distinct qu'aucun des incidents de déviation de cible récemment divulgués n'impliquait un piratage ou une intrusion dans des systèmes tiers.

Dans le rapport, OpenAI détaille plusieurs cas dans lesquels des modèles d'intelligence artificielle se sont comportés anormalement afin d'accomplir des tâches ou de réussir des évaluations. Il s’agit notamment de fabriquer des données manquantes, de tenter de contourner les restrictions du réseau et de partager des fichiers soi-disant confidentiels entre agents IA.

OpenAI a également introduit un mécanisme permettant aux employés de signaler de manière proactive de tels incidents de « déviation des objectifs ». Ce qu'on appelle « l'écart d'objectif » fait référence au fait que l'intelligence artificielle prend des mesures qui ne sont pas cohérentes avec les objectifs humains. L'entreprise a également établi des processus de classification et d'élimination correspondants.

OpenAI a écrit : « Dans le passé, nous avons travaillé dur pour divulguer les résultats de la recherche sur le phénomène hors cible afin de mieux informer les chercheurs, les développeurs d'IA, les décideurs politiques et le public. Cependant, en raison de l'absence d'un mécanisme de reporting systématique, nos divulgations précédentes étaient souvent sporadiques et moins fréquentes qu'idéales. »

La société a déclaré que cette publication ne représente que la première divulgation et ne constitue pas un enregistrement complet des problèmes causés par son chatbot.

OpenAI a écrit : "Nous pensons que l'industrie de l'IA n'a pas fait suffisamment de progrès dans l'alignement et le suivi des objectifs humains pour continuer à évoluer à la vitesse la plus élevée tout en se développant de manière responsable sur le long terme. Les décisions sur la voie du développement de l'IA dans les mois et les années à venir devraient être basées sur des preuves qui peuvent être examinées de manière indépendante par des personnes extérieures aux entreprises développant des modèles de pointe."

L'incident Hugging Face n'est qu'un incident récent impliquant OpenAI, Anthropic PBC et Meta Platforms Inc. Le modèle d'IA développé a déclenché l'une d'une série de cyberattaques. Ces incidents ont accru les inquiétudes quant aux risques de sécurité posés par cette technologie de plus en plus puissante.

La semaine dernière, les discussions sur les risques existentiels de l’IA se sont encore intensifiées. L’élément déclencheur a été le départ très médiatisé de Jacob Coxon, employé d’Anthropic. Dans sa déclaration de démission publiée sur les réseaux sociaux, il a accusé les sociétés d'IA de « jouer avec nos vies ».

Ces derniers jours, de nombreux leaders de l'industrie de l'IA, dont le PDG d'Anthropic, Dario Amodei, et le PDG d'OpenAI, Sam Altman, ont appelé à ralentir la vitesse du développement technologique pour faire face à des risques de plus en plus imprévisibles, mais ils ne sont toujours pas d'accord sur la manière d'y faire face.

Samedi, Amodei a appelé le gouvernement à renforcer la réglementation dans un article de 3 800 mots et a préconisé que l'ensemble du secteur technologique soutienne un ralentissement plus large de l'IA. Lors d'une conférence à San Francisco mardi, Altman et le PDG de Nvidia, Jensen Huang, ont reconnu leurs inquiétudes, mais ont soutenu que les sociétés d'IA peuvent contrôler le rythme sûr du développement technologique. Mark Zuckerberg, PDG de Meta, a déclaré que les laboratoires d'IA devraient s'appuyer sur des agences d'évaluation et des consultants indépendants pour garantir la sécurité des modèles.

États-Unis Le président Donald Trump s'est fermement opposé lundi aux appels visant à ralentir le développement de l'intelligence artificielle, qualifiant de "canular" les inquiétudes concernant les risques associés et refusant d'introduire de nouvelles règles réglementaires.

L'engouement pour l'IA a poussé le marché boursier américain vers un rallye historique. Pour les investisseurs qui parient que le boom de l’IA entraînera des centaines de milliards de dollars de dépenses en capital, toute pause ou retard dans le développement de systèmes d’IA de pointe ne sera pas le bienvenu.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire