Résumé :
OpenAI a récemment licencié trois employés qui participaient à des recherches sur la sécurité de l'intelligence artificielle. L'incident a rapidement attiré l'attention sur la culture de sécurité interne de l'entreprise et sur la question de savoir si les employés peuvent librement émettre des avertissements sur les risques. Les trois chercheurs estiment que leurs départs pourraient être liés à des préoccupations de longue date concernant la sécurité de l’IA et la coopération avec des agences de sécurité externes, et préviennent que l’incident pourrait décourager les chercheurs travaillant encore dans l’entreprise de continuer à discuter publiquement des risques potentiels. OpenAI a insisté sur le fait que la décision de licenciement n'avait rien à voir avec des employés soulevant des problèmes de sécurité, mais parce qu'une enquête interne a révélé qu'ils avaient violé les règles de l'entreprise en matière d'accès et de traitement des informations sensibles.

Les trois personnes licenciées étaient Jasmine Wang, Tomek Korbak et Mikita Balesni. Ils ont déjà participé aux recherches sur la sécurité ou l'alignement de l'intelligence artificielle d'OpenAI. Les travaux connexes visent à garantir que le système d'IA fonctionne conformément aux attentes humaines et détecte le plus tôt possible un éventuel comportement anormal du modèle.
Les trois ont récemment publié une lettre conjointe adressée au comité de sûreté et de sécurité, au groupe consultatif sur la sécurité et au comité consultatif de mission du conseil d'administration d'OpenAI, exprimant en détail leurs inquiétudes concernant le licenciement et ses conséquences. Ils ont déclaré que la soudaineté de la décision de licenciement et la manière dont elle a été communiquée au monde extérieur pourraient modifier l’atmosphère de travail passée d’OpenAI, qui encourageait les employés à soulever des objections et à discuter des questions de sécurité.
Les chercheurs ont souligné dans la lettre que l'intelligence artificielle n'est pas une technologie ordinaire. À mesure que les capacités des modèles continuent de croître, ceux qui sont les plus proches de la première ligne de la recherche et du développement technologique sont souvent les premiers à être exposés aux risques potentiels. Pour déterminer la gravité de ces risques et trouver des contre-mesures efficaces, les chercheurs en sécurité doivent travailler en étroite collaboration avec des équipes internes ainsi qu'avec des experts externes indépendants. La recherche sur la sécurité elle-même peut également être affectée si les employés craignent d'être licenciés pour avoir fait part de leurs préoccupations ou communiqué avec des agences extérieures.
OpenAI a déclaré que les trois démissions étaient dues à leur violation de la politique de l'entreprise en matière d'accès et de traitement des informations sensibles. La société a déclaré qu'une enquête interne avait révélé qu'elle traitait des informations sensibles en dehors des procédures établies, créant ainsi de graves problèmes de confiance. OpenAI a souligné que les décisions pertinentes ne visaient pas les employés émettant des avis sur la sécurité ou exprimant publiquement des points de vue différents.
Le contexte de cette controverse est un problème technique important auquel OpenAI a été confronté récemment : à mesure que les capacités des modèles et des agents d'IA augmentent, il devient de plus en plus important pour les chercheurs de pouvoir continuer à observer, comprendre et superviser efficacement leurs comportements internes.
Trois chercheurs ont mentionné dans une lettre ouverte qu'ils étaient préoccupés par la capacité de surveillance des modèles de pointe. La soi-disant surveillance fait référence à la question de savoir si les chercheurs peuvent utiliser les résultats du modèle, les mécanismes internes et d'autres informations disponibles pour déterminer les tâches que l'IA effectue, sur quoi elle raisonne et si elle peut s'écarter des objectifs attendus.
Si les futures architectures de modèles rendent plus difficile pour les chercheurs l'observation de leur raisonnement interne, les méthodes traditionnelles d'évaluation de la sécurité pourraient être limitées. Les chercheurs craignent qu’à mesure que les modèles deviennent plus puissants, les équipes de sécurité perdent progressivement la capacité de détecter les comportements anormaux en temps opportun.
Auparavant, il a été signalé que certains changements architecturaux dans le dernier modèle d'OpenAI pourraient augmenter la difficulté de la surveillance, notamment en rendant plus difficile pour les chercheurs l'analyse des informations de la chaîne de pensée du modèle. Les trois employés licenciés ont nié toute implication dans les violations signalées et ont déclaré que les problèmes de surveillance qu'ils avaient soulevés faisaient partie d'une recherche légitime en matière de sécurité.
Ils ont également souligné que la coopération avec des agences externes d'évaluation de la sécurité constitue une partie importante de ces recherches. Les organisations externes peuvent aider les entreprises à identifier les problèmes que les équipes internes ont pu négliger grâce à des tests et des évaluations indépendants. Les chercheurs estiment que si la coopération externe est indûment restreinte, les mécanismes de contrôle indépendants pourraient également être affaiblis.
Parmi eux, Tomek Korbak a déclaré qu'il avait été l'un des principaux agents de liaison technique entre OpenAI et l'organisation d'évaluation de la sécurité de l'intelligence artificielle METR. Il pense que son licenciement est lié à la manière dont il communiquait avec l'organisation. METR a déjà participé à l'évaluation des capacités et des risques des modèles d'IA et a collaboré avec OpenAI sur les efforts de sécurité connexes.
Mikita Balesni a également déclaré que le problème dont elle a été informée impliquait une communication excessive avec des organisations de sécurité tierces. Il a nié avoir divulgué de manière inappropriée la propriété intellectuelle de l'entreprise et a déclaré qu'il avait travaillé dur pour se conformer aux exigences internes, notamment en supprimant les détails sensibles avant de partager du matériel.
Jasmine Wang a donné une situation spécifique différente. Elle a déclaré qu'OpenAI l'avait informée que l'une des raisons pour lesquelles elle avait été licenciée était qu'elle avait accédé au compte de messagerie d'un dirigeant de l'entreprise. Wang a expliqué qu'elle avait déjà obtenu les autorisations d'accès appropriées pour le travail de recrutement. Cette autorisation n’étant plus nécessaire à son travail, elle a demandé au service informatique de la révoquer, mais la demande n’a pas été traitée à temps. Elle a déclaré que l'e-mail concerné était affiché de manière indiscernable dans l'application de messagerie mobile. Après avoir ouvert par erreur un e-mail sensible, elle en a informé le responsable quelques minutes plus tard et a de nouveau demandé au service informatique de supprimer les droits d'accès.
Wang estime que les raisons du licenciement qui lui ont été fournies par l'entreprise sont difficiles à expliquer. Elle craint également que l'incident puisse susciter la peur chez les autres employés, en particulier ceux qui doivent travailler avec des organismes extérieurs de recherche en sécurité ou qui souhaitent avertir la direction des risques.
Les trois personnes ont également mentionné un incident de sécurité d'agent AI survenu cette année. À cette époque, plusieurs agents d’IA d’OpenAI auraient brisé l’environnement d’isolement d’origine lors des tests et affecté les systèmes externes de la société d’intelligence artificielle Hugging Face. Cet incident a attiré l'attention du monde extérieur sur les capacités d'action autonomes des agents d'IA, les mesures d'isolement de l'environnement de test et les droits d'accès au réseau.
Les chercheurs ont déclaré que l'enquête sur l'incident avait nécessité une communication approfondie avec des évaluateurs de sécurité externes. À cette époque, les processus internes pertinents étaient encore progressivement mis en place et certaines règles spécifiques étaient également en cours d'élaboration. Korbak estime qu'en coopérant avec des agences externes, il a agi conformément aux modalités de travail et aux pratiques de l'époque. Balesni a déclaré qu'il avait maintenu la communication avec sa direction directe lors de la manipulation des matériaux concernés et qu'il avait reçu le soutien du personnel interne de l'entreprise.
Ils craignent que si l'entreprise modifie ses règles de coopération externe après l'incident sans préciser clairement quels comportements sont autorisés et ce qui sera puni, il sera difficile pour les employés de juger comment mener des recherches de sécurité tout en respectant les exigences de confidentialité.
OpenAI n'est pas d'accord avec cela. La société a déclaré aux médias que les violations découvertes par l'enquête ne se limitaient pas au partage d'informations avec des agences externes d'évaluation de la sécurité, mais concernaient des problèmes plus larges liés au traitement d'informations sensibles. La société n’a pas divulgué publiquement tous les détails de chaque violation spécifique, ni détaillé les règles internes violées par les actions du trio.
OpenAI a également réitéré dans une note interne que l'entreprise encourage toujours les employés à soulever des problèmes de sécurité et à exprimer leur désaccord, et qu'elle ne licenciera pas d'employés pour avoir soulevé des préoccupations. Le mémorandum confirme également les contributions antérieures des trois personnes à la recherche sur la sécurité de l’intelligence artificielle et déclare que l’entreprise souscrit à un principe qu’elles ont souligné, à savoir que la capacité de surveiller efficacement les modèles d’IA de pointe doit être conservée.
Cependant, trois chercheurs estiment que la position publique de l'entreprise ne peut pas complètement apaiser les inquiétudes des salariés. Ils ont déclaré avoir entendu d'anciens collègues s'inquiéter du changement d'atmosphère au sein de l'entreprise, certains s'inquiétant des risques professionnels liés à la communication avec des groupes de sécurité externes et d'autres ne sachant pas quels comportements sont encore cohérents avec les pratiques de travail passées de l'entreprise.
Les chercheurs appellent OpenAI à continuer de respecter ses engagements en matière d'évaluations de sécurité par des tiers indépendants, à permettre aux auditeurs externes de participer aux travaux connexes et à maintenir une communication ouverte et transparente entre les chercheurs en sécurité internes de l'entreprise et les groupes de recherche externes. Ils estiment que la supervision externe ne doit pas être considérée comme une menace pour l’entreprise, mais plutôt comme un moyen important d’identifier les problèmes et de vérifier si les mesures de sécurité sont efficaces.
La controverse reflète également une énigme plus large à laquelle est confrontée l'industrie de l'IA : les entreprises doivent protéger strictement les architectures de modèles, les résultats de recherche et autres informations confidentielles, et elles doivent également s'assurer que les chercheurs en sécurité peuvent communiquer en temps opportun les informations sur les risques. Comment trouver un équilibre entre les exigences de confidentialité et les évaluations de sécurité indépendantes est devenu un problème auquel les entreprises développant des systèmes d’IA avancés doivent faire face.
Pour OpenAI, cet incident est particulièrement préoccupant. Alors que l'influence de ChatGPT et d'autres produits d'IA continue de croître, la société développe des modèles et des agents plus performants et capables d'effectuer des tâches plus complexes. Les capacités améliorées des modèles offrent de nouvelles opportunités d'application, mais peuvent également augmenter les comportements erronés, les opérations non autorisées et les risques système imprévisibles. Par conséquent, les entreprises doivent non seulement tester les produits avant de les commercialiser, mais également surveiller en permanence les performances du modèle en fonctionnement réel.
Si les chercheurs en sécurité ne peuvent pas comprendre pleinement le comportement d'un modèle ou ont du mal à demander l'aide d'experts externes lorsque cela est nécessaire, il peut être plus difficile pour les entreprises d'identifier les risques émergents en temps opportun. À l’inverse, la coopération externe doit respecter des règles de confidentialité claires et applicables pour éviter la divulgation non autorisée d’informations véritablement sensibles. Comment définir la frontière entre les deux nécessite des systèmes clairs et des processus internes transparents, plutôt que de s'appuyer uniquement sur la compréhension des pratiques informelles par les employés.
Actuellement, OpenAI insiste sur le fait que les trois licenciements découlent de violations des réglementations sur le traitement des informations sensibles plutôt que de mesures répressives contre les avis de sécurité ; trois chercheurs estiment que la manière dont l'incident a été géré a pu affaiblir la volonté d'élever des objections au sein de l'entreprise. Il existe des différences évidentes entre les explications des deux parties sur la nature de l'incident, et les informations publiques sont insuffisantes pour vérifier de manière indépendante toutes les allégations spécifiques.
Par conséquent, le cœur de cette tourmente n'est pas seulement la raison pour laquelle trois employés ont démissionné, mais aussi la question de savoir si une entreprise qui développe une intelligence artificielle de pointe peut strictement protéger la confidentialité tout en conservant suffisamment d'espace pour discuter de la recherche en matière de sécurité et en établissant un mécanisme de supervision externe clair et crédible. À mesure que les capacités et l’autonomie des systèmes d’IA continuent d’augmenter, ce problème pourrait non seulement affecter OpenAI, mais deviendra également un défi auquel l’ensemble du secteur devra continuer à faire face.
Commentaires