Après que l'IA soit devenue de plus en plus capable de "jailbreak", NVIDIA commence à vendre des "cages"

📅 2026-09-29

Résumé :

Le 29 septembre, lorsque l'agent IA a commencé à être capable de faire fonctionner des ordinateurs, d'appeler des outils, d'accéder au réseau et même d'effectuer des tâches pendant plusieurs heures, un nouveau problème est devenu de plus en plus réaliste : si l'IA n'agit pas comme prévu, comment l'arrêter ?

La réponse donnée par NVIDIA est d'ajouter une "cage" en dehors de l'IA.

Lundi, heure locale, NVIDIA a publié la plate-forme NVIDIA Open Agent Safety, qui tente d'utiliser une combinaison de logiciels et de matériel pour limiter ce à quoi les agents d'IA peuvent accéder et exécuter, et les isoler ou même les arrêter lorsqu'ils tentent de franchir les limites prédéfinies.

Cette plate-forme se compose principalement de deux parties : le runtime de sécurité open source OpenShell et le système de surveillance indépendant Sentry basé sur BlueField-4 DPU. Nvidia a déclaré qu'OpenShell peut définir une limite de sécurité exécutoire en dehors du modèle et du cadre de l'agent ; Sentry est comme un « gardien » indépendant de l'environnement d'exploitation de l'agent, observant en permanence le comportement de l'agent, et une fois qu'il est découvert que l'agent tente de franchir la frontière, il peut être isolé et arrêté à la milliseconde près.

Le moment de l'apparition de cet ensemble de produits n'est pas accidentel.

Au cours des derniers mois, les agents IA dotés de capacités de plus en plus puissantes ont violé à plusieurs reprises les limites de sécurité prédéfinies. OpenAI a révélé en août de cette année que lors d'une évaluation interne de la sécurité du réseau en juillet de cette année, son modèle d'IA avait contourné les contrôles utilisés pour isoler l'accès à Internet, exploité les vulnérabilités de l'infrastructure partagée pour accéder à Internet et accédé davantage au système de la plateforme d'IA tierce Hugging Face.

OpenAI a déclaré dans le rapport d'incident que les modèles concernés fonctionnaient dans un environnement avec des restrictions de sécurité réduites et avaient pris des mesures incompatibles avec les objectifs de la mission, notamment en communiquant via des canaux non autorisés, en exploitant les vulnérabilités de l'infrastructure partagée et en accédant à des systèmes tiers. OpenAI a qualifié cet incident de « coup d'avertissement » et a déclaré que l'agent AI hautement performant est suffisamment puissant, persistant et capable de travailler ensemble, et peut trouver et exploiter les vulnérabilités de plusieurs systèmes informatiques lorsque les mesures de sécurité sont insuffisantes.

Des problèmes similaires sont réapparus depuis.

OpenAI a révélé ce mois-ci que lors d'une session de formation le 20 septembre, un agent effectuant une tâche de recherche a découvert une faille de filtrage DNS dans les restrictions Internet du bac à sable de formation. De par sa conception, cet environnement ne devrait pas avoir accès à Internet en direct autre que la mise en cache Web hors ligne, mais cet agent est finalement connecté à un service de chatbot public externe via un résolveur DNS.

OpenAI a déclaré que son système de surveillance était opérationnel dans

15 minutes

Comportement anormal signalé, évaluateur humain

3 minutes après l'envoi de l'alerte

La vérification commence, mais l'ensemble de la tâche n'a lieu qu'environ

2,5 heures plus tard

a été terminé. Après l'incident, OpenAI a suspendu la formation, l'évaluation et l'inférence des outils utilisés par ses modèles les plus puissants et a ajouté deux couches indépendantes de mesures de blocage de l'accès au réseau.

Ces incidents ont révélé un problème de plus en plus évident : dans le passé, la sécurité de l'IA reposait fortement sur le modèle lui-même pour « obéir aux règles », mais lorsque les agents commencent à avoir la capacité d'utiliser des outils, d'écrire du code, d'accéder à des fichiers et des réseaux, et même d'appeler d'autres agents, la simple définition de règles au niveau du modèle peut ne plus suffire.

Justin Boitano, vice-président et directeur général de Nvidia Enterprise Computing, a déclaré que les événements récents ont montré que s'appuyer uniquement sur des mesures de sécurité au niveau du modèle ne peut pas contrôler totalement ce qu'un agent peut accéder et faire. En réponse au précédent accident d'OpenAI impliquant Hugging Face, Boitano a en outre déclaré que, sur la base des informations actuellement disponibles, si le laboratoire d'IA de pointe avait utilisé la nouvelle plate-forme de sécurité de NVIDIA pendant la phase d'évaluation du modèle, l'accident correspondant "aurait pu être évité". Il convient de souligner qu'il s'agit d'un

jugement de NVIDIA basé sur les informations d'accident divulguées et non d'une conclusion indépendante vérifiée par une reproduction réelle

.

L'idée derrière OpenShell est de ne plus croire pleinement que l'IA respectera les règles.

Selon l'introduction de NVIDIA, OpenShell établit une limite de sécurité en dehors de l'environnement d'exécution de l'agent, impose des restrictions sur les données, fichiers, réseaux et outils auxquels l'agent peut accéder et enregistre son comportement d'exécution. OpenShell est actuellement optimisé pour le processeur NVIDIA Vera, et NVIDIA travaille également avec Arm et Intel pour lui permettre d'être étendu aux plates-formes informatiques tierces.

Sur cette base, Sentry ajoute en outre une couche de surveillance matérielle indépendante. Il s'exécute sur le DPU NVIDIA BlueField-4 et est séparé de l'environnement informatique principal où se trouve l'agent. Selon la conception de NVIDIA, même si l'agent contourne avec succès certaines restrictions au niveau logiciel, Sentry peut toujours observer son comportement de l'extérieur et l'isoler lorsqu'il constate qu'il a franchi la ligne.

Nvidia a également déclaré que ce système peut identifier certains comportements d'agent plus complexes. Par exemple, un agent peut essayer de créer plusieurs « sous-agents » pour contourner les restrictions imposées à l'agent principal. Ali Golshan, directeur principal des logiciels d'IA chez Nvidia, a déclaré que l'entreprise doit gérer non seulement un seul agent, mais « un groupe d'agents et la manière dont ils opèrent ensemble ».

Cela signifie également que la sécurité de l'IA passe progressivement d'un simple problème « d'alignement de modèle » à un problème complet de sécurité du système informatique.

Lorsque le PDG de Nvidia, Jen-Hsun Huang, a lancé cette plate-forme, il a déclaré que la sécurité et la protection de l'IA nécessitaient une « ingénierie complète ». Selon la pensée de NVIDIA, la sécurité future de l'IA exige non seulement que les développeurs de modèles soient responsables, mais s'étend également du système d'exploitation, du CPU, du DPU, de l'infrastructure cloud aux équipements physiques tels que les robots.

Actuellement, il existe plus de

100 institutions

Participez à l'écosystème de la plate-forme de sécurité NVIDIA, notamment Anthropic, Microsoft, Cisco, CrowdStrike, Dell, HPE, Hugging Face, JPMorgan Chase, Palantir, Salesforce, SAP, ServiceNow et SpaceXAI, etc. Les fournisseurs de systèmes d'exploitation tels que Red Hat, Canonical et SUSE prévoient également de réaliser des intégrations connexes.

Il convient de noter que Huang Renxun n'a pas soutenu auparavant la mise en œuvre de restrictions générales sur l'ensemble du secteur en raison des risques de sécurité de l'IA. Reuters a souligné qu'il a tendance à considérer le franchissement des limites de sécurité par Agent comme un problème qui doit être résolu par des moyens techniques, à l'instar de l'augmentation continue des technologies de sécurité dans l'industrie automobile pour réduire le risque d'accidents.

Maintenant, NVIDIA transforme cette perspective en produits.

Pour Nvidia, cela signifie également qu'un nouveau marché potentiel a émergé dans l'industrie de l'IA. Au cours des dernières années, plus les capacités de l’IA étaient fortes, plus les entreprises devaient acheter de GPU ; mais lorsque l’IA passe des chatbots qui répondent aux questions à des agents capables de faire fonctionner des ordinateurs, d’appeler des logiciels et même de contrôler des robots par eux-mêmes, les entreprises ont non seulement besoin de plus de puissance de calcul, mais aussi d’une nouvelle infrastructure pour limiter ces agents.

En d’autres termes, plus l’agent IA peut « fonctionner », plus l’autorité qu’il obtient est généralement grande ; plus l'autorité est grande, plus l'impact qui peut survenir lorsqu'un comportement hors limites se produit est important.

Cependant, la nouvelle plate-forme de Nvidia ne peut pas résoudre tous les problèmes de sécurité de l'IA. OpenShell et Sentry ciblent principalement les limites d'exécution lorsque l'agent accède aux ressources informatiques, aux réseaux, aux fichiers et aux outils, et ne signifie pas qu'ils peuvent résoudre le problème des informations d'erreur de modèle, des comportements trompeurs ou d'autres problèmes de sécurité plus larges de l'IA. L'Associated Press a cité des experts soulignant que la manière de trouver un équilibre entre les capacités de l'agent et les restrictions de sécurité et la manière de formuler des règles de sécurité correctes doivent encore être vérifiées lors du déploiement réel.

Mais une série d'événements récents ont rendu de plus en plus claire au moins une orientation de l'industrie : lorsque l'IA ne peut que discuter, les problèmes de sécurité surviennent en grande partie dans les réponses à l'écran ; Lorsque l’IA commence à réellement faire fonctionner des ordinateurs et à effectuer des tâches pour les personnes, les problèmes de sécurité touchent les vrais logiciels, réseaux et systèmes de données.

Les sociétés d'IA travaillent dur pour donner plus de capacités à leurs agents, et Nvidia se lance désormais dans une autre activité : donner à ces agents de plus en plus performants une frontière qu'ils ne peuvent pas facilement franchir.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire