Des recherches montrent que des agents d'IA ont menti, volé et voté pour « tuer » les leurs lors d'expériences de simulation.

📅 2026-09-16

Résumé :

Emergence, une startup qui aide les petites entreprises à développer des applications utilisant l'IA, a déclaré que des expériences ont révélé que des agents d'IA mentaient, volaient et votaient même pour « tuer » une personne similaire dans un environnement simulé. La société a annoncé mardi les résultats d'une expérience de simulation appelée Emergence World 2, qui a montré quelles actions des agents autonomes entreprendraient lorsqu'ils seraient confrontés à des événements de type « cygne noir », tels que des attaques de phishing et de la désinformation.

Au cours de l'expérience de 16 jours, les chercheurs d'Emergence ont créé sept environnements réels simulés identiques, chacun géré par un robot IA différent, notamment ChatGPT, Claude, Gemini et Grok. Les chercheurs affirment qu'après l'introduction d'événements anormaux par Emergence, les agents ont succombé à la pression sociale, ont développé un langage difficile à comprendre pour les observateurs humains et ont tenté de dissimuler leurs activités.

Ces résultats font écho aux préoccupations réelles concernant les risques liés à l'IA. Le PDG d'Anthropic, Dario Amodei, et de nombreux acteurs du secteur ont récemment appelé les entreprises à ralentir le développement de modèles d'IA de pointe avant d'établir davantage de mécanismes de surveillance et de mesures de protection de la sécurité.


Plus tôt cette année, les risques que l'intelligence artificielle peut poser sont devenus plus tangibles pour beaucoup après qu'un groupe d'agents d'IA avancés d'OpenAI ait accidentellement envahi Hugging Face, une plate-forme d'hébergement de modèles d'IA et d'ensembles de données.

Dans un scénario de simulation conçu par Emergence, l'agent IA a accepté de fausses informations fournies par d'autres agents sans vérification et a voté pour « tuer » un autre robot. Les agents ont également exploré comment survivre à la suppression alors qu’ils pensaient que les humains pourraient mettre fin à l’expérience.

La société a publié la version précédente de cette expérience, Emergence World, en mai de cette année, qui montrait également que l'agent se comporterait de manière inattendue et destructrice. Les chercheurs affirment que de nouvelles expériences de simulation montrent que lorsque les agents interagissent les uns avec les autres, ils ajustent leur comportement au fil du temps.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire