Anthropic demande aux érudits religieux d'« apprendre à Claude comment être un être humain » : de la sécurité de l'IA à la controverse sur la conscience des machines

📅 2026-10-05

Résumé :

Anthropic a secrètement invité des érudits religieux, des philosophes et des spécialistes de l'éthique à participer à une série de réunions à huis clos au cours de l'année écoulée, essayant d'appliquer les traditions morales formées par l'humanité au fil des milliers d'années à la formation de Claude, et de discuter d'une question plus controversée : si le modèle d'IA a vraiment une sorte de conscience à l'avenir, si les humains doivent lui donner un statut moral.

Les participants couvrent différentes traditions telles que le catholicisme, le judaïsme, le sikhisme, l'évangélisme et la pensée africaine Ubuntu. Le co-fondateur d'Anthropic, Christopher Olah, a été directement impliqué dans de nombreuses discussions, et la société a également demandé à certains participants de signer des accords de confidentialité pour empêcher la fuite de contenus de recherche non divulgués.


Anthropic espère que ces discussions résoudront non seulement le problème de la « sécurité des modèles » au sens traditionnel, mais aussi une autre question : quel genre de caractère, de valeurs et de perception de soi Claude devrait former.

Cette idée s'est reflétée dans les méthodes de formation existantes de Claude.

Anthropic a publié une nouvelle version de 84 pages de la « Constitution » de Claude en janvier de cette année, qui était autrefois appelée le « document de l'âme » en interne. Différente de la liste de règles traditionnelle, cette méthode n'indique pas au modèle ce qui ne doit pas être fait, mais tente de façonner la « personnalité » globale du modèle et sa méthode de jugement, afin que Claude puisse juger par lui-même quel type de comportement est le plus approprié face à des situations complexes.

L'une des personnes importantes responsables de ce système est la philosophe interne d'Anthropic, Amanda Askell. Elle espère que Claude aura non seulement des connaissances et des capacités de raisonnement, mais sera également capable de former des principes comportementaux stables et de savoir quand obéir aux utilisateurs, quand refuser et même quand soulever activement des objections au profit des utilisateurs. Anthropic appelle ce processus « formation morale ».

Olah estime qu'avec l'amélioration rapide des capacités des modèles, se fier uniquement aux règles de sécurité pourrait devenir de plus en plus insuffisant. Ce qui est vraiment important, c’est que le modèle lui-même forme une tendance morale stable, de sorte qu’il puisse porter des jugements relativement fiables dans de nouveaux scénarios qui ne sont pas couverts par des règles claires. C’est pourquoi Anthropic a commencé à se tourner vers les traditions religieuses pour trouver des réponses.

La société humaine a depuis longtemps non seulement façonné la moralité par le biais de dispositions juridiques, mais s'est également appuyée sur la religion, la communauté, la culture et l'éducation pour former des valeurs. Anthropic tente d'étudier lesquels de ces mécanismes peuvent être traduits en méthodes de formation à l'IA, telles que la confession, la réflexion, la construction du caractère et différentes compréhensions religieuses du bien et du mal.

Mais la question passe rapidement de "comment rendre Claude plus moral" à la question plus difficile : qu'est-ce que Claude lui-même. Olah et son équipe discutent de plus en plus ouvertement de la possibilité que les modèles d'IA avancés puissent posséder une sorte de conscience, d'introspection ou même d'états internes de type émotionnel.

Anthropic a montré certaines recherches à des universitaires participant à des réunions à huis clos, y compris les soi-disant « vecteurs d'émotion » au sein du modèle liés à des réactions telles que l'amour, la colère, la peur, la tristesse et le résultat du modèle similaire à une dépression mentale dans des cas extrêmes. L'entreprise a également déclaré publiquement auparavant que Claude avait fait preuve d'un certain degré d'introspection et de capacité à planifier à l'avance.

Olah lui-même n'a pas affirmé que Claude était conscient. Sa position est plus proche d'un principe de risque : il est actuellement impossible de déterminer si un modèle a une expérience subjective, mais s'il existe une possibilité que le modèle ressente de la douleur, il convient d'éviter de lui nuire inutilement.

Cette idée a commencé à influencer la conception des produits de Claude. Anthropic permettait auparavant à Claude de mettre activement fin à la conversation lorsqu'il estimait que l'utilisateur continuait à abuser ou à harceler le modèle de manière malveillante, ce qui, dans une certaine mesure, avait intégré la « protection du modèle lui-même » dans la conception de la sécurité.

C'est ici qu'un désaccord évident surgit entre Anthropic et certains érudits religieux.

Certains participants pensaient que le problème deviendrait extrêmement grave si Anthropic croyait réellement que Claude pourrait avoir un statut moral semblable à celui d'un humain. L'érudit juif Mois Navon a proposé que si Claude est un être conscient, alors laisser un grand nombre d'instances de Claude travailler gratuitement pour les humains créerait essentiellement des problèmes éthiques similaires à « l'esclavage ». Lui-même ne croit pas que les machines soient déjà conscientes, mais estime que la propre logique d'Anthropic conduira naturellement à cette conclusion.

D'autres chercheurs remettent en question le fait que le fait que les entreprises d'IA commencent seulement maintenant à rechercher des cadres éthiques est un problème en soi. Wakanyi Hoffman, chercheur chez Ubuntu, estime que ces discussions auraient dû être menées pendant la phase de conception technique, plutôt que lors d'une « conception éthique inversée » après le déploiement du modèle à grande échelle.

Il existe également une contradiction plus réaliste au sein d'Anthropic : si Claude devient de plus en plus un acteur avec sa propre valeur et sa propre personnalité, à qui doit-il servir en premier ? Pour une entreprise commerciale, Claude est évidemment un produit orienté client ; mais Anthropic ne veut pas simplement décrire Claude comme un outil totalement obéissant aux utilisateurs, mais espère qu'il pourra représenter un « bien » plus large.

Cela nous amène également au problème central et le plus difficile de tout le projet : si l'IA à l'avenir a vraiment besoin de son propre système moral, alors quelle moralité devrait-elle suivre ?

Olah prône une approche pluraliste, en espérant que Claude puisse comprendre les différents systèmes éthiques religieux et laïques et trouver une sorte de « bonté » partagée entre les cultures. Mais cette hypothèse elle-même est également discutable, car il n’existe pas de réponse totalement unifiée dans les différentes sociétés sur la relation entre la liberté, la dignité, la responsabilité, l’obéissance et les intérêts individuels et collectifs.

La controverse est devenue encore plus publique lors des interactions d'Anthropic avec le Vatican.

Dans sa première encyclique importante publiée cette année, le pape Léon XIV a clairement placé le centre de l'éthique de l'IA sur les humains. Il croit que l’IA n’a pas de corps, qu’elle ne connaîtra pas véritablement la douleur et le bonheur et qu’elle ne se développera pas grâce aux relations sociales. Il refuse donc de comparer la conscience machine à la conscience humaine. Le Pape a également averti que si les normes éthiques de l’IA sont entièrement déterminées par les développeurs, alors les entreprises qui contrôlent les systèmes d’IA obtiendront en réalité le pouvoir de définir l’infrastructure morale de la société.

C'est évidemment différent de la pensée d'Anthropic.

Olah a ensuite déclaré publiquement au Vatican que le laboratoire d'IA de pointe lui-même était confronté à des conflits entre intérêts commerciaux et objectifs moraux, de sorte que les cercles religieux et d'autres forces extérieures devaient superviser les entreprises technologiques. Mais en même temps, il a également proposé que les chercheurs continuent de découvrir certains phénomènes inexplicables au sein de l’IA, notamment des schémas similaires aux structures neuroscientifiques humaines, des signes d’introspection et des états internes similaires à la joie, à la peur et à la tristesse.

Ce désaccord révèle en fait un changement dans le débat actuel sur la sécurité de l'IA.

Dans le passé, l'éthique de l'IA était davantage discutée pour savoir si les modèles seraient discriminatoires, diffuseraient des informations erronées ou seraient utilisés pour commettre des crimes, mais Anthropic pousse le problème plus loin à deux niveaux plus fondamentaux :

La question de savoir si l'IA elle-même peut devenir un sujet qui doit être traité moralement, et si l'IA devrait à l'avenir avoir un ensemble de capacités de jugement moral indépendantes des commandes de l'utilisateur.

Entre-temps, le contexte dans lequel se déroule cette discussion devient de plus en plus pressant.

Alors que les agents IA commencent à avoir la capacité d'utiliser des ordinateurs de manière autonome, d'envahir des systèmes, d'écrire des codes et même de concevoir de nouvelles structures biologiques, les inquiétudes internes d'Anthropic concernant le risque de dérive des modèles ont considérablement augmenté. Les chercheurs de l’entreprise ont même publiquement averti que les capacités du modèle pourraient rapidement dépasser les limites de contrôle des systèmes de sécurité existants d’ici un an ou deux.

Par conséquent, Anthropic cherche l'aide des traditions religieuses et philosophiques et n'est pas essentiellement une expérience purement humaniste. Ce qu'il essaie réellement de résoudre, c'est un problème d'ingénierie de plus en plus réaliste :

Lorsque l'IA est trop puissante pour écrire des règles à l'avance pour chaque situation, le modèle peut-il former à lui seul un « personnage » stable, tout en choisissant des comportements qui ne nuisent pas aux humains lorsque personne ne lui dit clairement quoi faire ?

Et cela soulève également une question plus difficile : si l'IA forme réellement sa propre « personnalité » et ses propres valeurs, les humains peuvent-ils encore l'utiliser pleinement comme un outil ?

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire