Le nouveau modèle d'OpenAI tombe dans une controverse incontrôlable, répond le scientifique en chef

📅 2026-09-03

Résumé :

Le 2 septembre, Jakub Pachocki, scientifique en chef d'OpenAI, a publié un message sur les plateformes sociales en réponse à la récente controverse entourant le nouveau modèle Astra « non contrôlable ». La controverse remonte à la veille, lorsque la nouvelle a été annoncée selon laquelle le prochain modèle Astra d’OpenAI utilise une technologie d’inférence appelée Recurrent Depth.

Dans ce mode, le même ensemble de couches Transformer est calculé à plusieurs reprises, et une partie du processus de raisonnement se produit à l'intérieur du modèle, et n'a pas besoin d'être présentée sous la forme d'une chaîne de réflexion, c'est pourquoi on l'appelle également « boucle opaque ».


Pachocki a exprimé l'espoir d'éviter une course aux armements vers un état incontrôlable provoquée par des informations inexactes - c'est-à-dire que les grands laboratoires rivalisent pour développer des modèles trop puissants pour être surveillés et examinés par des humains, conduisant à un échec complet du contrôle de sécurité.

Il a souligné que la profondeur des graphiques informatiques des modèles de pointe, y compris Astra, n'est pas plus de deux fois supérieure à celle de GPT-4, ce qui indique que l'architecture du modèle n'a pas connu un saut de complexité comme le craignait le monde extérieur.

La profondeur du graphique de calcul fait ici référence à la plus longue chaîne d'étapes de calcul qui doivent être exécutées séquentiellement pour terminer une tâche d'inférence et ne peuvent pas être accélérées en parallèle. Dans le passé, les calculs intra-couches sous l'architecture Transformer ordinaire pouvaient être massivement parallèles et la profondeur de sérialisation était approximativement égale au nombre de couches du modèle.

La profondeur du cycle des rumeurs de marché peut itérer le même ensemble de modules pour plusieurs cycles de réflexion, augmentant ainsi la profondeur du raisonnement interne avant de produire le jeton suivant (élément de mot), au lieu de s'appuyer uniquement sur des chaînes de réflexion textuelles visibles plus longues, ce qui peut améliorer les mathématiques, le codage et d'autres performances et réduire les coûts.

Le risque de sécurité implicite de cette architecture est que lorsque la profondeur du graphe de calcul est extrêmement élevée, le modèle peut implicitement effectuer un grand nombre d'étapes de raisonnement en interne sans cracher la chaîne complète de réflexion dans le résultat. Les humains ne seront pas capables de voir le processus de réflexion, de planification et de recherche de failles, puis d’entrer dans un état incontrôlable. L’audit de sécurité et la surveillance de la chaîne de réflexion échoueront tous.


Après la divulgation de la nouvelle pertinente, la communauté de la sécurité de l'IA a vivement réagi. Buck Shlegeris, PDG de Redwood Research, une organisation à but non lucratif dédiée à la sécurité de l'IA, a écrit qu'il était « extrêmement préoccupé ». Sur la base de l'incident précédent du modèle OpenAI attaquant la communauté Hugging Face, il a déclaré qu'il n'était pas sûr que la capacité de surveillance de la chaîne de pensée d'Astra soit bien pire que celle du modèle précédent, mais si cette technologie est davantage promue et que le nombre de cycles est considérablement augmenté, la capacité de surveillance de la chaîne de pensée sera complètement détruite. Ceci est particulièrement préoccupant, car si les enquêteurs ne peuvent pas voir la chaîne de pensée, il sera plus difficile d'enquêter sur les incidents de sécurité associés, ce qui est vraiment effrayant.

Ryan Greenblatt, scientifique en chef chez Redwood Research qui a participé à l'enquête sur l'incident de sécurité de Hugging Face, a également déclaré qu'il s'agissait peut-être du revers le plus grave en matière de sécurité de l'IA jusqu'à présent. Zvi Mowshowitz, un écrivain préoccupé depuis longtemps par la sécurité de l'IA, a critiqué cette technologie comme « jouer avec le feu » et a même déclaré que des lois étaient nécessaires pour empêcher la concurrence entre les laboratoires d'IA pour abaisser les normes.

Pachoki a admis dans sa réponse que la surveillance de la chaîne de pensée est effectivement fragile et se développe dans une direction plus difficile, mais elle n'est pas causée par des changements architecturaux. OpenAI s'est engagé à maintenir et à utiliser la surveillance de la chaîne de pensée depuis ses premiers modèles d'inférence, et estime que cette technologie peut aider à observer comment les capacités d'alignement des modèles se généralisent à partir de la distribution de la formation. Renforcer la surveillance des chaînes de pensée reste l’objectif central des projets de recherche actuels.

OpenAI a déclaré qu'elle déploierait une surveillance supplémentaire de la chaîne de pensée pour Astra afin de détecter et de freiner rapidement les fautes potentielles. Selon l'actualité du marché, l'utilisation par Astra de la technologie de profondeur de boucle est limitée et la chaîne de réflexion du modèle devrait toujours rester lisible. Des plateformes telles qu'Anthropic et Google DeepMind du secteur discutent déjà de technologies similaires.

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire