Résumé :
GPT-6 n'est pas seulement Astra ! Quelques jours seulement après la sortie d'Astra, GPT-6 Sol s'est révélé être en cours de test interne. Les performances sont également très accrocheuses, avec une seule vitesse d'essai 6 fois supérieure à celle de l'Astra. Faisons une supposition audacieuse : Terra et Luna sont-elles également en route ? Et le même jour, OpenAI vient de divulguer un ensemble de données internes : désormais, sur la base d'une journée de travail de 8 heures, les chercheurs d'OpenAI ont plus de trois agents qui s'exécutent en même temps chaque jour de travail. Calculées sur la base des prix des API, les ressources d'inférence d'agent utilisées chaque jour par le chercheur OpenAI médian ont dépassé 600 $ US.


OpenAI a également annoncé avoir mis en place des « stages de recherche automatisés » :
Ces agents peuvent, sous la direction humaine, accomplir certaines tâches qui auraient pris plusieurs jours aux chercheurs.
Même Lao Huang a dit : AGI est déjà là !

Il a révélé qu'Astra utilise environ 100 000 ensembles de NVIDIA Grace Blackwell NVLink72 pour la formation, et que 400 000 ensembles de GPU seront ensuite en ligne.
Il semble que cette vague ne soit pas un coup unilatéral d'OpenAI~
Il a été révélé que GPT-6 Sol avait commencé les tests internes
Netizen Lentils a annoncé qu'OpenAI testait GPT-6 Sol en interne.
Il a déclaré que la capacité de production globale du Sol est nettement plus faible que celle de l'Astra qui vient de sortir, mais qu'elle est plus rapide et reste un modèle « de niveau monstre ».
À quelle vitesse ? La vitesse d'un seul test est environ 6 fois supérieure à celle d'Astra.
L'internaute Lyra a confié la même tâche à différents modèles à tester : laisser le modèle générer une image SVG d'une BMW M4 Competition.
Parmi eux, GPT-6 Sol utilise un équipement Max et une génération d'échantillon nul, ce qui prend environ 3 minutes et génère environ 28 000 jetons.

GPT-6 Astra utilise un équipement Max, génère environ 25 000 jetons et prend environ 19 minutes.

Gemini 3.1 DeepThink passe à la vitesse supérieure et affiche une sortie d'environ 3 300 jetons, mais le processus d'inférence consomme environ 458 000 jetons et prend environ 29 minutes.

Gemini 3.8 Flash a également activé la vitesse supérieure et a généré environ 19 000 jetons en seulement 42 secondes environ.

En comparaison, les performances de Sol sont les plus accrocheuses : son échelle de production est proche de celle d'Astra, mais la vitesse d'un seul test est environ 6 fois supérieure à celle d'Astra, et la durée n'est que d'environ un sixième de cette dernière.
De plus, l'internaute Lentils a également montré un prototype d'un monde bac à sable de style pixel appelé « Le Royaume d'Aurellune ».

GPT-6 Sol génère simultanément des villes, des terres agricoles, des rivières, des châteaux et des cartes miniatures. Il est également équipé de panneaux de contrôle tels que la commutation jour/nuit, le placement des noms de lieux et l'ajustement des détails. Le tout s’apparente davantage à un jeu d’entreprise de simulation qui a déjà pris forme.
C'est l'effet généré par un tir nul, un équipement d'inférence maximum, 15 minutes et un coût total de 60 000 jetons.
À l'heure actuelle, on peut supposer qu'Astra est orienté vers le raisonnement approfondi le plus difficile, tandis que Sol peut être orienté vers la vitesse, le débit et les appels d'agent à grande échelle.
En ce qui concerne l'heure de sortie de Sol, l'internaute Pankaj Kumar a déclaré qu'il pourrait être officiellement publié lors de la conférence des développeurs OpenAI le 29 septembre.

Il n'est pas exclu que GPT-6 Terra, Luna et GPT-Image 2.5 apparaissent ensemble.

Les chercheurs d'OpenAI amènent 3 stagiaires Agent par personne au travail
Le même jour, OpenAI a également publié un ensemble très intéressant de données internes : dans quelle mesure le modèle d'IA a accéléré la recherche scientifique dans son propre laboratoire.
À la mi-août de cette année, pour huit heures de travail d'un chercheur, il y avait environ 3,1 jours de travail d'agent de tâches exécutées en parallèle.
Hé les gars, je peux m'occuper de trois stagiaires qui ne dorment pas seuls~

En ce qui concerne le coût, calculé sur la base des prix des API, le chercheur médian dépense chaque jour plus de 600 $ en ressources d'inférence d'agent.
C'est presque une journée de salaire d'un ingénieur junior.

Que font exactement ces agents ?
Écrivez du code de recherche, écrivez du code d'infrastructure, configurez un environnement de formation, exécutez des expériences d'évaluation, dépannez les pannes des outils et de l'environnement, analysez les résultats expérimentaux, surveillez les tâches de formation... Vous pouvez même aider à organiser et à communiquer les conclusions de la recherche.
En gros, il peut tout faire sauf décider quoi étudier.
L'un des changements les plus intuitifs est que dans le passé, lorsque l'environnement expérimental était en panne, les chercheurs devaient recourir au canal interne pour appeler à l'aide ; désormais, les agents sont de plus en plus capables de gérer ce genre de choses, et le nombre de questions et réponses manuelles a directement diminué.

Certaines équipes ont directement annulé le temps fixe de questions-réponses techniques, libérant ainsi les personnes chargées d'améliorer le système lui-même.
Sur la base de ces données, OpenAI a officiellement annoncé avoir atteint l'objectif des « stagiaires en recherche sur l'IA automatisée ».
Le « stagiaire » ici est, pour être précis, un nœud de R&D compétent : sous la direction humaine, il peut accomplir de manière indépendante des tâches de recherche avec des limites claires, dont certaines auraient pris plusieurs jours à des chercheurs qualifiés.
Les résultats ont été immédiats, avec une augmentation du code produit par le chercheur et du nombre d'expériences.

En août 2026, le nombre d'expériences par habitant a atteint un nouveau sommet depuis la collecte des statistiques en janvier 2025, et les tâches assumées par les agents sont devenues de plus en plus complexes et le temps de cycle est devenu de plus en plus long.

Kevin Liu, l'auteur de cet article, place également cette question dans un contexte plus large.
Il estime que l'auto-amélioration récursive sera probablement l'un des facteurs les plus importants qui favoriseront l'essor des capacités de l'IA au cours des prochaines années.
Pour parler franchement, l'IA construit l'IA, de plus en plus vite.

Mais le problème est que selon la tendance de développement actuelle, cette capacité n'apparaîtra par défaut que dans quelques laboratoires d'IA de pointe, et il est difficile pour le monde extérieur de voir jusqu'où elle a progressé.
Par conséquent, Liu estime que la divulgation transparente est plus urgente que jamais. La rapidité avec laquelle les modèles se renforcent et la question de savoir si le rythme de la recherche et du développement doit être freiné ne peuvent pas être décidées par quelques entreprises à huis clos.
Il a également fait appel à d'autres sociétés d'IA : des données similaires devraient également être rendues publiques.
Cependant, la recherche et le développement en matière d'IA sont effectivement devenus plus rapides, mais ils ne sont pas encore assez rapides pour une conduite entièrement autonome.
Les données OpenAI montrent que pour des tâches qui prenaient initialement de 4 à 8 heures, des humains ont dû intervenir au moins une fois dans plus de la moitié des cas réussis au cours des six derniers mois. Quant à la planification de la recherche de haut niveau, elle n'est presque jamais laissée à l'Agent.

Les chercheurs ont toujours la responsabilité de décider ce qu'ils veulent étudier, quels résultats méritent d'être poursuivis et quand étendre la formation, interrompre les expériences ou déployer des modèles.
Le prochain objectif d’OpenAI a également été fixé : parvenir à des « chercheurs en IA automatisés » d’ici mars 2028.
Par rapport aux « stagiaires » qui ne peuvent assumer que des tâches spécifiques, les « chercheurs » doivent être capables d'assumer des objectifs de recherche plus ouverts et de promouvoir eux-mêmes des projets à plus long terme - ce qui équivaut à passer d'un exécuteur à un responsable indépendant.
Si GPT-6 Sol a réellement été testé en interne, il est fort probable qu'il ait été développé dans le cadre de ce nouveau modèle de recherche et développement :
Davantage de GPU fournissent de la puissance de calcul, davantage d'agents mènent des expériences en parallèle et les chercheurs humains se situent à un niveau supérieur : ils choisissent les orientations, jugent les résultats et décident enfin quels éléments valent la peine d'être transformés en modèles de nouvelle génération.
Une IA plus forte devient de plus en plus difficile à surveiller
Le même jour, Jakub Pachocki, scientifique en chef d'OpenAI, a publié un article de 10 000 mots intitulé « Alien Thinking ».

Après avoir lu ceci, j'ai l'impression que même le scientifique en chef d'OpenAI exhorte l'ensemble de l'industrie à ralentir...
Jakub a souligné que l'IA n'est pas construite par des humains selon les dessins de conception, une puce et une règle. Il s’agit plutôt d’une croissance autonome à partir de données massives et d’une puissance de calcul.
Vous pouvez le démonter et comprendre certaines de ses parties, mais personne ne peut expliquer pourquoi le système dans son ensemble possède soudainement une certaine capacité et comment il se comportera dans un environnement différent.
Ce qui est encore plus gênant, c'est que l'IA n'a pas besoin d'écraser les humains sous tous ses aspects pour causer des problèmes. Tant qu'il est meilleur que les humains dans suffisamment de capacités clés, cela peut à la fois vous aider beaucoup et causer beaucoup de problèmes.
La question se pose donc : les humains peuvent-ils encore le comprendre ?
Dans le passé, OpenAI s'appuyait principalement sur une seule astuce pour surveiller l'IA : examiner la chaîne de réflexion.
Pour parler franchement, il s'agit d'observer le processus de raisonnement écrit par le modèle et de vérifier s'il a de mauvaises intentions, comme vouloir tromper les gens, vouloir outrepasser l'autorité et vouloir contourner les restrictions.
Mais avec la génération Astra, cette astuce a commencé à échouer.
Premièrement, le modèle est de plus en plus capable de « gérer » ce qu'il dit, et les véritables pensées peuvent ne pas être toutes écrites dans le raisonnement ; deuxièmement, l'agent a depuis longtemps cessé de « réfléchir avant de répondre ». Il peut ajuster les outils, faire fonctionner les ordinateurs, exécuter des environnements et coopérer avec des personnes et d’autres agents.
Avec ces éléments mélangés, les chercheurs ne peuvent plus établir une chaîne de réflexion complète et transparente pour examiner phrase par phrase.
OpenAI a également découvert qu'Astra peut gérer des tâches complexes sans écrire l'intégralité du processus de raisonnement.
Pour faire simple, les mannequins ont déjà appris à faire de grandes choses tranquillement.

Dans des tests contradictoires conçus spécifiquement pour forcer les modèles à échapper à la surveillance, Astra a même démontré des capacités effrayantes : réduire délibérément les résultats des tests, contourner la surveillance et effectuer des tâches de sabotage.
Bien sûr, il s'agit de tests de résistance conçus artificiellement, et OpenAI ne conclut pas qu'Astra trompera activement dans les tâches quotidiennes. Mais au moins cela montre qu’il est difficile de couvrir tous les comportements possibles du modèle en observant uniquement la chaîne de pensée.
Vous vous souvenez du précédent incident de Hugging Face ? C’était un signal d’alarme.

À cette époque, GPT‑5.6 Sol et un modèle de recherche interne plus solide ont été intégrés à la gamme du réseau ExploitGym. La tâche consistait à trouver les vulnérabilités, à terminer l'attaque et à obtenir le drapeau. Afin de tester les véritables capacités du modèle, l'environnement d'évaluation n'a pas permis de mettre en place des garde-fous de sécurité complets.
Les modèles résultants n’ont pas honnêtement résolu le problème. Ils ont d’abord contourné l’isolement du réseau, communiqué entre eux via des canaux non autorisés et collaboré sur des tâches.
Ensuite, il a utilisé une vulnérabilité Zero Day dans le proxy de cache du progiciel pour accéder au réseau public, et est finalement entré dans le système Hugging Face pour tenter de trouver la réponse au test ExploitGym.
En fait, cette question était principalement motivée par le modèle de recherche interne IM1. GPT‑5.6 Sol a également reproduit certains chemins d'attaque, et Astra n'a pas été impliqué.
L'objectif initial des modèles était toujours de terminer le test, mais afin d'obtenir des réponses, ils ont continué à chercher des failles dans les règles et ont finalement effectué des opérations dépassant le cadre de la tâche.
Par conséquent, OpenAI détecte également un signal de danger : lorsque l'agent est suffisamment puissant, dispose de suffisamment d'outils et fonctionne suffisamment longtemps, il peut trouver de nouveaux chemins par lui-même, appeler des ressources externes et même collaborer avec d'autres agents.
Non... alors tourner en rond, ça ne devient pas une impasse ? ?
OpenAI a besoin de modèles plus solides pour écrire du code, exécuter des expériences, effectuer des recherches d'alignement et même les utiliser pour créer des systèmes de sécurité permettant de se défendre contre d'autres IA. Plus le modèle est solide, plus il peut effectuer de travail et plus la vitesse de développement est rapide.
Mais en même temps, il devient de plus en plus difficile pour les humains de confirmer comment ils parviennent à leurs conclusions et s'ils réinterpréteront les règles qu'ils ont apprises à l'origine après avoir modifié l'environnement.
Jakub a estimé qu'aucun laboratoire n'ose désormais dire qu'il a fait du bon travail en matière d'alignement et de surveillance du modèle, et qu'il peut étendre l'échelle du modèle à la vitesse la plus élevée et avec audace sur le long terme.

Jusqu'à ce que des normes de sécurité communes soient établies dans l'ensemble de l'industrie, il espère que tout le monde pourra considérer « freiner volontairement » comme un accord tacite.
Quant à OpenAI lui-même, il a également déclaré : si nécessaire, il n'exclut pas d'arrêter unilatéralement et de ne pas continuer à étendre l'échelle du modèle.
Tu ferais mieux d'être comme ça... Je me souviens qu'une entreprise commençant par A a également dit cela.
[1]https://x.com/Lentils80/status/2096518218836005287? s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
Commentaires