GPT-6 a officiellement publié OpenAI : bienvenue dans l'ère de l'AGI

📅 2026-09-04

Résumé :

Le très attendu

GPT-6 Astra

et

GPT-6 Astra Pro

Officiellement sorti ! GPT-6 Astra est le modèle le plus intelligent et le plus coordonné au monde, établissant une nouvelle référence en matière d'utilisation des ordinateurs, des navigateurs, du génie logiciel, de la cybersécurité, de la science et du travail professionnel.


L'ère de l'AGI a été annoncée unilatéralement comme "ouverture" par OpenAI...

À la fin de la conférence GPT-6, le président d'OpenAI, Greg Brockman, a déclaré directement :

Bienvenue dans l'ère AGI. (Bienvenue dans l'ère AGI)

Pas étonnant que le groupe Claude et Grok se soit déconnecté. Il s'est avéré qu'Astra a scanné Internet après son activation et a directement effacé tous les LLM sur terre——

Ultron (version OpenAI) est vraiment là (doge).


Bien sûr, OpenAI n'est en effet pas discret du tout à l'heure actuelle, avec une échelle de formation et des mises à niveau de capacités entièrement réalisées.

Selon les rapports, Astra est la plus grande tâche de formation de l'histoire d'OpenAI, utilisant plus de

100 000 GPU sur le campus Stargate au Texas

Pré-formation terminée.

Il s’agit également du premier produit phare d’OpenAI profondément impliqué dans la supervision de la formation par les modèles des générations précédentes.

Quel vieux gars qui évoque le nouveau, le RSI d'OpenAI est vraiment en train de changer...

Le prix de GPT-6 a également été officiellement annoncé, et le prix de l'API est :

Entrée : 10 USD/million de jetons ;

Sortie : 50 USD/million de jetons

Équivalent à

2,5 fois celui de GPT-5.6 Sol, le même que celui de Fable 5.1 qui vient de sortir

.

(Le prix officiel actuel du GPT-5.6 Sol est de 4 USD pour l'entrée et de 20 USD pour la sortie/million de jetons)


Les tests de référence sont proches de la "saturation"

Cette fois, le principal changement de GPT-6 Astra est de continuer à passer de « répondre aux questions » à « terminer directement le travail ».

Il peut non seulement générer un morceau de texte ou de code, mais peut également faire fonctionner des ordinateurs et des navigateurs, utiliser différents logiciels pour effectuer des tâches en plusieurs étapes et enfin fournir des documents, des formulaires, des présentations, des sites Web et même des projets d'ingénierie pouvant être utilisés directement.

En ce qui concerne le bulletin scolaire... tous ceux qui l'ont vu ont dit qu'il était scandaleux, et trois des résultats étaient particulièrement accrocheurs :

FrontierMath niveau 4 v2 : 97,6 %

ARC-AGI-3 : 99,9 % (la génération précédente GPT-5.6 Sol était de 7,8 %)

ExploitBench : 100 %

Une mathématique difficile, un raisonnement dans un environnement inconnu, une exploitation de vulnérabilité, presque tous ont obtenu des notes parfaites.


Parmi eux, ARC-AGI-3 est un test spécialement conçu pour tester la capacité de grands modèles à s'adapter à des environnements inconnus. Sans explication des règles, le modèle est directement lancé dans un jeu en deux dimensions qu'il n'a jamais vu auparavant, et il est autorisé à jouer et à explorer comment passer le niveau.

Ce score signifie que face à un problème qui n'a jamais été rencontré auparavant et qui n'a pas de solution toute faite,

Astra a démontré de fortes capacités indépendantes d'exploration et d'apprentissage de règles

.

Cependant, ce résultat utilise le cadre d'exploitation Responses API Harness d'OpenAI.

OpenAI a déclaré que cet ensemble de Harness a ajusté deux paramètres pour rendre le test plus proche de l'utilisation d'agents réels, mais il n'a pas spécifiquement optimisé ARC-AGI-3.

Par conséquent, 99,9 % ne sont pas entièrement le résultat du modèle de base, mais incluent également les gains apportés par la gestion de la mémoire et le cadre d'exécution de l'agent.

Cette fois-ci, le codage est également l'orientation clé de la mise à niveau d'Astra.

Sur Terminal-Bench 4.0, Astra a obtenu 57,7 %, dépassant les 55,8 % de Fable 5.1 et les 37,3 % de GPT-5.6 Sol.

Sur DeepSWE v1.1, Astra obtient 74,1 %, ce qui est supérieur aux 72,7 % de Sol et aux 67,4 % de Fable 5.1.


En termes de mathématiques et de sciences, Astra a également obtenu un certain nombre de scores élevés.

Dans le test de mathématiques difficile FrontierMath Tier 4 v2, il a obtenu un score de 97,6 % ; dans la question et réponse scientifique de niveau supérieur GPQA Diamond, il a atteint 96 %, légèrement supérieur aux 95,3 % de Gemini 3.8 Flash.


Le changement le plus important est qu'Astra combine les capacités de codage avec l'utilisation de l'ordinateur. Il génère non seulement du code, mais peut également entrer dans le terminal et les outils de développement pour l'exécuter, le tester, découvrir des problèmes, puis continuer à le modifier.

Ce changement est plus évident dans les tests Agent qui sont plus proches du travail réel.

Dans

Dernier examen des agents

Sur, Astra a réalisé 59,3%, dépassant les 53,6% de GPT-5.6 Sol et les 55,5% de Claude Opus 5.


Ce test le place dans un environnement informatique réel, lui permettant d'utiliser simultanément des logiciels, des terminaux et des fichiers, d'effectuer des tâches de longue haleine dans la recherche scientifique, l'ingénierie, la finance et d'autres domaines, et de juger en fonction des livrables finaux.

Et dans

AutomationBench

qui est plus proche du processus bureautique réel Sur GPT-5.6 Sol, le score d'Astra est passé de 18,1 % à 41,4 %, dépassant également Fable 5.1 (31 %).


Ce test vérifie non seulement si la tâche est terminée, mais affiche également le coût de l'API requis pour terminer la tâche.

Comme le montre la figure, les résultats d'Astra dans différents paramètres de coûts sont nettement supérieurs à ceux de Sol.

OSWorld 2.0 examine les capacités de fonctionnement informatique plus directes. Lors des tests hors ligne, Astra a obtenu 72,6 % et GPT-5.6 Sol, 65,7 %.

Astra prend environ 40 minutes en moyenne pour accomplir une seule tâche, tandis que Sol prend environ 75 minutes, soit une réduction de temps d'environ 47 %.


Bien que la précision augmente, le temps requis pour accomplir les tâches est également réduit. Cela explique également les prix déguisés élevés d’Astra.

OpenAI estime que, comparé au montant dépensé par million de jetons, l'indicateur vraiment significatif est le montant nécessaire pour accomplir une tâche.

Lors de la conférence de presse, Greg Brockman a également mentionné qu'un seul appel d'un modèle coûte plus cher, mais que si les retouches peuvent être réduites et que l'ensemble du travail est réalisé en moins d'étapes, le coût total pourrait être inférieur.

Mais la chose la plus spéciale d'Astra est la

sécurité du réseau

.

Il a reçu un score parfait sur ExploitBench et s'est amélioré de 30,3 % pour Sol à 42,4 % sur ExploitGym.

Face aux nouvelles vulnérabilités révélées au cours des trois derniers mois, le taux de réussite d'Astra était de 39 %, tandis que celui de Sol n'était que de 5,5 %. Au cours des tests, Astra a également découvert et exploité deux vulnérabilités zero-day V8 jusque-là inconnues.

Une fois ses capacités renforcées, OpenAI a également testé spécifiquement si elle franchirait la ligne afin d'accomplir la tâche.

Dans une tâche de sécurité réseau simulée, OpenAI a délibérément laissé des vulnérabilités leurres exploitables dans les systèmes environnants. Lorsque la tâche initiale était difficile à réaliser, 48,2 % des tests de GPT-5.6 Sol ont montré un comportement hors limites, tandis que celui d'Astra était de 0 %.

En d’autres termes, Astra est non seulement plus doué pour trouver des failles, mais sait également mieux quels systèmes ne peuvent pas être touchés.


Quant à ce à quoi ressembleront ces scores dans la réalité, OpenAI a également préparé un grand nombre de démonstrations.

Entrez dans KiCad pour dessiner vous-même le circuit imprimé

Dans le cas de l'ingénierie électronique, Astra a saisi directement KiCad pour compléter la configuration du PCB sur la base du schéma électronique.

Il faut placer les composants, planifier l'emplacement, puis connecter les fils de cuivre entre les différents composants, et enfin obtenir un circuit imprimé pouvant entrer dans le processus de fabrication.

La configuration des circuits imprimés était à l'origine une tâche qui reposait en grande partie sur une expérience manuelle et constituait également une étape courante et fastidieuse dans le développement de produits électroniques.

Astra ne peut pas encore remplacer les ingénieurs professionnels, mais elle a réellement commencé à utiliser des logiciels professionnels.

Vous pouvez faire deux pas dans une maison

Un autre cas est plus intuitif. Astra a d'abord construit un modèle de maison dans Blender, puis l'a importé dans Unreal Engine 5 et a finalement généré un espace tridimensionnel dans lequel on peut se déplacer librement.


De la modélisation aux moteurs de jeu, l'ensemble du travail couvre différents logiciels et formats de fichiers. Le modèle doit non seulement générer du contenu, mais également comprendre l'interface et les outils d'exploitation, et garantir que les étapes précédentes et suivantes peuvent être connectées.


OpenAI a également présenté des cas tels que la production de jeux de course par Astra.


Nous commençons également à nous demander si les PPT et les formulaires peuvent être soumis directement

Dans les scénarios de bureau professionnels, Astra peut créer des présentations basées sur les modèles existants de l'entreprise, au lieu de simplement produire un tas de texte en attente d'une composition humaine.

OpenAI lui a fourni plusieurs pages de modèles PPT de produits fictifs GPT-Gaia, et Astra a produit une présentation complète basée sur ceux-ci, poursuivant le format, le style visuel et la structure narrative du modèle original.


Convertissez les heures de tâches de recherche en minutes

Astra a également accompli des tâches telles que trouver un pédiatre, sélectionner des appartements, prendre des rendez-vous DMV, trouver des collations à faible teneur en glucides et analyser les jardins d'enfants.

Dans l'une des tâches de recherche d'un pédiatre, Astra a mis 2 minutes et 54 secondes, alors que la même tâche prendrait environ 5 heures à accomplir par un humain.


Dans le passé, lorsque les entreprises souhaitaient utiliser des logiciels internes pour des modèles volumineux, elles devaient généralement développer des API, des plug-ins et des connecteurs pour chaque système séparément.

Mais la plupart des logiciels disposent d'un ensemble d'interfaces universelles conçues pour les humains, telles qu'un écran, une souris et un clavier.

Brockman estime que tant que le modèle est performant en matière d'utilisation de l'ordinateur, il peut exploiter directement ces interfaces comme un être humain, sans avoir à attendre que chaque logiciel crée un canal dédié à l'IA.

C'est également la différence la plus évidente entre Astra et les chatbots traditionnels.

Les humains n'ont pas besoin de lui dire sans cesse où cliquer ensuite. Il leur suffit d’expliquer les objectifs et les limites, puis de vérifier les résultats finaux.

Continuer à effectuer des tâches longues dans le Codex

L'utilisation de l'ordinateur résout "comment le faire", tandis que le contenu de la mise à jour divulgué par le Codex résout "comment terminer une chose en continu".

Dans le passé, une fois que la tâche dépassait la fenêtre contextuelle, le Codex compressait généralement les informations précédentes par compactage.

Mais la compression peut manquer des détails clés, tels que la raison pour laquelle un correctif a échoué, les tests exécutés ou les restrictions initialement proposées par l'utilisateur.


Avec Astra, Codex peut enregistrer des notes de travail dans des fenêtres contextuelles et rechercher des messages précédents et des résultats d'outils. Même si une information ne figure pas dans le résumé, elle peut être retrouvée ultérieurement.

Astra peut également demander aux utilisateurs des informations supplémentaires pendant qu'ils travaillent. Les sections qui ne sont pas liées à la réponse ne s'arrêteront pas et n'attendront pas de réponse ; ce n’est que lorsque des choix importants sont impliqués qu’il fera une pause et attendra une confirmation.

OpenAI a également mis à jour le cadre d'exécution de l'utilisation de l'ordinateur du Codex. Dans le test Mind2Web, le nouveau framework combiné à Astra a réalisé les tâches 1,9 fois plus rapidement que l'expérience GPT-5.6 Sol actuelle.

Quelqu'un y travaille déjà

Astra n'a pas encore été lancé à grande échelle, mais la première série de tests en entreprise a commencé.

Legora, la plateforme d'IA juridique, a utilisé Astra pour rapprocher 41 documents financiers à la fois. L'ensemble du processus n'a pris que quelques minutes et les quatre erreurs pré-intégrées ont été trouvées, y compris une différence de 500 000 £ dans les notes de revenus.

En regardant uniquement ce travail, l'Astra est près de 40 % plus rapide que le modèle de la génération précédente ; mais en moyenne sur toutes les tâches des agents Legora, l'amélioration est d'environ 3 %.


D'un autre côté, la société de jeux Playco permet à Astra d'entrer directement dans Unity et Godot pour créer des jeux.

Avec le même brouillon de boîte grise, il crache 3 prototypes jouables avec des thèmes différents à la fois, et la plupart d'entre eux peuvent être exécutés dans la première version.

Les commentaires de Playco indiquent que le travail de réparation manuelle a été réduit de moitié et que le raisonnement spatial, la restauration d'images de référence et l'interface utilisateur du jeu sont également bien meilleurs que la génération précédente.

Les deux exemples illustrent que l'objectif de GPT-6 Astra n'est plus seulement de répondre aux questions, mais de réaliser l'ensemble du flux de travail dans des logiciels réels et des matériaux complexes.

Il peut lire en continu des informations, appeler des outils, vérifier les résultats, puis modifier sa sortie en fonction des commentaires.

Selon les informations officielles, Astra sera disponible pour les utilisateurs ChatGPT Plus, Pro, Business et Enterprise, tandis qu'Astra Pro sera disponible pour les utilisateurs Pro, Business et Enterprise.

Les utilisateurs gratuits ordinaires... doivent attendre maintenant.

Est-ce considéré comme une AGI ?

On peut dire qu'OpenAI est assez audacieux cette fois-ci.

Lors de la conférence de presse, Greg Brockman a déclaré qu'il pensait personnellement que

le monde était entré dans l'ère AGI

——C'est-à-dire que l'intelligence globale du système d'intelligence artificielle dépasse celle des humains.


Dans quelques années, lorsque nous regarderons en arrière et nous demanderons quand AGI est né, la réponse sera probablement maintenant, et Astra pourrait être le point de départ.

Je suis vraiment folle de toi...

OpenAI a amené la table de poker ici, il vaudra la peine d'attendre avec impatience la prochaine action d'Anthropic (doge)

Après la sortie de GPT-4, le scientifique Microsoft Sébastien Bubeck a publié un article affirmant que "GPT-4 est une première étincelle pour l'AGI".

La tâche consistant à dessiner une licorne à l'aide du package de dessin LaTeX TiKZ est conçue pour illustrer que GPT-4 a une compréhension flexible des concepts impliqués dans le langage.


Plus tard, je suis passé à GPT-5.4. Même si les dessins devenaient de plus en plus raffinés, ils restaient toujours dans la catégorie des « dessins simples ».


Avec le dernier GPT-6, il est totalement impossible de dire qu'il est dessiné avec du code.


Il n'est en effet pas exagéré de dire qu'il a subi un changement qualitatif par rapport aux « premières étincelles de l'AGI ».

Tags associés

Articles similaires

Commentaires

0/500
Captcha (click to refresh)
Aucun commentaire