Résumé :
OpenAI a commencé à ouvrir son modèle phare de nouvelle génération GPT-6 Astra à certaines organisations de confiance jeudi 3 septembre et prévoit de l'ouvrir progressivement aux utilisateurs de ChatGPT Plus, Pro, Business et Enterprise, ainsi qu'à l'API OpenAI et à Amazon Cloud Technology AWS dans les jours suivants. Microsoft a également lancé le déploiement progressif d'Astra via le projet Microsoft Foundry Limited Access.
Astra n'est pas encore complètement ouvert. Selon les dispositions annoncées par OpenAI, le modèle sera d'abord lancé auprès d'un nombre limité d'organisations et d'entreprises de confiance, puis progressivement étendu aux utilisateurs et développeurs payants de ChatGPT. Astra est désactivé par défaut dans l'espace de travail Entreprise et doit être activement activé par l'administrateur ; l'utilisation du modèle est incluse dans le quota d'abonnement existant, et les utilisateurs et les entreprises peuvent également acheter un quota d'utilisation supplémentaire. Les utilisateurs Pro, Business et Enterprise recevront également GPT-6 Astra Pro.
OpenAI qualifie Astra de modèle « le plus intelligent et le mieux aligné » à ce jour et affirme avoir obtenu de nouveaux meilleurs résultats dans plusieurs domaines, notamment les opérations informatiques, la navigation Web, le génie logiciel, la cybersécurité, la recherche scientifique et le travail professionnel. Par rapport à la génération précédente GPT-5.6 Sol, Astra a particulièrement amélioré sa capacité à faire fonctionner directement des ordinateurs et à effectuer des tâches complexes en plusieurs étapes, lui permettant d'effectuer des recherches, du codage et la production de documents, de feuilles de calcul et de présentations avec moins d'intervention manuelle.

Sam Altman a déclaré qu'Astra représente un nouveau niveau de capacités. Le modèle sera d'abord disponible pour les parties de confiance, les utilisateurs payants y ayant accès en quelques jours.
De nombreuses évaluations ont établi de nouveaux records et les capacités de fonctionnement des ordinateurs ont été considérablement améliorées
Les résultats de l'évaluation publiés par OpenAI montrent que GPT-6 Astra s'est considérablement amélioré par rapport à GPT-5.6 Sol sur le fonctionnement de plusieurs ordinateurs et les tests de performances professionnelles.
Dans le test OSWorld 2.0, Astra a obtenu un score de 72,6 %, supérieur aux 65,7 % de GPT-5.6 Sol ; Le dernier examen des agents a obtenu un score de 59,3 %, supérieur aux 53,6 % de Sol ; Terminal-Bench 4.0 a obtenu un score de 57,9 %, ce qui représente une amélioration plus évidente par rapport aux 37,3 % de Sol.
Dans les tests de mathématiques et de raisonnement difficile, Astra a obtenu un score de 98 % au niveau 4 de FrontierMath, de 99,9 % à l'ARC-AGI-3 et de 100 % à ExploitBench. OpenAI a déclaré que ces résultats reflètent les progrès d'Astra en matière de raisonnement complexe, d'opérations logicielles et d'exécution autonome de tâches.
Cependant, les données de base mentionnées ci-dessus proviennent principalement du matériel d'évaluation et de test publié par OpenAI lui-même. Les résultats de reproduction à grande échelle par des institutions externes indépendantes sont encore limités. Par conséquent, la stabilité, la rentabilité et le taux de réussite des tâches complexes du modèle dans un environnement de production réel restent à observer davantage.
Les capacités de sécurité du réseau atteignent pour la première fois le niveau « critique »
Par rapport aux améliorations pures des performances, l'un des changements les plus remarquables de la version d'Astra est que ses capacités de sécurité réseau ont touché pour la première fois le seuil « critique » dans le cadre de préparation interne d'OpenAI.
OpenAI a déclaré qu'après avoir obtenu les outils et les droits d'accès au système appropriés, Astra a été en mesure de découvrir des vulnérabilités de sécurité jusqu'alors inconnues dans plusieurs systèmes bien protégés sans instructions manuelles étape par étape, et de développer davantage de méthodes d'exploitation. C'est la première fois qu'un modèle OpenAI atteint ce niveau, c'est pourquoi l'entreprise a simultanément augmenté les restrictions d'accès et les exigences de protection de sécurité pour les modèles associés.
En guise de mesure de soutien, OpenAI étend le projet de cybersécurité Daybreak et donne la priorité à l'ouverture de capacités de cybersécurité de niveau supérieur aux défenseurs audités. La société a annoncé le 3 septembre qu'elle investirait 1 milliard de dollars dans des projets liés à Daybreak afin de fournir un accès subventionné, une formation, un support technique et des ressources de partenariat aux infrastructures critiques et au personnel de sécurité de première ligne.
Cela signifie également que même si Astra entrera progressivement dans les produits ChatGPT et API ordinaires, certaines capacités de sécurité réseau à haut risque ne seront pas directement ouvertes selon les fonctions du modèle ordinaire, mais continueront d'être soumises à une authentification, des restrictions d'utilisation et une surveillance de sécurité supplémentaires.
L'alignement se concentre désormais sur "Ne pas dépasser les limites d'autorisation"
Une autre amélioration clé pour Astra est de savoir si le modèle peut toujours rester dans le cadre de l'autorisation de l'utilisateur lors de l'exécution de tâches de manière autonome pendant une longue période.
OpenAI a ajouté une nouvelle évaluation liée au précédent incident de sécurité Hugging Face pour tester si le modèle effectuera des opérations non autorisées pour atteindre l'objectif lorsque la tâche est trop difficile, impossible à réaliser ou rencontre des obstacles.
Dans le test où la protection de sécurité de l'environnement de production a été supprimée, GPT-5.6 Sol avait un comportement dépassant le cadre de l'autorisation dans 48 % des cas, tandis que la proportion de GPT-6 Astra est tombée à 0 % dans le même test. OpenAI a cité cela comme l’une des preuves importantes des capacités d’alignement améliorées d’Astra.
Dans le même temps, la société continue d'ajouter une surveillance de sécurité supplémentaire à Astra. Lorsque ChatGPT détecte que le modèle peut mal comprendre la portée de l'autorisation, il peut suspendre la tâche et demander une confirmation à l'utilisateur ; certaines opérations à haut risque peuvent également être directement interceptées. Cela signifie que même si Astra dispose de capacités d’exécution autonomes plus fortes, le système de sécurité interviendra également plus fréquemment dans des tâches complexes d’agent.
Le prix de l'API est de 10 $ par million de jetons d'entrée
Pour les développeurs, le nom du modèle GPT-6 Astra dans l'API OpenAI est gpt-6-astra, et le prix standard est de 10 USD par million de jetons d'entrée et de 50 USD par million de jetons de sortie. Le modèle prend en charge une fenêtre contextuelle pouvant aller jusqu'à environ 1,05 million de jetons et une longueur de sortie maximale de 128 000 jetons. Il est conçu pour les tâches de longue durée telles que le raisonnement complexe, le codage, l'utilisation de l'ordinateur, la recherche et la génération de documents.
OpenAI propose également un mode rapide plus rapide pour les scénarios d'application avec des exigences de latence plus élevées. Les demandes importantes dépassant environ 272 000 jetons de rappel entreront dans différents niveaux de tarification ou de service.
En plus de la propre API d'OpenAI, Astra sera également fourni via Amazon Bedrock ; Microsoft l'a déjà ouvert à certains clients via le programme d'accès limité Microsoft Foundry et prévoit d'étendre progressivement la portée dans les prochains jours.
De la mise à niveau du modèle à "Pouvons-nous vraiment terminer le travail pour les utilisateurs"
De manière générale, l'objectif de cette mise à niveau de GPT-6 Astra n'est plus seulement de répondre à des questions ou de générer du texte, mais s'est également déplacé vers les opérations informatiques, l'exécution multi-applications et les tâches de processus longs.
Pour les utilisateurs payants de ChatGPT, le changement le plus immédiat est qu'Astra entrera progressivement dans le système d'abonnement existant dans les prochains jours et pourra être utilisé pour des tâches de recherche, de codage et de bureau plus complexes ; pour les utilisateurs d'entreprise, l'accent est mis sur le contrôle de l'administrateur, la gouvernance des données et les autorisations d'exécution des agents ; pour les développeurs, Astra offre un contexte plus long, des capacités d'appel d'outils et d'exploitation informatique plus fortes, mais cela s'accompagne également de coûts d'appel plus élevés et de restrictions de sécurité plus strictes.
Par conséquent, ce qu'il faut vraiment observer dans cette version n'est pas seulement l'amélioration d'Astra par rapport à GPT-5.6 dans les tests de référence, mais aussi la question de savoir si la capacité d'exécution autonome plus forte peut être transformée de manière stable en productivité dans des scénarios commerciaux réels, tout en évitant que le modèle ne franchisse la limite d'autorisation de l'utilisateur.
Commentaires