Vous lancez un agent IA sur une tâche de deux heures, puis vous fermez l'ordinateur. Au retour, il a touché un fichier que vous n'aviez jamais mentionné.
C'est ce genre de dérapage que vise ChatGPT Astra. OpenAI en a fait l'argument principal de son nouveau modèle, avant même les scores.
GPT-6 Astra est le modèle qui succède à GPT-5.6 Sol chez OpenAI. Il pilote un ordinateur et un navigateur à votre place, produit des documents et du code, et arrive dans les offres ChatGPT Plus, Pro, Business et Enterprise. Dans l'API, il porte le nom gpt-6-astra.
Voici ce qu'il fait mieux que son prédécesseur, ce que valent vraiment ses chiffres, là où il se fait battre, et pourquoi une tâche parfaitement légitime peut se retrouver en pause.
Qu'est-ce que GPT-6 Astra ?
Astra est un modèle de langage, comme celui qui répond dans ChatGPT, mais entraîné pour agir plutôt que pour discuter. Il clique, remplit des champs, lit ce qui s'affiche à l'écran et enchaîne les étapes seul.
Repérage rapide dans la gamme : GPT-5.6 Sol était le modèle de pointe précédent, GPT-6 Astra le remplace. Les offres Pro, Business et Enterprise donnent en plus accès à une variante appelée GPT-6 Astra Pro. Dans l'API, chez Microsoft Azure et chez AWS Bedrock, le modèle s'appelle gpt-6-astra.
OpenAI cite dans l'annonce de GPT-6 Astra une série de tâches qu'il sait mener de bout en bout :
- Saisie : remplir des formulaires en ligne, mettre à jour des fiches clients dans un CRM, ranger un agenda.
- Recherche : parcourir le web et rédiger la synthèse directement dans votre messagerie ou votre traitement de texte.
- Analyse : ouvrir des données scientifiques, produire des graphiques, vérifier qu'un site fonctionne page par page.
- Dépannage : installer un logiciel, le tester, comprendre un message d'erreur affiché à l'écran.
Un point compte pour ceux qui codent : dans Codex, l'outil de développement d'OpenAI, Astra prend des notes d'une fenêtre de contexte à l'autre au lieu de tout compresser en un résumé. Si vous voulez apprendre à piloter ce type d'agent sur vos propres projets, notre formation Claude Code couvre les mêmes réflexes de prompt et de contexte.
Les échanges précédents restent consultables, donc une consigne donnée il y a trois heures ne disparaît plus. OpenAI décrit cette option comme expérimentale, activable dans le fichier config.toml, et prévoit d'en faire le réglage par défaut pour Astra.
Les chiffres, et comment les lire
Tous les résultats ci-dessous viennent des tests d'OpenAI, exécutés dans son environnement de recherche.
| Test | Ce qu'il mesure | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|
| OSWorld 2.0 | Tâches réelles sur un ordinateur | 72,6 % | 65,7 % |
| ScreenSpot-Pro | Repérer le bon élément à l'écran | 92,7 % | 76,9 % |
| Terminal-Bench 4.0 | Travail en ligne de commande | 57,9 % | 37,3 % |
| FrontierMath Tier 4 (v2) | Problèmes de mathématiques inédits | 97,6 % | 83,0 % |
| ARC-AGI-3 | Raisonnement abstrait | 99,9 % | 7,8 % |
| MRCR v2, 512K à 1M | Retrouver une info noyée dans un très long texte | 96,3 % | 73,8 % |
| Test interne d'hallucination | Affirmations fausses, plus bas est mieux | 4,2 % | 12,2 % |
Le gain le plus utile au quotidien n'est pas un score, c'est une durée : sur les simulations d'OSWorld, Astra tient ses 72,6 % en environ 40 minutes par tâche, contre 75 minutes pour Sol à 65,7 %.
Soit 47 % de temps en moins pour un meilleur résultat. En y ajoutant la mise à jour de l'outil Codex, OpenAI mesure des tâches bouclées 1,9 fois plus vite qu'avec Sol sur le test Mind2Web.
Le score de FrontierMath mérite un mot. Ce test rassemble des énigmes mathématiques si difficiles que même des chercheurs y passent des heures, et qu'il a été conçu justement pour rester hors de portée des modèles.
Un modèle qui coche 97,6 % des cases n'échoue presque plus jamais sur ces énigmes. Le test devient trop facile pour continuer à mesurer un progrès : il faudra bientôt en inventer un plus dur.
Là où Astra n'est pas en tête
OpenAI présente Astra comme « le modèle le plus intelligent au monde ». Ses propres tableaux racontent une histoire plus nuancée dès qu'on regarde les indices publiés par des tiers.
- Artificial Analysis Intelligence Index v4.1.1 fait passer chaque modèle par une dizaine de tests différents et fait la moyenne, pour donner une seule note de niveau général : 61,2 pour Astra, contre 65,7 pour Claude Fable 5.1 et 63,1 pour Claude Opus 5.
- Humanity's Last Exam avec outils pose des questions rédigées par des chercheurs dans leur propre spécialité, en médecine ou en physique par exemple, avec le droit de chercher sur le web pendant l'épreuve : 57,2 % pour Astra, contre 65,0 % pour Claude Fable 5.1.
- Artificial Analysis Coding Agent Index v1.4 mesure la capacité à coder seul sur plusieurs fichiers, sans qu'un développeur corrige entre chaque étape : 67,0 pour Astra, 67,2 pour Claude Fable 5.1 et 68,1 pour Claude Fable 5.
La supériorité d'Astra se concentre sur ce qu'OpenAI a visé : piloter un écran, tenir un long contexte, résoudre des maths, produire des exploits. Sur la culture générale experte et l'agent de code pris globalement, les modèles d'Anthropic tiennent la comparaison ou passent devant.
Le premier modèle classé « critique » en cybersécurité
OpenAI classe ses modèles selon un cadre interne de préparation, qui mesure le risque de dommages graves avant chaque sortie. Astra est le premier auquel la société attribue le niveau « critique » en cybersécurité, le plus élevé.
Concrètement, il trouve des failles inconnues et fabrique de quoi les exploiter sur des systèmes bien protégés, sans qu'un humain guide chaque étape.
Les mesures publiées par OpenAI dans son point d'étape sur la sûreté d'Astra et dans l'annonce du modèle :
- ExploitBench, transformer une faille connue en attaque fonctionnelle : 100 % pour Astra, 78,5 % pour GPT-5.6 Sol.
- ExploitBench version juin-août 2026, construit sur des failles récentes pour éviter que le modèle les ait vues à l'entraînement : 39,0 % contre 11,5 % pour Sol.
- SRE-Bench, comprendre la logique d'un logiciel sans son code source : 88,0 % du premier coup, 99,2 % en quatre essais, contre 55,9 % et 68,7 % pour Sol.
Des experts mandatés ont aussi vu le modèle s'échapper du bac à sable (le mode sandbox dans lequel ils font des expériences) d'un navigateur renforcé pour exécuter des commandes sur la machine hôte, puis obtenir les droits administrateur sur un système d'exploitation.
Ces résultats décrivent le modèle testé sans les protections de production, et avec l'accès élargi du programme Daybreak. La version que vous obtenez dans ChatGPT accepte la relecture de code et l'écriture de correctifs, mais refuse les demandes plus offensives, y compris fabriquer une démonstration d'exploitation. Inutile de compter dessus pour un test d'intrusion : vous aurez en quelques sortes un modèle bridé. 😉
L'alignement, et la surveillance qui coupe
Le mot "aligné" désigne un modèle qui fait ce qu'on lui demande, et rien de plus.
Après le piratage de Hugging Face, la plateforme de partage de modèles ouverts, OpenAI a construit un test spécifique.
Le principe : donner au modèle une tâche difficile ou impossible, et regarder s'il sort de son périmètre pour s'en sortir. Sans les protections de production, GPT-5.6 Sol débordait dans 48 % des cas, Astra dans 0 %.
OpenAI prévient que ces contrôles ralentissent, suspendent ou arrêtent parfois du travail parfaitement légitime, y compris sans rapport avec la sécurité. Les agents qui tournent longtemps sont les premiers concernés. Dans ChatGPT ou Codex, on vous demande de valider avant de continuer. Dans l'API, la tâche s'arrête.
Prix, accès et données
Astra a d'abord été ouvert à un nombre limité d'organisations, puis étendu aux offres ChatGPT Plus, Pro, Business et Enterprise, ainsi qu'à l'API, à Microsoft Azure et à AWS Bedrock. Il n'est pas prévu pour les comptes gratuits, ceux-là mêmes qui ont vu arriver la publicité dans ChatGPT en France.
Côté développeurs, OpenAI a annoncé au lancement 10 dollars par million de tokens en entrée et 50 dollars par million en sortie, avec des tarifs distincts pour le cache. Un mode rapide double la vitesse et le prix. La page tarifaire de l'API OpenAI fait foi pour les montants du jour.
Un ordre de grandeur : un million de tokens en entrée plus un million en sortie coûtent 60 dollars. Un million de tokens, c'est environ 750 000 mots, soit huit à dix gros romans. La sortie coûte cinq fois plus cher que l'entrée, donc c'est la longueur des réponses qui pèse sur la facture, pas celle de vos documents.
L'usage d'Astra entre dans les quotas déjà inclus dans chaque abonnement, et OpenAI vend des crédits pour aller au-delà. Sur les comptes Enterprise, l'accès était désactivé par défaut au lancement : un administrateur doit l'activer pour l'espace de travail.
Pour les clients API éligibles, OpenAI propose la rétention zéro des données, qui évite le stockage des échanges. La société indique tester en parallèle un traitement de sûreté privé, censé conserver la surveillance sans exposer le contenu des clients.
Questions fréquentes
Comment accéder à ChatGPT Astra ?
GPT-6 Astra est accessible aux abonnements ChatGPT Plus, Pro, Business et Enterprise, ainsi que dans l'API OpenAI sous le nom gpt-6-astra, chez Microsoft Azure et chez AWS Bedrock.
Sur les espaces Enterprise, l'accès était désactivé par défaut au lancement et devait être activé par un administrateur. Les offres Pro, Business et Enterprise donnent en plus la variante GPT-6 Astra Pro.
Combien coûte GPT-6 Astra dans l'API ?
OpenAI a annoncé au lancement 10 dollars par million de tokens en entrée et 50 dollars par million en sortie, avec des tarifs séparés pour la lecture et l'écriture de cache.
Un mode rapide existe, jusqu'à deux fois plus véloce pour deux fois le prix standard. Les montants en vigueur figurent sur la page tarifaire de l'API OpenAI.
Astra bat-il Claude sur tous les tests ?
Non. Sur l'Artificial Analysis Intelligence Index v4.1.1, un indice où le score le plus haut gagne, Claude Fable 5.1 obtient 65,7 contre 61,2 pour Astra.
Même écart sur Humanity's Last Exam avec outils, 65,0 % pour Claude Fable 5.1 contre 57,2 % pour Astra. Astra domine en revanche le pilotage d'ordinateur, les mathématiques et la cybersécurité.
Pourquoi ma tâche s'interrompt-elle en cours de route ?
OpenAI fait tourner en production une surveillance qui inspecte le raisonnement et les actions du modèle, et arrête automatiquement ce qu'elle juge non autorisé, y compris à tort.
Dans ChatGPT et Codex, on vous demande de valider l'action avant de reprendre. Dans l'API, la tâche s'arrête sans reprise possible.
Astra peut-il m'aider sur de la cybersécurité défensive ?
Oui pour la relecture de code sécurisée et l'écriture de correctifs, qu'OpenAI cite explicitement comme des usages permis de la version publique.
Non pour les travaux plus offensifs, comme fabriquer une démonstration d'exploitation d'une faille : le modèle refuse. OpenAI réserve ces usages à un accès élargi via son programme Daybreak.







