GPT-6 Astra : quand OpenAI annonce l’AGI, l’API présente la facture
Avec GPT-6 Astra, OpenAI ressort le grand mot : AGI. Le nouveau modèle affiche des résultats spectaculaires sur un benchmark indépendant, mais il reste très cher, personne ou presque ne peut s’en servir, et il n’est certainement pas la preuve que l’intelligence artificielle générale est arrivée.
OpenAI a présenté GPT-6 Astra, un modèle d'intelligence artificielle présenté comme un saut générationnel vers l'AGI (Artificial General Intelligence ou intelligence artificielle générale), capable de réaliser des tâches complexes de manière autonome. L'entreprise, dirigée par Greg Brockman, a multiplié les annonces pour promouvoir ce modèle, mais les critères définissant l'AGI restent flous. Astra est actuellement réservé à un groupe restreint d'organisations participant au programme Daybreak, un projet lié à la cybersécurité. OpenAI prévoit son déploiement généralisé dans les prochains jours pour les abonnés Plus, Pro, Business et Entreprise, ainsi que via son API et la plateforme AWS. L'AGI désigne une IA capable de comprendre, apprendre et appliquer ses connaissances à des situations variées, comme le ferait un humain.
L'utilisation de GPT-6 Astra via l'API est facturée à l'usage, avec un tarif de 10 dollars par million de tokens en entrée (les données fournies à l'IA) et 50 dollars par million en sortie (les réponses générées). Ces prix représentent une hausse de 150% par rapport au modèle précédent, GPT-5.6 Sol. Malgré cette augmentation, OpenAI affirme que Astra utilise nettement moins de tokens par tâche, ce qui pourrait réduire les coûts globaux, bien que cela reste à confirmer. Greg Brockman a souligné que le modèle marque un changement qualitatif, justifiant ainsi ces tarifs élevés. À titre de comparaison, un autre modèle concurrent, Fable 5.1, est facturé au même prix. Un token est une unité de base pour mesurer la quantité de texte traitée par l'IA.
OpenAI a publié des résultats de benchmarks internes montrant que GPT-6 Astra excelle dans des tâches variées, comme la résolution de problèmes ou la gestion d'agents autonomes. Cependant, ces tests, réalisés par OpenAI, sont critiquables car ils pourraient être biaisés en faveur du modèle. Par exemple, Astra atteint 62,7% de réussite avec un cadre de test standard et 99,9% avec un cadre adapté à ses spécificités. Les images associées illustrent ses performances, mais leur interprétation doit rester prudente. Un modèle est évalué en benchmarks (tests standardisés) pour mesurer ses capacités comparativement à d'autres IA ou à des humains.
L'organisation ARC Prize Foundation, fondée par François Chollet (créateur de la bibliothèque Keras), a testé Astra avec ARC-AGI-3, un benchmark indépendant conçu pour évaluer les capacités d'IA générales. Contrairement à OpenAI, ARC Prize ne considère pas Astra comme une AGI, même si ses résultats sont remarquables : 62,7% de réussite en mode standard et 99,9% avec un cadre adapté. Astra utilise moins d'actions que les humains dans 96% des niveaux terminés, avec en moyenne 51,7% d'actions en moins par niveau. Cependant, les humains résolvent 100% des environnements du benchmark, contre moins de 63% pour Astra. Ce test, bien que rigoureux, reste artificiel et ne reflète pas la complexité du monde réel.
Pour atteindre 62,7% de réussite sur ARC-AGI-3, Astra a coûté 26 098 dollars en inférence (calculs nécessaires pour générer les réponses). Avec le cadre adapté, le coût descend à 18 817 dollars, mais reste très élevé. À titre de comparaison, des participants humains étaient rémunérés 115 dollars pour 90 minutes de test, plus 5 dollars par niveau terminé, soit environ 12,78 dollars par essai. Ces chiffres soulignent l'écart entre les coûts de fonctionnement d'une IA et ceux d'une participation humaine. L'inférence désigne le processus par lequel l'IA génère une réponse après avoir reçu une requête.
OpenAI a intégré les leçons tirées d'une récente attaque contre **Hugging Face**, une plateforme de partage de modèles d'IA, pour renforcer la sécurité d'Astra. L'entreprise affirme que ses protections réduisent suffisamment les risques pour permettre le déploiement du modèle, conformément à son *cadre de préparation*. Cependant, Astra n'a pas été impliqué dans cette attaque. Malgré ses avancées, le modèle ne résout pas tous les niveaux d'ARC-AGI-3, contrairement aux humains. Les benchmarks comme ARC-AGI-3 sont conçus pour tester des compétences spécifiques dans des environnements contrôlés, ce qui limite leur représentativité des capacités réelles d'une IA dans des situations imprévisibles.

