Google dévoile Gemini 4 Argon et revendique de meilleures performances que GPT-6 Astra et Claude Opus 5.5

Google renforce son offensive dans l’intelligence artificielle avec Gemini 4 Argon, son nouveau modèle haut de gamme destiné aux tâches complexes et au raisonnement avancé. Sans communiquer encore de date de lancement grand public, le groupe américain affirme que son modèle arrive en tête de 12 des 18 benchmarks présentés.
Google passe directement à Gemini 4 Argon
L’annonce intervient dans un contexte de concurrence soutenue entre les principaux acteurs de l’IA générative. GPT-6 Astra d’OpenAI a été lancé le 3 septembre, tandis que Claude Opus 5.5 d’Anthropic est arrivé le 22 septembre.
Face à ces nouveaux modèles, Gemini 3.1 Pro apparaissait désormais comme une génération plus ancienne. Google a donc choisi de ne pas commercialiser Gemini 3.5 Pro, pourtant annoncé auparavant, et de passer directement à Gemini 4 Argon.
Ces dix derniers mois, l’entreprise avait surtout concentré ses efforts sur sa gamme Flash, composée de modèles plus légers et moins coûteux. Gemini 3.8 Flash, lancé le 2 septembre, était ainsi le troisième modèle Flash présenté en six semaines. Deux modèles consacrés à la synthèse vocale ont également suivi le 23 septembre.
Gemini 4 Argon face à GPT-6 Astra et Claude Opus 5.5
Selon les résultats publiés par Google, Gemini 4 Argon occupe la première place dans 12 des 18 tests présentés et arrive à égalité dans un autre. GPT-6 Astra prend la tête sur trois benchmarks, tandis que Claude Opus 5.5 domine les deux autres.
Des résultats contrastés selon les tests
Sur DeepSWE v1.1, qui mesure notamment la capacité d’un modèle à réaliser de longues tâches de développement logiciel, Argon atteint 77,9 %. Claude Opus 5.5 obtient 74,2 %, contre 74,1 % pour GPT-6 Astra.
Les performances ne sont toutefois pas uniformes. Sur FrontierSWE v2, un autre benchmark consacré à la programmation, GPT-6 Astra conserve une avance de 10,5 points sur Argon. Claude Opus 5.5 devance également le nouveau modèle de Google de neuf points sur Terminal-bench 4.0, qui évalue notamment l’utilisation d’outils en ligne de commande.
Ces résultats restent ceux communiqués par Google et devront être confrontés à des évaluations indépendantes lorsque Gemini 4 Argon sera plus largement accessible.
Un modèle conçu pour les tâches complexes de longue durée
Gemini 4 Argon est présenté comme un modèle nettement plus volumineux que ses prédécesseurs. Google l’a conçu pour le raisonnement approfondi et l’exécution de tâches nécessitant plusieurs étapes sur une période prolongée.
L’entreprise affirme déjà utiliser cette technologie en interne. Des agents basés sur Argon auraient notamment travaillé sur libgav1, le décodeur vidéo open source de Google. Selon le groupe, la version ainsi retravaillée fonctionne 2,7 fois plus rapidement que la précédente, tout en utilisant le même langage de programmation.
Sundar Pichai a présenté le modèle comme particulièrement performant dans les workflows complexes, la cybersécurité et l’ingénierie logicielle. Selon lui, différentes équipes de Google l’utilisent déjà dans des domaines allant de la programmation à l’informatique quantique.
Jusqu’à un million de tokens générés
Google cible principalement trois domaines avec Argon : les longues tâches de programmation, les activités professionnelles spécialisées, notamment dans le droit et la finance, et la cybersécurité.
L’une des principales évolutions concerne la longueur des réponses. Argon peut, selon Google, produire jusqu’à un million de tokens en une seule génération, contre 64 000 auparavant, soit une capacité environ quinze fois supérieure.
Cette fenêtre de sortie particulièrement importante pourrait permettre au modèle de traiter en une seule fois des projets logiciels volumineux ou de produire des documents professionnels très longs sans devoir interrompre puis reprendre la génération.
Un accès initial limité aux spécialistes de la cybersécurité
Gemini 4 Argon n’est pas encore disponible pour le grand public. Google réserve actuellement son accès à certains experts en cybersécurité sélectionnés dans le cadre du programme Fairwind.
Ces spécialistes disposent d’une version dont certains garde-fous habituellement appliqués aux requêtes liées au piratage sont désactivés afin de faciliter la recherche de vulnérabilités et leur correction.
Selon Google, l’entreprise de cybersécurité Wiz aurait ainsi utilisé Argon pour identifier une vulnérabilité critique dans un logiciel médical employé par des établissements hospitaliers à travers le monde et susceptible d’exposer des données personnelles.
Le modèle fait également l’objet d’évaluations dans le cadre d’une initiative volontaire du gouvernement américain permettant d’examiner certains systèmes d’intelligence artificielle avant leur commercialisation.
Quel prix pour Gemini 4 Argon ?
Après cette phase limitée, Google prévoit d’ouvrir l’accès aux clients payants de son API et aux abonnés Google AI Ultra.
Pour les développeurs, le tarif de lancement annoncé s’élève à 2 dollars par million de tokens transmis au modèle et à 10 dollars par million de tokens générés, soit environ 1,75 euro et 8,80 euros hors taxes.
À titre de comparaison, GPT-6 Astra est proposé à 10 dollars pour un million de tokens en entrée et 50 dollars en sortie.
Google précise cependant que ces prix sont promotionnels. À l’issue d’une période dont la durée n’a pas été communiquée, ils doivent doubler pour atteindre respectivement 4 et 20 dollars par million de tokens, soit environ 3,50 euros et 17,60 euros hors taxes. Ce niveau correspond au tarif annoncé pour Claude Opus 5.5.
Une sortie grand public encore sans date
Pour les particuliers, Google indique vouloir proposer Gemini 4 Argon « dès que possible », avec un accès initial prévu pour les abonnés Google AI Ultra. Aucune date précise n’a cependant été communiquée pour son arrivée dans l’application Gemini.
Avec Argon, Google entend donc renforcer sa position sur le segment des modèles d’IA les plus avancés, notamment pour le développement logiciel, les usages professionnels et la cybersécurité. Les benchmarks présentés sont prometteurs, mais l’évaluation réelle du modèle dépendra désormais de tests indépendants et de son déploiement auprès d’un public plus large.




