Gemini 4 Argon est le meilleur modèle de Google. Vous ne pouvez pas encore l'utiliser.
Google a annoncé Gemini 4 Argon, son nouveau modèle de pointe, et seuls les cyberdéfenseurs de confiance peuvent l'utiliser.
Google a annoncé Gemini 4 Argon, son nouveau modèle de pointe, et seuls les cyberdéfenseurs de confiance peuvent l'utiliser. Voici ce que montre le propre tableau de référence de 19 lignes de Google, ce que le classement indépendant a mesuré et quand les développeurs pourraient l'obtenir. Verdict : NEEDS REVIEW.
Lire l'édition écrite (anglais) ↗
Ce que cette vidéo couvre
- Gemini 4 Argon : un million de jetons de sortie, 2 $ en entrée, et vous ne pouvez pas l'utiliser
- Chez Google : les agents Argon portent le C++ vers Rust
- Le propre tableau de Google : Argon est en tête de 13 des 19 lignes
- Le discours cyber : se corrige seul, pas de garde-fous pour les défenseurs
- Le chiffre extérieur : Artificial Analysis dit 53, Opus 5.5 a 58
Transcription traduite
Traduit de la narration originale en anglais. L'audio et les sous-titres disponibles sont contrôlés par YouTube.
Gemini 4 Argon : un million de jetons de sortie, 2 $ en entrée, et vous ne pouvez pas l'utiliser
0:00 On pourrait penser qu'un lancement signifie que l'on obtient le modèle. Google vient de lancer Gemini four Argon, et à moins d'être un cyber défenseur de confiance, vous ne pouvez pas y toucher. Dans cette vidéo : que montre le tableau de Google ? Qu'ont mesuré les testeurs externes ? Et quand l'obtiendrez-vous ? Vous avez probablement déjà vu les vidéos de battage médiatique. J'ai lu le tableau de référence à la place, et deux lignes n'ont jamais été incluses dans le
0:20 texte de la publication. Je les aborderai à la fin. C'est le jeudi 1er octobre, et c'est The Daily Diff. Deux histoires aujourd'hui, et la grande est Gemini four Argon, que Google appelle sa prochaine ère d'intelligence de pointe. Une réponse peut maintenant atteindre un million de jetons, contre soixante-quatre mille, ce qui représente plusieurs romans en une seule réponse. Le prix de lancement est de deux dollars par million de jetons en entrée et dix en sortie. C'est exactement ce qu'OpenAI facture pour GPT six point one Sol,
0:48 le modèle que j'ai couvert hier, et Sol est un modèle que vous pouvez réellement acheter. Chez Google, il est déjà au travail.
Chez Google : les agents Argon portent le C++ vers Rust
0:54 Google affirme que les agents Argon portent C et C++ vers Rust à travers l' entreprise, jusqu'à huit cent mille lignes pour le noyau Fuchsia. Sur Hacker News, un ingénieur s'est souvenu que l'équipe C++ de Google ne voulait même pas considérer Rust et avait plutôt examiné Carbon. Maintenant, un modèle réalise la migration dont ils ont débattu.
Le propre tableau de Google : Argon est en tête de 13 des 19 lignes
1:12 Maintenant, le tableau. Google place Argon à côté de GPT six Astra, Claude Fable et Claude Opus sur dix-neuf lignes, et Argon arrive en tête dans treize d'entre elles. Le titre est DeepSWE, un long benchmark de codage, à soixante-dix-huit pour cent, environ quatre points d'avance. La victoire la plus étrange est la rédaction juridique, où Argon obtient vingt pour cent et les autres restent en dessous de dix pour cent. C'est la meilleure note à un test que tout le monde rate, et sur les benchmarks du diaporama,
1:38 qui sont invaincus, ça compte.
Le discours cyber : se corrige seul, pas de garde-fous pour les défenseurs
1:41 Le véritable argument est la sécurité. Google affirme qu'Argon peut trouver, valider et corriger les vulnérabilités critiques par ses propres moyens, et que les défenseurs de confiance l'obtiennent sans garde-fous cybernétiques. Wiz l'a utilisé pour trouver une faille critique dans un logiciel hospitalier que les modèles précédents avaient manquée. Un petit détail. Wiz appartient à Google, depuis la clôture d'un accord de trente-deux milliards de dollars en mars. Donc, le test de piratage en boîte noire dans la publication est une entreprise Google qui évalue un modèle Google. Et sur le classement de correction de bugs, trois modèles partagent soixante-huit
2:10 pour cent, et la barre la plus à gauche appartient à Grok. Alors, qu'ont mesuré les testeurs externes ?
Le chiffre extérieur : Artificial Analysis dit 53, Opus 5.5 a 58
2:15 Le classement indépendant que j'ai pu trouver avec Argon est Artificial Analysis. Il attribue à Argon un score de cinquante-trois sur son indice d'intelligence, au réglage élevé, ce qui le lie à Astra et Fable. Claude Opus cinq point cinq est cinq points devant. Il y a une semaine, je vous ai dit qu'Opus occupait la première place là-bas, et il la détient toujours. La partie juste pour Google est la facture. Une exécution d'Argon coûte environ deux dollars par tâche sur cet index, environ un tiers de ce que coûte Opus.
Quand l'obtiendrez-vous : « Alors, tenez bon »
2:42 Et quand l'obtiendrez-vous ? Google ne donnera pas de date. La publication promet un accès aux développeurs, aux entreprises et aux consommateurs dès que possible, avec les clients API payants en premier. La publication de Sundar Pichai sur X dit, alors tenez bon. Jusque-là, l'accès se fait via Fairwind, le programme que Google a lancé il y a un mois avec Gemini trois point huit Flash Cyber. Il compte plus de six cent cinquante partenaires, et ils ne peuvent remettre Argon qu'à leurs
3:05 équipes de sécurité et doivent suivre qui l'utilise. Hacker News l'a bien pris. Un commentateur a écrit : « Gemini ne bat pas les allégations de ne pas pouvoir publier un modèle. » Un autre a prédit que les modèles se transformeraient en vaporware, un tas de chiffres sur un tableau. Pendant ce temps, Netlify a reconstruit Edge Functions, qui s'exécutent environ un milliard
Netlify Edge Functions : des isolats V8 aux micro-VM, environ 5 fois plus rapide
3:23 de fois par jour. Ils sont passés des isolats V8 dans un service hébergé aux micro-VM Firecracker au sein du propre réseau de Netlify, et un appel à chaud est passé de quarante millisecondes à environ six. Hacker News a souligné que Cloudflare Workers sont également des isolats V8 et fonctionnent beaucoup plus rapidement, donc la majeure partie du gain semble être que la requête ne quitte plus le bâtiment. Un autre commentateur s'est inquiété des instantanés, car les micro-VM clonées peuvent partager l'état du nombre aléatoire, ce qui donne deux UUID identiques.
3:50 Un démarrage à froid, lorsqu'une région n'a jamais vu votre fonction, atteint environ un pour cent des appels et prend environ neuf millisecondes. Et la micro-VM elle-même est Firecracker, qu'Amazon a construit pour Lambda, donc un commentateur suggère de s'en souvenir la prochaine fois que vous maudirez AWS.
Les deux lignes que la publication de Google ne mentionne jamais
4:06 Maintenant, ces deux lignes. Sur FrontierSWE et Terminal-bench, deux tests de codage que le texte de la publication ne mentionne jamais, Argon arrive dernier sur quatre, sur le propre tableau de Google. Terminal-bench place un agent dans un vrai shell, ce qui est la façon dont la plupart d'entre nous l'utiliseraient, et Opus le devance de neuf points. Si vous préférez lire ceci plutôt que de m'entendre le dire, le diff atterrit dans votre boîte de réception tous les matins, gratuitement sur the daily diff dot dev, lien ci-dessous.
Verdict : NEEDS REVIEW, le jour où je pourrai l'appeler
4:29 Donc, le verdict d'aujourd'hui sur Gemini four Argon. NEEDS REVIEW. Je le marquerais ainsi parce que le chiffre indépendant que j'ai trouvé le classe à égalité pour la deuxième place, et les deux lignes de codage qui m'intéressent le placent en dernier, donc je le réviserai correctement le jour où je pourrai l'appeler. Abonnez-vous, cliquez sur la cloche, et dites-moi dans les commentaires si vous l'auriez marqué différemment. Et c'est le diff pour aujourd'hui. Je suis Niko d'Axrisi. Fusionnez de manière responsable.
Sources
- Googleblog.google
- Hacker Newsnews.ycombinator.com
- Fairwind Programdeepmind.google
- Artificial Analysisartificialanalysis.ai
- Sundar Pichaix.com
- Demis Hassabisx.com
- Google completes acquisition of Wizcloud.google.com
- Netlifywww.netlify.com
- Hacker Newsnews.ycombinator.com



