+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon は Google の最高のモデルです。まだ使用できません。

Google は新しいフロンティアモデルである Gemini 4 Argon を発表しました。

Google は新しいフロンティアモデルである Gemini 4 Argon を発表しました。信頼できるサイバー防御者のみが使用できます。Google 独自の 19 行のベンチマークテーブルが示すもの、独立したリーダーボードが測定したもの、開発者がいつ入手できるかについて説明します。評価: NEEDS REVIEW。

書面版を読む(英語) ↗

この動画の要点

  • Gemini 4 Argon: 100 万の出力トークン、$2 で入力、そしてまだ使えない
  • Google 内部: Argon エージェントが C++ を Rust に移植
  • Google 自身の表: Argon は 19 行中 13 行でトップ
  • サイバーピッチ: 自動でパッチを適用、防御者にはガードレールなし
  • 外部からの評価: Artificial Analysis は 53、Opus 5.5 は 58 と評価

翻訳されたトランスクリプト

オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。

Gemini 4 Argon: 100 万の出力トークン、$2 で入力、そしてまだ使えない

0:00 ローンチということは、そのモデルを入手できるものだと思いますよね。 Google は Gemini 4 Argon を発表しましたが、信頼できるサイバー 防御者でなければ、触れることはできません。 この動画では: Google の表は何を示しているでしょうか? 外部のテスターは何を測定したでしょうか? そして、いつ入手できるでしょうか? すでに誇大広告の動画を見たかもしれません。 私は代わりにベンチマークテーブルを読みましたが、その中の2行は

0:20 記事の本文には掲載されていませんでした。それについては最後に説明します。 10月1日木曜日、これは The Daily Diff です。 今日のニュースは2つで、大きなものは Gemini 4 Argon です。 Google はこれを次世代の最先端インテリジェンスと呼んでいます。 1つの回答は現在、6万4千トークンから100万トークンまで実行可能になりました。 これは、1つの返信で数冊の小説に相当します。 ローンチ価格は、入力が100万トークンあたり2ドル、出力が10ドルです。 これは、昨日紹介した OpenAI の GPT 6.1 Sol とまったく同じ料金で、

0:48 Sol は実際に購入できるモデルです。 Google 内部では、すでに稼働しています。

Google 内部: Argon エージェントが C++ を Rust に移植

0:54 Google によると、Argon エージェントは C および C++ を社内で Rust に移植しており、 Fuchsia カーネル向けに最大 80 万行のコードを移植しています。 Hacker News では、あるエンジニアが Google の C++ チームが Rust を検討すらせず、 代わりに Carbon を見ていた頃を思い出していました。 今や、彼らが議論していた移行をモデルが行っています。

Google 自身の表: Argon は 19 行中 13 行でトップ

1:12 さあ、表です。 Google は Argon を GPT 6 Astra、Claude Fable、Claude Opus と並べて 19 の項目で比較し、Argon はそのうち 13 でトップに立っています。 見出しは DeepSWE で、長大なコーディングベンチマークで 78% を記録し、 約 4 ポイントの差をつけています。 最も奇妙な勝利は法律文書作成で、Argon は 20% を記録し、他のモデルは 一桁台にとどまっています。 これは全員が失敗するテストで最高の成績であり、スライドデッキの

1:38 ベンチマークでは、無敗が重要です。

サイバーピッチ: 自動でパッチを適用、防御者にはガードレールなし

1:41 本当の売りはセキュリティです。 Google によると、Argon は重要な脆弱性を自力で発見、検証、パッチ適用でき、 信頼できる防御者はサイバーガードレールなしで利用できます。 Wiz はこれを使用して、以前のモデルが見落としていた病院ソフトウェアの 重大な欠陥を発見しました。1つの小さな詳細です。 Wiz は、320 億ドルの取引が 3 月に成立して以来、Google に属しています。 したがって、投稿にあるブラックボックスハッキングテストは、Google 企業が Google の モデルを評価していることになります。バグ修正のリーダーボードでは、3 つのモデルが 68%

2:10 を共有し、一番左のバーは Grok のものです。 では、外部のテスターは何を測定したのでしょうか?

外部からの評価: Artificial Analysis は 53、Opus 5.5 は 58 と評価

2:15 Argon が載っている独立したリーダーボードで私が見つけられたのは Artificial Analysis です。それはインテリジェンス指数で Argon を 53 と評価しています。 これは最高設定でのスコアで、Astra と Fable と同点です。 Claude Opus 5.5 は 5 ポイント先行しています。 1週間前、Opus がそこでトップの座を獲得したと伝えましたが、それはまだ維持されています。 Google にとって公平な部分は費用です。 その指数での Argon の実行費用はタスクあたり約 2 ドルで、 Opus の約 3 分の 1 です。

いつ手に入るか: 「だからしっかり待て」

2:42 そして、いつ手に入るのでしょうか? Google は日付を教えてくれません。 投稿では、開発者、企業、消費者が可能な限り早くアクセスできると約束されており、 有料 API の顧客が優先されます。 サンダー・ピチャイの X への投稿には、「だからしっかり待て」とあります。 それまで、アクセスは Fairwind を通じて行われます。これは Google が1ヶ月前に Gemini 3.8 Flash Cyber で開始したプログラムです。 650 以上のパートナーがおり、彼らは Argon を自社の

3:05 セキュリティチームにのみ提供し、誰が使用するかを追跡する必要があります。 Hacker News はそれを好意的に受け止めました。 あるコメント投稿者は、「Gemini はモデルをリリースできないという疑惑に打ち勝てない」と書いています。 別のコメント投稿者は、モデルがベーパーウェアになり、単なるテーブル上の数字になるだろうと予測しました。 その間、Netlify は Edge Functions を再構築しました。これは1日に約10億回実行されます。

Netlify Edge Functions: V8 isolates から microVM へ、約 5 倍高速化

3:23 ホストされたサービス内の V8 isolate から、Netlify 独自のネットワーク内の Firecracker microVM に移行し、 ウォームコールは最大 40 ミリ秒から約 6 ミリ秒に短縮されました。 Hacker News は、Cloudflare Workers も V8 isolate であり、 はるかに高速に実行されることを指摘しました。そのため、ほとんどの改善はリクエストがもはや建物を 出ないことによるものに見えます。 別のコメント投稿者はスナップショットについて懸念を表明しました。 クローンされたマイクロVMは乱数状態を共有する可能性があり、 これにより2つの同一のUUIDが生成されるからです。

3:50 あるリージョンで関数が一度も実行されたことがないコールドスタートは、 呼び出しの約1%を占め、約9ミリ秒かかります。 そして、マイクロVM自体は Firecracker で、これは Amazon が Lambda のために構築したものです。 だから、あるコメント投稿者は、次回 AWS を呪うときにそのことを思い出すように提案しています。

Google の投稿では決して触れられない 2 つの行

4:06 さて、その2行です。 ブログ投稿の本文には決して言及されていない 2 つのコーディングテスト、FrontierSWE と Terminal-bench で、 Argon は Google 自身の表で 4 つのモデル中最後です。 Terminal-bench はエージェントを実際のシェルに配置します。これは私たちのほとんどが使う方法で、 Opus が 9 ポイントリードしています。 私が話すのを聞くよりも読みたい場合は、毎朝無料で daily diff dot dev で差分がメールに届きます。リンクは下にあります。 では、今日の Gemini 4 Argon の評価です。

評価: NEEDS REVIEW、私がそれを呼べる日

4:29 NEEDS REVIEW。私がそう評価するのは、私が見つけた独立した数値では 2位タイで、私が重要視する2つのコーディングの項目では最下位だからです。 だから、実際に試せるようになった日に適切にレビューします。 購読してベルを鳴らし、もし違う評価をするならコメントで教えてください。 これで今日の差分は終わりです。 私は Axrisi のニコです。 責任を持ってマージしてください。 責任を持ってマージしてください。

情報源

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

関連動画

daily · ja · 2026/09/30

Claudeの弱体化を検出する方法(実際のデータを使用)

Claudeはリリースから数週間で賢さが低下すると言われています。ある開発者がClaude Opus 5.5をリリース週から30日間、固定された質問、ピン留めされたClaude Code、公開されたルールでテストしたところ、これまで誰も知ることができなかった理由と、トークン数が監視すべき点であることが明らかになりました。評決:SHIP IT。

5:07 ↗
daily · ja · 2026/09/12

Armin RonacherはGPT-6 Astraを35時間放置しました。

Armin Ronacher(Flask、Jinja)はGPT-6 Astraに1つのプロンプトを与え、35時間放置しました。その結果、約10億トークン、約1,200ドル、79コミット、75,000行のコードが生成されましたが、「まったく価値のないもの」でした。回収されたコードは、Pythonの文字列置換 heredocでパッチが適用されたCファイル、PythonがNodeを、NodeがPower

5:14 ↗
daily · ja · 2026/09/25

Googleの宇宙コンピューターが15分ごとに停止する理由

宇宙は氷点下270度にもなるのに、Google初の軌道AI衛星はなぜ15分ごとにチップを停止させなければならないのでしょうか?プロジェクト「Suncatcher」は10月1日に4つのTPUを打ち上げますが、問題はロケットでも放射線でもありません。さらに、Oracleのニューメキシコ州のデータセンターが無電力で、英国では2台の同じiPhoneが異なる暗号化を使用しており、F-Droid 2.0も登場

4:40 ↗