+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon é o melhor modelo da Google. Ainda não o pode usar.

A Google anunciou o Gemini 4 Argon, o seu novo modelo de ponta, e apenas defensores cibernéticos de confiança o podem usar.

A Google anunciou o Gemini 4 Argon, o seu novo modelo de ponta, e apenas defensores cibernéticos de confiança o podem usar. Eis o que a própria tabela de referência de 19 linhas da Google mostra, o que a classificação independente mediu e quando os programadores o poderão ter. Veredito: NEEDS REVIEW.

Ler a edição escrita (Inglês) ↗

O que este vídeo aborda

  • Gemini 4 Argon: um milhão de tokens de saída, 2 $ de entrada, e não o pode usar
  • Dentro da Google: agentes Argon portam C++ para Rust
  • Tabela da própria Google: Argon lidera em 13 das 19 linhas
  • O discurso cibernético: corrige por conta própria, sem guardrails para defensores
  • O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58

Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

Gemini 4 Argon: um milhão de tokens de saída, 2 $ de entrada, e não o pode usar

0:00 Poderíamos pensar que um lançamento significa que obtém o modelo. A Google acabou de lançar o Gemini 4 Argon, e a menos que seja um ciber defensor de confiança, não lhe pode tocar. Neste vídeo: o que mostra a tabela da Google? O que mediram os testadores externos? E quando o obtém? Provavelmente já viu os vídeos de "hype". Li a tabela de referência, e duas linhas nela nunca chegaram ao

0:20 texto da publicação. Chegarei a elas no final. É quinta-feira, primeiro de outubro, e este é o The Daily Diff. Duas histórias hoje, e a grande é o Gemini 4 Argon, que a Google chama a sua próxima era de inteligência de ponta. Uma resposta pode agora ter um milhão de tokens, acima dos sessenta e quatro mil, o que são vários romances numa única resposta. O preço de lançamento é de dois dólares por milhão de tokens de entrada e dez de saída. É exatamente o que a OpenAI cobra pelo GPT 6.1 Sol,

0:48 o modelo que cobri ontem, e o Sol é um que pode realmente comprar. Dentro da Google, já está a trabalhar.

Dentro da Google: agentes Argon portam C++ para Rust

0:54 A Google diz que os agentes Argon estão a portar C e C++ para Rust em toda a empresa, até oitocentas mil linhas para o kernel do Fuchsia. No Hacker News, um engenheiro lembrou-se de quando a equipa de C++ da Google nem sequer consideraria o Rust e olhou para o Carbon em vez disso. Agora um modelo está a fazer a migração sobre a qual eles discutiram.

Tabela da própria Google: Argon lidera em 13 das 19 linhas

1:12 Agora a tabela. A Google coloca o Argon ao lado do GPT 6 Astra, Claude Fable e Claude Opus em dezanove linhas, e o Argon sai por cima em treze delas. A manchete é DeepSWE, uma referência de codificação longa, com setenta e oito por cento, cerca de quatro pontos à frente. A vitória mais estranha é a redação legal, onde o Argon pontua vinte por cento e os outros permanecem em um dígito. É a melhor nota num teste em que todos falham, e nas referências de "slide-deck"

1:38 que são imbatíveis, isso conta.

O discurso cibernético: corrige por conta própria, sem guardrails para defensores

1:41 A verdadeira proposta é a segurança. A Google diz que o Argon pode encontrar, validar e corrigir vulnerabilidades críticas por conta própria, e que os defensores de confiança o obtêm sem guardrails cibernéticos. A Wiz usou-o para encontrar uma falha crítica num software hospitalar que modelos anteriores tinham perdido. Um pequeno detalhe. A Wiz pertence à Google, desde que um negócio de trinta e dois mil milhões de dólares foi fechado em março. Portanto, o teste de hacking de caixa preta na publicação é uma empresa da Google a classificar um modelo da Google. E na classificação de correção de bugs, três modelos partilham sessenta e oito

2:10 por cento, e a barra na extrema esquerda pertence ao Grok. Então, o que mediram os testadores externos?

O número externo: Artificial Analysis diz 53, Opus 5.5 tem 58

2:15 A classificação independente que consegui encontrar com o Argon é a Artificial Analysis. Ela pontua o Argon cinquenta e três no seu índice de inteligência, na configuração alta, o que o empata com o Astra e o Fable. Claude Opus 5.5 está cinco pontos à frente. Há uma semana disse-lhe que o Opus tinha o primeiro lugar lá, e ainda o mantém. A parte justa para a Google é a fatura. Uma execução do Argon custa cerca de dois dólares por tarefa nesse índice, aproximadamente um terço do que o Opus custa.

Quando o obtém: "Então aguarde"

2:42 E quando o obtém? A Google não dará uma data. A publicação promete acesso para programadores, empresas e consumidores o mais rápido possível, com clientes de API pagas primeiro. A publicação de Sundar Pichai no X diz, então aguarde. Até então, o acesso é feito através do Fairwind, o programa que a Google começou há um mês com o Gemini 3.8 Flash Cyber. Tem mais de seiscentos e cinquenta parceiros, e eles só podem entregar o Argon às suas

3:05 equipas de segurança e devem rastrear quem o usa. O Hacker News aceitou bem. Um comentador escreveu, Gemini não está a vencer as alegações de que não pode lançar um modelo. Outro previu que os modelos se transformam em vaporware, um monte de números numa tabela. Entretanto, a Netlify reconstruiu as Edge Functions, que são executadas cerca de mil milhões

Netlify Edge Functions: Isolados V8 para microVMs, cerca de 5x mais rápido

3:23 de vezes por dia. Eles passaram de isolados V8 num serviço alojado para microVMs Firecracker dentro da rede da própria Netlify, e uma chamada "quente" caiu de até quarenta milissegundos para cerca de seis. O Hacker News salientou que os Cloudflare Workers também são isolados V8 e são executados muito mais rápido, então a maior parte da vitória parece que o pedido já não está a sair do edifício. Outro comentador preocupou-se com os "snapshots", porque microVMs clonadas podem partilhar o estado do número aleatório, que é como se obtêm dois UUIDs idênticos.

3:50 Um arranque a frio, quando uma região nunca viu a sua função, atinge cerca de um por cento das chamadas e leva cerca de nove milissegundos. E a própria microVM é Firecracker, que a Amazon construiu para a Lambda, então um comentador sugere que se lembre disso da próxima vez que amaldiçoar a AWS.

As duas linhas que a publicação da Google nunca menciona

4:06 Agora, essas duas linhas. Em FrontierSWE e Terminal-bench, dois testes de codificação que o texto da publicação nunca menciona, o Argon fica em último lugar entre quatro, na própria tabela da Google. O Terminal-bench coloca um agente numa "shell" real, que é como a maioria de nós o usaria, e o Opus lidera por nove pontos. Se preferir ler isto em vez de me ouvir dizer, o "diff" chega à sua caixa de entrada todas as manhãs, gratuitamente em the daily diff dot dev, link abaixo.

Veredito: NEEDS REVIEW, no dia em que o puder ligar

4:29 Então, o veredito de hoje sobre o Gemini 4 Argon. NEEDS REVIEW. Eu o classificaria assim porque o número independente que encontrei o tem empatado em segundo, e as duas linhas de codificação que me importam o têm em último, então o revisarei adequadamente no dia em que o puder ligar. Subscreva, toque na campainha, e diga-me nos comentários se o teria classificado diferentemente. E esse é o "diff" de hoje. Eu sou o Niko da Axrisi. Junte-se responsavelmente.

Fontes

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Vídeos relacionados