+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon es el mejor modelo de Google. Aún no puedes usarlo.

Google anunció Gemini 4 Argon, su nuevo modelo de vanguardia, y solo los ciberdefensores de confianza pueden usarlo.

Google anunció Gemini 4 Argon, su nuevo modelo de vanguardia, y solo los ciberdefensores de confianza pueden usarlo. Aquí te mostramos lo que indica la propia tabla de evaluación comparativa de Google de 19 filas, lo que midió la clasificación independiente y cuándo los desarrolladores podrían obtenerlo. Veredicto: NECESITA REVISIÓN.

Leer la edición escrita (inglés) ↗

Lo que cubre este video

  • Gemini 4 Argon: un millón de tokens de salida, $2 de entrada, y no puedes usarlo
  • Dentro de Google: agentes Argon portan C++ a Rust
  • La propia tabla de Google: Argon lidera 13 de 19 filas
  • La propuesta de ciberseguridad: parches por sí solo, sin medidas de seguridad para los defensores
  • El número externo: Artificial Analysis dice 53, Opus 5.5 tiene 58

Transcripción traducida

Traducido de la narración original en inglés. El audio y los subtítulos disponibles son controlados por YouTube.

Gemini 4 Argon: un millón de tokens de salida, $2 de entrada, y no puedes usarlo

0:00 Uno pensaría que un lanzamiento significa que obtienes el modelo. Google acaba de lanzar Gemini 4 Argon, y a menos que seas un ciberdefensor de confianza, no puedes tocarlo. En este video: ¿qué muestra la tabla de Google? ¿Qué midieron los evaluadores externos? Y, ¿cuándo lo obtendrás? Probablemente ya hayas visto los videos promocionales. Yo, en cambio, leí la tabla de evaluación comparativa, y dos filas de ella nunca

0:20 llegaron al texto de la publicación. Hablaré de ellas al final. Es jueves, primero de octubre, y este es The Daily Diff. Dos historias hoy, y la más importante es Gemini 4 Argon, que Google llama su próxima era de inteligencia de frontera. Una respuesta ahora puede llegar a un millón de tokens, frente a sesenta y cuatro mil, lo que equivale a varias novelas en una sola respuesta. El precio de lanzamiento es de dos dólares por millón de tokens de entrada y diez de salida. Eso es exactamente lo que OpenAI cobra por GPT 6.1 Sol,

0:48 el modelo que cubrí ayer, y Sol es uno que realmente puedes comprar. Dentro de Google, ya está funcionando.

Dentro de Google: agentes Argon portan C++ a Rust

0:54 Google dice que los agentes Argon están portando C y C++ a Rust en toda la compañía, hasta ochocientas mil líneas para el kernel de Fuchsia. En Hacker News, un ingeniero recordó cuando el equipo de C++ de Google ni siquiera consideraba Rust y en su lugar miraba Carbon. Ahora, un modelo está haciendo la migración sobre la que ellos discutieron.

La propia tabla de Google: Argon lidera 13 de 19 filas

1:12 Ahora la tabla. Google compara Argon con GPT 6 Astra, Claude Fable y Claude Opus en diecinueve filas, y Argon sale victorioso en trece de ellas. El titular es DeepSWE, un largo benchmark de codificación, con setenta y ocho por ciento, aproximadamente cuatro puntos de ventaja. La victoria más extraña es la redacción legal, donde Argon puntúa veinte por ciento y los demás se mantienen en un solo dígito. Es la mejor calificación en una prueba que todos fallan, y en las diapositivas de

1:38 benchmarks, que son invictas, eso cuenta.

La propuesta de ciberseguridad: parches por sí solo, sin medidas de seguridad para los defensores

1:41 La verdadera propuesta es la seguridad. Google dice que Argon puede encontrar, validar y parchear vulnerabilidades críticas por sí mismo, y que los defensores de confianza lo obtienen sin ciberseguridad. Wiz lo usó para encontrar un agujero crítico en el software de un hospital que modelos anteriores habían pasado por alto. Un pequeño detalle. Wiz pertenece a Google, ya que un acuerdo de treinta y dos mil millones de dólares se cerró en marzo. Así que la prueba de hacking de caja negra en la publicación es una empresa de Google calificando un modelo de Google. Y en la clasificación de corrección de errores, tres modelos comparten sesenta y ocho

2:10 por ciento, y la barra de la extrema izquierda pertenece a Grok. Entonces, ¿qué midieron los evaluadores externos?

El número externo: Artificial Analysis dice 53, Opus 5.5 tiene 58

2:15 La clasificación independiente que pude encontrar con Argon es Artificial Analysis. Califica a Argon con cincuenta y tres en su índice de inteligencia, en la configuración alta, lo que lo empata con Astra y Fable. Claude Opus 5.5 se sitúa cinco puntos por delante. Hace una semana te dije que Opus ocupaba el primer puesto allí, y todavía lo mantiene. La parte justa para Google es la factura. Una ejecución de Argon cuesta alrededor de dos dólares por tarea en ese índice, aproximadamente un tercio de lo que cuesta Opus.

¿Cuándo lo obtendrás?: "Así que espera un poco"

2:42 ¿Y cuándo lo obtendrás? Google no dará una fecha. La publicación promete acceso para desarrolladores, empresas y consumidores lo antes posible, con los clientes de API de pago primero. La publicación de Sundar Pichai en X dice: así que espera un poco. Hasta entonces, el acceso se realiza a través de Fairwind, el programa que Google inició hace un mes con Gemini 3.8 Flash Cyber. Tiene más de seiscientos cincuenta socios, y solo pueden entregar Argon a sus

3:05 equipos de seguridad y deben rastrear quién lo usa. Hacker News lo tomó bien. Un comentarista escribió: Gemini no vence las acusaciones de no poder lanzar un modelo. Otro predijo que los modelos se convertirán en vaporware, un montón de números en una tabla. Mientras tanto, Netlify reconstruyó Edge Functions, que se ejecutan aproximadamente mil millones

Netlify Edge Functions: de aislados V8 a microVM, aproximadamente 5 veces más rápido

3:23 de veces al día. Pasaron de aislados V8 en un servicio alojado a microVM de Firecracker dentro de la propia red de Netlify, y una llamada en caliente se redujo de hasta cuarenta milisegundos a aproximadamente seis. Hacker News señaló que Cloudflare Workers también son aislados V8 y se ejecutan mucho más rápido, por lo que la mayor parte de la ventaja parece ser que la solicitud ya no sale del edificio. Otro comentarista se preocupó por las instantáneas, porque los microVM clonados pueden compartir el estado de números aleatorios, que es como se obtienen dos UUID idénticos.

3:50 Un arranque en frío, cuando una región nunca ha visto tu función, afecta aproximadamente al uno por ciento de las llamadas y tarda alrededor de nueve milisegundos. Y el microVM en sí es Firecracker, que Amazon construyó para Lambda, así que un comentarista sugiere que lo recuerdes la próxima vez que maldigas a AWS.

Las dos filas que la publicación de Google nunca menciona

4:06 Ahora, esas dos filas. En FrontierSWE y Terminal-bench, dos pruebas de codificación que el texto de la publicación nunca menciona, Argon queda último de cuatro, en la propia tabla de Google. Terminal-bench coloca un agente en un shell real, que es como la mayoría de nosotros lo usaríamos, y Opus lo supera por nueve puntos. Si prefieres leer esto en lugar de escucharlo, el diff llega a tu bandeja de entrada todas las mañanas, gratis en thedailydiff.dev, enlace abajo.

Veredicto: NECESITA REVISIÓN, el día que pueda probarlo

4:29 Entonces, el veredicto de hoy sobre Gemini 4 Argon. NECESITA REVISIÓN. Lo sellaría así porque el número independiente que encontré lo tiene empatado en segundo lugar, y las dos filas de codificación que me importan lo tienen en último lugar, así que lo revisaré correctamente el día que pueda probarlo. Suscríbete, dale a la campana y dime en los comentarios si lo habrías sellado de manera diferente. Y ese es el diff de hoy. Soy Niko de Axrisi. Fusiona responsablemente.

Fuentes

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Videos relacionados