Google acaba de lanzar un modelo de hacking. Aquí está a diferenza.
Google lanzou Gemini 3.8 Flash (0,75 $ de entrada / 3,75 $ de saída, o prezo duplícase o 1 de xaneiro) e Gemini 3.8 Flash Cyber —un modelo de caza de vulnerabilidades que só vende a 650 "defensores de confianza" verificados— e catro horas despois Meta lanzou Muse Spark 1.3 cun nivel de "colaborador" de 0,10 $ por millón no que o desconto é a transcrición da túa sesión.
Google lanzou Gemini 3.8 Flash (0,75 $ de entrada / 3,75 $ de saída, o prezo duplícase o 1 de xaneiro) e Gemini 3.8 Flash Cyber —un modelo de caza de vulnerabilidades que só vende a 650 "defensores de confianza" verificados— e catro horas despois Meta lanzou Muse Spark 1.3 cun nivel de "colaborador" de 0,10 $ por millón no que o desconto é a transcrición da túa sesión. Comprobamos ambos contra o único benchmark que ningunha das dúas compañías escribiu. Veredicto: SHIP IT.
Que abrangue este vídeo
- Google lanza Gemini 3.8 Flash + Flash Cyber (86,2% CyberGym, Fairwind Program)
- Meta lanza Muse Spark 1.3: 1,25 $/4,25 $, ou 0,10 $/0,20 $ se Meta pode adestrar con el
- Tres sitios crearon 215.128 páxinas falsas de "mellor software"; Perplexity cítalos
Transcrición traducida
Traducido da narración orixinal en inglés. O audio e os subtítulos dispoñibles son controlados por YouTube.
0:00 Google lanzou hoxe o seu terceiro modelo Flash en seis semanas, máis unha versión adestrada para hackear, e catro horas despois Meta lanzou un modelo que custa dez céntimos por millón de tokens se deixas que Zuckerberg lea o teu código, polo que a guerra de prezos da IA agora ten unha división de ciberseguridade. É mércores, e a diferenza é longa. Gemini 3.8 Flash alcanzou mil cen puntos en Hacker News, Muse Spark 1.3 obtivo case setecentos máis, e entre eles, unha tenda de investigación atopou tres sitios web que publicaron douscentos quince mil
0:28 páxinas falsas de mellor software puramente para que Perplexity as citase. Tamén hoxe: unha publicación que che pedía que te aferrases ao teu Firefox obtivo novecentos oitenta e oito puntos, e a páxina de axuda de Mistral sobre como optar por non participar no adestramento obtivo case cincocentos, principalmente de europeos que descubrían que a opción soberana adestra nas túas indicacións por defecto. Neste vídeo: o que realmente custa Gemini 3.8 Flash, o modelo de hacking que Google só venderá a seiscentos cincuenta socios, o nivel de dez céntimos de Meta e o que realmente cobra, e o único benchmark que ningunha das dúas compañías escribiu.
0:59 É mércores, 2 de setembro, e este é The Daily Diff. Gemini 3.8 Flash custa setenta e cinco céntimos por millón de tokens de entrada e tres setenta e cinco de saída, o mesmo que 3.7 Flash de hai tres semanas, cunha nota ao pé que di que o prezo se duplica o 1 de xaneiro, o que é unha proba gratuíta con pasos adicionais. Nos benchmarks da presentación, que son imbatibles, obtén un 54,9 por cento en HLE-Verified, X di que supera a Sol e Opus 5 en Terminal-Bench, e Logan Kilpatrick publicou un 73,7 en DeepSWE, o único benchmark de codificación de longo horizonte
1:29 que aínda non foi memorizado, supostamente. Simon Willison pediulle que fixese algo interesante en HTML e obtivo unha simulación de partículas en trece segundos por 1,8 céntimos, correndo a sesenta fotogramas por segundo, porque o sesenta estaba codificado na páxina. A propia publicación de Google explica as ganancias cunha frase que eu enmarcaría: 3.8 Flash traballa máis duro. Executa pasos de razoamento adicionais, chama a ferramentas de forma iterativa, e, cito, pode usar máis tokens, o que en termos corporativos significa que o contador corre máis rápido. A xunta independente de DeepSWE está de acordo en ambos os aspectos: Flash obtén setenta e catro
2:02 por cento, empatado con Opus 5 a un quinto do custo por tarefa, pero precisou cento sesenta e seis pasos e cento corenta e tres mil tokens de saída para chegar alí, máis do dobre do que gastou Sol. Artificial Analysis queimou cento corenta millóns de tokens e mil setenta e oito dólares só para avalialo. Barato por token, falador por tarefa, e o primeiro token chega despois de doce segundos de pensamento. Despois, a metade interesante.
2:23 Gemini 3.8 Flash Cyber é o mesmo modelo coas barreiras de seguridade relaxadas para, cito, defensores de confianza, e Sundar di que alcanza o 86,2 por cento en CyberGym, o benchmark para atopar vulnerabilidades de forma autónoma. Tamén aplica parches: 47,2 por cento en CWE-Bench fronte ao 47,8 para un modelo punteiro, o equipo de Chrome di que produciu 2,6 veces máis parches correctos que modelos comerciais moito máis grandes, e os investigadores da nube de Google usárono para atopar unha vulnerabilidade crítica en menos de dúas horas, un traballo que normalmente leva meses, ou un adolescente motivado.
2:54 Google insiste en que priorizou a corrección sobre a explotación, que é a forma educada de dicir que o modelo pode absolutamente pasar polos buratos, simplemente pedíronlle que non o fixese. Así que non o podes ter. O acceso faise a través dun novo Fairwind Program: gobernos, infraestruturas críticas e seiscentos cincuenta socios verificados con obriga dous factores. Cada laboratorio de fronteira agora posúe un modelo de hacking que non che venderá, e esta semana é un barato.
3:16 Catro horas despois, Meta lanzou Muse Spark 1.3, e Zuck chamouno rendemento fronteirizo case demasiado barato para medir, o que é certo, cun asterisco do tamaño de Menlo Park. O punto final normal é un dólar vinte e cinco de entrada e catro vinte e cinco de saída, máis que Gemini. O punto final do contribuínte é dez centavos de entrada, vinte centavos de saída, lecturas de caché a un quinto de centavo, ata vinte veces máis barato, e a única diferenza é unha columna que di 'utilizado para mellorar os nosos produtos'.
3:40 Así que o desconto é a túa transcrición da sesión, e por unha vez ninguén ten que ler a licenza, porque Meta escribiu a licenza como unha lista de prezos. Comentario principal: agora é completamente obvio canto vale roubar os meus tokens. O segundo comentario pregúntase canto tempo pasará ata que alguén extraia unha clave de AWS dun modelo adestrado con solicitudes de contribuíntes. No propio cadro de puntuación de Meta, Spark 1.3 obtén 75.4 en DeepSWE, por riba de Sol e Opus 5, e Meta di que usa un vinte por cento menos de chamadas a ferramentas
4:06 e un vinte e cinco por cento menos de tokens que a 1.2, a aposta exactamente oposta á de Google, polo que hoxe as dúas maiores empresas de publicidade da terra discrepan sobre se falar máis é bo. Mentres tanto, Trellner Research preguntoulle a Perplexity sobre o mellor software en trescentas ochenta categorías e leu todas as citas: o 59.8 por cento proviña de sitios fóra dos cen mil principais, Wikipedia foi citada tres veces de sete mil e medio, e tres sitios irmáns con douscentos quince mil
4:34 guías de compra xeradas titulan as súas páxinas de inicio 'Facts and Grounding Page', dirixido ao rastreador, non a ti. A guerra de SEO da IA comezou, e a súa primeira arma é regex cun orzamento de márketing. Son moitos prezos para un mércores; se prefires ler isto en vez de escoitarmo dicir, o 'diff' chega á túa caixa de entrada cada mañá — de balde en thedailydiff.dev, ligazón a continuación. Entón, o veredicto de hoxe: SHIP IT. Gemini 3.8 Flash empata con Opus 5 no único taboleiro que Google non escribiu,
5:00 por un quinto do prezo. Só le a factura de tokens e le os encabezados de columna de Meta. Esa é a 'diff' de hoxe. Son Niko de Axrisi. Combina con responsabilidade.
Fontes
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
- Fairwind Programblog.google
- DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
- Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
- Muse Spark 1.3 pricingdeveloper.meta.com
- Introducing Muse Spark 1.3research.meta.ai
- Hang on to Your Firefoxwww.newsonaut.com
- Mistral: opting out of traininghelp.mistral.ai
- HN: Gemini 3.8 Flashnews.ycombinator.com
- HN: Muse Spark 1.3news.ycombinator.com
- HN: 215,128 "best software" pagesnews.ycombinator.com



