O Google acabou de lançar um modelo de hacking. Aqui está a diferença.
O Google lançou o Gemini 3.8 Flash (US$ 0,75 de entrada / US$ 3,75 de saída, o preço dobra em 1º de janeiro) e o Gemini 3.8 Flash Cyber — um modelo de caça a vulnerabilidades que ele vende apenas para 650 "defensores confiáveis" verificados — e quatro horas depois o Meta lançou o Muse Spark 1.3 com um nível de "colaborador" de US$ 0,10 por milhão onde o desconto é a sua transcrição de sessão.
O Google lançou o Gemini 3.8 Flash (US$ 0,75 de entrada / US$ 3,75 de saída, o preço dobra em 1º de janeiro) e o Gemini 3.8 Flash Cyber — um modelo de caça a vulnerabilidades que ele vende apenas para 650 "defensores confiáveis" verificados — e quatro horas depois o Meta lançou o Muse Spark 1.3 com um nível de "colaborador" de US$ 0,10 por milhão onde o desconto é a sua transcrição de sessão. Nós verificamos ambos contra o único benchmark que nenhuma das empresas escreveu. Veredito: ENVIAR.
O que este vídeo aborda
- Google lança Gemini 3.8 Flash + Flash Cyber (86,2% CyberGym, Programa Fairwind)
- Meta lança Muse Spark 1.3: US$ 1,25/US$ 4,25, ou US$ 0,10/US$ 0,20 se o Meta puder treinar com ele
- Três sites criaram 215.128 páginas falsas de "melhor software"; Perplexity as cita
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
0:00 O Google lançou hoje seu terceiro modelo Flash em seis semanas, além de uma versão treinada para hackear, e quatro horas depois o Meta lançou um modelo que custa dez centavos por milhão de tokens se você deixar Zuckerberg ler seu código, então a guerra de preços da IA agora tem uma divisão de cibersegurança. É quarta-feira, e a diferença é grande. O Gemini 3.8 Flash atingiu mil e cem pontos no Hacker News, o Muse Spark 1.3 levou quase setecentos a mais, e no meio, uma loja de pesquisa encontrou três sites que publicaram duzentos e quinze mil
0:28 páginas falsas de melhor software puramente para que o Perplexity as citasse. Também hoje: um post implorando para você continuar com seu Firefox conseguiu novecentos e oitenta e oito pontos, e a página de ajuda do Mistral sobre como desativar o treinamento conseguiu quase quinhentos, principalmente de europeus descobrindo que a opção soberana treina em seus prompts por padrão. Neste vídeo: o que o Gemini 3.8 Flash realmente custa, o modelo de hacking que o Google só venderá para seiscentos e cinquenta parceiros, o nível de dez centavos do Meta e o que ele realmente cobra, e o único benchmark que nenhuma das empresas escreveu.
0:59 É quarta-feira, 2 de setembro, e este é o The Daily Diff. O Gemini 3.8 Flash custa setenta e cinco centavos por milhão de tokens de entrada e três e setenta e cinco de saída, o mesmo que o 3.7 Flash de três semanas atrás, com uma nota de rodapé dizendo que o preço dobra em 1º de janeiro, o que é um teste gratuito com passos extras. Nos benchmarks do slide-deck, que são invictos, ele marca 54,9 por cento no HLE-Verified, o X diz que supera Sol e Opus 5 no Terminal-Bench, e Logan Kilpatrick postou um 73.7 no DeepSWE, o único benchmark de
1:29 codificação de longo prazo que ainda não foi memorizado, supostamente. Simon Willison pediu para ele fazer algo legal em HTML e obteve uma simulação de partículas em treze segundos por 1,8 centavos, rodando a sessenta quadros por segundo, porque o sessenta estava codificado na página. A própria postagem do Google explica os ganhos com uma frase que eu emolduraria: o 3.8 Flash trabalha mais. Ele executa etapas extras de raciocínio, chama ferramentas iterativamente, e, cito, pode usar mais tokens, o que em termos corporativos significa que o medidor corre mais rápido. O conselho independente do DeepSWE concorda em ambos os pontos: o Flash marca setenta e quatro
2:02 por cento, empatado com o Opus 5 a um quinto do custo por tarefa, mas precisou de cento e sessenta e seis etapas e cento e quarenta e três mil tokens de saída para chegar lá, mais que o dobro do que o Sol gastou. A Artificial Analysis queimou cento e quarenta milhões de tokens e mil e setenta e oito dólares apenas para avaliá-lo. Barato por token, falante por tarefa, e o primeiro token chega após doze segundos de pensamento. Depois, a metade interessante.
2:23 O Gemini 3.8 Flash Cyber é o mesmo modelo com as barreiras de segurança afrouxadas para, cito, defensores confiáveis, e Sundar diz que atinge 86,2 por cento no CyberGym, o benchmark para encontrar vulnerabilidades autonomamente. Ele também corrige: 47,2 por cento no CWE-Bench contra 47,8 para um modelo de ponta líder, a equipe do Chrome diz que produziu 2,6 vezes mais correções corretas do que modelos comerciais muito maiores, e os pesquisadores da nuvem do Google o usaram para encontrar uma vulnerabilidade crítica em menos de duas horas, um trabalho que geralmente leva meses, ou um adolescente motivado.
2:54 O Google insiste que priorizou a correção em vez da exploração, que é a maneira educada de dizer que o modelo pode absolutamente passar pelos buracos, eles apenas pediram para não fazê-lo. Então você não pode ter. O acesso é feito através de um novo Programa Fairwind: governos, infraestrutura crítica e seiscentos e cinquenta parceiros verificados com obrigação autenticação de dois fatores. Cada laboratório de fronteira agora possui um modelo de hacking que não será vendido a você, e esta semana é um modelo barato.
3:16 Quatro horas depois, a Meta lançou o Muse Spark 1.3, e Zuck o chamou de desempenho de fronteira quase barato demais para ser medido, o que é verdade, com um asterisco do tamanho de Menlo Park. O endpoint normal é um dólar e vinte e cinco centavos para entrada e quatro dólares e vinte e cinco centavos para saída, mais do que Gemini. O endpoint do colaborador é dez centavos para entrada, vinte centavos para saída, leituras de cache a um quinto de centavo, até vinte vezes mais barato, e a única diferença é uma coluna que diz 'usado para melhorar nossos produtos'.
3:40 Então o desconto é a transcrição da sua sessão, e, pela primeira vez, ninguém precisa ler a licença, porque a Meta escreveu a licença como uma lista de preços. Comentário principal: agora é completamente óbvio o valor de roubar meus tokens. O segundo comentário questiona quanto tempo levará até que alguém extraia uma chave AWS de um modelo treinado em prompts de colaboradores. No próprio scorecard da Meta, o Spark 1.3 obtém 75.4 no DeepSWE, acima de Sol e Opus 5, e a Meta diz que ele usa vinte por cento menos chamadas de ferramentas
4:06 e vinte e cinco por cento menos tokens do que o 1.2, a aposta exata oposta da Google, então hoje as duas maiores empresas de publicidade na Terra discordam sobre se falar mais é bom. Enquanto isso, a Trellner Research perguntou ao Perplexity sobre o melhor software em trezentas e oitenta categorias e leu todas as citações: 59.8 por cento vieram de sites fora dos cem mil maiores, a Wikipedia foi citada três vezes em sete mil e quinhentas, e três sites irmãos com duzentos e quinze mil guias de compra gerados intitulam suas páginas iniciais 'Fatos e Página de Fundamentação',
4:34 endereçado ao rastreador, não a você. A guerra de SEO com IA começou, e sua primeira arma é regex com um orçamento de marketing. São muitos preços para uma quarta-feira; se você preferir ler isso a me ouvir dizer, o 'diff' chega na sua caixa de entrada todas as manhãs — gratuito em 'the daily diff dot dev', link abaixo. Então, o veredito de hoje: SHIP IT. Gemini 3.8 Flash empata com Opus 5 na única placa que o Google não escreveu, por um quinto do preço.
5:00 Basta ler a conta de tokens e os cabeçalhos das colunas da Meta. Esse é o 'diff' de hoje. Sou Niko da Axrisi. Faça a fusão com responsabilidade. Merge responsibly.
Fontes
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
- Fairwind Programblog.google
- DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
- Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
- Muse Spark 1.3 pricingdeveloper.meta.com
- Introducing Muse Spark 1.3research.meta.ai
- Hang on to Your Firefoxwww.newsonaut.com
- Mistral: opting out of traininghelp.mistral.ai
- HN: Gemini 3.8 Flashnews.ycombinator.com
- HN: Muse Spark 1.3news.ycombinator.com
- HN: 215,128 "best software" pagesnews.ycombinator.com



