Google har netop sendt en hackingmodel ud. Her er forskellen.
Google lancerede Gemini 3.8 Flash (0,75 $ ind / 3,75 $ ud, prisen fordobles 1.
Google lancerede Gemini 3.8 Flash (0,75 $ ind / 3,75 $ ud, prisen fordobles 1. januar) og Gemini 3.8 Flash Cyber — en model til at finde sårbarheder, som de kun sælger til 650 godkendte "betroede forsvarere" — og fire timer senere lancerede Meta Muse Spark 1.3 med et "bidragyder"-niveau til 0,10 $ per million, hvor rabatten er din sessionsudskrift. Vi sammenligner begge med den ene benchmark, ingen af virksomhederne skrev. Dom: AFSEND DEN.
Hvad denne video dækker
- Google lancerer Gemini 3.8 Flash + Flash Cyber (86,2% CyberGym, Fairwind Program)
- Meta lancerer Muse Spark 1.3: 1,25 $/4,25 $, eller 0,10 $/0,20 $, hvis Meta må træne på det
- Tre websteder lavede 215.128 falske "bedste software"-sider; Perplexity citerer dem
Oversat udskrift
Oversat fra den originale engelske fortælling. Tilgængelig lyd og undertekster styres af YouTube.
0:00 Google lancerede sin tredje Flash-model på seks uger i dag, plus en version trænet til at hacke, og fire timer senere lancerede Meta en model, der koster ti cent per million tokens, hvis du lader Zuckerberg læse din kode, så AI-priskrigen har nu en cybersikkerhedsdivision. Det er onsdag, og forskellen er lang. Gemini 3.8 Flash ramte elleve hundrede point på Hacker News, Muse Spark 1.3 tog næsten syv hundrede mere, og derimellem, fandt et forskningscenter tre hjemmesider, der udgav to hundrede femten tusind
0:28 falske bedste-software sider udelukkende for at Perplexity skulle citere dem. Også i dag: et indlæg, der tryglede dig om at holde fast i din Firefox, fik ni hundrede otteogfirs point, og Mistrals hjælpeside om at fravælge træning fik næsten fem hundrede, mest fra europæere, der opdagede, at den suveræne mulighed træner på dine prompter som standard. I denne video: hvad Gemini 3.8 Flash faktisk koster, hackingmodellen Google kun vil sælge til seks hundrede halvtreds partnere, Metas ti-cents-niveau og hvad det virkelig koster, og den ene benchmark ingen af virksomhederne skrev.
0:59 Det er onsdag den 2. september, og dette er The Daily Diff. Gemini 3.8 Flash koster femoghalvfjerds cent per million tokens ind og tre femoghalvfjerds ud, det samme som 3.7 Flash fra tre uger siden, med en fodnote, der siger, at prisen fordobles den 1. januar, hvilket er en gratis prøveperiode med ekstra trin. På slide-deck benchmarks, som er uovertrufne, scorer den 54,9 procent på HLE-Verified, X siger, at den slår Sol og Opus 5 på Terminal-Bench, og Logan Kilpatrick postede en 73,7 på DeepSWE, den ene langhorisont
1:29 kodningsbenchmark, der endnu ikke er blevet husket, angiveligt. Simon Willison bad den om at lave en fed ting i HTML og fik en partikelsimulering på tretten sekunder for 1,8 cent, kørende med tres billeder i sekundet, fordi tres var hardcoded ind i siden. Googles eget indlæg forklarer fremskridtene med en sætning, jeg ville indramme: 3.8 Flash arbejder hårdere. Den udfører ekstra ræsonnementstrin, kalder værktøjer iterativt, og, citat, kan bruge flere tokens, hvilket er virksomhedssprog for, at tælleren kører hurtigere. Det uafhængige DeepSWE-panel er enig på begge punkter: Flash scorer fireoghalvfjerds
2:02 procent, uafgjort med Opus 5 til en femtedel af omkostningerne per opgave, men den krævede et hundrede seksogtres trin og et hundrede treogfyrre tusind output-tokens for at nå dertil, mere end dobbelt så meget som Sol brugte. Kunstig analyse brændte et hundrede fyrre millioner tokens og et tusind otteoghalvfjerds dollars bare for at bedømme den. Billig per token, snakkesalig per opgave, og det første token ankommer efter tolv sekunders tænkning. Så den interessante halvdel.
2:23 Gemini 3.8 Flash Cyber er den samme model med sikkerhedsskinnerne løsnet for, citat, betroede forsvarere, og Sundar siger, at den rammer 86,2 procent på CyberGym, benchmarket for autonomt at finde sårbarheder. Den lapper også: 47,2 procent på CWE-Bench mod 47,8 for en førende frontiermodel, Chrome-teamet siger, at den producerede 2,6 gange flere korrekte lapper end meget større kommercielle modeller, og Googles cloud-forskere brugte den til at finde en kritisk sårbarhed på under to timer, et job der normalt tager måneder, eller en motiveret teenager.
2:54 Google insisterer på, at de prioriterede rettelse over udnyttelse, hvilket er den høflige måde at sige, at modellen absolut kan gå igennem hullerne, de bad den bare om ikke at gøre det. Så du kan ikke få den. Adgang går via et nyt Fairwind Program: regeringer, kritisk infrastruktur og seks hundrede halvtreds godkendte partnere med obligatorisk to-faktor. Hvert frontlinjelaboratorium ejer nu en hackingmodel, de ikke vil sælge dig, og denne uge er det en billig en.
3:16 Fire timer senere udgav Meta Muse Spark 1.3, og Zuck kaldte det en banebrydende ydelse, næsten for billig til at måle, hvilket er sandt, med en stjerne på størrelse med Menlo Park. Det normale slutpunkt koster 1,25 dollar ind og 4,25 dollar ud, mere end Gemini. Bidragsydernes slutpunkt koster ti cent ind, tyve cent ud, cache-læsninger til en femtedel af en cent, op til tyve gange billigere, og den eneste forskel er en kolonne, der siger 'bruges til at forbedre vores produkter'.
3:40 Så rabatten er din sessionsudskrift, og for en gangs skyld behøver ingen at læse licensen, fordi Meta skrev licensen som en prisliste. Topkommentar: det er nu helt åbenlyst, hvor meget det er værd at stjæle mine tokens. Anden kommentar undrer sig over, hvor lang tid der går, før nogen udtrækker en AWS-nøgle fra en model trænet på bidragsyder-prompter. På Metas egen scorekort opnår Spark 1.3 75,4 på DeepSWE, over Sol og Opus 5, og Meta siger, at den bruger tyve procent færre værktøjskald
4:06 og femogtyve procent færre tokens end 1.2, den stik modsatte satsning fra Google, så i dag er de to største reklamevirksomheder på jorden uenige om, hvorvidt at snakke mere er godt. I mellemtiden bad Trellner Research Perplexity om den bedste software i tre hundrede og firs kategorier og læste hver citation: 59,8 procent kom fra sider uden for top hundrede tusind, Wikipedia blev citeret tre gange ud af syv og et halvt tusind, og tre søstersider med to hundrede og femten tusind
4:34 genererede købsguider med titlerne 'Facts and Grounding Page' på deres hjemmesider, adresseret til crawleren, ikke til dig. AI SEO-krigen er begyndt, og dens første våben er regex med et marketingbudget. Det er mange prisskilte til en onsdag; hvis du hellere vil læse dette end høre mig sige det, lander the diff i din indbakke hver morgen — gratis på the daily diff dot dev, link nedenfor. Så, dagens dom: SHIP IT. Gemini 3.8 Flash matcher Opus 5 på det eneste board, Google ikke skrev,
5:00 til en femtedel af prisen. Læs blot token-regningen, og læs Metas kolonneoverskrifter. Det er dagens diff. Jeg er Niko fra Axrisi. Flet ansvarligt.
Kilder
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
- Fairwind Programblog.google
- DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
- Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
- Muse Spark 1.3 pricingdeveloper.meta.com
- Introducing Muse Spark 1.3research.meta.ai
- Hang on to Your Firefoxwww.newsonaut.com
- Mistral: opting out of traininghelp.mistral.ai
- HN: Gemini 3.8 Flashnews.ycombinator.com
- HN: Muse Spark 1.3news.ycombinator.com
- HN: 215,128 "best software" pagesnews.ycombinator.com



