+− THE DAILY DIFFdev & AI news
SHIP IT

Google heeft zojuist een hackingmodel gelanceerd. Hier is het verschil.

Google heeft Gemini 3.8 Flash geleverd ($0,75 in / $3,75 uit, prijs verdubbelt op 1 januari) en Gemini 3.8 Flash Cyber — een model voor het opsporen van kwetsbaarheden dat het alleen verkoopt aan 650 "vertrouwde verdedigers" — en vier uur later lanceerde Meta Muse Spark 1.3 met een $0,10-per-miljoen "bijdrager"-niveau waarbij de korting je sessie-transcript is.

Google heeft Gemini 3.8 Flash geleverd ($0,75 in / $3,75 uit, prijs verdubbelt op 1 januari) en Gemini 3.8 Flash Cyber — een model voor het opsporen van kwetsbaarheden dat het alleen verkoopt aan 650 "vertrouwde verdedigers" — en vier uur later lanceerde Meta Muse Spark 1.3 met een $0,10-per-miljoen "bijdrager"-niveau waarbij de korting je sessie-transcript is. We controleren beide tegen de ene benchmark die geen van beide bedrijven heeft geschreven. Oordeel: SHIP IT.

Wat deze video behandelt

  • Google levert Gemini 3.8 Flash + Flash Cyber (86,2% CyberGym, Fairwind Programma)
  • Meta levert Muse Spark 1.3: $1,25/$4,25, of $0,10/$0,20 als Meta erop mag trainen
  • Drie sites maakten 215.128 nep "beste software"-pagina's; Perplexity citeert ze

Vertaald transcript

Vertaald vanuit de originele Engelse gesproken tekst. Beschikbare audio en ondertiteling worden beheerd door YouTube.

0:00 Google lanceerde vandaag zijn derde Flash-model in zes weken, plus een versie getraind om te hacken, en vier uur later lanceerde Meta een model dat tien cent per miljoen tokens kost als je Zuckerberg je code laat lezen, dus de AI-prijzenoorlog heeft nu een cybersecurity-divisie. Het is woensdag, en het verschil is groot. Gemini 3.8 Flash behaalde elfhonderd punten op Hacker News, Muse Spark 1.3 behaalde bijna zevenhonderd meer, en daartussenin, vond een onderzoeksinstituut drie websites die tweehonderdvijftienduizend

0:28 nep beste-software-pagina's publiceerden puur zodat Perplexity ze zou citeren. Ook vandaag: een bericht dat je smeekte om je Firefox te behouden kreeg negenhonderd achtentachtig punten, en de helppagina van Mistral over het afmelden voor training kreeg bijna vijfhonderd, voornamelijk van Europeanen die de soevereine optie ontdekten trainde standaard op hun prompts. In deze video: wat Gemini 3.8 Flash eigenlijk kost, het hackingmodel dat Google alleen aan zeshonderdvijftig partners zal verkopen, Meta's tien-cent-niveau en wat het echt in rekening brengt, en de ene benchmark die geen van beide bedrijven heeft geschreven.

0:59 Het is woensdag 2 september, en dit is The Daily Diff. Gemini 3.8 Flash kost vijfenzeventig cent per miljoen tokens in en drie vijfenzeventig uit, hetzelfde als 3.7 Flash van drie weken geleden, met een voetnoot die zegt dat de prijs op 1 januari verdubbelt, wat een gratis proefperiode is met extra stappen. Op de slide-deck benchmarks, die ongeslagen zijn, scoort het 54,9 procent op HLE-Verified, X zegt dat het Sol en Opus 5 verslaat op Terminal-Bench, en Logan Kilpatrick plaatste een 73,7 op DeepSWE, de enige long-horizon

1:29 codeerbenchmark die nog niet is gememoriseerd, naar verluidt. Simon Willison vroeg het om iets cools te maken in HTML en kreeg een deeltjessimulatie in dertien seconden voor 1,8 cent, draaiend op zestig frames per seconde, omdat de zestig hardgecodeerd was in de pagina. Googles eigen bericht verklaart de winst met een zin die ik zou inlijsten: 3.8 Flash werkt harder. Het voert extra redeneerstappen uit, roept tools iteratief aan, en, quote, zou meer tokens kunnen gebruiken, wat bedrijfsjargon is voor de teller loopt sneller. Het onafhankelijke DeepSWE-bestuur is het op beide punten eens: Flash scoort vierenzeventig

2:02 procent, gelijk met Opus 5 tegen een vijfde van de kosten per taak, maar het had honderdzestig stappen en honderd drieënveertigduizend uitvoer-tokens nodig om daar te komen, meer dan twee keer wat Sol uitgaf. Kunstmatige Analyse verbrandde honderdveertig miljoen tokens en duizend achtenzeventig dollar alleen om het te beoordelen. Goedkoop per token, praatgraag per taak, en het eerste token arriveert na twaalf seconden denken. Dan de interessante helft.

2:23 Gemini 3.8 Flash Cyber is hetzelfde model met de veiligheidsvoorzieningen versoepeld voor, quote, vertrouwde verdedigers, en Sundar zegt dat het 86,2 procent scoort op CyberGym, de benchmark voor het autonoom vinden van kwetsbaarheden. Het patche ook: 47,2 procent op CWE-Bench tegen 47,8 voor een leidend grensmodel, het Chrome-team zegt dat het 2,6 keer meer correcte patches produceerde dan veel grotere commerciële modellen, en de cloud-onderzoekers van Google gebruikten het om een kritieke kwetsbaarheid te vinden in minder dan twee uur, een taak die meestal maanden, of één gemotiveerde tiener, kost.

2:54 Google staat erop dat het prioriteit gaf aan reparatie boven exploitatie, wat de beleefde manier is om te zeggen dat het model absoluut door de gaten kan lopen, ze vroegen het alleen om dat niet te doen. Dus je kunt het niet hebben. Toegang verloopt via een nieuw Fairwind Programma: overheden, kritieke infrastructuur en zeshonderdvijftig doorgelichte partners met verplichte tweefactor. Elk grensverleggend lab bezit nu een hackingmodel dat het u niet zal verkopen, en deze week is het een goedkoop exemplaar.

3:16 Vier uur later bracht Meta Muse Spark 1.3 uit, en Zuck noemde het grensverleggende prestaties die bijna te goedkoop zijn om te meten, wat waar is, met één asterisk zo groot als Menlo Park. Het normale eindpunt is anderhalve dollar in en vier dollar vijfentwintig uit, meer dan Gemini. Het 'contributor' eindpunt is tien cent in, twintig cent uit, cache-lezingen voor een vijfde van een cent, tot twintig keer goedkoper, en het enige verschil is een kolom die zegt 'gebruikt om onze producten te verbeteren'.

3:40 Dus de korting is uw sessietranscript, en voor één keer hoeft niemand de licentie te lezen, want Meta schreef de licentie als een prijslijst. Bovenste reactie: het is nu volkomen duidelijk hoeveel het stelen van mijn tokens waard is. Tweede reactie vraagt zich af hoe lang het duurt voordat iemand een AWS-sleutel uit een model haalt dat getraind is op 'contributor' prompts. Op Meta's eigen scorekaart krijgt Spark 1.3 75.4 op DeepSWE, boven Sol en Opus 5, en Meta zegt dat het twintig procent minder tool calls gebruikt

4:06 en vijfentwintig procent minder tokens dan 1.2, precies de tegenovergestelde weddenschap van Google, dus vandaag zijn de twee grootste advertentiebedrijven ter wereld het er niet over eens of meer praten goed is. Ondertussen vroeg Trellner Research aan Perplexity naar de beste software in drie honderd tachtig categorieën en las elke bronvermelding: 59.8 procent kwam van sites buiten de top honderdduizend, Wikipedia werd drie keer geciteerd op zeven en een half duizend, en drie zustersites met tweehonderdvijftienduizend

4:34 gegenereerde koopgidsen die hun homepages 'Feiten en Grondbeginselen Pagina' noemen, gericht aan de crawler, niet aan u. De AI SEO-oorlog is begonnen, en het eerste wapen is regex met een marketingbudget. Dat zijn veel prijskaartjes voor één woensdag; als u dit liever leest dan mij het hoort zeggen, de 'diff' landt elke ochtend in uw inbox — gratis op the daily diff dot dev, link hieronder. Dus, het oordeel van vandaag: SHIP IT. Gemini 3.8 Flash evenaart Opus 5 op het enige bord dat Google niet schreef,

5:00 voor een vijfde van de prijs. Lees gewoon de tokenrekening, en lees Meta's kolomkoppen. Dat is de 'diff' van vandaag. Ik ben Niko van Axrisi. Merge verantwoordelijk.

Bronnen

  1. Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
  2. Fairwind Programblog.google
  3. DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
  4. Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
  5. Muse Spark 1.3 pricingdeveloper.meta.com
  6. Introducing Muse Spark 1.3research.meta.ai
  7. Hang on to Your Firefoxwww.newsonaut.com
  8. Mistral: opting out of traininghelp.mistral.ai
  9. HN: Gemini 3.8 Flashnews.ycombinator.com
  10. HN: Muse Spark 1.3news.ycombinator.com
  11. HN: 215,128 "best software" pagesnews.ycombinator.com

Gerelateerde video's