+− THE DAILY DIFFdev & AI news
NEEDS REVIEW

Gemini 4 Argon to najlepszy model Google. Nie możesz go jeszcze używać.

Google ogłosiło Gemini 4 Argon, swój nowy, przełomowy model, dostępny tylko dla zaufanych obrońców cybernetycznych.

Google ogłosiło Gemini 4 Argon, swój nowy, przełomowy model, dostępny tylko dla zaufanych obrońców cybernetycznych. Oto, co pokazuje własna 19-wierszowa tabela porównawcza Google, co zmierzył niezależny ranking i kiedy programiści mogą go otrzymać. Werdykt: NEEDS REVIEW.

Przeczytaj wydanie pisemne (angielski) ↗

Co obejmuje ten film

  • Gemini 4 Argon: milion tokenów wyjściowych, 2 $ wejścia, a nie możesz go używać
  • Wewnątrz Google: agenci Argon portują C++ na Rust
  • Własna tabela Google: Argon na czele w 13 z 19 wierszy
  • Prezentacja cybernetyczna: samodzielne łatanie, brak zabezpieczeń dla obrońców
  • Liczba zewnętrzna: Artificial Analysis mówi 53, Opus 5.5 ma 58

Przetłumaczona transkrypcja

Przetłumaczono z oryginalnej narracji angielskiej. Dostępne audio i napisy są kontrolowane przez YouTube.

Gemini 4 Argon: milion tokenów wyjściowych, 2 $ wejścia, a nie możesz go używać

0:00 Można by pomyśleć, że uruchomienie oznacza, że ​​otrzymujesz model. Google właśnie uruchomiło Gemini 4 Argon, i chyba że jesteś zaufanym cyber- obrońcą, nie możesz go dotknąć. W tym filmie: co pokazuje tabela Google? Co zmierzyli zewnętrzni testerzy? I kiedy go dostaniesz? Prawdopodobnie widziałeś już filmy promocyjne. Zamiast tego przeczytałem tabelę porównawczą, a dwa wiersze w niej nigdy nie trafiły do

0:20 tekstu posta. Dojdę do nich na końcu. Jest czwartek, pierwszego października, i to jest The Daily Diff. Dziś dwie historie, a ta duża to Gemini 4 Argon, które Google nazywa swoją nową erą inteligencji granicznej. Jedna odpowiedź może teraz mieć milion tokenów, w porównaniu do sześćdziesięciu czterech tysięcy, co stanowi kilka powieści w jednej odpowiedzi. Cena uruchomienia to dwa dolary za milion tokenów wejścia i dziesięć wyjścia. To dokładnie to, co OpenAI pobiera za GPT 6.1 Sol,

0:48 model, o którym mówiłem wczoraj, a Sol to model, który faktycznie możesz kupić. Wewnątrz Google już pracuje.

Wewnątrz Google: agenci Argon portują C++ na Rust

0:54 Google twierdzi, że agenci Argon portują C i C++ na Rust w całej firmie, do ośmiuset tysięcy linii dla jądra Fuchsia. Na Hacker News, jeden inżynier przypomniał sobie, kiedy zespół C++ Google nawet nie rozważał Rust i zamiast tego patrzył na Carbon. Teraz model dokonuje migracji, o którą się spierali.

Własna tabela Google: Argon na czele w 13 z 19 wierszy

1:12 Teraz tabela. Google umieszcza Argon obok GPT 6 Astra, Claude Fable i Claude Opus na dziewiętnastu wierszach, a Argon jest na czele w trzynastu z nich. Głównym nagłówkiem jest DeepSWE, długi test kodowania, z wynikiem siedemdziesięciu ośmiu procent, około czterech punktów przewagi. Najdziwniejszym zwycięstwem jest tworzenie projektów prawnych, gdzie Argon zdobywa dwadzieścia procent, a inne pozostają w jednocyfrowych wynikach. To najlepsza ocena w teście, w którym wszyscy zawodzą, a na testach z prezentacji

1:38 slajdów, które są niepokonane, to się liczy.

Prezentacja cybernetyczna: samodzielne łatanie, brak zabezpieczeń dla obrońców

1:41 Prawdziwa oferta to bezpieczeństwo. Google twierdzi, że Argon może samodzielnie znajdować, weryfikować i łatać krytyczne luki, a zaufani obrońcy otrzymują go bez cyberzabezpieczeń. Wiz użył go do znalezienia krytycznej dziury w oprogramowaniu szpitalnym, której wcześniejsze modele nie zauważyły. Jeden mały szczegół. Wiz należy do Google, ponieważ transakcja o wartości trzydziestu dwóch miliardów dolarów została zamknięta w marcu. Więc test hakerski czarnej skrzynki w poście to firma Google oceniająca model Google. A w rankingu naprawiania błędów, trzy modele dzielą sześćdziesiąt osiem

2:10 procent, a pasek po lewej stronie należy do Grok. Więc co zmierzyli zewnętrzni testerzy?

Liczba zewnętrzna: Artificial Analysis mówi 53, Opus 5.5 ma 58

2:15 Niezależny ranking, który znalazłem z Argonem, to Artificial Analysis. Ocenia Argona na pięćdziesiąt trzy w swoim indeksie inteligencji, na wysokim ustawieniu, co wiąże go z Astrą i Fable. Claude Opus 5.5 jest pięć punktów przed nim. Tydzień temu mówiłem, że Opus zajął tam pierwsze miejsce, i nadal je utrzymuje. Sprawiedliwa część dla Google to rachunek. Uruchomienie Argona kosztuje około dwa dolary za zadanie w tym indeksie, mniej więcej jedna trzecia tego, co kosztuje Opus.

Kiedy go dostaniesz: „Więc trzymaj się mocno”

2:42 I kiedy go dostaniesz? Google nie poda daty. Post obiecuje dostęp dla programistów, przedsiębiorstw i konsumentów tak szybko, jak to możliwe, z klientami płatnego API na pierwszym miejscu. Post Sundara Pichai na X mówi, więc trzymaj się mocno. Do tego czasu dostęp odbywa się poprzez Fairwind, program, który Google rozpoczął miesiąc temu z Gemini 3.8 Flash Cyber. Ma ponad sześćset pięćdziesiąt partnerów i mogą oni przekazać Argona tylko swoim

3:05 zespołom bezpieczeństwa i muszą śledzić, kto go używa. Hacker News dobrze to przyjął. Jeden komentator napisał: „Gemini nie bije zarzutów o niemożność wydania modelu”. Inny przewidział, że modele zamienią się w vaporware, zbiór liczb w tabeli. Tymczasem Netlify przebudowało Edge Functions, które uruchamiają się około miliarda

Netlify Edge Functions: od izolacji V8 do mikro-VM, około 5 razy szybciej

3:23 razy dziennie. Przeszli z izolacji V8 w hostowanej usłudze do mikro-VM Firecracker w własnej sieci Netlify, a ciepłe wywołanie spadło z nawet czterdziestu milisekund do około sześciu. Hacker News wskazało, że Cloudflare Workers to również izolacje V8 i działają znacznie szybciej, więc większość zwycięstwa wygląda na to, że żądanie nie opuszcza już budynku. Inny komentator martwił się o migawki, ponieważ sklonowane mikro-VM mogą dzielić stan liczb losowych, czyli w ten sposób otrzymujesz dwa identyczne UUID.

3:50 Zimny start, gdy region nigdy nie widział twojej funkcji, dotyka około jednego procenta wywołań i zajmuje około dziewięciu milisekund. A samo mikro-VM to Firecracker, który Amazon zbudował dla Lambda, więc jeden komentator sugeruje, abyś o tym pamiętał następnym razem, gdy będziesz przeklinać AWS.

Dwa wiersze, o których post Google nigdy nie wspomina

4:06 Teraz, te dwa wiersze. Na FrontierSWE i Terminal-bench, dwóch testach kodowania, o których tekst posta nigdy nie wspomina, Argon jest ostatni z czterech, w własnej tabeli Google. Terminal-bench umieszcza agenta w prawdziwej powłoce, czyli tak, jak większość z nas by go używała, a Opus prowadzi go o dziewięć punktów. Jeśli wolisz to przeczytać, niż usłyszeć, jak to mówię, The Daily Diff ląduje w twojej skrzynce odbiorczej każdego ranka, za darmo na daily diff dot dev, link poniżej.

Werdykt: NEEDS REVIEW, w dniu, w którym będę mógł to nazwać

4:29 Więc, dzisiejszy werdykt w sprawie Gemini 4 Argon. NEEDS REVIEW. Zaznaczyłbym to w ten sposób, ponieważ niezależna liczba, którą znalazłem, stawia go na drugim miejscu, a dwa wiersze kodowania, na których mi zależy, stawiają go na ostatnim miejscu, więc zrecenzuję go należycie w dniu, w którym będę mógł go nazwać. Subskrybuj, naciśnij dzwonek i powiedz mi w komentarzach, czy zaznaczyłbyś to inaczej. I to jest The Daily Diff na dziś. Jestem Niko z Axrisi. Łącz odpowiedzialnie.

Źródła

  1. Googleblog.google
  2. Hacker Newsnews.ycombinator.com
  3. Fairwind Programdeepmind.google
  4. Artificial Analysisartificialanalysis.ai
  5. Sundar Pichaix.com
  6. Demis Hassabisx.com
  7. Google completes acquisition of Wizcloud.google.com
  8. Netlifywww.netlify.com
  9. Hacker Newsnews.ycombinator.com

Powiązane filmy