Google vừa tung ra một mô hình hack. Đây là sự khác biệt.
Google đã phát hành Gemini 3.8 Flash (0,75 đô la vào / 3,75 đô la ra, giá tăng gấp đôi vào ngày 1 tháng 1) và Gemini 3.8 Flash Cyber – một mô hình săn lỗ hổng mà họ chỉ bán cho 650 "nhà bảo vệ đáng tin cậy" được kiểm duyệt – và bốn giờ sau đó Meta đã phát hành Muse Spark 1.3 với gói "người đóng góp" 0,10 đô la mỗi triệu, trong đó giảm giá là bản ghi phiên của bạn.
Google đã phát hành Gemini 3.8 Flash (0,75 đô la vào / 3,75 đô la ra, giá tăng gấp đôi vào ngày 1 tháng 1) và Gemini 3.8 Flash Cyber – một mô hình săn lỗ hổng mà họ chỉ bán cho 650 "nhà bảo vệ đáng tin cậy" được kiểm duyệt – và bốn giờ sau đó Meta đã phát hành Muse Spark 1.3 với gói "người đóng góp" 0,10 đô la mỗi triệu, trong đó giảm giá là bản ghi phiên của bạn. Chúng tôi kiểm tra cả hai so với một tiêu chuẩn mà cả hai công ty đều không tạo ra. Nhận định: SHIP IT.
Nội dung video này đề cập
- Google ra mắt Gemini 3.8 Flash + Flash Cyber (86.2% CyberGym, Chương trình Fairwind)
- Meta ra mắt Muse Spark 1.3: $1.25/$4.25, hoặc $0.10/$0.20 nếu Meta có thể huấn luyện trên đó
- Ba trang web đã tạo 215.128 trang "phần mềm tốt nhất" giả mạo; Perplexity trích dẫn chúng
Bản ghi đã dịch
Được dịch từ lời tường thuật tiếng Anh gốc. Âm thanh và phụ đề có sẵn được điều khiển bởi YouTube.
0:00 Hôm nay, Google đã ra mắt mô hình Flash thứ ba trong sáu tuần, cùng với một phiên bản được huấn luyện để hack, và bốn giờ sau đó Meta đã ra mắt một mô hình mà có giá mười xu cho mỗi triệu token nếu bạn cho phép Zuckerberg đọc mã của mình, vì vậy cuộc chiến giá AI giờ đây có một bộ phận an ninh mạng. Hôm nay là thứ Tư, và sự khác biệt là rất lớn. Gemini 3.8 Flash đạt mười một trăm điểm trên Hacker News, Muse Spark 1.3 đạt gần bảy trăm điểm nữa, và ở giữa, một cửa hàng nghiên cứu đã tìm thấy ba trang web đã xuất bản hai trăm mười lăm nghìn
0:28 trang phần mềm tốt nhất giả mạo hoàn toàn chỉ để Perplexity trích dẫn chúng. Cũng trong hôm nay: một bài đăng cầu xin bạn giữ Firefox của mình đã đạt chín trăm tám mươi tám điểm, và trang trợ giúp của Mistral về việc từ chối đào tạo đã đạt gần năm trăm điểm, chủ yếu từ những người châu Âu phát hiện ra rằng tùy chọn chủ quyền đào tạo trên các lời nhắc của bạn theo mặc định. Trong video này: chi phí thực sự của Gemini 3.8 Flash, mô hình hack mà Google chỉ bán cho sáu trăm năm mươi đối tác, gói mười xu của Meta và những gì nó thực sự tính phí, và một tiêu chuẩn mà cả hai công ty đều không tạo ra.
0:59 Hôm nay là thứ Tư, ngày 2 tháng 9, và đây là The Daily Diff. Gemini 3.8 Flash có giá bảy mươi lăm xu cho mỗi triệu token vào và ba bảy mươi lăm ra, giống như 3.7 Flash từ ba tuần trước, với một chú thích nói rằng giá tăng gấp đôi vào ngày 1 tháng 1, đó là một bản dùng thử miễn phí với các bước bổ sung. Trên các tiêu chuẩn của slide-deck, vốn chưa từng bị đánh bại, nó đạt 54.9 phần trăm trên HLE-Verified, X nói rằng nó đánh bại Sol và Opus 5 trên Terminal-Bench, và Logan Kilpatrick đã đăng một 73.7 trên DeepSWE, tiêu chuẩn mã hóa dài hạn
1:29 chưa được ghi nhớ, theo cáo buộc. Simon Willison yêu cầu nó tạo ra một thứ thú vị trong HTML và đã có một mô phỏng hạt trong mười ba giây với giá 1.8 xu, chạy ở sáu mươi khung hình mỗi giây, vì sáu mươi đã được mã hóa cứng vào trang. Bài đăng của riêng Google giải thích những lợi ích với một câu mà tôi muốn đóng khung: 3.8 Flash hoạt động chăm chỉ hơn. Nó thực hiện các bước suy luận bổ sung, gọi các công cụ lặp lại, và, trích dẫn, có thể sử dụng nhiều token hơn, đó là cách nói của công ty cho việc đồng hồ chạy nhanh hơn. Hội đồng DeepSWE độc lập đồng ý về cả hai điểm: Flash đạt bảy mươi bốn
2:02 phần trăm, ngang với Opus 5 với một phần năm chi phí cho mỗi nhiệm vụ, nhưng nó cần một trăm sáu mươi sáu bước và một trăm bốn mươi ba nghìn token đầu ra để đạt được điều đó, hơn gấp đôi những gì Sol đã tiêu tốn. Artificial Analysis đã đốt một trăm bốn mươi triệu token và một nghìn bảy mươi tám đô la chỉ để chấm điểm nó. Rẻ mỗi token, nói nhiều mỗi nhiệm vụ, và token đầu tiên đến sau mười hai giây suy nghĩ. Sau đó là nửa thú vị.
2:23 Gemini 3.8 Flash Cyber là cùng một mô hình với các hàng rào an toàn được nới lỏng cho, trích dẫn, những người bảo vệ đáng tin cậy, và Sundar nói rằng nó đạt 86.2 phần trăm trên CyberGym, tiêu chuẩn để tự động tìm lỗ hổng. Nó cũng vá lỗi: 47.2 phần trăm trên CWE-Bench so với 47.8 cho một mô hình tiên tiến hàng đầu, nhóm Chrome nói rằng nó đã tạo ra số bản vá đúng gấp 2.6 lần so với các mô hình thương mại lớn hơn nhiều, và các nhà nghiên cứu đám mây của Google đã sử dụng nó để tìm một lỗ hổng nghiêm trọng trong vòng chưa đầy hai giờ, một công việc thường mất nhiều tháng, hoặc một thiếu niên có động lực.
2:54 Google khẳng định họ ưu tiên sửa lỗi hơn là khai thác, đó là cách nói lịch sự rằng mô hình hoàn toàn có thể đi qua các lỗ hổng, họ chỉ yêu cầu nó không làm vậy. Vì vậy bạn không thể có nó. Quyền truy cập thông qua một Chương trình Fairwind mới: chính phủ, cơ sở hạ tầng quan trọng và sáu trăm năm mươi đối tác được kiểm duyệt với bắt buộc xác thực hai yếu tố. Mọi phòng thí nghiệm tiên phong giờ đây đều sở hữu một mô hình hack mà họ sẽ không bán cho bạn, và tuần này là một mô hình rẻ tiền.
3:16 Bốn giờ sau, Meta phát hành Muse Spark 1.3, và Zuck gọi đó là hiệu suất tiên phong quá rẻ đến mức gần như không thể đo lường, điều này là đúng, với một dấu hoa thị lớn bằng Menlo Park. Điểm cuối thông thường là một đô la hai mươi lăm xu vào và bốn đô la hai mươi lăm xu ra, nhiều hơn Gemini. Điểm cuối của người đóng góp là mười xu vào, hai mươi xu ra, đọc bộ nhớ cache với giá một phần năm xu, rẻ hơn tới hai mươi lần, và sự khác biệt duy nhất là một cột ghi "được sử dụng để cải thiện sản phẩm của chúng tôi."
3:40 Vì vậy, khoản giảm giá là bản ghi phiên của bạn, và lần này không ai phải đọc giấy phép, bởi vì Meta đã viết giấy phép dưới dạng bảng giá. Bình luận hàng đầu: giờ đây hoàn toàn rõ ràng việc đánh cắp token của tôi đáng giá bao nhiêu. Bình luận thứ hai tự hỏi sẽ mất bao lâu cho đến khi ai đó trích xuất khóa AWS từ một mô hình được đào tạo trên các lời nhắc của người đóng góp. Trên bảng điểm của Meta, Spark 1.3 đạt 75.4 trên DeepSWE, cao hơn Sol và Opus 5, và Meta nói rằng nó sử dụng ít hơn hai mươi phần trăm lệnh gọi công cụ
4:06 và ít hơn hai mươi lăm phần trăm token so với 1.2, một nước cờ hoàn toàn ngược lại với Google, vì vậy hôm nay hai công ty quảng cáo lớn nhất trên thế giới không đồng ý về việc nói nhiều hơn có tốt hay không. Trong khi đó, Trellner Research đã hỏi Perplexity về phần mềm tốt nhất trong ba trăm tám mươi danh mục và đọc mọi trích dẫn: 59.8 phần trăm đến từ các trang web ngoài top một trăm nghìn, Wikipedia được trích dẫn ba lần trong số bảy nghìn rưỡi, và ba trang web chị em với hai trăm mười lăm nghìn
4:34 hướng dẫn mua hàng được tạo tựa đề trang chủ của họ là "Facts and Grounding Page" (Trang Sự thật và Cơ sở), hướng đến trình thu thập thông tin, không phải bạn. Cuộc chiến AI SEO đã bắt đầu, và vũ khí đầu tiên của nó là regex với ngân sách tiếp thị. Đó là rất nhiều thẻ giá cho một ngày thứ Tư; nếu bạn muốn đọc điều này hơn là nghe tôi nói, The Daily Diff sẽ đến hộp thư đến của bạn mỗi sáng — miễn phí tại thedailydiff.dev, liên kết bên dưới. Vậy, phán quyết hôm nay: SHIP IT. Gemini 3.8 Flash ngang Opus 5 trên bảng Google không viết,
5:00 với giá bằng một phần năm. Chỉ cần đọc hóa đơn token và đọc các tiêu đề cột của Meta. Đó là The Daily Diff hôm nay. Tôi là Niko từ Axrisi. Hợp nhất có trách nhiệm.
Nguồn
- Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
- Fairwind Programblog.google
- DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
- Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
- Muse Spark 1.3 pricingdeveloper.meta.com
- Introducing Muse Spark 1.3research.meta.ai
- Hang on to Your Firefoxwww.newsonaut.com
- Mistral: opting out of traininghelp.mistral.ai
- HN: Gemini 3.8 Flashnews.ycombinator.com
- HN: Muse Spark 1.3news.ycombinator.com
- HN: 215,128 "best software" pagesnews.ycombinator.com



