+− THE DAILY DIFFdev & AI news
SHIP IT

गुगलले भर्खरै ह्याकिङ मोडेल पठायो। यहाँ भिन्नता छ।

गुगलले Gemini 3.8 Flash (भित्र $0.75 / बाहिर $3.75, जनवरी 1 मा मूल्य दोब्बर हुन्छ) र Gemini 3.8 Flash Cyber — एक जोखिम-खोजी गर्ने मोडेल जुन यसले 650 "विश्वसनीय रक्षकहरू" लाई मात्र बेच्दछ — पठायो र चार घण्टा पछि मेटाले Muse Spark 1.3 लाई प्रति मिलियन $0.10 को "योगदानकर्ता" टियरको साथ पठायो जहाँ छुट तपाईको सत्र ट्रान्सक्रिप्ट हो।

गुगलले Gemini 3.8 Flash (भित्र $0.75 / बाहिर $3.75, जनवरी 1 मा मूल्य दोब्बर हुन्छ) र Gemini 3.8 Flash Cyber — एक जोखिम-खोजी गर्ने मोडेल जुन यसले 650 "विश्वसनीय रक्षकहरू" लाई मात्र बेच्दछ — पठायो र चार घण्टा पछि मेटाले Muse Spark 1.3 लाई प्रति मिलियन $0.10 को "योगदानकर्ता" टियरको साथ पठायो जहाँ छुट तपाईको सत्र ट्रान्सक्रिप्ट हो। हामी दुबैलाई कुनै पनि कम्पनीले नलेखेको बेन्चमार्क विरुद्ध जाँच गर्छौं। निर्णय: SHIP IT।

यो भिडियोले के समेट्छ

  • गुगलले Gemini 3.8 Flash + Flash Cyber पठाउँछ (86.2% CyberGym, Fairwind Program)
  • मेटाले Muse Spark 1.3 पठाउँछ: $1.25/$4.25, वा $0.10/$0.20 यदि मेटाले यसमा प्रशिक्षण दिन सक्छ भने
  • तीन साइटहरूले 215,128 नक्कली "सर्वश्रेष्ठ सफ्टवेयर" पृष्ठहरू बनाए; Perplexity ले तिनीहरूलाई उद्धृत गर्दछ

अनुवादित ट्रान्सक्रिप्ट

मूल अंग्रेजी कथाबाट अनुवादित। उपलब्ध अडियो र क्याप्सनहरू YouTube द्वारा नियन्त्रित हुन्छन्।

0:00 गुगलले आज छ हप्तामा आफ्नो तेस्रो फ्ल्याश मोडेल पठायो, थप ह्याक गर्न प्रशिक्षित संस्करण, र चार घण्टा पछि मेटाले एउटा मोडेल पठायो जुन यदि तपाइँ जुकरबर्गलाई तपाइँको कोड पढ्न दिनुहुन्छ भने प्रति मिलियन टोकन दस सेन्ट लाग्छ, त्यसैले एआई मूल्य युद्धमा अब साइबरसुरक्षा डिभिजन छ। आज बुधबार हो, र भिन्नता लामो छ। Gemini 3.8 Flash ले ह्याकर न्यूजमा ११ सय अंक प्राप्त गर्यो, Muse Spark 1.3 ले करिब सात सय थप लियो, र बीचमा, एक अनुसन्धान पसलले दुई लाख पन्ध्र हजार प्रकाशन गर्ने तीन वेबसाइटहरू फेला पार्यो

0:28 नक्कली सर्वश्रेष्ठ-सफ्टवेयर पृष्ठहरू विशुद्ध रूपमा Perplexity ले तिनीहरूलाई उद्धृत गर्नको लागि। आज पनि: तपाइँलाई Firefox मा झुण्डिन अनुरोध गर्ने एउटा पोस्टले नौ सय अठ्ठासी अंक प्राप्त गर्यो, र Mistral को प्रशिक्षणबाट बाहिर निस्कने बारे मद्दत पृष्ठले करिब पाँच सय प्राप्त गर्यो, धेरै जसो युरोपेलीहरूले सार्वभौम विकल्प पत्ता लगाएकाले पूर्वनिर्धारित रूपमा तपाइँको प्रम्प्टहरूमा प्रशिक्षण दिन्छ। यस भिडियोमा: Gemini 3.8 Flash को वास्तविक लागत, गुगलले ह्याकिङ मोडेल छ सय पचास साझेदारहरूलाई मात्र बेच्नेछ, मेटाको दस-सेन्ट टियर र यसले के वास्तवमा शुल्क लिन्छ, र कुनै पनि कम्पनीले नलेखेको बेन्चमार्क।

0:59 आज बुधबार, सेप्टेम्बर २ हो, र यो The Daily Diff हो। Gemini 3.8 Flash प्रति मिलियन टोकन भित्र पचहत्तर सेन्ट र बाहिर तीन पचहत्तर सेन्ट हो, तीन हप्ता अघिको 3.7 Flash जस्तै, एक फुटनोटको साथ भनिएको छ कि मूल्य जनवरी १ मा दोब्बर हुन्छ, जुन अतिरिक्त चरणहरूको साथ एक नि: शुल्क परीक्षण हो। स्लाइड-डेक बेन्चमार्कहरूमा, जुन अपराजित छन्, यसले 54.9 प्रतिशत स्कोर गर्छ HLE-Verified मा, X भन्छ कि यसले Terminal-Bench मा Sol र Opus 5 लाई हराउँछ, र Logan Kilpatrick ले DeepSWE मा 73.7 पोस्ट गर्यो, एक मात्र लामो-क्षितिज

1:29 कोडिंग बेन्चमार्क जुन अहिलेसम्म कण्ठ गरिएको छैन, कथित रूपमा। Simon Willison ले यसलाई HTML मा एक राम्रो चीज बनाउन आग्रह गर्यो र तेह्र सेकेन्डमा 1.8 सेन्टमा एक कण सिमुलेशन प्राप्त गर्यो, प्रति सेकेन्ड साठी फ्रेममा चलिरहेको, किनभने साठी पृष्ठमा हार्ड-कोड गरिएको थियो। गुगलको आफ्नै पोस्टले एक वाक्यको साथ लाभहरू बताउँछ जुन म फ्रेम गर्नेछु: 3.8 Flash थप मेहनत गर्छ। यसले अतिरिक्त तर्क चरणहरू कार्यान्वयन गर्छ, उपकरणहरू दोहोरिँदै बोलाउँछ, र, उद्धृत, थप टोकनहरू प्रयोग गर्न सक्छ, जुन मिटर छिटो चल्छ भन्ने कर्पोरेट भाषा हो। स्वतन्त्र DeepSWE बोर्ड दुबै कुरामा सहमत छ: Flash ले चौहत्तर

2:02 प्रतिशत स्कोर गर्छ, Opus 5 सँग प्रति कार्य लागतको पाँच भागमा बराबर, तर त्यहाँ पुग्न यसलाई एक सय छैसट्ठी चरण र एक लाख तेह्र हजार आउटपुट टोकनहरू आवश्यक पर्यो, Sol ले खर्च गरेको भन्दा दोब्बर भन्दा बढी। Artificial Analysis ले एक सय चालीस मिलियन टोकन र एक हजार अठहत्तर डलर यसलाई ग्रेड गर्न मात्रै जलायो। प्रति टोकन सस्तो, प्रति कार्य बढी कुराकानी गर्ने, र पहिलो टोकन बाह्र सेकेन्डको सोच पछि आउँछ। त्यसपछि रोचक आधा।

2:23 Gemini 3.8 Flash Cyber एउटै मोडेल हो जसको सुरक्षा रेलहरू "विश्वसनीय रक्षकहरू" को लागि ढिलो गरिएको छ, र सुन्दर भन्छन् कि यसले CyberGym मा 86.2 प्रतिशत हिट गर्छ, स्वशासित रूपमा जोखिमहरू पत्ता लगाउनको लागि बेन्चमार्क। यसले प्याच पनि गर्छ: CWE-Bench मा 47.2 प्रतिशत बनाम एक अग्रणी फ्रोन्टियर मोडेलको लागि 47.8, क्रोम टोली भन्छ कि यसले धेरै ठूला व्यावसायिक मोडेलहरू भन्दा 2.6 गुणा बढी सही प्याचहरू उत्पादन गर्यो, र गुगलका क्लाउड अनुसन्धानकर्ताहरूले यसलाई दुई घण्टा भित्र एक महत्वपूर्ण जोखिम पत्ता लगाउन प्रयोग गरे, एउटा काम जुन सामान्यतया महिनाहरू लाग्छ, वा एक उत्प्रेरित किशोरी। गुगलले शोषण भन्दा फिक्सिंगलाई प्राथमिकता दिएकोमा जोड दिन्छ,

2:54 जुन مودेलले निश्चित रूपमा प्वालहरूबाट हिड्न सक्छ भन्नको लागि विनम्र तरिका हो, तिनीहरूले मात्र यसलाई नगर्न भनेका थिए। त्यसैले तपाइँ यसलाई प्राप्त गर्न सक्नुहुन्न। पहुँच एक नयाँ Fairwind Program मार्फत हुन्छ: सरकारहरू, महत्वपूर्ण पूर्वाधार, र छ सय पचास प्रमाणित साझेदारहरू अनिवार्य दुई-कारक प्रमाणीकरणको साथ। अब हरेक फ्रन्टियर प्रयोगशालासँग ह्याकिङ मोडेल छ जुन यसले तपाइँलाई बेच्दैन, र यस हप्ता यो एक सस्तो हो। चार घण्टा पछि, मेटाले Muse Spark 1.3 जारी गर्यो, र Zuck ले यसलाई फ्रन्टियर

3:16 प्रदर्शन भन्यो जुन मिटर गर्न पनि धेरै सस्तो छ, जुन सत्य हो, मेन्लो पार्कको आकारको एक तारा चिन्हको साथ। सामान्य अन्त्यबिन्दु भित्र एक डलर पच्चीस र बाहिर चार पच्चीस हो, Gemini भन्दा बढी। योगदानकर्ता अन्त्यबिन्दु भित्र दस सेन्ट, बाहिर बीस सेन्ट हो, क्यास पढ्ने पाँचौं सेन्टमा, बीस गुणा सस्तो सम्म, र मात्र फरक एउटा स्तम्भ हो जुन हाम्रो उत्पादनहरू सुधार गर्न प्रयोग गरिएको भन्छ। त्यसैले छुट तपाइँको सत्र ट्रान्सक्रिप्ट हो,

3:40 र एक पटकको लागि कसैले पनि लाइसेन्स पढ्नु पर्दैन, किनभने मेटाले लाइसेन्सलाई मूल्य सूचीको रूपमा लेखेको छ। शीर्ष टिप्पणी: मेरो टोकनहरू चोर्नु कति लायक छ भन्ने अब पूर्ण रूपमा स्पष्ट छ। दोस्रो टिप्पणीले सोध्छ कि योगदानकर्ता प्रम्प्टहरूमा प्रशिक्षित मोडेलबाट कसैले AWS कुञ्जी कहिले निकाल्छ। मेटाको आफ्नै स्कोरकार्डमा, Spark 1.3 ले DeepSWE मा 75.4 प्राप्त गर्छ, Sol र Opus 5 भन्दा माथि, र मेटा भन्छ कि यसले 1.2 भन्दा बीस प्रतिशत कम उपकरण कलहरू र पच्चीस प्रतिशत कम टोकनहरू प्रयोग गर्छ, गुगलको ठ्याक्कै उल्टो शर्त, त्यसैले आज पृथ्वीमा दुई ठूला विज्ञापन कम्पनीहरू कुरा बढी गर्नु राम्रो हो कि होइन भन्ने कुरामा असहमत छन्।

4:06 यसैबीच Trellner Research ले Perplexity लाई तीन सय अठ्ठासी वर्गमा सर्वश्रेष्ठ सफ्टवेयरको लागि सोध्यो र हरेक उद्धरण पढ्यो: 59.8 प्रतिशत शीर्ष लाख बाहिरका साइटहरूबाट आएको थियो, Wikipedia सात हजार र आधा हजारमा तीन पटक उद्धृत गरिएको थियो, र दुई लाख पन्ध्र हजार उत्पन्न खरीद गाइडहरू भएका तीन बहिनी साइटहरूले तिनीहरूको गृहपृष्ठहरूलाई तथ्य र आधारभूत पृष्ठ नाम दिएका छन्, तपाईंलाई नभई क्रलरलाई सम्बोधन गरिएको। एआई एसईओ युद्ध सुरु भैसकेको छ, र यसको पहिलो हतियार मार्केटिंग बजेटको साथ regex हो।

4:34 आज बुधबारको लागि यो धेरै मूल्य ट्याग हो; यदि तपाइँ यो पढ्न रुचाउनुहुन्छ भने मलाई यो भन्न सुन्नु भन्दा, भिन्नता हरेक बिहान तपाइँको इनबक्समा आउँछ — daily diff.dev मा नि:शुल्क, तलको लिङ्क। त्यसैले, आजको निर्णय: यसलाई पठाउनुहोस्। Gemini 3.8 Flash ले Google ले नलेखेको बोर्डमा Opus 5 लाई बराबर गर्छ, मूल्यको पाँच भागको लागि। केवल टोकन बिल पढ्नुहोस्, र मेटाको स्तम्भ हेडरहरू पढ्नुहोस्। आजको भिन्नता यही हो।

5:00 म Axrisi बाट Niko हुँ। जिम्मेवारीपूर्वक मर्ज गर्नुहोस्। र त्यो Diff हो। म निको हूँ। जिम्मेवारीपूर्वक मर्ज गर्नुहोस्।

स्रोतहरू

  1. Introducing Gemini 3.8 Flash and 3.8 Flash Cyberblog.google
  2. Fairwind Programblog.google
  3. DeepSWE v1.1 leaderboarddeepswe.datacurve.ai
  4. Artificial Analysis: Gemini 3.8 Flashartificialanalysis.ai
  5. Muse Spark 1.3 pricingdeveloper.meta.com
  6. Introducing Muse Spark 1.3research.meta.ai
  7. Hang on to Your Firefoxwww.newsonaut.com
  8. Mistral: opting out of traininghelp.mistral.ai
  9. HN: Gemini 3.8 Flashnews.ycombinator.com
  10. HN: Muse Spark 1.3news.ycombinator.com
  11. HN: 215,128 "best software" pagesnews.ycombinator.com

सम्बन्धित भिडियोहरू

daily · ne · २०२६ अक्टोबर १

जेमिनी ४ आर्गन गुगलको सबैभन्दा राम्रो मोडेल हो। तपाईले यसलाई अझै प्रयोग गर्न सक्नुहुन्न।

गुगलले जेमिनी ४ आर्गन, आफ्नो नयाँ फ्रन्टियर मोडेल घोषणा गर्‍यो, र केवल विश्वसनीय साइबर डिफेन्डरहरूले यसलाई प्रयोग गर्न सक्छन्। यहाँ गुगलको आफ्नै १९-पंक्ति बेन्चमार्क तालिकाले के देखाउँछ, स्वतन्त्र लिड

4:53 ↗
daily · ne · २०२६ सेप्टेम्बर २७

Grok 4.7 को लागत उस्तै, तर बिल दोब्बर

Grok 4.7 को प्रति टोकन लागत Grok 4.6 को जत्तिकै छ, भित्र $2 र बाहिर $6। त्यसोभए किन प्रति कार्यको स्वतन्त्र बिल दोब्बर भयो, र के यो साँच्चै "दोब्बर छिटो" छ? एक हप्ता पछिको फलो-अप। @therealhaas द्वारा

4:56 ↗
daily · ne · २०२६ सेप्टेम्बर २२

अमेजनले मेटाको म्युजलाई आफ्नो स्टोरबाट हटायो। यहाँ भिन्नता छ।

आइतबार रातिदेखि, मेटाको म्युज एजेन्टले amazon.com मा एउटा पपअप पाउँछ: "अनधिकृत AI एजेन्टद्वारा निरन्तर पहुँचले अमेजनको प्रयोगका सर्तहरूको उल्लङ्घन गर्दछ।" अमेजनले अगस्टमा पर्प्लेक्सिटीको धूमकेतु विरुद

5:08 ↗
daily · ne · २०२६ अक्टोबर ३

एप्पलले एआई एजेन्टहरूमा ब्रेक लगायो

एप्पलले म्याकओएस फुल डिस्क एक्सेस नियन्त्रणहरू थप्ने योजना बनाएको छ किनभने स्वायत्त एआई एजेन्टहरूले व्यापक डेटा पहुँचको जोखिम बढाउँछन्। हामी वर्तमान अनुमति, मेटाको विवादित म्युज सन्देशहरूको मामला र ऐत

5:08 ↗