+− THE DAILY DIFFdev & AI news
SHIP IT

स्थानिक एआय हार्डवेअर मार्गदर्शक (2026)

स्थानिक एआय एजंट्स आणि ओपन-वेट एलएलएमसाठी मशीन बनवताना, डेव्हलपर्स गेमिंग पीसीचे स्पेसिफिकेशन्स खरेदी करण्याची चूक करतात: 5.8 GHz CPUs, कस्टम लिक्विड कूलिंग लूप्स आणि फक्त 8GB VRAM असलेले फास्ट गेमिंग GPUs.

स्थानिक एआय एजंट्स आणि ओपन-वेट एलएलएमसाठी मशीन बनवताना, डेव्हलपर्स गेमिंग पीसीचे स्पेसिफिकेशन्स खरेदी करण्याची चूक करतात: 5.8 GHz CPUs, कस्टम लिक्विड कूलिंग लूप्स आणि फक्त 8GB VRAM असलेले फास्ट गेमिंग GPUs. परंतु ऑटोरेग्रेसिव्ह टोकन जनरेशन हे मेमरी-बँडविड्थ-बाउंड असते, कम्प्यूट-बाउंड नाही: एक टोकन उत्सर्जित करण्यासाठी, मॉडेलमधील प्रत्येक वेट मेमरी बसमधून प्रवाहित होणे आवश्यक आहे. जेव्हा तुमचे वेट्स किंवा KV कॅशे संदर्भ भौतिक VRAM पेक्षा जास्त होतात, तेव्हा रनटाइम PCIe द्वारे सिस्टम DDR5 वर लेयर्स ऑफलोड करतो आणि तुम्हाला 20x मेमरी बँडविड्थ क्लिफचा सामना करावा लागतो: वेग 40 टोकन प्रति सेकंदावरून 1.5 पर्यंत घसरतो. या फील्ड टेस्टमध्ये, निको हार्डवेअर मेकॅनिक्स, 4-बिट क्वांटायझेशन मॉडेल साइजिंग नियम, $1,200 ते $5,000 पर्यंतचे तीन वास्तविक बजेट स्तर, वापरलेला RTX 3090 24GB हा कम्प्यूटिंगमधील सर्वोत्तम VRAM-प्रति-डॉलर व्यवहार का आहे, रास्पबेरी पाई एज ट्रॅप आणि स्थानिक विरुद्ध क्लाउड इन्फरन्ससाठी होम जिम रणनीती समजावून सांगतो. निकाल: SHIP IT.

लिखित आवृत्ती वाचा (इंग्रजी) ↗

या व्हिडिओमध्ये काय समाविष्ट आहे

  • 20x मेमरी बँडविड्थ क्लिफ: 936 GB/s GDDR6X विरुद्ध 50 GB/s DDR5 आणि 31.5 GB/s PCIe
  • मॉडेल साइजिंग @ 4-बिट: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • टियर 1 ($1,200–$1,500): RTX 4060 Ti 16GB (कधीही 8GB नाही) किंवा Mac Mini 16GB
  • टियर 2 ($1,500–$2,000): वापरलेला RTX 3090 24GB स्वीट स्पॉट किंवा Mac Mini M4 Pro 64GB
  • टियर 3 ($3,500+): RTX 4090 24GB / ड्युअल 3090s किंवा Mac Studio Ultra

अनुवादित प्रतिलेख

मूळ इंग्रजी निवेदनातून अनुवादित. उपलब्ध ऑडिओ आणि मथळे YouTube द्वारे नियंत्रित आहेत.

0:00 जर तुम्ही स्थानिक एआय एजंट्स चालवण्यासाठी पीसी बनवण्याची योजना करत असाल, गेमिंग रिग बनवणे थांबवा. तुम्हाला 5.8 गिगाहर्ट्झचा कोर आय9, लिक्विड कूलिंग लूपची आवश्यकता नाही, किंवा आरजीबीने भरलेल्या 8-गिगाबाइट ग्राफिक्स कार्डची. स्थानिक एआय इन्फरन्समध्ये, गेमिंग स्पेसिफिकेशन्स अक्षरशः निरुपयोगी आहेत. तुमचा एजंट चालतो की रेंगतो हे ठरवणारे एकमेव मेट्रिक म्हणजे VRAM क्षमता आणि मेमरी बस बँडविड्थ. हार्डवेअर चाचणीचे नियम: सीपीयू क्लॉक्स आणि रॅस्टरायझेशन बेंचमार्क्स विसरा.

0:24 आपल्याला तीन संख्यांची काळजी आहे: मेमरी बसची रुंदी, गिगाबाइट्स प्रति सेकंद बँडविड्थ आणि केव्ही कॅशे ब्लॉटसाठी कच्ची VRAM हेडरुम. या फील्ड टेस्टमध्ये, मी 20x मेमरी बँडविड्थ क्लिफचे विश्लेषण करेन, मॉडेल साइजिंग नियमांची योजना करेन, बाराशे डॉलरपासून ते पाच हजार डॉलरपर्यंतच्या तीन वास्तविक स्तरांचे बेंचमार्क करेन आणि वापरलेला 3090 अजूनही कम्प्यूटिंगचा सर्वात मोठा चीट कोड का आहे हे समजावून सांगेन. ही आहे The Daily Diff, फील्ड टेस्ट. गेमिंग रिग्स का अयशस्वी होतात हे समजून घेण्यासाठी, टोकन जनरेशन प्रत्यक्षात कसे कार्य करते ते पहा. गेम्समध्ये, तुमचा सीपीयू ड्रॉ कॉल्स फीड करतो आणि तुमचा जीपीयू फ्रेम्स रेंडर करतो.

0:54 परंतु ऑटोरेग्रेसिव्ह एलएलएम डीकोडिंग जवळपास पूर्णपणे मेमरी बँडविड्थ बाउंड असते. एक सिंगल टोकन जनरेट करण्यासाठी, जीपीयूने मॉडेलच्या प्रत्येक वेट पॅरामीटरला मेमरीमधून त्याच्या कम्प्यूट कोअरमधून प्रवाहित करणे आवश्यक आहे. जर तुमचे मॉडेल दहा गिगाबाइट्सचे असेल, तर एक टोकन तयार करणे म्हणजे दहा गिगाबाइट्स डेटा वाचणे. 384-बिट मेमरी बस असलेल्या Nvidia RTX 3090 वर, तुम्हाला 936 गिगाबाइट्स प्रति सेकंद GDDR6X बँडविड्थ मिळते, 80 टोकन प्रति सेकंद तयार होतात. पण तुमचे मॉडेल भौतिक VRAM पेक्षा जास्त होताच काय होते ते पहा.

1:22 जेव्हा VRAM भरते, तेव्हा रनटाइम्स उर्वरित लेयर्स PCIe बसवरून सिस्टम DDR5 मेमरीवर ऑफलोड करतात. तुमचे जीपीयू कोअर प्रति सेकंद एक हजार गिगाबाइट्सची अपेक्षा करतात. त्याऐवजी, ड्युअल-चॅनेल DDR5 त्यांना पन्नास फीड करते आणि PCIe 4 एकतीसवर थांबते. ही 20x बँडविड्थची घट आहे. टोकन जनरेशन पाइपलाइन बसची वाट पाहत त्वरित थांबते, आणि वेग 40 टोकन प्रति सेकंदावरून 1.5 पर्यंत घसरतो. तुम्ही दोन हजार डॉलरचा रिग स्पेस हीटरमध्ये बदलला आहे.

1:47 आणि मल्टी-टर्न एजंट रन दरम्यान ते आणखी वाईट होते, कारण वेट्स ही फक्त अर्धी लढाई आहे. प्रत्येक प्रॉम्प्ट, टूल कॉल आणि फाइल चंक की-व्हॅल्यू कॅशेमध्ये संग्रहित केले जाते. 32-के संदर्भ विंडो वेट्सच्या वर चार ते आठ गिगाबाइट्स VRAM वापरू शकते. जर तुमच्या कार्डमध्ये फक्त 16 गिगाबाइट्स असतील, तर तुमचा एजंट दोनदा लूप करतो, संदर्भ भिंतीवर आदळतो, आणि एकतर मेमरी-आउट एररमुळे क्रॅश होतो किंवा DDR5 मध्ये ओव्हरफ्लो होतो. येथे 4-बिट साइजिंग चीट शीट आहे. लामा 3.1 किंवा डीपसीक डिस्टिलसारख्या सात किंवा आठ-अब्ज पॅरामीटर मॉडेलला

2:16 सुमारे पाच गिगाबाइट्स लागतात. चौदा-अब्ज मॉडेलला दहा गिगाबाइट्स लागतात. 32-अब्ज मॉडेल, कोडिंग एजंट्ससाठी इंटेलिजन्स स्वीट स्पॉट, 20 गिगाबाइट्सची आवश्यकता असते. आणि 70-अब्ज फ्रंटियर मॉडेलला तुम्ही संदर्भ वाटप करण्यापूर्वीच 40 गिगाबाइट्सची मागणी असते. यामुळे आपण वास्तविक हार्डवेअर बिल्ड्सकडे येतो. टियर 1 म्हणजे स्टार्टर रिग, बाराशे ते पंधराशे डॉलर्स. पीसीवर, तुमचा अँकर RTX 4060 Ti 16-गिगाबाइट आहे.

2:39 गंभीर चेतावणी: 70 डॉलर वाचवण्यासाठी कधीही आठ-गिगाबाइट आवृत्ती खरेदी करू नका. 2026 मध्ये 8 गिगाबाइट्स VRAM हे कोणत्याही वास्तविक एजंट वर्कफ्लोवर तत्काळ मेमरी-आउट मृत्यूदंडासारखे आहे. त्याला 6-कोअर रायझन 5, 64 गिगाबाइट्स DDR5 सह जुळवा, आणि 2-टेराबाइट एनव्हीएमई ड्राइव्ह. ॲप्पलच्या जगात, याच्या समतुल्य Mac Mini किंवा MacBook Pro 16 गिगाबाइट्स युनिफाइड मेमरीसह आहे.

3:02 तुम्हाला 8-अब्ज मॉडेल्सवर 40 ते 50 टोकन प्रति सेकंद दिसतील. टियर 2 हा पॉवर युझरचा स्वीट स्पॉट आहे: Qwen 2.5 32B सारख्या 32-अब्ज पॅरामीटर मॉडेल्स चालवण्यासाठी विशेषतः तयार केलेला. मार्ग A हा आठशे डॉलर्समध्ये 16 गिगाबाइट्ससह नवीन RTX 4070 Ti सुपर आहे. परंतु मार्ग B ही माझी जोरदार शिफारस आहे: वापरलेला Nvidia RTX 3090 24 गिगाबाइट खरेदी करा. तुम्हाला eBay वर सहाशे पन्नास ते सातशे पन्नास डॉलर्समध्ये स्वच्छ 3090s मिळू शकतात. हे तुम्हाला 384-बिट बसवर 24 गिगाबाइट्स VRAM देते, जे

3:33 936 गिगाबाइट्स प्रति सेकंद पुश करते. डॉलरसाठी डॉलर, कम्प्यूटिंगमधील हा सर्वोत्तम VRAM व्यवहार आहे. macOS वर, टियर 2 चा समतुल्य Mac Mini M4 Pro 64 गिगाबाइट्स युनिफाइड मेमरीसह आहे. हे 32-अब्ज मॉडेलवर 11 ते 12 टोकन प्रति सेकंद तयार करते: Nvidia पेक्षा हळू, परंतु 30 वॅट्सवर पूर्णपणे शांत आणि मोठ्या संदर्भ विंडोसाठी जागा. टियर 3 मल्टी-एजंट स्वार्म्ससाठी उत्साही वर्ग आहे. पीसीवर, याचा अर्थ 24 गिगाबाइट्ससह RTX 4090 आहे,

3:57 रायझन 9, आणि 128 गिगाबाइट्स रॅम, किंवा ड्युअल RTX 3090s एकूण 48 गिगाबाइट्स VRAM प्रदान करतात. ॲप्पलच्या लाइनअपमध्ये, हे Mac Studio Ultra 96 ते 128 गिगाबाइट्स युनिफाइड मेमरीसह आहे. याची सुपरपॉवर म्हणजे मेमरी रेसिडेन्सी: तुम्ही एम्बेडिंग मॉडेल, एक फास्ट राउटर आणि 32-अब्ज कोडिंग मॉडेल एकाच वेळी शून्य स्वॅप विलंबेशिवाय लोड करू शकता. आता आपल्या फील्ड टेस्टच्या प्रामाणिक अपयशाबद्दल: एज कम्प्यूटिंग ट्रॅप.

4:24 प्रत्येक आठवड्यात एक सोशल पोस्ट दावा करते की तुम्ही 80-डॉलरच्या रास्पबेरी पाई 5 वर ऑटोनॉमस कोडिंग एजंट्स चालवू शकता. मी त्याची चाचणी केली. एक लहान 1.5-अब्ज पॅरामीटर मॉडेल चालवल्यास तुम्हाला 85 अंश सेल्सिअसवर बोर्ड थ्रॉटल होत असताना क्वचितच 3 टोकन प्रति सेकंद मिळतात. हे एक छान वीकेंड खेळणे आहे, पण दैनिक विकास चालक म्हणून, तो केवळ दंड आहे. सॉफ्टवेअरसाठी, तुम्हाला कर्सर, क्लाइन किंवा VS कोडला थेट जोडणारा स्वच्छ

4:47 कमांड-लाइन डेमन हवा असल्यास Ollama वापरा. जर तुम्हाला मॉडेल डाउनलोड्स आणि जीपीयू लेयर स्लाइडर्ससह ग्राफिकल प्लेग्राउंड हवा असेल, LM Studio वापरा. आणि तुमचा फॉरमॅट तुमच्या सिलिकॉनशी जुळवा. ॲप्पल सिलिकॉनवर, नेहमी मेटलसाठी ऑप्टिमाइझ केलेले GGUF मॉडेल्स डाउनलोड करा. Nvidia सह विंडोज किंवा लिनक्सवर, AWQ किंवा EXL2 मॉडेल्स डाउनलोड करा, जे 20 ते 30 टक्के जलद इन्फरन्ससाठी Nvidia टेन्सर कोअर वापरतात. तर तुम्ही हे दिवाळखोर न होता कसे उपयोजित कराल?

5:11 स्थानिक हार्डवेअरला होम जिम विरुद्ध व्यावसायिक जिम समजा. घरी स्क्वॅट रॅक असण्याचा अर्थ असा आहे की तुम्ही शून्य प्रवासासह, शून्य सदस्यता शुल्कासह, आणि पूर्ण गोपनीयतेसह दररोज प्रशिक्षण घेता. तुमचे स्थानिक मशीन तुमच्या दैनंदिन कोडिंगच्या 80 टक्के, युनिट टेस्टिंग आणि खाजगी दस्तऐवज प्रक्रिया टोकन प्रति शून्य डॉलर्समध्ये हाताळते. आणि जेव्हा तुम्हाला 500 पौंड डेडलिफ्ट करायची असते — जसे की 50 फाइल्समध्ये मोठे रेपो-व्यापी आर्किटेक्चरल रिफॅक्टर — तेव्हा तुम्ही व्यावसायिक जिममध्ये जाता: क्लाउड एपीआयला Claude 3.5 Sonnet किंवा OpenAI o3 साठी 15 मिनिटांसाठी पैसे द्या

5:38 आणि पुढे जा. येथे बिल आहे: वापरलेल्या 3090 सह टियर 2 बिल्डला एकूण 1600 डॉलर्स खर्च येतो. जर तुम्ही एपीआय टोकन्सवर दरमहा 50 ते 100 डॉलर्स खर्च करत असाल, तर ते 18 महिन्यांत स्वतःच पैसे फेडते आणि तुमचा मालकीचा कोडबेस तृतीय-पक्ष सर्व्हरपासून दूर ठेवते. आजच्या फील्ड टेस्टचा निकाल: SHIP IT. VRAM आणि मेमरी बँडविड्थ प्रत्येक वेळी क्लॉक स्पीड्सना हरवतात. एआयसाठी 5-गिगाहर्ट्झ सीपीयू खरेदी करणे थांबवा आणि वापरलेला 3090 शोधा.

6:04 तुम्ही स्थानिक मॉडेल्ससाठी कोणती हार्डवेअर बिल्ड वापरत आहात ते टिप्पण्यांमध्ये सांगा. आणि जर तुम्हाला हे विश्लेषण वाचायचे असेल, तर daily diff dot dev वर वृत्तपत्र मिळवा, लिंक खाली आहे. आणि आजचा 'द डिफ' एवढाच. मी निको, Axrisi मधून. जबाबदारीने विलीन करा.

स्रोत

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

संबंधित व्हिडिओ

daily · mr · २८ सप्टें, २०२६

NVIDIA ला या व्यक्तीचे एक अब्ज डॉलर्स देणे आहे का?

1993 मध्ये, जेन्सेन हुआंग यांनी एरिक गुलिचसेन यांना NVIDIA च्या तांत्रिक सल्लागार मंडळात आमंत्रित केले आणि त्यांना 25,000 पर्याय दिले, जे अनुदान (grant) नुसार एका वर्षात निहित (vest) झाले. 1996 मध्ये

4:41 ↗
under-the-hood · mr · २१ सप्टें, २०२६

क्लॉडने RSA-896 चा अवयव पाडला. RSA प्रत्यक्षात कसे ब्रेक होते ते येथे आहे

19 सप्टेंबर रोजी, एका अँथ्रॉपिक अभियंत्याने Claude वापरून RSA-896 — एक 270-अंकी आव्हान क्रमांक — चा अवयव पाडला, जे ओपन-सोर्स CADO-NFS चाळणीचे GPU पोर्ट आहे आणि दहा दिवसांत 2,048 निष्क्रिय GPUs वर ~30

3:39 ↗
daily · mr · १० सप्टें, २०२६

शॉपिफायने टेलविंड विकत घेतले, नंतर मूळ प्रणालीवर परत गेले.

शॉपिफायच्या दोन पोस्ट, 25 तासांच्या अंतराने. मंगळवार: टेलविंड लॅब्स शॉपिफायमध्ये सामील झाले — फ्रेमवर्क MIT राहील, परंतु टेलविंड प्लस आणि ui.sh नवीन ग्राहकांसाठी बंद झाले, ॲडम वाथनने AI मुळे डॉक्स ट्र

5:15 ↗
daily · mr · ४ ऑक्टो, २०२६

AWS खर्च मर्यादा तुमचा प्रकल्प हटवू शकतात

AWS च्या नवीन प्रकल्प खर्च मर्यादेमुळे खर्चाच्या मर्यादेपर्यंत पोहोचल्यावर संसाधने थांबतात आणि सुरुवातीला तुमचा डेटा जतन होतो. त्याच्या मार्गदर्शिकेत असे म्हटले आहे की 90 दिवसांपर्यंत कोणताही क्रियाकल

5:13 ↗