स्थानीय एआई हार्डवेयर गाइड (२०२६)
स्थानीय एआई एजेन्टहरू र खुला-वजन LLM हरूका लागि मेसिन निर्माण गर्दा, विकासकर्ताहरूले गेमिङ पीसी स्पेक्स किन्न गल्ती गर्छन्: ५.८ GHz CPU हरू, कस्टम तरल शीतलन लुपहरू, र मात्र ८GB VRAM भएका तीव्र गेमिङ GPU हरू।
स्थानीय एआई एजेन्टहरू र खुला-वजन LLM हरूका लागि मेसिन निर्माण गर्दा, विकासकर्ताहरूले गेमिङ पीसी स्पेक्स किन्न गल्ती गर्छन्: ५.८ GHz CPU हरू, कस्टम तरल शीतलन लुपहरू, र मात्र ८GB VRAM भएका तीव्र गेमिङ GPU हरू। तर अटोरिग्रेसिभ टोकन जेनेरेसन मेमोरी-ब्यान्डविथ-बाउन्ड हुन्छ, गणना-बाउन्ड होइन: एउटै टोकन उत्सर्जन गर्नका लागि, मोडेलका हरेक वेट मेमोरी बसमा प्रवाहित हुनुपर्छ। जब तपाईंको वेट वा KV क्यास सन्दर्भ भौतिक VRAM भन्दा बढी हुन्छ, रनटाइमले तहहरू PCIe मार्फत प्रणाली DDR5 मा अफलोड गर्छ, र तपाईंले २०x मेमोरी ब्यान्डविथ क्लिफमा पुग्नुहुन्छ: गति प्रति सेकेन्ड ४० टोकनबाट १.५ मा झर्छ। यस फिल्ड परीक्षणमा, निकोले हार्डवेयर मेकानिक्स, ४-बिट क्वान्टाइजेसन मोडेल साइजिंग नियमहरू, $१,२०० देखि $५,००० सम्मका तीन वास्तविक बजेट स्तरहरू, किन प्रयोग गरिएको RTX 3090 24GB कम्प्युटिङमा प्रति डलर VRAM को लागि सबैभन्दा राम्रो डिल हो, Raspberry Pi एज ट्र्याप, र स्थानीय बनाम क्लाउड अनुमानका लागि होम जिम रणनीति बारे बताएका छन्। फैसला: SHIP IT।
लिखित संस्करण पढ्नुहोस् (अंग्रेजी) ↗
यो भिडियोले के समेट्छ
- २०x मेमोरी ब्यान्डविथ क्लिफ: ९३६ GB/s GDDR6X बनाम ५० GB/s DDR5 र ३१.५ GB/s PCIe
- मोडेल साइजिंग @ ४-बिट: ८B (५GB), १४B (१०GB), ३२B (२०GB), ७०B (४०GB)
- स्तर १ ($१,२००–$१,५००): RTX 4060 Ti 16GB (कहिल्यै ८GB होइन) वा Mac Mini 16GB
- स्तर २ ($१,५००–$२,०००): प्रयोग गरिएको RTX 3090 24GB उत्तम विकल्प वा Mac Mini M4 Pro 64GB
- स्तर ३ ($३,५००+): RTX 4090 24GB / दोहोरो 3090s वा Mac Studio Ultra
अनुवादित ट्रान्सक्रिप्ट
मूल अंग्रेजी कथाबाट अनुवादित। उपलब्ध अडियो र क्याप्सनहरू YouTube द्वारा नियन्त्रित हुन्छन्।
0:00 यदि तपाईं स्थानीय एआई एजेन्टहरू चलाउन पीसी बनाउने योजनामा हुनुहुन्छ भने, गेमिङ रिग बनाउन बन्द गर्नुहोस्। तपाईंलाई ५.८ गिगाहर्ज कोर आई९, लिक्विड कूलिङ लुपको आवश्यकता पर्दैन, वा RGB ले ढाकिएको आठ-गिगाबाइट ग्राफिक्स कार्डको। स्थानीय एआई अनुमानमा, गेमिङ स्पेक्स लगभग बेकार हुन्छन्। तपाईंको एजेन्ट चल्छ वा घस्रन्छ भन्ने निर्धारण गर्ने एक मात्र मेट्रिक VRAM क्षमता हो र मेमोरी बस ब्यान्डविथ। हार्डवेयर परीक्षणका नियमहरू: CPU घडीहरू र रास्टराइजेसन बेन्चमार्कहरू बिर्सनुहोस्।
0:24 हामी तीन संख्याहरूमा ध्यान दिन्छौं: मेमोरी बस चौडाई, प्रति गिगाबाइटमा ब्यान्डविथ सेकेन्ड, र KV क्यास ब्लोटका लागि कच्चा VRAM हेडरुम। यस फिल्ड परीक्षणमा, म २०x मेमोरी ब्यान्डविथ क्लिफलाई विस्तृत रूपमा व्याख्या गर्नेछु, मोडेल साइजिंग नियमहरू म्याप गर्नेछु, बाह्र सय डलर देखि पाँच हजारसम्मका तीन वास्तविक स्तरहरू बेन्चमार्क गर्नेछु, र प्रयोग गरिएको ३०९० किन कम्प्युटिङको सबैभन्दा ठूलो चीट कोड हो भनेर व्याख्या गर्नेछु। यो The Daily Diff, फिल्ड परीक्षण हो। गेमिङ रिगहरू किन असफल हुन्छन् भनेर बुझ्नका लागि, टोकन उत्पादन कसरी वास्तवमा कार्यान्वयन हुन्छ हेर्नुहोस्। खेलहरूमा, तपाईंको CPU ले ड्र कलहरू फिड गर्छ र तपाईंको GPU ले फ्रेमहरू रेन्डर गर्छ।
0:54 तर अटोरिग्रेसिभ LLM डिकोडिङ लगभग पूर्ण रूपमा मेमोरी ब्यान्डविथ बाउन्ड हुन्छ। एउटै टोकन उत्पन्न गर्नका लागि, GPU ले मोडेलको हरेक वेट प्यारामिटरलाई मेमोरीबाट यसको कम्प्युट कोरहरू मार्फत प्रवाहित गर्नुपर्छ। यदि तपाईंको मोडेल दश गिगाबाइटको छ भने, एउटा टोकन उत्पादन गर्नुको अर्थ दश गिगाबाइट डेटा पढ्नु हो। ३८४-बिट मेमोरी बस भएको Nvidia RTX ३०९० मा, तपाईंले प्रति सेकेन्ड ९३६ गिगाबाइट GDDR6X ब्यान्डविथ पाउनुहुन्छ, प्रति सेकेन्ड अस्सी टोकनहरू उत्पादन गर्दै। तर तपाईंको मोडेल भौतिक VRAM भन्दा बढी हुने बित्तिकै के हुन्छ हेर्नुहोस्।
1:22 जब VRAM भरिन्छ, रनटाइमहरूले बाँकी तहहरू PCIe बस मार्फत प्रणाली DDR5 मेमोरीमा अफलोड गर्छन्। तपाईंको GPU कोरहरूले प्रति सेकेन्ड एक हजार गिगाबाइटको अपेक्षा गर्छन्। यसको सट्टा, डुअल-च्यानल DDR5 ले तिनीहरूलाई पचास दिन्छ, र PCIe 4 ले एकतीसमा अड्कन्छ। त्यो २०x ब्यान्डविथको गिरावट हो। टोकन उत्पादन पाइपलाइन बसमा पर्खँदै तुरुन्तै रोकिन्छ, र गति प्रति सेकेन्ड चालीस टोकनबाट १.५ मा झर्छ। तपाईंले दुई हजार डलरको रिगलाई स्पेस हीटरमा परिणत गर्नुभयो।
1:47 र यो बहु-टर्न एजेन्ट रनहरूको समयमा अझ खराब हुन्छ, किनभने वेटहरू आधा मात्र हुन् लडाई। प्रत्येक प्रम्प्ट, उपकरण कल, र फाइल चंक कुञ्जी-मान क्यासमा भण्डारण हुन्छ। बत्तीस-के सन्दर्भ विन्डोले वेटहरू बाहेक चार देखि आठ गिगाबाइट VRAM खपत गर्न सक्छ। यदि तपाईंको कार्डमा मात्र सोह्र गिगाबाइट छ भने, तपाईंको एजेन्ट दुई पटक लुप हुन्छ, सन्दर्भ भित्तामा ठोकिन्छ, र या त आउट-अफ-मेमोरी त्रुटिको साथ क्र्यास हुन्छ वा DDR5 मा फैलन्छ। यहाँ चार-बिट साइजिंग चीट शीट छ। Llama 3.1 वा DeepSeek Distill जस्ता सात वा आठ-बिलियन प्यारामिटर मोडेलले
2:16 लगभग पाँच गिगाबाइट लिन्छ। चौध-बिलियन मोडेलले दश गिगाबाइट लिन्छ। कोडिङ एजेन्टहरूका लागि बुद्धिमत्ताको उत्कृष्ट स्थान, बत्तीस-बिलियन मोडेललाई, बीस गिगाबाइट चाहिन्छ। र एक सत्तरी-बिलियन फ्रन्टियर मोडेलले तपाईंले सन्दर्भ विनियोजन गर्नु अघि नै चालीस गिगाबाइट माग गर्छ। जसले हामीलाई वास्तविक हार्डवेयर निर्माणहरूमा ल्याउँछ। स्तर १ स्टार्टर रिग हो, बाह्र सय देखि पन्ध्र सय डलर। पीसीमा, तपाईंको एंकर RTX 4060 Ti 16-गिगाबाइट हो।
2:39 गम्भीर चेतावनी: कहिल्यै सत्तरी डलर बचाउनका लागि आठ-गिगाबाइट संस्करण नकिन्नुहोस्। २०२६ मा आठ गिगाबाइट VRAM कुनै पनि वास्तविक एजेन्ट कार्यप्रवाहमा तत्काल आउट-अफ-मेमोरी मृत्युदण्ड हो। यसलाई छ-कोर Ryzen 5, चौसठ्ठी गिगाबाइट DDR5, र दुई-टेराबाइट NVMe ड्राइभसँग जोड्नुहोस्। एप्पलको क्षेत्रमा, यसको बराबर सोह्र गिगाबाइट एकीकृत मेमोरी भएको Mac Mini वा MacBook Pro हो। गिगाबाइट एकीकृत मेमोरी।
3:02 तपाईंले आठ-बिलियन मोडेलहरूमा प्रति सेकेन्ड चालीस देखि पचास टोकनहरू देख्नुहुनेछ। स्तर २ पावर प्रयोगकर्ताको उत्कृष्ट स्थान हो: विशेष गरी Qwen 2.5 32B जस्ता बत्तीस-बिलियन प्यारामिटर मोडेलहरू चलाउनका लागि निर्माण गर्दै। मार्ग A आठ सय डलरमा सोह्र गिगाबाइटको नयाँ RTX 4070 Ti Super हो। तर मार्ग B मेरो बलियो सिफारिस हो: प्रयोग गरिएको Nvidia RTX 3090 चौबिस गिगाबाइट किन्नुहोस्। तपाईंले eBay मा सफा ३०९० हरू छ सय पचास देखि सात सय पचास डलरमा पाउन सक्नुहुन्छ। यसले तपाईंलाई विशाल ३८४-बिट बसमा चौबिस गिगाबाइट VRAM दिन्छ
3:33 प्रति सेकेन्ड ९३६ गिगाबाइट धकेल्दै। प्रति डलर, यो कम्प्युटिङमा सबैभन्दा राम्रो VRAM डिल हो। macOS मा, स्तर २ को समकक्ष चौसठ्ठी गिगाबाइट एकीकृत मेमोरी भएको Mac Mini M4 Pro हो। यसले बत्तीस-बिलियन मोडेलमा प्रति सेकेन्ड एघार देखि बाह्र टोकनहरू उत्पादन गर्छ: Nvidia भन्दा ढिलो, तर तीस वाटमा एकदम शान्त र विशाल सन्दर्भ विन्डोको लागि ठाउँ सहित। स्तर ३ बहु-एजेन्ट झुण्डहरूका लागि उत्साही कोष्ठक हो। पीसीमा, यसको अर्थ चौबिस गिगाबाइटको RTX 4090,
3:57 एक Ryzen 9, र एक सय अठाईस गिगाबाइट RAM, वा कुल अठ्चालिस गिगाबाइट VRAM प्रदान गर्ने डुअल RTX 3090s। एप्पलको लाइनअपमा, यो ९६ देखि एक सय अठाईस गिगाबाइट एकीकृत मेमोरी भएको Mac Studio Ultra हो। सुपरपावर मेमोरी रेसिडेन्सी हो: तपाईंले एम्बेडिङ मोडेल, एक तीव्र राउटर, र ३२-बिलियन कोडिङ मोडेललाई एकै साथ शून्य स्व्याप ढिलाइ बिना लोड गर्न सक्नुहुन्छ। शून्य स्व्याप ढिलाइ। अब हाम्रो फिल्ड परीक्षणको इमानदार असफलताका लागि: एज कम्प्युटिङ ट्र्याप।
4:24 हरेक हप्ता एउटा सामाजिक पोस्टले तपाईंले असी डलरको Raspberry Pi 5 मा स्वायत्त कोडिङ एजेन्टहरू चलाउन सक्नुहुन्छ भन्ने दाबी गर्छ। मैले यसलाई परीक्षण गरें। एउटा सानो १.५ बिलियन प्यारामिटर मोडेल चलाउँदा तपाईंलाई मुश्किलले प्रति सेकेन्ड तीन टोकनहरू दिन्छ जबकि बोर्ड पचसी डिग्री सेल्सियसमा थ्रोटल हुन्छ। यो एउटा राम्रो सप्ताहन्तको खेलौना हो, तर दैनिक विकास चालकको रूपमा, यो शुद्ध सजाय हो। सफ्टवेयरको लागि, यदि तपाईं Cursor, Cline, वा VS Code मा सिधै जडान हुने
4:47 सफा कमान्ड-लाइन डेमन चाहनुहुन्छ भने Ollama प्रयोग गर्नुहोस्। यदि तपाईं मोडेल डाउनलोडहरू र GPU लेयर स्लाइडरहरूको साथ ग्राफिकल प्लेग्राउन्ड चाहनुहुन्छ भने, LM Studio प्रयोग गर्नुहोस्। र आफ्नो ढाँचालाई आफ्नो सिलिकनमा मिलाउनुहोस्। एप्पल सिलिकनमा, सधैं Metal को लागि अनुकूलित GGUF मोडेलहरू डाउनलोड गर्नुहोस्। Nvidia सहित Windows वा Linux मा, AWQ वा EXL2 मोडेलहरू डाउनलोड गर्नुहोस्, जसले २० देखि ३० प्रतिशत तीव्र अनुमानका लागि Nvidia Tensor Cores प्रयोग गर्दछ। त्यसोभए तपाईं यसलाई कसरी बैंक नदिनाई तैनाथ गर्नुहुन्छ?
5:11 स्थानीय हार्डवेयरलाई घरको जिम बनाम व्यावसायिक जिम जस्तै सोच्नुहोस्। घरमा स्क्वाट र्याक हुनुको अर्थ तपाईंले हरेक दिन शून्य यात्रा, शून्य सदस्यता शुल्क, र पूर्ण गोपनीयताका साथ तालिम लिनुहुन्छ। तपाईंको स्थानीय मेसिनले तपाईंको दैनिक कोडिङको अस्सी प्रतिशत, इकाई परीक्षण, र प्रति टोकन शून्य डलरमा निजी कागजात प्रशोधन ह्यान्डल गर्छ। र जब तपाईंलाई पाँच सय पाउन्ड डेडलिफ्ट गर्न आवश्यक हुन्छ — जस्तै विशाल रेपो-व्यापी पचास फाइलहरूमा वास्तुकलाको पुनर्संरचना — तपाईं व्यावसायिक जिममा जानुहुन्छ: क्लाउड API लाई Claude 3.5 Sonnet वा OpenAI o3 को लागि पन्ध्र मिनेटको लागि तिर्नुहोस्
5:38 र अगाडि बढ्नुहोस्। यहाँ बिल छ: प्रयोग गरिएको ३०९० सहितको स्तर २ निर्माणको कुल १६०० डलर लाग्छ। यदि तपाईंले API टोकनहरूमा प्रति महिना पचास देखि सय डलर खर्च गर्नुहुन्छ भने, यसले अठार महिनामा आफैंले पैसा फिर्ता गर्छ जबकि तपाईंको स्वामित्वको कोडबेसलाई तेस्रो-पक्ष सर्भरहरूबाट टाढा राख्छ। आजको फिल्ड परीक्षणको फैसला: SHIP IT। VRAM र मेमोरी ब्यान्डविथले हरेक पटक घडीको गतिलाई जित्छ। एआईका लागि पाँच-गिगाहर्ज CPU हरू किन्न बन्द गर्नुहोस्, र प्रयोग गरिएको ३०९० खोज्नुहोस्।
6:04 स्थानीय मोडेलहरूका लागि तपाईंले कुन हार्डवेयर निर्माण चलाइरहनुभएको छ टिप्पणीहरूमा मलाई बताउनुहोस्। र यदि तपाईं यो ब्रेकडाउन पढ्न चाहनुहुन्छ भने, The Daily Diff डट देवमा न्यूजलेटर लिनुहोस्, लिङ्क तल छ। र आजको लागि यति नै डिफ। म Axrisi बाट निको हुँ। जिम्मेवारीपूर्वक मर्ज गर्नुहोस्।
स्रोतहरू
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



