# ધ લોકલ AI હાર્ડવેર ગાઈડ (2026)

Published: 2026-09-14

લોકલ AI એજન્ટ્સ અને ઓપન-વેઈટ LLM માટે મશીન બનાવતી વખતે, ડેવલપર્સ ગેમિંગ PC સ્પેશિફિકેશન ખરીદવાની ભૂલ કરે છે: 5.8 GHz CPUs, કસ્ટમ લિક્વિડ કૂલિંગ લૂપ્સ, અને માત્ર 8GB VRAM સાથેના ફાસ્ટ ગેમિંગ GPUs. પરંતુ ઓટોરીગ્રેસિવ ટોકન જનરેશન મેમરી-બેન્ડવિડ્થ બાઉન્ડ છે, કમ્પ્યુટ બાઉન્ડ નથી: એક જ ટોકન ઉત્સર્જિત કરવા માટે, મોડેલમાં દરેક વજન મેમરી બસ પર સ્ટ્રીમ કરવું આવશ્યક છે. જ્યારે તમારા વજન અથવા KV કેશ સંદર્ભ ભૌતિક VRAM કરતાં વધી જાય છે, ત્યારે રનટાઇમ PCIe પર સિસ્ટમ DDR5 પર લેયર્સને ઓફલોડ કરે છે, અને તમે 20x મેમરી બેન્ડવિડ્થ ક્લિફ પર પહોંચો છો: ઝડપ 40 ટોકન્સ પ્રતિ સેકન્ડથી ઘટીને 1.5 થઈ જાય છે. આ ફિલ્ડ ટેસ્ટમાં, નિકો હાર્ડવેર મિકેનિક્સ, 4-બિટ ક્વોન્ટાઇઝેશન મોડેલ સાઈઝિંગ નિયમો, $1,200 થી $5,000 સુધીના ત્રણ વાસ્તવિક બજેટ ટાયર, શા માટે વપરાયેલ RTX 3090 24GB કમ્પ્યુટિંગમાં શ્રેષ્ઠ VRAM-પ્રતિ-ડોલરનો સોદો છે, Raspberry Pi એજ ટ્રેપ, અને લોકલ વર્સિસ ક્લાઉડ ઇન્ફરન્સ માટે હોમ જિમ વ્યૂહરચના સમજાવે છે. ચુકાદો: SHIP IT.

Canonical: https://thedailydiff.dev/gu/video/2026-09-14-local-ai-hardware/

## આ વીડિયોમાં શું આવરી લેવામાં આવ્યું છે

- 20x મેમરી બેન્ડવિડ્થ ક્લિફ: 936 GB/s GDDR6X vs 50 GB/s DDR5 અને 31.5 GB/s PCIe
- મોડેલ સાઈઝિંગ @ 4-બિટ: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- ટાયર 1 ($1,200–$1,500): RTX 4060 Ti 16GB (ક્યારેય 8GB નહીં) અથવા Mac Mini 16GB
- ટાયર 2 ($1,500–$2,000): વપરાયેલ RTX 3090 24GB સ્વીટ સ્પોટ અથવા Mac Mini M4 Pro 64GB
- ટાયર 3 ($3,500+): RTX 4090 24GB / ડ્યુઅલ 3090s અથવા Mac Studio Ultra

## અનુવાદિત ટ્રાન્સક્રિપ્ટ

મૂળ અંગ્રેજી કથામાંથી અનુવાદિત. ઉપલબ્ધ ઑડિઓ અને કૅપ્શન્સ YouTube દ્વારા નિયંત્રિત થાય છે.

0:00 જો તમે લોકલ AI એજન્ટ્સ ચલાવવા માટે PC બનાવવાનું વિચારી રહ્યા છો, તો ગેમિંગ રીગ બનાવવાનું બંધ કરો. તમને પાંચ-પોઈન્ટ-આઠ ગીગાહર્ટ્ઝ કોર i9, લિક્વિડ કૂલિંગ લૂપની જરૂર નથી, અથવા RGB થી ઢંકાયેલ આઠ-ગીગાબાઈટ ગ્રાફિક્સ કાર્ડની. લોકલ AI ઇન્ફરન્સમાં, ગેમિંગ સ્પેક્સ વર્ચ્યુઅલી નકામા છે. એકમાત્ર મેટ્રિક જે નક્કી કરે છે કે તમારો એજન્ટ ચાલે છે કે ક્રોલ કરે છે તે VRAM ક્ષમતા છે અને મેમરી બસ બેન્ડવિડ્થ. હાર્ડવેર ટેસ્ટના નિયમો: CPU ક્લોક્સ અને રાસ્ટરાઇઝેશન બેન્ચમાર્ક્સ ભૂલી જાઓ.

0:24 અમને ત્રણ સંખ્યાઓની ચિંતા છે: મેમરી બસની પહોળાઈ, પ્રતિ ગીગાબાઈટ્સમાં બેન્ડવિડ્થ સેકન્ડ, અને KV કેશ બ્લોટ માટે કાચી VRAM હેડરૂમ. આ ફિલ્ડ ટેસ્ટમાં, હું વીસ-x મેમરી બેન્ડવિડ્થ ક્લિફને સમજાવીશ, મોડેલ સાઈઝિંગ નિયમોને મેપ કરીશ, બારસોથી પાંચ હજાર ડોલર સુધીના ત્રણ વાસ્તવિક ટાયરને બેન્ચમાર્ક કરીશ, અને સમજાવીશ કે શા માટે વપરાયેલ 3090 હજી પણ કમ્પ્યુટિંગનો શ્રેષ્ઠ ચીટ કોડ છે. આ The Daily Diff, ફિલ્ડ ટેસ્ટ છે. આ The Daily Diff, ફિલ્ડ ટેસ્ટ છે. શા માટે ગેમિંગ રીગ્સ નિષ્ફળ જાય છે તે સમજવા માટે, ટોકન જનરેશન ખરેખર કેવી રીતે કાર્ય કરે છે તે જુઓ. ગેમ્સમાં, તમારું CPU ડ્રો કોલ્સ ફીડ કરે છે અને તમારું GPU ફ્રેમ્સ રેન્ડર કરે છે.

0:54 પરંતુ ઓટોરીગ્રેસિવ LLM ડીકોડિંગ લગભગ સંપૂર્ણપણે મેમરી બેન્ડવિડ્થ બાઉન્ડ છે. એક જ ટોકન જનરેટ કરવા માટે, GPU એ મોડેલના દરેક વજન પેરામીટરને મેમરીમાંથી તેના કમ્પ્યુટ કોર દ્વારા સ્ટ્રીમ કરવું આવશ્યક છે. મોડેલના દરેક વજન પેરામીટરને મેમરીમાંથી તેના કમ્પ્યુટ કોર દ્વારા સ્ટ્રીમ કરવું આવશ્યક છે. જો તમારું મોડેલ દસ ગીગાબાઈટ્સનું છે, તો એક ટોકન ઉત્પન્ન કરવાનો અર્થ દસ ગીગાબાઈટ્સ ડેટા વાંચવાનો છે. 384-બિટ મેમરી બસ સાથે Nvidia RTX 3090 પર, તમને 936 ગીગાબાઈટ્સ પ્રતિ સેકન્ડની GDDR6X બેન્ડવિડ્થ મળે છે, જે પ્રતિ સેકન્ડ એંસી ટોકન ઉત્પન્ન કરે છે. પરંતુ તમારી મોડેલ ભૌતિક VRAM કરતા વધી જાય તે જ ક્ષણે શું થાય છે તે જુઓ.

1:22 જ્યારે VRAM ભરાઈ જાય છે, ત્યારે રનટાઇમ બાકીના સ્તરોને PCIe બસ દ્વારા સિસ્ટમ DDR5 મેમરીમાં ઓફલોડ કરે છે. સિસ્ટમ DDR5 મેમરીમાં ઓફલોડ કરે છે. તમારા GPU કોરો પ્રતિ સેકન્ડ એક હજાર ગીગાબાઈટ્સની અપેક્ષા રાખે છે. તેના બદલે, ડ્યુઅલ-ચેનલ DDR5 તેમને પચાસ ફીડ કરે છે, અને PCIe 4 એકત્રીસ પર ચોક થઈ જાય છે. તે વીસ-x બેન્ડવિડ્થ પતન છે. ટોકન જનરેશન પાઇપલાઇન તરત જ બસની રાહ જોવામાં અટકી જાય છે, અને ઝડપ પ્રતિ સેકન્ડ ચાલીસ ટોકનથી ઘટીને એક પોઈન્ટ પાંચ થઈ જાય છે. તમે બે હજાર ડોલરના રીગને સ્પેસ હીટરમાં ફેરવી દીધું છે.

1:47 અને મલ્ટી-ટર્ન એજન્ટ રન દરમિયાન તે વધુ ખરાબ થાય છે, કારણ કે વજન અડધી લડાઈ છે. દરેક પ્રોમ્પ્ટ, ટૂલ કૉલ અને ફાઇલ ચંક કી-વેલ્યુ કેશમાં સંગ્રહિત થાય છે. બત્રીસ-k સંદર્ભ વિન્ડો વજન ઉપરાંત ચાર થી આઠ ગીગાબાઈટ્સ VRAM નો ઉપયોગ કરી શકે છે. VRAM નો ઉપયોગ કરી શકે છે. જો તમારા કાર્ડમાં માત્ર સોળ ગીગાબાઈટ્સ હોય, તો તમારો એજન્ટ બે વાર લૂપ કરે છે, સંદર્ભ દીવાલ સાથે ટકરાય છે, અને કાં તો આઉટ-ઓફ-મેમરી ભૂલ સાથે ક્રેશ થાય છે અથવા DDR5 માં ફેંકાઈ જાય છે. અહીં ચાર-બિટ સાઈઝિંગ ચીટ શીટ છે. લામા 3.1 અથવા DeepSeek Distill જેવા સાત કે આઠ-અબજ પેરામીટર મોડેલને

2:16 લગભગ પાંચ ગીગાબાઈટ્સ લાગે છે. ચૌદ-અબજ મોડેલને દસ ગીગાબાઈટ્સ લાગે છે. બત્રીસ-અબજ મોડેલ, કોડિંગ એજન્ટ્સ માટે ઇન્ટેલિજન્સ સ્વીટ સ્પોટ, વીસ ગીગાબાઈટ્સની જરૂર છે. અને સિત્તેર-અબજ ફ્રન્ટિયર મોડેલને સંદર્ભ ફાળવતા પહેલા ચાલીસ ગીગાબાઈટ્સની જરૂર પડે છે. જે આપણને વાસ્તવિક હાર્ડવેર બિલ્ડ્સ તરફ લાવે છે. ટાયર 1 એ સ્ટાર્ટર રીગ છે, બારસો થી પંદરસો ડોલર. PC પર, તમારું એન્કર RTX 4060 Ti 16-ગીગાબાઈટ છે.

2:39 ગંભીર ચેતવણી: સિત્તેર ડોલર બચાવવા માટે ક્યારેય આઠ-ગીગાબાઈટ વર્ઝન ખરીદશો નહીં. 2026 માં આઠ ગીગાબાઈટ્સ VRAM એ કોઈપણ વાસ્તવિક એજન્ટ વર્કફ્લો પર તાત્કાલિક આઉટ-ઓફ-મેમરી મૃત્યુદંડ છે. કોઈપણ વાસ્તવિક એજન્ટ વર્કફ્લો પર તાત્કાલિક આઉટ-ઓફ-મેમરી મૃત્યુદંડ છે. તેને છ-કોર Ryzen 5, ચોસઠ ગીગાબાઈટ્સ DDR5, અને બે-ટેરાબાઈટ NVMe ડ્રાઇવ સાથે જોડો. Apple માં, સમકક્ષ મેક મિની અથવા મેકબુક પ્રો છે જેમાં સોળ ગીગાબાઈટ્સ યુનિફાઈડ મેમરી છે.

3:02 તમે આઠ-અબજ મોડેલો પર પ્રતિ સેકન્ડ ચાલીસ થી પચાસ ટોકન જોશો. ટાયર 2 પાવર યુઝર સ્વીટ સ્પોટ છે: ખાસ કરીને Qwen 2.5 32B જેવા બત્રીસ-અબજ પેરામીટર મોડેલો ચલાવવા માટે બનાવવું. પાથ A એ નવો RTX 4070 Ti સુપર છે જેમાં આઠસો ડોલરમાં સોળ ગીગાબાઈટ્સ છે. પરંતુ પાથ B એ મારી મજબૂત ભલામણ છે: વપરાયેલ Nvidia RTX 3090 ચોવીસ ગીગાબાઈટ ખરીદો. તમે eBay પર છસો પચાસ થી સાતસો પચાસ ડોલરમાં સ્વચ્છ 3090s શોધી શકો છો. થી સાતસો પચાસ ડોલરમાં સ્વચ્છ 3090s શોધી શકો છો. તે તમને 384-બિટની વિશાળ બસ પર 936 ગીગાબાઈટ્સ પ્રતિ સેકન્ડ ધકેલતી ચોવીસ ગીગાબાઈટ્સ VRAM આપે છે.

3:33 936 ગીગાબાઈટ્સ પ્રતિ સેકન્ડ ધકેલતી ચોવીસ ગીગાબાઈટ્સ VRAM આપે છે. ડોલર પ્રતિ ડોલર, તે કમ્પ્યુટિંગમાં શ્રેષ્ઠ VRAM સોદો છે. macOS પર, ટાયર 2 સમકક્ષ મેક મિની M4 પ્રો છે જેમાં ચોસઠ ગીગાબાઈટ્સ યુનિફાઈડ મેમરી છે. તે બત્રીસ-અબજ મોડેલ પર પ્રતિ સેકન્ડ અગિયાર થી બાર ટોકન ઉત્પન્ન કરે છે: Nvidia કરતાં ધીમું, પરંતુ ત્રીસ વોટ પર સાવ શાંત છે અને વિશાળ સંદર્ભ વિન્ડો માટે જગ્યા છે. Nvidia કરતાં ધીમું, પરંતુ ત્રીસ વોટ પર સાવ શાંત છે અને વિશાળ સંદર્ભ વિન્ડો માટે જગ્યા છે. ટાયર 3 એ મલ્ટી-એજન્ટ સ્વર્મ્સ માટે ઉત્સાહી કૌંસ છે. PC પર, તેનો અર્થ ચોવીસ ગીગાબાઈટ્સ સાથે RTX 4090,

3:57 Ryzen 9, અને એકસો અઠ્ઠાવીસ ગીગાબાઈટ્સ RAM, અથવા ડ્યુઅલ RTX 3090s કુલ અઠ્ઠાવીસ ગીગાબાઈટ્સ VRAM પૂરી પાડે છે. Apple ના લાઇનઅપમાં, આ મેક સ્ટુડિયો અલ્ટ્રા છે જેમાં છન્નેર થી એકસો અઠ્ઠાવીસ ગીગાબાઈટ્સ યુનિફાઈડ મેમરી છે. સુપરપાવર મેમરી રેસિડેન્સી છે: તમે એમ્બેડિંગ મોડેલ, એક ફાસ્ટ રાઉટર અને 32-અબજ કોડિંગ મોડેલને શૂન્ય સ્વેપ વિલંબ સાથે એકસાથે લોડ કરી શકો છો. શૂન્ય સ્વેપ વિલંબ સાથે એકસાથે લોડ કરી શકો છો. હવે આપણા ફિલ્ડ ટેસ્ટની પ્રમાણિક નિષ્ફળતા માટે: એજ કમ્પ્યુટિંગ ટ્રેપ.

4:24 દર અઠવાડિયે એક સોશિયલ પોસ્ટ દાવો કરે છે કે તમે એંસી ડોલરના Raspberry Pi 5 પર સ્વાયત્ત કોડિંગ એજન્ટ્સ ચલાવી શકો છો. એંસી ડોલરના Raspberry Pi 5 પર સ્વાયત્ત કોડિંગ એજન્ટ્સ ચલાવી શકો છો. મેં તેનું પરીક્ષણ કર્યું. એક નાનું એક-પોઈન્ટ-પાંચ અબજ પેરામીટર મોડેલ ચલાવવાથી તમને પ્રતિ સેકન્ડ ભાગ્યે જ ત્રણ ટોકન મળે છે જ્યારે બોર્ડ પચાસી ડિગ્રી સેલ્સિયસ પર થ્રોટલ થાય છે. તે એક સરસ વીકએન્ડ રમકડું છે, પરંતુ દૈનિક વિકાસ ડ્રાઇવર તરીકે, તે શુદ્ધ સજા છે. સોફ્ટવેર માટે, જો તમે સ્વચ્છ કમાન્ડ-લાઇન ડેમન ઇચ્છતા હો જે સીધા Cursor, Cline, અથવા VS Code સાથે જોડાય,

4:47 તો Ollama નો ઉપયોગ કરો. જો તમે મોડેલ ડાઉનલોડ્સ અને GPU લેયર સ્લાઇડર્સ સાથે ગ્રાફિકલ પ્લેગ્રાઉન્ડ ઇચ્છતા હો, તો LM Studio નો ઉપયોગ કરો. અને તમારા ફોર્મેટને તમારા સિલિકોન સાથે મેચ કરો. Apple સિલિકોન પર, હંમેશા Metal માટે ઓપ્ટિમાઈઝ્ડ GGUF મોડેલો ડાઉનલોડ કરો. Nvidia સાથે Windows અથવા Linux પર, AWQ અથવા EXL2 મોડેલો ડાઉનલોડ કરો, જે વીસ થી ત્રીસ ટકા ઝડપી ઇન્ફરન્સ માટે Nvidia ટેન્સર કોર્સનો ઉપયોગ કરે છે. તો તમે આને નાદાર થયા વિના કેવી રીતે ડિપ્લોય કરશો?

5:11 લોકલ હાર્ડવેરને હોમ જિમ વિરુદ્ધ કોમર્શિયલ જિમ તરીકે વિચારો. ઘરે સ્ક્વોટ રેક રાખવાનો અર્થ છે કે તમે શૂન્ય મુસાફરી, શૂન્ય સબ્સ્ક્રિપ્શન ફી અને સંપૂર્ણ ગોપનીયતા સાથે દરરોજ તાલીમ લો છો. શૂન્ય સબ્સ્ક્રિપ્શન ફી, અને સંપૂર્ણ ગોપનીયતા. તમારું લોકલ મશીન તમારા દૈનિક કોડિંગના એંસી ટકાને હેન્ડલ કરે છે, યુનિટ ટેસ્ટિંગ, અને પ્રતિ ટોકન શૂન્ય ડોલરમાં ખાનગી દસ્તાવેજ પ્રક્રિયા. અને જ્યારે તમારે પાંચસો પાઉન્ડ ડેડલિફ્ટ કરવાની જરૂર હોય — જેમ કે પચાસ ફાઇલોમાં મોટા રીપો-વાઇડ આર્કિટેક્ચરલ રિફેક્ટર — તમે કોમર્શિયલ જિમની મુલાકાત લો: ક્લાઉડ API ને ક્લાઉડ 3.5 સોનેટ અથવા OpenAI o3 માટે પંદર મિનિટ માટે ચૂકવણી કરો ક્લાઉડ 3.5 સોનેટ અથવા OpenAI o3 માટે પંદર મિનિટ માટે ચૂકવણી કરો

5:38 અને આગળ વધો. અહીં બિલ છે: વપરાયેલ 3090 સાથે ટાયર 2 બિલ્ડની કુલ કિંમત સોળસો ડોલર છે. જો તમે API ટોકન પર દર મહિને પચાસ થી સો ડોલર ખર્ચ કરો છો, તો તે અઢાર મહિનામાં પોતાનો ખર્ચ કાઢી નાખે છે જ્યારે તમારા માલિકીનો કોડબેઝ તૃતીય-પક્ષ સર્વર્સથી દૂર રાખે છે. આજની ફિલ્ડ ટેસ્ટનો ચુકાદો: SHIP IT. VRAM અને મેમરી બેન્ડવિડ્થ દર વખતે ક્લોક સ્પીડને હરાવે છે. AI માટે પાંચ-ગીગાહર્ટ્ઝ CPUs ખરીદવાનું બંધ કરો, અને વપરાયેલ 3090 શોધો.

6:04 તમે લોકલ મોડેલો માટે કયું હાર્ડવેર બિલ્ડ ચલાવી રહ્યા છો તે મને ટિપ્પણીઓમાં કહો. અને જો તમે આ વિશ્લેષણ વાંચવા માંગતા હો, તો daily diff dot dev પર ન્યૂઝલેટર મેળવો, લિંક નીચે છે. અને તે આજનો ડિફ છે. હું એક્સરીસીથી નિકો છું. જવાબદારીપૂર્વક મર્જ કરો.

## સ્ત્રોતો

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
