Lokalni vodnik po strojni opremi za umetno inteligenco (2026)
Pri gradnji stroja za lokalne agente umetne inteligence in LLM-je z odprto težo razvijalci delajo napako in kupujejo specifikacije igralnih računalnikov: CPE-je s 5,8 GHz, prilagojene zanke za tekočinsko hlajenje in hitre igralne GPE-je z le 8 GB VRAM-a.
Pri gradnji stroja za lokalne agente umetne inteligence in LLM-je z odprto težo razvijalci delajo napako in kupujejo specifikacije igralnih računalnikov: CPE-je s 5,8 GHz, prilagojene zanke za tekočinsko hlajenje in hitre igralne GPE-je z le 8 GB VRAM-a. Toda avtoregresivno generiranje žetonov je omejeno s pasovno širino pomnilnika, ne z izračunom: za oddajanje enega žetona mora vsaka teža v modelu pretakati preko pomnilniškega vodila. Ko vaše uteži ali kontekst predpomnilnika KV presežejo fizični VRAM, izvajalno okolje prenese sloje v sistemski DDR5 prek PCIe, in naletite na 20-kratno omejitev pasovne širine pomnilnika: hitrost pade s 40 žetonov na sekundo na 1,5. V tem terenskem testu Niko razčleni strojno mehaniko, pravila določanja velikosti modela 4-bitne kvantizacije, tri realne proračunske razrede od 1.200 do 5.000 USD, zakaj je rabljena RTX 3090 24GB najboljša ponudba VRAM-a na dolar v računalništvu, past Raspberry Pi edge in strategijo domače telovadnice za lokalno v primerjavi z oblakom. Verdikt: SHIP IT.
Preberi pisno izdajo (angleščina) ↗
Kaj zajema ta videoposnetek
- 20-kratna omejitev pasovne širine pomnilnika: 936 GB/s GDDR6X proti 50 GB/s DDR5 in 31,5 GB/s PCIe
- Velikost modela @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Razred 1 (1.200–1.500 USD): RTX 4060 Ti 16GB (nikoli 8GB) ali Mac Mini 16GB
- Razred 2 (1.500–2.000 USD): Rabljena RTX 3090 24GB optimalna točka ali Mac Mini M4 Pro 64GB
- Razred 3 (3.500+ USD): RTX 4090 24GB / dvojna 3090 ali Mac Studio Ultra
Preveden prepis
Prevedeno iz izvirnega angleškega pripovedovanja. Razpoložljivi zvok in podnapisi so nadzorovani s strani YouTuba.
0:00 Če nameravate sestaviti računalnik za poganjanje lokalnih agentov umetne inteligence, nehajte sestavljati igralno napravo. Ne potrebujete Core i9 s pet točk osem gigahercev, zanke za tekočinsko hlajenje, ali osemgigabajtne grafične kartice, prekrite z RGB-jem. Pri lokalnem sklepanju umetne inteligence so igralne specifikacije praktično neuporabne. Edina metrika, ki določa, ali bo vaš agent deloval ali se bo plazil, je kapaciteta VRAM-a in pasovna širina pomnilniškega vodila. Pravila strojnega testa: pozabite na takte CPE-ja in meritve rastriranja.
0:24 Zanimajo nas tri številke: širina pomnilniškega vodila, pasovna širina v gigabajtih na sekundo in surova zaloga VRAM-a za napihovanje predpomnilnika KV. V tem terenskem testu bom razčlenil dvajset-kratno omejitev pasovne širine pomnilnika, preslikal pravila določanja velikosti modela, preizkusil tri resnične razrede od dvanajstih stotin dolarjev do petih tisočakov in razložil, zakaj je rabljena 3090 še vedno največja goljufiva koda v računalništvu. To je The Daily Diff, terenski test. Da bi razumeli, zakaj igralne naprave ne delujejo, si oglejte, kako se dejansko izvaja generiranje žetonov. V igrah vaš CPE napaja klicaje risanja, GPE pa upodablja sličice.
0:54 Toda avtoregresivno dekodiranje LLM je skoraj izključno omejeno s pasovno širino pomnilnika. Za generiranje enega žetona mora GPE pretakati vsak parameter teže modela iz pomnilnika skozi svoja računska jedra. Če je vaš model velik deset gigabajtov, produkcija enega žetona pomeni branje desetih gigabajtov podatkov. Na Nvidii RTX 3090 s 384-bitnim pomnilniškim vodilom, dobite 936 gigabajtov na sekundo pasovne širine GDDR6X, proizvajate osemdeset žetonov na sekundo. Toda poglejte, kaj se zgodi v trenutku, ko vaš model preseže fizični VRAM.
1:22 Ko se VRAM napolni, izvajalna okolja preostale sloje prenesejo prek vodila PCIe v sistemski pomnilnik DDR5. Vaša jedra GPE pričakujejo tisoč gigabajtov na sekundo. Namesto tega jih dvokanalni DDR5 napaja s petdesetimi, PCIe 4 pa se zamaši pri enaintridesetih. To je dvajset-kratni kolaps pasovne širine. Cevovod za generiranje žetonov se takoj ustavi, čakajoč na vodilo, in hitrost pade s štiridesetih žetonov na sekundo na eno točko pet. Dvotisočdolarsko napravo ste spremenili v grelec.
1:47 In še slabše je med večkratnimi zagoni agenta, saj so uteži le polovica bitke. Vsak poziv, klic orodja in del datoteke se shrani v predpomnilnik Key-Value. 32K kontekstno okno lahko porabi štiri do osem gigabajtov VRAM-a poleg uteži. Če ima vaša kartica le šestnajst gigabajtov, se vaš agent zanke dvakrat, zadene kontekstno steno in se bodisi sesuje z napako pomanjkanja pomnilnika bodisi se razlije v DDR5. Tukaj je priročnik za 4-bitno določanje velikosti. Model s sedmimi ali osmimi milijardami parametrov, kot sta Llama 3.1 ali DeepSeek Distill,
2:16 zavzame približno pet gigabajtov. Model s štirinajstimi milijardami zavzame deset gigabajtov. Model z dvaintridesetimi milijardami, optimalna točka inteligence za kodirne agente, zahteva dvajset gigabajtov. In mejni model s sedemdesetimi milijardami zahteva štirideset gigabajtov, preden sploh dodeli kontekst. Kar nas pripelje do dejanskih strojnih gradenj. Razred 1 je začetni komplet, dvanajst sto do petnajst sto dolarjev. Na osebnem računalniku je vaše sidro RTX 4060 Ti 16-gigabajtna.
2:39 Kritično opozorilo: nikoli ne kupujte osemgigabajtne različice, da prihranite sedemdeset dolarjev. Osem gigabajtov VRAM-a leta 2026 je takojšnja smrtna obsodba zaradi pomanjkanja pomnilnika pri katerem koli resničnem delovnem toku agenta. Seznanite ga s šestjedrnim Ryzenom 5, štiriinšestdesetimi gigabajti DDR5, in dvoterabajtnim NVMe diskom. V deželi Apple je enakovreden Mac Mini ali MacBook Pro s šestnajstimi gigabajti enotnega pomnilnika.
3:02 Na modelih z osmimi milijardami boste videli štirideset do petdeset žetonov na sekundo. Razred 2 je optimalna točka za napredne uporabnike: gradnja posebej za poganjanje modelov z dvaintridesetimi milijardami parametrov, kot je Qwen 2.5 32B. Pot A je nova RTX 4070 Ti Super s šestnajstimi gigabajti za osem sto dolarjev. Toda pot B je moje močno priporočilo: kupite rabljeno Nvidia RTX 3090 štiriindvajset gigabajtov. Čiste 3090 lahko najdete na eBayu za šest sto petdeset do sedem sto petdeset dolarjev. To vam daje štiriindvajset gigabajtov VRAM-a na masivnem 384-bitnem vodilu, ki potiska
3:33 936 gigabajtov na sekundo. Dolar za dolar, to je najboljša ponudba VRAM-a v računalništvu. Na macOS-u je ustreznik razreda 2 Mac Mini M4 Pro s štiriinšestdesetimi gigabajti enotnega pomnilnika. Proizvede enajst do dvanajst žetonov na sekundo na modelu z dvaintridesetimi milijardami: počasnejši kot Nvidia, a popolnoma tih pri tridesetih vatih z dovolj prostora za ogromno kontekstno okno. Razred 3 je navdušenski razred za roje več agentov. Na osebnem računalniku to pomeni RTX 4090 s štiriindvajsetimi gigabajti,
3:57 Ryzen 9 in sto osemindvajset gigabajtov RAM-a, ali dvojni RTX 3090, ki zagotavljata osemintrideset gigabajtov skupnega VRAM-a. V Applovi ponudbi je to Mac Studio Ultra s šestindevetdeset do sto in dvaindvajsetimi gigabajti enotnega pomnilnika. Super moč je stalnost pomnilnika: lahko obdržite model vdelave, hiter usmerjevalnik in 32-milijardni kodirni model naložene hkrati z ničelno zakasnitvijo zamenjave. Sedaj pa k iskrenemu neuspehu našega terenskega testa: past roba računalništva.
4:24 Vsak teden objava na družabnih omrežjih trdi, da lahko poganjate avtonomne kodirne agente na osemdesetdolarškem Raspberry Pi 5. Preizkusil sem ga. Poganjanje majhnega modela z eno točko pet milijard parametrov vam omogoča komaj tri žetone na sekundo, medtem ko se plošča zmanjšuje pri petinosemdesetih stopinjah Celzija. Je lepa vikend igrača, toda kot dnevni gonilnik razvoja, je čisto mučenje. Za programsko opremo uporabite Ollama, če želite čist demonski program ukazne vrstice, ki se povezuje
4:47 naravnost z Cursorjem, Clineom ali VS Codeom. Če želite grafično igrišče s prenosi modelov in drsniki slojev GPE, uporabite LM Studio. In uskladite format s svojim silicijem. Na Apple Siliconu vedno prenesite modele GGUF, optimizirane za Metal. Na sistemu Windows ali Linux z Nvidia prenesite modele AWQ ali EXL2, ki uporabljajo jedra Nvidia Tensor za dvajset do trideset odstotkov hitrejše sklepanje. Kako torej to razmestiti, ne da bi bankrotirali?
5:11 Pomislite na lokalno strojno opremo kot na domačo telovadnico v primerjavi s komercialno telovadnico. Imeti stojalo za počep doma pomeni, da trenirate vsak dan z ničelnimi potnimi stroški, ničelnimi naročninami in popolno zasebnostjo. Vaš lokalni stroj obdeluje osemdeset odstotkov vašega dnevnega kodiranja, testiranja enot in obdelave zasebnih dokumentov za nič dolarjev na žeton. In ko morate dvigniti petsto funtov — kot masivna refaktorizacija arhitekture celotnega repozitorija v petdesetih datotekah — obiščete komercialno telovadnico: plačajte API oblaku za Claude 3.5 Sonnet ali OpenAI o3 za petnajst minut
5:38 in nadaljujte. Tukaj je račun: gradnja razreda 2 z rabljeno 3090 stane šestnajst sto dolarjev vse skupaj. Če porabite petdeset do sto dolarjev na mesec za API žetone, se povrne v osemnajstih mesecih, medtem ko vaša lastniška koda ostaja zunaj strežnikov tretjih oseb. Današnja sodba terenskega testa: SHIP IT. VRAM in pasovna širina pomnilnika vedno premagata hitrosti takta. Ne kupujte več petgigaherčnih CPE-jev za umetno inteligenco in poiščite rabljeno 3090.
6:04 Povejte mi, kakšno strojno opremo uporabljate za lokalne modele v komentarjih. In če bi raje prebrali to razčlenitev, si priskrbite novice na daily diff dot dev, povezava spodaj. In to je razlika za danes. Jaz sem Niko iz Axrisi. Združujte odgovorno.
Viri
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



