# Vodič za lokalni AI hardver (2026)

Published: 2026-09-14

Pri izradi stroja za lokalne AI agente i LLM-ove otvorenog koda, developeri griješe kupujući specifikacije gaming PC-ja: 5.8 GHz CPU-ove, prilagođene sustave vodenog hlađenja i brze gaming GPU-ove sa samo 8 GB VRAM-a. Ali autoregresivna generacija tokena je ograničena propusnošću memorije, a ne računskom snagom: za emitiranje jednog tokena, svaka težina u modelu mora proći kroz memorijsku sabirnicu. Kada vaše težine ili kontekst KV cachea premaše fizički VRAM, izvršno okruženje prebacuje slojeve u sistemski DDR5 preko PCIe-a, i tada udarate u 20x pad propusnosti memorije: brzina pada sa 40 tokena u sekundi na 1.5. U ovom terenskom testu, Niko razlaže hardversku mehaniku, pravila određivanja veličine modela kvantizacijom na 4 bita, tri stvarna proračunska razreda od 1.200 do 5.000 dolara, zašto je korištena RTX 3090 24GB najbolji omjer VRAM-a po dolaru u računarstvu, zamku Raspberry Pi-ja na rubu mreže i strategiju kućne teretane za lokalno naspram oblačnog zaključivanja. Presuda: SHIP IT.

Canonical: https://thedailydiff.dev/hr/video/2026-09-14-local-ai-hardware/

## Što ovaj video pokriva

- 20x pad propusnosti memorije: 936 GB/s GDDR6X naspram 50 GB/s DDR5 i 31.5 GB/s PCIe
- Veličina modela @ 4 bita: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Razina 1 (1.200–1.500 dolara): RTX 4060 Ti 16GB (nikad 8GB) ili Mac Mini 16GB
- Razina 2 (1.500–2.000 dolara): Korištena RTX 3090 24GB kao 'sweet spot' ili Mac Mini M4 Pro 64GB
- Razina 3 (3.500+ dolara): RTX 4090 24GB / dvostruke 3090-ke ili Mac Studio Ultra

## Prevedeni transkript

Prevedeno iz izvornog engleskog pripovijedanja. Dostupni zvuk i titlovi kontroliraju se putem YouTubea.

0:00 Ako planirate sastaviti računalo za pokretanje lokalnih AI agenata, prestanite sastavljati gaming rig. Ne trebate Core i9 od pet točka osam gigaherca, sustav vodenog hlađenja, ili osam-gigabajtnu grafičku karticu prekrivenu RGB-om. U lokalnom AI zaključivanju, gaming specifikacije su praktički beskorisne. Jedina metrika koja određuje hoće li vaš agent raditi ili puzati je kapacitet VRAM-a i propusnost memorijske sabirnice. Pravila hardverskog testa: zaboravite taktove CPU-a i benchmarke rasterizacije.

0:24 Zanimaju nas tri broja: širina memorijske sabirnice, propusnost u gigabajtima po sekundi i sirova VRAM margina za širenje KV cachea. U ovom terenskom testu, razradit ću dvadesetostruki pad propusnosti memorije, mapirati pravila određivanja veličine modela, usporediti tri stvarna razreda od tisuću dvjesto dolara do pet tisuća, i objasniti zašto je korištena 3090 i dalje najveći cheat code u računarstvu. Ovo je The Daily Diff, terenski test. Da biste razumjeli zašto gaming rigovi ne uspijevaju, pogledajte kako se generiranje tokena zapravo izvršava. U igrama, vaš CPU šalje pozive za crtanje, a vaš GPU renderira okvire.

0:54 Ali autoregresivno LLM dekodiranje je gotovo isključivo ograničeno propusnošću memorije. Za generiranje jednog tokena, GPU mora prenositi svaki parametar težine modela iz memorije kroz svoje računske jezgre. Ako je vaš model deset gigabajta, produciranje jednog tokena znači čitanje deset gigabajta podataka. Na Nvidia RTX 3090 s 384-bitnom memorijskom sabirnicom, dobivate 936 gigabajta u sekundi GDDR6X propusnosti, producirajući osamdeset tokena u sekundi. Ali pogledajte što se događa milisekunde kada vaš model premaši fizički VRAM.

1:22 Kada se VRAM napuni, izvršna okruženja prebacuju preostale slojeve preko PCIe sabirnice na sistemsku DDR5 memoriju. Vaše GPU jezgre očekuju tisuću gigabajta u sekundi. Umjesto toga, dvokanalni DDR5 im daje pedeset, a PCIe 4 se guši na trideset i jednoj. To je dvadesetostruki kolaps propusnosti. Cjevovod za generiranje tokena odmah se zaustavlja čekajući na sabirnici, i brzina pada sa četrdeset tokena u sekundi na jedan točka pet. Pretvorili ste rig od dvije tisuće dolara u grijač prostora.

1:47 I postaje gore tijekom višestrukih pokretanja agenata, jer su težine samo pola bitke. Svaki prompt, poziv alata i dio datoteke pohranjuje se u Key-Value cache. Prozor konteksta od trideset i dvije tisuće može potrošiti četiri do osam gigabajta VRAM-a povrh težina. Ako vaša kartica ima samo šesnaest gigabajta, vaš agent se vrti dvaput, udara u zid konteksta i ili se ruši s greškom nedostatka memorije ili se prelijeva u DDR5. Evo varalice za veličinu od četiri bita. Model sa sedam ili osam milijardi parametara poput Llama 3.1 ili DeepSeek Distill

2:16 zauzima oko pet gigabajta. Model od četrnaest milijardi zauzima deset gigabajta. Model od trideset i dvije milijarde, idealna točka inteligencije za kodirajuće agente, zahtijeva dvadeset gigabajta. I model granice od sedamdeset milijardi zahtijeva četrdeset gigabajta prije nego što uopće dodijelite kontekst. Što nas dovodi do stvarnih hardverskih konfiguracija. Razina 1 je početni rig, dvanaest stotina do petnaest stotina dolara. Na PC-u, vaše sidro je RTX 4060 Ti 16-gigabajtna.

2:39 Kritično upozorenje: nikada nemojte kupiti osam-gigabajtnu verziju da biste uštedjeli sedamdeset dolara. Osam gigabajta VRAM-a u 2026. godini je trenutna smrtna kazna nedostatkom memorije na bilo kojem stvarnom radnom procesu agenta. Uparite ga sa šesterojezgrenim Ryzenom 5, šezdeset četiri gigabajta DDR5, i dva-terabajtnim NVMe diskom. U Appleovom svijetu, ekvivalent je Mac Mini ili MacBook Pro sa šesnaest gigabajta objedinjene memorije.

3:02 Vidjet ćete četrdeset do pedeset tokena u sekundi na modelima od osam milijardi. Razina 2 je idealna točka za napredne korisnike: izrada specifično za pokretanje modela sa trideset i dvije milijarde parametara poput Qwen 2.5 32B. Put A je nova RTX 4070 Ti Super sa šesnaest gigabajta za osam stotina dolara. Ali Put B je moja snažna preporuka: kupite korištenu Nvidia RTX 3090 dvadeset i četiri gigabajta. Čiste 3090-ke možete pronaći na eBayu za šest stotina pedeset do sedam stotina pedeset dolara. To vam daje dvadeset i četiri gigabajta VRAM-a na masivnoj 384-bitnoj sabirnici koja gura

3:33 936 gigabajta u sekundi. Dolar za dolar, to je najbolja VRAM ponuda u računarstvu. Na macOS-u, pandan Razine 2 je Mac Mini M4 Pro sa šezdeset i četiri gigabajta objedinjene memorije. Proizvodi jedanaest do dvanaest tokena u sekundi na modelu od trideset i dvije milijarde: sporije od Nvidije, ali potpuno tiho na trideset vata s prostorom za divovski prozor konteksta. Razina 3 je za entuzijaste za rojeve više agenata. Na PC-u, to znači RTX 4090 sa dvadeset i četiri gigabajta,

3:57 Ryzen 9, i sto dvadeset i osam gigabajta RAM-a, ili dvostruke RTX 3090-ke koje pružaju četrdeset osam gigabajta ukupnog VRAM-a. U Appleovoj ponudi, ovo je Mac Studio Ultra sa devedeset šest do sto dvadeset i osam gigabajta objedinjene memorije. Supermoć je rezidentnost memorije: možete istovremeno držati učitan model za ugradnju, brzi usmjerivač i 32-milijardni kodirajući model s nula kašnjenja zamjene. Sada o iskrenom neuspjehu našeg terenskog testa: zamka rubnog računarstva.

4:24 Svaki tjedan neka objava na društvenim mrežama tvrdi da možete pokretati autonomne kodirajuće agente na Raspberry Pi 5 od osamdeset dolara. Testirao sam. Pokretanje sićušnog modela od jedan točka pet milijardi parametara daje vam jedva tri tokena u sekundi dok se ploča guši na osamdeset pet stupnjeva Celzijusa. To je lijepa igračka za vikend, ali kao svakodnevni razvojni alat, to je čista kazna. Za softver, koristite Ollama ako želite čist daemon naredbenog retka koji se povezuje

4:47 izravno na Cursor, Cline ili VS Code. Ako želite grafičko igralište s preuzimanjima modela i klizačima GPU slojeva, koristite LM Studio. I uskladite svoj format sa svojim silicijem. Na Apple Siliconu, uvijek preuzimajte GGUF modele optimizirane za Metal. Na Windowsu ili Linuxu s Nvidijom, preuzimajte AWQ ili EXL2 modele, koji koriste Nvidia Tensor Cores za dvadeset do trideset posto brže zaključivanje. Kako to implementirati bez bankrota?

5:11 Razmislite o lokalnom hardveru kao o kućnoj teretani naspram komercijalne teretane. Imati stalak za čučnjeve kod kuće znači da trenirate svaki dan bez putovanja, bez pretplate i uz potpunu privatnost. Vaš lokalni stroj obrađuje osamdeset posto vašeg dnevnog kodiranja, jediničnog testiranja i obrade privatnih dokumenata za nula dolara po tokenu. A kada trebate dizati pet stotina funti – poput masivnog arhitektonskog refaktoringa cijelog repozitorija preko pedeset datoteka – posjetite komercijalnu teretanu: platite cloud API za Claude 3.5 Sonnet ili OpenAI o3 na petnaest minuta

5:38 i nastavite dalje. Evo računa: konfiguracija Razine 2 s korištenom 3090 košta šesnaest stotina dolara ukupno. Ako trošite pedeset do sto dolara mjesečno na API tokene, isplati se za osamnaest mjeseci dok vaša vlasnička baza koda ostaje izvan poslužitelja trećih strana. Današnja presuda terenskog testa: SHIP IT. VRAM i propusnost memorije pobjeđuju taktne brzine svaki put. Prestanite kupovati procesore od pet gigaherca za AI, i pronađite korištenu 3090.

6:04 Recite mi koju hardversku konfiguraciju koristite za lokalne modele u komentarima. A ako biste radije pročitali ovu analizu, preuzmite bilten na the daily diff dot dev, poveznica ispod. I to je to za danas. Ja sam Niko iz Axrisija. Spajajte odgovorno.

## Izvori

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
