+− THE DAILY DIFFdev & AI news
SHIP IT

AI Hardware Lokalerako Gida (2026)

AI agente lokaletarako eta pisu irekiko LLMetarako makina bat eraikitzean, garatzaileek joko-ordenagailuen zehaztapenak erosteko akatsa egiten dute: 5.8 GHz-ko CPUak, hozte likido pertsonalizatuak eta 8GB VRAM bakarrik dituzten joko-GPU azkarrak.

AI agente lokaletarako eta pisu irekiko LLMetarako makina bat eraikitzean, garatzaileek joko-ordenagailuen zehaztapenak erosteko akatsa egiten dute: 5.8 GHz-ko CPUak, hozte likido pertsonalizatuak eta 8GB VRAM bakarrik dituzten joko-GPU azkarrak. Baina token sorkuntza autoregresiboa memoria-banda zabaleraren menpe dago, ez konputazioaren menpe: token bakarra igortzeko, ereduaren pisu bakoitzak memoria-busetik igaro behar du. Zure pisuak edo KV cache testuingurua VRAM fisikoa gainditzen dutenean, exekuzio-denborak geruzak sistema DDR5era deskargatzen ditu PCIe bidez, eta 20 aldiz memoria-banda zabaleraren amildegi bat jotzen duzu: abiadura segundoko 40 tokenetik 1.5era jaisten da. Eremu-proba honetan, Nikok hardwarearen mekanika, 4 biteko kuantifikazio-ereduen tamaina-arauak, benetako hiru aurrekontu-maila (1.200 $ eta 5.000 $ artean), zergatik den erabilitako RTX 3090 24GB VRAM/dolar tratu onena konputazioan, Raspberry Pi ertzeko tranpa eta etxe-gimnasioaren estrategia inferentzia lokalaren eta hodeiko inferentziaren artean azaltzen ditu. Epaia: SHIP IT.

Irakurri idatzizko edizioa (ingelesez) ↗

Bideo honek zer jorratzen duen

  • 20 aldiz memoria-banda zabaleraren amildegia: 936 GB/s GDDR6X vs 50 GB/s DDR5 eta 31.5 GB/s PCIe
  • Ereduaren tamaina @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • 1. maila (1.200 $–1.500 $): RTX 4060 Ti 16GB (inoiz ez 8GB) edo Mac Mini 16GB
  • 2. maila (1.500 $–2.000 $): Erabilitako RTX 3090 24GB puntu gozoa edo Mac Mini M4 Pro 64GB
  • 3. maila (3.500 $+): RTX 4090 24GB / 3090 bikoitza edo Mac Studio Ultra

Itzulitako transkripzioa

Jatorrizko ingelesezko narraziotik itzulia. Eskuragarri dauden audioa eta azpitituluak YouTube-k kontrolatzen ditu.

0:00 PC bat eraikitzen ari bazara AI agente lokalak exekutatzeko, utzi joko-ekipo bat eraikitzeari. Ez duzu bost puntu zortzi gigahertz-eko Core i9 bat, hozte likido-zirkuitu bat, edo RGBz estalitako zortzi gigabyte-ko txartel grafiko bat behar. AI inferentzia lokalean, joko-zehaztapenak ia ez dira erabilgarriak. Zure agenteak funtzionatzen edo arrastaka dabilen diktatzen duen metrika bakarra VRAM gaitasuna da eta memoria-busaren banda-zabalera. Hardware-probaren arauak: ahaztu CPU erlojuak eta rasterizazio-benchmarkak.

0:24 Hiru zenbaki interesatzen zaizkigu: memoria-busaren zabalera, banda-zabalera gigabyteetan segundoko, eta VRAM-eko tarte gordina KV cachearen puztuarentzat. Eremu-proba honetan, hogeita hamar aldiz memoria-banda zabaleraren amildegia aztertuko dut, ereduen tamaina-arauak mapatuko ditut, hamabi ehunetik bost mila dolarrera bitarteko hiru maila erreal neurtuko ditut, eta azalduko dut zergatik den oraindik erabilitako 3090 bat konputazioaren iruzur-kode handiena. Hau The Daily Diff da, eremu-proba. Zergatik huts egiten duten joko-ekipoek ulertzeko, ikus dezagun nola gauzatzen den token-sorkuntza. Jokoetan, zure CPUak marrazketa-deiak elikatzen ditu eta zure GPUak fotogramak errendatzen ditu.

0:54 Baina LLM deskodeketa autoregresiboa ia memoria-banda zabaleraren menpe dago erabat. Token bakarra sortzeko, GPUak ereduaren pisu-parametro guztiak memoriatik bere konputazio-nukleoetara igorri behar ditu. Zure eredua hamar gigabytekoa bada, token bat ekoizteak hamar gigabyteko datu irakurtzea esan nahi du. Nvidia RTX 3090 batean, 384 biteko memoria-bus batekin, segundoko 936 gigabyteko GDDR6X banda-zabalera lortzen duzu, segundoko laurogei token ekoiztuz. Baina ikus ezazu zer gertatzen den zure ereduak VRAM fisikoa gainditzen duen milisegundoan.

1:22 VRAM betetzen denean, exekuzio-denborak gainerako geruzak PCIe busetik sistemako DDR5 memoriara deskargatzen ditu. Zure GPU nukleoek segundoko mila gigabyte espero dituzte. Horren ordez, kanal bikoitzeko DDR5ak berrogeita hamar elikatzen ditu, eta PCIe 4ak hogeita hamabian itotzen da. Hori hogei aldiz banda-zabalera kolapso bat da. Token-sorkuntza-hodia berehala gelditzen da busaren zain, eta abiadura segundoko berrogei tokenetik puntu batera eta erdira jaisten da. Bi mila dolarreko ekipo bat espazio-berogailu bihurtu duzu.

1:47 Eta okerrago jartzen da txanda anitzeko agente-exekuzioetan, pisuak erdia bakarrik direlako borrokaren. Eskabide, tresna-dei eta fitxategi zati guztiak Gako-Balio cachean gordetzen dira. Hogeita hamabi k-ko testuinguru-leiho batek lau eta zortzi gigabyteko VRAMa kontsumitu ditzake pisuen gainetik. Zure txartelak hamasei gigabyte bakarrik baditu, zure agenteak bi aldiz ibiltzen da, testuinguruaren hormarekin topo egiten du, eta memoria falta dela eta huts egiten du edo DDR5era isurtzen da. Hemen duzue lau biteko tamainaren iruzur-orria. Llama 3.1 edo DeepSeek Distill bezalako zazpi edo zortzi mila milioi parametroko eredu batek

2:16 bost gigabyte inguru hartzen ditu. Hamalau mila milioi eredu batek hamar gigabyte hartzen ditu. Hogeita hamabi mila milioi eredu batek, kodeketa-agenteentzako adimen-puntu gozoa, hogei gigabyte eskatzen ditu. Eta hirurogeita hamar mila milioi mugako eredu batek berrogei gigabyte eskatzen ditu zuk testuingurua esleitu aurretik. Honek benetako hardware-eraikuntzetara garamatza. 1. maila abiarazteko ekipoa da, mila berrehun eta mila bostehun dolar artean. PCan, zure aingura RTX 4060 Ti 16-gigabyte da.

2:39 Abisu kritikoa: inoiz ez erosi zortzi gigabyteko bertsioa hirurogeita hamar dolar aurrezteko. Zortzi gigabyte VRAM 2026an memoria falta dela eta heriotza-epaia da benetako edozein agente-fluxutan. Konbinatu sei nukleoko Ryzen 5 batekin, hirurogeita lau gigabyte DDR5ekin, eta bi terabyteko NVMe unitate batekin. Apple lurraldean, baliokidea Mac Mini edo MacBook Pro bat da hamasei gigabyteko memoria unifikatuarekin.

3:02 Segundoko berrogei eta berrogeita hamar token ikusiko dituzu zortzi mila milioi eredutan. 2. maila erabiltzaile boteretsuen puntu gozoa da: zehazki eraikitzea hogeita hamabi mila milioi parametroko ereduak exekutatzeko, Qwen 2.5 32B bezalakoak. A bidea RTX 4070 Ti Super berri bat da, hamasei gigabyte zortzi ehun dolarretan. Baina B bidea nire gomendio sendoa da: erosi erabilitako Nvidia RTX 3090 hogeita lau gigabyte. 3090 garbiak aurki ditzakezu eBayn seiehun eta berrogeita hamar eta zazpiehun eta berrogeita hamar dolarretan. Horrek hogeita lau gigabyte VRAM ematen dizkizu 384 biteko bus masibo batean, segundoko

3:33 936 gigabyte bultzatuz. Dolarra dolarraren truke, konputazioan VRAM tratamendu onena da. macOSen, 2. mailako baliokidea Mac Mini M4 Pro bat da hirurogeita lau gigabyteko memoria unifikatuarekin. Segundoko hamaika eta hamabi token ekoizten ditu hogeita hamabi mila milioi eredu batean: Nvidia baino motelagoa, baina guztiz isila hogeita hamar wattetan, testuinguru-leiho erraldoi baterako lekuarekin. 3. maila zaleen atala da agente anitzen taldeentzat. PCan, horrek esan nahi du RTX 4090 bat hogeita lau gigabytekin,

3:57 Ryzen 9 bat, eta ehun eta hogeita zortzi gigabyte RAM, edo RTX 3090 bikoitzak, guztira berrogeita zortzi gigabyte VRAM eskainiz. Appleren lerroan, hau Mac Studio Ultra bat da laurogeita hamasei eta ehun eta hogeita zortzi gigabyteko memoria unifikatuarekin. Superpotentzia memoria-egoera da: kapsulatze-eredu bat, bideratzaile azkar bat, eta 32 mila milioi kodeketa-eredu bat aldi berean kargatuta eduki ditzakezu zero trukaketa-atzerapenarekin. Orain gure eremu-probaren huts egite zintzoari buruz: ertzeko konputazio-tranpa.

4:24 Astero, sare sozialetan post batek dio autonomo kodeketa-agenteak exekutatu ditzakezula laurogei dolarreko Raspberry Pi 5 batean. Probatu nuen. Mila eta bostehun milioi parametroko eredu txiki bat exekutatzeak segundoko hiru token bakarrik ematen dizkizu, plaka laurogeita bost gradu Celsius-ean ito egiten den bitartean. Asteburuko jostailu polita da, baina eguneroko garapen-gidari gisa, zuzeneko zigorra da. Softwarerako, erabili Ollama, Cursor, Cline edo VS Coder-era zuzenean konektatzen den komando-lerroko deamon garbi bat nahi baduzu.

4:47 zuzenean konektatzen den komando-lerroko deamon garbi bat nahi baduzu. Eredu-deskargak eta GPU geruza-lerragarriekin jolasteko gune grafiko bat nahi baduzu, erabili LM Studio. Eta lotu zure formatua zure silizioarekin. Apple Silicon-en, beti deskargatu Metalentzat optimizatutako GGUF ereduak. Windows edo Linux-en Nvidiarekin, deskargatu AWQ edo EXL2 ereduak, Nvidia Tensor Cores erabiltzen dituztenak %20-%30 azkarrago inferentzia egiteko. Beraz, nola hedatzen duzu hau dirurik gabe geratu gabe?

5:11 Pentsa hardware lokala etxe-gimnasio bat dela, gimnasio komertzial baten ordez. Etxean squat-rack bat izateak esan nahi du egunero entrenatzen duzula joan-etorririk gabe, harpidetza-kuotarik gabe, eta pribatutasun osoz. Zure makina lokalak zure eguneroko kodeketaren %80a kudeatzen du, unitate-probak eta dokumentu pribatuen prozesamendua token bakoitzeko zero dolarretan. Eta bostehun libra altxatu behar dituzunean — adibidez, berrogeita hamar fitxategi zeharkatzen dituen biltegi osoko arkitektura-birformulazio masibo bat —, gimnasio komertzialera joaten zara: ordaindu hodeiko APIari Claude 3.5 Sonnet edo OpenAI o3rako hamabost minutuz

5:38 eta aurrera egin. Hona hemen faktura: 2. mailako eraikuntza bat erabilitako 3090 batekin mila seiehun dolar kostatzen da guztira. Hilabetean berrogeita hamar eta ehun dolar artean gastatzen badituzu API tokenetan, hemeretzi hilabetetan amortizatzen da, zure kode-base jabeduna hirugarrenen zerbitzarietatik kanpo mantenduz. Gaurko eremu-probaren epaia: SHIP IT. VRAM eta memoria-banda zabalerak erloju-abiadurak garaitzen dituzte beti. Utzi bost gigahertz-eko CPUak erosteari AIrako, eta bilatu erabilitako 3090 bat.

6:04 Esan iezadazue zer hardware-eraikuntza darabilzuen modelo lokaletarako iruzkinetan. Eta azterketa hau irakurtzea nahiago baduzu, har ezazu buletina the daily diff dot deven, beheko esteka. Eta hori da gaurko ezberdintasuna. Niko naiz, Axrisikoa. Batu arduraz.

Iturriak

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Lotutako bideoak