+− THE DAILY DIFFdev & AI news
SHIP IT

Die Plaaslike KI Hardewaregids (2026)

Wanneer 'n masjien gebou word vir plaaslike KI-agente en oopgewig LLM's, maak ontwikkelaars die fout om speletjie-rekenaarspesifikasies te koop: 5.8 GHz SVE's, pasgemaakte vloeistofverkoelingslusse, en vinnige speletjie-GPU's met slegs 8GB VRAM.

Wanneer 'n masjien gebou word vir plaaslike KI-agente en oopgewig LLM's, maak ontwikkelaars die fout om speletjie-rekenaarspesifikasies te koop: 5.8 GHz SVE's, pasgemaakte vloeistofverkoelingslusse, en vinnige speletjie-GPU's met slegs 8GB VRAM. Maar outoregressiewe token-generasie is geheuebandwydte-gebonde, nie rekenaar-gebonde nie: om 'n enkele token uit te stuur, moet elke gewig in die model oor die geheuebus stroom. Wanneer jou gewigte of KV-kas-konteks fisiese VRAM oorskry, laai die looptyd lae na stelsel DDR5 oor PCIe, en jy bereik 'n 20x geheuebandwydte-afgrond: spoed daal van 40 tokens per sekonde tot 1.5. In hierdie veldtoets ontleed Niko die hardeware-meganika, die 4-bis kwantisasiemodel-groottreëls, drie werklike begrotingvlakke van $1,200 tot $5,000, waarom 'n gebruikte RTX 3090 24GB die beste VRAM-per-dollar-transaksie in rekenaar is, die Raspberry Pi-randlokval, en die tuisgimnasiumstrategie vir plaaslike versus wolk-inferensie. Uitspraak: SHIP IT.

Lees die geskrewe uitgawe (Engels) ↗

Wat hierdie video dek

  • Die 20x geheuebandwydte-afgrond: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
  • Modelgrootte @ 4-bis: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Vlak 1 ($1,200–$1,500): RTX 4060 Ti 16GB (nooit 8GB) of Mac Mini 16GB
  • Vlak 2 ($1,500–$2,000): Gebruikte RTX 3090 24GB ideale plek of Mac Mini M4 Pro 64GB
  • Vlak 3 ($3,500+): RTX 4090 24GB / dubbele 3090s of Mac Studio Ultra

Vertaalde transkripsie

Vertaal uit die oorspronklike Engelse vertelling. Beskikbare klank en onderskrifte word deur YouTube beheer.

0:00 As jy beplan om 'n rekenaar te bou om plaaslike KI-agente te bestuur, hou op om 'n speletjie-opstelling te bou. Jy het nie 'n vyf-punt-agt gigahertz Core i9, 'n vloeistofverkoelingslus nodig nie, of 'n agt-gigabyte grafiese kaart bedek met RGB. In plaaslike KI-inferensie is speletjie-spesifikasies feitlik nutteloos. Die enigste maatstaf wat bepaal of jou agent loop of kruip, is VRAM-kapasiteit en geheuebusbandwydte. Reëls van die hardewaretoets: vergeet SVE-klokke en rasteriseringmaatstawwe.

0:24 Ons gee om vir drie getalle: geheuebuswydte, bandwydte in gigabyte per sekonde, en rou VRAM-kopruimte vir KV-kas-opblaas. In hierdie veldtoets sal ek die twintig-x geheuebandwydte-afgrond afbreek, die modelgroottreëls karteer, drie werklike vlakke van twaalfhonderd dollar tot vyfduisend evalueer, en verduidelik waarom 'n gebruikte 3090 steeds rekenaar se grootste is bedrogkode. Dit is The Daily Diff, veldtoets. Om te verstaan waarom speletjie-opstellings misluk, kyk na hoe token-generasie werklik uitvoer. In speletjies voed jou SVE tekenoproepe en jou GPU lewer rame.

0:54 Maar outoregressiewe LLM-dekodering is byna suiwer geheuebandwydte gebonde. Om 'n enkele token te genereer, moet die GPU elke gewigsparameter van die model van geheue deur sy rekenaarkerse stroom. As jou model tien gigabyte is, beteken die produksie van een token dat tien gigabyte data gelees word. Op 'n Nvidia RTX 3090 met 'n 384-bis geheuebus, kry jy 936 gigabyte per sekonde GDDR6X-bandwydte, wat tagtig tokens per sekonde produseer. Maar kyk wat gebeur die oomblik dat jou model fisiese VRAM oorskry.

1:22 Wanneer VRAM vol raak, laai looptye oorblywende lae oor die PCIe-bus na stelsel DDR5-geheue. Jou GPU-kerne verwag duisend gigabyte per sekonde. In plaas daarvan voed dubbelkanaal DDR5 hulle vyftig, en PCIe 4 stik op een-en-dertig. Dit is 'n twintig-x bandwydte-ineenstorting. Die token-generasiepypleiding staak onmiddellik en wag op die bus, en spoed daal van veertig tokens per sekonde tot een punt vyf. Jy het 'n tweeduisend-dollar-opstelling in 'n ruimteverwarmer verander.

1:47 En dit word erger tydens multibeurt-agentlopies, want gewigte is slegs die helfte van die stryd. Elke opdrag, gereedskapoproep en lêergedeelte word in die sleutel-waarde kas gestoor. 'n twee-en-dertig-k konteksvenster kan vier tot agt gigabyte VRAM bo-op die gewigte opgebruik. As jou kaart slegs sestien gigabyte het, lus jou agent twee keer, bereik die konteksmuur, en stort òf ineen met 'n uit-geheue-fout òf mors in DDR5. Hier is die vier-bis groottespoedkaart. 'n Sewe of agt-miljard parameter model soos Llama 3.1 of DeepSeek Distill

2:16 neem ongeveer vyf gigabyte. 'n Veertien-miljard model neem tien gigabyte. 'n Twee-en-dertig-miljard model, die intelligensie-ideale plek vir koderingsagente, vereis twintig gigabyte. En 'n sewentig-miljard grensmodel vereis veertig gigabyte voordat jy eers konteks toeken. Wat ons by die werklike hardeware-bouwerk bring. Vlak 1 is die beginner-opstelling, twaalfhonderd tot vyftienhonderd dollar. Op PC is jou anker 'n RTX 4060 Ti 16-gigabyte.

2:39 Kritieke waarskuwing: koop nooit die agt-gigabyte-weergawe om sewentig dollar te spaar nie. Agt gigabyte VRAM in 2026 is 'n onmiddellike uit-geheue-doodvonnis op enige werklike agent-werkvloei. Koppel dit met 'n ses-kern Ryzen 5, vier-en-sestig gigabyte DDR5, en 'n twee-terabyte NVMe-skyf. Oor in Apple-land is die ekwivalent 'n Mac Mini of MacBook Pro met sestien gigabyte verenigde geheue.

3:02 Jy sal veertig tot vyftig tokens per sekonde op agt-miljard modelle sien. Vlak 2 is die kraggebruiker se ideale plek: spesifiek gebou om te loop twee-en-dertig-miljard parameter modelle soos Qwen 2.5 32B. Pad A is 'n nuwe RTX 4070 Ti Super met sestien gigabyte vir agthonderd dollar. Maar Pad B is my sterk aanbeveling: koop 'n gebruikte Nvidia RTX 3090 vier-en-twintig gigabyte. Jy kan skoon 3090s op eBay vind vir seshonderd-en-vyftig tot sewehonderd-en-vyftig dollar. Dit gee jou vier-en-twintig gigabyte VRAM op 'n massiewe 384-bis bus wat

3:33 936 gigabyte per sekonde lewer. Dollar vir dollar is dit die beste VRAM-transaksie in rekenaar. Op macOS is die Vlak 2-eweknie 'n Mac Mini M4 Pro met vier-en-sestig gigabyte verenigde geheue. Dit produseer elf tot twaalf tokens per sekonde op 'n twee-en-dertig-miljard model: stadiger as Nvidia, maar doodstil teen dertig watt met ruimte vir 'n reuse konteksvenster. Vlak 3 is die entoesiaste-klas vir multi-agent swerms. Op PC beteken dit 'n RTX 4090 met vier-en-twintig gigabyte,

3:57 'n Ryzen 9, en honderd-agt-en-twintig gigabyte RAM, of dubbele RTX 3090s wat agt-en-veertig gigabyte totale VRAM verskaf. In Apple se reeks is dit 'n Mac Studio Ultra met ses-en-negentig tot honderd-en- agt-en-twintig gigabyte verenigde geheue. Die superkrag is geheueresidensie: jy kan 'n insluitingsmodel behou, 'n vinnige roeteerder, en 'n 32-miljard koderingmodel gelyktydig gelaai met nul ruilvertraging. Nou vir die eerlike mislukking van ons veldtoets: die randrekenaarlokval.

4:24 Elke week beweer 'n sosiale plasing dat jy outonome koderingsagente op 'n tagtig-dollar Raspberry Pi 5 kan laat loop. Ek het dit getoets. Die bestuur van 'n klein een-punt-vyf miljard parameter model gee jou skaars drie tokens per sekonde terwyl die bord smoor by vyf-en-tagtig grade Celsius. Dit is 'n oulike naweekspeelding, maar as 'n daaglikse ontwikkelingsbestuurder, is dit pure straf. Vir sagteware, gebruik Ollama as jy 'n skoon opdraglyn-daemon wil hê wat direk

4:47 aan Cursor, Cline, of VS Code koppel. As jy 'n grafiese speelplek met model aflaaie en GPU laagskuivers wil hê, gebruik LM Studio. En pas jou formaat by jou silikon aan. Op Apple Silicon, laai altyd GGUF-modelle af wat vir Metal geoptimaliseer is. Op Windows of Linux met Nvidia, laai AWQ- of EXL2-modelle af, wat Nvidia Tensor Cores gebruik vir twintig tot dertig persent vinniger inferensie. So hoe ontplooi jy dit sonder om bankrot te raak?

5:11 Dink aan plaaslike hardeware soos 'n tuisgimnasium versus 'n kommersiële gimnasium. Om 'n hurkrak by die huis te hê beteken dat jy elke dag oefen met nul pendel, nul inskrywingsfooie, en volledige privaatheid. Jou plaaslike masjien hanteer tagtig persent van jou daaglikse kodering, eenheidtoetsing, en private dokumentverwerking vir nul dollar per token. En wanneer jy vyfhonderd pond moet doodlig — soos 'n massiewe repo-wye argitektuurherfaktor oor vyftig lêers — besoek jy die kommersiële gimnasium: betaal die wolk-API vir Claude 3.5 Sonnet of OpenAI o3 vir vyftien minute

5:38 en gaan aan. Hier is die rekening: 'n Vlak 2-bou met 'n gebruikte 3090 kos sestienhonderd dollar alles ingesluit. As jy vyftig tot honderd dollar per maand aan API-tokens bestee, betaal dit homself binne agtien maande terug terwyl jou eie kodebasis van derdeparty-bedieners af gehou word. Vandag se veldtoetsuitspraak: SHIP IT. VRAM en geheuebandwydte klop kloksnelhede elke keer. Hou op om vyf-gigahertz SVE's vir KI te koop, en gaan soek 'n gebruikte 3090.

6:04 Vertel my watter hardeware-opstelling jy gebruik vir plaaslike modelle in die kommentaar. En as jy eerder hierdie uiteensetting wil lees, kry die nuusbrief by the daily diff dot dev, skakel hieronder. En dit is die verskil vir vandag. Ek is Niko van Axrisi. Voeg verantwoordelik saam.

Bronne

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Verwante video's