+− THE DAILY DIFFdev & AI news
SHIP IT

De Lokale AI Hardware Gids (2026)

Bij het bouwen van een machine voor lokale AI-agenten en open-weight LLM's maken ontwikkelaars de fout om gaming PC-specificaties te kopen: 5,8 GHz CPU's, aangepaste vloeistofkoelingscircuits en snelle gaming GPU's met slechts 8GB VRAM.

Bij het bouwen van een machine voor lokale AI-agenten en open-weight LLM's maken ontwikkelaars de fout om gaming PC-specificaties te kopen: 5,8 GHz CPU's, aangepaste vloeistofkoelingscircuits en snelle gaming GPU's met slechts 8GB VRAM. Maar autoregressieve token generatie is geheugenbandbreedte-gebonden, niet rekenkracht-gebonden: om een enkele token uit te zenden, moet elk gewicht in het model over de geheugenbus streamen. Wanneer uw gewichten of KV cache-context de fysieke VRAM overschrijden, verplaatst de runtime lagen naar systeem DDR5 via PCIe, en komt u terecht in een 20x geheugenbandbreedte-val: de snelheid keldert van 40 tokens per seconde naar 1,5. In deze veldtest analyseert Niko de hardwaremechanica, de 4-bit kwantisatie model-maatbepalingsregels, drie echte budgetklassen van $1.200 tot $5.000, waarom een gebruikte RTX 3090 24GB de beste VRAM-per-dollar deal in computing is, de Raspberry Pi edge-valkuil, en de 'home gym'-strategie voor lokale versus cloud-inferentie. Oordeel: SHIP IT.

Lees de geschreven editie (Engels) ↗

Wat deze video behandelt

  • De 20x geheugenbandbreedteval: 936 GB/s GDDR6X versus 50 GB/s DDR5 en 31,5 GB/s PCIe
  • Modelgrootte @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Niveau 1 ($1.200–$1.500): RTX 4060 Ti 16GB (nooit 8GB) of Mac Mini 16GB
  • Niveau 2 ($1.500–$2.000): Gebruikte RTX 3090 24GB 'sweet spot' of Mac Mini M4 Pro 64GB
  • Niveau 3 ($3.500+): RTX 4090 24GB / dubbele 3090's of Mac Studio Ultra

Vertaald transcript

Vertaald vanuit de originele Engelse gesproken tekst. Beschikbare audio en ondertiteling worden beheerd door YouTube.

0:00 Als je van plan bent een pc te bouwen om lokale AI-agenten te draaien, stop dan met het bouwen van een gaming rig. Je hebt geen 5,8 gigahertz Core i9, een vloeistofkoelcircuit nodig, of een grafische kaart van acht gigabyte vol met RGB. Bij lokale AI-inferentie zijn gaming specs vrijwel nutteloos. De enige metriek die bepaalt of je agent draait of kruipt, is VRAM-capaciteit en geheugenbusbandbreedte. Regels van de hardwaretest: vergeet CPU-kloksnelheden en rasterisatie-benchmarks.

0:24 Het gaat ons om drie getallen: geheugenbusbreedte, bandbreedte in gigabytes per seconde, en de ruime VRAM-hoofdruimte voor KV cache-opzwelling. In deze veldtest zal ik de twintig-x geheugenbandbreedte-val uitleggen, de modelgrootteregels in kaart brengen, drie echte prijsklassen benchmarken van twaalfhonderd dollar tot vijfduizend, en uitleggen waarom een gebruikte 3090 nog steeds de grootste cheatcode van de computerwereld is. Dit is The Daily Diff, veldtest. Om te begrijpen waarom gaming rigs falen, kijk hoe tokengeneratie werkelijk uitvoert. In games voert je CPU draw calls aan en rendert je GPU frames.

0:54 Maar autoregressieve LLM-decodering is bijna puur gebonden aan geheugenbandbreedte. Om een enkele token te genereren, moet de GPU elke gewichtsparameter van het model uit het geheugen via zijn rekenkernen streamen. Als je model tien gigabytes is, betekent het produceren van één token het lezen van tien gigabytes aan data. Op een Nvidia RTX 3090 met een 384-bit geheugenbus, krijg je 936 gigabytes per seconde GDDR6X-bandbreedte, wat tachtig tokens per seconde produceert. Maar kijk wat er gebeurt op het moment dat je model de fysieke VRAM overschrijdt.

1:22 Wanneer VRAM vol raakt, verplaatst de runtime de resterende lagen via de PCIe-bus naar het systeem-DDR5-geheugen. Je GPU-kernen verwachten duizend gigabytes per seconde. In plaats daarvan voedt dual-channel DDR5 ze vijftig, en PCIe 4 stikt bij eenendertig. Dat is een twintig-x bandbreedte-ineenstorting. De tokengeneratiepijplijn stopt onmiddellijk in afwachting van de bus, en de snelheid keldert van veertig tokens per seconde naar anderhalf. Je hebt een tweeduizend dollar kostende rig in een elektrische kachel veranderd.

1:47 En het wordt erger tijdens multi-turn agent runs, want gewichten zijn maar de helft van de strijd. Elke prompt, tool call en bestandswinkel wordt opgeslagen in de Key-Value cache. Een contextvenster van tweeëndertig-k kan vier tot acht gigabyte aan VRAM verbruiken bovenop de gewichten. Als je kaart slechts zestien gigabytes heeft, doorloopt je agent twee keer, bereikt de contextmuur, en crasht ofwel met een 'out-of-memory' fout of loopt over in DDR5. Hier is het 4-bit sizing spiekbriefje. Een zeven of acht miljard parameter model zoals Llama 3.1 of DeepSeek Distill

2:16 verbruikt ongeveer vijf gigabytes. Een veertien miljard model verbruikt tien gigabytes. Een tweeëndertig miljard model, de intelligentie 'sweet spot' voor coderingsagenten, vereist twintig gigabytes. En een zeventig miljard frontier model vereist veertig gigabytes voordat je überhaupt context toewijst. Wat ons brengt bij de daadwerkelijke hardware-builds. Niveau 1 is de starter-rig, twaalfhonderd tot vijftienhonderd dollar. Op pc is je anker een RTX 4060 Ti 16-gigabyte.

2:39 Kritieke waarschuwing: koop nooit de acht-gigabyte versie om zeventig dollar te besparen. Acht gigabyte VRAM in 2026 is een onmiddellijk 'out-of-memory' doodvonnis op elke echte agent-workflow. Koppel hem aan een zes-core Ryzen 5, vierenzestig gigabytes DDR5, en een twee-terabyte NVMe-schijf. In Apple-land is het equivalent een Mac Mini of MacBook Pro met zestien gigabyte verenigd geheugen.

3:02 Je zult veertig tot vijftig tokens per seconde zien op acht-miljard modellen. Niveau 2 is de 'sweet spot' voor power users: specifiek gebouwd om tweeëndertig-miljard parameter modellen zoals Qwen 2.5 32B te draaien. Pad A is een nieuwe RTX 4070 Ti Super met zestien gigabytes voor achthonderd dollar. Maar Pad B is mijn sterke aanbeveling: koop een gebruikte Nvidia RTX 3090 vierentwintig gigabyte. Je kunt schone 3090's op eBay vinden voor zeshonderdvijftig tot zevenhonderdvijftig dollar. Dat geeft je vierentwintig gigabytes VRAM op een enorme 384-bit bus die

3:33 936 gigabytes per seconde verwerkt. Dollar voor dollar, is het de beste VRAM-deal in computing. Op macOS is de Tier 2 tegenhanger een Mac Mini M4 Pro met vierenzestig gigabytes verenigd geheugen. Het produceert elf tot twaalf tokens per seconde op een tweeëndertig-miljard model: langzamer dan Nvidia, maar doodstil bij dertig watt met ruimte voor een gigantisch contextvenster. Niveau 3 is de liefhebber-categorie voor multi-agent zwermen. Op pc betekent dat een RTX 4090 met vierentwintig gigabytes,

3:57 een Ryzen 9, en honderdtweeëntwintig gigabytes RAM, of dubbele RTX 3090's die achtenveertig gigabytes totale VRAM bieden. In Apple's assortiment is dit een Mac Studio Ultra met zesennegentig tot honderdtweeëntwintig gigabyte verenigd geheugen. De superkracht is geheugenresidentie: je kunt een embedding-model, een snelle router, en een 32-miljard coderingsmodel tegelijk laden met nul swap-vertraging. Nu voor de eerlijke mislukking van onze veldtest: de edge computing valkuil.

4:24 Elke week beweert een sociale post dat je autonome coderingsagenten kunt draaien op een tachtig dollar kostende Raspberry Pi 5. Ik heb het getest. Het draaien van een klein 1,5 miljard parameter model geeft je nauwelijks drie tokens per seconde terwijl het bord vertraagt bij vijfentachtig graden Celsius. Het is een leuk weekend speeltje, maar als dagelijkse ontwikkelingsdriver, is het puur straf. Voor software, gebruik Ollama als je een schone command-line daemon wilt die direct

4:47 aansluit op Cursor, Cline of VS Code. Als je een grafische speeltuin wilt met model downloads en GPU-laag sliders, gebruik dan LM Studio. En match je formaat met je silicium. Op Apple Silicon, download altijd GGUF-modellen geoptimaliseerd voor Metal. Op Windows of Linux met Nvidia, download AWQ- of EXL2-modellen, die Nvidia Tensor Cores gebruiken voor twintig tot dertig procent snellere inferentie. Dus hoe implementeer je dit zonder failliet te gaan?

5:11 Zie lokale hardware als een thuisgym versus een commerciële gym. Een squatrek thuis betekent dat je elke dag traint zonder reistijd, zonder abonnementskosten, en met volledige privacy. Je lokale machine verwerkt tachtig procent van je dagelijkse codering, unit testing, en private documentverwerking voor nul dollar per token. En wanneer je vijfhonderd pond moet deadliften — zoals een enorme repo-brede architecturale refactor over vijftig bestanden — bezoek je de commerciële gym: betaal de cloud API voor Claude 3.5 Sonnet of OpenAI o3 voor vijftien minuten

5:38 en ga verder. Hier is de rekening: een Niveau 2 build met een gebruikte 3090 kost zestienhonderd dollar alles inclusief. Als je vijftig tot honderd dollar per maand uitgeeft aan API-tokens, betaalt het zichzelf terug in achttien maanden, terwijl je eigen codebase niet op servers van derden staat. Het oordeel van de veldtest van vandaag: SHIP IT. VRAM en geheugenbandbreedte verslaan kloksnelheden elke keer weer. Stop met het kopen van vijf gigahertz CPU's voor AI, en zoek een gebruikte 3090.

6:04 Vertel me welke hardware-build je draait voor lokale modellen in de reacties. En als je deze analyse liever leest, pak dan de nieuwsbrief op the daily diff dot dev, link hieronder. En dat is het verschil voor vandaag. Ik ben Niko van Axrisi. Samenvoegen met verantwoordelijkheid.

Bronnen

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Gerelateerde video's