A Helyi AI Hardver Útmutató (2026)
Helyi AI ügynökök és nyílt súlyú LLM-ek számára történő gép építésekor a fejlesztők elkövetik azt a hibát, hogy gamer PC specifikációkat vásárolnak: 5,8 GHz-es CPU-kat, egyedi folyadékhűtést és gyors gamer GPU-kat mindössze 8 GB VRAM-mal.
Helyi AI ügynökök és nyílt súlyú LLM-ek számára történő gép építésekor a fejlesztők elkövetik azt a hibát, hogy gamer PC specifikációkat vásárolnak: 5,8 GHz-es CPU-kat, egyedi folyadékhűtést és gyors gamer GPU-kat mindössze 8 GB VRAM-mal. Azonban az autoregresszív token generálás memória-sávszélességhez kötött, nem számítási teljesítményhez: egyetlen token kibocsátásához a modell minden súlyának át kell áramolnia a memóriabuszon. Amikor a súlyok vagy a KV gyorsítótár kontextusa meghaladja a fizikai VRAM-ot, a futtatókörnyezet a rétegeket PCIe-n keresztül a rendszer DDR5-re helyezi át, és egy 20-szoros memória-sávszélességi szakadékba ütközünk: a sebesség 40 token/másodpercről 1,5-re zuhan. Ebben a terepi tesztben Niko lebontja a hardver mechanikáját, a 4 bites kvantálási modell méretezési szabályait, három valós költségvetési szintet 1200 és 5000 dollár között, miért a használt RTX 3090 24GB a legjobb VRAM-per-dollár üzlet a számítástechnikában, a Raspberry Pi "edge" csapdáját, és az otthoni edzőterem stratégiáját a helyi versus felhő alapú következtetéshez. Ítélet: SHIP IT.
Olvassa el az írott kiadást (angolul) ↗
Amit ez a videó tartalmaz
- A 20-szoros memória-sávszélességi szakadék: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31,5 GB/s PCIe
- Modell méretezés @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- 1. szint (1200–1500 dollár): RTX 4060 Ti 16GB (soha ne 8GB) vagy Mac Mini 16GB
- 2. szint (1500–2000 dollár): Használt RTX 3090 24GB ideális választás vagy Mac Mini M4 Pro 64GB
- 3. szint (3500+ dollár): RTX 4090 24GB / két 3090 vagy Mac Studio Ultra
Lefordított átirat
Az eredeti angol narrációból fordítva. A rendelkezésre álló hangot és feliratokat a YouTube vezérli.
0:00 Ha PC-t tervezel helyi AI ügynökök futtatására, hagyd abba a gamer gép építését. Nincs szükséged egy 5,8 GHz-es Core i9-re, egy folyadékhűtéses hurkra, vagy egy RGB-vel borított 8 GB-os grafikus kártyára. Helyi AI következtetésnél a gamer specifikációk gyakorlatilag haszontalanok. Az egyetlen metrika, ami meghatározza, hogy az ügynököd fut vagy kúszik, az a VRAM kapacitás és a memória busz sávszélessége. A hardverteszt szabályai: felejtsd el a CPU órajelét és a raszterizációs benchmarkokat.
0:24 Három számra figyelünk: memória busz szélesség, sávszélesség gigabájt per másodpercben, és nyers VRAM szabad terület a KV cache megnövekedésére. Ebben a terepi tesztben lebontom a hússzoros memória sávszélességi szakadékot, feltérképezem a modell méretezési szabályokat, benchmarkolok három valós szintet ezerkétszáz dollártól ötezer dollárig, és elmagyarázom, miért a használt 3090 még mindig a számítástechnika legnagyobb csalása. Ez a The Daily Diff, terepi teszt. Ahhoz, hogy megértsük, miért buknak el a gamer gépek, nézzük meg, hogyan történik valójában a token generálás. Játékokban a CPU táplálja a rajzolási hívásokat, a GPU pedig rendereli a képkockákat.
0:54 De az autoregresszív LLM dekódolás szinte tisztán memória sávszélesség korlátos. Egyetlen token generálásához a GPU-nak át kell streamelnie a modell minden súlyparaméterét a memóriából a számítási magokon keresztül. Ha a modeled tíz gigabájt, egy token előállítása tíz gigabájt adat olvasását jelenti. Egy Nvidia RTX 3090-en, 384 bites memóriabusszal, 936 gigabájt/másodperc GDDR6X sávszélességet kapsz, másodpercenként nyolcvan tokent generálva. De figyeld meg, mi történik abban a pillanatban, amikor a modeled túllépi a fizikai VRAM-ot.
1:22 Amikor a VRAM megtelik, a futtatókörnyezetek a fennmaradó rétegeket a PCIe buszon keresztül a rendszer DDR5 memóriájába helyezik át. A GPU magok ezer gigabájt/másodpercet várnak. Ehelyett a kétcsatornás DDR5 ötvenet ad nekik, a PCIe 4 pedig harmincegyen fojt. Ez egy hússzoros sávszélesség-összeomlás. A token generálási folyamat azonnal leáll a buszra várva, és a sebesség negyven token/másodpercről egy és félre zuhan. Egy kétezer dolláros gépet fűtőtestté változtattál.
1:47 És még rosszabb a helyzet a többlépéses ügynök futtatások során, mert a súlyok csak a fele a csatának. Minden prompt, eszközhívás és fájlrész a Kulcs-Érték gyorsítótárban tárolódik. Egy harminckétk-s kontextusablak négy-nyolc gigabájt VRAM-ot fogyaszthat a súlyok tetejére. Ha a kártyádnak csak tizenhat gigabájtja van, az ügynököd kétszer fut le, eléri a kontextusfalat, és vagy összeomlik egy memória-hiba miatt, vagy átömlik a DDR5-be. Itt van a négy bites méretezési csalólap. Egy hét- vagy nyolcmilliárd paraméteres modell, mint a Llama 3.1 vagy a DeepSeek Distill,
2:16 körülbelül öt gigabájtot foglal. Egy tizennégymilliárdos modell tíz gigabájtot igényel. Egy harminckétmilliárdos modell, a kódoló ügynökök ideális intelligencia szintje, húsz gigabájtot igényel. És egy hetvenmilliárdos élvonalbeli modell negyven gigabájtot követel, még mielőtt kontextust osztanál. Ami elvezet minket a tényleges hardver összeállításokhoz. Az 1. szint a kezdő gép, ezerkétszáz és ezerötszáz dollár között. PC-n a horgony egy RTX 4060 Ti 16 gigabájtos kártya.
2:39 Kritikus figyelmeztetés: soha ne vásárold meg a nyolc gigabájtos verziót hetven dollár megtakarításáért. A 8 GB VRAM 2026-ban azonnali memória-hiba okozta halálos ítélet bármely valós ügynök munkafolyamaton. Párosítsd egy hatmagos Ryzen 5-tel, hatvannégy gigabájt DDR5-tel, és egy két terabájtos NVMe meghajtóval. Apple vonalon az egyenértékű egy Mac Mini vagy MacBook Pro tizenhat gigabájt egyesített memóriával.
3:02 Negyven-ötven tokent fogsz látni másodpercenként nyolcmilliárdos modelleken. A 2. szint a haladó felhasználók ideális választása: kifejezetten a harminckétmilliárd paraméteres modellek, mint a Qwen 2.5 32B futtatására építve. A) út egy új RTX 4070 Ti Super tizenhat gigabájttal nyolcszáz dollárért. De a B) út az erősen javasolt: vásárolj egy használt Nvidia RTX 3090 huszonnégy gigabájtos kártyát. Tiszta 3090-eseket találhatsz az eBay-en hatszázötven és hétszázötven dollár között. Ez huszonnégy gigabájt VRAM-ot biztosít egy hatalmas 384 bites buszon, ami
3:33 936 gigabájtot tol másodpercenként. Dollár-dollár alapon ez a legjobb VRAM-ajánlat a számítástechnikában. macOS-en a 2. szintű megfelelő egy Mac Mini M4 Pro hatvannégy gigabájt egyesített memóriával. Tizenegy-tizenkét tokent produkál másodpercenként egy harminckétmilliárdos modellen: lassabb, mint az Nvidia, de teljesen csendes harminc watton, hatalmas kontextusablak befogadására alkalmas. A 3. szint a rajongói kategória a többügynökös rajok számára. PC-n ez egy RTX 4090-et jelent huszonnégy gigabájttal,
3:57 egy Ryzen 9-et és százhuszonnyolc gigabájt RAM-ot, vagy két RTX 3090-et, ami összesen negyvennyolc gigabájt VRAM-ot biztosít. Az Apple kínálatában ez egy Mac Studio Ultra kilencvenhattól százhuszonnyolc gigabájt egyesített memóriával. A szuperképesség a memória rezidencia: egy beágyazási modellt, egy gyors routert és egy 32 milliárdos kódoló modellt tölthetsz be egyszerre nulla csere késleltetéssel. Most pedig a terepi tesztünk őszinte kudarca: az edge computing csapda.
4:24 Minden héten megjelenik egy poszt, ami azt állítja, hogy nyolcvan dolláros Raspberry Pi 5-ön is futtathatsz autonóm kódoló ügynököket. Kipróbáltam. Egy apró, másfél milliárd paraméteres modell futtatása alig három tokent ad másodpercenként, miközben a kártya nyolcvanöt Celsius fokon túlmelegszik. nyolcvanöt Celsius fokon túlmelegszik. Kellemes hétvégi játék, de napi fejlesztési eszközként tiszta büntetés. Szoftverhez használd az Ollamát, ha egy tiszta parancssori démont szeretnél, ami
4:47 közvetlenül csatlakozik a Cursorhoz, Cline-hoz vagy VS Code-hoz. Ha egy grafikus játszóteret szeretnél modellletöltésekkel és GPU réteg csúszkákkal, használd az LM Studiót. És igazítsd a formátumot a szilikonhoz. Apple Siliconon mindig Metalra optimalizált GGUF modelleket tölts le. Windowson vagy Linuxon Nvidia-val AWQ vagy EXL2 modelleket tölts le, amelyek az Nvidia Tensor Core-okat használják a húsz-harminc százalékkal gyorsabb következtetéshez. Szóval hogyan telepítheted ezt anélkül, hogy csődbe mennél?
5:11 Gondolj a helyi hardverre, mint egy otthoni edzőteremre szemben egy kereskedelmi edzőteremmel. Ha van otthon egy guggoló állványod, az azt jelenti, hogy minden nap edzel nulla ingázással, nulla előfizetési díjjal és teljes magánélettel. A helyi géped kezeli a napi kódolásod nyolcvan százalékát, egységtesztelését és privát dokumentumfeldolgozását tokenenként nulla dollárért. És amikor ötszáz fontot kell emelned – mint egy hatalmas, repó-szintű architekturális refaktor ötven fájlban – meglátogatod a kereskedelmi edzőtermet: kifizeted a felhő API-t a Claude 3.5 Sonnet vagy az OpenAI o3 számára tizenöt percre
5:38 és továbbmész. Itt a számla: egy 2. szintű összeállítás használt 3090-nel ezerhatszáz dollárba kerül összesen. Ha havonta ötven-száz dollárt költesz API tokenekre, az tizennyolc hónap alatt megtérül, miközben a saját kódodat harmadik féltől származó szervereken kívül tartja. A mai terepi teszt ítélete: SHIP IT. A VRAM és a memória sávszélesség mindig veri az órajeleket. Hagyja abba az ötgigahertzes CPU-k vásárlását AI-hoz, és keressen egy használt 3090-et.
6:04 Mondja el kommentben, milyen hardver összeállítást használ helyi modellekhez. És ha inkább elolvasná ezt a lebontást, iratkozzon fel a hírlevélre a daily diff dot dev címen, link lent. És ennyi a mai különbség. Én Niko vagyok az Axrisitől. Felelősségteljesen egyesítsen.
Források
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



