# La Guia de Hardware d'IA Local (2026)

Published: 2026-09-14

Quan construeixen una màquina per a agents d'IA locals i LLMs de pes obert, els desenvolupadors cometen l'error de comprar especificacions de PC de joc: CPUs de 5,8 GHz, bucles de refrigeració líquida personalitzats i GPUs ràpides de joc amb només 8 GB de VRAM. Però la generació autoregressiva de tokens depèn de l'ample de banda de la memòria, no del càlcul: per emetre un sol token, cada pes del model ha de fluir a través del bus de memòria. Quan els teus pesos o el context de la memòria cau KV excedeixen la VRAM física, el temps d'execució descarrega capes a la memòria DDR5 del sistema a través de PCIe, i t'enfrontes a un salt de 20x en l'ample de banda de la memòria: la velocitat cau de 40 tokens per segon a 1,5. En aquesta prova de camp, Niko desglossa la mecànica del hardware, les regles de dimensionament de models de quantificació de 4 bits, tres nivells de pressupost reals de 1.200 $ a 5.000 $, per què una RTX 3090 24 GB usada és la millor oferta de VRAM per dòlar en informàtica, la trampa del Raspberry Pi edge, i l'estratègia del gimnàs domèstic per a la inferència local versus el núvol. Veredicte: SHIP IT.

Canonical: https://thedailydiff.dev/ca/video/2026-09-14-local-ai-hardware/

## Què cobreix aquest vídeo

- El salt de 20x en l'ample de banda de la memòria: 936 GB/s GDDR6X vs 50 GB/s DDR5 i 31,5 GB/s PCIe
- Dimensionament del model @ 4 bits: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Nivell 1 (1.200 $–1.500 $): RTX 4060 Ti 16GB (mai 8GB) o Mac Mini 16GB
- Nivell 2 (1.500 $–2.000 $): RTX 3090 24GB usada (punt òptim) o Mac Mini M4 Pro 64GB
- Nivell 3 (3.500 $+): RTX 4090 24GB / dual 3090s o Mac Studio Ultra

## Transcripció traduïda

Traduït de la narració original en anglès. L'àudio i els subtítols disponibles estan controlats per YouTube.

0:00 Si esteu pensant a construir un PC per executar agents d'IA locals, deixeu de construir un equip de joc. No necessiteu un Core i9 de cinc-punt-vuit gigahertzs, un bucle de refrigeració líquida, o una targeta gràfica de vuit gigabytes coberta de RGB. En la inferència d'IA local, les especificacions de joc són pràcticament inútils. L'única mètrica que dicta si el vostre agent funciona o arrossega és la capacitat de VRAM i l'ample de banda del bus de memòria. Regles de la prova de hardware: oblideu els rellotges de la CPU i els benchmarks de rasterització.

0:24 Ens importen tres números: l'ample del bus de memòria, l'ample de banda en gigabytes per segon, i el marge de VRAM brut per a l'inflament de la memòria cau KV. En aquesta prova de camp, desglossaré el salt de vint-x en l'ample de banda de la memòria, mapejaré les regles de dimensionament del model, faré benchmarks de tres nivells reals des de mil dos-cents dòlars fins a cinc mil, i explicaré per què una 3090 usada segueix sent el millor codi trampa de la informàtica. Això és The Daily Diff, prova de camp. Per entendre per què fallen els equips de joc, observeu com s'executa realment la generació de tokens. En els jocs, la vostra CPU alimenta les crides de dibuix i la vostra GPU renderitza els fotogrames.

0:54 Però la descodificació autoregressiva de LLM depèn gairebé purament de l'ample de banda de la memòria. Per generar un sol token, la GPU ha de transmetre tots els paràmetres de pes del model des de la memòria a través dels seus nuclis de càlcul. Si el vostre model és de deu gigabytes, produir un token significa llegir deu gigabytes de dades. En una Nvidia RTX 3090 amb un bus de memòria de 384 bits, obteniu 936 gigabytes per segon d'ample de banda GDDR6X, produint vuitanta tokens per segon. Però observeu què passa el mil·lisegon que el vostre model excedeix la VRAM física.

1:22 Quan la VRAM s'omple, els temps d'execució descarreguen les capes restants a través del bus PCIe a la memòria DDR5 del sistema. Els nuclis de la vostra GPU esperen mil gigabytes per segon. En canvi, la DDR5 de doble canal els alimenta amb cinquanta, i la PCIe 4 s'estrangula a trenta-un. Això és un col·lapse de l'ample de banda de vint-x. La canonada de generació de tokens s'atura instantàniament esperant el bus, i la velocitat cau de quaranta tokens per segon fins a un punt cinc. Heu convertit un equip de dos mil dòlars en un escalfador.

1:47 I empitjora durant les execucions d'agents de múltiples torns, perquè els pesos només són la meitat de la batalla. Cada missatge, crida a l'eina i fragment de fitxer s'emmagatzema a la memòria cau Key-Value. Una finestra de context de trenta-dos k pot consumir de quatre a vuit gigabytes de VRAM a més dels pesos. Si la vostra targeta només té setze gigabytes, el vostre agent fa dos bucles, arriba al mur del context i es bloqueja amb un error de memòria insuficient o es desborda a la DDR5. Aquí teniu la fulla de trucs de dimensionament de quatre bits. Un model de set o vuit mil milions de paràmetres com Llama 3.1 o DeepSeek Distill

2:16 ocupa uns cinc gigabytes. Un model de catorze mil milions ocupa deu gigabytes. Un model de trenta-dos mil milions, el punt òptim d'intel·ligència per a agents de codificació, requereix vint gigabytes. I un model de frontera de setanta mil milions demana quaranta gigabytes abans que ni tan sols assigneu context. La qual cosa ens porta a les configuracions de hardware reals. El nivell 1 és l'equip d'inici, de mil dos-cents a mil cinc-cents dòlars. En PC, el vostre punt d'ancoratge és una RTX 4060 Ti de 16 gigabytes.

2:39 Advertència crítica: mai compreu la versió de vuit gigabytes per estalviar setanta dòlars. Vuit gigabytes de VRAM el 2026 és una sentència de mort immediata per manca de memòria en qualsevol flux de treball d'agent real. Combina-la amb un Ryzen 5 de sis nuclis, seixanta-quatre gigabytes de DDR5, i una unitat NVMe de dos terabytes. En el món Apple, l'equivalent és un Mac Mini o MacBook Pro amb setze gigabytes de memòria unificada.

3:02 Veureu de quaranta a cinquanta tokens per segon en models de vuit mil milions. El nivell 2 és el punt òptim per a usuaris avançats: construint específicament per executar models de trenta-dos mil milions de paràmetres com Qwen 2.5 32B. El camí A és una nova RTX 4070 Ti Super amb setze gigabytes per vuit-cents dòlars. Però el camí B és la meva forta recomanació: compreu una Nvidia RTX 3090 de vint-i-quatre gigabytes usada. Podeu trobar 3090s netes a eBay per sis-cents cinquanta a set-cents cinquanta dòlars. Això us ofereix vint-i-quatre gigabytes de VRAM en un enorme bus de 384 bits que impulsa

3:33 936 gigabytes per segon. Dòlar per dòlar, és la millor oferta de VRAM en informàtica. En macOS, la contrapart del nivell 2 és un Mac Mini M4 Pro amb seixanta-quatre gigabytes de memòria unificada. Produeix d'onze a dotze tokens per segon en un model de trenta-dos mil milions: més lent que Nvidia, però completament silenciós a trenta watts amb espai per a una finestra de context gegant. El nivell 3 és la categoria per a entusiastes per a eixams multi-agent. En PC, això significa una RTX 4090 amb vint-i-quatre gigabytes,

3:57 un Ryzen 9, i cent vint-i-vuit gigabytes de RAM, o dues RTX 3090 que proporcionen quaranta-vuit gigabytes de VRAM total. En la línia d'Apple, això és un Mac Studio Ultra amb noranta-sis a cent vint-i-vuit gigabytes de memòria unificada. El superpoder és la residència de memòria: podeu mantenir un model d'incrustació, un encaminador ràpid i un model de codificació de 32 mil milions carregats simultàniament amb zero retard de swap. Ara, per a la fallada honesta de la nostra prova de camp: la trampa de l'edge computing.

4:24 Cada setmana una publicació a les xarxes socials afirma que podeu executar agents de codificació autònoms en un Raspberry Pi 5 de vuitanta dòlars. Ho vaig provar. Executar un petit model d'un punt cinc mil milions de paràmetres us dóna amb prou feines tres tokens per segon mentre la placa s'estrangula a vuitanta-cinc graus Celsius. És un joguet divertit per al cap de setmana, però com a controlador de desenvolupament diari, és pura tortura. Per al programari, utilitzeu Ollama si voleu un dimoni de línia de comandes net que es connecti

4:47 directament a Cursor, Cline o VS Code. Si voleu un entorn gràfic amb descàrregues de models i controladors de capes de GPU, utilitzeu LM Studio. I ajusteu el vostre format al vostre silici. En Apple Silicon, descarregueu sempre models GGUF optimitzats per a Metal. En Windows o Linux amb Nvidia, descarregueu models AWQ o EXL2, que utilitzen els Tensor Cores de Nvidia per a una inferència entre un vint i un trenta per cent més ràpida. Així que, com desplegueu això sense arruïnar-vos?

5:11 Penseu en el hardware local com un gimnàs casolà versus un gimnàs comercial. Tenir un rack de sentadilles a casa significa que entreneu cada dia sense desplaçaments, sense quotes de subscripció i amb total privacitat. La vostra màquina local gestiona el vuitanta per cent de la vostra codificació diària, proves unitàries i processament de documents privats per zero dòlars per token. I quan necessiteu aixecar cinc-centes lliures, com una refactorització arquitectònica massiva de tot un repositori en cinquanta fitxers, visiteu el gimnàs comercial: pagueu l'API del núvol per a Claude 3.5 Sonnet o OpenAI o3 durant quinze minuts

5:38 i continueu. Aquí teniu la factura: una configuració de nivell 2 amb una 3090 usada costa mil sis-cents dòlars en total. Si gasteu de cinquanta a cent dòlars al mes en tokens d'API, es paga sola en divuit mesos mentre manteniu el vostre codi base propietari fora de servidors de tercers. Veredicte de la prova de camp d'avui: SHIP IT. VRAM i ample de banda de memòria sempre guanyen als rellotges. Deixeu de comprar CPUs de cinc gigahertzs per a IA i aneu a buscar una 3090 usada. Digueu-me quina configuració de hardware utilitzeu per a models locals als comentaris.

6:04 I si preferiu llegir aquesta anàlisi, subscriviu-vos al butlletí a the daily diff punt dev, enllaç a continuació. I això és el diff d'avui. Sóc Niko d'Axrisi. Fusiona amb responsabilitat. Fusiona amb responsabilitat.

## Fonts

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
