# A Guía de Hardware para IA Local (2026)

Published: 2026-09-14

Ao construír unha máquina para axentes de IA locais e LLM de "open-weight", os desenvolvedores cometen o erro de mercar especificacións de PC para xogos: CPUs de 5,8 GHz, sistemas de refrixeración líquida personalizados e GPUs rápidas para xogos con só 8 GB de VRAM. Pero a xeración autoregresiva de tokens está limitada polo ancho de banda da memoria, non pola capacidade de cálculo: para emitir un único token, cada "peso" no modelo debe fluír polo bus da memoria. Cando os "pesos" ou o contexto da caché KV exceden a VRAM física, o "runtime" descarga capas na DDR5 do sistema a través de PCIe, e prodúcese un "salto" de ancho de banda da memoria de 20x: a velocidade cae de 40 tokens por segundo a 1,5. Nesta proba de campo, Niko desglosa a mecánica do hardware, as regras de tamaño do modelo de cuantificación de 4 bits, tres niveis de orzamento reais de 1.200 $ a 5.000 $, por que unha RTX 3090 24GB usada é a mellor oferta de VRAM por dólar en informática, a trampa do Raspberry Pi "edge", e a estratexia do ximnasio doméstico para inferencia local versus na nube. Veredicto: SHIP IT.

Canonical: https://thedailydiff.dev/gl/video/2026-09-14-local-ai-hardware/

## Que abrangue este vídeo

- O "salto" de ancho de banda da memoria de 20x: 936 GB/s GDDR6X fronte a 50 GB/s DDR5 e 31,5 GB/s PCIe
- Tamaño do modelo @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Nivel 1 (1.200 $–1.500 $): RTX 4060 Ti 16GB (nunca 8GB) ou Mac Mini 16GB
- Nivel 2 (1.500 $–2.000 $): Punto óptimo RTX 3090 24GB usada ou Mac Mini M4 Pro 64GB
- Nivel 3 (3.500 $+): RTX 4090 24GB / dual 3090s ou Mac Studio Ultra

## Transcrición traducida

Traducido da narración orixinal en inglés. O audio e os subtítulos dispoñibles son controlados por YouTube.

0:00 Se estás a planear construír un PC para executar axentes de IA locais, deixa de construír unha plataforma de xogos. Non necesitas un Core i9 de cinco punto oito xigahertz, un circuíto de refrixeración líquida, ou unha tarxeta gráfica de oito xigabytes cuberta de RGB. Na inferencia de IA local, as especificacións de xogos son practicamente inútiles. A única métrica que dita se o teu axente se executa ou se arrastra é a capacidade de VRAM e o ancho de banda do bus de memoria. Regras da proba de hardware: esquece os reloxos da CPU e os "benchmarks" de rasterización.

0:24 Interésannos tres números: ancho do bus de memoria, ancho de banda en xigabytes por segundo, e espazo libre de VRAM pura para o inchazo da caché KV. Nesta proba de campo, desglosarei o "salto" de ancho de banda da memoria de vinte-x, mapearei as regras de dimensionamento do modelo, farei unha avaliación de rendemento de tres niveis reais desde mil douscentos dólares ata cinco mil, e explicarei por que unha 3090 usada segue sendo o maior "cheat code" da informática. Este é The Daily Diff, proba de campo. Para entender por que as plataformas de xogos fallan, observa como se executa realmente a xeración de tokens. Nos xogos, a túa CPU alimenta as "draw calls" e a túa GPU renderiza os "frames".

0:54 Pero a decodificación autoregresiva de LLM está case puramente limitada polo ancho de banda da memoria. Para xerar un único token, a GPU debe transmitir cada parámetro de "peso" do modelo desde a memoria a través dos seus núcleos de cálculo. Se o teu modelo é de dez xigabytes, producir un token significa ler dez xigabytes de datos. Nunha Nvidia RTX 3090 cun bus de memoria de 384 bits, obtés 936 xigabytes por segundo de ancho de banda GDDR6X, producindo oitenta tokens por segundo. Pero observa o que acontece no instante en que o teu modelo excede a VRAM física.

1:22 Cando a VRAM se enche, os "runtimes" descargan as capas restantes polo bus PCIe á memoria DDR5 do sistema. Os teus núcleos da GPU esperan mil xigabytes por segundo. Pola contra, a DDR5 de dous canles aliméntaos con cincuenta, e o PCIe 4 estrangúlase en trinta e un. Isto é un colapso de ancho de banda de vinte-x. A cadea de xeración de tokens detense instantaneamente esperando polo bus, e a velocidade cae de corenta tokens por segundo a un punto cinco. Convertiches unha plataforma de dous mil dólares nun quentador de espazos.

1:47 E empeora durante as execucións de axentes con múltiples "turns", porque os "pesos" son só a metade da batalla. Cada "prompt", chamada a ferramenta e anaco de ficheiro gárdase na caché de "Key-Value". Unha ventá de contexto de trinta e dous-k pode consumir de catro a oito xigabytes de VRAM ademais dos "pesos". Se a túa tarxeta só ten dezaseis xigabytes, o teu axente repite dúas veces, chega ao muro de contexto e ou falla cun erro de "sen memoria" ou se derrama na DDR5. Aquí está a folla de trucos de dimensionamento de catro bits. Un modelo de sete ou oito mil millóns de parámetros como Llama 3.1 ou DeepSeek Distill

2:16 ocupa uns cinco xigabytes. Un modelo de catorce mil millóns ocupa dez xigabytes. Un modelo de trinta e dous mil millóns, o punto óptimo de intelixencia para axentes de codificación, require vinte xigabytes. E un modelo "frontier" de setenta mil millóns esixe corenta xigabytes antes de que sequera asignar contexto. O que nos leva ás construcións de hardware reais. O Nivel 1 é a plataforma inicial, de mil douscentos a mil cincocentos dólares. En PC, o teu anchor é unha RTX 4060 Ti de 16 xigabytes.

2:39 Advertencia crítica: nunca compre a versión de oito xigabytes para aforrar setenta dólares. Oito xigabytes de VRAM en 2026 é unha sentenza de morte inmediata por "falta de memoria" en calquera fluxo de traballo de axente real. Combínao cun Ryzen 5 de seis núcleos, sesenta e catro xigabytes de DDR5, e unha unidade NVMe de dous terabytes. No mundo de Apple, o equivalente é un Mac Mini ou MacBook Pro con dezaseis xigabytes de memoria unificada.

3:02 Verás de corenta a cincuenta tokens por segundo en modelos de oito mil millóns. O Nivel 2 é o punto óptimo para usuarios avanzados: construído especificamente para executar modelos de trinta e dous mil millóns de parámetros como Qwen 2.5 32B. A Ruta A é unha nova RTX 4070 Ti Super con dezaseis xigabytes por oitocentos dólares. Pero a Ruta B é a miña forte recomendación: compre unha Nvidia RTX 3090 usada de vinte e catro xigabytes. Podes atopar 3090s en bo estado en eBay por seiscentos cincuenta a setecentos cincuenta dólares. Iso dáche vinte e catro xigabytes de VRAM nun enorme bus de 384 bits que empuxa

3:33 936 xigabytes por segundo. Dólar por dólar, é a mellor oferta de VRAM na informática. En macOS, o equivalente do Nivel 2 é un Mac Mini M4 Pro con sesenta e catro xigabytes de memoria unificada. Produce de once a doce tokens por segundo nun modelo de trinta e dous mil millóns: máis lento que Nvidia, pero completamente silencioso a trinta vatios con espazo para unha xigantesca ventá de contexto. O Nivel 3 é o nivel para entusiastas para enxames de multi-axentes. En PC, iso significa unha RTX 4090 con vinte e catro xigabytes,

3:57 un Ryzen 9 e cento vinte e oito xigabytes de RAM, ou dúas RTX 3090 que proporcionan corenta e oito xigabytes de VRAM total. Na liña de Apple, isto é un Mac Studio Ultra con noventa e seis a cento e vinte e oito xigabytes de memoria unificada. O superpoder é a residencia en memoria: podes manter un modelo de incrustación, un enrutador rápido e un modelo de codificación de 32 mil millóns cargados simultaneamente con cero atraso de "swap". Agora, o fracaso honesto da nosa proba de campo: a trampa da computación "edge".

4:24 Cada semana unha publicación social afirma que podes executar axentes de codificación autónomos nunha Raspberry Pi 5 de oitenta dólares. Probeino. Executar un pequeno modelo de un punto cinco mil millóns de parámetros dache apenas tres tokens por segundo mentres a placa estrangúlase a oitenta e cinco graos Celsius. É un xoguete divertido para a fin de semana, pero como controlador de desenvolvemento diario, é puro castigo. Para software, usa Ollama se queres un "daemon" de liña de comandos limpo que se conecte

4:47 directamente a Cursor, Cline ou VS Code. Se queres un "playground" gráfico con descargas de modelos e deslizadores de capas da GPU, usa LM Studio. E fai coincidir o teu formato co teu silicio. En Apple Silicon, descarga sempre modelos GGUF optimizados para Metal. En Windows ou Linux con Nvidia, descarga modelos AWQ ou EXL2, que utilizan os "Tensor Cores" de Nvidia para unha inferencia un vinte a trinta por cento máis rápida. Entón, como despregas isto sen arruinarte?

5:11 Pensa no hardware local como un ximnasio doméstico fronte a un ximnasio comercial. Ter un "squat rack" na casa significa que adestras todos os días sen desprazamentos, sen taxas de subscrición e con total privacidade. A túa máquina local xestiona o oitenta por cento da túa codificación diaria, probas unitarias e procesamento de documentos privados por cero dólares por token. E cando necesites levantar cincocentas libras —como unha refactorización arquitectónica masiva de todo un repositorio en cincuenta ficheiros— visitas o ximnasio comercial: pagas a API na nube por Claude 3.5 Sonnet ou OpenAI o3 durante quince minutos

5:38 e sigues adiante. Aquí está a conta: unha construción de Nivel 2 cunha 3090 usada custa mil seiscentos dólares en total. Se gastas de cincuenta a cen dólares ao mes en tokens da API, págase en dezaoito meses mentres mantén o teu código propietario fóra de servidores de terceiros. Veredicto da proba de campo de hoxe: SHIP IT. A VRAM e o ancho de banda da memoria vencen ás velocidades de reloxo todas as veces. Deixa de mercar CPUs de cinco xigahertz para IA, e busca unha 3090 usada.

6:04 Dime que construción de hardware estás a usar para modelos locais nos comentarios. E se prefires ler esta análise, subscríbete ao boletín en the daily diff punto dev, ligazón debaixo. E esa é a diferenza por hoxe. Son Niko de Axrisi. Fai "merge" con responsabilidade.

## Fontes

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
