La guía de hardware de IA local (2026)
Al construir una máquina para agentes de IA locales y LLM de peso abierto, los desarrolladores cometen el error de comprar especificaciones de PC para juegos: CPU de 5.8 GHz, circuitos de enfriamiento líquido personalizados y GPU de juego rápidas con solo 8GB de VRAM.
Al construir una máquina para agentes de IA locales y LLM de peso abierto, los desarrolladores cometen el error de comprar especificaciones de PC para juegos: CPU de 5.8 GHz, circuitos de enfriamiento líquido personalizados y GPU de juego rápidas con solo 8GB de VRAM. Pero la generación de tokens autorregresivos está limitada por el ancho de banda de la memoria, no por el cálculo: para emitir un solo token, cada peso en el modelo debe transmitirse a través del bus de memoria. Cuando sus pesos o el contexto de la caché KV exceden la VRAM física, el tiempo de ejecución descarga las capas al sistema DDR5 a través de PCIe, y se produce un "cliff" de ancho de banda de memoria de 20x: la velocidad cae en picada de 40 tokens por segundo a 1.5. En esta prueba de campo, Niko desglosa la mecánica del hardware, las reglas de tamaño del modelo de cuantificación de 4 bits, tres niveles de presupuesto reales de $1,200 a $5,000, por qué una RTX 3090 24GB usada es la mejor oferta de VRAM por dólar en computación, la trampa del "edge" de Raspberry Pi y la estrategia de "gimnasio en casa" para la inferencia local versus en la nube. Veredicto: SHIP IT.
Leer la edición escrita (inglés) ↗
Lo que cubre este video
- El "cliff" de ancho de banda de memoria de 20x: 936 GB/s GDDR6X vs 50 GB/s DDR5 y 31.5 GB/s PCIe
- Tamaño del modelo @ 4 bits: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Nivel 1 ($1,200–$1,500): RTX 4060 Ti 16GB (nunca 8GB) o Mac Mini 16GB
- Nivel 2 ($1,500–$2,000): Punto ideal de RTX 3090 24GB usada o Mac Mini M4 Pro 64GB
- Nivel 3 ($3,500+): RTX 4090 24GB / dual 3090s o Mac Studio Ultra
Transcripción traducida
Traducido de la narración original en inglés. El audio y los subtítulos disponibles son controlados por YouTube.
0:00 Si estás pensando en construir una PC para ejecutar agentes de IA locales, deja de construir una plataforma de juegos. No necesitas un Core i9 de cinco punto ocho gigahercios, un circuito de enfriamiento líquido, o una tarjeta gráfica de ocho gigabytes cubierta de RGB. En la inferencia de IA local, las especificaciones de juego son prácticamente inútiles. La única métrica que dicta si tu agente funciona o se arrastra es la capacidad de VRAM y el ancho de banda del bus de memoria. Reglas de la prueba de hardware: olvídate de los relojes de CPU y los benchmarks de rasterización.
0:24 Nos importan tres números: el ancho del bus de memoria, el ancho de banda en gigabytes por segundo y el espacio libre de VRAM para el "bloat" de la caché KV. En esta prueba de campo, desglosaré el "cliff" de ancho de banda de memoria de veinte-x, mapearé las reglas de tamaño del modelo, compararé tres niveles reales desde mil doscientos dólares hasta cinco mil, y explicaré por qué una 3090 usada sigue siendo el mayor "cheat code" de la computación. Esto es The Daily Diff, prueba de campo. Para entender por qué las plataformas de juego fallan, mira cómo se ejecuta realmente la generación de tokens. En los juegos, tu CPU alimenta las llamadas de dibujo y tu GPU renderiza los fotogramas.
0:54 Pero la decodificación autorregresiva de LLM está casi puramente limitada por el ancho de banda de la memoria. Para generar un solo token, la GPU debe transmitir cada parámetro de peso del modelo desde la memoria a través de sus núcleos de cómputo. Si tu modelo es de diez gigabytes, producir un token significa leer diez gigabytes de datos. En una Nvidia RTX 3090 con un bus de memoria de 384 bits, obtienes 936 gigabytes por segundo de ancho de banda GDDR6X, produciendo ochenta tokens por segundo. Pero mira lo que sucede en el milisegundo en que tu modelo excede la VRAM física.
1:22 Cuando la VRAM se llena, los tiempos de ejecución descargan las capas restantes a través del bus PCIe a la memoria del sistema DDR5. Tus núcleos de GPU esperan mil gigabytes por segundo. En cambio, la DDR5 de doble canal les entrega cincuenta, y PCIe 4 se ahoga a treinta y uno. Eso es un colapso de ancho de banda de veinte-x. El pipeline de generación de tokens se detiene instantáneamente esperando en el bus, y la velocidad cae en picada de cuarenta tokens por segundo a uno punto cinco. Has convertido una plataforma de dos mil dólares en un calentador de espacio.
1:47 Y empeora durante las ejecuciones de agentes de varias vueltas, porque los pesos son solo la mitad de la batalla. Cada prompt, llamada a herramienta y fragmento de archivo se almacena en la caché de Key-Value. Una ventana de contexto de treinta y dos mil puede consumir de cuatro a ocho gigabytes de VRAM además de los pesos. Si tu tarjeta solo tiene dieciséis gigabytes, tu agente hace dos bucles, golpea el muro de contexto y se bloquea con un error de falta de memoria o se desborda en DDR5. Aquí está la hoja de trucos de tamaño de 4 bits. Un modelo de siete u ocho mil millones de parámetros como Llama 3.1 o DeepSeek Distill
2:16 ocupa unos cinco gigabytes. Un modelo de catorce mil millones ocupa diez gigabytes. Un modelo de treinta y dos mil millones, el punto óptimo de inteligencia para los agentes de codificación, requiere veinte gigabytes. Y un modelo de frontera de setenta mil millones exige cuarenta gigabytes antes de que siquiera asignar contexto. Lo que nos lleva a las construcciones de hardware reales. El Nivel 1 es la plataforma de inicio, de mil doscientos a mil quinientos dólares. En PC, tu ancla es una RTX 4060 Ti de 16 gigabytes.
2:39 Advertencia crítica: nunca compres la versión de ocho gigabytes para ahorrar setenta dólares. Ocho gigabytes de VRAM en 2026 es una sentencia de muerte inmediata por falta de memoria en cualquier flujo de trabajo de agente real. Combínalo con un Ryzen 5 de seis núcleos, sesenta y cuatro gigabytes de DDR5, y una unidad NVMe de dos terabytes. En el mundo de Apple, el equivalente es un Mac Mini o MacBook Pro con dieciséis gigabytes de memoria unificada.
3:02 Verás de cuarenta a cincuenta tokens por segundo en modelos de ocho mil millones. El Nivel 2 es el punto ideal para usuarios avanzados: construir específicamente para ejecutar modelos de treinta y dos mil millones de parámetros como Qwen 2.5 32B. La Ruta A es una nueva RTX 4070 Ti Super con dieciséis gigabytes por ochocientos dólares. Pero la Ruta B es mi fuerte recomendación: compra una Nvidia RTX 3090 usada de veinticuatro gigabytes. Puedes encontrar 3090 limpias en eBay por seiscientos cincuenta a setecientos cincuenta dólares. Eso te da veinticuatro gigabytes de VRAM en un enorme bus de 384 bits empujando
3:33 936 gigabytes por segundo. Dólar por dólar, es la mejor oferta de VRAM en la computación. En macOS, la contraparte del Nivel 2 es un Mac Mini M4 Pro con sesenta y cuatro gigabytes de memoria unificada. Produce de once a doce tokens por segundo en un modelo de treinta y dos mil millones: más lento que Nvidia, pero completamente silencioso a treinta vatios con espacio para una gigantesca ventana de contexto. El Nivel 3 es el nivel entusiasta para enjambres multiagente. En PC, eso significa una RTX 4090 con veinticuatro gigabytes,
3:57 un Ryzen 9 y ciento veintiocho gigabytes de RAM, o dos RTX 3090 que proporcionan cuarenta y ocho gigabytes de VRAM total. En la línea de Apple, esto es un Mac Studio Ultra con noventa y seis a ciento veintiocho gigabytes de memoria unificada. El superpoder es la residencia en memoria: puedes mantener un modelo de incrustación, un enrutador rápido y un modelo de codificación de 32 mil millones cargados simultáneamente con cero retraso de intercambio. Ahora, el fracaso honesto de nuestra prueba de campo: la trampa de la computación de borde.
4:24 Cada semana, una publicación social afirma que puedes ejecutar agentes de codificación autónomos en una Raspberry Pi 5 de ochenta dólares. Lo probé. Ejecutar un pequeño modelo de uno punto cinco mil millones de parámetros apenas te da tres tokens por segundo mientras la placa se estrangula a ochenta y cinco grados Celsius. Es un bonito juguete de fin de semana, pero como controlador de desarrollo diario, es puro castigo. Para software, usa Ollama si quieres un demonio de línea de comandos limpio que se conecte
4:47 directamente a Cursor, Cline o VS Code. Si quieres un "playground" gráfico con descargas de modelos y deslizadores de capas de GPU, usa LM Studio. Y haz que tu formato coincida con tu silicio. En Apple Silicon, descarga siempre modelos GGUF optimizados para Metal. En Windows o Linux con Nvidia, descarga modelos AWQ o EXL2, que utilizan los Tensor Cores de Nvidia para una inferencia de veinte a treinta por ciento más rápida. ¿Entonces cómo despliegas esto sin arruinarte?
5:11 Piensa en el hardware local como un gimnasio en casa versus un gimnasio comercial. Tener un rack de sentadillas en casa significa que entrenas todos los días sin viajar, sin cuotas de suscripción y con total privacidad. Tu máquina local maneja el ochenta por ciento de tu codificación diaria, pruebas unitarias y procesamiento de documentos privados por cero dólares por token. Y cuando necesitas levantar quinientas libras —como una refactorización arquitectónica masiva de todo el repositorio en cincuenta archivos— visitas el gimnasio comercial: pagas la API en la nube por Claude 3.5 Sonnet o OpenAI o3 durante quince minutos
5:38 y sigues adelante. Aquí está la factura: una construcción de Nivel 2 con una 3090 usada cuesta mil seiscientos dólares en total. Si gastas de cincuenta a cien dólares al mes en tokens de API, se amortiza en dieciocho meses mientras mantienes tu base de código propietaria fuera de servidores de terceros. El veredicto de la prueba de campo de hoy: SHIP IT. VRAM y el ancho de banda de la memoria superan las velocidades de reloj una y otra vez. Deja de comprar CPUs de cinco gigahercios para IA y busca una 3090 usada.
6:04 Cuéntame qué configuración de hardware estás usando para modelos locales en los comentarios. Y si prefieres leer este desglose, suscríbete al boletín en the daily diff dot dev, enlace abajo. Y esa es la diferencia de hoy. Soy Niko de Axrisi. Fusiona con responsabilidad.
Fuentes
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



