# O Guia de Hardware de IA Local (2026)

Published: 2026-09-14

Ao construir uma máquina para agentes de IA locais e LLMs de peso aberto, os programadores cometem o erro de comprar especificações de PC de jogos: CPUs de 5.8 GHz, loops de arrefecimento líquido personalizados e GPUs de jogos rápidas com apenas 8GB de VRAM. Mas a geração de tokens autorregressiva é limitada pela largura de banda da memória, não pela capacidade de computação: para emitir um único token, cada peso no modelo deve fluir pelo barramento de memória. Quando os seus pesos ou contexto de cache KV excedem a VRAM física, o tempo de execução descarrega camadas para o sistema DDR5 via PCIe, e atinge um 'cliff' de largura de banda de memória de 20x: a velocidade cai de 40 tokens por segundo para 1.5. Neste teste de campo, o Niko detalha a mecânica do hardware, as regras de dimensionamento de modelos de quantização de 4 bits, três níveis de orçamento reais de $1,200 a $5,000, porque uma RTX 3090 24GB usada é o melhor negócio de VRAM por dólar em computação, a armadilha de 'edge' do Raspberry Pi, e a estratégia de ginásio em casa para inferência local versus cloud. Veredicto: SHIP IT.

Canonical: https://thedailydiff.dev/pt-PT/video/2026-09-14-local-ai-hardware/

## O que este vídeo aborda

- O 'cliff' de largura de banda de memória de 20x: 936 GB/s GDDR6X vs 50 GB/s DDR5 &amp; 31.5 GB/s PCIe
- Dimensionamento de modelo @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Nível 1 ($1,200–$1,500): RTX 4060 Ti 16GB (nunca 8GB) ou Mac Mini 16GB
- Nível 2 ($1,500–$2,000): Ponto ideal de RTX 3090 24GB usada ou Mac Mini M4 Pro 64GB
- Nível 3 ($3,500+): RTX 4090 24GB / duas 3090s ou Mac Studio Ultra

## Transcrição traduzida

Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.

0:00 Se está a planear construir um PC para executar agentes de IA locais, pare de construir uma máquina de jogos. Não precisa de um Core i9 de cinco vírgula oito gigahertz, um loop de arrefecimento líquido, ou uma placa gráfica de oito gigabytes coberta de RGB. Na inferência de IA local, as especificações de jogos são virtualmente inúteis. A única métrica que dita se o seu agente funciona ou rasteja é a capacidade de VRAM e a largura de banda do barramento de memória. Regras do teste de hardware: esqueça os clocks da CPU e os benchmarks de rasterização.

0:24 Interessam-nos três números: largura do barramento de memória, largura de banda em gigabytes por segundo, e folga de VRAM bruta para o inchaço da cache KV. Neste teste de campo, detalharei o 'cliff' de largura de banda de memória de vinte vezes, mapearei as regras de dimensionamento de modelos, farei um benchmark de três níveis reais de mil e duzentos dólares a cinco mil, e explicarei porque uma 3090 usada ainda é o maior 'cheat code' da computação. Este é The Daily Diff, teste de campo. Para entender porque as máquinas de jogos falham, veja como a geração de tokens realmente é executada. Nos jogos, a sua CPU alimenta as chamadas de desenho e a sua GPU renderiza os frames.

0:54 Mas a descodificação autorregressiva de LLM é quase puramente limitada pela largura de banda da memória. Para gerar um único token, a GPU deve transmitir cada parâmetro de peso do modelo da memória através dos seus núcleos de computação. Se o seu modelo tem dez gigabytes, produzir um token significa ler dez gigabytes de dados. Numa Nvidia RTX 3090 com um barramento de memória de 384 bits, obtém 936 gigabytes por segundo de largura de banda GDDR6X, produzindo oitenta tokens por segundo. Mas observe o que acontece no milissegundo em que o seu modelo excede a VRAM física.

1:22 Quando a VRAM se esgota, os tempos de execução descarregam as camadas restantes através do barramento PCIe para a memória DDR5 do sistema. Os seus núcleos de GPU esperam mil gigabytes por segundo. Em vez disso, a DDR5 de canal duplo fornece-lhes cinquenta, e o PCIe 4 'engasga' a trinta e um. Isso é um colapso de largura de banda de vinte vezes. O pipeline de geração de tokens instantaneamente 'estaciona' à espera no barramento, e a velocidade cai de quarenta tokens por segundo para um ponto cinco. Transformou uma máquina de dois mil dólares num aquecedor.

1:47 E piora durante as execuções de agentes com múltiplas voltas, porque os pesos são apenas metade da batalha. Cada 'prompt', chamada de ferramenta e 'chunk' de ficheiro é armazenado na cache 'Key-Value'. Uma janela de contexto de trinta e dois mil pode consumir de quatro a oito gigabytes de VRAM além dos pesos. Se a sua placa tem apenas dezasseis gigabytes, o seu agente executa duas vezes, atinge a parede de contexto e ou falha com um erro de falta de memória ou 'derrama' para a DDR5. Aqui está a 'cheat sheet' de dimensionamento de quatro bits. Um modelo de sete ou oito mil milhões de parâmetros como o Llama 3.1 ou o DeepSeek Distill

2:16 ocupa cerca de cinco gigabytes. Um modelo de catorze mil milhões ocupa dez gigabytes. Um modelo de trinta e dois mil milhões, o ponto ideal de inteligência para agentes de codificação, requer vinte gigabytes. E um modelo de ponta de setenta mil milhões exige quarenta gigabytes antes mesmo de alocar contexto. O que nos leva às construções de hardware reais. O Nível 1 é a máquina inicial, de mil e duzentos a mil e quinhentos dólares. No PC, a sua âncora é uma RTX 4060 Ti de 16 gigabytes.

2:39 Aviso crítico: nunca compre a versão de oito gigabytes para poupar setenta dólares. Oito gigabytes de VRAM em 2026 é uma sentença de morte imediata por falta de memória em qualquer fluxo de trabalho de agente real. Emparelhe-a com um Ryzen 5 de seis núcleos, sessenta e quatro gigabytes de DDR5, e uma drive NVMe de dois terabytes. No mundo Apple, o equivalente é um Mac Mini ou MacBook Pro com dezasseis gigabytes de memória unificada.

3:02 Verá quarenta a cinquenta tokens por segundo em modelos de oito mil milhões. O Nível 2 é o ponto ideal para utilizadores avançados: construção especificamente para executar modelos de trinta e dois mil milhões de parâmetros como o Qwen 2.5 32B. O Caminho A é uma nova RTX 4070 Ti Super com dezasseis gigabytes por oitocentos dólares. Mas o Caminho B é a minha forte recomendação: compre uma Nvidia RTX 3090 usada de vinte e quatro gigabytes. Pode encontrar 3090s 'limpas' no eBay por seiscentos e cinquenta a setecentos e cinquenta dólares. Isso dá-lhe vinte e quatro gigabytes de VRAM num enorme barramento de 384 bits a impulsionar

3:33 936 gigabytes por segundo. Dólar por dólar, é o melhor negócio de VRAM em computação. No macOS, a contraparte do Nível 2 é um Mac Mini M4 Pro com sessenta e quatro gigabytes de memória unificada. Produz onze a doze tokens por segundo num modelo de trinta e dois mil milhões: mais lento que a Nvidia, mas completamente silencioso a trinta watts com espaço para uma janela de contexto gigante. O Nível 3 é o escalão entusiasta para enxames multi-agente. No PC, isso significa uma RTX 4090 com vinte e quatro gigabytes,

3:57 um Ryzen 9 e cento e vinte e oito gigabytes de RAM, ou duas RTX 3090s fornecendo quarenta e oito gigabytes de VRAM total. Na linha de produtos da Apple, isto é um Mac Studio Ultra com noventa e seis a cento e vinte e oito gigabytes de memória unificada. O superpoder é a residência da memória: pode manter um modelo de incorporação, um router rápido e um modelo de codificação de 32 mil milhões carregados simultaneamente com zero atraso de troca. Agora, para a falha honesta do nosso teste de campo: a armadilha da computação de ponta.

4:24 Toda semana uma publicação social afirma que pode executar agentes de codificação autónomos num Raspberry Pi 5 de oitenta dólares. Eu testei. Executar um pequeno modelo de um ponto cinco mil milhões de parâmetros dá-lhe apenas três tokens por segundo enquanto a placa acelera a oitenta e cinco graus Celsius. É um brinquedo divertido para o fim de semana, mas como um driver de desenvolvimento diário, é pura punição. Para software, use o Ollama se quiser um daemon de linha de comando limpo que se conecta

4:47 diretamente ao Cursor, Cline ou VS Code. Se quiser um ambiente gráfico com downloads de modelos e 'sliders' de camadas de GPU, use o LM Studio. E combine o seu formato com o seu silício. No Apple Silicon, descarregue sempre modelos GGUF otimizados para Metal. No Windows ou Linux com Nvidia, descarregue modelos AWQ ou EXL2, que utilizam os Nvidia Tensor Cores para uma inferência vinte a trinta por cento mais rápida. Então, como implementa isto sem ir à falência?

5:11 Pense no hardware local como um ginásio em casa versus um ginásio comercial. Ter um rack de agachamento em casa significa que treina todos os dias com zero deslocamento, zero taxas de subscrição e total privacidade. A sua máquina local lida com oitenta por cento da sua codificação diária, testes unitários e processamento de documentos privados por zero dólares por token. E quando precisa de levantar duzentos e cinquenta quilos — como uma refatoração arquitetónica massiva em todo o repositório em cinquenta ficheiros — visita o ginásio comercial: pague a API da cloud por Claude 3.5 Sonnet ou OpenAI o3 por quinze minutos

5:38 e siga em frente. Aqui está a conta: uma construção de Nível 2 com uma 3090 usada custa mil e seiscentos dólares tudo incluído. Se gastar cinquenta a cem dólares por mês em tokens de API, paga-se em dezoito meses enquanto mantém a sua base de código proprietária fora de servidores de terceiros. Veredicto do teste de campo de hoje: SHIP IT. VRAM e largura de banda de memória superam as velocidades de clock sempre. Pare de comprar CPUs de cinco gigahertz para IA e vá encontrar uma 3090 usada.

6:04 Diga-me qual a configuração de hardware que está a usar para modelos locais nos comentários. E se preferir ler esta análise, pegue a 'newsletter' em the daily diff dot dev, link abaixo. E essa é a diferença de hoje. Eu sou o Niko da Axrisi. Faça 'merge' responsavelmente.

## Fontes

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
