Panduan Perkakasan AI Tempatan (2026)
Apabila membina mesin untuk agen AI tempatan dan LLM berat terbuka, pembangun membuat kesilapan dengan membeli spesifikasi PC permainan: CPU 5.8 GHz, gelung penyejukan cecair tersuai, dan GPU permainan pantas dengan hanya 8GB VRAM.
Apabila membina mesin untuk agen AI tempatan dan LLM berat terbuka, pembangun membuat kesilapan dengan membeli spesifikasi PC permainan: CPU 5.8 GHz, gelung penyejukan cecair tersuai, dan GPU permainan pantas dengan hanya 8GB VRAM. Tetapi penjanaan token auteregresif adalah terikat pada lebar jalur memori, bukan terikat pada pengiraan: untuk mengeluarkan satu token, setiap berat dalam model mesti mengalir melalui bas memori. Apabila berat anda atau konteks cache KV melebihi VRAM fizikal, masa jalan akan memuatkan lapisan ke sistem DDR5 melalui PCIe, dan anda akan mengalami penurunan lebar jalur memori 20x: kelajuan menjunam dari 40 token sesaat kepada 1.5. Dalam ujian lapangan ini, Niko memecahkan mekanik perkakasan, peraturan saiz model kuantisasi 4-bit, tiga tahap bajet sebenar dari $1,200 hingga $5,000, mengapa RTX 3090 24GB terpakai adalah tawaran VRAM-per-dolar terbaik dalam pengkomputeran, perangkap tepi Raspberry Pi, dan strategi gim rumah untuk inferens tempatan berbanding awan. Keputusan: SHIP IT.
Baca edisi bertulis (Bahasa Inggeris) ↗
Apa yang diliputi video ini
- Penurunan lebar jalur memori 20x: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
- Saiz model @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Tahap 1 ($1,200–$1,500): RTX 4060 Ti 16GB (jangan sekali-kali 8GB) atau Mac Mini 16GB
- Tahap 2 ($1,500–$2,000): RTX 3090 24GB terpakai sweet spot atau Mac Mini M4 Pro 64GB
- Tahap 3 ($3,500+): RTX 4090 24GB / dwi 3090s atau Mac Studio Ultra
Transkrip terjemahan
Diterjemahkan daripada penceritaan asal Bahasa Inggeris. Audio dan kapsyen yang tersedia dikawal oleh YouTube.
0:00 Jika anda merancang untuk membina PC untuk menjalankan agen AI tempatan, berhentilah membina rig permainan. Anda tidak memerlukan Core i9 lima-titik-lapan gigahertz, gelung penyejukan cecair, atau kad grafik lapan-gigabyte yang diliputi RGB. Dalam inferens AI tempatan, spesifikasi permainan hampir tidak berguna. Satu-satunya metrik yang menentukan sama ada agen anda berjalan atau merangkak adalah kapasiti VRAM dan lebar jalur bas memori. Peraturan ujian perkakasan: lupakan jam CPU dan penanda aras rasterisasi.
0:24 Kami mengambil berat tentang tiga nombor: lebar bas memori, lebar jalur dalam gigabyte per saat, dan ruang kepala VRAM mentah untuk pembengkakan cache KV. Dalam ujian lapangan ini, saya akan memecahkan penurunan lebar jalur memori dua puluh-x, memetakan peraturan saiz model, menanda aras tiga tahap sebenar dari seribu dua ratus dolar hingga lima ribu, dan menjelaskan mengapa 3090 terpakai masih merupakan kod penipu terbesar dalam pengkomputeran. Ini The Daily Diff, ujian lapangan. Untuk memahami mengapa rig permainan gagal, lihat bagaimana penjanaan token sebenarnya berjalan. Dalam permainan, CPU anda memberi suapan panggilan lukisan dan GPU anda memaparkan bingkai.
0:54 Tetapi penyahkodan LLM auteregresif hampir sepenuhnya lebar jalur memori terikat. Untuk menjana satu token, GPU mesti mengalirkan setiap parameter berat model dari memori melalui teras pengiraannya. Jika model anda sepuluh gigabyte, menghasilkan satu token bermaksud membaca sepuluh gigabyte data. Pada Nvidia RTX 3090 dengan bas memori 384-bit, anda mendapat 936 gigabyte sesaat lebar jalur GDDR6X, menghasilkan lapan puluh token sesaat. Tetapi lihat apa yang berlaku pada milisaat model anda melebihi VRAM fizikal.
1:22 Apabila VRAM penuh, masa jalan akan memuatkan lapisan yang tinggal melalui bas PCIe ke memori sistem DDR5. Teras GPU anda mengharapkan seribu gigabyte sesaat. Sebaliknya, DDR5 dwi-saluran memberi suapan lima puluh, dan PCIe 4 tersedak pada tiga puluh satu. Itu adalah kejatuhan lebar jalur dua puluh-x. Saluran penjanaan token serta-merta terhenti menunggu pada bas, dan kelajuan menjunam dari empat puluh token sesaat kepada satu titik lima. Anda telah menukar rig dua ribu dolar menjadi pemanas ruang.
1:47 Dan ia menjadi lebih teruk semasa larian agen berbilang giliran, kerana berat hanyalah separuh pertempuran. Setiap gesaan, panggilan alat, dan cebisan fail disimpan dalam cache Key-Value. Tetingkap konteks tiga puluh dua-k boleh menggunakan empat hingga lapan gigabyte VRAM di atas berat. Jika kad anda hanya mempunyai enam belas gigabyte, agen anda berulang dua kali, mencapai dinding konteks, dan sama ada ranap dengan ralat "kehabisan memori" atau tumpah ke dalam DDR5. Berikut adalah helaian curang saiz empat-bit. Model parameter tujuh atau lapan bilion seperti Llama 3.1 atau DeepSeek Distill
2:16 mengambil kira-kira lima gigabyte. Model empat belas bilion mengambil sepuluh gigabyte. Model tiga puluh dua bilion, sweet spot kecerdasan untuk agen pengekodan, memerlukan dua puluh gigabyte. Dan model sembilan puluh bilion sempadan menuntut empat puluh gigabyte sebelum anda memperuntukkan konteks. Ini membawa kita kepada binaan perkakasan sebenar. Tahap 1 adalah rig permulaan, seribu dua ratus hingga seribu lima ratus dolar. Pada PC, jangkar anda adalah RTX 4060 Ti 16-gigabyte.
2:39 Amaran kritikal: jangan sekali-kali membeli versi lapan-gigabyte untuk menjimatkan tujuh puluh dolar. Lapan gigabyte VRAM pada tahun 2026 adalah hukuman mati "kehabisan memori" serta-merta pada mana-mana aliran kerja agen sebenar. Pasangkannya dengan Ryzen 5 enam teras, enam puluh empat gigabyte DDR5, dan pemacu NVMe dua terabyte. Di tanah Apple, yang setara adalah Mac Mini atau MacBook Pro dengan enam belas gigabyte memori bersatu.
3:02 Anda akan melihat empat puluh hingga lima puluh token sesaat pada model lapan bilion. Tahap 2 adalah sweet spot pengguna berkuasa: membina khusus untuk menjalankan model parameter tiga puluh dua bilion seperti Qwen 2.5 32B. Laluan A adalah RTX 4070 Ti Super baharu dengan enam belas gigabyte untuk lapan ratus dolar. Tetapi Laluan B adalah cadangan kuat saya: beli Nvidia RTX 3090 terpakai dua puluh empat gigabyte. Anda boleh mencari 3090s bersih di eBay dengan harga enam ratus lima puluh hingga tujuh ratus lima puluh dolar. Itu memberi anda dua puluh empat gigabyte VRAM pada bas 384-bit yang besar menolak
3:33 936 gigabyte sesaat. Dolar demi dolar, ia adalah tawaran VRAM terbaik dalam pengkomputeran. Pada macOS, rakan sejawat Tahap 2 adalah Mac Mini M4 Pro dengan enam puluh empat gigabyte memori bersatu. Ia menghasilkan sebelas hingga dua belas token sesaat pada model tiga puluh dua bilion: lebih perlahan daripada Nvidia, tetapi senyap sepenuhnya pada tiga puluh watt dengan ruang untuk tetingkap konteks gergasi. Tahap 3 adalah kurungan penggemar untuk swarm berbilang agen. Pada PC, itu bermakna RTX 4090 dengan dua puluh empat gigabyte,
3:57 Ryzen 9, dan seratus dua puluh lapan gigabyte RAM, atau dwi RTX 3090s menyediakan empat puluh lapan gigabyte VRAM keseluruhan. Dalam barisan Apple, ini adalah Mac Studio Ultra dengan sembilan puluh enam hingga seratus dua puluh lapan gigabyte memori bersatu. Kuasa besar adalah residensi memori: anda boleh menyimpan model embedding, penghala pantas, dan model pengekodan 32-bilion dimuat secara serentak dengan kelewatan swap sifar. Sekarang untuk kegagalan jujur ujian lapangan kami: perangkap pengkomputeran tepi.
4:24 Setiap minggu siaran sosial mendakwa anda boleh menjalankan agen pengekodan autonomi pada Raspberry Pi 5 lapan puluh dolar. Saya mengujinya. Menjalankan model parameter satu-titik-lima bilion yang kecil memberikan anda hampir tiga token sesaat sementara papan tercekik pada lapan puluh lima darjah Celsius. Ia adalah mainan hujung minggu yang menarik, tetapi sebagai pemacu pembangunan harian, ia adalah azab semata-mata. Untuk perisian, gunakan Ollama jika anda mahukan daemon baris perintah bersih yang bersambung
4:47 terus ke Cursor, Cline, atau VS Code. Jika anda mahukan taman permainan grafik dengan muat turun model dan peluncur lapisan GPU, gunakan LM Studio. Dan padankan format anda dengan silikon anda. Pada Apple Silicon, sentiasa muat turun model GGUF yang dioptimumkan untuk Metal. Pada Windows atau Linux dengan Nvidia, muat turun model AWQ atau EXL2, yang menggunakan Nvidia Tensor Cores untuk inferens dua puluh hingga tiga puluh peratus lebih pantas. Jadi bagaimana anda menggunakan ini tanpa muflis?
5:11 Fikirkan perkakasan tempatan seperti gim rumah berbanding gim komersial. Mempunyai rak squat di rumah bermakna anda berlatih setiap hari tanpa ulang-alik, yuran langganan sifar, dan privasi lengkap. Mesin tempatan anda mengendalikan lapan puluh peratus pengekodan harian anda, pengujian unit, dan pemprosesan dokumen peribadi dengan sifar dolar per token. Dan apabila anda perlu mengangkat beban mati lima ratus paun — seperti refaktor seni bina repo-lebar besar merentasi lima puluh fail — anda melawat gim komersial: bayar API awan untuk Claude 3.5 Sonnet atau OpenAI o3 selama lima belas minit
5:38 dan teruskan. Berikut adalah bil: binaan Tahap 2 dengan 3090 terpakai berharga seribu enam ratus dolar secara keseluruhan. Jika anda membelanjakan lima puluh hingga seratus dolar sebulan untuk token API, ia membayar sendiri dalam lapan belas bulan sambil memastikan pangkalan kod proprietari anda jauh dari pelayan pihak ketiga. Keputusan ujian lapangan hari ini: SHIP IT. VRAM dan lebar jalur memori mengalahkan kelajuan jam setiap masa. Berhenti membeli CPU lima-gigahertz untuk AI, dan pergi cari 3090 terpakai.
6:04 Beritahu saya binaan perkakasan apa yang anda gunakan untuk model tempatan di komen. Dan jika anda lebih suka membaca pecahan ini, dapatkan buletin di the daily diff dot dev, pautan di bawah. Dan itu perbezaan untuk hari ini. Saya Niko dari Axrisi. Gabungkan dengan bertanggungjawab.
Sumber
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



