本機端 AI 硬體指南 (2026)
為本機端 AI 代理和開源 LLM 建構機器時,開發人員常犯的錯誤是購買遊戲 PC 規格:5.8 GHz CPU、客製化液冷系統,以及只有 8GB VRAM 的快速遊戲 GPU。
為本機端 AI 代理和開源 LLM 建構機器時,開發人員常犯的錯誤是購買遊戲 PC 規格:5.8 GHz CPU、客製化液冷系統,以及只有 8GB VRAM 的快速遊戲 GPU。但自迴歸式詞元生成受記憶體頻寬限制,而非運算限制:為發出一個詞元,模型中的每個權重都必須跨記憶體匯流排傳輸。當您的權重或 KV 快取內容超出實體 VRAM 時,執行時會將層卸載到透過 PCIe 連接的系統 DDR5,此時您會遇到 20 倍的記憶體頻寬驟降:速度從每秒 40 個詞元驟降至 1.5 個詞元。在此實地測試中,Niko 拆解了硬體機制、4 位元量化模型尺寸規則、從 1,200 美元到 5,000 美元的三個實際預算等級、為什麼二手 RTX 3090 24GB 是運算中每美元 VRAM 最佳交易、Raspberry Pi 邊緣陷阱,以及本機與雲端推斷的家庭健身房策略。結論:SHIP IT。
本影片重點
- 20 倍記憶體頻寬驟降:936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
- 4 位元模型尺寸:8B (5GB)、14B (10GB)、32B (20GB)、70B (40GB)
- 等級 1 (1,200–1,500 美元):RTX 4060 Ti 16GB (絕非 8GB) 或 Mac Mini 16GB
- 等級 2 (1,500–2,000 美元):二手 RTX 3090 24GB 最佳點或 Mac Mini M4 Pro 64GB
- 等級 3 (3,500 美元以上):RTX 4090 24GB / 雙 3090 或 Mac Studio Ultra
翻譯文字稿
譯自英文原版旁白。可用的音訊和字幕由 YouTube 控制。
0:00 如果您正計畫組裝一台 PC 以執行本機 AI 代理, 請停止組裝遊戲機。 您不需要 5.8 GHz 的 Core i9 處理器、液體冷卻系統, 或是覆蓋 RGB 的 8GB 顯示卡。 在本機 AI 推斷中,遊戲規格幾乎毫無用處。 唯一決定您的代理程式是運作還是緩慢的指標是 VRAM 容量 以及記憶體匯流排頻寬。 硬體測試規則:忘記 CPU 時脈和光柵化基準。
0:24 我們關心三個數字:記憶體匯流排寬度、每秒 GB 的頻寬, 以及用於 KV 快取膨脹的原始 VRAM 空間。 在此實地測試中,我將拆解 20 倍記憶體頻寬驟降, 繪製模型尺寸規則,基準測試從 1,200 美元到 5,000 美元的三個實際等級, 並解釋為何二手 3090 仍然是運算領域最棒的作弊碼。這是 The Daily Diff,實地測試。 cheat code. This is The Daily Diff, field test. 要了解遊戲機為何失敗,請看詞元生成實際是如何執行的。 在遊戲中,您的 CPU 供給繪圖指令,您的 GPU 渲染畫面。
0:54 但自迴歸 LLM 解碼幾乎完全受記憶體頻寬 限制。要生成一個詞元,GPU 必須將模型的每個權重參數從記憶體經由其運算核心傳輸。 從記憶體經由其運算核心傳輸。 如果您的模型是 10GB,產生一個詞元意味著讀取 10GB 的資料。在具有 384 位元記憶體匯流排的 Nvidia RTX 3090 上, 您可以獲得每秒 936GB 的 GDDR6X 頻寬, 每秒產生 80 個詞元。 但請看您的模型超出實體 VRAM 的那一瞬間會發生什麼。
1:22 當 VRAM 滿載時,執行時會將剩餘的層經由 PCIe 匯流排卸載到 系統 DDR5 記憶體。 您的 GPU 核心預期每秒 1,000GB。 然而,雙通道 DDR5 卻只提供 50GB,而 PCIe 4 在 31GB 時就會卡住。 這是 20 倍的頻寬崩潰。 詞元生成管線會立即因等待匯流排而停滯, 速度從每秒 40 個詞元驟降至 1.5 個詞元。 您將一台 2,000 美元的機器變成了一個空間加熱器。
1:47 在多輪代理執行期間情況會更糟,因為權重只是一半的戰鬥。 每個提示、工具呼叫和檔案區塊都儲存在鍵值 快取中。32K 的上下文視窗可以在權重之上消耗 4 到 8GB 的 VRAM。 如果您的顯示卡只有 16GB,您的代理程式會循環兩次, 達到上下文限制,然後因記憶體不足錯誤而崩潰,或溢出到 DDR5。這是 4 位元尺寸備忘單。 一個 7 或 80 億參數模型,例如 Llama 3.1 或 DeepSeek Distill,
2:16 大約需要 5GB。 一個 140 億參數模型需要 10GB。 一個 320 億參數模型,對於程式碼代理來說是智慧的最佳點, 需要 20GB。 而一個 700 億邊界模型甚至在您分配上下文之前就需要 40GB。 這讓我們來到了實際的硬體建構。 等級 1 是入門級裝備,1,200 到 1,500 美元。 在 PC 上,您的核心是 RTX 4060 Ti 16GB。
2:39 關鍵警告:絕不要購買 8GB 版本以節省 70 美元。 在 2026 年,8GB VRAM 在任何實際代理工作流程中都是立即的記憶體不足死刑。 在任何實際代理工作流程中都是立即的記憶體不足死刑。 將它與 6 核心 Ryzen 5、64GB DDR5, 和 2TB NVMe 硬碟搭配。 在 Apple 方面,等效的是配備 16GB 統一記憶體的 Mac Mini 或 MacBook Pro。 的統一記憶體。
3:02 在 80 億參數模型上,您將看到每秒 40 到 50 個詞元。 等級 2 是進階用戶的最佳點:專門為執行 320 億參數模型,例如 Qwen 2.5 32B,而建構。 途徑 A 是新的 RTX 4070 Ti Super,配備 16GB,價格為 800 美元。 但我強烈推薦途徑 B:購買一張二手 Nvidia RTX 3090 24GB。您可以在 eBay 上找到狀況良好的 3090,價格在 650 到 750 美元之間。 到 750 美元之間。 這將為您提供 24GB VRAM,位於巨大的 384 位元匯流排上,每秒可傳輸
3:33 936GB。 以美元計算,這是運算領域中最佳的 VRAM 交易。 在 macOS 上,等級 2 的對應產品是配備 64GB 統一記憶體的 Mac Mini M4 Pro。 的統一記憶體。 它在 320 億參數模型上每秒產生 11 到 12 個詞元: 比 Nvidia 慢,但在 30 瓦的功耗下卻異常安靜,並有足夠的空間容納巨大的 上下文視窗。等級 3 是針對多代理集群的愛好者級別。 在 PC 上,這意味著 RTX 4090 配備 24GB,
3:57 Ryzen 9 處理器,以及 128GB RAM, 或者雙 RTX 3090,提供總共 48GB 的 VRAM。 在 Apple 的產品線中,這是配備 96 到 128GB 統一記憶體的 Mac Studio Ultra。 的統一記憶體。 它的超能力是記憶體駐留:您可以同時載入一個嵌入模型、 一個快速路由器和一個 320 億參數的程式碼模型, 且沒有交換延遲。 現在來說說我們實地測試的誠實失敗:邊緣運算陷阱。
4:24 每週都有社交貼文聲稱您可以在 80 美元的 Raspberry Pi 5 上執行自主程式碼代理。 80 美元的 Raspberry Pi 5。 我測試過了。 執行一個小小的 15 億參數模型,您只能得到每秒不到 3 個詞元,同時電路板會因 85 攝氏度而降頻。 詞元,同時電路板會因 85 攝氏度而降頻。 它是一個有趣的週末玩具,但作為日常開發驅動程式, 它純粹是折磨。 對於軟體,如果您想要一個能直接連接到 Cursor、Cline 或 VS Code 的乾淨命令列精靈,請使用 Ollama。
4:47 如果您想要一個能直接連接到 Cursor、Cline 或 VS Code 的乾淨命令列精靈,請使用 Ollama。 如果您想要一個帶有模型下載和 GPU 層滑塊的圖形化遊樂場, 請使用 LM Studio。 並將您的格式與您的晶片匹配。 在 Apple Silicon 上,請務必下載針對 Metal 優化的 GGUF 模型。 在配備 Nvidia 顯示卡的 Windows 或 Linux 上,下載 AWQ 或 EXL2 模型, 它們利用 Nvidia Tensor 核心,可將推斷速度提高 20% 到 30%。 那麼,您如何在不破產的情況下部署它呢?
5:11 將本機硬體想像成家用健身房與商業健身房。 在家裡擁有深蹲架意味著您可以每天訓練,無需通勤、 零訂閱費,並享有完全的隱私。 您的本機機器處理您日常 80% 的編碼、 單元測試和私人文件處理,每詞元零費用。 當您需要舉起 500 磅的重量 — 就像跨 50 個檔案進行大規模的程式碼庫重構時 — 您可以前往商業健身房: 程式碼庫重構 — 您可以前往商業健身房: 支付 Claude 3.5 Sonnet 或 OpenAI o3 的雲端 API 費用 15 分鐘,
5:38 然後繼續。 這是帳單:一個使用二手 3090 的等級 2 建置,總價為 1,600 美元。 如果您每月花費 50 到 100 美元在 API 詞元上, 它將在 18 個月內回本,同時將您的專有程式碼庫 保留在第三方伺服器之外。 今天的實地測試結論:SHIP IT。 VRAM 和記憶體頻寬每次都勝過時脈速度。 不要再為 AI 購買 5GHz 的 CPU,去尋找一張二手 3090 吧。
6:04 在評論中告訴我您正在為本機模型運行什麼樣的硬體建置。 如果您想閱讀這份拆解分析,請訂閱 daily diff dot dev 的電子報,連結如下。 這就是今天的 The Daily Diff。 我是 Axrisi 的 Niko。 負責任地合併。
來源
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



