+− THE DAILY DIFFdev & AI news
SHIP IT

Hướng dẫn phần cứng AI cục bộ (2026)

Khi xây dựng một cỗ máy cho các tác nhân AI cục bộ và các LLM trọng lượng mở, các nhà phát triển mắc sai lầm khi mua các thông số kỹ thuật của PC chơi game: CPU 5,8 GHz, hệ thống tản nhiệt nước tùy chỉnh và GPU chơi game nhanh chỉ với 8GB VRAM.

Khi xây dựng một cỗ máy cho các tác nhân AI cục bộ và các LLM trọng lượng mở, các nhà phát triển mắc sai lầm khi mua các thông số kỹ thuật của PC chơi game: CPU 5,8 GHz, hệ thống tản nhiệt nước tùy chỉnh và GPU chơi game nhanh chỉ với 8GB VRAM. Nhưng việc tạo token tự hồi quy bị giới hạn bởi băng thông bộ nhớ, không phải giới hạn bởi tính toán: để phát ra một token duy nhất, mọi trọng số trong mô hình phải truyền qua bus bộ nhớ. Khi trọng số của bạn hoặc ngữ cảnh bộ đệm KV vượt quá VRAM vật lý, thời gian chạy sẽ chuyển các lớp đến hệ thống DDR5 qua PCIe và bạn gặp phải ngưỡng băng thông bộ nhớ 20 lần: tốc độ giảm mạnh từ 40 token mỗi giây xuống còn 1,5. Trong thử nghiệm thực địa này, Niko sẽ phân tích cơ chế phần cứng, các quy tắc định cỡ mô hình lượng tử hóa 4-bit, ba mức ngân sách thực tế từ 1.200 đô la đến 5.000 đô la, lý do tại sao một chiếc RTX 3090 24GB đã qua sử dụng là thỏa thuận VRAM trên mỗi đô la tốt nhất trong điện toán, bẫy biên của Raspberry Pi và chiến lược phòng tập thể dục tại nhà cho suy luận cục bộ so với đám mây. Phán quyết: SHIP IT.

Đọc phiên bản viết (tiếng Anh) ↗

Nội dung video này đề cập

  • Ngưỡng băng thông bộ nhớ 20 lần: 936 GB/s GDDR6X so với 50 GB/s DDR5 & 31,5 GB/s PCIe
  • Kích thước mô hình @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Cấp 1 (1.200–1.500 đô la): RTX 4060 Ti 16GB (không bao giờ 8GB) hoặc Mac Mini 16GB
  • Cấp 2 (1.500–2.000 đô la): RTX 3090 24GB đã qua sử dụng là điểm ngọt hoặc Mac Mini M4 Pro 64GB
  • Cấp 3 (3.500+ đô la): RTX 4090 24GB / dual 3090s hoặc Mac Studio Ultra

Bản ghi đã dịch

Được dịch từ lời tường thuật tiếng Anh gốc. Âm thanh và phụ đề có sẵn được điều khiển bởi YouTube.

0:00 Nếu bạn đang có kế hoạch xây dựng một PC để chạy các tác nhân AI cục bộ, hãy ngừng xây dựng một dàn máy chơi game. Bạn không cần một Core i9 5,8 gigahertz, một hệ thống tản nhiệt nước tùy chỉnh, hoặc một card đồ họa 8 gigabyte phủ đầy RGB. Trong suy luận AI cục bộ, thông số kỹ thuật chơi game gần như vô dụng. Chỉ số duy nhất quyết định liệu tác nhân của bạn chạy hay bò là dung lượng VRAM và băng thông bus bộ nhớ. Quy tắc thử nghiệm phần cứng: quên xung nhịp CPU và điểm chuẩn rasterization.

0:24 Chúng ta quan tâm đến ba con số: độ rộng bus bộ nhớ, băng thông tính bằng gigabyte mỗi giây và khoảng trống VRAM thô cho sự phình to của bộ đệm KV. Trong thử nghiệm thực địa này, tôi sẽ phân tích ngưỡng băng thông bộ nhớ 20 lần, lập bản đồ các quy tắc định cỡ mô hình, điểm chuẩn ba cấp thực tế từ mười hai trăm đô la đến năm nghìn, và giải thích tại sao một chiếc 3090 đã qua sử dụng vẫn là mã gian lận lớn nhất của điện toán. Đây là The Daily Diff, thử nghiệm thực địa. Để hiểu tại sao các dàn máy chơi game thất bại, hãy xem cách tạo token thực sự thực hiện. Trong các trò chơi, CPU của bạn cung cấp các lệnh vẽ và GPU của bạn hiển thị các khung hình.

0:54 Nhưng giải mã LLM tự hồi quy gần như hoàn toàn bị giới hạn bởi băng thông bộ nhớ. Để tạo một token duy nhất, GPU phải truyền mọi tham số trọng số của mô hình từ bộ nhớ qua các lõi tính toán của nó. Nếu mô hình của bạn là mười gigabyte, việc tạo một token có nghĩa là đọc mười gigabyte dữ liệu. Trên một Nvidia RTX 3090 với bus bộ nhớ 384-bit, bạn có 936 gigabyte mỗi giây băng thông GDDR6X, tạo ra 80 token mỗi giây. Nhưng hãy xem điều gì xảy ra ngay khi mô hình của bạn vượt quá VRAM vật lý.

1:22 Khi VRAM đầy, các thời gian chạy sẽ chuyển các lớp còn lại qua bus PCIe sang bộ nhớ hệ thống DDR5. Các lõi GPU của bạn mong đợi một nghìn gigabyte mỗi giây. Thay vào đó, DDR5 kênh đôi cung cấp cho chúng năm mươi, và PCIe 4 bị nghẽn ở ba mươi mốt. Đó là một sự sụp đổ băng thông 20 lần. Đường ống tạo token ngay lập tức bị đình trệ chờ trên bus, và tốc độ giảm mạnh từ 40 token mỗi giây xuống còn 1,5. Bạn đã biến một dàn máy 2.000 đô la thành một máy sưởi.

1:47 Và điều đó còn tồi tệ hơn trong các lần chạy tác nhân đa lượt, bởi vì trọng số chỉ là một nửa cuộc chiến. Mọi lời nhắc, lệnh gọi công cụ và đoạn tệp đều được lưu trữ trong bộ đệm Key-Value. Cửa sổ ngữ cảnh 32k có thể tiêu tốn bốn đến tám gigabyte VRAM ngoài trọng số. Nếu card của bạn chỉ có 16 gigabyte, tác nhân của bạn sẽ lặp lại hai lần, đụng phải bức tường ngữ cảnh, và hoặc gặp lỗi hết bộ nhớ hoặc tràn vào DDR5. Đây là bảng gian lận định cỡ 4-bit. Một mô hình 7 hoặc 8 tỷ tham số như Llama 3.1 hoặc DeepSeek Distill

2:16 mất khoảng 5 gigabyte. Một mô hình 14 tỷ tham số mất 10 gigabyte. Một mô hình 32 tỷ tham số, điểm ngọt thông minh cho các tác nhân lập trình, yêu cầu 20 gigabyte. Và một mô hình biên 70 tỷ tham số đòi hỏi 40 gigabyte trước khi bạn thậm chí phân bổ ngữ cảnh. Điều này đưa chúng ta đến các bản dựng phần cứng thực tế. Cấp 1 là dàn máy khởi động, 1.200 đến 1.500 đô la. Trên PC, điểm tựa của bạn là một RTX 4060 Ti 16 gigabyte.

2:39 Cảnh báo quan trọng: đừng bao giờ mua phiên bản 8 gigabyte để tiết kiệm 70 đô la. 8 gigabyte VRAM vào năm 2026 là một án tử hết bộ nhớ ngay lập tức trên bất kỳ quy trình làm việc tác nhân thực tế nào. Ghép nối nó với một Ryzen 5 6 nhân, 64 gigabyte DDR5, và một ổ NVMe 2 terabyte. Ở xứ Apple, tương đương là một Mac Mini hoặc MacBook Pro với 16 gigabyte bộ nhớ hợp nhất.

3:02 Bạn sẽ thấy 40 đến 50 token mỗi giây trên các mô hình 8 tỷ tham số. Cấp 2 là điểm ngọt cho người dùng chuyên nghiệp: xây dựng đặc biệt để chạy các mô hình 32 tỷ tham số như Qwen 2.5 32B. Lộ trình A là một RTX 4070 Ti Super mới với 16 gigabyte với giá 800 đô la. Nhưng Lộ trình B là khuyến nghị mạnh mẽ của tôi: mua một Nvidia RTX 3090 24 gigabyte đã qua sử dụng. Bạn có thể tìm thấy các chiếc 3090 sạch trên eBay với giá 650 đến 750 đô la. Điều đó mang lại cho bạn 24 gigabyte VRAM trên một bus 384-bit khổng lồ đẩy

3:33 936 gigabyte mỗi giây. Tính trên mỗi đô la, đó là thỏa thuận VRAM tốt nhất trong điện toán. Trên macOS, đối tác của Cấp 2 là một Mac Mini M4 Pro với 64 gigabyte bộ nhớ hợp nhất. Nó tạo ra 11 đến 12 token mỗi giây trên một mô hình 32 tỷ tham số: chậm hơn Nvidia, nhưng hoàn toàn im lặng ở 30 watt với không gian cho một cửa sổ ngữ cảnh khổng lồ. Cấp 3 là phân khúc dành cho người đam mê cho các đàn tác nhân đa nhiệm. Trên PC, điều đó có nghĩa là một RTX 4090 với 24 gigabyte,

3:57 một Ryzen 9, và 128 gigabyte RAM, hoặc hai RTX 3090 cung cấp tổng cộng 48 gigabyte VRAM. Trong dòng sản phẩm của Apple, đây là một Mac Studio Ultra với 96 đến 128 gigabyte bộ nhớ hợp nhất. Sức mạnh siêu việt là khả năng lưu trú trong bộ nhớ: bạn có thể giữ một mô hình nhúng, một bộ định tuyến nhanh, và một mô hình lập trình 32 tỷ tham số được tải đồng thời với độ trễ trao đổi bằng không. Bây giờ là thất bại trung thực của thử nghiệm thực địa của chúng ta: bẫy điện toán biên.

4:24 Mỗi tuần một bài đăng trên mạng xã hội tuyên bố bạn có thể chạy các tác nhân lập trình tự động trên một Raspberry Pi 5 80 đô la. Tôi đã thử nghiệm nó. Chạy một mô hình 1,5 tỷ tham số nhỏ chỉ mang lại cho bạn gần như 3 token mỗi giây trong khi bo mạch bị điều tiết ở 85 độ C. Đó là một món đồ chơi cuối tuần thú vị, nhưng như một trình điều khiển phát triển hàng ngày, nó là sự trừng phạt thuần túy. Đối với phần mềm, hãy sử dụng Ollama nếu bạn muốn một daemon dòng lệnh sạch kết nối

4:47 thẳng đến Cursor, Cline, hoặc VS Code. Nếu bạn muốn một sân chơi đồ họa với các bản tải xuống mô hình và thanh trượt lớp GPU, hãy sử dụng LM Studio. Và khớp định dạng của bạn với phần cứng của bạn. Trên Apple Silicon, luôn tải xuống các mô hình GGUF được tối ưu hóa cho Metal. Trên Windows hoặc Linux với Nvidia, tải xuống các mô hình AWQ hoặc EXL2, sử dụng Nvidia Tensor Cores để suy luận nhanh hơn 20 đến 30 phần trăm. Vậy làm thế nào để bạn triển khai điều này mà không bị phá sản?

5:11 Hãy nghĩ về phần cứng cục bộ như một phòng tập thể dục tại nhà so với một phòng tập thể dục thương mại. Việc có một giá squat ở nhà có nghĩa là bạn tập luyện mỗi ngày mà không phải di chuyển, không phí đăng ký, và riêng tư hoàn toàn. Máy cục bộ của bạn xử lý 80 phần trăm công việc lập trình hàng ngày của bạn, kiểm thử đơn vị, và xử lý tài liệu riêng tư với chi phí 0 đô la mỗi token. Và khi bạn cần nâng tạ 500 pound — như một lần tái cấu trúc kiến trúc khổng lồ trên toàn bộ kho lưu trữ trên 50 tệp — bạn đến phòng tập thể dục thương mại: trả API đám mây cho Claude 3.5 Sonnet hoặc OpenAI o3 trong 15 phút

5:38 và tiếp tục. Đây là hóa đơn: một bản dựng Cấp 2 với một chiếc 3090 đã qua sử dụng có giá 1.600 đô la tất cả. Nếu bạn chi 50 đến 100 đô la mỗi tháng cho các token API, nó sẽ tự trả hết trong 18 tháng trong khi giữ mã nguồn độc quyền của bạn không nằm trên các máy chủ của bên thứ ba. Phán quyết thử nghiệm thực địa hôm nay: SHIP IT. VRAM và băng thông bộ nhớ luôn đánh bại tốc độ xung nhịp. Hãy ngừng mua CPU 5 gigahertz cho AI, và tìm một chiếc 3090 đã qua sử dụng.

6:04 Hãy cho tôi biết bạn đang chạy bản dựng phần cứng nào cho các mô hình cục bộ trong phần bình luận. Và nếu bạn muốn đọc phân tích này, hãy lấy bản tin tại the daily diff dot dev, liên kết bên dưới. Và đó là sự khác biệt trong ngày hôm nay. Tôi là Niko từ Axrisi. Hợp nhất một cách có trách nhiệm.

Nguồn

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Video liên quan