+− THE DAILY DIFFdev & AI news
SHIP IT

คู่มือฮาร์ดแวร์ AI ภายใน (2026)

เมื่อสร้างเครื่องสำหรับตัวแทน AI ในเครื่องและ LLM แบบ open-weight นักพัฒนาทำผิดพลาดในการซื้อสเปกคอมพิวเตอร์สำหรับเล่นเกม: CPU 5.8 GHz, ชุดระบายความร้อนด้วยของเหลวแบบกำหนดเอง และ GPU สำหรับเล่นเกมที่รวดเร็วพร้อม VRAM เพียง 8GB แต่การสร้างโทเค็นแบบอัตโนมัติถูกจำกัดด้วยแบนด์วิดท์หน่วยความจำ ไม่ใช่การคำนวณ: ในการสร้างโทเค็นเดียว ทุกน้ำหนักในโมเดลจะต้องส่งผ่านบัสหน่วยความจำ เมื่อน้ำหนักหรือบริบทแคช KV เกิน VRAM ทางกายภาพ รันไทม์จะย้ายเลเยอร์ไปยังระบบ DDR5 ผ่าน PCIe และคุณจะพบกับขีดจำกัดแบนด์วิดท์หน่วยความจำที่ลดลงถึง 20 เท่า: ความเร็วลดลงจาก 40 โทเค็นต่อวินาทีเหลือ 1.5 ในการทดสอบภาคสนามนี้ Niko จะอธิบายกลไกฮาร์ดแวร์ กฎการกำหนดขนาดโมเดลแบบ 4 บิต สามระดับงบประมาณจริงตั้งแต่ $1,200 ถึง $5,000 เหตุผลที่ RTX 3090 24GB มือสองเป็นข้อเสนอ VRAM ต่อดอลลาร์ที่ดีที่สุดในการคำนวณ ปัญหา Raspberry Pi edge และกลยุทธ์ยิมที่บ้านสำหรับการอนุมานในเครื่องเทียบกับคลาวด์ คำตัดสิน: SHIP IT.

เมื่อสร้างเครื่องสำหรับตัวแทน AI ในเครื่องและ LLM แบบ open-weight นักพัฒนาทำผิดพลาดในการซื้อสเปกคอมพิวเตอร์สำหรับเล่นเกม: CPU 5.8 GHz, ชุดระบายความร้อนด้วยของเหลวแบบกำหนดเอง และ GPU สำหรับเล่นเกมที่รวดเร็วพร้อม VRAM เพียง 8GB แต่การสร้างโทเค็นแบบอัตโนมัติถูกจำกัดด้วยแบนด์วิดท์หน่วยความจำ ไม่ใช่การคำนวณ: ในการสร้างโทเค็นเดียว ทุกน้ำหนักในโมเดลจะต้องส่งผ่านบัสหน่วยความจำ เมื่อน้ำหนักหรือบริบทแคช KV เกิน VRAM ทางกายภาพ รันไทม์จะย้ายเลเยอร์ไปยังระบบ DDR5 ผ่าน PCIe และคุณจะพบกับขีดจำกัดแบนด์วิดท์หน่วยความจำที่ลดลงถึง 20 เท่า: ความเร็วลดลงจาก 40 โทเค็นต่อวินาทีเหลือ 1.5 ในการทดสอบภาคสนามนี้ Niko จะอธิบายกลไกฮาร์ดแวร์ กฎการกำหนดขนาดโมเดลแบบ 4 บิต สามระดับงบประมาณจริงตั้งแต่ $1,200 ถึง $5,000 เหตุผลที่ RTX 3090 24GB มือสองเป็นข้อเสนอ VRAM ต่อดอลลาร์ที่ดีที่สุดในการคำนวณ ปัญหา Raspberry Pi edge และกลยุทธ์ยิมที่บ้านสำหรับการอนุมานในเครื่องเทียบกับคลาวด์ คำตัดสิน: SHIP IT.

อ่านฉบับลายลักษณ์อักษร (ภาษาอังกฤษ) ↗

วิดีโอนี้ครอบคลุมอะไรบ้าง

  • ขีดจำกัดแบนด์วิดท์หน่วยความจำ 20 เท่า: GDDR6X 936 GB/s เทียบกับ DDR5 50 GB/s และ PCIe 31.5 GB/s
  • การกำหนดขนาดโมเดลที่ 4 บิต: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • ระดับ 1 ($1,200–$1,500): RTX 4060 Ti 16GB (ไม่เคย 8GB) หรือ Mac Mini 16GB
  • ระดับ 2 ($1,500–$2,000): RTX 3090 24GB มือสองเป็นจุดที่เหมาะสมที่สุด หรือ Mac Mini M4 Pro 64GB
  • ระดับ 3 ($3,500+): RTX 4090 24GB / Dual 3090s หรือ Mac Studio Ultra

บทถอดเสียงที่แปลแล้ว

แปลจากการบรรยายภาษาอังกฤษต้นฉบับ เสียงและคำบรรยายที่มีให้จะควบคุมโดย YouTube

0:00 หากคุณกำลังวางแผนที่จะสร้างคอมพิวเตอร์เพื่อเรียกใช้ตัวแทน AI ในเครื่อง หยุดสร้างเครื่องเล่นเกมได้เลย คุณไม่จำเป็นต้องมี Core i9 ห้าจุดแปดกิกะเฮิรตซ์ ชุดระบายความร้อนด้วยของเหลว หรือการ์ดกราฟิกแปดกิกะไบต์ที่เต็มไปด้วย RGB ในการอนุมาน AI ในเครื่อง สเปกสำหรับการเล่นเกมนั้นไร้ประโยชน์อย่างสิ้นเชิง ตัวชี้วัดเดียวที่กำหนดว่าตัวแทนของคุณจะทำงานได้ดีหรือช้าคือความจุ VRAM และแบนด์วิดท์บัสหน่วยความจำ กฎการทดสอบฮาร์ดแวร์: ลืมความเร็ว CPU และเกณฑ์มาตรฐานการเรนเดอร์ไปได้เลย

0:24 เราสนใจสามตัวเลข: ความกว้างของบัสหน่วยความจำ แบนด์วิดท์เป็นกิกะไบต์ต่อ วินาที และพื้นที่ VRAM ดิบสำหรับส่วนขยายแคช KV ในการทดสอบภาคสนามนี้ ผมจะอธิบายขีดจำกัดแบนด์วิดท์หน่วยความจำยี่สิบเท่า ทำแผนที่กฎการกำหนดขนาดโมเดล เปรียบเทียบสามระดับจริงตั้งแต่หนึ่งพันสองร้อย ดอลลาร์ถึงห้าพัน และอธิบายว่าทำไม 3090 มือสองยังคงเป็นกลโกงที่ยอดเยี่ยมที่สุดของคอมพิวเตอร์ นี่คือ The Daily Diff การทดสอบภาคสนาม เพื่อทำความเข้าใจว่าทำไมเครื่องเล่นเกมถึงล้มเหลว ลองดูว่าการสร้างโทเค็นทำงาน ได้อย่างไร ในเกม CPU ของคุณจะป้อนคำสั่งวาดภาพและ GPU ของคุณจะเรนเดอร์เฟรม

0:54 แต่การถอดรหัส LLM แบบอัตโนมัตินั้นเกือบจะถูกจำกัดด้วยแบนด์วิดท์หน่วยความจำ อย่างสมบูรณ์ ในการสร้างโทเค็นเดียว GPU จะต้องสตรีมพารามิเตอร์น้ำหนักทุกตัวของ โมเดลจากหน่วยความจำผ่านคอร์ประมวลผล หากโมเดลของคุณมีขนาดสิบกิกะไบต์ การสร้างโทเค็นหนึ่งตัวหมายถึงการอ่านข้อมูลสิบกิกะไบต์ บน Nvidia RTX 3090 ที่มีบัสหน่วยความจำ 384 บิต คุณจะได้แบนด์วิดท์ GDDR6X 936 กิกะไบต์ต่อวินาที สร้างโทเค็นแปดสิบตัวต่อวินาที แต่ดูสิ่งที่เกิดขึ้นทันทีที่โมเดลของคุณเกิน VRAM ทางกายภาพ

1:22 เมื่อ VRAM เต็ม รันไทม์จะย้ายเลเยอร์ที่เหลือผ่านบัส PCIe ไปยัง หน่วยความจำ DDR5 ของระบบ คอร์ GPU ของคุณคาดหวังหนึ่งพันกิกะไบต์ต่อวินาที แต่ DDR5 แบบ dual-channel ป้อนให้เพียงห้าสิบ และ PCIe 4 ชะงักที่สามสิบเอ็ด นั่นคือการยุบตัวของแบนด์วิดท์ 20 เท่า ไปป์ไลน์การสร้างโทเค็นจะหยุดทันทีเพื่อรอที่บัส และความเร็วลดลงจากสี่สิบโทเค็นต่อวินาทีเหลือหนึ่งจุดห้า คุณเปลี่ยนเครื่องราคา 2,000 ดอลลาร์ให้เป็นเครื่องทำความร้อน

1:47 และมันจะแย่ลงในระหว่างการทำงานของตัวแทนหลายรอบ เพราะน้ำหนักเป็นเพียงครึ่งหนึ่ง ของการต่อสู้ ทุกข้อความแจ้ง การเรียกใช้เครื่องมือ และส่วนของไฟล์จะถูกเก็บไว้ในแคช Key-Value หน้าต่างบริบทสามสิบสอง K สามารถใช้ VRAM สี่ถึงแปดกิกะไบต์ นอกเหนือจากน้ำหนัก หากการ์ดของคุณมีเพียงสิบหกกิกะไบต์ ตัวแทนของคุณจะวนซ้ำสองครั้ง ชนกำแพงบริบท และไม่ว่าจะขัดข้องด้วยข้อผิดพลาดหน่วยความจำไม่พอหรือข้อมูลล้น เข้าสู่ DDR5 นี่คือตารางสรุปขนาด 4 บิต โมเดลพารามิเตอร์เจ็ดหรือแปดพันล้านเช่น Llama 3.1 หรือ DeepSeek Distill

2:16 ใช้ประมาณห้ากิกะไบต์ โมเดลสิบสี่พันล้านใช้สิบกิกะไบต์ โมเดลสามสิบสองพันล้าน ซึ่งเป็นจุดที่เหมาะสมที่สุดสำหรับตัวแทนการเขียนโค้ด ต้องใช้ยี่สิบกิกะไบต์ และโมเดลแนวหน้าเจ็ดสิบพันล้านต้องการสี่สิบกิกะไบต์ก่อนที่คุณจะ จัดสรรบริบท ซึ่งนำเราไปสู่การสร้างฮาร์ดแวร์จริง ระดับ 1 คือเครื่องเริ่มต้น ราคาหนึ่งพันสองร้อยถึงหนึ่งพันห้าร้อยดอลลาร์ บน PC จุดยึดของคุณคือ RTX 4060 Ti 16 กิกะไบต์

2:39 คำเตือนสำคัญ: อย่าซื้อ เวอร์ชันแปดกิกะไบต์เพื่อประหยัดเจ็ดสิบดอลลาร์ VRAM แปดกิกะไบต์ในปี 2026 คือการประหารชีวิตด้วยหน่วยความจำไม่พอทันที ในเวิร์กโฟลว์ของตัวแทนจริงใดๆ จับคู่กับ Ryzen 5 หกคอร์, DDR5 หกสิบสี่กิกะไบต์ และไดรฟ์ NVMe สองเทราไบต์ ในฝั่ง Apple สิ่งที่เทียบเท่าคือ Mac Mini หรือ MacBook Pro ที่มีหน่วยความจำรวมสิบหก กิกะไบต์

3:02 คุณจะเห็นสี่สิบถึงห้าสิบโทเค็นต่อวินาทีบนโมเดลแปดพันล้าน ระดับ 2 คือจุดที่เหมาะสมที่สุดสำหรับผู้ใช้ระดับสูง: สร้างขึ้นโดยเฉพาะเพื่อเรียกใช้ โมเดลพารามิเตอร์สามสิบสองพันล้านเช่น Qwen 2.5 32B เส้นทาง A คือ RTX 4070 Ti Super ใหม่ที่มีสิบหกกิกะไบต์ในราคาแปดร้อย ดอลลาร์ แต่เส้นทาง B คือคำแนะนำที่แข็งแกร่งของผม: ซื้อ Nvidia RTX 3090 ยี่สิบสี่กิกะไบต์มือสอง คุณสามารถหา 3090 ที่สะอาดบน eBay ได้ในราคาหกร้อยห้าสิบ ถึงเจ็ดร้อยห้าสิบดอลลาร์ ซึ่งให้ VRAM ยี่สิบสี่กิกะไบต์บนบัส 384 บิตขนาดใหญ่ที่ส่งข้อมูล

3:33 936 กิกะไบต์ต่อวินาที เมื่อเทียบเป็นดอลลาร์ต่อดอลลาร์ มันคือข้อเสนอ VRAM ที่ดีที่สุดในการคำนวณ บน macOS สิ่งที่เทียบเท่ากับระดับ 2 คือ Mac Mini M4 Pro ที่มีหน่วยความจำรวมหกสิบสี่กิกะไบต์ ของหน่วยความจำรวม มันสร้างสิบเอ็ดถึงสิบสองโทเค็นต่อวินาทีบนโมเดลสามสิบสองพันล้าน: ช้ากว่า Nvidia แต่เงียบสนิทที่สามสิบวัตต์พร้อมพื้นที่สำหรับหน้าต่างบริบทขนาดใหญ่ ระดับ 3 คือวงเล็บสำหรับผู้ที่ชื่นชอบสำหรับฝูงตัวแทนหลายตัว บน PC นั่นหมายถึง RTX 4090 ที่มีหน่วยความจำยี่สิบสี่กิกะไบต์

3:57 Ryzen 9 และ RAM หนึ่งร้อยยี่สิบแปดกิกะไบต์ หรือ RTX 3090 คู่ที่ให้ VRAM รวมสี่สิบแปดกิกะไบต์ ในกลุ่มผลิตภัณฑ์ของ Apple นี่คือ Mac Studio Ultra ที่มีหน่วยความจำรวมเก้าสิบหกถึงหนึ่งร้อย ยี่สิบแปดกิกะไบต์ พลังพิเศษคือการคงอยู่ของหน่วยความจำ: คุณสามารถเก็บโมเดลฝังตัว เราเตอร์ที่รวดเร็ว และโมเดลการเขียนโค้ด 32 พันล้านโหลดพร้อมกันโดย ไม่มีการหน่วงเวลาการสลับ ตอนนี้มาถึงความล้มเหลวที่แท้จริงของการทดสอบภาคสนามของเรา: กับดักการประมวลผลแบบเอดจ์

4:24 ทุกสัปดาห์โพสต์โซเชียลมีเดียอ้างว่าคุณสามารถเรียกใช้ตัวแทนการเขียนโค้ดอัตโนมัติบน Raspberry Pi 5 ราคาแปดสิบดอลลาร์ ผมได้ทดสอบแล้ว การเรียกใช้โมเดลพารามิเตอร์หนึ่งจุดห้าพันล้านขนาดเล็กทำให้คุณได้เพียงสาม โทเค็นต่อวินาทีในขณะที่บอร์ดถูกจำกัดที่แปดสิบห้าองศาเซลเซียส มันเป็นของเล่นที่ดีสำหรับวันหยุดสุดสัปดาห์ แต่ในฐานะไดรเวอร์การพัฒนาประจำวัน มันคือการลงโทษที่แท้จริง สำหรับซอฟต์แวร์ ให้ใช้ Ollama หากคุณต้องการ daemon บรรทัดคำสั่งที่สะอาดที่เชื่อมต่อ

4:47 โดยตรงกับ Cursor, Cline หรือ VS Code หากคุณต้องการสนามเด็กเล่นกราฟิกพร้อมการดาวน์โหลดโมเดลและตัวเลื่อนเลเยอร์ GPU ให้ใช้ LM Studio และจับคู่รูปแบบของคุณกับซิลิคอนของคุณ บน Apple Silicon ให้ดาวน์โหลดโมเดล GGUF ที่ปรับให้เหมาะสมสำหรับ Metal เสมอ บน Windows หรือ Linux ที่มี Nvidia ให้ดาวน์โหลดโมเดล AWQ หรือ EXL2 ซึ่งใช้ Nvidia Tensor Cores เพื่อการอนุมานที่เร็วขึ้นยี่สิบถึงสามสิบเปอร์เซ็นต์ แล้วคุณจะปรับใช้สิ่งนี้ได้อย่างไรโดยไม่หมดตัว?

5:11 ลองนึกถึงฮาร์ดแวร์ในเครื่องเหมือนยิมที่บ้านเทียบกับยิมเชิงพาณิชย์ การมี Squat rack ที่บ้านหมายความว่าคุณฝึกได้ทุกวันโดยไม่ต้องเดินทาง ไม่มีค่าสมัครสมาชิก และความเป็นส่วนตัวที่สมบูรณ์ เครื่องในเครื่องของคุณจัดการการเขียนโค้ดประจำวันของคุณแปดสิบเปอร์เซ็นต์ การทดสอบหน่วย และการประมวลผลเอกสารส่วนตัวโดยไม่มีค่าใช้จ่ายต่อโทเค็น และเมื่อคุณต้องการ Deadlift ห้าร้อยปอนด์ — เช่นการปรับโครงสร้างสถาปัตยกรรมครั้งใหญ่ทั่วทั้ง repo ทั่วทั้งห้าสิบไฟล์ — คุณไปที่ยิมเชิงพาณิชย์: จ่าย ค่า API คลาวด์สำหรับ Claude 3.5 Sonnet หรือ OpenAI o3 เป็นเวลาสิบห้านาที

5:38 และเดินหน้าต่อไป นี่คือบิล: การสร้างระดับ 2 ด้วย 3090 มือสองมีค่าใช้จ่ายหนึ่งพันหกร้อยดอลลาร์ ทั้งหมด หากคุณใช้จ่ายห้าสิบถึงหนึ่งร้อยดอลลาร์ต่อเดือนสำหรับโทเค็น API มันจะคืนทุนในสิบแปดเดือนในขณะที่รักษารหัสฐานที่เป็นกรรมสิทธิ์ของคุณ ให้ห่างจากเซิร์ฟเวอร์ของบุคคลที่สาม คำตัดสินการทดสอบภาคสนามวันนี้: SHIP IT. VRAM และแบนด์วิดท์หน่วยความจำเอาชนะความเร็วสัญญาณนาฬิกาทุกครั้ง หยุดซื้อ CPU ห้ากิกะเฮิรตซ์สำหรับ AI และไปหา 3090 มือสอง

6:04 บอกผมว่าคุณใช้ฮาร์ดแวร์แบบไหนสำหรับโมเดลในเครื่องในความคิดเห็น และหากคุณต้องการอ่านรายละเอียดนี้ ให้สมัครรับจดหมายข่าวที่ the daily diff dot dev ลิงก์ด้านล่าง และนั่นคือความแตกต่างสำหรับวันนี้ ผม Niko จาก Axrisi รวมอย่างรับผิดชอบ

แหล่งที่มา

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

วิดีโอที่เกี่ยวข้อง

daily · th · 28 ก.ย. 2569

NVIDIA เป็นหนี้ชายคนนี้เป็นพันล้านดอลลาร์หรือไม่?

ในปี 1993 Jensen Huang ได้เชิญ Eric Gullichsen เข้าเป็นสมาชิกคณะกรรมการที่ปรึกษาด้านเทคนิคของ NVIDIA และให้สิทธิ์ซื้อหุ้น 25,000 หุ้นแก่เขา ซึ่งตามข้อกำหนดแล้ว หุ้นเหล่านั้นจะสามารถใช้สิทธิ์ได้ภายในหน

4:41 ↗
under-the-hood · th · 21 ก.ย. 2569

Claude แยกตัวประกอบ RSA-896 นี่คือวิธีที่ RSA ถูกทำลายจริง ๆ

เมื่อวันที่ 19 กันยายน วิศวกรของ Anthropic ได้แยกตัวประกอบ RSA-896 ซึ่งเป็นหมายเลขท้าทาย 270 หลัก ด้วย Claude ซึ่งเป็นพอร์ต GPU ของตะแกรง CADO-NFS แบบโอเพนซอร์ส และใช้ GPU ประมาณ 30 ปี บน GPU ที่ไม่ได

3:39 ↗
daily · th · 10 ก.ย. 2569

Shopify ซื้อ Tailwind แล้วกลับไปใช้ Native

สองโพสต์จาก Shopify ห่างกัน 25 ชั่วโมง วันอังคาร: Tailwind Labs เข้าร่วม Shopify — เฟรมเวิร์กยังคงเป็น MIT แต่ Tailwind Plus และ ui.sh ปิดรับลูกค้าใหม่ แปดเดือนหลังจาก Adam Wathan เขียนว่า AI ทำให้ปริ

5:15 ↗
daily · th · 4 ต.ค. 2569

ขีดจำกัดการใช้จ่าย AWS สามารถลบโปรเจกต์ของคุณได้

ขีดจำกัดการใช้จ่ายโปรเจกต์ใหม่ของ AWS จะหยุดทรัพยากรเมื่อถึงขีดจำกัดและเก็บรักษาข้อมูลของคุณไว้ในเบื้องต้น คู่มือระบุว่าข้อมูลโปรเจกต์จะถูกลบอย่างถาวรหลังจากหยุดชั่วคราว 90 วันโดยไม่มีการดำเนินการใดๆ

5:13 ↗