# Дотоодын хиймэл оюун ухааны техник хангамжийн гарын авлага (2026)

Published: 2026-09-14

Дотоодын хиймэл оюун ухааны агентууд болон нээлттэй жинтэй LLM-д зориулсан машин бүтээхдээ хөгжүүлэгчид тоглоомын PC-ийн үзүүлэлтүүдийг худалдаж авах алдаа гаргадаг: 5.8 ГГц CPU, захиалгат шингэн хөргөлтийн систем, ердөө 8ГБ VRAM-тай хурдан тоглоомын GPU. Гэвч авторегрессив токен үүсгэлт нь тооцоололд бус, харин санах ойн зурвасын өргөнөөс хамаардаг: нэг токеныг ялгаруулахын тулд загвар дахь бүх жин санах ойн автобусаар дамжин урсдаг. Таны жин эсвэл KV кэшийн контекст физик VRAM-аас хэтрэх үед, системийн ажиллагаа давхаргуудаа PCIe-ээр дамжуулан системийн DDR5 руу шилжүүлж, та санах ойн зурвасын өргөний 20 дахин уналттай тулгардаг: хурд нь секундэд 40 токеноос 1.5 болж буурдаг. Энэхүү талбайн туршилтанд Нико техник хангамжийн механикууд, 4-битийн квантчилалын загварын хэмжээг тодорхойлох дүрмүүд, 1,200$-аас 5,000$-ын хоорондох бодит төсвийн гурван түвшин, яагаад хуучин RTX 3090 24ГБ нь компьютерийн VRAM-ын үнийн хувьд хамгийн сайн хэлцэл болох, Raspberry Pi-ийн ирмэгийн урхи, мөн орон нутгийн болон үүлэн таамаглалд зориулсан гэрийн биеийн тамирын заалны стратегийг задалж байна. Дүгнэлт: SHIP IT.

Canonical: https://thedailydiff.dev/mn/video/2026-09-14-local-ai-hardware/

## Энэ видео юуг хамардаг

- 20 дахин багасах санах ойн зурвасын өргөн: 936 ГБ/с GDDR6X vs 50 ГБ/с DDR5 &amp; 31.5 ГБ/с PCIe
- Загварын хэмжээ @ 4-бит: 8B (5ГБ), 14B (10ГБ), 32B (20ГБ), 70B (40ГБ)
- Түвшин 1 (1,200–1,500$): RTX 4060 Ti 16ГБ (хэзээ ч 8ГБ биш) эсвэл Mac Mini 16ГБ
- Түвшин 2 (1,500–2,000$): Ашигласан RTX 3090 24ГБ-ийн хамгийн тохиромжтой цэг эсвэл Mac Mini M4 Pro 64ГБ
- Түвшин 3 (3,500$+): RTX 4090 24ГБ / хос 3090 эсвэл Mac Studio Ultra

## Орчуулсан бичлэг

Англи хэл дээрх эх хувилбараас орчуулсан. Боломжтой дуу болон хадмал орчуулгыг YouTube хянадаг.

0:00 Хэрэв та дотоодын хиймэл оюун ухааны агентуудыг ажиллуулах PC бүтээхээр төлөвлөж байгаа бол, тоглоомын төхөөрөмж бүтээхээ боль. Танд тав цэг найман гигагерцийн Core i9, шингэн хөргөлтийн систем хэрэггүй, эсвэл RGB-ээр бүрхэгдсэн найман гигабайтын график карт ч хэрэггүй. Дотоодын хиймэл оюун ухааны таамаглалд тоглоомын үзүүлэлтүүд бараг хэрэггүй. Таны агент ажиллах эсвэл мөлхөх эсэхийг тодорхойлдог цорын ганц үзүүлэлт бол VRAM-ын багтаамж юм. мөн санах ойн автобусны зурвасын өргөн. Техник хангамжийн туршилтын дүрэм: CPU-ийн цагийн хурд болон растержуулалтын хэмжээсийг март.

0:24 Бид гурван тоонд анхаарна: санах ойн автобусны өргөн, секундэд гигабайтаар хэмжигдэх зурвасын өргөн, мөн KV кэшийн хэтрэлтэнд зориулсан түүхий VRAM-ын зай. Энэхүү талбайн туршилтанд би хорин дахин багасах санах ойн зурвасын өргөнийг задална, загварын хэмжээг тодорхойлох дүрмүүдийг зураглаж, арван хоёр зуун доллараас таван мянган долларын хоорондох бодит гурван түвшинг туршиж, мөн яагаад хуучин 3090 нь компьютерийн хамгийн гайхалтай арга хэвээр байгааг тайлбарлана. Энэ бол The Daily Diff, талбайн туршилт. Тоглоомын төхөөрөмжүүд яагаад бүтэлгүйтдгийг ойлгохын тулд токен үүсгэлт хэрхэн явагддагийг харна уу. Тоглоомуудад таны CPU зураг зурах дуудлагуудыг өгч, таны GPU кадрүүдийг дүрсэлдэг.

0:54 Гэвч авторегрессив LLM-ийн декодчилол нь бараг зөвхөн санах ойн зурвасын өргөнөөс хамаардаг. Нэг токеныг үүсгэхийн тулд GPU нь загварын жингийн параметр бүрийг санах ойгоос өөрийн тооцоолох цөмөөрөө дамжуулан дамжуулах ёстой. загвараа санах ойгоос дамжуулах ёстой. Хэрэв таны загвар арван гигабайт бол, нэг токен үүсгэнэ гэдэг нь арван гигабайт өгөгдөл уншина гэсэн үг юм. 384-битийн санах ойн автобустай Nvidia RTX 3090 дээр, та секундэд 936 гигабайт GDDR6X зурвасын өргөнийг авна, секундэд наян токен үүсгэнэ. Гэвч таны загвар физик VRAM-аас хэтрэх тэр мөчид юу болдгийг хараарай.

1:22 VRAM дүүрэх үед, үлдсэн давхаргууд PCIe автобусаар дамжин системийн DDR5 санах ой руу шилждэг. системийн DDR5 санах ой руу шилждэг. Таны GPU-ийн цөмүүд секундэд мянган гигабайт хүлээж байдаг. Үүний оронд, хос сувгийн DDR5 тэдэнд тавь, PCIe 4 гучин нэгээр боомилдог. Энэ бол хорин дахин багасах зурвасын өргөний уналт юм. Токен үүсгэх дамжлага автобусыг хүлээж тэр даруй зогсдог, мөн хурд нь секундэд дөчин токеноос нэг цэг тав болж буурдаг. Та хоёр мянган долларын төхөөрөмжийг дулаан алдагч болгон хувиргасан.

1:47 Мөн олон эргэлттэй агентын ажиллагааны үед энэ нь улам дорддог, учир нь жин нь зөвхөн тал хувь нь юм. Үг, хэрэгсэл дуудалт, файлын хэсэг бүр Key-Value кэшид хадгалагддаг. Гучин хоёр К контекстийн цонх нь жингийнхээ дээр дөрвөөс найман гигабайт VRAM-ыг хэрэглэж болно. VRAM-ыг хэрэглэж болно. Хэрэв таны карт зөвхөн арван зургаан гигабайттай бол, таны агент хоёр удаа давтаж, контекстийн хананд тулж, санах ой дүүрсэн алдаагаар унах эсвэл DDR5 руу асгарна. Энд дөрвөн битийн хэмжээг тодорхойлох хуулбар хуудас байна. Llama 3.1 эсвэл DeepSeek Distill шиг долоо эсвэл найман тэрбум параметрийн загвар

2:16 ойролцоогоор таван гигабайт эзэлдэг. Арван дөрвөн тэрбум загвар арван гигабайт эзэлдэг. Гучин хоёр тэрбум загвар, кодчилох агентуудын оюун ухааны хамгийн тохиромжтой цэг, хорин гигабайт шаарддаг. Мөн далан тэрбум хил хязгаарын загвар та контекст хуваарилахаас өмнө дөчин гигабайт шаарддаг. Энэ нь биднийг бодит техник хангамжийн бүтэц рүү хөтөлж байна. Түвшин 1 бол эхлэлийн төхөөрөмж, арван хоёр зуун-арван таван зуун доллар. PC дээр таны зангуу бол RTX 4060 Ti 16-гигабайт юм.

2:39 Чухал анхааруулга: хэзээ ч наян доллар хэмнэх гэж найман гигабайтын хувилбарыг бүү худалдаж ав. 2026 онд найман гигабайт VRAM бол ямар ч бодит агентын ажлын урсгал дээр санах ой дүүрэх шууд үхлийн ял юм. ямар ч бодит агентын ажлын урсгал дээр. Үүнийг зургаан цөмт Ryzen 5, жаран дөрвөн гигабайт DDR5-тай хослуулна, мөн хоёр терабайт NVMe диск. Apple-ийн талд, үүнтэй тэнцэх нь арван зургаан гигабайт нэгдсэн санах ойтой Mac Mini эсвэл MacBook Pro юм. гигабайт нэгдсэн санах ой.

3:02 Та найман тэрбум загвар дээр секундэд дөчин-тавь токен харах болно. Түвшин 2 бол хүчирхэг хэрэглэгчийн хамгийн тохиромжтой цэг: ялангуяа Qwen 2.5 32B шиг гучин хоёр тэрбум параметрийн загваруудыг ажиллуулахад зориулагдсан. Зам А бол шинэ RTX 4070 Ti Super арван зургаан гигабайттай найман зуун доллар юм. Гэвч Зам Б бол миний хүчтэй зөвлөмж: ашигласан Nvidia RTX 3090 хорин дөрвөн гигабайтыг худалдаж ав. Та eBay дээр цэвэр 3090-ийг зургаан зуун тавин доллараас долоон зуун тавин доллараар олж болно. долоон зуун тавин доллар. Энэ нь танд 384-битийн том автобусаар секундэд 936 гигабайт дамжуулдаг хорин дөрвөн гигабайт VRAM өгнө.

3:33 секундэд. Доллар тутамд энэ нь компьютерийн VRAM-ын хамгийн сайн хэлцэл юм. macOS дээр Түвшин 2-ын аналог нь жаран дөрвөн гигабайт нэгдсэн санах ойтой Mac Mini M4 Pro юм. нэгдсэн санах ой. Энэ нь гучин хоёр тэрбум загвар дээр секундэд арван нэгээс арван хоёр токен үүсгэдэг: Nvidia-аас удаан боловч гучин ватт эрчим хүчээр чимээгүй ажилладаг бөгөөд том контекстийн цонхонд зайтай. Түвшин 3 бол олон агентын сүрэгт зориулсан сонирхогчдын ангилал юм. PC дээр энэ нь хорин дөрвөн гигабайттай RTX 4090,

3:57 Ryzen 9, мөн нэг зуун хорин найман гигабайт RAM, эсвэл нийт дөчин найман гигабайт VRAM-ыг хангадаг хос RTX 3090 гэсэн үг юм. Apple-ийн цувралд энэ нь ерэн зургаагаас нэг зуун хорин найман гигабайт нэгдсэн санах ойтой Mac Studio Ultra юм. хорин найман гигабайт нэгдсэн санах ой. Супер хүч нь санах ойн байршил юм: та эмбединг загвар, хурдан чиглүүлэгч, мөн 32 тэрбум кодчилох загварыг нэгэн зэрэг тэг солих сааталгүйгээр ачааллах боломжтой. тэг солих сааталгүйгээр. Одоо манай талбайн туршилтын үнэнч бүтэлгүйтэл: ирмэгийн тооцооллын урхи.

4:24 Долоо хоног бүр нэгэн олон нийтийн пост та наян долларын Raspberry Pi 5 дээр бие даасан кодчилох агентуудыг ажиллуулж болно гэж мэдэгддэг. найман долларын Raspberry Pi 5. Би туршиж үзсэн. Нэг цэг таван тэрбум параметрийн жижиг загварыг ажиллуулахад танд секундэд гуравхан токен өгдөг бол самбар нь наян таван градус Цельсийн хэмд удааширдаг. температурт удааширдаг. Энэ бол сонирхолтой амралтын өдрийн тоглоом боловч өдөр тутмын хөгжүүлэлтийн хөдөлгөгч болгон, энэ бол цэвэр шийтгэл юм. Програм хангамжийн хувьд, хэрэв та Cursor, Cline, эсвэл VS Code-той шууд холбогддог цэвэр командын мөрийн демоныг хүсвэл Ollama-г ашигла.

4:47 шууд холбогддог. Хэрэв та загвар татаж авах, GPU давхаргын гүйдэг хяналт бүхий график тоглоомын талбайг хүсвэл, LM Studio-г ашигла. Мөн форматаа өөрийн силиконтой тааруул. Apple Silicon дээр үргэлж Metal-д оновчлогдсон GGUF загваруудыг татаж ав. Windows эсвэл Linux дээр Nvidia-тай хамт, Nvidia Tensor Cores-ийг хорин-гучин хувиар хурдан таамаглахад ашигладаг AWQ эсвэл EXL2 загваруудыг татаж ав. Nvidia Tensor Cores-ийг ашигладаг. Тэгэхээр та үүнийг яаж дампуурахгүйгээр байрлуулах вэ?

5:11 Орон нутгийн техник хангамжийг гэрийн биеийн тамирын заал эсвэл худалдааны биеийн тамирын заалтай адил гэж бод. Гэртээ суултуур тавиуртай байх нь та өдөр бүр зорчих хөдөлгөөн, захиалгын төлбөр, хувийн нууцлалгүйгээр бэлтгэл хийнэ гэсэн үг. захиалгын төлбөргүйгээр, мөн бүрэн нууцлалтайгаар. Таны орон нутгийн машин таны өдөр тутмын кодчилол, нэгжийн туршилт, мөн хувийн баримт бичиг боловсруулалтын наян хувийг токен тутамд тэг доллараар гүйцэтгэдэг. Мөн та таван зуун фунт татах шаардлагатай үед — тавин файлд хамарсан асар том репо-өргөн архитектурын өөрчлөлт шиг — та худалдааны биеийн тамирын заал руу зочилно: Claude 3.5 Sonnet эсвэл OpenAI o3-ийн үүлэн API-д арван таван минутын төлбөр төлж, Claude 3.5 Sonnet эсвэл OpenAI o3-ийн үүлэн API-д арван таван минутын төлбөр төлж,

5:38 үргэлжлүүлнэ. Энд төлбөр байна: Түвшин 2-ын бүтэц нь ашигласан 3090-тэй нийт арван зургаан зуун доллар үнэтэй. Хэрэв та сард тавин-нэг зуун доллар API токенд зарцуулбал, энэ нь арван найман сарын дотор өөрийгөө нөхөх бөгөөд таны өмчийн кодын баазыг гуравдагч талын серверүүдээс хол байлгана. гуравдагч талын серверүүдээс. Өнөөдрийн талбайн туршилтын дүгнэлт: SHIP IT. VRAM болон санах ойн зурвасын өргөн цагийн хурдыг үргэлж ялдаг. Хиймэл оюун ухаанд зориулж таван гигагерцийн CPU худалдаж авахаа больж, ашигласан 3090-ийг ол.

6:04 Дотоодын загваруудад зориулж та ямар техник хангамжийн бүтэц ашиглаж байгаагаа сэтгэгдэл хэсэгт бичээрэй. Мөн хэрэв та энэ задаргааг уншихыг хүсвэл, daily diff dot dev дээрх мэдээллийн товхимолыг аваарай, холбоос доор байна. доорх холбоос. Энэ бол өнөөдрийн ялгаа. Би Axrisi-гийн Нико. Хариуцлагатай нэгдүүл.

## Эх сурвалжууд

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
