# Mahalliy AI Uskunasi Bo'yicha Qo'llanma (2026)

Published: 2026-09-14

Mahalliy AI agentlari va ochiq vaznli LLM'lar uchun mashina qurishda, dasturchilar o'yin kompyuterining xususiyatlarini xato bilan sotib olishadi: 5.8 GHz protsessorlar, maxsus suyuq sovutish tizimlari va atigi 8GB VRAMga ega tez o'yin videokartalari. Ammo avtoregressiv token yaratish hisoblash bilan emas, balki xotira-o'tkazish qobiliyati bilan chegaralangan: bitta token chiqarish uchun modeldagi har bir og'irlik xotira shinasidan oqib o'tishi kerak. Og'irliklar yoki KV kesh konteksti jismoniy VRAMdan oshib ketganda, ish vaqti qatlamlarni PCIe orqali tizim DDR5ga o'tkazadi va siz 20 barobar xotira o'tkazish qobiliyati pasayishiga duch kelasiz: tezlik sekundiga 40 tokendan 1.5 tokenga tushadi. Ushbu dala sinovida Niko apparat mexanikasini, 4-bitli kvantlash modelini o'lchash qoidalarini, 1200 dollardan 5000 dollargacha bo'lgan uchta real byudjet darajasini, nima uchun ishlatilgan RTX 3090 24GB hisoblashda dollariga eng yaxshi VRAM taklifi ekanligini, Raspberry Pi qopqog'ini va mahalliy va bulutli inferensiya uchun uy sport zali strategiyasini tushuntiradi. Hukm: SHIP IT.

Canonical: https://thedailydiff.dev/uz/video/2026-09-14-local-ai-hardware/

## Bu video nimani qamrab oladi

- 20 barobar xotira o'tkazish qobiliyati pasayishi: 936 GB/s GDDR6X vs 50 GB/s DDR5 &amp; 31.5 GB/s PCIe
- Model o'lchami @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- 1-daraja (1200–1500$): RTX 4060 Ti 16GB (hech qachon 8GB emas) yoki Mac Mini 16GB
- 2-daraja (1500–2000$): Ishlatilgan RTX 3090 24GB eng maqbul joy yoki Mac Mini M4 Pro 64GB
- 3-daraja (3500$+): RTX 4090 24GB / ikki 3090 yoki Mac Studio Ultra

## Tarjima qilingan transkript

Asl inglizcha hikoyadan tarjima qilingan. Mavjud audio va subtitrlar YouTube tomonidan boshqariladi.

0:00 Agar siz mahalliy AI agentlarini ishga tushirish uchun kompyuter qurishni rejalashtirayotgan bo'lsangiz, o'yin qurilmasini qurishni to'xtating. Sizga 5.8 gigagertsli Core i9, suyuq sovutish tizimi kerak emas, yoki RGB bilan qoplangan 8 gigabaytlik videokarta. Mahalliy AI inferensiyasida o'yin spetsifikatsiyalari deyarli foydasiz. Agentingiz ishlaydimi yoki sudraladimi, faqatgina VRAM hajmi va xotira shinasi o'tkazish qobiliyati belgilaydi. Uskuna sinovining qoidalari: protsessor chastotalari va rasterizatsiya benchmarklarini unuting.

0:24 Bizga uchta raqam qiziq: xotira shinasi kengligi, gigabayt/sekunddagi o'tkazish qobiliyati va KV keshining shishishi uchun xom VRAM zaxirasi. Ushbu dala sinovida men yigirma barobar xotira o'tkazish qobiliyati pasayishini tushuntiraman, model o'lchash qoidalarini belgilayman, 1200 dollardan 5000 dollargacha bo'lgan uchta haqiqiy darajani benchmark qilaman va nima uchun ishlatilgan 3090 hisoblashning eng katta firibgarlik kodi ekanligini tushuntiraman. Bu The Daily Diff, dala sinovi. Nima uchun o'yin qurilmalari ishlamay qolishini tushunish uchun token yaratish qanday amalga oshirilishiga qarang. O'yinlarda protsessoringiz chizish chaqiruvlarini ta'minlaydi va videokartangiz kadrlarni renderlaydi.

0:54 Ammo avtoregressiv LLM dekodlashi deyarli faqat xotira o'tkazish qobiliyati bilan chegaralangan. Bitta token yaratish uchun videokarta modelning har bir og'irlik parametrini xotiradan o'zining hisoblash yadrolari orqali uzatishi kerak. Agar modelingiz 10 gigabayt bo'lsa, bitta token ishlab chiqarish 10 gigabayt ma'lumotni o'qishni anglatadi. Nvidia RTX 3090da 384-bitli xotira shinasi bilan, siz 936 gigabayt/sekund GDDR6X o'tkazish qobiliyatini olasiz, sekundiga 80 token ishlab chiqaradi. Ammo modelingiz jismoniy VRAMdan oshib ketgan lahzada nima bo'lishini ko'ring.

1:22 VRAM to'lganda, ish vaqti qolgan qatlamlarni PCIe shinasidan tizim DDR5 xotirasiga o'tkazadi. Videokarta yadrolaringiz sekundiga 1000 gigabayt kutadi. Buning o'rniga, ikki kanalli DDR5 ularga 50 gigabayt beradi va PCIe 4 31 gigabaytda tiqilib qoladi. Bu 20 barobar o'tkazish qobiliyatining qulashi. Token yaratish quvuri darhol shina kutib to'xtab qoladi, va tezlik sekundiga 40 tokendan 1.5 tokenga tushadi. Siz 2000 dollarlik qurilmani isitgichga aylantirdingiz.

1:47 Va bu ko'p bosqichli agent ishlarida yomonlashadi, chunki og'irliklar jangning yarmi. Har bir so'rov, vosita chaqiruvi va fayl bo'lagi Kalit-Qiymat keshida saqlanadi. 32K kontekst oynasi og'irliklardan tashqari 4 dan 8 gigabaytgacha VRAMni iste'mol qilishi mumkin. Agar kartangizda faqat 16 gigabayt bo'lsa, agentingiz ikki marta aylanadi, kontekst devoriga uriladi va xotira yetishmovchiligi xatosi bilan ishdan chiqadi yoki DDR5ga to'kiladi. Mana 4-bitli o'lchamlashtirish uchun yordamchi jadval. Llama 3.1 yoki DeepSeek Distill kabi 7 yoki 8 milliard parametrlik model

2:16 taxminan 5 gigabaytni oladi. 14 milliard parametrlik model 10 gigabaytni oladi. 32 milliard parametrlik model, kodlash agentlari uchun eng maqbul intellektual joy, 20 gigabaytni talab qiladi. Va 70 milliardlik chegaraviy model siz kontekstni ajratmasdan oldin ham 40 gigabaytni talab qiladi. Bu bizni haqiqiy apparat qurilmalariga olib keladi. 1-daraja boshlang'ich qurilma, 1200 dan 1500 dollargacha. Kompyuterda sizning asosiy narsangiz RTX 4060 Ti 16 gigabaytlik.

2:39 Muhim ogohlantirish: hech qachon 70 dollar tejash uchun 8 gigabaytlik versiyani sotib olmang. 2026 yilda 8 gigabayt VRAM har qanday real agent ish oqimida darhol xotira yetishmovchiligi bilan o'lim jazosidir. Uni 6 yadroli Ryzen 5, 64 gigabayt DDR5 va 2 terabaytlik NVMe diski bilan birlashtiring. Apple olamida uning ekvivalenti 16 gigabayt yagona xotiraga ega Mac Mini yoki MacBook Pro.

3:02 8 milliard parametrlik modellarda sekundiga 40 dan 50 tagacha token ko'rasiz. 2-daraja tajribali foydalanuvchi uchun eng maqbul joy: ayniqsa Qwen 2.5 32B kabi 32 milliard parametrlik modellarni ishga tushirish uchun qurilgan. A yo'li 800 dollarga 16 gigabaytli yangi RTX 4070 Ti Super. Lekin B yo'li mening kuchli tavsiyam: ishlatilgan Nvidia RTX 3090 24 gigabaytni sotib oling. Siz eBayda 650 dan 750 dollargacha toza 3090larni topishingiz mumkin. Bu sizga ulkan 384-bitli shinada 24 gigabayt VRAM beradi va

3:33 sekundiga 936 gigabaytni ta'minlaydi. Dollariga dollar, bu hisoblashda eng yaxshi VRAM taklifi. macOSda 2-darajaning ekvivalenti 64 gigabayt yagona xotiraga ega Mac Mini M4 Pro. U 32 milliard parametrlik modelda sekundiga 11 dan 12 tagacha token ishlab chiqaradi: Nvidia'dan sekinroq, ammo 30 vattda mutlaqo ovozsiz, katta kontekst oynasi uchun joy bilan. 3-daraja ko'p agentli to'dalar uchun ishqibozlar qatori. Kompyuterda bu 24 gigabaytli RTX 4090ni anglatadi,

3:57 Ryzen 9 va 128 gigabayt RAM, yoki jami 48 gigabayt VRAM ta'minlaydigan ikki RTX 3090. Apple'ning qatorida bu 96 dan 128 gigabaytgacha yagona xotiraga ega Mac Studio Ultra. Superkuch xotira rezidentligi: siz bir vaqtning o'zida bir embedding modelini, tez router va 32 milliard parametrlik kodlash modelini nol almashish kechikishi bilan yuklashingiz mumkin. Nol almashtirish kechikishi bilan yuklashingiz mumkin. Endi dala sinovimizning samimiy muvaffaqiyatsizligi haqida: chekka hisoblash qopqog'i.

4:24 Har hafta ijtimoiy post 80 dollarlik Raspberry Pi 5da avtonom kodlash agentlarini ishga tushirish mumkinligini da'vo qiladi. Men uni sinab ko'rdim. Kichkina 1.5 milliard parametrlik modelni ishga tushirish sekundiga deyarli 3 ta token beradi, karta 85 daraja Selsiyda tiqilib qoladi. Bu ajoyib dam olish kunlari o'yinchog'i, ammo kundalik rivojlanish drayveri sifatida bu sof azob. Dasturiy ta'minot uchun, agar toza buyruq satri daemonini xohlasangiz, Ollamani ishlating,

4:47 u to'g'ridan-to'g'ri Cursor, Cline yoki VS Codega ulanadi. Agar model yuklashlari va GPU qatlam slaydrlari bilan grafik o'yin maydonchasini xohlasangiz, LM Studioni ishlating. Va formatingizni silikoningizga moslang. Apple Siliconda har doim Metal uchun optimallashtirilgan GGUF modellarini yuklab oling. Windows yoki Linuxda Nvidia bilan AWQ yoki EXL2 modellarini yuklab oling, ular Nvidia Tensor yadrolaridan 20 dan 30 foizgacha tezroq inferensiya uchun foydalanadi. Xo'sh, buni qanday qilib buzilmasdan joylashtirasiz?

5:11 Mahalliy apparatni tijorat sport zali bilan solishtirganda uy sport zali deb o'ylang. Uyda squat rackga ega bo'lish har kuni nol yo'lga, nol obuna to'lovi va to'liq maxfiylik bilan mashq qilishingizni anglatadi. Mahalliy mashinangiz kundalik kodlash, birlik sinovlari va shaxsiy hujjatlarni qayta ishlashning 80 foizini token uchun nol dollar evaziga amalga oshiradi. Va 500 funt deadlift qilishingiz kerak bo'lganda — masalan, 50 ta fayl bo'ylab katta repo bo'yicha arxitektura refaktori — tijorat zaliga borasiz: Claude 3.5 Sonnet yoki OpenAI o3 uchun 15 daqiqa davomida bulut APIga pul to'laysiz

5:38 va ishingizni davom ettirasiz. Mana hisob: ishlatilgan 3090 bilan 2-daraja qurilmasi jami 1600 dollar turadi. Agar siz API tokenlariga oyiga 50 dan 100 dollargacha sarflasangiz, u o'zini 18 oyda qoplaydi, shu bilan birga mulkiy kod bazangizni uchinchi tomon serverlaridan uzoqda saqlaydi. Bugungi dala sinovi hukmi: SHIP IT. VRAM va xotira o'tkazish qobiliyati har doim chastota tezligidan ustun turadi. AI uchun 5 gigagertsli protsessorlarni sotib olishni to'xtating va ishlatilgan 3090ni toping.

6:04 Izohlarda mahalliy modellar uchun qanday apparat qurilmasidan foydalanayotganingizni ayting. Va agar siz bu tahlilni o'qishni xohlasangiz, Daily Diff saytidan xabarnomani oling, pastdagi havola orqali. Va bugungi farq shundan iborat. Men Axrisidan Niko. Mas'uliyat bilan birlashtiring.

## Manbalar

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
