# Mwongozo wa Vifaa vya AI vya Ndani (2026)

Published: 2026-09-14

Wakati wa kujenga mashine kwa ajili ya mawakala wa AI wa ndani na LLM zenye uzito wazi, watengenezaji hufanya makosa ya kununua vipimo vya Kompyuta ya michezo ya kubahatisha: CPU za 5.8 GHz, loops maalum za kupozea maji, na GPU za haraka za michezo ya kubahatisha zenye 8GB tu ya VRAM. Lakini uzalishaji wa ishara wa kiotomatiki unategemea upana wa kumbukumbu, sio hesabu: ili kutoa ishara moja, kila uzito katika mfumo lazima upitie basi la kumbukumbu. Uzito wako au muktadha wa kashe ya KV unapozidi VRAM halisi, mfumo hupakia tabaka kwenye mfumo wa DDR5 kupitia PCIe, na unapata upana wa kumbukumbu mara 20: kasi hupungua kutoka ishara 40 kwa sekunde hadi 1.5. Katika jaribio hili la uwanja, Niko anafafanua mitambo ya vifaa, sheria za ukubwa wa mfumo wa 4-bit quantization, viwango vitatu halisi vya bajeti kutoka $1,200 hadi $5,000, kwa nini RTX 3090 24GB iliyotumika ni dili bora zaidi la VRAM-kwa-dola katika kompyuta, mtego wa Raspberry Pi, na mkakati wa mazoezi ya nyumbani kwa inferensi ya ndani dhidi ya wingu. Uamuzi: SHIP IT.

Canonical: https://thedailydiff.dev/sw/video/2026-09-14-local-ai-hardware/

## Nini video hii inashughulikia

- Upana wa kumbukumbu mara 20: 936 GB/s GDDR6X dhidi ya 50 GB/s DDR5 &amp; 31.5 GB/s PCIe
- Ukubwa wa mfumo @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Kiwango cha 1 ($1,200–$1,500): RTX 4060 Ti 16GB (kamwe 8GB) au Mac Mini 16GB
- Kiwango cha 2 ($1,500–$2,000): RTX 3090 24GB iliyotumika au Mac Mini M4 Pro 64GB
- Kiwango cha 3 ($3,500+): RTX 4090 24GB / 3090 mbili au Mac Studio Ultra

## Nakala iliyotafsiriwa

Imetafsiriwa kutoka simulizi asili ya Kiingereza. Sauti na manukuu yanayopatikana yanadhibitiwa na YouTube.

0:00 Ikiwa unapanga kujenga Kompyuta ili kuendesha mawakala wa AI wa ndani, acha kujenga rig ya michezo ya kubahatisha. Huitaji Core i9 ya gigahertz tano-nane, kitanzi cha kupozea maji, au kadi ya michoro ya gigabyte nane iliyofunikwa na RGB. Katika inferensi ya AI ya ndani, vipimo vya michezo ya kubahatisha karibu havina maana. Kigezo pekee kinachoamua kama wakala wako anaendesha au anabeba ni uwezo wa VRAM na upana wa basi la kumbukumbu. Sheria za jaribio la vifaa: sahau saa za CPU na vigezo vya rasterization.

0:24 Tunajali namba tatu: upana wa basi la kumbukumbu, upana katika gigabytes kwa sekunde, na nafasi ya VRAM ghafi kwa ukuaji wa kashe ya KV. Katika jaribio hili la uwanja, nitafafanua upana wa kumbukumbu mara ishirini, kupanga sheria za ukubwa wa mfumo, kupima viwango vitatu halisi kutoka dola elfu moja na mia mbili hadi elfu tano, na kueleza kwa nini 3090 iliyotumika bado ni msimbo bora zaidi wa kudanganya katika kompyuta. Huu ni The Daily Diff, jaribio la uwanja. Ili kuelewa kwa nini rig za michezo ya kubahatisha hushindwa, angalia jinsi uzalishaji wa ishara unavyofanya kazi. Katika michezo, CPU yako hutoa simu za kuchora na GPU yako hutoa fremu.

0:54 Lakini usimbaji wa LLM wa kiotomatiki unategemea upana wa kumbukumbu karibu kabisa. Ili kuzalisha ishara moja, GPU lazima itoe kila parameta ya uzito wa mfumo kutoka kwenye kumbukumbu kupitia cores zake za kompyuta. Ikiwa mfumo wako ni gigabytes kumi, kuzalisha ishara moja kunamaanisha kusoma gigabytes kumi za data. Kwenye Nvidia RTX 3090 na basi la kumbukumbu la 384-bit, unapata gigabytes 936 kwa sekunde ya upana wa GDDR6X, ukizalisha ishara themanini kwa sekunde. Lakini angalia kinachotokea sekunde mfumo wako unapozidi VRAM halisi.

1:22 VRAM inapojaza, runtimes hupakia tabaka zilizobaki kwenye basi la PCIe hadi kumbukumbu ya mfumo ya DDR5. Cores za GPU yako zinatarajia gigabytes elfu moja kwa sekunde. Badala yake, DDR5 ya njia mbili huwalisha hamsini, na PCIe 4 inaziba kwa thelathini na moja. Huo ni mporomoko wa upana wa mara ishirini. Msururu wa uzalishaji wa ishara husimama mara moja ukisubiri basi, na kasi hupungua kutoka ishara arobaini kwa sekunde hadi moja nukta tano. Umefanya rig ya dola elfu mbili kuwa hita ya nafasi.

1:47 Na inazidi kuwa mbaya wakati wa mawakala wengi, kwa sababu uzito ni nusu tu ya vita. Kila kidokezo, simu ya zana, na kipande cha faili huhifadhiwa kwenye kashe ya Key-Value. Dirisha la muktadha la thelathini na mbili K linaweza kutumia gigabytes nne hadi nane za VRAM juu ya uzito. Ikiwa kadi yako ina gigabytes kumi na sita tu, wakala wako hurudia mara mbili, hugonga ukuta wa muktadha, na ama huanguka na hitilafu ya ukosefu wa kumbukumbu au kumwagika katika DDR5. Hapa kuna karatasi ya kudanganya ya ukubwa wa 4-bit. Mfumo wa parameta bilioni saba au nane kama Llama 3.1 au DeepSeek Distill

2:16 unachukua takriban gigabytes tano. Mfumo wa bilioni kumi na nne unachukua gigabytes kumi. Mfumo wa bilioni thelathini na mbili, hatua tamu ya akili kwa mawakala wa kusimba, unahitaji gigabytes ishirini. Na mfumo wa bilioni sabini unahitaji gigabytes arobaini kabla hata hujaweka muktadha. Ambao unatuletea ujenzi halisi wa vifaa. Kiwango cha 1 ni rig ya kuanzia, dola elfu moja na mia mbili hadi elfu moja na mia tano. Kwenye Kompyuta, nanga yako ni RTX 4060 Ti 16-gigabyte.

2:39 Onyo muhimu: usiwahi kununua toleo la gigabyte nane ili kuokoa dola sabini. Gigabytes nane za VRAM mnamo 2026 ni hukumu ya kifo ya ukosefu wa kumbukumbu katika mtiririko wowote halisi wa wakala. Unganisha na Ryzen 5 ya cores sita, gigabytes sitini na nne za DDR5, na diski ya NVMe ya terabyte mbili. Katika nchi ya Apple, sawa ni Mac Mini au MacBook Pro yenye gigabytes kumi na sita ya kumbukumbu iliyounganishwa.

3:02 Utaona ishara arobaini hadi hamsini kwa sekunde kwenye mifumo ya bilioni nane. Kiwango cha 2 ni hatua tamu ya mtumiaji wa nguvu: kujenga mahsusi kuendesha mifumo ya parameta bilioni thelathini na mbili kama Qwen 2.5 32B. Njia A ni RTX 4070 Ti Super mpya yenye gigabytes kumi na sita kwa dola mia nane. Lakini Njia B ni pendekezo langu kuu: nunua Nvidia RTX 3090 iliyotumika gigabyte ishirini na nne. Unaweza kupata 3090 safi kwenye eBay kwa dola mia sita na hamsini hadi mia saba na hamsini. Hiyo inakupa gigabytes ishirini na nne za VRAM kwenye basi kubwa la 384-bit inayotumia

3:33 gigabytes 936 kwa sekunde. Dola kwa dola, ni dili bora zaidi la VRAM katika kompyuta. Kwenye macOS, mshirika wa Kiwango cha 2 ni Mac Mini M4 Pro yenye gigabytes sitini na nne ya kumbukumbu iliyounganishwa. Inazalisha ishara kumi na moja hadi kumi na mbili kwa sekunde kwenye mfumo wa bilioni thelathini na mbili: polepole kuliko Nvidia, lakini kimya kabisa kwa wati thelathini na nafasi ya dirisha kubwa la muktadha. Kiwango cha 3 ni bracket ya wapenda shauku kwa makundi ya mawakala wengi. Kwenye Kompyuta, hiyo inamaanisha RTX 4090 yenye gigabytes ishirini na nne,

3:57 Ryzen 9, na gigabytes mia moja ishirini na nane za RAM, au RTX 3090 mbili zinazotoa gigabytes arobaini na nane za jumla ya VRAM. Katika safu ya bidhaa za Apple, hii ni Mac Studio Ultra yenye gigabytes tisini na sita hadi mia moja ishirini na nane ya kumbukumbu iliyounganishwa. Nguvu kuu ni ukaaji wa kumbukumbu: unaweza kuweka mfumo wa uwekaji, ruta ya haraka, na mfumo wa kusimba wa bilioni 32 umepakiwa wakati huo huo na kuchelewa kwa swap sifuri. Sasa kwa kushindwa kwa uaminifu wa jaribio letu la uwanja: mtego wa kompyuta ya ukingo.

4:24 Kila wiki chapisho la kijamii linadai unaweza kuendesha mawakala wa kusimba wanaojitegemea kwenye Raspberry Pi 5 ya dola themanini. Niliipima. Kuendesha mfumo mdogo wa parameta bilioni moja nukta tano kunakupa ishara tatu tu kwa sekunde wakati bodi inafungia kwa nyuzi joto themanini na tano Celsius. Ni toy nzuri ya wikendi, lakini kama dereva wa maendeleo wa kila siku, ni adhabu kamili. Kwa programu, tumia Ollama ikiwa unataka daemon safi ya mstari wa amri inayounganisha

4:47 moja kwa moja kwa Cursor, Cline, au VS Code. Ikiwa unataka uwanja wa michezo wa picha na upakuaji wa mfumo na vitelezi vya tabaka za GPU, tumia LM Studio. Na linganisha muundo wako na silikoni yako. Kwenye Apple Silicon, pakua mifumo ya GGUF iliyoboreshwa kwa Metal kila wakati. Kwenye Windows au Linux na Nvidia, pakua mifumo ya AWQ au EXL2, ambayo hutumia Nvidia Tensor Cores kwa inferensi ya asilimia ishirini hadi thelathini kwa kasi zaidi. Kwa hivyo unawezaje kupeleka hii bila kufilisika?

5:11 Fikiria vifaa vya ndani kama vile gym ya nyumbani dhidi ya gym ya kibiashara. Kuwa na rack ya squat nyumbani inamaanisha unafanya mazoezi kila siku bila safari, bila ada za usajili, na faragha kamili. Mashine yako ya ndani inashughulikia asilimia themanini ya usimbaji wako wa kila siku, upimaji wa kitengo, na usindikaji wa hati za kibinafsi kwa dola sifuri kwa ishara. Na unapohitaji kuinua pauni mia tano—kama vile marekebisho makubwa ya usanifu wa repo-wide katika faili hamsini—unatembelea gym ya kibiashara: lipa API ya wingu kwa Claude 3.5 Sonnet au OpenAI o3 kwa dakika kumi na tano

5:38 na uendelee. Hapa kuna bili: ujenzi wa Kiwango cha 2 na 3090 iliyotumika unagharimu dola elfu moja na mia sita kwa jumla. Ikiwa unatumia dola hamsini hadi mia moja kwa mwezi kwenye ishara za API, inalipa yenyewe katika miezi kumi na nane huku ikiweka codebase yako ya umiliki nje ya seva za mtu wa tatu. Uamuzi wa jaribio la uwanja wa leo: SHIP IT. VRAM na upana wa kumbukumbu hupiga kasi za saa kila wakati. Acha kununua CPU za gigahertz tano kwa AI, na uende ukatafute 3090 iliyotumika.

6:04 Niambie ni ujenzi gani wa vifaa unaoendesha kwa mifumo ya ndani kwenye maoni. Na ikiwa ungependa kusoma ufafanuzi huu, pata jarida kwenye the daily diff dot dev, kiungo hapa chini. Na hiyo ndio tofauti kwa leo. Mimi ni Niko kutoka Axrisi. Unganisha kwa uwajibikaji.

## Vyanzo

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
