Տեղական AI սարքավորումների ուղեցույց (2026)
Տեղական AI գործակալների և բաց քաշային LLM-ների համար մեքենա կառուցելիս ծրագրավորողները սխալ են թույլ տալիս՝ գնելով խաղային համակարգիչների բնութագրեր՝ 5.8 ԳՀց պրոցեսորներ, հարմարեցված հեղուկ հովացման համակարգեր և արագ խաղային GPU-ներ՝ ընդամենը 8 ԳԲ VRAM-ով: Սակայն ինքնավերարտադրվող նշանների ստեղծումը հիմնված է հիշողության թողունակության վրա, ոչ թե հաշվողական հզորության վրա.
Տեղական AI գործակալների և բաց քաշային LLM-ների համար մեքենա կառուցելիս ծրագրավորողները սխալ են թույլ տալիս՝ գնելով խաղային համակարգիչների բնութագրեր՝ 5.8 ԳՀց պրոցեսորներ, հարմարեցված հեղուկ հովացման համակարգեր և արագ խաղային GPU-ներ՝ ընդամենը 8 ԳԲ VRAM-ով: Սակայն ինքնավերարտադրվող նշանների ստեղծումը հիմնված է հիշողության թողունակության վրա, ոչ թե հաշվողական հզորության վրա. մեկ նշան արտածելու համար մոդելի յուրաքանչյուր կշիռ պետք է հոսի հիշողության ավտոբուսով: Երբ ձեր կշիռները կամ KV քեշի կոնտեքստը գերազանցում են ֆիզիկական VRAM-ը, աշխատաժամանակը շերտերը փոխանցում է համակարգի DDR5-ին PCIe-ի միջոցով, և դուք բախվում եք հիշողության թողունակության 20 անգամ անկմանը. արագությունը 40 նշանից մեկ վայրկյանում իջնում է մինչև 1.5: Այս դաշտային փորձարկման մեջ Նիկոն մանրամասնում է սարքավորումների մեխանիզմները, 4-բիթանոց քվանտիզացիայի մոդելի չափերի կանոնները, երեք իրական բյուջետային մակարդակներ՝ 1,200 դոլարից մինչև 5,000 դոլար, թե ինչու է օգտագործված RTX 3090 24 ԳԲ-ը լավագույն VRAM-ը մեկ դոլարի դիմաց հաշվողական տեխնիկայում, Raspberry Pi-ի "edge" ծուղակը և տնային մարզասրահի ռազմավարությունը տեղական ընդդեմ ամպային ինֆերենցիայի համար: Դատավճիռ՝ SHIP IT:
Կարդացեք գրավոր տարբերակը (անգլերեն) ↗
Ինչ է ընդգրկում այս տեսանյութը
- Հիշողության թողունակության 20x անկում. 936 ԳԲ/վ GDDR6X ընդդեմ 50 ԳԲ/վ DDR5 և 31.5 ԳԲ/վ PCIe
- Մոդելի չափսերը @ 4-բիթ. 8B (5ԳԲ), 14B (10ԳԲ), 32B (20ԳԲ), 70B (40ԳԲ)
- Մակարդակ 1 (1,200–1,500 դոլար). RTX 4060 Ti 16ԳԲ (երբեք 8ԳԲ) կամ Mac Mini 16ԳԲ
- Մակարդակ 2 (1,500–2,000 դոլար). Օգտագործված RTX 3090 24ԳԲ լավագույն տարբերակը կամ Mac Mini M4 Pro 64ԳԲ
- Մակարդակ 3 (3,500$+). RTX 4090 24ԳԲ / կրկնակի 3090 կամ Mac Studio Ultra
Թարգմանված արձանագրություն
Թարգմանվել է բնօրինակ անգլերեն պատմությունից։ Հասանելի աուդիո և ենթագրերը վերահսկվում են YouTube-ի կողմից։
0:00 Եթե նախատեսում եք համակարգիչ կառուցել տեղական AI գործակալներ գործարկելու համար, դադարեք խաղային համակարգիչ կառուցել։ Ձեզ պետք չէ 5.8 ԳՀց Core i9, հեղուկ հովացման համակարգ, կամ 8 ԳԲ գրաֆիկական քարտ՝ ծածկված RGB լույսերով։ Տեղական AI ինֆերենցիայի դեպքում խաղային բնութագրերն, ըստ էության, անօգուտ են: Միակ չափանիշը, որը թելադրում է, թե արդյոք ձեր գործակալը կաշխատի, թե կսողա, VRAM-ի հզորությունն է և հիշողության ավտոբուսի թողունակությունը։ Սարքավորումների փորձարկման կանոններ՝ մոռացեք պրոցեսորի ժամացույցի հաճախականությունների և ռաստերիզացիայի բենչմարկների մասին:
0:24 Մեզ հետաքրքրում են երեք թվեր՝ հիշողության ավտոբուսի լայնությունը, թողունակությունը գիգաբայթերով վայրկյանում և VRAM-ի հում պահուստը KV քեշի ուռճացման համար։ Այս դաշտային փորձարկման մեջ ես կմանրամասնեմ հիշողության թողունակության 20-անգամյա անկումը, կգծագրեմ մոդելի չափերի կանոնները, կգնահատեմ երեք իրական մակարդակներ՝ 1200 դոլարից մինչև 5000 դոլար, և կբացատրեմ, թե ինչու է օգտագործված 3090-ը դեռևս հաշվողական տեխնիկայի ամենամեծ խաբեության կոդը։ Սա The Daily Diff-ն է, դաշտային փորձարկում։ Հասկանալու համար, թե ինչու են խաղային համակարգիչները ձախողվում, դիտարկեք, թե ինչպես է իրականում տեղի ունենում նշանների ստեղծումը: Խաղերում ձեր պրոցեսորը մատակարարում է նկարչական կանչեր, իսկ ձեր GPU-ն մշակում է կադրերը:
0:54 Սակայն ինքնավերարտադրվող LLM վերծանումը գրեթե բացառապես հիշողության թողունակության վրա է հիմնված։ Մեկ նշան ստեղծելու համար GPU-ն պետք է մոդելի յուրաքանչյուր կշիռի պարամետրը հիշողությունից անցկացնի իր հաշվողական միջուկների միջով։ մոդելը հիշողությունից իր հաշվողական միջուկների միջով։ Եթե ձեր մոդելը տասը գիգաբայթ է, մեկ նշան արտադրելը նշանակում է տասը գիգաբայթ տվյալներ կարդալ։ Nvidia RTX 3090-ի վրա՝ 384-բիթանոց հիշողության ավտոբուսով, դուք ստանում եք 936 գիգաբայթ վայրկյանում GDDR6X թողունակություն, արտադրելով ութսուն նշան վայրկյանում։ Բայց դիտեք, թե ինչ է տեղի ունենում այն միլիվայրկյանին, երբ ձեր մոդելը գերազանցում է ֆիզիկական VRAM-ը:
1:22 Երբ VRAM-ը լցվում է, աշխատաժամանակը մնացած շերտերը PCIe ավտոբուսով տեղափոխում է համակարգի DDR5 հիշողություն։ Ձեր GPU միջուկներն ակնկալում են հազար գիգաբայթ վայրկյանում: Փոխարենը, երկկողմանի DDR5-ը նրանց մատակարարում է հիսուն, իսկ PCIe 4-ը խեղդվում է երեսունմեկի վրա: Դա քսան անգամ թողունակության անկում է։ Նշանների ստեղծման խողովակաշարն անմիջապես կանգ է առնում՝ սպասելով ավտոբուսին, և արագությունը 40 նշանից մեկ վայրկյանում իջնում է մինչև 1.5։ Դուք երկու հազար դոլարանոց համակարգը վերածել եք ջեռուցիչի:
1:47 Եվ այն ավելի է վատանում բազմաշերտ գործակալների աշխատանքի ժամանակ, քանի որ կշիռները պայքարի միայն կեսն են: Յուրաքանչյուր հրահանգ, գործիքի կանչ և ֆայլի հատված պահվում է Key-Value քեշում: Երեսուններկու կոնտեքստային պատուհանը կարող է սպառել չորսից ութ գիգաբայթ VRAM՝ ի լրումն կշիռների։ VRAM-ի վրա՝ ի լրումն կշիռների։ Եթե ձեր քարտը ունի ընդամենը տասնվեց գիգաբայթ, ձեր գործակալը երկու անգամ կրկնում է իր գործողությունները, բախվում է կոնտեքստային պատին և կամ խափանվում է հիշողության սխալով, կամ արտահոսում է DDR5-ի մեջ: Ահա 4-բիթանոց չափսերի խաբեության թերթիկը։ Յոթ կամ ութ միլիարդ պարամետր ունեցող մոդելը, ինչպիսին են Llama 3.1-ը կամ DeepSeek Distill-ը,
2:16 պահանջում է մոտ հինգ գիգաբայթ: Տասնչորս միլիարդ պարամետր ունեցող մոդելը պահանջում է տասը գիգաբայթ: Երեսուներկու միլիարդ պարամետր ունեցող մոդելը՝ ծրագրավորման գործակալների համար ինտելեկտի լավագույն կետը, պահանջում է քսան գիգաբայթ: Եվ յոթանասուն միլիարդի սահմանային մոդելը պահանջում է քառասուն գիգաբայթ, նախքան նույնիսկ կոնտեքստը հատկացնելը։ Ինչը մեզ բերում է իրական սարքավորումների կառուցմանը։ Մակարդակ 1-ը սկզբնական համակարգն է՝ 1200-ից 1500 դոլար։ PC-ի վրա ձեր հիմնական կետը RTX 4060 Ti 16 ԳԲ է։
2:39 Կարևոր զգուշացում. երբեք մի գնեք ութ գիգաբայթանոց տարբերակը՝ յոթանասուն դոլար խնայելու համար։ 8 ԳԲ VRAM-ը 2026 թվականին անմիջապես հիշողության բացակայության մահվան դատավճիռ է ցանկացած իրական գործակալի աշխատանքի վրա։ Զուգակցեք այն վեց միջուկանի Ryzen 5-ի, վաթսունչորս գիգաբայթ DDR5-ի և երկու տերաբայթ NVMe կրիչի հետ: Apple-ի աշխարհում համարժեքը Mac Mini-ն կամ MacBook Pro-ն է՝ տասնվեց գիգաբայթ միասնական հիշողությամբ։
3:02 Դուք կտեսնեք քառասունից հիսուն նշան վայրկյանում ութ միլիարդ պարամետր ունեցող մոդելների վրա: Մակարդակ 2-ը հզոր օգտատերերի համար է՝ հատուկ կառուցված երեսուներկու միլիարդ պարամետր ունեցող մոդելներ, ինչպիսին է Qwen 2.5 32B-ը։ Ա ճանապարհը նոր RTX 4070 Ti Super-ն է՝ տասնվեց գիգաբայթով՝ ութ հարյուր դոլարով։ Բայց Բ ճանապարհն իմ ամուր առաջարկն է. գնեք օգտագործված Nvidia RTX 3090 քսանչորս գիգաբայթ։ Մաքուր 3090-ներ կարող եք գտնել eBay-ում վեց հարյուր հիսունից մինչև յոթ հարյուր հիսուն դոլարով։ Դա ձեզ տալիս է քսանչորս գիգաբայթ VRAM հսկայական 384-բիթանոց ավտոբուսի վրա, որը մղում է
3:33 936 գիգաբայթ վայրկյանում: Դոլար առ դոլար, դա VRAM-ի լավագույն գործարքն է հաշվողական աշխարհում: macOS-ի վրա Tier 2-ի համարժեքը Mac Mini M4 Pro-ն է՝ վաթսունչորս գիգաբայթ միասնական հիշողությամբ: Այն արտադրում է տասնմեկից տասներկու նշան վայրկյանում երեսուներկու միլիարդ պարամետր ունեցող մոդելի վրա։ Ավելի դանդաղ, քան Nvidia-ն, բայց բացարձակապես անաղմուկ՝ երեսուն վատտ հզորությամբ և հսկայական կոնտեքստային պատուհանի համար տեղով։ Մակարդակ 3-ը էնտուզիաստների համար է բազմագործակալային խմբերի համար։ PC-ի վրա դա նշանակում է RTX 4090՝ քսանչորս գիգաբայթով,
3:57 Ryzen 9 և հարյուր քսանութ գիգաբայթ RAM, կամ երկակի RTX 3090-ներ, որոնք ապահովում են քառասունութ գիգաբայթ ընդհանուր VRAM։ Apple-ի շարքում սա Mac Studio Ultra-ն է՝ իննսունվեցից հարյուր քսանութ գիգաբայթ միասնական հիշողությամբ: Գերհզորությունն է հիշողության մշտական մնալը. դուք կարող եք պահել ներկառուցման մոդել, արագ երթուղիչ և 32 միլիարդ պարամետր ունեցող կոդավորման մոդել միաժամանակ բեռնված՝ զրո փոխանակման ուշացումով: Հիմա մեր դաշտային փորձարկման անկեղծ ձախողման մասին՝ edge computing-ի ծուղակը:
4:24 Ամեն շաբաթ սոցիալական գրառումը պնդում է, որ դուք կարող եք ինքնավար կոդավորման գործակալներ գործարկել ութսուն դոլարանոց Raspberry Pi 5-ի վրա։ Ես փորձարկեցի այն: Շատ փոքր՝ 1.5 միլիարդ պարամետր ունեցող մոդելը գործարկելը ձեզ հազիվ է տալիս երեք նշան վայրկյանում, մինչդեռ պլատան խեղդվում է ութսունհինգ աստիճան Ցելսիուսում։ Դա հաճելի հանգստյան օրվա խաղալիք է, բայց որպես ամենօրյա զարգացման վարորդ, դա մաքուր պատիժ է։ Ծրագրային ապահովման համար օգտագործեք Ollama-ն, եթե ցանկանում եք մաքուր հրամանատարական տողի դաեմոն, որը միանում է
4:47 անմիջապես Cursor-ին, Cline-ին կամ VS Code-ին: Եթե ցանկանում եք գրաֆիկական խաղահրապարակ՝ մոդելների ներբեռնումներով և GPU շերտի սլայդերներով, օգտագործեք LM Studio: Եվ ձեր ձևաչափը համապատասխանեցրեք ձեր սիլիցիումին: Apple Silicon-ի վրա միշտ ներբեռնեք Metal-ի համար օպտիմիզացված GGUF մոդելներ: Windows կամ Linux-ի վրա Nvidia-ի հետ ներբեռնեք AWQ կամ EXL2 մոդելներ, որոնք օգտագործում են Nvidia Tensor Cores-ը քսանից երեսուն տոկոսով ավելի արագ ինֆերենցիայի համար: Այսպիսով, ինչպես տեղակայել սա՝ առանց սնանկանալու։
5:11 Մտածեք տեղական սարքավորումների մասին, ինչպես տնային մարզասրահն ընդդեմ առևտրային մարզասրահի: Տանը squat rack ունենալը նշանակում է, որ դուք մարզվում եք ամեն օր՝ զրո երթևեկությամբ, զրո բաժանորդագրության վճարներով և ամբողջական գաղտնիությամբ։ Ձեր տեղական մեքենան մշակում է ձեր ամենօրյա կոդավորման ութսուն տոկոսը, միավորի փորձարկումը և մասնավոր փաստաթղթերի մշակումը՝ զրո դոլար մեկ նշանի համար։ Եվ երբ ձեզ հարկավոր է բարձրացնել հինգ հարյուր ֆունտ — ինչպես հսկայական ռեպո-լայն ճարտարապետական վերակառուցում հիսուն ֆայլերի միջև — դուք այցելում եք առևտրային մարզասրահ. վճարեք ամպային API-ին Claude 3.5 Sonnet-ի կամ OpenAI o3-ի համար տասնհինգ րոպեով
5:38 և անցեք առաջ։ Ահա հաշիվը. Tier 2 կառուցվածքը՝ օգտագործված 3090-ով, արժե տասնվեց հարյուր դոլար ամբողջությամբ։ Եթե դուք ծախսում եք հիսունից հարյուր դոլար ամիսը API թոքենների վրա, այն ինքն իրեն հետ է բերում տասնութ ամսվա ընթացքում՝ պահելով ձեր սեփական կոդային բազան երրորդ կողմի սերվերներից հեռու: Այսօրվա դաշտային փորձարկման վճիռը՝ SHIP IT։ VRAM-ը և հիշողության թողունակությունը միշտ գերազանցում են ժամացույցի արագություններին: Դադարեք AI-ի համար հինգ գիգահերցանոց պրոցեսորներ գնել և գտեք օգտագործված 3090:
6:04 Մեկնաբանություններում ինձ ասեք, թե ինչ սարքավորում եք օգտագործում տեղական մոդելների համար: Եվ եթե նախընտրում եք կարդալ այս վերլուծությունը, բաժանորդագրվեք լրատուին The Daily Diff dot dev կայքում, հղումը ներքևում։ Եվ վերջ, այսքանը այսօրվա համար։ Ես Նիկոն եմ՝ Axrisi-ից։ Միավորվեք պատասխանատվությամբ:
Աղբյուրներ
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



