# ადგილობრივი AI აპარატურის სახელმძღვანელო (2026)

Published: 2026-09-14

ადგილობრივი AI აგენტებისა და ღია წონის LLM-ებისთვის აპარატურის აწყობისას დეველოპერები შეცდომას უშვებენ და ყიდულობენ სათამაშო კომპიუტერის მახასიათებლებს: 5.8 გჰც CPU-ებს, თხევადი გაგრილების სისტემებს და სწრაფ სათამაშო GPU-ებს მხოლოდ 8 გბ VRAM-ით. მაგრამ ავტორეგრესიული ტოკენის გენერაცია მეხსიერების გამტარუნარიანობითაა შეზღუდული და არა გამოთვლითი სიმძლავრით: ერთი ტოკენის გამოსაცემად, მოდელის ყველა წონა მეხსიერების ავტობუსში უნდა გადაიცეს. როდესაც თქვენი წონები ან KV cache კონტექსტი გადააჭარბებს ფიზიკურ VRAM-ს, runtime ფენებს ათავისუფლებს სისტემის DDR5-ში PCIe-ის გავლით და თქვენ ეჯახებით მეხსიერების გამტარუნარიანობის 20-ჯერ შემცირებას: სიჩქარე ეცემა წამში 40 ტოკენიდან 1.5-მდე. ამ საველე ტესტში ნიკო განმარტავს აპარატურის მექანიკას, 4-ბიტიანი კვანტიზაციის მოდელის ზომის განსაზღვრის წესებს, სამ რეალურ ბიუჯეტურ დონეს $1,200-დან $5,000-მდე, რატომ არის მეორადი RTX 3090 24GB საუკეთესო VRAM-ის თანაფარდობის თვალსაზრისით კომპიუტერულ სამყაროში, Raspberry Pi-ის ხაფანგს და სახლის სავარჯიშო დარბაზის სტრატეგიას ადგილობრივი და ღრუბლოვანი ინფერენციისთვის. ვერდიქტი: SHIP IT.

Canonical: https://thedailydiff.dev/ka/video/2026-09-14-local-ai-hardware/

## რას მოიცავს ეს ვიდეო

- მეხსიერების გამტარუნარიანობის 20-ჯერ შემცირება: 936 გბ/წმ GDDR6X vs 50 გბ/წმ DDR5 &amp; 31.5 გბ/წმ PCIe
- მოდელის ზომის განსაზღვრა @ 4-ბიტი: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- დონე 1 ($1,200–$1,500): RTX 4060 Ti 16GB (არასოდეს 8GB) ან Mac Mini 16GB
- დონე 2 ($1,500–$2,000): მეორადი RTX 3090 24GB ოპტიმალური ვარიანტი ან Mac Mini M4 Pro 64GB
- დონე 3 ($3,500+): RTX 4090 24GB / ორმაგი 3090s ან Mac Studio Ultra

## ნათარგმნი ტრანსკრიპტი

ნათარგმნია ორიგინალური ინგლისური ნარატივიდან. ხელმისაწვდომი აუდიო და სუბტიტრები კონტროლდება YouTube-ის მიერ.

0:00 თუ გეგმავთ კომპიუტერის აწყობას ადგილობრივი AI აგენტების გასაშვებად, შეწყვიტეთ სათამაშო კომპიუტერის აწყობა. თქვენ არ გჭირდებათ 5.8 გიგაჰერციანი Core i9, თხევადი გაგრილების სისტემა, ან რვა გიგაბაიტიანი გრაფიკული ბარათი RGB განათებით. ადგილობრივი AI ინფერენციისას, სათამაშო მახასიათებლები პრაქტიკულად უსარგებლოა. ერთადერთი მაჩვენებელი, რომელიც კარნახობს, იმუშავებს თუ არა თქვენი აგენტი, არის VRAM ტევადობა და მეხსიერების ავტობუსის გამტარუნარიანობა. აპარატურის ტესტის წესები: დაივიწყეთ CPU-ს სიხშირეები და რასტერიზაციის ბენჩმარკები.

0:24 ჩვენთვის მნიშვნელოვანია სამი რიცხვი: მეხსიერების ავტობუსის სიგანე, გამტარუნარიანობა გიგაბაიტებში წამში და ნედლი VRAM რეზერვი KV cache-ის გასაბერად. ამ საველე ტესტში, მე განვიხილავ მეხსიერების გამტარუნარიანობის ოციჯერ შემცირებას, ავღწერ მოდელის ზომის განსაზღვრის წესებს, შევაფასებ სამ რეალურ დონეს ათას ორასი დოლარიდან ხუთ ათასამდე და განვმარტავ, რატომ არის მეორადი 3090 კვლავ გამოთვლების ყველაზე დიდი „მოტყუების კოდი“. ეს არის The Daily Diff, საველე ტესტი. იმის გასაგებად, თუ რატომ მარცხდება სათამაშო კომპიუტერები, დააკვირდით, როგორ ხდება ტოკენის გენერაცია სინამდვილეში. თამაშებში, თქვენი CPU კვებავს draw calls-ს და თქვენი GPU ამუშავებს კადრებს.

0:54 მაგრამ ავტორეგრესიული LLM დეკოდირება თითქმის მთლიანად მეხსიერების გამტარუნარიანობითაა შეზღუდული. ერთი ტოკენის გენერირებისთვის, GPU-მ უნდა გადაიტანოს მოდელის ყველა წონის პარამეტრი მეხსიერებიდან თავისი გამოთვლითი ბირთვების გავლით. თუ თქვენი მოდელი ათი გიგაბაიტია, ერთი ტოკენის წარმოება ნიშნავს ათი გიგაბაიტი მონაცემების წაკითხვას. Nvidia RTX 3090-ზე 384-ბიტიანი მეხსიერების ავტობუსით, თქვენ მიიღებთ 936 გიგაბაიტს წამში GDDR6X გამტარუნარიანობას, წარმოქმნით ოთხმოც ტოკენს წამში. მაგრამ ნახეთ, რა ხდება იმ წამს, როდესაც თქვენი მოდელი გადააჭარბებს ფიზიკურ VRAM-ს.

1:22 როდესაც VRAM ივსება, runtimes გადააქვს დარჩენილი ფენები PCIe ავტობუსის გავლით სისტემის DDR5 მეხსიერებაში. თქვენი GPU ბირთვები ელოდებიან ათას გიგაბაიტს წამში. ამის ნაცვლად, ორარხიანი DDR5 მათ აწვდის ორმოცდაათს, ხოლო PCIe 4 იხრჩობა ოცდათერთმეტზე. ეს არის ოციჯერ შემცირებული გამტარუნარიანობა. ტოკენის გენერაციის კონვეიერი მყისიერად ჩერდება ავტობუსის მოლოდინში, და სიჩქარე ეცემა წამში ორმოცი ტოკენიდან ერთნახევრამდე. თქვენ ორ ათას დოლარიანი კომპიუტერი გადააქციეთ გამათბობლად.

1:47 და ეს უარესდება მრავალჯერადი აგენტის გაშვებისას, რადგან წონები მხოლოდ ნახევარია ბრძოლის. ყოველი მოთხოვნა, ხელსაწყოს გამოძახება და ფაილის ნაწილი ინახება Key-Value cache-ში. ოცდათორმეტი K კონტექსტის ფანჯარას შეუძლია ოთხიდან რვა გიგაბაიტი VRAM-ის მოხმარება წონების გარდა. თუ თქვენს ბარათს მხოლოდ თექვსმეტი გიგაბაიტი აქვს, თქვენი აგენტი ორჯერ ციკლს გაივლის, დაარტყამს კონტექსტის კედელს და ან კრახდება მეხსიერების ამოწურვის შეცდომით ან გადადის DDR5-ში. აქ არის ოთხბიტიანი ზომის "მოტყუების ფურცელი" (cheat sheet). შვიდი ან რვა მილიარდი პარამეტრის მოდელი, როგორიცაა Llama 3.1 ან DeepSeek Distill,

2:16 მოითხოვს დაახლოებით ხუთ გიგაბაიტს. თოთხმეტი მილიარდი პარამეტრის მოდელი მოითხოვს ათ გიგაბაიტს. ოცდათორმეტი მილიარდი პარამეტრის მოდელი, ინტელექტის ოპტიმალური ვარიანტი კოდირების აგენტებისთვის, მოითხოვს ოც გიგაბაიტს. და სამოცდაათი მილიარდი პარამეტრის წამყვანი მოდელი მოითხოვს ორმოცი გიგაბაიტს კონტექსტის გამოყოფამდეც კი. რაც მიგვიყვანს რეალურ აპარატურულ კონფიგურაციებამდე. დონე 1 არის საწყისი კომპიუტერი, ათას ორასიდან ათას ხუთას დოლარამდე. კომპიუტერზე, თქვენი ძირითადი არჩევანია RTX 4060 Ti 16-გიგაბაიტიანი.

2:39 კრიტიკული გაფრთხილება: არასოდეს იყიდოთ რვა გიგაბაიტიანი ვერსია სამოცდაათი დოლარის დაზოგვის მიზნით. რვა გიგაბაიტი VRAM 2026 წელს არის მყისიერი მეხსიერების ამოწურვის სასიკვდილო განაჩენი ნებისმიერ რეალურ აგენტურ სამუშაო პროცესში. შეუხამეთ მას ექვსბირთვიანი Ryzen 5, სამოცდაოთხი გიგაბაიტი DDR5, და ორ ტერაბაიტიანი NVMe დისკი. Apple-ის სამყაროში, ექვივალენტია Mac Mini ან MacBook Pro თექვსმეტი გიგაბაიტი ერთიანი მეხსიერებით.

3:02 თქვენ იხილავთ ორმოციდან ორმოცდაათ ტოკენს წამში რვა მილიარდიან მოდელებზე. დონე 2 არის მოწინავე მომხმარებლისთვის ოპტიმალური ვარიანტი: სპეციალურად შექმნილი ოცდათორმეტი მილიარდი პარამეტრის მოდელების გასაშვებად, როგორიცაა Qwen 2.5 32B. გზა A არის ახალი RTX 4070 Ti Super თექვსმეტი გიგაბაიტით რვაასი დოლარად. მაგრამ გზა B არის ჩემი მკაცრი რეკომენდაცია: შეიძინეთ მეორადი Nvidia RTX 3090 ოცდაოთხი გიგაბაიტი. eBay-ზე შეგიძლიათ იპოვოთ კარგ მდგომარეობაში მყოფი 3090-ები ექვსას ორმოცდაათიდან შვიდას ორმოცდაათ დოლარამდე. ეს გაძლევთ ოცდაოთხ გიგაბაიტ VRAM-ს მასიურ 384-ბიტიან ავტობუსზე, რომელიც უზრუნველყოფს

3:33 936 გიგაბაიტს წამში. დოლარი დოლარზე, ეს არის საუკეთესო VRAM შეთავაზება გამოთვლით ტექნიკაში. macOS-ზე, დონე 2-ის ეკვივალენტია Mac Mini M4 Pro სამოცდაოთხი გიგაბაიტი ერთიანი მეხსიერებით. ის აწარმოებს თერთმეტიდან თორმეტ ტოკენს წამში ოცდათორმეტი მილიარდიან მოდელზე: Nvidia-ზე ნელა, მაგრამ სრულიად ჩუმად ოცდაათ ვატზე, დიდი კონტექსტური ფანჯრისთვის. დონე 3 არის ენთუზიასტების კატეგორია მრავალაგენტური სისტემებისთვის. კომპიუტერზე, ეს ნიშნავს RTX 4090-ს ოცდაოთხი გიგაბაიტით,

3:57 Ryzen 9-ს და ას ოცდარვა გიგაბაიტ RAM-ს, ან ორმაგ RTX 3090-ს, რომელიც უზრუნველყოფს სულ ორმოცდარვა გიგაბაიტ VRAM-ს. Apple-ის შემადგენლობაში, ეს არის Mac Studio Ultra ოთხმოცდათექვსმეტიდან ას ოცდარვა გიგაბაიტი ერთიანი მეხსიერებით. მისი უპირატესობაა მეხსიერებაში მუდმივი შენახვა: შეგიძლიათ გქონდეთ ჩატვირთული embedding მოდელი, სწრაფი როუტერი და 32-მილიარდიანი კოდირების მოდელი ერთდროულად, ნულოვანი შეფერხებით. ახლა კი ჩვენი საველე ტესტის გულახდილი წარუმატებლობა: edge computing-ის ხაფანგი.

4:24 ყოველ კვირას სოციალურ ქსელში ჩნდება პოსტი, რომ შეგიძლიათ ავტონომიური კოდირების აგენტები გაუშვათ ოთხმოც დოლარიან Raspberry Pi 5-ზე. მე გამოვცადე. პატარა ერთნახევარი მილიარდი პარამეტრის მოდელის გაშვება გაძლევთ ძლივს სამ ტოკენს წამში, მაშინ როცა დაფა ოთხმოცდახუთ გრადუს ცელსიუსზე ითიშება. ეს არის სასიამოვნო შაბათ-კვირის სათამაშო, მაგრამ როგორც ყოველდღიური განვითარების მამოძრავებელი ძალა, ეს წმინდა ტანჯვაა. პროგრამული უზრუნველყოფისთვის, გამოიყენეთ Ollama, თუ გსურთ სუფთა ბრძანების ხაზის დემონი, რომელიც უერთდება

4:47 პირდაპირ Cursor-ს, Cline-ს ან VS Code-ს. თუ გსურთ გრაფიკული სათამაშო მოედანი მოდელის ჩამოტვირთვით და GPU ფენის სლაიდერებით, გამოიყენეთ LM Studio. და შეუსაბამეთ თქვენი ფორმატი თქვენს სილიკონს. Apple Silicon-ზე, ყოველთვის ჩამოტვირთეთ GGUF მოდელები, ოპტიმიზებული Metal-ისთვის. Windows-ზე ან Linux-ზე Nvidia-ით, ჩამოტვირთეთ AWQ ან EXL2 მოდელები, რომლებიც იყენებენ Nvidia Tensor Cores-ს ოციდან ოცდაათ პროცენტამდე უფრო სწრაფი ინფერენციისთვის. მაშ, როგორ განვახორციელოთ ეს გაღარიბების გარეშე?

5:11 ადგილობრივი აპარატურა წარმოიდგინეთ, როგორც სახლის სპორტული დარბაზი კომერციული სპორტული დარბაზის წინააღმდეგ. სახლში ჩაჯდომის თარო ნიშნავს, რომ ყოველდღე ვარჯიშობთ ნულოვანი მგზავრობით, ნულოვანი სააბონენტო გადასახადით და სრული კონფიდენციალურობით. თქვენი ადგილობრივი მანქანა ასრულებს თქვენი ყოველდღიური კოდირების ოთხმოცი პროცენტს, ერთეულის ტესტირებას და პირადი დოკუმენტების დამუშავებას ნულ დოლარად თითო ტოკენზე. და როცა გჭირდებათ ხუთასი ფუნტის დედლიფტის გაკეთება — როგორიცაა მასიური repo-wide არქიტექტურული რეფაქტორი ორმოცდაათ ფაილზე — თქვენ სტუმრობთ კომერციულ დარბაზს: იხდით ღრუბლოვანი API-სთვის Claude 3.5 Sonnet-ისთვის ან OpenAI o3-ისთვის თხუთმეტი წუთით

5:38 და აგრძელებთ. აქ არის გადასახადი: დონე 2-ის კონფიგურაცია მეორადი 3090-ით ჯამში ათას ექვსასი დოლარი ღირს. თუ თვეში ორმოცდაათიდან ას დოლარს ხარჯავთ API ტოკენებზე, ის თვრამეტ თვეში იხდის თავს, ხოლო თქვენი საკუთრების კოდური ბაზა მესამე მხარის სერვერებისგან დაცულია. დღევანდელი საველე ტესტის ვერდიქტი: SHIP IT. VRAM და მეხსიერების გამტარუნარიანობა ყოველთვის ჯობს საათის სიხშირეებს. შეწყვიტეთ ხუთ გიგაჰერციანი CPU-ების ყიდვა AI-ისთვის და იპოვეთ მეორადი 3090.

6:04 მომწერეთ კომენტარებში, რა აპარატურულ კონფიგურაციას იყენებთ ადგილობრივი მოდელებისთვის. და თუ გირჩევნიათ ამ ანალიზის წაკითხვა, გამოიწერეთ ბიულეტენი the daily diff dot dev-ზე, ბმული ქვემოთ. და ეს არის დღევანდელი განსხვავება. მე ვარ ნიკო Axrisi-დან. შეაერთეთ პასუხისმგებლობით.

## წყაროები

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
