+− THE DAILY DIFFdev & AI news
SHIP IT

Lokal Süni İntellekt Avadanlığı Bələdçisi (2026)

Lokal süni intellekt agentləri və açıq çəkili LLM-lər üçün maşın qurarkən, tərtibatçılar oyun PC xüsusiyyətləri almaq səhvini edirlər: 5.8 GHz CPU-lar, xüsusi maye soyutma sistemləri və yalnız 8GB VRAM olan sürətli oyun GPU-ları.

Lokal süni intellekt agentləri və açıq çəkili LLM-lər üçün maşın qurarkən, tərtibatçılar oyun PC xüsusiyyətləri almaq səhvini edirlər: 5.8 GHz CPU-lar, xüsusi maye soyutma sistemləri və yalnız 8GB VRAM olan sürətli oyun GPU-ları. Lakin avtoreqressiv token yaratma hesablama ilə deyil, yaddaş bant genişliyi ilə məhdudlaşır: tək bir token yaymaq üçün modeldəki hər bir çəki yaddaş şini üzərindən axmalıdır. Çəkiləriniz və ya KV keş kontekstiniz fiziki VRAM-ı keçdikdə, işləmə mühiti layları PCIe üzərindən sistem DDR5-ə köçürür və siz 20 qat yaddaş bant genişliyi uçurumuna düşürsünüz: sürət saniyədə 40 tokendən 1.5-ə düşür. Bu sahə testində Niko aparat mexanizmlərini, 4-bit kvantizasiya modelinin ölçülmə qaydalarını, 1,200 dollardan 5,000 dollara qədər üç real büdcə səviyyəsini, istifadə edilmiş RTX 3090 24GB-ın niyə hesablama sahəsində dollar başına ən yaxşı VRAM sövdələşməsi olduğunu, Raspberry Pi kənar tələsini və yerli ilə bulud inferensi arasında ev idman zalı strategiyasını təhlil edir. Hökm: SHIP IT.

Yazılı nəşri oxuyun (İngiliscə) ↗

Bu videoda nələr əhatə olunur

  • 20 qat yaddaş bant genişliyi uçurumu: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
  • Model ölçüləri @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Səviyyə 1 (1,200–1,500 dollar): RTX 4060 Ti 16GB (heç vaxt 8GB) və ya Mac Mini 16GB
  • Səviyyə 2 (1,500–2,000 dollar): İstifadə edilmiş RTX 3090 24GB ideal nöqtə və ya Mac Mini M4 Pro 64GB
  • Səviyyə 3 (3,500$+): RTX 4090 24GB / iki 3090 və ya Mac Studio Ultra

Tərcümə olunmuş transkript

Orijinal ingilis dilindəki nəqldən tərcümə edilmişdir. Mövcud audio və subtitrlər YouTube tərəfindən idarə olunur.

0:00 Əgər siz lokal süni intellekt agentlərini işə salmaq üçün PC qurmağı planlaşdırırsınızsa, oyun qurğusu qurmağı dayandırın. Sizə 5.8 giqahers Core i9, maye soyutma dövrü lazım deyil, və ya RGB ilə örtülmüş səkkiz giqabaytlıq qrafik kartı. Lokal süni intellekt inferensində oyun xüsusiyyətləri demək olar ki, faydasızdır. Agentinizin işlədiyini və ya süründüyünü diktə edən yeganə metrika VRAM tutumudur və yaddaş şini bant genişliyi. Aparat testinin qaydaları: CPU saatlarını və rastrlama etalonlarını unudun.

0:24 Bizi üç rəqəm maraqlandırır: yaddaş şini genişliyi, saniyədə giqabaytlarla bant genişliyi və KV keş şişkinliyi üçün xam VRAM boşluğu. Bu sahə testində mən iyirmi qat yaddaş bant genişliyi uçurumunu təhlil edəcəyəm, model ölçüsü qaydalarını xəritələyəcəyəm, on iki yüz dollardan beş min dollara qədər üç real səviyyəni müqayisə edəcəyəm və niyə istifadə edilmiş 3090-ın hələ də hesablama sahəsinin ən böyük hiylə kodu olduğunu izah edəcəyəm. Bu, The Daily Diff, sahə testidir. Oyun qurğularının niyə uğursuz olduğunu anlamaq üçün token yaratmanın əslində necə işlədiyinə baxın. Oyunlarda CPU-nuz çəkmə çağırışlarını bəsləyir və GPU-nuz çərçivələri render edir.

0:54 Lakin avtoreqressiv LLM dekodlaması demək olar ki, sırf yaddaş bant genişliyi ilə məhdudlaşır. Tək bir token yaratmaq üçün GPU, modelin hər bir çəki parametrini yaddaşdan öz hesablama nüvələri vasitəsilə axın etdirməlidir. modeldən yaddaşdan öz hesablama nüvələri vasitəsilə. Əgər modeliniz on giqabaytdırsa, bir token yaratmaq on giqabayt məlumatı oxumaq deməkdir. 384-bit yaddaş şini olan bir Nvidia RTX 3090-da, saniyədə 936 giqabayt GDDR6X bant genişliyi əldə edirsiniz, saniyədə səksən token istehsal edir. Lakin modeliniz fiziki VRAM-ı bir millisekund keçəndə nə baş verdiyinə baxın.

1:22 VRAM dolanda, işləmə mühitləri qalan layları PCIe şini üzərindən sistem DDR5 yaddaşına köçürür. sistem DDR5 yaddaşına. GPU nüvələriniz saniyədə min giqabayt gözləyir. Bunun əvəzinə, iki kanallı DDR5 onlara əlli verir və PCIe 4 otuz bir gigabaytda boğulur. Bu, iyirmi qat bant genişliyi çöküşüdür. Token yaratma boru xətti avtomatik olaraq şin gözləyərkən dayanır, və sürət saniyədə qırx tokendən bir nöqtə beşə düşür. Siz iki min dollarlıq qurğunu qızdırıcıya çevirdiniz.

1:47 Və çoxdövrlü agent işləmələri zamanı daha da pisləşir, çünki çəkilər döyüşün yalnız yarısıdır. Hər bir sorğu, alət çağırışı və fayl hissəciyi Açar-Dəyər keşində saxlanılır. Otuz iki min kontekst pəncərəsi çəkilərin üstündə dörd-səkkiz giqabayt VRAM yeyə bilər. VRAM-ın üstündə. Əgər kartınızda yalnız on altı giqabayt varsa, agentiniz iki dəfə dövr edir, kontekst divarına dəyir və ya yaddaşın olmaması səhv ilə qəza edir və ya DDR5-ə tökülür. DDR5-ə tökülür. Budur dörd-bit ölçüləndirmə yardım vərəqəsi. Llama 3.1 və ya DeepSeek Distill kimi yeddi və ya səkkiz milyard parametrli model

2:16 təxminən beş giqabayt yer tutur. On dörd milyardlıq model on giqabayt yer tutur. Otuz iki milyardlıq model, kodlaşdırma agentləri üçün intellektual ideal nöqtə, iyirmi giqabayt tələb edir. Və yetmiş milyardlıq sərhəd modeli, kontekst ayırmadan əvvəl qırx giqabayt tələb edir. Bu da bizi əsl aparat qurğularına gətirir. Səviyyə 1 başlanğıc qurğusudur, on iki yüzdən on beş yüz dollara qədər. PC-də, əsasınız RTX 4060 Ti 16-giqabaytdır.

2:39 Kritik xəbərdarlıq: heç vaxt səksən dollar qənaət etmək üçün səkkiz giqabaytlıq versiyanı almayın. 2026-cı ildə səkkiz giqabayt VRAM istənilən real agent iş axınında dərhal yaddaşın olmaması ilə ölüm hökmüdür. istənilən real agent iş axınında. Onu altı nüvəli Ryzen 5, altmış dörd giqabayt DDR5 və iki terabayt NVMe sürücüsü ilə birləşdirin. Apple dünyasında isə buna bərabər olan Mac Mini və ya Mac Pro MacBook Pro on altı giqabayt vahid yaddaşa malikdir. vahid yaddaş ilə.

3:02 Səkkiz milyardlıq modellərdə saniyədə qırx-əlli token görəcəksiniz. Səviyyə 2 güclü istifadəçilər üçün ideal nöqtədir: xüsusilə Qwen 2.5 32B kimi otuz iki milyard parametrli modelləri işlətmək üçün qurulur. otuz iki milyard parametrli modelləri işlətmək üçün. A Yolu səkkiz yüz dollara on altı giqabaytlıq yeni RTX 4070 Ti Superdir. Lakin B Yolu mənim güclü tövsiyəm: istifadə edilmiş Nvidia RTX 3090 iyirmi dörd giqabayt alın. eBay-da təmiz 3090-ları altı yüz əlli-yeddi yüz əlli dollara tapa bilərsiniz. yeddi yüz əlli dollara. Bu sizə nəhəng 384-bit şin üzərində 936 giqabayt saniyə ötürən iyirmi dörd giqabayt VRAM verir.

3:33 saniyədə 936 giqabayt ötürür. Dollar üçün dollar, bu, hesablama sahəsində ən yaxşı VRAM sövdələşməsidir. macOS-da, Səviyyə 2-nin qarşılığı altmış dörd giqabayt vahid yaddaşa malik Mac Mini M4 Pro-dur. vahid yaddaş ilə. Otuz iki milyardlıq modeldə saniyədə on bir-on iki token istehsal edir: Nvidia-dan daha yavaş, lakin otuz vattda səssizdir və nəhəng kontekst pəncərəsi üçün yer var. Səviyyə 3, çoxagentli sürüklər üçün həvəskar kateqoriyadır. PC-də bu, iyirmi dörd giqabaytlıq RTX 4090, Ryzen 9 və yüz iyirmi səkkiz giqabayt RAM deməkdir,

3:57 Ryzen 9 və yüz iyirmi səkkiz giqabayt RAM, və ya ümumi qırx səkkiz giqabayt VRAM təmin edən iki RTX 3090. Apple-ın məhsul xəttində bu, doxsan altıdan yüz iyirmi səkkiz giqabayt vahid yaddaşa malik Mac Studio Ultra-dır. iyirmi səkkiz giqabayt vahid yaddaş. Super gücü yaddaşda rezidentlikdir: bir embedding modelini, sürətli bir marşrutlaşdırıcını və 32 milyardlıq kodlaşdırma modelini eyni anda sıfır dəyişdirmə gecikməsi ilə yüklü saxlaya bilərsiniz. sürətli bir marşrutlaşdırıcı və 32 milyardlıq kodlaşdırma modelini eyni anda sıfır dəyişdirmə gecikməsi ilə. İndi sahə testimizin dürüst uğursuzluğu: kənar hesablama tələsi.

4:24 Hər həftə bir sosial post səksən dollarlıq Raspberry Pi 5-də avtonom kodlaşdırma agentlərini işlədə biləcəyinizi iddia edir. səksən dollarlıq Raspberry Pi 5. Mən onu test etdim. Kiçik bir nöqtə beş milyard parametrli model işlətmək sizə saniyədə demək olar ki, üç token verir, lövhə səksən beş dərəcə Selsidə boğularkən. Bu, əla bir həftəsonu oyuncağıdır, lakin gündəlik inkişaf sürücüsü kimi, bu, sırf cəzadır. Proqram təminatı üçün, Cursor, Cline və ya VS Code ilə birbaşa əlaqə quran təmiz bir komanda sətiri daemonu istəyirsinizsə, Ollama istifadə edin.

4:47 birbaşa Cursor, Cline və ya VS Code-a qoşulur. Model yükləmələri və GPU qat sürgüləri ilə qrafik bir oyun meydançası istəyirsinizsə, LM Studio istifadə edin. Və formatınızı silikonunuza uyğunlaşdırın. Apple Silicon-da, həmişə Metal üçün optimallaşdırılmış GGUF modellərini yükləyin. Nvidia ilə Windows və ya Linux-da, AWQ və ya EXL2 modellərini yükləyin, bu, iyirmi-otuz faiz daha sürətli inferensiya üçün Nvidia Tensor Cores-dən istifadə edir. Bəs bunu iflas etmədən necə yerləşdirmək olar?

5:11 Yerli aparatı bir ev idman zalı ilə kommersiya idman zalı kimi düşünün. Evdə squat rəfi olması, hər gün işə getmək üçün sıfır səfər, sıfır abunə haqqı və tam məxfilik ilə məşq etdiyiniz deməkdir. sıfır abunə haqqı və tam məxfilik. Yerli maşınınız gündəlik kodlaşdırmağınızın səksən faizini, vahid testini və şəxsi sənəd emalını token başına sıfır dollara həyata keçirir. Və beş yüz funt ağırlıq qaldırmağa ehtiyacınız olduqda — əlli fayl üzrə nəhəng bir repo-geniş arxitektur refaktor kimi — kommersiya idman zalına gedirsiniz: Claude 3.5 Sonnet və ya OpenAI o3 üçün bulud API-yə on beş dəqiqə və ya OpenAI o3 üçün on beş dəqiqə ödəyin

5:38 və davam edin. Budur hesab: istifadə edilmiş 3090 ilə Səviyyə 2 qurğusu hamısı daxil olmaqla on altı yüz dollara başa gəlir. Əgər API tokenlərinə ayda əlli-yüz dollar xərcləyirsinizsə, bu, on səkkiz ayda özünü ödəyir, eyni zamanda mülkiyyət kod bazanızı üçüncü tərəf serverlərindən uzaq tutur. üçüncü tərəf serverlərindən uzaq tutur. Bugünkü sahə testinin hökmü: SHIP IT. VRAM və yaddaş bant genişliyi hər dəfə saat sürətlərini üstələyir. Süni intellekt üçün beş giqahers CPU-lar almağı dayandırın və istifadə edilmiş 3090 tapın.

6:04 Şərhlərdə lokal modellər üçün hansı aparat qurğunu işlətdiyinizi mənə deyin. Və əgər bu təhlili oxumaq istəyirsinizsə, aşağıdakı linkdə daily diff dot dev saytından bülleteni əldə edin. dot dev, link aşağıdadır. Və bu, bu gün üçün fərqdir. Mən Axrisi-dən Nikoyam. Məsuliyyətlə birləşdirin.

Mənbələr

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Əlaqəli videolar