# Кіраўніцтва па лакальным апаратным забеспячэнні AI (2026)

Published: 2026-09-14

Пры стварэнні машыны для лакальных агентаў AI і LLM з адкрытым кодам распрацоўшчыкі робяць памылку, купляючы характарыстыкі гульнявога ПК: працэсары 5,8 ГГц, карыстальніцкія контуры вадкаснага астуджэння і хуткія гульнявыя графічныя працэсары толькі з 8 ГБ відэапамяці. Але аўтарагрэсіўная генерацыя токенаў абмежавана прапускной здольнасцю памяці, а не вылічальнай магутнасцю: каб вывесці адзін токен, кожная вага ў мадэлі павінна перадавацца па шыне памяці. Калі вашы вагі або кантэкст кэша KV перавышаюць фізічную відэапамяць, асяроддзе выканання перадае слаі ў сістэмную памяць DDR5 праз PCIe, і вы сутыкнецеся з 20-кратным падзеннем прапускной здольнасці памяці: хуткасць зніжаецца з 40 токенаў у секунду да 1,5. У гэтым палявым выпрабаванні Ніка разбірае механіку апаратнага забеспячэння, правілы памераў мадэляў 4-бітнай квантавання, тры рэальныя бюджэтныя ўзроўні ад 1200 да 5000 долараў, чаму выкарыстаная RTX 3090 24 ГБ з'яўляецца лепшай здзелкай па відэапамяці на долар у вылічальнай тэхніцы, пастку Raspberry Pi edge і стратэгію «хатняй трэнажорнай залы» для лакальнага параўнання з воблачным высновай. Вердыкт: SHIP IT.

Canonical: https://thedailydiff.dev/be/video/2026-09-14-local-ai-hardware/

## Што ахоплівае гэта відэа

- 20-кратнае падзенне прапускной здольнасці памяці: 936 ГБ/с GDDR6X супраць 50 ГБ/с DDR5 і 31,5 ГБ/с PCIe
- Памер мадэлі пры 4-бітным квантаванні: 8B (5 ГБ), 14B (10 ГБ), 32B (20 ГБ), 70B (40 ГБ)
- Узровень 1 (1200–1500 долараў): RTX 4060 Ti 16 ГБ (ніколі не 8 ГБ) або Mac Mini 16 ГБ
- Узровень 2 (1500–2000 долараў): Выкарыстаная RTX 3090 24 ГБ (аптымальны варыянт) або Mac Mini M4 Pro 64 ГБ
- Узровень 3 (3500+ долараў): RTX 4090 24 ГБ / дзве 3090 або Mac Studio Ultra

## Перакладзеная стэнаграма

Перакладзена з арыгінальнай англійскай агучкі. Даступнае аўдыя і субтытры кантралююцца YouTube.

0:00 Калі вы плануеце стварыць ПК для запуску лакальных агентаў AI, спыніце збіраць гульнявы ​​кампутар. Вам не патрэбны Core i9 з частатой пяць цэлых восем дзясятых гігагерца, контур вадкаснага астуджэння, або васьмігігабайтавая відэакарта, пакрытая RGB. У лакальным выснове AI гульнявыя характарыстыкі практычна бескарысныя. Адзіны паказчык, які вызначае, ці працуе ваш агент, ці паўзе, гэта ёмістасць відэапамяці і прапускная здольнасць шыны памяці. Правілы апаратнага тэсту: забудзьцеся пра тактавыя частоты працэсара і бенчмаркі растрызацыі.

0:24 Нам важныя тры лічбы: шырыня шыны памяці, прапускная здольнасць у гігабайтах у секунду і чысты запас відэапамяці для перапаўнення кэша KV. У гэтым палявым выпрабаванні я разбяру дваццацікратнае падзенне прапускной здольнасці памяці, намалюю правілы памераў мадэляў, пратэстую тры рэальныя ўзроўні ад тысячы двухсот долараў да пяці тысяч і растлумачу, чаму патрыманая 3090 па-ранейшаму з'яўляецца найвялікшым чыт-кодам у вылічальнай тэхніцы. Гэта The Daily Diff, палявы тэст. Каб зразумець, чаму гульнявыя камп'ютары церпяць няўдачу, паглядзіце, як насамрэч адбываецца генерацыя токенаў. У гульнях ваш працэсар падае выклікі адмалёўкі, а ваш графічны працэсар візуалізуе кадры.

0:54 Але аўтарагрэсіўнае дэкадаванне LLM амаль цалкам абмежавана прапускной здольнасцю памяці. Каб згенераваць адзін токен, графічны працэсар павінен перадаць кожны параметр вагі мадэлі з памяці праз свае вылічальныя ядры. Калі ваша мадэль складае дзесяць гігабайт, вытворчасць аднаго токена азначае чытанне дзесяці гігабайт дадзеных. На Nvidia RTX 3090 з 384-бітнай шынай памяці, вы атрымліваеце 936 гігабайт у секунду прапускной здольнасці GDDR6X, выпрацоўваючы восемдзесят токенаў у секунду. Але паглядзіце, што адбываецца ў той момант, калі ваша мадэль перавышае фізічную відэапамяць.

1:22 Калі відэапамяць запаўняецца, асяроддзі выканання перадаюць астатнія слаі праз шыну PCIe у сістэмную памяць DDR5. Ядры вашага графічнага працэсара чакаюць тысячу гігабайт у секунду. Замест гэтага двухканальная DDR5 падае ім пяцьдзесят, а PCIe 4 захлынаецца на трыццаці адным. Гэта дваццацікратны калапс прапускной здольнасці. Канвеер генерацыі токенаў імгненна застойваецца ў чаканні шыны, і хуткасць падае з сорак токенаў у секунду да паўтара. Вы ператварылі ўстаноўку за дзве тысячы долараў у абагравальнік.

1:47 І становіцца горш падчас шматэтапных запускаў агентаў, таму што вагі — гэта толькі палова бітвы. Кожны запыт, выклік інструмента і фрагмент файла захоўваюцца ў кэшы Key-Value. Акно кантэксту ў трыццаць два K можа спажываць ад чатырох да васьмі гігабайт відэапамяці ў дадатак да вагі. Калі ваша карта мае толькі шаснаццаць гігабайт, ваш агент зацыкліваецца двойчы, дасягае кантэкстнай сцяны і альбо вылятае з памылкай недахопу памяці, альбо перапаўняе у DDR5. Вось чыт-ліст памераў 4-бітнай мадэлі. Мадэль з сям'ю ці васьмю мільярдамі параметраў, такая як Llama 3.1 або DeepSeek Distill,

2:16 займае каля пяці гігабайт. Мадэль з чатырнаццаццю мільярдамі займае дзесяць гігабайт. Мадэль з трыццаццю двума мільярдамі, аптымальны ўзровень інтэлекту для агентаў кадавання, патрабуе дваццаці гігабайт. І мадэль-піянер з сям'юдзесяццю мільярдамі патрабуе сорак гігабайт, перш чым вы нават выдзеліце кантэкст. Што прыводзіць нас да фактычных апаратных зборак. Узровень 1 - гэта пачатковая ўстаноўка, ад тысячы двухсот да тысячы пяцісот долараў. На ПК ваш асноўны кампанент - RTX 4060 Ti 16-гігабайтная.

2:39 Крытычнае папярэджанне: ніколі не купляйце васьмігігабайтную версію, каб зэканоміць семдзесят долараў. Восем гігабайт відэапамяці ў 2026 годзе - гэта неадкладны смяротны прысуд з-за недахопу памяці для любога рэальнага працоўнага працэсу агента. Спалучайце яе з шасці'ядравым Ryzen 5, шасцідзесяці чатырма гігабайтамі DDR5, і двухтэрабайтным NVMe-назапашвальнікам. У свеце Apple эквівалентам з'яўляецца Mac Mini або MacBook Pro з шаснаццаццю гігабайтамі адзінай памяці.

3:02 Вы ўбачыце сорак-пяцьдзесят токенаў у секунду на васьмімільярдных мадэлях. Узровень 2 - гэта аптымальны варыянт для прасунутых карыстальнікаў: зборка спецыяльна для запуску трыццацідвухмільярдных мадэляў, такіх як Qwen 2.5 32B. Шлях A - гэта новая RTX 4070 Ti Super з шаснаццаццю гігабайтамі за восемсот долараў. Але шлях B - гэта мая моцная рэкамендацыя: купіце патрыманую Nvidia RTX 3090 дваццацічатырохгігабайтную. Вы можаце знайсці чыстыя 3090 на eBay за шэсцьсот пяцьдзясят да сямісот пяцідзесяці долараў. Гэта дае вам дваццаць чатыры гігабайты відэапамяці на масіўнай 384-бітнай шыне, якая перадае

3:33 936 гігабайт у секунду. У пераліку на долар гэта лепшая здзелка па відэапамяці ў вылічальнай тэхніцы. На macOS аналагам Узроўню 2 з'яўляецца Mac Mini M4 Pro з шасцідзесяццю чатырма гігабайтамі адзінай памяці. Ён вырабляе ад адзінаццаці да дванаццаці токенаў у секунду на трыццацідвухмільярднай мадэлі: павольней, чым Nvidia, але абсалютна бясшумны пры трыццаці ватах з месцам для гіганцкага акна кантэксту. Узровень 3 - гэта энтузіястычны ўзровень для рояў з многіх агентаў. На ПК гэта азначае RTX 4090 з дваццаццю чатырма гігабайтамі,

3:57 Ryzen 9 і сто дваццаць восем гігабайт аператыўнай памяці, або дзве RTX 3090, якія забяспечваюць сорак восем гігабайт агульнай відэапамяці. У лінейцы Apple гэта Mac Studio Ultra з дзевяноста шасцю да ста дваццаці васьмі гігабайтамі адзінай памяці. Суперсіла - гэта рэзідэнтнасць памяці: вы можаце трымаць мадэль эмбэдынгаў, хуткі маршрутызатар і 32-мільярдную мадэль кадавання загружанымі адначасова з нулявой затрымкай абмену. Зараз пра сумленную няўдачу нашага палявога выпрабавання: пастку краёвых вылічэнняў.

4:24 Кожны тыдзень у сацыяльных сетках з'яўляецца паведамленне аб тым, што вы можаце запускаць аўтаномных агентаў кадавання на васьмідзесяцідоларавым Raspberry Pi 5. Я гэта праверыў. Запуск малюсенькай мадэлі з паўтара мільярдамі параметраў дае вам ледзь тры токены ў секунду, у той час як плата задыхаецца пры васьмідзесяці пяці градусах Цэльсія. Гэта прыемная цацка на выхадныя, але як штодзённы інструмент распрацоўкі, гэта чыстае катаванне. Для праграмнага забеспячэння выкарыстоўвайце Ollama, калі вам патрэбен чысты дэман каманднага радка, які падключаецца

4:47 непасрэдна да Cursor, Cline або VS Code. Калі вы хочаце графічную пляцоўку з загрузкай мадэляў і паўзункамі слаёў графічнага працэсара, выкарыстоўвайце LM Studio. І супастаўце свой фармат з вашым крэмніем. На Apple Silicon заўсёды загружайце мадэлі GGUF, аптымізаваныя для Metal. На Windows або Linux з Nvidia загружайце мадэлі AWQ або EXL2, якія выкарыстоўваюць ядра Tensor ад Nvidia для на дваццаць-трыццаць працэнтаў хутчэйшага высновы. Дык як жа разгарнуць гэта, не збанкрутаваўшы?

5:11 Думайце пра лакальнае абсталяванне як пра хатні трэнажорную залу ў параўнанні з камерцыйнай трэнажорнай залай. Наяўнасць стойкі для прысяданняў дома азначае, што вы трэніруецеся кожны дзень без паездак, без абаненцкай платы і з поўнай прыватнасцю. Ваша лакальная машына апрацоўвае восемдзесят працэнтаў вашага штодзённага кадавання, блочнага тэставання і апрацоўкі прыватных дакументаў за нуль долараў за токен. А калі вам трэба падняць пяцьсот фунтаў — напрыклад, маштабную рэструктурызацыю архітэктуры рэпазітарыя па пяцідзесяці файлах — вы наведваеце камерцыйную трэнажорную залу: плаціце воблачнаму API за Claude 3.5 Sonnet або OpenAI o3 на пятнаццаць хвілін

5:38 і рухаецеся далей. Вось рахунак: зборка Узроўню 2 з патрыманай 3090 каштуе тысячу шэсцьсот долараў цалкам. Калі вы траціце ад пяцідзесяці да ста долараў у месяц на токены API, яна акупляецца за васемнаццаць месяцаў, захоўваючы ваш уласны код па-за серверамі трэціх бакоў. Сённяшні вердыкт палявога выпрабавання: SHIP IT. Відэапамяць і прапускная здольнасць памяці заўсёды перамагаюць тактавыя частоты. Спыніце купляць пяцігігагерцавыя працэсары для AI і знайдзіце патрыманую 3090.

6:04 Раскажыце мне, якую апаратную зборку вы выкарыстоўваеце для лакальных мадэляў у каментарах. І калі вы аддаеце перавагу прачытаць гэты разбор, падпішыцеся на рассылку на daily diff dot dev, спасылка ніжэй. І гэта ўсё на сёння. Я Ніка з Axrisi. Аб'ядноўвайце адказна.

## Крыніцы

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
