# Локалниот хардверски водич за вештачка интелигенција (2026)

Published: 2026-09-14

Кога градат машина за локални AI агенти и LLM со отворена тежина, програмерите прават грешка со купување спецификации за гејмерски компјутери: 5,8 GHz процесори, прилагодени системи за течно ладење и брзи гејмерски графички картички со само 8GB VRAM. Но, авторегресивното генерирање токени е ограничено од пропусниот опсег на меморијата, а не од пресметковната моќ: за да се емитува еден токен, секоја тежина во моделот мора да се пренесе преку мемориската магистрала. Кога вашите тежини или контекстот на KV кешот го надминуваат физичкиот VRAM, времето на извршување ги префрла слоевите на системскиот DDR5 преку PCIe, и ќе наидете на 20x намалување на пропусниот опсег на меморијата: брзината паѓа од 40 токени во секунда на 1,5. Во овој теренски тест, Нико ги објаснува хардверските механизми, правилата за димензионирање на моделите со 4-битна квантизација, три реални буџетски нивоа од 1.200 до 5.000 долари, зошто користена RTX 3090 24GB е најдобрата зделка за VRAM по долар во компјутерите, стапицата со Raspberry Pi на работ и стратегијата за домашна теретана за локално наспроти облачно заклучување. Пресуда: SHIP IT.

Canonical: https://thedailydiff.dev/mk/video/2026-09-14-local-ai-hardware/

## Што покрива ова видео

- 20x намалување на пропусниот опсег на меморијата: 936 GB/s GDDR6X наспроти 50 GB/s DDR5 и 31,5 GB/s PCIe
- Големина на моделот @ 4-бит: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Ниво 1 (1.200 – 1.500 $): RTX 4060 Ti 16GB (никогаш 8GB) или Mac Mini 16GB
- Ниво 2 (1.500 – 2.000 $): Користена RTX 3090 24GB идеална понуда или Mac Mini M4 Pro 64GB
- Ниво 3 (3.500$+): RTX 4090 24GB / двојни 3090s или Mac Studio Ultra

## Преведен транскрипт

Преведено од оригиналната англиска нарација. Достапното аудио и наслови се контролирани од YouTube.

0:00 Ако планирате да изградите компјутер за да извршувате локални AI агенти, престанете да градите гејмерска машина. Не ви треба петточка-осум гигахерцен Core i9, систем за течно ладење, или осумгигабајтна графичка картичка прекриена со RGB. Во локалното AI заклучување, гејмерските спецификации се практично бескорисни. Единствената метрика која одредува дали вашиот агент работи или лази е капацитетот на VRAM и пропусниот опсег на мемориската магистрала. Правила на хардверскиот тест: заборавете на часовниците на процесорот и бенчмарците за растеризација.

0:24 Се грижиме за три броја: ширина на мемориската магистрала, пропусен опсег во гигабајти по секунда и суров VRAM простор за KV кеш натрупување. Во овој теренски тест, ќе го разложам дваесет-пати намалувањето на пропусниот опсег на меморијата, ќе ги мапирам правилата за димензионирање на моделот, ќе бенчмаркирам три реални нивоа од илјада и двесте долари до пет илјади, и ќе објаснам зошто користена 3090 сè уште е најголемиот компјутерски хак. Ова е The Daily Diff, теренски тест. За да разберете зошто гејмерските машини пропаѓаат, погледнете како всушност се извршува генерирањето токени. Во игрите, вашиот процесор ги испраќа повиците за цртање, а вашата графичка картичка ги рендерира рамките.

0:54 Но, авторегресивното декодирање на LLM е речиси чисто ограничено од пропусниот опсег на меморијата. За да генерира еден токен, графичката картичка мора да го пренесе секој параметар на тежина на моделот од меморијата низ неговите процесорски јадра. Ако вашиот модел е десет гигабајти, произведувањето на еден токен значи читање десет гигабајти податоци. На Nvidia RTX 3090 со 384-битна мемориска магистрала, добивате 936 гигабајти во секунда GDDR6X пропусен опсег, произведувајќи осумдесет токени во секунда. Но, гледајте што се случува во моментот кога вашиот модел ќе го надмине физичкиот VRAM.

1:22 Кога VRAM се полни, времето на извршување ги префрла преостанатите слоеви преку PCIe магистралата на системска DDR5 меморија. Вашите графички јадра очекуваат илјада гигабајти во секунда. Наместо тоа, двоканалниот DDR5 им доставува педесет, а PCIe 4 се гуши на триесет и еден. Тоа е дваесетпати намалување на пропусниот опсег. Процесот на генерирање токени веднаш застанува чекајќи на магистралата, и брзината паѓа од четириесет токени во секунда на еден и пол. Ја претворивте машината од две илјади долари во греалка.

1:47 И станува полошо за време на повеќекратни извршувања на агенти, бидејќи тежините се само половина од битката. Секое барање, повик на алатка и дел од датотека се складира во кешот Key-Value. Контекстуален прозорец од триесет и две илјади може да потроши четири до осум гигабајти VRAM покрај тежините. Ако вашата картичка има само шеснаесет гигабајти, вашиот агент се повторува двапати, ја удира контекстуалната граница, и или паѓа со грешка за недостаток на меморија или се префрла во DDR5. Еве го листот за големина на 4-битни модели. Модел со седум или осум милијарди параметри како Llama 3.1 или DeepSeek Distill

2:16 зафаќа околу пет гигабајти. Модел од четиринаесет милијарди зафаќа десет гигабајти. Модел од триесет и две милијарди, идеална интелигенција за кодирачки агенти, бара дваесет гигабајти. И фронтиер модел од седумдесет милијарди бара четириесет гигабајти пред дури да одделите контекст. Што нè доведува до вистинските хардверски склопови. Ниво 1 е почетна конфигурација, илјада двесте до илјада петстотини долари. На компјутер, вашето сидро е RTX 4060 Ti 16-гигабајти.

2:39 Критично предупредување: никогаш не купувајте осумгигабајтна верзија за да заштедите седумдесет долари. Осум гигабајти VRAM во 2026 година е моментална смртна казна поради недостаток на меморија на која било вистинска работна шема на агент. Спарете ја со шест-јадрен Ryzen 5, шеесет и четири гигабајти DDR5, и двотерабајтен NVMe диск. Во светот на Apple, еквивалентот е Mac Mini или MacBook Pro со шеснаесет гигабајти унифицирана меморија.

3:02 Ќе видите четириесет до педесет токени во секунда на осуммилијардни модели. Ниво 2 е идеалната понуда за напредни корисници: изградена специјално за извршување на модели со триесет и две милијарди параметри како Qwen 2.5 32B. Патека А е нова RTX 4070 Ti Super со шеснаесет гигабајти за осумстотини долари. Но, Патека Б е мојата силна препорака: купете користена Nvidia RTX 3090 дваесет и четири гигабајти. Можете да најдете чисти 3090-ки на eBay за шестотини и педесет до седумстотини и педесет долари. Тоа ви дава дваесет и четири гигабајти VRAM на масивна 384-битна магистрала која пропушта

3:33 936 гигабајти во секунда. Долар за долар, тоа е најдобрата VRAM зделка во компјутерството. На macOS, еквивалентот на Ниво 2 е Mac Mini M4 Pro со шеесет и четири гигабајти унифицирана меморија. Произведува единаесет до дванаесет токени во секунда на модел од триесет и две милијарди: побавно од Nvidia, но апсолутно тивко на триесет вати со простор за огромен контекстуален прозорец. Ниво 3 е категорија за ентузијасти за повеќеагентни роеви. На компјутер, тоа значи RTX 4090 со дваесет и четири гигабајти,

3:57 Ryzen 9 и сто дваесет и осум гигабајти RAM меморија, или двојни RTX 3090 кои обезбедуваат четириесет и осум гигабајти вкупен VRAM. Во понудата на Apple, ова е Mac Studio Ultra со деведесет и шест до сто дваесет и осум гигабајти унифицирана меморија. Супермоќта е мемориската резидентност: можете да задржите модел за вградување, брз рутер и 32-милијарден модел за кодирање вчитани истовремено со нулта доцнење при размена. Сега за чесниот неуспех на нашиот теренски тест: стапицата на периферното пресметување.

4:24 Секоја недела социјална објава тврди дека можете да извршувате автономни агенти за кодирање на Raspberry Pi 5 од осумдесет долари. Го тестирав. Извршувањето на мал модел со еден и пол милијарди параметри ви дава едвај три токени во секунда додека плочката се намалува на осумдесет и пет степени Целзиусови. Тоа е убава викенд играчка, но како дневен двигател за развој, тоа е чисто мачење. За софтвер, користете Ollama ако сакате чист демон од командна линија што се поврзува

4:47 директно со Cursor, Cline или VS Code. Ако сакате графичко игралиште со преземања на модели и лизгачи за графички слоеви, користете LM Studio. И усогласете го вашиот формат со вашиот силициум. На Apple Silicon, секогаш преземајте GGUF модели оптимизирани за Metal. На Windows или Linux со Nvidia, преземајте AWQ или EXL2 модели, кои ги користат Nvidia Tensor Cores за дваесет до триесет проценти побрзо заклучување. Како да го имплементирате ова без да банкротирате?

5:11 Размислете за локален хардвер како домашна теретана наспроти комерцијална теретана. Имањето држач за чучњеви дома значи дека тренирате секој ден без патување, без претплати и со целосна приватност. Вашата локална машина обработува осумдесет проценти од вашето дневно кодирање, тестирање на единици и приватна обработка на документи за нула долари по токен. И кога треба да кренете петстотини фунти – како масивна рефактура на архитектурата на целиот репозиториум низ педесет датотеки – ја посетувате комерцијалната теретана: плаќате cloud API за Claude 3.5 Sonnet или OpenAI o3 петнаесет минути

5:38 и продолжувате понатаму. Еве ја сметката: конфигурација од Ниво 2 со користена 3090 чини илјада и шестотини долари вкупно. Ако трошите педесет до сто долари месечно на API токени, таа се исплатува за осумнаесет месеци додека вашиот комерцијален код останува надвор од серверите на трети страни. Пресуда од денешниот теренски тест: SHIP IT. VRAM и пропусниот опсег на меморијата ги надминуваат брзините на процесорот секој пат. Престанете да купувате процесори од пет гигахерци за вештачка интелигенција, и пронајдете користена 3090.

6:04 Кажете ми каква хардверска конфигурација користите за локални модели во коментарите. И ако повеќе сакате да го прочитате овој преглед, претплатете се на билтенот на the daily diff dot dev, линк подолу. И тоа е разликата за денес. Јас сум Нико од Axrisi. Спојувајте одговорно.

## Извори

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
