# Руководство по локальному аппаратному обеспечению ИИ (2026)

Published: 2026-09-14

При создании машины для локальных агентов ИИ и LLM с открытым весом разработчики совершают ошибку, покупая игровые ПК: процессоры с частотой 5,8 ГГц, пользовательские системы жидкостного охлаждения и быстрые игровые графические процессоры всего с 8 ГБ видеопамяти. Но авторегрессивная генерация токенов ограничена пропускной способностью памяти, а не вычислительной мощностью: чтобы выдать один токен, каждый вес в модели должен передаваться через шину памяти. Когда ваши веса или контекст кэша KV превышают физическую видеопамять, среда выполнения переносит слои в системную память DDR5 через PCIe, и вы сталкиваетесь с 20-кратным падением пропускной способности памяти: скорость падает с 40 токенов в секунду до 1,5. В этом полевом испытании Нико анализирует механику аппаратного обеспечения, правила определения размера модели 4-битной квантизации, три реальных бюджетных уровня от 1200 до 5000 долларов, почему подержанная RTX 3090 24 ГБ является лучшим соотношением видеопамяти к доллару в вычислениях, ловушку периферийных устройств Raspberry Pi и стратегию домашнего спортзала для локального и облачного вывода. Вердикт: SHIP IT.

Canonical: https://thedailydiff.dev/ru/video/2026-09-14-local-ai-hardware/

## Что освещается в этом видео

- 20-кратное падение пропускной способности памяти: 936 ГБ/с GDDR6X против 50 ГБ/с DDR5 и 31,5 ГБ/с PCIe
- Размер модели при 4-битах: 8B (5 ГБ), 14B (10 ГБ), 32B (20 ГБ), 70B (40 ГБ)
- Уровень 1 (1200–1500 долларов): RTX 4060 Ti 16 ГБ (никогда не 8 ГБ) или Mac Mini 16 ГБ
- Уровень 2 (1500–2000 долларов): Идеальный вариант — подержанная RTX 3090 24 ГБ или Mac Mini M4 Pro 64 ГБ
- Уровень 3 (3500+ долларов): RTX 4090 24 ГБ / две 3090 или Mac Studio Ultra

## Переведенная стенограмма

Переведено с оригинального английского повествования. Доступные аудио и субтитры контролируются YouTube.

0:00 Если вы планируете собрать ПК для запуска локальных агентов ИИ, перестаньте собирать игровой компьютер. Вам не нужен Core i9 с тактовой частотой 5,8 гигагерц, система жидкостного охлаждения, или восьмигигабайтная видеокарта с RGB-подсветкой. В локальном выводе ИИ игровые характеристики практически бесполезны. Единственный показатель, определяющий, работает ли ваш агент или еле ползает, — это объем видеопамяти и пропускная способность шины памяти. Правила аппаратного теста: забудьте о тактовых частотах процессора и бенчмарках растеризации.

0:24 Нам важны три числа: ширина шины памяти, пропускная способность в гигабайтах в секунду и запас видеопамяти для разрастания кэша KV. В этом полевом испытании я разберу 20-кратное падение пропускной способности памяти, намечу правила определения размера модели, протестирую три реальных уровня бюджета от двенадцатисот до пяти тысяч долларов и объясню, почему подержанная 3090 по-прежнему является величайшим чит-кодом в вычислениях. Это The Daily Diff, полевое испытание. Чтобы понять, почему игровые компьютеры не справляются, посмотрите, как на самом деле происходит генерация токенов. В играх ваш процессор подает команды отрисовки, а графический процессор рендерит кадры.

0:54 Но авторегрессивное декодирование LLM почти полностью ограничено пропускной способностью памяти. Для генерации одного токена графический процессор должен передать каждый весовой параметр модели из памяти через свои вычислительные ядра. Если ваша модель составляет десять гигабайт, производство одного токена означает чтение десяти гигабайт данных. На Nvidia RTX 3090 с 384-битной шиной памяти, вы получаете 936 гигабайт в секунду пропускной способности GDDR6X, производя восемьдесят токенов в секунду. Но посмотрите, что происходит, как только ваша модель превышает физический объем видеопамяти.

1:22 Когда видеопамять заполняется, среды выполнения перегружают оставшиеся слои через шину PCIe в системную память DDR5. Ваши ядра графического процессора ожидают тысячу гигабайт в секунду. Вместо этого двухканальная DDR5 подает им пятьдесят, а PCIe 4 задыхается на тридцати одном. Это 20-кратный коллапс пропускной способности. Конвейер генерации токенов мгновенно останавливается в ожидании шины, и скорость падает с сорока токенов в секунду до полутора. Вы превратили двухтысячедолларовую установку в обогреватель.

1:47 И становится хуже во время многократных запусков агентов, потому что веса — это только половина дела. Каждый запрос, вызов инструмента и фрагмент файла сохраняются в кэше Key-Value. Окно контекста в 32K может потреблять от четырех до восьми гигабайт видеопамяти в дополнение к весам. Если у вашей карты всего шестнадцать гигабайт, ваш агент зацикливается дважды, достигает контекстного предела и либо вылетает с ошибкой нехватки памяти, либо переходит в DDR5. Вот шпаргалка по размерам 4-битных моделей. Модель с семью или восьми миллиардами параметров, такая как Llama 3.1 или DeepSeek Distill,

2:16 занимает около пяти гигабайт. Модель с четырнадцатью миллиардами параметров занимает десять гигабайт. Модель с тридцатью двумя миллиардами параметров, оптимальный вариант для агентов кодирования, требует двадцать гигабайт. И пограничная модель с семьюдесятью миллиардами параметров требует сорок гигабайт, прежде чем вы даже выделите контекст. Что подводит нас к реальным аппаратным сборкам. Уровень 1 — это стартовая установка, от двенадцатисот до полутора тысяч долларов. На ПК вашей основой является RTX 4060 Ti 16-гигабайтная.

2:39 Важное предупреждение: никогда не покупайте восьмигигабайтную версию, чтобы сэкономить семьдесят долларов. Восемь гигабайт видеопамяти в 2026 году — это немедленный смертный приговор из-за нехватки памяти в любом реальном рабочем процессе агента. Соедините ее с шестиядерным Ryzen 5, шестьюдесятью четырьмя гигабайтами DDR5, и двухтерабайтным NVMe-накопителем. В мире Apple эквивалентом является Mac Mini или MacBook Pro с шестнадцатью гигабайтами объединенной памяти.

3:02 Вы увидите от сорока до пятидесяти токенов в секунду на восьмимиллиардных моделях. Уровень 2 — идеальный вариант для опытных пользователей: сборка специально для запуска моделей с тридцатью двумя миллиардами параметров, таких как Qwen 2.5 32B. Путь А — это новая RTX 4070 Ti Super с шестнадцатью гигабайтами за восемьсот долларов. Но Путь Б — моя настоятельная рекомендация: купите подержанную Nvidia RTX 3090 двадцать четыре гигабайта. Чистые 3090 можно найти на eBay за шестьсот пятьдесят до семисот пятидесяти долларов. Это дает вам двадцать четыре гигабайта видеопамяти на массивной 384-битной шине, передающей

3:33 936 гигабайт в секунду. Доллар за доллар, это лучшее предложение по видеопамяти в вычислениях. В macOS аналогом Уровня 2 является Mac Mini M4 Pro с шестьюдесятью четырьмя гигабайтами объединенной памяти. Он выдает от одиннадцати до двенадцати токенов в секунду на модели с тридцатью двумя миллиардами параметров: медленнее, чем Nvidia, но абсолютно бесшумно при тридцати ваттах с местом для гигантского контекстного окна. Уровень 3 — это категория для энтузиастов многоагентных роев. На ПК это означает RTX 4090 с двадцатью четырьмя гигабайтами,

3:57 Ryzen 9 и сто двадцать восемь гигабайт оперативной памяти, или две RTX 3090, обеспечивающие сорок восемь гигабайт общей видеопамяти. В линейке Apple это Mac Studio Ultra с девяносто шестью до ста двадцати восьми гигабайт объединенной памяти. Суперсила — это постоянство памяти: вы можете одновременно загружать модель встраивания, быстрый маршрутизатор и 32-миллиардную модель кодирования без задержки подкачки. Теперь о честной неудаче нашего полевого испытания: ловушка периферийных вычислений.

4:24 Каждую неделю в социальных сетях появляется сообщение о том, что вы можете запускать автономных агентов кодирования на восьмидесятидолларовом Raspberry Pi 5. Я протестировал это. Запуск крошечной модели с полутора миллиардами параметров дает едва три токена в секунду, при этом плата дросселируется при восьмидесяти пяти градусах Цельсия. Это классная игрушка на выходные, но в качестве ежедневного драйвера разработки, это чистое наказание. Для программного обеспечения используйте Ollama, если вам нужен чистый демон командной строки, который подключается

4:47 напрямую к Cursor, Cline или VS Code. Если вы хотите графическую среду с загрузкой моделей и ползунками слоев GPU, используйте LM Studio. И согласуйте формат с вашим кремнием. На Apple Silicon всегда загружайте модели GGUF, оптимизированные для Metal. На Windows или Linux с Nvidia загружайте модели AWQ или EXL2, которые используют тензорные ядра Nvidia для ускорения вывода на двадцать-тридцать процентов. Итак, как это развернуть, не разорившись?

5:11 Думайте о локальном оборудовании как о домашнем спортзале против коммерческого спортзала. Наличие стойки для приседаний дома означает, что вы тренируетесь каждый день без поездок, без абонентской платы и в полной конфиденциальности. Ваша локальная машина обрабатывает восемьдесят процентов вашего ежедневного кодирования, модульного тестирования и обработки частных документов за ноль долларов за токен. А когда вам нужно поднять пятьсот фунтов — например, масштабный рефакторинг архитектуры всего репозитория в пятидесяти файлах — вы посещаете коммерческий спортзал: платите облачному API за Claude 3.5 Sonnet или OpenAI o3 на пятнадцать минут

5:38 и продолжаете работу. Вот счет: сборка Уровня 2 с подержанной 3090 стоит тысячу шестьсот долларов в общем. Если вы тратите от пятидесяти до ста долларов в месяц на токены API, она окупается за восемнадцать месяцев, сохраняя вашу проприетарную кодовую базу от сторонних серверов. Вердикт сегодняшнего полевого испытания: SHIP IT. Видеопамять и пропускная способность памяти всегда превосходят тактовые частоты. Перестаньте покупать пятигигагерцовые процессоры для ИИ и найдите подержанную 3090.

6:04 Расскажите мне, какое аппаратное обеспечение вы используете для локальных моделей в комментариях. А если вы предпочитаете прочитать этот обзор, подпишитесь на рассылку на the daily diff dot dev, ссылка ниже. И это все на сегодня. Я Нико из Axrisi. Сливайте ответственно.

## Источники

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
