+− THE DAILY DIFFdev & AI news
SHIP IT

Локальний посібник з апаратного забезпечення ШІ (2026)

При створенні машини для локальних агентів ШІ та LLM з відкритою вагою розробники роблять помилку, купуючи специфікації ігрового ПК: процесори 5,8 ГГц, спеціальні рідинні системи охолодження та швидкі ігрові графічні процесори лише з 8 ГБ VRAM.

При створенні машини для локальних агентів ШІ та LLM з відкритою вагою розробники роблять помилку, купуючи специфікації ігрового ПК: процесори 5,8 ГГц, спеціальні рідинні системи охолодження та швидкі ігрові графічні процесори лише з 8 ГБ VRAM. Але авторегресивна генерація токенів обмежена пропускною здатністю пам'яті, а не обчислювальною потужністю: для випромінювання одного токена кожна вага моделі повинна передаватися через шину пам'яті. Коли ваші ваги або контекст кешу KV перевищують фізичну VRAM, середовище виконання переносить шари в системну DDR5 через PCIe, і ви стикаєтесь з 20-кратним "обривом" пропускної здатності пам'яті: швидкість падає з 40 токенів на секунду до 1,5. У цьому польовому випробуванні Ніко розбирає механіку апаратного забезпечення, правила масштабування моделі 4-бітної квантизації, три реальні бюджетні рівні від 1200 до 5000 доларів, чому використана RTX 3090 24 ГБ є найкращою пропозицією VRAM за долар в обчислювальній техніці, пастку Raspberry Pi та стратегію домашнього спортзалу для локального та хмарного висновку. Вердикт: SHIP IT.

Читати письмову версію (англійською) ↗

Що охоплює це відео

  • 20-кратний обрив пропускної здатності пам'яті: 936 ГБ/с GDDR6X проти 50 ГБ/с DDR5 і 31,5 ГБ/с PCIe
  • Масштабування моделі @ 4-біт: 8B (5 ГБ), 14B (10 ГБ), 32B (20 ГБ), 70B (40 ГБ)
  • Рівень 1 (1200–1500 доларів): RTX 4060 Ti 16 ГБ (ніколи не 8 ГБ) або Mac Mini 16 ГБ
  • Рівень 2 (1500–2000 доларів): Використана RTX 3090 24 ГБ — ідеальний варіант або Mac Mini M4 Pro 64 ГБ
  • Рівень 3 (3500+ доларів): RTX 4090 24 ГБ / подвійні 3090 або Mac Studio Ultra

Перекладена стенограма

Перекладено з оригінальної англійської розповіді. Доступне аудіо та субтитри контролюються YouTube.

0:00 Якщо ви плануєте зібрати ПК для запуску локальних агентів ШІ, перестаньте будувати ігрову установку. Вам не потрібен Core i9 на 5,8 ГГц, система рідинного охолодження, або восьмигігабайтна відеокарта, покрита RGB-підсвічуванням. У локальному виведенні ШІ ігрові специфікації практично марні. Єдина метрика, яка визначає, чи працює ваш агент, чи повзе, це обсяг VRAM та пропускна здатність шини пам'яті. Правила апаратного тесту: забудьте про тактові частоти процесора та бенчмарки растеризації.

0:24 Нам важливі три числа: ширина шини пам'яті, пропускна здатність у гігабайтах за секунду та запас VRAM для роздування кешу KV. У цьому польовому випробуванні я розберу 20-кратний обрив пропускної здатності пам'яті, нанесу на карту правила масштабування моделі, оціню три реальні рівні від тисячі двохсот до п'яти тисяч доларів і поясню, чому використана 3090 все ще є найбільшим чіт-кодом в обчислювальній техніці. Це The Daily Diff, польове випробування. Щоб зрозуміти, чому ігрові установки зазнають невдачі, подивіться, як насправді виконується генерація токенів. В іграх ваш процесор подає виклики на малювання, а ваш графічний процесор рендерить кадри.

0:54 Але авторегресивне декодування LLM майже повністю обмежене пропускною здатністю пам'яті. Щоб згенерувати один токен, графічний процесор повинен передати кожен ваговий параметр моделі з пам'яті через свої обчислювальні ядра. Якщо ваша модель десять гігабайт, створення одного токена означає читання десяти гігабайт даних. На Nvidia RTX 3090 з 384-бітною шиною пам'яті, ви отримуєте 936 гігабайт на секунду пропускної здатності GDDR6X, створюючи вісімдесят токенів на секунду. Але подивіться, що відбувається тієї миті, коли ваша модель перевищує фізичну VRAM.

1:22 Коли VRAM заповнюється, середовища виконання перевантажують залишки шарів через шину PCIe до системної пам'яті DDR5. Ваші ядра GPU очікують тисячу гігабайт на секунду. Натомість, двоканальна DDR5 подає їм п'ятдесят, а PCIe 4 задихається на тридцяти одному. Це двадцятикратний обвал пропускної здатності. Конвеєр генерації токенів миттєво зупиняється, чекаючи на шині, і швидкість падає з сорока токенів на секунду до півтора. Ви перетворили установку за дві тисячі доларів на обігрівач.

1:47 І стає гірше під час багатоетапних запусків агента, тому що ваги — це лише половина битви. Кожен запит, виклик інструменту та фрагмент файлу зберігаються в кеші "Ключ-Значення" (Key-Value) . Вікно контексту в тридцять два тисячі може використовувати від чотирьох до восьми гігабайт VRAM на додаток до ваг. Якщо ваша карта має лише шістнадцять гігабайт, ваш агент робить два цикли, досягає стіни контексту і або аварійно завершує роботу з помилкою "недостатньо пам'яті", або переливається в DDR5. Ось шпаргалка з 4-бітного розміру. Модель з сімома або вісьмома мільярдами параметрів, як Llama 3.1 або DeepSeek Distill,

2:16 займає близько п'яти гігабайт. Модель з чотирнадцятьма мільярдами займає десять гігабайт. Модель з тридцятьма двома мільярдами, ідеальний варіант для кодуючих агентів, вимагає двадцяти гігабайт. А передова модель з сімдесятьма мільярдами вимагає сорок гігабайт, перш ніж ви навіть виділите контекст. Що підводить нас до фактичних збірок апаратного забезпечення. Рівень 1 – це стартова установка, від дванадцятисот до п'ятнадцятисот доларів. На ПК ваш основний компонент – це RTX 4060 Ti 16-гігабайтовий.

2:39 Критичне попередження: ніколи не купуйте восьмигігабайтну версію, щоб заощадити сімдесят доларів. Вісім гігабайт VRAM у 2026 році – це негайний смертельний вирок через нестачу пам'яті для будь-якого реального робочого процесу агента. Поєднайте його з шестиядерним Ryzen 5, шістдесятьма чотирма гігабайтами DDR5, і двотерабайтним NVMe-накопичувачем. У світі Apple еквівалентом є Mac Mini або MacBook Pro з шістнадцятьма гігабайтами об'єднаної пам'яті.

3:02 Ви побачите від сорока до п'ятдесяти токенів на секунду на моделях з восьми мільярдів. Рівень 2 – це ідеальний варіант для досвідчених користувачів: створення спеціально для запуску моделей з тридцяти двома мільярдами параметрів, таких як Qwen 2.5 32B. Шлях А – це нова RTX 4070 Ti Super з шістнадцятьма гігабайтами за вісімсот доларів. Але Шлях Б – моя рішуча рекомендація: купіть вживану Nvidia RTX 3090 двадцяти чотирьох гігабайт. Ви можете знайти чисті 3090 на eBay за шістсот п'ятдесят до семисот п'ятдесяти доларів. Це дає вам двадцять чотири гігабайти VRAM на масивній 384-бітній шині, що забезпечує

3:33 936 гігабайт на секунду. По співвідношенню долар/продуктивність, це найкраща пропозиція VRAM в обчислювальній техніці. На macOS аналогом Рівня 2 є Mac Mini M4 Pro з шістдесятьма чотирма гігабайтами об'єднаної пам'яті. Він генерує одинадцять-дванадцять токенів на секунду на 32-мільярдній моделі: повільніше, ніж Nvidia, але абсолютно безшумний при тридцяти ватах з місцем для гігантського вікна контексту. Рівень 3 призначений для ентузіастів, для роїв з кількома агентами. На ПК це означає RTX 4090 з двадцяти чотирма гігабайтами,

3:57 Ryzen 9 та сто двадцятьма вісьмома гігабайтами оперативної пам'яті, або подвійні RTX 3090, що забезпечують сорок вісім гігабайт загальної VRAM. У лінійці Apple це Mac Studio Ultra з дев'яносто шістьма до ста двадцяти восьми гігабайтами об'єднаної пам'яті. Суперсила – це резидентність пам'яті: ви можете тримати модель вбудовування, швидкий маршрутизатор і 32-мільярдну модель кодування завантаженими одночасно без затримки обміну. Тепер про чесну невдачу нашого польового випробування: пастка граничних обчислень.

4:24 Щотижня публікація в соціальних мережах стверджує, що ви можете запускати автономних кодуючих агентів на Raspberry Pi 5 за вісімдесят доларів. Я це протестував. Запуск крихітної моделі з 1,5 мільярдами параметрів дає вам ледь три токени на секунду, тоді як плата троттлить при вісімдесяти п'яти градусах Цельсія. Це класна іграшка на вихідні, але як щоденний інструмент розробки, це чисте покарання. Для програмного забезпечення використовуйте Ollama, якщо вам потрібен чистий демон командного рядка, який підключається

4:47 безпосередньо до Cursor, Cline або VS Code. Якщо ви хочете графічне середовище з завантаженням моделей та повзунками шарів GPU, використовуйте LM Studio. І узгодьте ваш формат з вашим кремнієм. На Apple Silicon завжди завантажуйте моделі GGUF, оптимізовані для Metal. На Windows або Linux з Nvidia завантажуйте моделі AWQ або EXL2, які використовують Nvidia Tensor Cores для на 20-30 відсотків швидшого виведення. Отже, як це розгорнути, не збанкрутувавши?

5:11 Уявіть локальне обладнання як домашній спортзал проти комерційного спортзалу. Маючи вдома стійку для присідань, ви тренуєтеся щодня без поїздок, без абонентської плати та з повною конфіденційністю. Ваша локальна машина обробляє вісімдесят відсотків вашого щоденного кодування, модульного тестування та обробки приватних документів за нуль доларів за токен. А коли вам потрібно підняти п'ятсот фунтів — як масивний архітектурний рефакторинг в п'ятдесяти файлах — ви відвідуєте комерційний спортзал: платите хмарному API за Claude 3.5 Sonnet або OpenAI o3 на п'ятнадцять хвилин

5:38 і рухаєтесь далі. Ось рахунок: збірка Рівня 2 з використаною 3090 коштує шістнадцять сотень доларів за все. Якщо ви витрачаєте п'ятдесят-сто доларів на місяць на токени API, вона окупиться за вісімнадцять місяців, зберігаючи вашу власну кодову базу поза сторонніми серверами. Вердикт сьогоднішнього польового випробування: SHIP IT. VRAM та пропускна здатність пам'яті перемагають тактові частоти щоразу. Перестаньте купувати процесори з п'ятьма гігагерцами для ШІ і знайдіть вживану 3090.

6:04 Розкажіть мені, яку апаратну збірку ви використовуєте для локальних моделей у коментарях. І якщо ви бажаєте прочитати цей розбір, візьміть розсилку на daily diff dot dev, посилання нижче. І це The Daily Diff на сьогодні. Я Ніко з Axrisi. Об'єднуйте відповідально.

Джерела

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Пов'язані відео