Жергиликтүү AI Аппараттык Куралдар Жетекчиси (2026)
Жергиликтүү AI агенттери жана ачык-салмактагы LLMдер үчүн машина куруп жатканда, иштеп чыгуучулар оюн PC спецификацияларын сатып алууда ката кетиришет: 5.8 ГГц CPU, бажы суюк муздатуу циклы жана 8 ГБ VRAM гана болгон тез оюн GPUлары.
Жергиликтүү AI агенттери жана ачык-салмактагы LLMдер үчүн машина куруп жатканда, иштеп чыгуучулар оюн PC спецификацияларын сатып алууда ката кетиришет: 5.8 ГГц CPU, бажы суюк муздатуу циклы жана 8 ГБ VRAM гана болгон тез оюн GPUлары. Бирок авторегрессивдүү токенди генерациялоо эсептөө менен эмес, эс тутумунун өткөрүү жөндөмдүүлүгү менен чектелет: бир токенди чыгаруу үчүн, моделдеги ар бир салмак эс тутум шинасы аркылуу өтүшү керек. Сиздин салмагыңыз же KV кэш контексти физикалык VRAMдан ашып кеткенде, иштөө убактысы катмарларды PCIe аркылуу системалык DDR5ке түшүрөт жана сиз 20 эсе эс тутумунун өткөрүү жөндөмдүүлүгү чегине туш болосуз: ылдамдык секундасына 40 токенден 1,5ке чейин төмөндөйт. Бул талаа тестинде Нико аппараттык механиканы, 4-биттик кванттоо моделинин өлчөмүн аныктоо эрежелерин, 1200 доллардан 5000 долларга чейинки үч реалдуу бюджеттик деңгээлди, колдонулган RTX 3090 24 ГБ эмне үчүн эсептөөдөгү эң мыкты VRAM-доллар үчүн келишим экенин, Raspberry Pi четинин тузагын жана жергиликтүү vs булуттагы тыянак үчүн үй спорт залы стратегиясын талдайт. Өкүм: SHIP IT.
Жазма басылышын окуу (Англисче) ↗
Бул видео эмнелерди камтыйт
- 20x эс тутумунун өткөрүү жөндөмдүүлүгү чеги: 936 ГБ/с GDDR6X vs 50 ГБ/с DDR5 & 31.5 ГБ/с PCIe
- Моделдин өлчөмү @ 4-бит: 8B (5ГБ), 14B (10ГБ), 32B (20ГБ), 70B (40ГБ)
- 1-деңгээл (1,200–1,500 доллар): RTX 4060 Ti 16ГБ (эч качан 8ГБ) же Mac Mini 16ГБ
- 2-деңгээл (1,500–2,000 доллар): Колдонулган RTX 3090 24ГБ эң ыңгайлуу же Mac Mini M4 Pro 64ГБ
- 3-деңгээл (3,500+ доллар): RTX 4090 24ГБ / кош 3090 же Mac Studio Ultra
Котормо стенограмма
Англис тилиндеги баштапкы баяндамадан которулган. Жеткиликтүү аудио жана коштомо жазуулар YouTube тарабынан көзөмөлдөнөт.
0:00 Эгер сиз жергиликтүү AI агенттерин иштетүү үчүн компьютер курууну пландаштырып жатсаңыз, оюн жабдуусун курууну токтотуңуз. Сизге беш бүтүн сегиз гигагерц Core i9, суюк муздатуу циклы, же RGB менен капталган сегиз гигабайттык графикалык картанын кереги жок. Жергиликтүү AI тыянагында оюн спецификациялары дээрлик пайдасыз. Сиздин агентиңиз иштейби же сойлойбу, аны аныктоочу жалгыз көрсөткүч VRAM сыйымдуулугу жана эс тутумунун өткөрүү жөндөмдүүлүгү. Аппараттык сыноонун эрежелери: CPU сааттарын жана растерлөө эталондорун унут.
0:24 Бизге үч сан маанилүү: эс тутумунун шинасынын туурасы, секундасына гигабайт менен өткөрүү жөндөмдүүлүгү жана KV кэштин кеңейиши үчүн чийки VRAM резерви. Бул талаа сыноосунда мен жыйырма эсе эс тутумунун өткөрүү жөндөмдүүлүгү чегин талдайм, моделдин өлчөмүн аныктоо эрежелерин карталап, миң эки жүз доллардан беш миң долларга чейинки үч реалдуу деңгээлди эталондоп, колдонулган 3090 эмне үчүн дагы эле эсептөөнүн эң мыкты алдамчылык коду экенин түшүндүрөм. Бул The Daily Diff, талаа сыноосу. Оюн жабдуулары эмне үчүн иштебей калганын түшүнүү үчүн, токенди генерациялоо чындыгында кантип аткарылаарын караңыз. Оюндарда CPUңуз чийүү чакырууларын азыктандырып, GPUңуз кадрларды көрсөтөт.
0:54 Бирок авторегрессивдүү LLM декоддоо дээрлик толугу менен эс тутумунун өткөрүү жөндөмдүүлүгү менен чектелет. Бир токенди түзүү үчүн, GPU моделдин ар бир салмак параметрин эс тутумдан эсептөө ядролору аркылуу агылтышы керек. Эгер моделдин көлөмү он гигабайт болсо, бир токенди түзүү он гигабайт маалыматты окууну билдирет. Nvidia RTX 3090до 384-биттик эс тутумунун шинасы менен, сиз GDDR6X өткөрүү жөндөмдүүлүгүн секундасына 936 гигабайт аласыз, секундасына сексен токенди түзөт. Бирок моделиңиз физикалык VRAMдан ашып кеткен учурда эмне болорун караңыз.
1:22 VRAM толгондо, иштөө убактысы калган катмарларды PCIe шинасы аркылуу системалык DDR5 эс тутумуна түшүрөт. Сиздин GPU ядролору секундасына миң гигабайтты күтөт. Анын ордуна, кош каналдуу DDR5 аларга элүү, ал эми PCIe 4 отуз бирде тумчугат. Бул жыйырма эсе өткөрүү жөндөмдүүлүгүнүн кыйроосу. Токенди генерациялоо процесси дароо шинаны күтүп туруп калат, жана ылдамдык секундасына кырк токенден бир бүтүн бешке чейин төмөндөйт. Сиз эки миң долларлык жабдууну жылыткычка айландырдыңыз.
1:47 Жана бул көп кезектеги агенттик иштөөдө начарлайт, анткени салмактардын жарымы гана маанилүү. Ар бир сунуш, курал чакыруу жана файл бөлүгү Key-Value кэште сакталат. Отуз эки К контексттик терезе салмактардын үстүнө төрт-сегиз гигабайт VRAMды жеп салышы мүмкүн. Эгер картаңызда он алты гигабайт гана болсо, агентиңиз эки жолу айланып, контексттик дубалга урунуп, же эс тутум жетишсиздиги катасы менен бузулат же DDR5ке ашып кетет. Бул төрт биттик өлчөмдү аныктоо боюнча cheat sheet. Llama 3.1 же DeepSeek Distill сыяктуу жети же сегиз миллиард параметрдик модель
2:16 болжол менен беш гигабайтты ээлейт. Он төрт миллиарддык модель он гигабайтты ээлейт. Отуз эки миллиарддык модель, коддоо агенттери үчүн акылдуулук оптималдуу чекити, жыйырма гигабайтты талап кылат. Жана жетимиш миллиарддык чек ара модели контекстти бөлүштүрүүдөн мурун эле кырк гигабайтты талап кылат. Бул бизди чыныгы аппараттык курулуштарга алып келет. 1-деңгээл - бул баштапкы жабдуу, миң эки жүз доллардан миң беш жүз долларга чейин. Компьютерде сиздин негизиңиз RTX 4060 Ti 16-гигабайт.
2:39 Критикалык эскертүү: эч качан жетимиш доллар үнөмдөө үчүн сегиз гигабайттык версиясын сатып албаңыз. 2026-жылы сегиз гигабайт VRAM ар кандай чыныгы агенттик жумуш процессинде эс тутум жетишсиздигинен дароо өлүм жазасы. Аны алты ядролуу Ryzen 5, алтымыш төрт гигабайт DDR5 жана эки терабайт NVMe диски менен жуптаңыз. Apple тарапта, эквиваленти Mac Mini же MacBook Pro он алты гигабайт бириккен эс тутуму менен.
3:02 Сиз сегиз миллиарддык моделдерде секундасына кырктан элүүгө чейин токен көрөсүз. 2-деңгээл - бул күчтүү колдонуучунун оптималдуу чекити: Qwen 2.5 32B сыяктуу отуз эки миллиард параметрдик моделдерди иштетүү үчүн атайын курулган. А жолу - сегиз жүз долларга он алты гигабайттык жаңы RTX 4070 Ti Super. Бирок В жолу - менин катуу сунушум: колдонулган Nvidia RTX 3090 жыйырма төрт гигабайтты сатып алыңыз. Сиз eBayден таза 3090ду алты жүз элүүдөн жети жүз элүү долларга таба аласыз. Бул сизге 384-биттик массивдүү шинада 936 гигабайтты секундасына түртүп
3:33 жыйырма төрт гигабайт VRAM берет. Доллар үчүн доллар, бул эсептөөдөгү эң мыкты VRAM келишими. macOSто, 2-деңгээлдин окшошу - алтымыш төрт гигабайт бириккен эс тутуму бар Mac Mini M4 Pro. Ал отуз эки миллиарддык моделде секундасына он бирден он экиге чейин токенди түзөт: Nvidiaдан жайыраак, бирок отуз ватт менен такыр үнсүз, чоң контексттик терезе үчүн орун бар. 3-деңгээл - көп агенттик топтор үчүн ышкыбоздор категориясы. Компьютерде бул жыйырма төрт гигабайттык RTX 4090,
3:57 Ryzen 9 жана жүз жыйырма сегиз гигабайт RAM же жалпы кырк сегиз гигабайт VRAMды камсыз кылган кош RTX 3090дорду билдирет. Apple'дин линиясында бул токсон алтыдан жүз жыйырма сегизге чейин бириккен эс тутуму бар Mac Studio Ultra. Супер күчү - эс тутумдун резиденциясы: сиз бир убакта эмбеддинг моделин, тез роутерди жана 32-миллиарддык коддоо моделин нөлдүк алмашуу кечигүүсү менен жүктөй аласыз. нөлдүк алмашуу кечигүүсү менен. Эми биздин талаа сыноонун чынчыл ийгиликсиздиги жөнүндө: четки эсептөө тузагы.
4:24 Жума сайын бир социалдык пост сексен долларлык Raspberry Pi 5те автономдуу коддоо агенттерин иштете аласыз деп ырастайт. Мен аны сынадым. Бир бүтүн беш миллиард параметрдик кичинекей моделди иштетүү сизге секундасына үч токенди гана берет, ал эми плата сексен беш градус Цельсийде дроссель кылат. Бул сонун дем алыш оюнчугу, бирок күнүмдүк иштеп чыгуу драйвери катары, бул таза жаза. Программалык камсыздоо үчүн, эгер сиз Cursor, Cline же VS Codeго түз туташкан
4:47 таза команддык сап демонун кааласаңыз, Ollamaны колдонуңуз. Эгер сиз моделди жүктөп алуу жана GPU катмар слайдерлери менен графикалык оюн аянтчасын кааласаңыз, LM Studioну колдонуңуз. Жана форматыңызды силиконуңузга дал келтириңиз. Apple Siliconдо, ар дайым Metal үчүн оптималдаштырылган GGUF моделдерин жүктөп алыңыз. Nvidia менен Windows же Linuxта, AWQ же EXL2 моделдерин жүктөп алыңыз, алар Nvidia Tensor Coresди жыйырма-отуз пайызга тезирээк тыянак чыгаруу үчүн колдонушат. Анда муну кантип банкрот болбой жайылтасыз?
5:11 Жергиликтүү жабдууларды үй спорт залы менен коммерциялык спорт залын салыштырып көрүңүз. Үйдө скват-стойканын болушу, сиз нөлдүк жол жүрүү, нөлдүк жазылуу акысы жана толук купуялуулук менен күн сайын машыгасыз дегенди билдирет. Сиздин жергиликтүү машинаңыз күнүмдүк коддооңуздун сексен пайызын, бирдик тестирлөөнү жана жеке документти нөлдүк токен үчүн иштетет. Жана сизге беш жүз фунт көтөрүү керек болгондо — мисалы, элүү файл боюнча массивдүү репозиторий боюнча архитектуралык рефактор — сиз коммерциялык спорт залына барасыз: Claude 3.5 Sonnet же OpenAI o3 үчүн булут APIне он беш мүнөткө төлөп, Claude 3.5 Sonnet же OpenAI o3 үчүн он беш мүнөткө төлөп,
5:38 жана алдыга жыласыз. Бул жерде эсеп: колдонулган 3090 менен 2-деңгээлдеги курулуш он алты жүз долларды түзөт. Эгер сиз айына элүүдөн жүз долларга чейин API токендерине сарптасаңыз, ал он сегиз айда өзүн актап, менчик код базаңызды үчүнчү тараптын серверлеринен алыс кармайт. Бүгүнкү талаа сыноосунун өкүмү: SHIP IT. VRAM жана эс тутумунун өткөрүү жөндөмдүүлүгү ар дайым саат ылдамдыгын жеңет. AI үчүн беш гигагерц CPUларды сатып алууну токтотуп, колдонулган 3090ду табыңыз.
6:04 Комментарийлерде жергиликтүү моделдер үчүн кандай аппараттык курулушту иштетип жатканыңызды айтыңыз. Жана эгер сиз бул талдоону окууну кааласаңыз, the daily diff dot dev дарегинен маалымат катты алыңыз, шилтеме ылдыйда. Бүгүнкү айырма ушул. Мен Axrisiден Нико. Жоопкерчиликтүү бириктиргиле.
Булактар
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



