راهنمای سختافزار محلی هوش مصنوعی (2026)
توسعهدهندگان هنگام ساخت ماشینی برای عاملهای هوش مصنوعی محلی و LLMهای با وزن باز، اشتباه میکنند و مشخصات رایانههای بازی را میخرند: پردازندههای 5.8 گیگاهرتزی، سیستمهای خنککننده مایع سفارشی، و کارتهای گرافیک سریع بازی با تنها 8 گیگابایت VRAM.
توسعهدهندگان هنگام ساخت ماشینی برای عاملهای هوش مصنوعی محلی و LLMهای با وزن باز، اشتباه میکنند و مشخصات رایانههای بازی را میخرند: پردازندههای 5.8 گیگاهرتزی، سیستمهای خنککننده مایع سفارشی، و کارتهای گرافیک سریع بازی با تنها 8 گیگابایت VRAM. اما تولید توکن خودرگرسیو محدود به پهنای باند حافظه است، نه محدود به محاسبات: برای انتشار یک توکن، هر وزن در مدل باید از طریق گذرگاه حافظه جریان یابد. وقتی وزنها یا زمینه کش KV شما از VRAM فیزیکی فراتر رود، زمان اجرا لایهها را به DDR5 سیستم از طریق PCIe تخلیه میکند و شما به یک پرتگاه پهنای باند حافظه 20 برابری میخورید: سرعت از 40 توکن در ثانیه به 1.5 کاهش مییابد. در این آزمایش میدانی، نیکو مکانیک سختافزار، قوانین اندازهبندی مدل کوانتیزاسیون 4 بیتی، سه رده بودجه واقعی از 1,200 تا 5,000 دلار، دلیل اینکه RTX 3090 24GB دست دوم بهترین معامله VRAM به ازای هر دلار در محاسبات است، تله اج رزبری پای، و استراتژی باشگاه خانگی برای استنتاج محلی در مقابل ابری را بررسی میکند. حکم: SHIP IT.
نسخه نوشتاری را بخوانید (انگلیسی) ↗
این ویدیو چه مواردی را پوشش میدهد
- پرتگاه پهنای باند حافظه 20 برابری: 936 گیگابایت بر ثانیه GDDR6X در مقابل 50 گیگابایت بر ثانیه DDR5 و 31.5 گیگابایت بر ثانیه PCIe
- اندازهبندی مدل در 4 بیت: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- رده 1 (1,200 تا 1,500 دلار): RTX 4060 Ti 16GB (هرگز 8GB) یا مک مینی 16GB
- رده 2 (1,500 تا 2,000 دلار): نقطه شیرین RTX 3090 24GB دست دوم یا مک مینی M4 پرو 64GB
- رده 3 (3,500 دلار+): RTX 4090 24GB / دو 3090 یا مک استودیو اولترا
رونوشت ترجمه شده
ترجمه شده از روایت اصلی انگلیسی. صوت و زیرنویسهای موجود توسط YouTube کنترل میشوند.
0:00 اگر قصد دارید یک کامپیوتر برای اجرای عوامل هوش مصنوعی محلی بسازید، ساخت یک سیستم بازی را متوقف کنید. شما به یک Core i9 پنج و هشت دهم گیگاهرتزی، یک حلقه خنککننده مایع، یا یک کارت گرافیک هشت گیگابایتی که با RGB پوشیده شده است، نیاز ندارید. در استنتاج هوش مصنوعی محلی، مشخصات بازی تقریباً بیفایده هستند. تنها معیاری که دیکته میکند عامل شما اجرا میشود یا میخزد، ظرفیت VRAM است و پهنای باند گذرگاه حافظه. قوانین تست سختافزار: کلاک CPU و معیارهای رسترایز کردن را فراموش کنید.
0:24 ما به سه عدد اهمیت میدهیم: عرض گذرگاه حافظه، پهنای باند به گیگابایت در ثانیه، و فضای خالی VRAM خام برای افزایش کش KV. در این آزمایش میدانی، من پرتگاه پهنای باند حافظه بیست برابری را بررسی میکنم، قوانین اندازهبندی مدل را ترسیم میکنم، سه رده واقعی از هزار و دویست دلار تا پنج هزار دلار را محک میزنم، و توضیح میدهم چرا یک 3090 دست دوم هنوز بزرگترین رمز تقلب در محاسبات است. این The Daily Diff، آزمایش میدانی است. برای درک اینکه چرا سیستمهای بازی شکست میخورند، به نحوه اجرای واقعی تولید توکن نگاه کنید. در بازیها، CPU شما دستورات رسم را تغذیه میکند و GPU شما فریمها را رندر میکند.
0:54 اما دیکدینگ LLM خودرگرسیو تقریباً کاملاً به پهنای باند حافظه محدود است. برای تولید یک توکن واحد، GPU باید هر پارامتر وزن مدل را از حافظه از طریق هستههای محاسباتی خود جریان دهد. اگر مدل شما ده گیگابایت باشد، تولید یک توکن به معنای خواندن ده گیگابایت داده است. در یک Nvidia RTX 3090 با گذرگاه حافظه 384 بیتی، شما 936 گیگابایت بر ثانیه پهنای باند GDDR6X دریافت میکنید، و هشتاد توکن در ثانیه تولید میکنید. اما ببینید چه اتفاقی میافتد لحظهای که مدل شما از VRAM فیزیکی فراتر میرود.
1:22 وقتی VRAM پر میشود، زمانهای اجرا لایههای باقیمانده را از طریق گذرگاه PCIe به حافظه DDR5 سیستم تخلیه میکنند. هستههای GPU شما انتظار هزار گیگابایت در ثانیه را دارند. در عوض، DDR5 دو کاناله پنجاه گیگابایت به آنها میدهد، و PCIe 4 در سی و یک گیگابایت گیر میکند. این یک فروپاشی پهنای باند بیست برابری است. خط لوله تولید توکن فوراً در انتظار گذرگاه متوقف میشود، و سرعت از چهل توکن در ثانیه به یک و نیم کاهش مییابد. شما یک سیستم دو هزار دلاری را به یک بخاری تبدیل کردهاید.
1:47 و در طول اجرای عاملهای چند دورهای بدتر میشود، زیرا وزنها تنها نیمی از نبرد هستند. هر درخواست، فراخوانی ابزار، و تکه فایل در کش Key-Value ذخیره میشود. یک پنجره زمینه سی و دو هزار تایی میتواند چهار تا هشت گیگابایت از VRAM را علاوه بر وزنها مصرف کند. اگر کارت شما فقط شانزده گیگابایت داشته باشد، عامل شما دو بار حلقه میزند، به دیوار زمینه میخورد، و یا با خطای کمبود حافظه از کار میافتد یا به DDR5 میریزد. در اینجا برگه تقلب اندازهبندی چهار بیتی است. یک مدل با هفت یا هشت میلیارد پارامتر مانند Llama 3.1 یا DeepSeek Distill
2:16 حدود پنج گیگابایت میگیرد. یک مدل چهارده میلیارد تایی ده گیگابایت میگیرد. یک مدل سی و دو میلیارد تایی، نقطه شیرین هوش برای عاملهای کدنویسی، به بیست گیگابایت نیاز دارد. و یک مدل مرزی هفتاد میلیارد تایی قبل از اینکه حتی زمینه را تخصیص دهید، چهل گیگابایت را میطلبد. که ما را به ساخت واقعی سختافزار میرساند. رده 1 سیستم اولیه است، دوازده صد تا پانزده صد دلار. در کامپیوتر، لنگر شما یک RTX 4060 Ti 16 گیگابایتی است.
2:39 هشدار حیاتی: هرگز نسخه هشت گیگابایتی را برای صرفهجویی در هفتاد دلار نخرید. هشت گیگابایت VRAM در سال 2026 یک حکم اعدام فوری به دلیل کمبود حافظه در هر گردش کار عامل واقعی است. آن را با یک Ryzen 5 شش هستهای، شصت و چهار گیگابایت DDR5، و یک درایو NVMe دو ترابایتی جفت کنید. در دنیای اپل، معادل آن یک مک مینی یا مکبوک پرو با شانزده گیگابایت حافظه یکپارچه است.
3:02 شما چهل تا پنجاه توکن در ثانیه در مدلهای هشت میلیارد تایی مشاهده خواهید کرد. رده 2 نقطه شیرین کاربر قدرتمند است: ساخت به طور خاص برای اجرای مدلهای سی و دو میلیارد پارامتر مانند Qwen 2.5 32B. مسیر A یک RTX 4070 Ti Super جدید با شانزده گیگابایت برای هشتصد دلار است. اما مسیر B توصیه قوی من است: یک Nvidia RTX 3090 بیست و چهار گیگابایتی دست دوم بخرید. میتوانید 3090های تمیز را در eBay با ششصد و پنجاه تا هفتصد و پنجاه دلار پیدا کنید. این به شما بیست و چهار گیگابایت VRAM در یک گذرگاه 384 بیتی عظیم میدهد که
3:33 936 گیگابایت در ثانیه را ارسال میکند. دلار به دلار، بهترین معامله VRAM در محاسبات است. در macOS، همتای رده 2 یک مک مینی M4 پرو با شصت و چهار گیگابایت حافظه یکپارچه است. آن یازده تا دوازده توکن در ثانیه در یک مدل سی و دو میلیارد تایی تولید میکند: کندتر از Nvidia، اما کاملاً بیصدا در سی وات با فضای کافی برای یک پنجره زمینه عظیم. رده 3 براکت علاقهمندان برای ازدحام عاملهای چندگانه است. در کامپیوتر، این به معنای یک RTX 4090 با بیست و چهار گیگابایت،
3:57 یک Ryzen 9، و صد و بیست و هشت گیگابایت RAM، یا دو RTX 3090 که چهل و هشت گیگابایت VRAM کلی را فراهم میکنند. در خط تولید اپل، این یک مک استودیو اولترا با نود و شش تا صد و بیست و هشت گیگابایت حافظه یکپارچه است. قدرت فوقالعاده اقامت حافظه است: شما میتوانید یک مدل تعبیه، یک روتر سریع، و یک مدل کدنویسی 32 میلیارد تایی را همزمان با تأخیر تعویض صفر بارگذاری کنید. حالا به شکست صادقانه آزمایش میدانی ما: تله محاسبات اج.
4:24 هر هفته یک پست اجتماعی ادعا میکند که میتوانید عوامل کدنویسی خودکار را روی یک رزبری پای 5 هشتاد دلاری اجرا کنید. من آن را آزمایش کردم. اجرای یک مدل کوچک یک و نیم میلیارد پارامتر به شما به سختی سه توکن در ثانیه میدهد در حالی که برد در هشتاد و پنج درجه سانتیگراد دچار افت عملکرد میشود. این یک اسباببازی جالب برای آخر هفته است، اما به عنوان یک درایور توسعه روزانه، این مجازات خالص است. برای نرمافزار، از Ollama استفاده کنید اگر میخواهید یک دیمون خط فرمان تمیز داشته باشید که مستقیماً به Cursor، Cline یا VS Code متصل میشود.
4:47 مستقیماً به Cursor، Cline، یا VS Code متصل میشود. اگر یک محیط بازی گرافیکی با دانلود مدل و اسلایدرهای لایه GPU میخواهید، از LM Studio استفاده کنید. و فرمت خود را با سیلیکون خود مطابقت دهید. در Apple Silicon، همیشه مدلهای GGUF بهینه شده برای Metal را دانلود کنید. در ویندوز یا لینوکس با Nvidia، مدلهای AWQ یا EXL2 را دانلود کنید، که از Nvidia Tensor Cores برای 20 تا 30 درصد استنتاج سریعتر استفاده میکنند. پس چگونه این را بدون ورشکستگی مستقر میکنید؟
5:11 سختافزار محلی را مانند یک باشگاه خانگی در مقابل یک باشگاه تجاری در نظر بگیرید. داشتن یک رک اسکوات در خانه به این معنی است که هر روز بدون رفت و آمد، بدون هزینه اشتراک، و با حریم خصوصی کامل تمرین میکنید. ماشین محلی شما هشتاد درصد از کدنویسی روزانه، تست واحد، و پردازش اسناد خصوصی شما را با صفر دلار به ازای هر توکن انجام میدهد. و وقتی نیاز به ددلیفت پانصد پوند دارید — مانند یک بازسازی معماری گسترده در سراسر پنجاه فایل — به باشگاه تجاری میروید: هزینه API ابری برای Claude 3.5 Sonnet یا OpenAI o3 را برای پانزده دقیقه پرداخت میکنید
5:38 و ادامه میدهید. در اینجا صورتحساب است: یک ساخت رده 2 با یک 3090 دست دوم در مجموع شانزده صد دلار هزینه دارد. اگر پنجاه تا صد دلار در ماه برای توکنهای API خرج کنید، در هجده ماه خودش را جبران میکند در حالی که کدبیس اختصاصی شما را از سرورهای شخص ثالث دور نگه میدارد. حکم آزمایش میدانی امروز: SHIP IT. VRAM و پهنای باند حافظه همیشه از سرعت کلاک بهتر عمل میکنند. خرید CPUهای پنج گیگاهرتزی برای هوش مصنوعی را متوقف کنید، و یک 3090 دست دوم پیدا کنید.
6:04 در نظرات به من بگویید چه سختافزاری را برای مدلهای محلی استفاده میکنید. و اگر ترجیح میدهید این تحلیل را بخوانید، خبرنامه را در the daily diff dot dev، لینک زیر، دریافت کنید. و این تفاوت برای امروز است. من نیکو از Axrisi هستم. مسئولانه ادغام کنید.
منابع
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



