# راهنمای سخت‌افزار محلی هوش مصنوعی (2026)

Published: 2026-09-14

توسعه‌دهندگان هنگام ساخت ماشینی برای عامل‌های هوش مصنوعی محلی و LLM‌های با وزن باز، اشتباه می‌کنند و مشخصات رایانه‌های بازی را می‌خرند: پردازنده‌های 5.8 گیگاهرتزی، سیستم‌های خنک‌کننده مایع سفارشی، و کارت‌های گرافیک سریع بازی با تنها 8 گیگابایت VRAM. اما تولید توکن خودرگرسیو محدود به پهنای باند حافظه است، نه محدود به محاسبات: برای انتشار یک توکن، هر وزن در مدل باید از طریق گذرگاه حافظه جریان یابد. وقتی وزن‌ها یا زمینه کش KV شما از VRAM فیزیکی فراتر رود، زمان اجرا لایه‌ها را به DDR5 سیستم از طریق PCIe تخلیه می‌کند و شما به یک پرتگاه پهنای باند حافظه 20 برابری می‌خورید: سرعت از 40 توکن در ثانیه به 1.5 کاهش می‌یابد. در این آزمایش میدانی، نیکو مکانیک سخت‌افزار، قوانین اندازه‌بندی مدل کوانتیزاسیون 4 بیتی، سه رده بودجه واقعی از 1,200 تا 5,000 دلار، دلیل اینکه RTX 3090 24GB دست دوم بهترین معامله VRAM به ازای هر دلار در محاسبات است، تله اج رزبری پای، و استراتژی باشگاه خانگی برای استنتاج محلی در مقابل ابری را بررسی می‌کند. حکم: SHIP IT.

Canonical: https://thedailydiff.dev/fa/video/2026-09-14-local-ai-hardware/

## این ویدیو چه مواردی را پوشش می‌دهد

- پرتگاه پهنای باند حافظه 20 برابری: 936 گیگابایت بر ثانیه GDDR6X در مقابل 50 گیگابایت بر ثانیه DDR5 و 31.5 گیگابایت بر ثانیه PCIe
- اندازه‌بندی مدل در 4 بیت: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- رده 1 (1,200 تا 1,500 دلار): RTX 4060 Ti 16GB (هرگز 8GB) یا مک مینی 16GB
- رده 2 (1,500 تا 2,000 دلار): نقطه شیرین RTX 3090 24GB دست دوم یا مک مینی M4 پرو 64GB
- رده 3 (3,500 دلار+): RTX 4090 24GB / دو 3090 یا مک استودیو اولترا

## رونوشت ترجمه شده

ترجمه شده از روایت اصلی انگلیسی. صوت و زیرنویس‌های موجود توسط YouTube کنترل می‌شوند.

0:00 اگر قصد دارید یک کامپیوتر برای اجرای عوامل هوش مصنوعی محلی بسازید، ساخت یک سیستم بازی را متوقف کنید. شما به یک Core i9 پنج و هشت دهم گیگاهرتزی، یک حلقه خنک‌کننده مایع، یا یک کارت گرافیک هشت گیگابایتی که با RGB پوشیده شده است، نیاز ندارید. در استنتاج هوش مصنوعی محلی، مشخصات بازی تقریباً بی‌فایده هستند. تنها معیاری که دیکته می‌کند عامل شما اجرا می‌شود یا می‌خزد، ظرفیت VRAM است و پهنای باند گذرگاه حافظه. قوانین تست سخت‌افزار: کلاک CPU و معیارهای رسترایز کردن را فراموش کنید.

0:24 ما به سه عدد اهمیت می‌دهیم: عرض گذرگاه حافظه، پهنای باند به گیگابایت در ثانیه، و فضای خالی VRAM خام برای افزایش کش KV. در این آزمایش میدانی، من پرتگاه پهنای باند حافظه بیست برابری را بررسی می‌کنم، قوانین اندازه‌بندی مدل را ترسیم می‌کنم، سه رده واقعی از هزار و دویست دلار تا پنج هزار دلار را محک می‌زنم، و توضیح می‌دهم چرا یک 3090 دست دوم هنوز بزرگترین رمز تقلب در محاسبات است. این The Daily Diff، آزمایش میدانی است. برای درک اینکه چرا سیستم‌های بازی شکست می‌خورند، به نحوه اجرای واقعی تولید توکن نگاه کنید. در بازی‌ها، CPU شما دستورات رسم را تغذیه می‌کند و GPU شما فریم‌ها را رندر می‌کند.

0:54 اما دیکدینگ LLM خودرگرسیو تقریباً کاملاً به پهنای باند حافظه محدود است. برای تولید یک توکن واحد، GPU باید هر پارامتر وزن مدل را از حافظه از طریق هسته‌های محاسباتی خود جریان دهد. اگر مدل شما ده گیگابایت باشد، تولید یک توکن به معنای خواندن ده گیگابایت داده است. در یک Nvidia RTX 3090 با گذرگاه حافظه 384 بیتی، شما 936 گیگابایت بر ثانیه پهنای باند GDDR6X دریافت می‌کنید، و هشتاد توکن در ثانیه تولید می‌کنید. اما ببینید چه اتفاقی می‌افتد لحظه‌ای که مدل شما از VRAM فیزیکی فراتر می‌رود.

1:22 وقتی VRAM پر می‌شود، زمان‌های اجرا لایه‌های باقی‌مانده را از طریق گذرگاه PCIe به حافظه DDR5 سیستم تخلیه می‌کنند. هسته‌های GPU شما انتظار هزار گیگابایت در ثانیه را دارند. در عوض، DDR5 دو کاناله پنجاه گیگابایت به آن‌ها می‌دهد، و PCIe 4 در سی و یک گیگابایت گیر می‌کند. این یک فروپاشی پهنای باند بیست برابری است. خط لوله تولید توکن فوراً در انتظار گذرگاه متوقف می‌شود، و سرعت از چهل توکن در ثانیه به یک و نیم کاهش می‌یابد. شما یک سیستم دو هزار دلاری را به یک بخاری تبدیل کرده‌اید.

1:47 و در طول اجرای عامل‌های چند دوره‌ای بدتر می‌شود، زیرا وزن‌ها تنها نیمی از نبرد هستند. هر درخواست، فراخوانی ابزار، و تکه فایل در کش Key-Value ذخیره می‌شود. یک پنجره زمینه سی و دو هزار تایی می‌تواند چهار تا هشت گیگابایت از VRAM را علاوه بر وزن‌ها مصرف کند. اگر کارت شما فقط شانزده گیگابایت داشته باشد، عامل شما دو بار حلقه می‌زند، به دیوار زمینه می‌خورد، و یا با خطای کمبود حافظه از کار می‌افتد یا به DDR5 می‌ریزد. در اینجا برگه تقلب اندازه‌بندی چهار بیتی است. یک مدل با هفت یا هشت میلیارد پارامتر مانند Llama 3.1 یا DeepSeek Distill

2:16 حدود پنج گیگابایت می‌گیرد. یک مدل چهارده میلیارد تایی ده گیگابایت می‌گیرد. یک مدل سی و دو میلیارد تایی، نقطه شیرین هوش برای عامل‌های کدنویسی، به بیست گیگابایت نیاز دارد. و یک مدل مرزی هفتاد میلیارد تایی قبل از اینکه حتی زمینه را تخصیص دهید، چهل گیگابایت را می‌طلبد. که ما را به ساخت واقعی سخت‌افزار می‌رساند. رده 1 سیستم اولیه است، دوازده صد تا پانزده صد دلار. در کامپیوتر، لنگر شما یک RTX 4060 Ti 16 گیگابایتی است.

2:39 هشدار حیاتی: هرگز نسخه هشت گیگابایتی را برای صرفه‌جویی در هفتاد دلار نخرید. هشت گیگابایت VRAM در سال 2026 یک حکم اعدام فوری به دلیل کمبود حافظه در هر گردش کار عامل واقعی است. آن را با یک Ryzen 5 شش هسته‌ای، شصت و چهار گیگابایت DDR5، و یک درایو NVMe دو ترابایتی جفت کنید. در دنیای اپل، معادل آن یک مک مینی یا مک‌بوک پرو با شانزده گیگابایت حافظه یکپارچه است.

3:02 شما چهل تا پنجاه توکن در ثانیه در مدل‌های هشت میلیارد تایی مشاهده خواهید کرد. رده 2 نقطه شیرین کاربر قدرتمند است: ساخت به طور خاص برای اجرای مدل‌های سی و دو میلیارد پارامتر مانند Qwen 2.5 32B. مسیر A یک RTX 4070 Ti Super جدید با شانزده گیگابایت برای هشتصد دلار است. اما مسیر B توصیه قوی من است: یک Nvidia RTX 3090 بیست و چهار گیگابایتی دست دوم بخرید. می‌توانید 3090های تمیز را در eBay با ششصد و پنجاه تا هفتصد و پنجاه دلار پیدا کنید. این به شما بیست و چهار گیگابایت VRAM در یک گذرگاه 384 بیتی عظیم می‌دهد که

3:33 936 گیگابایت در ثانیه را ارسال می‌کند. دلار به دلار، بهترین معامله VRAM در محاسبات است. در macOS، همتای رده 2 یک مک مینی M4 پرو با شصت و چهار گیگابایت حافظه یکپارچه است. آن یازده تا دوازده توکن در ثانیه در یک مدل سی و دو میلیارد تایی تولید می‌کند: کندتر از Nvidia، اما کاملاً بی‌صدا در سی وات با فضای کافی برای یک پنجره زمینه عظیم. رده 3 براکت علاقه‌مندان برای ازدحام عامل‌های چندگانه است. در کامپیوتر، این به معنای یک RTX 4090 با بیست و چهار گیگابایت،

3:57 یک Ryzen 9، و صد و بیست و هشت گیگابایت RAM، یا دو RTX 3090 که چهل و هشت گیگابایت VRAM کلی را فراهم می‌کنند. در خط تولید اپل، این یک مک استودیو اولترا با نود و شش تا صد و بیست و هشت گیگابایت حافظه یکپارچه است. قدرت فوق‌العاده اقامت حافظه است: شما می‌توانید یک مدل تعبیه، یک روتر سریع، و یک مدل کدنویسی 32 میلیارد تایی را همزمان با تأخیر تعویض صفر بارگذاری کنید. حالا به شکست صادقانه آزمایش میدانی ما: تله محاسبات اج.

4:24 هر هفته یک پست اجتماعی ادعا می‌کند که می‌توانید عوامل کدنویسی خودکار را روی یک رزبری پای 5 هشتاد دلاری اجرا کنید. من آن را آزمایش کردم. اجرای یک مدل کوچک یک و نیم میلیارد پارامتر به شما به سختی سه توکن در ثانیه می‌دهد در حالی که برد در هشتاد و پنج درجه سانتی‌گراد دچار افت عملکرد می‌شود. این یک اسباب‌بازی جالب برای آخر هفته است، اما به عنوان یک درایور توسعه روزانه، این مجازات خالص است. برای نرم‌افزار، از Ollama استفاده کنید اگر می‌خواهید یک دیمون خط فرمان تمیز داشته باشید که مستقیماً به Cursor، Cline یا VS Code متصل می‌شود.

4:47 مستقیماً به Cursor، Cline، یا VS Code متصل می‌شود. اگر یک محیط بازی گرافیکی با دانلود مدل و اسلایدرهای لایه GPU می‌خواهید، از LM Studio استفاده کنید. و فرمت خود را با سیلیکون خود مطابقت دهید. در Apple Silicon، همیشه مدل‌های GGUF بهینه شده برای Metal را دانلود کنید. در ویندوز یا لینوکس با Nvidia، مدل‌های AWQ یا EXL2 را دانلود کنید، که از Nvidia Tensor Cores برای 20 تا 30 درصد استنتاج سریع‌تر استفاده می‌کنند. پس چگونه این را بدون ورشکستگی مستقر می‌کنید؟

5:11 سخت‌افزار محلی را مانند یک باشگاه خانگی در مقابل یک باشگاه تجاری در نظر بگیرید. داشتن یک رک اسکوات در خانه به این معنی است که هر روز بدون رفت و آمد، بدون هزینه اشتراک، و با حریم خصوصی کامل تمرین می‌کنید. ماشین محلی شما هشتاد درصد از کدنویسی روزانه، تست واحد، و پردازش اسناد خصوصی شما را با صفر دلار به ازای هر توکن انجام می‌دهد. و وقتی نیاز به ددلیفت پانصد پوند دارید — مانند یک بازسازی معماری گسترده در سراسر پنجاه فایل — به باشگاه تجاری می‌روید: هزینه API ابری برای Claude 3.5 Sonnet یا OpenAI o3 را برای پانزده دقیقه پرداخت می‌کنید

5:38 و ادامه می‌دهید. در اینجا صورتحساب است: یک ساخت رده 2 با یک 3090 دست دوم در مجموع شانزده صد دلار هزینه دارد. اگر پنجاه تا صد دلار در ماه برای توکن‌های API خرج کنید، در هجده ماه خودش را جبران می‌کند در حالی که کدبیس اختصاصی شما را از سرورهای شخص ثالث دور نگه می‌دارد. حکم آزمایش میدانی امروز: SHIP IT. VRAM و پهنای باند حافظه همیشه از سرعت کلاک بهتر عمل می‌کنند. خرید CPUهای پنج گیگاهرتزی برای هوش مصنوعی را متوقف کنید، و یک 3090 دست دوم پیدا کنید.

6:04 در نظرات به من بگویید چه سخت‌افزاری را برای مدل‌های محلی استفاده می‌کنید. و اگر ترجیح می‌دهید این تحلیل را بخوانید، خبرنامه را در the daily diff dot dev، لینک زیر، دریافت کنید. و این تفاوت برای امروز است. من نیکو از Axrisi هستم. مسئولانه ادغام کنید.

## منابع

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
