# دی لوکل اے آئی ہارڈویئر گائیڈ (2026)

Published: 2026-09-14

لوکل اے آئی ایجنٹس اور اوپن ویٹ ایل ایل ایمز کے لیے ایک مشین بناتے وقت، ڈویلپرز گیمنگ پی سی کی خصوصیات خریدنے کی غلطی کرتے ہیں: 5.8 GHz CPUs، کسٹم لیکویڈ کولنگ لوپس، اور تیز گیمنگ GPUs صرف 8GB VRAM کے ساتھ۔ لیکن آٹو ریگریسیو ٹوکن جنریشن میموری-بینڈوتھ سے منسلک ہے، نہ کہ کمپیوٹ سے: ایک ہی ٹوکن جاری کرنے کے لیے، ماڈل میں موجود ہر ویٹ کو میموری بس کے ذریعے اسٹریم کرنا ضروری ہے۔ جب آپ کے ویٹس یا KV کیشے کا سیاق و سباق فزیکل VRAM سے بڑھ جاتا ہے، تو رن ٹائم PCIe پر سسٹم DDR5 میں تہوں کو آف لوڈ کرتا ہے، اور آپ 20x میموری بینڈوتھ کی رکاوٹ کا سامنا کرتے ہیں: رفتار 40 ٹوکن فی سیکنڈ سے 1.5 تک گر جاتی ہے۔ اس فیلڈ ٹیسٹ میں، نیکو ہارڈویئر میکینکس، 4-بٹ کوانٹائزیشن ماڈل سائزنگ کے قواعد، $1,200 سے $5,000 تک کے تین حقیقی بجٹ ٹیرز، کیوں ایک استعمال شدہ RTX 3090 24GB کمپیوٹنگ میں VRAM-فی-ڈالر کا بہترین سودا ہے، Raspberry Pi ایج ٹریپ، اور لوکل بمقابلہ کلاؤڈ انفرنس کے لیے ہوم جم کی حکمت عملی کی وضاحت کرتا ہے۔ فیصلہ: SHIP IT۔

Canonical: https://thedailydiff.dev/ur/video/2026-09-14-local-ai-hardware/

## اس ویڈیو میں کیا شامل ہے

- 20x میموری بینڈوتھ کی رکاوٹ: 936 GB/s GDDR6X بمقابلہ 50 GB/s DDR5 اور 31.5 GB/s PCIe
- ماڈل سائزنگ @ 4-بٹ: 8B (5GB)، 14B (10GB)، 32B (20GB)، 70B (40GB)
- ٹیر 1 ($1,200–$1,500): RTX 4060 Ti 16GB (کبھی 8GB نہیں) یا Mac Mini 16GB
- ٹیر 2 ($1,500–$2,000): استعمال شدہ RTX 3090 24GB بہترین جگہ یا Mac Mini M4 Pro 64GB
- ٹیر 3 ($3,500+): RTX 4090 24GB / ڈوئل 3090s یا Mac Studio Ultra

## ترجمہ شدہ ٹرانسکرپٹ

اصل انگریزی بیان سے ترجمہ کیا گیا۔ دستیاب آڈیو اور کیپشنز یوٹیوب کے زیر انتظام ہیں۔

0:00 اگر آپ لوکل AI ایجنٹس چلانے کے لیے ایک پی سی بنانے کا ارادہ کر رہے ہیں، گیمنگ ریگ بنانا بند کریں۔ آپ کو 5.8 گیگا ہرٹز کور i9، ایک مائع کولنگ لوپ کی ضرورت نہیں ہے، یا RGB سے ڈھکا ہوا 8 گیگا بائٹ گرافکس کارڈ۔ لوکل AI انفرنس میں، گیمنگ کی خصوصیات عملی طور پر بیکار ہیں۔ واحد میٹرک جو یہ بتاتا ہے کہ آپ کا ایجنٹ چلتا ہے یا رینگتا ہے وہ VRAM کی صلاحیت ہے اور میموری بس بینڈوتھ۔ ہارڈویئر ٹیسٹ کے اصول: سی پی یو کلاک اور راسٹرائزیشن بینچ مارکس کو بھول جائیں۔

0:24 ہمیں تین نمبروں کی فکر ہے: میموری بس کی چوڑائی، گیگا بائٹس فی سیکنڈ میں بینڈوتھ، اور KV کیشے بلوٹ کے لیے خام VRAM ہیڈ روم۔ اس فیلڈ ٹیسٹ میں، میں بیس گنا میموری بینڈوتھ کی رکاوٹ کی وضاحت کروں گا، ماڈل سائزنگ کے قواعد کا نقشہ بناؤں گا، بارہ سو ڈالر سے پانچ ہزار تک کے تین حقیقی ٹیرز کا بینچ مارک کروں گا، اور یہ سمجھاؤں گا کہ کیوں ایک استعمال شدہ 3090 اب بھی کمپیوٹنگ کا سب سے بڑا چیٹ کوڈ ہے۔ یہ The Daily Diff کا فیلڈ ٹیسٹ ہے۔ یہ سمجھنے کے لیے کہ گیمنگ رِگز کیوں ناکام ہوتی ہیں، یہ دیکھیں کہ ٹوکن جنریشن اصل میں کیسے عمل میں آتی ہے۔ گیمز میں، آپ کا CPU ڈرا کالز فیڈ کرتا ہے اور آپ کا GPU فریمز رینڈر کرتا ہے۔

0:54 لیکن آٹو ریگریسیو LLM ڈی کوڈنگ تقریباً خالصتاً میموری بینڈوتھ سے منسلک ہے۔ ایک واحد ٹوکن بنانے کے لیے، GPU کو ماڈل کے ہر ویٹ پیرامیٹر کو میموری سے اپنے کمپیوٹ کورز کے ذریعے اسٹریم کرنا ہوگا۔ اگر آپ کا ماڈل 10 گیگا بائٹس کا ہے، تو ایک ٹوکن تیار کرنے کا مطلب 10 گیگا بائٹس ڈیٹا پڑھنا ہے۔ 384-بٹ میموری بس والے Nvidia RTX 3090 پر، آپ کو 936 گیگا بائٹس فی سیکنڈ GDDR6X بینڈوتھ ملتی ہے، جس سے 80 ٹوکن فی سیکنڈ پیدا ہوتے ہیں۔ لیکن دیکھیں کیا ہوتا ہے جس سیکنڈ آپ کا ماڈل فزیکل VRAM سے تجاوز کرتا ہے۔

1:22 جب VRAM بھر جاتا ہے، تو رن ٹائم باقی تہوں کو PCIe بس کے ذریعے سسٹم DDR5 میموری میں آف لوڈ کر دیتے ہیں۔ آپ کے GPU کورز ایک ہزار گیگا بائٹس فی سیکنڈ کی توقع رکھتے ہیں۔ اس کے بجائے، ڈوئل چینل DDR5 انہیں 50 فیڈ کرتا ہے، اور PCIe 4 اکتیس پر رک جاتا ہے۔ یہ بیس گنا بینڈوتھ کا انہدام ہے۔ ٹوکن جنریشن پائپ لائن فوری طور پر بس کا انتظار کرتے ہوئے رک جاتی ہے، اور رفتار 40 ٹوکن فی سیکنڈ سے کم ہو کر 1.5 ہو جاتی ہے۔ آپ نے دو ہزار ڈالر کے ریگ کو ایک ہیٹر میں بدل دیا ہے۔

1:47 اور یہ ملٹی ٹرن ایجنٹ رنز کے دوران مزید خراب ہوتا ہے، کیونکہ ویٹس صرف نصف جنگ ہیں۔ ہر پرامپٹ، ٹول کال، اور فائل چنک کی-وی کیشے میں ذخیرہ ہوتا ہے۔ ایک بتیس-کے سیاق و سباق کی ونڈو ویٹس کے اوپر چار سے آٹھ گیگا بائٹس VRAM استعمال کر سکتی ہے۔ اگر آپ کے کارڈ میں صرف سولہ گیگا بائٹس ہیں، تو آپ کا ایجنٹ دو بار لوپ کرتا ہے، سیاق و سباق کی دیوار سے ٹکراتا ہے، اور یا تو آؤٹ آف میموری ایرر کے ساتھ کریش ہو جاتا ہے یا DDR5 میں پھیل جاتا ہے۔ یہ چار بٹ سائزنگ چیٹ شیٹ ہے۔ Llama 3.1 یا DeepSeek Distill جیسے سات یا آٹھ بلین پیرامیٹر ماڈل کو

2:16 تقریباً پانچ گیگا بائٹس لگتے ہیں۔ ایک چودہ بلین ماڈل کو دس گیگا بائٹس لگتے ہیں۔ ایک بتیس بلین ماڈل، کوڈنگ ایجنٹس کے لیے انٹیلی جنس کا بہترین مقام، کو بیس گیگا بائٹس کی ضرورت ہوتی ہے۔ اور ایک ستر بلین فرنٹیئر ماڈل چالیس گیگا بائٹس کا مطالبہ کرتا ہے اس سے پہلے کہ آپ سیاق و سباق کو بھی مختص کریں۔ جو ہمیں حقیقی ہارڈویئر بلڈز کی طرف لاتا ہے۔ ٹیر 1 اسٹارٹر ریگ ہے، بارہ سو سے پندرہ سو ڈالر۔ پی سی پر، آپ کا اینکر ایک RTX 4060 Ti 16-گیگا بائٹ ہے۔

2:39 اہم انتباہ: ستر ڈالر بچانے کے لیے کبھی بھی آٹھ گیگا بائٹ ورژن نہ خریدیں۔ 2026 میں آٹھ گیگا بائٹس VRAM کسی بھی حقیقی ایجنٹ ورک فلو پر فوری آؤٹ آف میموری کی موت ہے۔ اسے چھ کور والے Ryzen 5، چونسٹھ گیگا بائٹس DDR5، اور ایک دو ٹیرا بائٹ NVMe ڈرائیو کے ساتھ جوڑیں۔ ایپل کی دنیا میں، اس کے مساوی ایک Mac Mini یا MacBook Pro ہے جس میں سولہ گیگا بائٹس متحد میموری ہے۔

3:02 آپ آٹھ بلین ماڈلز پر چالیس سے پچاس ٹوکن فی سیکنڈ دیکھیں گے۔ ٹیر 2 پاور یوزر کا بہترین مقام ہے: خاص طور پر بتیس بلین پیرامیٹر ماڈلز جیسے Qwen 2.5 32B چلانے کے لیے بنانا۔ پاتھ A آٹھ سو ڈالر میں سولہ گیگا بائٹس کے ساتھ ایک نیا RTX 4070 Ti سپر ہے۔ لیکن پاتھ B میری مضبوط سفارش ہے: ایک استعمال شدہ Nvidia RTX 3090 چوبیس گیگا بائٹ خریدیں۔ آپ eBay پر چھ سو پچاس سے سات سو پچاس ڈالر میں صاف 3090s تلاش کر سکتے ہیں۔ یہ آپ کو ایک بڑے 384-بٹ بس پر چوبیس گیگا بائٹس VRAM دیتا ہے جو

3:33 936 گیگا بائٹس فی سیکنڈ پش کرتا ہے۔ ڈالر کے بدلے ڈالر، یہ کمپیوٹنگ میں VRAM کا بہترین سودا ہے۔ macOS پر، ٹیر 2 کا ہم منصب ایک Mac Mini M4 Pro ہے جس میں چونسٹھ گیگا بائٹس متحد میموری ہے۔ یہ بتیس بلین ماڈل پر گیارہ سے بارہ ٹوکن فی سیکنڈ پیدا کرتا ہے: Nvidia سے سست، لیکن 30 واٹ پر بالکل خاموش ہے اور ایک بڑی سیاق و سباق کی ونڈو کے لیے جگہ ہے۔ ٹیر 3 ملٹی ایجنٹ سوارمز کے لیے شوقین افراد کی بریکٹ ہے۔ پی سی پر، اس کا مطلب ہے 24 گیگا بائٹس کے ساتھ ایک RTX 4090،

3:57 ایک Ryzen 9، اور 128 گیگا بائٹس RAM، یا ڈوئل RTX 3090s جو 48 گیگا بائٹس کل VRAM فراہم کرتے ہیں۔ ایپل کی لائن اپ میں، یہ ایک Mac Studio Ultra ہے جس میں چھیانوے سے ایک سو اٹھائیس گیگا بائٹس متحد میموری ہے۔ سپر پاور میموری ریزیڈنسی ہے: آپ ایک ایمبیڈنگ ماڈل، ایک تیز راؤٹر، اور ایک 32 بلین کوڈنگ ماڈل کو بغیر کسی سویپ تاخیر کے بیک وقت لوڈ کر سکتے ہیں۔ اب ہمارے فیلڈ ٹیسٹ کی ایماندارانہ ناکامی کے لیے: ایج کمپیوٹنگ ٹریپ۔

4:24 ہر ہفتے ایک سوشل پوسٹ کا دعویٰ ہوتا ہے کہ آپ اسی ڈالر والے Raspberry Pi 5 پر خود مختار کوڈنگ ایجنٹس چلا سکتے ہیں۔ میں نے اسے آزمایا۔ ایک چھوٹے سے 1.5 بلین پیرامیٹر ماڈل کو چلانے سے آپ کو بمشکل تین ٹوکن فی سیکنڈ ملتے ہیں جبکہ بورڈ پچاسی ڈگری سیلسیس پر تھروٹل کرتا ہے۔ یہ ایک اچھا ہفتے کے آخر کا کھلونا ہے، لیکن روزانہ کے ڈویلپمنٹ ڈرائیور کے طور پر، یہ خالص سزا ہے۔ سافٹ ویئر کے لیے، اگر آپ ایک صاف کمانڈ لائن ڈیمن چاہتے ہیں جو براہ راست Cursor، Cline، یا VS Code سے جڑتا ہے تو Ollama استعمال کریں۔

4:47 سافٹ ویئر کے لیے، اگر آپ ایک صاف کمانڈ لائن ڈیمن چاہتے ہیں جو براہ راست Cursor، Cline، یا VS Code سے جڑتا ہے تو Ollama استعمال کریں۔ اگر آپ ماڈل ڈاؤن لوڈز اور GPU لیئر سلائیڈرز کے ساتھ ایک گرافیکل پلے گراؤنڈ چاہتے ہیں، تو LM Studio استعمال کریں۔ اور اپنے فارمیٹ کو اپنی سلیکون سے میچ کریں۔ Apple Silicon پر، ہمیشہ Metal کے لیے آپٹمائزڈ GGUF ماڈلز ڈاؤن لوڈ کریں۔ Windows یا Linux پر Nvidia کے ساتھ، AWQ یا EXL2 ماڈلز ڈاؤن لوڈ کریں، جو 20 سے 30 فیصد تیز انفرنس کے لیے Nvidia Tensor Cores کا استعمال کرتے ہیں۔ تو آپ اسے دیوالیہ ہوئے بغیر کیسے تعینات کرتے ہیں؟

5:11 لوکل ہارڈویئر کو ایک ہوم جم بمقابلہ ایک کمرشل جم کی طرح سمجھیں۔ گھر میں ایک سکواٹ ریک رکھنے کا مطلب ہے کہ آپ ہر روز بغیر سفر، بغیر سبسکرپشن فیس، اور مکمل رازداری کے ساتھ تربیت کرتے ہیں۔ آپ کی لوکل مشین آپ کی روزانہ کی کوڈنگ کے اسی فیصد کو ہینڈل کرتی ہے، یونٹ ٹیسٹنگ، اور نجی دستاویز پروسیسنگ صفر ڈالر فی ٹوکن پر۔ اور جب آپ کو 500 پاؤنڈ ڈیڈ لفٹ کرنے کی ضرورت ہو — جیسے پچاس فائلوں میں ایک بڑے ریپو-وائیڈ آرکیٹیکچرل ری فیکٹر — آپ کمرشل جم کا دورہ کرتے ہیں: Claude 3.5 Sonnet یا OpenAI o3 کے لیے پندرہ منٹ کے لیے کلاؤڈ API کو ادائیگی کریں

5:38 اور آگے بڑھیں۔ یہ ہے بل: ایک استعمال شدہ 3090 کے ساتھ ایک ٹیر 2 بلڈ کی کل لاگت سولہ سو ڈالر ہے۔ اگر آپ API ٹوکنز پر پچاس سے سو ڈالر ماہانہ خرچ کرتے ہیں، تو یہ اٹھارہ ماہ میں خود کو ادا کر دیتا ہے جبکہ آپ کے ملکیتی کوڈ بیس کو تیسری پارٹی کے سرورز سے دور رکھتا ہے۔ آج کے فیلڈ ٹیسٹ کا فیصلہ: SHIP IT۔ VRAM اور میموری بینڈوتھ ہر بار کلاک اسپیڈز کو ہراتے ہیں۔ AI کے لیے پانچ گیگا ہرٹز CPUs خریدنا بند کریں، اور ایک استعمال شدہ 3090 تلاش کریں۔

6:04 تبصروں میں مجھے بتائیں کہ آپ لوکل ماڈلز کے لیے کون سا ہارڈویئر بلڈ چلا رہے ہیں۔ اور اگر آپ اس وضاحت کو پڑھنا چاہتے ہیں، تو daily diff dot dev پر نیوز لیٹر حاصل کریں، لنک نیچے ہے۔ اور آج کے لیے بس اتنا ہی فرق ہے۔ میں Axrisi سے نیکو ہوں۔ ذمہ داری سے ضم کریں۔

## ذرائع

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
