# স্থানীয় AI হাৰ্ডৱেৰ গাইড (2026)

Published: 2026-09-14

স্থানীয় AI এজেণ্ট আৰু অপেন-ৱেইট LLM-ৰ বাবে মেচিন এটা নিৰ্মাণ কৰোঁতে, ডেভেলপাৰসকলে গেমিং PC স্পেচিফিকেচন ক্ৰয় কৰাৰ ভুল কৰে: 5.8 GHz CPU, কাষ্টম লিকুইড কুলিং লুপ, আৰু মাত্ৰ 8GB VRAM থকা দ্ৰুত গেমিং GPU। কিন্তু অটোৰেগ্ৰেছিভ টোকেন জেনেৰেচন মেমৰি-বেণ্ডউইডথ বাউণ্ড হয়, কম্পিউট বাউণ্ড নহয়: এটা টোকেন এমিট কৰিবলৈ, মডেলৰ প্ৰতিটো ৱেইট মেমৰি বাছৰ মাজেৰে ষ্ট্ৰীম হ'ব লাগিব। যেতিয়া আপোনাৰ ৱেইট বা KV কেচ কণ্টেক্সট ভৌতিক VRAM অতিক্ৰম কৰে, ৰানটাইমে PCIe-ৰ ওপৰেৰে ছিষ্টেম DDR5-লৈ স্তৰসমূহ অফলোড কৰে, আৰু আপুনি 20x মেমৰি বেণ্ডউইডথ ক্লিফত আঘাত কৰে: গতি প্ৰতি ছেকেণ্ডত 40 টোকেনৰ পৰা 1.5-লৈ হ্ৰাস পায়। এই ফিল্ড টেষ্টত, নিকোৱে হাৰ্ডৱেৰ মেকানিক্স, 4-বিট কোৱান্টিইজেচন মডেল চাইজিং নিয়ম, $1,200-ৰ পৰা $5,000-লৈ তিনিটা প্ৰকৃত বাজেট স্তৰ, কিয় এটা ব্যৱহৃত RTX 3090 24GB কম্পিউটিং-ত সৰ্বশ্ৰেষ্ঠ VRAM-প্ৰতি-ডলাৰৰ চুক্তি হয়, ৰাছবেৰী পাই এজ ট্ৰেপ, আৰু স্থানীয় বনাম ক্লাউড ইনফাৰেন্সৰ বাবে ঘৰুৱা জিম কৌশল ভাঙি দেখুৱাইছে। ৰায়: SHIP IT.

Canonical: https://thedailydiff.dev/as/video/2026-09-14-local-ai-hardware/

## এই ভিডিঅ’টোত কি আছে

- 20x মেমৰি বেণ্ডউইডথ ক্লিফ: 936 GB/s GDDR6X বনাম 50 GB/s DDR5 &amp; 31.5 GB/s PCIe
- মডেল চাইজিং @ 4-বিট: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- স্তৰ 1 ($1,200–$1,500): RTX 4060 Ti 16GB (কেতিয়াও 8GB নহয়) বা মেক মিনি 16GB
- স্তৰ 2 ($1,500–$2,000): ব্যৱহৃত RTX 3090 24GB ছুইট স্পট বা মেক মিনি M4 প্ৰ' 64GB
- স্তৰ 3 ($3,500+): RTX 4090 24GB / ডুৱেল 3090s বা মেক ষ্টুডিঅ' আল্ট্ৰা

## অনূদিত ট্ৰান্সক্ৰিপ্ট

মূল ইংৰাজী বৰ্ণনাৰ পৰা অনুবাদ কৰা হৈছে। উপলব্ধ অডিঅ’ আৰু কেপচন ইউটিউবে নিয়ন্ত্ৰণ কৰে।

0:00 যদি আপুনি স্থানীয় AI এজেণ্ট চলাবলৈ এটা PC নিৰ্মাণ কৰাৰ পৰিকল্পনা কৰিছে, গেমিং ৰিগ নিৰ্মাণ বন্ধ কৰক। আপোনাক পাঁচ-আঠ গিগাহাৰ্টজ ক’ৰ আই৯, এটা লিকুইড কুলিং লুপৰ প্ৰয়োজন নাই, বা আৰজিবিৰে আবৃত আঠ-গিগাবাইট গ্ৰাফিক্স কাৰ্ডৰ প্ৰয়োজন নাই। স্থানীয় AI ইনফাৰেন্সত, গেমিং স্পেচিফিকেচনসমূহ প্ৰায় অপ্ৰয়োজনীয়। আপোনাৰ এজেণ্ট চলে নে লাহে লাহে চলে সেয়া নিৰ্ধাৰণ কৰা একমাত্ৰ মেট্ৰিক হৈছে VRAM ক্ষমতা আৰু মেমৰি বাছ বেণ্ডউইডথ। হাৰ্ডৱেৰ পৰীক্ষাৰ নিয়ম: CPU ক্লক আৰু ৰাষ্টাৰাইজেশ্বন বেঞ্চমাৰ্ক পাহৰি যাওক।

0:24 আমি তিনিটা সংখ্যাৰ বিষয়ে চিন্তা কৰোঁ: মেমৰি বাছৰ প্ৰস্থ, প্ৰতি ছেকেণ্ডত গিগাবাইটত বেণ্ডউইডথ, আৰু KV কেচ ব্লোটৰ বাবে ৰ' VRAM হেডৰুম। এই ফিল্ড টেষ্টত, মই বিশ-গুণ মেমৰি বেণ্ডউইডথ ক্লিফ ভাঙি দেখুৱাম, মডেল চাইজিং নিয়মসমূহ মেপ কৰিম, বাৰশ ডলাৰৰ পৰা পাঁচ হাজাৰ ডলাৰলৈ তিনিটা প্ৰকৃত স্তৰ বেঞ্চমাৰ্ক কৰিম, আৰু কিয় এটা ব্যৱহৃত 3090 এতিয়াও কম্পিউটিং-ৰ সৰ্বশ্ৰেষ্ঠ ঠগ ক'ড সেয়া ব্যাখ্যা কৰিম। এইয়া হৈছে The Daily Diff, ফিল্ড টেষ্ট। গেমিং ৰিগে কিয় ব্যৰ্থ হয় বুজিবলৈ, টোকেন জেনেৰেচনে প্ৰকৃততে কেনেকৈ কাৰ্য্য কৰে সেয়া চাওক। গেমত, আপোনাৰ CPU-এ ড্ৰ' কল যোগান ধৰে আৰু আপোনাৰ GPU-এ ফ্ৰেম ৰেণ্ডাৰ কৰে।

0:54 কিন্তু অটোৰেগ্ৰেছিভ LLM ডিক'ডিং প্ৰায় সম্পূৰ্ণৰূপে মেমৰি বেণ্ডউইডথ বাউণ্ড। এটা টোকেন উৎপন্ন কৰিবলৈ, GPU-এ মডেলৰ প্ৰতিটো ৱেইট পেৰামিটাৰ মেমৰিৰ পৰা ইয়াৰ কম্পিউট ক'ৰৰ মাজেৰে ষ্ট্ৰীম কৰিব লাগিব। যদি আপোনাৰ মডেল দহ গিগাবাইটৰ হয়, এটা টোকেন উৎপাদন কৰাৰ অৰ্থ হৈছে দহ গিগাবাইট ডাটা পঢ়া। এটা Nvidia RTX 3090-ত এটা 384-বিট মেমৰি বাছৰ সৈতে, আপুনি প্ৰতি ছেকেণ্ডত 936 গিগাবাইট GDDR6X বেণ্ডউইডথ পায়, প্ৰতি ছেকেণ্ডত আশীটা টোকেন উৎপাদন কৰে। কিন্তু আপোনাৰ মডেল ভৌতিক VRAM অতিক্ৰম কৰাৰ লগে লগে কি হয় চাওক।

1:22 যেতিয়া VRAM পূৰ্ণ হয়, ৰানটাইমে PCIe বাছৰ মাজেৰে বাকী থকা স্তৰসমূহ ছিষ্টেম DDR5 মেমৰিলৈ অফলোড কৰে। আপোনাৰ GPU ক'ৰসমূহে প্ৰতি ছেকেণ্ডত এহাজাৰ গিগাবাইট আশা কৰে। তাৰ পৰিৱৰ্তে, ডুৱেল-চেনেল DDR5-এ সিহঁতক পঞ্চাশ যোগান ধৰে, আৰু PCIe 4-এ একত্ৰিশত শ্বাসৰুদ্ধ হয়। এইয়া এক বিশ-গুণ বেণ্ডউইডথ পতন। টোকেন জেনেৰেচন পাইপলাইনে বাছৰ বাবে অপেক্ষা কৰি লগে লগে বন্ধ হৈ পৰে, আৰু গতি প্ৰতি ছেকেণ্ডত চল্লিশ টোকেনৰ পৰা এক পইণ্ট পাঁচলৈ হ্ৰাস পায়। আপুনি দুই হাজাৰ ডলাৰৰ ৰিগ এটা স্পেচ হিটাৰলৈ সলনি কৰিছে।

1:47 আৰু মাল্টি-টাৰ্ন এজেণ্ট ৰানৰ সময়ত ই বেয়া হয়, কাৰণ ৱেইট মাত্ৰ আধা যুদ্ধ। প্ৰতিটো প্ৰম্পট, টুল কল, আৰু ফাইল চাংক কী-ভেল্যু কেচত সংৰক্ষণ কৰা হয়। এটা বত্ৰিশ-কে কণ্টেক্সট উইণ্ডোৱে ৱেইটৰ ওপৰত চাৰিৰ পৰা আঠ গিগাবাইট VRAM ব্যৱহাৰ কৰিব পাৰে। যদি আপোনাৰ কাৰ্ডত মাত্ৰ ষোল্ল গিগাবাইট আছে, আপোনাৰ এজেণ্ট দুবাৰ লুপ কৰে, কণ্টেক্সট ৱালত আঘাত কৰে, আৰু হয় এটা আউট-অফ-মেমৰি ত্ৰুটিৰে ক্ৰেচ হয় বা DDR5-ত সোমায়। এইয়া হৈছে চাৰি-বিট চাইজিং চিট শ্বিট। Llama 3.1 বা DeepSeek Distill-ৰ দৰে সাত বা আঠ-বিলিয়ন পেৰামিটাৰ মডেলে

2:16 প্ৰায় পাঁচ গিগাবাইট লয়। এটা চৈধ্য-বিলিয়ন মডেলে দহ গিগাবাইট লয়। এটা বত্ৰিশ-বিলিয়ন মডেলে, ক'ডিং এজেণ্টৰ বাবে ইন্টেলিজেন্স ছুইট স্পট, বিশ গিগাবাইটৰ প্ৰয়োজন। আৰু এটা সত্তৰ-বিলিয়ন ফ্ৰন্টিয়াৰ মডেলে আপুনি কণ্টেক্সট আৱণ্টন কৰাৰ আগতে চল্লিশ গিগাবাইট দাবী কৰে। যিটোৱে আমাক প্ৰকৃত হাৰ্ডৱেৰ বিল্ডলৈ লৈ আহে। স্তৰ 1 হৈছে ষ্টাৰ্টাৰ ৰিগ, বাৰশৰ পৰা পোন্ধৰশ ডলাৰ। PC-ত, আপোনাৰ এংকৰ হৈছে এটা RTX 4060 Ti 16-গিগাবাইট।

2:39 জৰুৰী সতৰ্কবাণী: কেতিয়াও আঠ-গিগাবাইট সংস্কৰণটো সত্তৰ ডলাৰ বচাবলৈ কিনিব নালাগে। 2026 চনত আঠ গিগাবাইট VRAM যিকোনো প্ৰকৃত এজেণ্ট ৱৰ্কফ্লোত এক তাৎক্ষণিক আউট-অফ-মেমৰি ডেথ চেন্টেন্স। ইয়াক ছয়-ক'ৰ ৰাইজেন 5, চৌষষ্ঠী গিগাবাইট DDR5, আৰু এটা দুই-টেৰাবাইট NVMe ড্ৰাইভৰ সৈতে যোৰ কৰক। এপলৰ ফালে, সমতুল্য হৈছে এটা মেক মিনি বা মেকবুক প্ৰ' ষোল্ল গিগাবাইট ইউনিফাইড মেমৰিৰ সৈতে।

3:02 আপুনি আঠ-বিলিয়ন মডেলত প্ৰতি ছেকেণ্ডত চল্লিশৰ পৰা পঞ্চাশ টোকেন দেখিব। স্তৰ 2 হৈছে পাৱাৰ ইউজাৰ ছুইট স্পট: Qwen 2.5 32B-ৰ দৰে বত্ৰিশ-বিলিয়ন পেৰামিটাৰ মডেল চলাবলৈ বিশেষভাৱে নিৰ্মাণ কৰা। পথ A হৈছে আঠশ ডলাৰত ষোল্ল গিগাবাইটৰ সৈতে এটা নতুন RTX 4070 Ti ছুপাৰ। কিন্তু পথ B হৈছে মোৰ দৃঢ় পৰামৰ্শ: এটা ব্যৱহৃত Nvidia RTX 3090 চব্বিশ গিগাবাইট ক্ৰয় কৰক। আপুনি eBay-ত ছশ পঞ্চাশৰ পৰা সাতশ পঞ্চাশ ডলাৰত পৰিষ্কাৰ 3090s বিচাৰি পাব পাৰে। ই আপোনাক এটা বিশাল 384-বিট বাছত চব্বিশ গিগাবাইট VRAM দিয়ে যি

3:33 প্ৰতি ছেকেণ্ডত 936 গিগাবাইট ঠেলি দিয়ে। ডলাৰৰ বাবে ডলাৰ, ই কম্পিউটিং-ৰ সৰ্বশ্ৰেষ্ঠ VRAM চুক্তি। macOS-ত, স্তৰ 2-ৰ প্ৰতিপক্ষ হৈছে চৌষষ্ঠী গিগাবাইট ইউনিফাইড মেমৰিৰ সৈতে এটা মেক মিনি M4 প্ৰ'। ই এটা বত্ৰিশ-বিলিয়ন মডেলত প্ৰতি ছেকেণ্ডত এঘাৰৰ পৰা বাৰ টোকেন উৎপাদন কৰে: Nvidia-তকৈ লেহেম, কিন্তু ত্ৰিশ ৱাটত সম্পূৰ্ণ শান্ত এক বিশাল কণ্টেক্সট উইণ্ডোৰ বাবে ঠাই থকা। স্তৰ 3 হৈছে মাল্টি-এজেণ্ট স্বাৰ্মৰ বাবে উত্সাহী ব্ৰেকেট। PC-ত, ইয়াৰ অৰ্থ হৈছে চব্বিশ গিগাবাইটৰ সৈতে এটা RTX 4090,

3:57 এটা Ryzen 9, আৰু একশ আঠাইশ গিগাবাইট RAM, বা ডুৱেল RTX 3090s-এ মুঠ আঠচল্লিশ গিগাবাইট VRAM যোগান ধৰে। এপলৰ লাইনআপত, এইয়া হৈছে ছিয়ানব্বৈৰ পৰা একশ আঠাইশ গিগাবাইট ইউনিফাইড মেমৰিৰ সৈতে এটা মেক ষ্টুডিঅ' আল্ট্ৰা। ছুপাৰপাৱাৰ হৈছে মেমৰি ৰেছিডেন্সী: আপুনি এটা এম্বেডিং মডেল, এটা দ্ৰুত ৰাউটাৰ, আৰু এটা 32-বিলিয়ন ক'ডিং মডেল একেলগে লোড কৰি ৰাখিব পাৰে শূন্য চ্ৱাপ দেৰীৰ সৈতে। এতিয়া আমাৰ ফিল্ড টেষ্টৰ সত্ ব্যৰ্থতাৰ বাবে: এজ কম্পিউটিং ট্ৰেপ।

4:24 প্ৰতি সপ্তাহে এটা ছ'চিয়েল প'ষ্টে দাবী কৰে যে আপুনি এটা আঠ ডলাৰৰ ৰাছবেৰী পাই 5-ত স্বায়ত্তশাসিত ক'ডিং এজেণ্ট চলাব পাৰে। মই ইয়াক পৰীক্ষা কৰিলোঁ। এটা সৰু এক পইণ্ট পাঁচ বিলিয়ন পেৰামিটাৰ মডেল চলালে আপুনি প্ৰতি ছেকেণ্ডত প্ৰায় তিনিটা টোকেন পায় যেতিয়া ব'ৰ্ড পঁচাশী ডিগ্ৰী চেলছিয়াছত থ্ৰটল হয়। ই এটা সুন্দৰ সপ্তাহান্তৰ খেলনা, কিন্তু দৈনন্দিন উন্নয়ন ড্ৰাইভাৰ হিচাপে, ই বিশুদ্ধ শাস্তি। ছফ্টৱেৰৰ বাবে, যদি আপুনি এটা পৰিষ্কাৰ কমাণ্ড-লাইন ডেমোন বিচাৰে যি

4:47 চিধা কাৰ্ছৰ, ক্লাইন, বা ভিএছ ক'ডৰ সৈতে সংযোগ হয়, তেন্তে Ollama ব্যৱহাৰ কৰক। যদি আপুনি মডেল ডাউনলোড আৰু GPU লেয়াৰ স্লাইডাৰৰ সৈতে এটা গ্ৰাফিকেল খেলপথাৰ বিচাৰে, LM Studio ব্যৱহাৰ কৰক। আৰু আপোনাৰ ফৰ্মেট আপোনাৰ ছিলিকনৰ সৈতে মিলাওক। এপল ছিলিকনত, সদায় মেটালৰ বাবে অপটিমাইজ কৰা GGUF মডেল ডাউনলোড কৰক। Nvidia-ৰ সৈতে Windows বা Linux-ত, AWQ বা EXL2 মডেল ডাউনলোড কৰক, যি বিশৰ পৰা ত্ৰিশ শতাংশ দ্ৰুত ইনফাৰেন্সৰ বাবে Nvidia টেন্সৰ ক'ৰ ব্যৱহাৰ কৰে। তেন্তে আপুনি কেনেকৈ ইয়াক ভাঙি যোৱা অবিহনে স্থাপন কৰিব?

5:11 স্থানীয় হাৰ্ডৱেৰক এটা ঘৰুৱা জিম বনাম এটা বাণিজ্যিক জিম হিচাপে ভাবক। ঘৰত স্কুৱাট ৰেক এটা থকাৰ অৰ্থ হৈছে আপুনি দৈনিক শূন্য যাত্ৰাৰে, শূন্য সদস্যতা ফী, আৰু সম্পূৰ্ণ গোপনীয়তাৰে প্ৰশিক্ষণ লয়। আপোনাৰ স্থানীয় মেচিনে আপোনাৰ দৈনিক ক'ডিং-ৰ আশী শতাংশ ইউনিট টেষ্টিং, আৰু ব্যক্তিগত নথিপত্ৰ প্ৰচেছিং প্ৰতি টোকেনত শূন্য ডলাৰত চম্ভালে। আৰু যেতিয়া আপুনি পাঁচশ পাউণ্ড ডেডলিফ্ট কৰিবলৈ প্ৰয়োজন হয় — যেনে এটা বিশাল ৰিপ' ৱাইড পঞ্চাশটা ফাইলৰ মাজেৰে স্থাপত্য পুনৰ গঠন — আপুনি বাণিজ্যিক জিমলৈ যায়: ক্লাউড API-ক Claude 3.5 Sonnet বা OpenAI o3-ৰ বাবে পোন্ধৰ মিনিটৰ বাবে পৰিশোধ কৰে

5:38 আৰু আগবাঢ়ে। এইয়া হৈছে বিল: এটা ব্যৱহৃত 3090-ৰ সৈতে এটা স্তৰ 2 বিল্ডৰ মুঠ খৰচ ষোল্লশ ডলাৰ। যদি আপুনি API টোকেনত মাহে পঞ্চাশৰ পৰা এশ ডলাৰ খৰচ কৰে, ই আপোনাৰ মালিকীস্বত্ব থকা ক'ডবেছ তৃতীয় পক্ষৰ ছাৰ্ভাৰৰ পৰা দূৰত ৰাখি আঠাইশ মাহত নিজৰ বাবে পৰিশোধ কৰে। তৃতীয় পক্ষৰ ছাৰ্ভাৰৰ পৰা দূৰত ৰাখি আঠাইশ মাহত নিজৰ বাবে পৰিশোধ কৰে। আজিৰ ফিল্ড টেষ্টৰ ৰায়: SHIP IT। VRAM আৰু মেমৰি বেণ্ডউইডথে প্ৰতিবাৰেই ক্লক স্পীডক পৰাস্ত কৰে। AI-ৰ বাবে পাঁচ-গিগাহাৰ্টজ CPU কিনা বন্ধ কৰক, আৰু এটা ব্যৱহৃত 3090 বিচাৰি উলিয়াওক।

6:04 স্থানীয় মডেলৰ বাবে আপুনি কি হাৰ্ডৱেৰ বিল্ড চলাই আছে মন্তব্যত কওক। আৰু যদি আপুনি এই ব্ৰেকডাউনটো পঢ়িব বিচাৰে, তেন্তে daily diff dot dev-ত নিউজলেটাৰটো লওক, লিংক তলত আছে। আৰু এইয়া আজিৰ বাবে diff। মই Axrisi-ৰ পৰা Niko। দায়িত্বশীলভাৱে মৰ্জ কৰক।

## উৎসসমূহ

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
