# লোকাল এআই হার্ডওয়্যার গাইড (2026)

Published: 2026-09-14

লোকাল এআই এজেন্ট এবং ওপেন-ওয়েট এলএলএম-এর জন্য একটি মেশিন তৈরি করার সময়, ডেভেলপাররা গেমিং পিসির স্পেকস কেনার ভুল করে: 5.8 GHz সিপিইউ, কাস্টম লিকুইড কুলিং লুপ, এবং মাত্র 8GB VRAM সহ দ্রুত গেমিং GPU। কিন্তু অটোরিগ্রেসিভ টোকেন জেনারেশন মেমরি-ব্যান্ডউইথের উপর নির্ভরশীল, কম্পিউট-এর উপর নয়: একটি একক টোকেন নির্গত করতে, মডেলের প্রতিটি ওজন মেমরি বাস জুড়ে প্রবাহিত হতে হয়। যখন আপনার ওজন বা KV ক্যাশে প্রসঙ্গ ফিজিক্যাল VRAM ছাড়িয়ে যায়, তখন রানটাইম PCIe-এর মাধ্যমে সিস্টেম DDR5-এ স্তরগুলি অফলোড করে, এবং আপনি 20 গুণ মেমরি ব্যান্ডউইথের পতন দেখেন: গতি সেকেন্ডে 40 টোকেন থেকে কমে 1.5 হয়ে যায়। এই ফিল্ড টেস্টে, নিকো হার্ডওয়্যারের মেকানিক্স, 4-বিট কোয়ান্টিজেশন মডেল সাইজিং নিয়ম, $1,200 থেকে $5,000 পর্যন্ত তিনটি বাস্তব বাজেট স্তর, কেন একটি ব্যবহৃত RTX 3090 24GB কম্পিউটিংয়ে সেরা VRAM-প্রতি-ডলার চুক্তি, Raspberry Pi এজ ট্র্যাপ, এবং লোকাল বনাম ক্লাউড ইনফারেন্সের জন্য হোম জিম কৌশলটি ভেঙে দেখিয়েছেন। রায়: SHIP IT।

Canonical: https://thedailydiff.dev/bn/video/2026-09-14-local-ai-hardware/

## এই ভিডিওতে যা আছে

- 20x মেমরি ব্যান্ডউইথ পতন: 936 GB/s GDDR6X বনাম 50 GB/s DDR5 এবং 31.5 GB/s PCIe
- মডেল সাইজিং @ 4-বিট: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- স্তর 1 ($1,200–$1,500): RTX 4060 Ti 16GB (কখনোই 8GB নয়) অথবা Mac Mini 16GB
- স্তর 2 ($1,500–$2,000): ব্যবহৃত RTX 3090 24GB মিষ্টি জায়গা অথবা Mac Mini M4 Pro 64GB
- স্তর 3 ($3,500+): RTX 4090 24GB / ডুয়াল 3090s অথবা Mac Studio Ultra

## অনুবাদিত প্রতিলিপি

মূল ইংরেজি বর্ণনা থেকে অনূদিত। উপলব্ধ অডিও এবং ক্যাপশন YouTube দ্বারা নিয়ন্ত্রিত।

0:00 আপনি যদি লোকাল এআই এজেন্ট চালানোর জন্য একটি পিসি তৈরি করার পরিকল্পনা করেন, গেমিং রিং তৈরি করা বন্ধ করুন। আপনার পাঁচ-পয়েন্ট-আট গিগাহার্টজ কোর আই9, একটি লিকুইড কুলিং লুপের প্রয়োজন নেই, অথবা RGB দিয়ে আবৃত একটি আট-গিগাবাইট গ্রাফিক্স কার্ড। লোকাল এআই ইনফারেন্সে, গেমিং স্পেকস কার্যত অকেজো। একমাত্র মেট্রিক যা আপনার এজেন্ট চলে বা ধীরে চলে তা নির্ধারণ করে তা হল VRAM ক্ষমতা এবং মেমরি বাস ব্যান্ডউইথ। হার্ডওয়্যার পরীক্ষার নিয়ম: সিপিইউ ক্লক এবং রাস্টারাইজেশন বেঞ্চমার্ক ভুলে যান।

0:24 আমরা তিনটি সংখ্যা নিয়ে চিন্তা করি: মেমরি বাস প্রস্থ, প্রতি সেকেন্ডে গিগাবাইটে ব্যান্ডউইথ, এবং KV ক্যাশে ব্লট করার জন্য কাঁচা VRAM হেডরুম। এই ফিল্ড টেস্টে, আমি বিশ-গুণ মেমরি ব্যান্ডউইথ পতন ভেঙে দেখাব, মডেল সাইজিং নিয়মগুলি ম্যাপ করব, বারোশ ডলার থেকে পাঁচ হাজার পর্যন্ত তিনটি বাস্তব স্তরকে বেঞ্চমার্ক করব, এবং ব্যাখ্যা করব কেন একটি ব্যবহৃত 3090 এখনও কম্পিউটিংয়ের সবচেয়ে বড় ঠকানোর কোড। এটি The Daily Diff, ফিল্ড টেস্ট। কেন গেমিং রিগগুলি ব্যর্থ হয় তা বোঝার জন্য, দেখুন কিভাবে টোকেন জেনারেশন আসলে নির্বাচিত হয়। গেমগুলিতে, আপনার সিপিইউ ড্র কলগুলি সরবরাহ করে এবং আপনার GPU ফ্রেমগুলি রেন্ডার করে।

0:54 কিন্তু অটোরিগ্রেসিভ এলএলএম ডিকোডিং প্রায় বিশুদ্ধভাবে মেমরি ব্যান্ডউইথের উপর নির্ভরশীল। একটি একক টোকেন তৈরি করতে, GPU কে মডেলের প্রতিটি ওজন প্যারামিটার মেমরি থেকে তার কম্পিউট কোরগুলির মাধ্যমে স্ট্রিম করতে হয়। যদি আপনার মডেল দশ গিগাবাইট হয়, তবে একটি টোকেন তৈরি করার অর্থ দশ গিগাবাইট ডেটা পড়া। 384-বিট মেমরি বাস সহ একটি Nvidia RTX 3090-এ, আপনি প্রতি সেকেন্ডে 936 গিগাবাইট GDDR6X ব্যান্ডউইথ পান, প্রতি সেকেন্ডে আশিটি টোকেন তৈরি করে। কিন্তু আপনার মডেল ফিজিক্যাল VRAM ছাড়িয়ে গেলে কী ঘটে তা দেখুন।

1:22 যখন VRAM ভরে যায়, রানটাইমগুলি PCIe বাসের মাধ্যমে অবশিষ্ট স্তরগুলিকে সিস্টেম DDR5 মেমরিতে অফলোড করে। সিস্টেম DDR5 মেমরি। আপনার GPU কোরগুলি প্রতি সেকেন্ডে এক হাজার গিগাবাইট আশা করে। পরিবর্তে, ডুয়াল-চ্যানেল DDR5 তাদের পঞ্চাশ সরবরাহ করে, এবং PCIe 4 একত্রিশে আটকে যায়। এটি একটি বিশ-গুণ ব্যান্ডউইথ পতন। টোকেন জেনারেশন পাইপলাইন অবিলম্বে বাসের জন্য অপেক্ষা করে আটকে যায়, এবং গতি প্রতি সেকেন্ডে চল্লিশ টোকেন থেকে কমে এক পয়েন্ট পাঁচে নেমে আসে। আপনি একটি দুই হাজার ডলারের রিগকে একটি স্পেস হিটারে পরিণত করেছেন।

1:47 এবং মাল্টি-টার্ন এজেন্ট রান চলাকালীন এটি আরও খারাপ হয়, কারণ ওজনগুলি কেবল অর্ধেক যুদ্ধ। প্রতিটি প্রম্পট, টুল কল, এবং ফাইল চাঙ্ক Key-Value ক্যাশে সংরক্ষিত হয়। একটি বত্রিশ-কে প্রসঙ্গ উইন্ডো ওজনের উপরে চার থেকে আট গিগাবাইট VRAM ব্যবহার করতে পারে। যদি আপনার কার্ডে মাত্র ষোল গিগাবাইট থাকে, আপনার এজেন্ট দুবার লুপ করে, প্রসঙ্গ দেওয়ালে আঘাত করে, এবং হয় মেমরি-আউট ত্রুটি দিয়ে ক্র্যাশ করে অথবা DDR5-এ ছড়িয়ে পড়ে। এখানে চার-বিট সাইজিং চিট শিট। Llama 3.1 বা DeepSeek Distill-এর মতো সাত বা আট বিলিয়ন প্যারামিটার মডেল

2:16 প্রায় পাঁচ গিগাবাইট নেয়। একটি চৌদ্দ-বিলিয়ন মডেল দশ গিগাবাইট নেয়। একটি বত্রিশ-বিলিয়ন মডেল, কোডিং এজেন্টদের জন্য বুদ্ধিমত্তার মিষ্টি জায়গা, বিশ গিগাবাইট প্রয়োজন। এবং একটি সত্তর-বিলিয়ন ফ্রন্টিয়ার মডেল আপনাকে প্রসঙ্গ বরাদ্দ করার আগেও চল্লিশ গিগাবাইট দাবি করে। যা আমাদের প্রকৃত হার্ডওয়্যার বিল্ডগুলিতে নিয়ে আসে। স্তর 1 হল স্টার্টার রিগ, বারোশ থেকে পনেরশ ডলার। পিসিতে, আপনার অ্যাঙ্কর হল একটি RTX 4060 Ti 16-গিগাবাইট।

2:39 গুরুত্বপূর্ণ সতর্কতা: সত্তর ডলার বাঁচাতে আট-গিগাবাইট সংস্করণটি কখনোই কিনবেন না। 2026 সালে আট গিগাবাইট VRAM যেকোনো বাস্তব এজেন্ট ওয়ার্কফ্লোতে তাৎক্ষণিক মেমরি-আউট মৃত্যুর রায়। এটি একটি ছয়-কোর Ryzen 5, চৌষট্টি গিগাবাইট DDR5, এবং একটি দুই-টেরাবাইট NVMe ড্রাইভের সাথে যুক্ত করুন। অ্যাপল ল্যান্ডে, সমতুল্য হল একটি Mac Mini বা MacBook Pro যার ষোল গিগাবাইট ইউনিফাইড মেমরি।

3:02 আপনি আট-বিলিয়ন মডেলে প্রতি সেকেন্ডে চল্লিশ থেকে পঞ্চাশ টোকেন দেখতে পাবেন। স্তর 2 হল পাওয়ার ইউজারের মিষ্টি জায়গা: বিশেষভাবে বত্রিশ-বিলিয়ন প্যারামিটার মডেল যেমন Qwen 2.5 32B চালানোর জন্য তৈরি করা হয়েছে। বত্রিশ-বিলিয়ন প্যারামিটার মডেল যেমন Qwen 2.5 32B চালানোর জন্য তৈরি করা হয়েছে। পথ A হল একটি নতুন RTX 4070 Ti Super যার ষোল গিগাবাইট আটশ ডলারের জন্য। কিন্তু পথ B হল আমার দৃঢ় সুপারিশ: একটি ব্যবহৃত Nvidia RTX 3090 চব্বিশ গিগাবাইট কিনুন। আপনি eBay-তে ছয়শ পঞ্চাশ থেকে সাতশ পঞ্চাশ ডলারে পরিষ্কার 3090s খুঁজে পেতে পারেন। থেকে সাতশ পঞ্চাশ ডলার। এটি আপনাকে একটি বিশাল 384-বিট বাসে চব্বিশ গিগাবাইট VRAM দেয় যা প্রতি সেকেন্ডে

3:33 936 গিগাবাইট ঠেলে। ডলারের জন্য ডলার, এটি কম্পিউটিংয়ে সেরা VRAM চুক্তি। macOS-এ, স্তর 2-এর প্রতিপক্ষ হল একটি Mac Mini M4 Pro যার চৌষট্টি গিগাবাইট ইউনিফাইড মেমরি। এটি একটি বত্রিশ-বিলিয়ন মডেলে প্রতি সেকেন্ডে এগারো থেকে বারো টোকেন তৈরি করে: Nvidia-এর চেয়ে ধীর, কিন্তু ত্রিশ ওয়াটে একেবারে নীরব এবং একটি বিশাল প্রসঙ্গ উইন্ডোর জন্য জায়গা আছে। স্তর 3 হল মাল্টি-এজেন্ট সোয়ার্মের জন্য উত্সাহী ব্র্যাকেট। পিসিতে, এর মানে হল একটি RTX 4090 যার চব্বিশ গিগাবাইট,

3:57 একটি Ryzen 9, এবং একশ আঠাশ গিগাবাইট RAM, অথবা মোট আটচল্লিশ গিগাবাইট VRAM প্রদানকারী ডুয়াল RTX 3090s। অ্যাপলের লাইনআপে, এটি একটি Mac Studio Ultra যার ছিয়ানব্বই থেকে একশ আঠাশ গিগাবাইট ইউনিফাইড মেমরি। সুপারপাওয়ার হল মেমরি রেসিডেন্সি: আপনি একটি এম্বেডিং মডেল, একটি দ্রুত রাউটার, এবং একটি 32-বিলিয়ন কোডিং মডেল একই সাথে জিরো সোয়াপ ডিলে লোড করে রাখতে পারেন। এখন আমাদের ফিল্ড টেস্টের সৎ ব্যর্থতার জন্য: এজ কম্পিউটিং ট্র্যাপ।

4:24 প্রতি সপ্তাহে একটি সামাজিক পোস্ট দাবি করে যে আপনি একটি আশি ডলারের Raspberry Pi 5-এ স্বায়ত্তশাসিত কোডিং এজেন্ট চালাতে পারবেন। আমি এটি পরীক্ষা করেছি। একটি ছোট এক-পয়েন্ট-পাঁচ বিলিয়ন প্যারামিটার মডেল চালালে আপনি সবেমাত্র প্রতি সেকেন্ডে তিনটি টোকেন পান যখন বোর্ড পঁচাশি ডিগ্রি সেলসিয়াস তাপমাত্রায় আটকে যায়। এটি একটি চমৎকার উইকেন্ডের খেলনা, কিন্তু একটি দৈনিক ডেভেলপমেন্ট ড্রাইভার হিসাবে, এটি নিছক শাস্তি। সফ্টওয়্যারের জন্য, আপনি যদি একটি পরিষ্কার কমান্ড-লাইন ডেমোন চান যা সরাসরি Cursor, Cline, বা VS Code এর সাথে সংযোগ করে,

4:47 Ollama ব্যবহার করুন। আপনি যদি মডেল ডাউনলোড এবং GPU লেয়ার স্লাইডার সহ একটি গ্রাফিকাল খেলার মাঠ চান, LM Studio ব্যবহার করুন। এবং আপনার ফরম্যাট আপনার সিলিকনের সাথে মিলিয়ে নিন। অ্যাপল সিলিকনে, সর্বদা Metal-এর জন্য অপ্টিমাইজ করা GGUF মডেল ডাউনলোড করুন। Nvidia সহ Windows বা Linux-এ, AWQ বা EXL2 মডেল ডাউনলোড করুন, যা Nvidia Tensor Cores ব্যবহার করে বিশ থেকে ত্রিশ শতাংশ দ্রুত ইনফারেন্সের জন্য। তাহলে আপনি কিভাবে এটি দেউলিয়া না হয়ে স্থাপন করবেন?

5:11 লোকাল হার্ডওয়্যারকে একটি হোম জিমের বনাম একটি বাণিজ্যিক জিম হিসাবে ভাবুন। বাড়িতে একটি স্কোয়াট র্যাক থাকার অর্থ হল আপনি প্রতিদিন শূন্য যাতায়াত, শূন্য সাবস্ক্রিপশন ফি, এবং সম্পূর্ণ গোপনীয়তা সহ প্রশিক্ষণ নেন। আপনার লোকাল মেশিন আপনার দৈনিক কোডিংয়ের আশি শতাংশ পরিচালনা করে, ইউনিট টেস্টিং, এবং প্রতি টোকেনের জন্য শূন্য ডলারে ব্যক্তিগত নথি প্রক্রিয়াকরণ। এবং যখন আপনার পাঁচশ পাউন্ড ডেডলিফট করার প্রয়োজন হয় — যেমন পঞ্চাশটি ফাইল জুড়ে একটি বিশাল রেপো-ব্যাপী আর্কিটেকচারাল রিফ্যাক্টর — আপনি বাণিজ্যিক জিমে যান: Claude 3.5 Sonnet বা OpenAI o3-এর জন্য ক্লাউড API-কে পনের মিনিটের জন্য অর্থ প্রদান করুন

5:38 এবং এগিয়ে যান। এখানে বিল: একটি ব্যবহৃত 3090 সহ একটি স্তর 2 বিল্ডের মোট খরচ ষোলশ ডলার। আপনি যদি প্রতি মাসে পঞ্চাশ থেকে একশ ডলার API টোকেনগুলিতে ব্যয় করেন, এটি আঠারো মাসের মধ্যে নিজের খরচ তুলে নেয় যখন আপনার মালিকানাধীন কোডবেস তৃতীয় পক্ষের সার্ভার থেকে দূরে রাখে। আজকের ফিল্ড টেস্টের রায়: SHIP IT। VRAM এবং মেমরি ব্যান্ডউইথ প্রতিবার ক্লক স্পিডকে ছাড়িয়ে যায়। এআই-এর জন্য পাঁচ-গিগাহার্টজ সিপিইউ কেনা বন্ধ করুন, এবং একটি ব্যবহৃত 3090 খুঁজুন।

6:04 আপনি লোকাল মডেলের জন্য কোন হার্ডওয়্যার বিল্ড চালাচ্ছেন তা কমেন্টে বলুন। এবং আপনি যদি এই বিশ্লেষণটি পড়তে চান, তাহলে daily diff ডট দেব-এ নিউজলেটারটি নিন, লিঙ্ক নিচে। এবং এটিই আজকের জন্য diff। আমি Axrisi থেকে নিকো। দায়িত্বশীলভাবে মার্জ করুন।

## উৎস

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
