# ସ୍ଥାନୀୟ AI ହାର୍ଡୱେର ଗାଇଡ୍ (2026)

Published: 2026-09-14

ସ୍ଥାନୀୟ AI ଏଜେଣ୍ଟ ଏବଂ ଓପନ୍-ୱେଟ୍ LLM ପାଇଁ ଏକ ମେସିନ୍ ନିର୍ମାଣ କରିବା ସମୟରେ, ଡେଭଲପର୍‌ମାନେ ଗେମିଂ PC ସ୍ପେକ୍ସ କିଣିବା ଭୁଲ୍ କରିଥା’ନ୍ତି: 5.8 GHz CPU, କଷ୍ଟମ୍ ଲିକ୍ୱିଡ୍ କୁଲିଂ ଲୁପ୍, ଏବଂ ମାତ୍ର 8GB VRAM ସହିତ ଫାଷ୍ଟ ଗେମିଂ GPU। କିନ୍ତୁ ଅଟୋରେଗ୍ରେସିଭ୍ ଟୋକେନ୍ ଜେନେରେସନ୍ ମେମୋରୀ-ବ୍ୟାଣ୍ଡୱିଡ୍ଥ-ବାଉଣ୍ଡ, କମ୍ପ୍ୟୁଟ୍-ବାଉଣ୍ଡ ନୁହେଁ: ଗୋଟିଏ ଟୋକେନ୍ ଉତ୍ପନ୍ନ କରିବାକୁ, ମଡେଲରେ ଥିବା ପ୍ରତ୍ୟେକ ଓଜନ ମେମୋରୀ ବସ୍ ମାଧ୍ୟମରେ ଷ୍ଟ୍ରିମ୍ ହେବା ଆବଶ୍ୟକ। ଯେତେବେଳେ ଆପଣଙ୍କ ଓଜନ କିମ୍ବା KV କ୍ୟାଚ୍ ପ୍ରସଙ୍ଗ ଭୌତିକ VRAM କୁ ଅତିକ୍ରମ କରେ, ରନ୍‌ଟାଇମ୍ PCIe ଉପରେ ସିଷ୍ଟମ୍ DDR5 କୁ ଲେୟର ଅଫଲୋଡ୍ କରେ, ଏବଂ ଆପଣ ଏକ 20x ମେମୋରୀ ବ୍ୟାଣ୍ଡୱିଡ୍ଥ କ୍ଲିଫ୍ ରେ ପହଞ୍ଚନ୍ତି: ଗତି ପ୍ରତି ସେକେଣ୍ଡରେ 40 ଟୋକେନ୍ ରୁ 1.5 କୁ ଖସିଯାଏ। ଏହି ଫିଲ୍ଡ ଟେଷ୍ଟରେ, ନିକୋ ହାର୍ଡୱେର ମେକାନିକ୍ସ, 4-ବିଟ୍ କ୍ୱାଣ୍ଟାଇଜେସନ୍ ମଡେଲ୍ ସାଇଜିଂ ନିୟମ, $1,200 ରୁ $5,000 ପର୍ଯ୍ୟନ୍ତ ତିନୋଟି ବାସ୍ତବ ବଜେଟ୍ ଟାୟର୍, କାହିଁକି ଏକ ବ୍ୟବହୃତ RTX 3090 24GB କମ୍ପ୍ୟୁଟିଂରେ ସର୍ବୋତ୍ତମ VRAM-ପ୍ରତି-ଡଲାର୍ ଡିଲ୍, Raspberry Pi ଏଜ୍ ଟ୍ରାପ୍, ଏବଂ ସ୍ଥାନୀୟ ବନାମ କ୍ଲାଉଡ୍ ଇନଫରେନ୍ସ ପାଇଁ ହୋମ୍ ଜିମ୍ ରଣନୀତି ବିଷୟରେ ବର୍ଣ୍ଣନା କରନ୍ତି। ରାୟ: SHIP IT।

Canonical: https://thedailydiff.dev/or/video/2026-09-14-local-ai-hardware/

## ଏହି ଭିଡିଓରେ କ'ଣ ଅଛି

- 20x ମେମୋରୀ ବ୍ୟାଣ୍ଡୱିଡ୍ଥ କ୍ଲିଫ୍: 936 GB/s GDDR6X ବନାମ 50 GB/s DDR5 ଏବଂ 31.5 GB/s PCIe
- ମଡେଲ ସାଇଜିଂ @ 4-ବିଟ୍: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- ଟାୟର୍ 1 ($1,200–$1,500): RTX 4060 Ti 16GB (କେବେବି 8GB ନୁହେଁ) କିମ୍ବା Mac Mini 16GB
- ଟାୟର୍ 2 ($1,500–$2,000): ବ୍ୟବହୃତ RTX 3090 24GB ସୁଇଟ୍ ସ୍ପଟ୍ କିମ୍ବା Mac Mini M4 Pro 64GB
- ଟାୟର୍ 3 ($3,500+): RTX 4090 24GB / ଡୁଆଲ୍ 3090 କିମ୍ବା Mac Studio Ultra

## ଅନୁବାଦିତ ଟ୍ରାନ୍ସକ୍ରିପ୍ଟ

ମୂଳ ଇଂରାଜୀ ବର୍ଣ୍ଣନାରୁ ଅନୁବାଦିତ। ଉପଲବ୍ଧ ଅଡିଓ ଏବଂ କ୍ୟାପ୍ସନ୍ଗୁଡ଼ିକ YouTube ଦ୍ୱାରା ନିୟନ୍ତ୍ରିତ।

0:00 ଯଦି ଆପଣ ସ୍ଥାନୀୟ AI ଏଜେଣ୍ଟ ଚଳାଇବା ପାଇଁ ଏକ PC ନିର୍ମାଣ କରିବାକୁ ଯୋଜନା କରୁଛନ୍ତି, ଏକ ଗେମିଂ ରିଗ୍ ନିର୍ମାଣ ବନ୍ଦ କରନ୍ତୁ। ଆପଣଙ୍କୁ ପାଞ୍ଚ-ପଏଣ୍ଟ-ଆଠ ଗିଗାହର୍ଜ କୋର i9, ଏକ ଲିକ୍ୱିଡ୍ କୁଲିଂ ଲୁପ୍, କିମ୍ବା RGB ରେ ଢାଙ୍କି ହୋଇଥିବା ଆଠ-ଗିଗାବାଇଟ୍ ଗ୍ରାଫିକ୍ସ କାର୍ଡ ଆବଶ୍ୟକ ନାହିଁ। ସ୍ଥାନୀୟ AI ଇନଫରେନ୍ସରେ, ଗେମିଂ ସ୍ପେକ୍ସ ପ୍ରାୟତଃ ଅଦରକାରୀ। ଏଜେଣ୍ଟ ଚାଲୁଛି କି ଧୀରେ ଚାଲୁଛି ତାହା ନିର୍ଦ୍ଧାରଣ କରୁଥିବା ଏକମାତ୍ର ମେଟ୍ରିକ୍ ହେଉଛି VRAM କ୍ଷମତା ଏବଂ ମେମୋରୀ ବସ୍ ବ୍ୟାଣ୍ଡୱିଡ୍ଥ। ହାର୍ଡୱେର ପରୀକ୍ଷଣର ନିୟମ: CPU କ୍ଲକ୍ ଏବଂ ରାଷ୍ଟରାଇଜେସନ୍ ବେଞ୍ଚମାର୍କ ଭୁଲିଯାଆନ୍ତୁ।

0:24 ଆମେ ତିନୋଟି ସଂଖ୍ୟା ବିଷୟରେ ଚିନ୍ତା କରୁ: ମେମୋରୀ ବସ୍ ପ୍ରସ୍ଥ, ପ୍ରତି ସେକେଣ୍ଡରେ ଗିଗାବାଇଟ୍ ରେ ବ୍ୟାଣ୍ଡୱିଡ୍ଥ, ଏବଂ KV କ୍ୟାଚ୍ ଫୁଲିବା ପାଇଁ ଅବ୍ୟବହୃତ VRAM। ଏହି ଫିଲ୍ଡ ଟେଷ୍ଟରେ, ମୁଁ କୋଡିଏ-x ମେମୋରୀ ବ୍ୟାଣ୍ଡୱିଡ୍ଥ କ୍ଲିଫ୍ ବିଷୟରେ ବର୍ଣ୍ଣନା କରିବି, ମଡେଲ ସାଇଜିଂ ନିୟମଗୁଡ଼ିକୁ ମ୍ୟାପ୍ କରିବି, ବାର ଶହ ଡଲାରରୁ ପାଞ୍ଚ ହଜାର ପର୍ଯ୍ୟନ୍ତ ତିନୋଟି ବାସ୍ତବ ଟାୟର୍ କୁ ବେଞ୍ଚମାର୍କ କରିବି, ଏବଂ କାହିଁକି ଏକ ବ୍ୟବହୃତ 3090 ଏବେ ବି କମ୍ପ୍ୟୁଟିଂର ସର୍ବଶ୍ରେଷ୍ଠ ଚିଟ୍ କୋଡ୍ ତାହା ବୁଝାଇବି। ଏହା ହେଉଛି The Daily Diff, ଫିଲ୍ଡ ଟେଷ୍ଟ। ଗେମିଂ ରିଗ୍ କାହିଁକି ବିଫଳ ହୁଏ ତାହା ବୁଝିବା ପାଇଁ, ଟୋକେନ୍ ଜେନେରେସନ୍ ପ୍ରକୃତରେ କିପରି କାର୍ଯ୍ୟକାରୀ ହୁଏ ତାହା ଦେଖନ୍ତୁ। ଖେଳରେ, ଆପଣଙ୍କ CPU ଡ୍ର ଅଲ୍ କୁ ଫିଡ୍ କରେ ଏବଂ ଆପଣଙ୍କ GPU ଫ୍ରେମ୍ ରେଣ୍ଡର କରେ।

0:54 କିନ୍ତୁ ଅଟୋରେଗ୍ରେସିଭ୍ LLM ଡିକୋଡିଂ ପ୍ରାୟତଃ ସମ୍ପୂର୍ଣ୍ଣ ରୂପେ ମେମୋରୀ ବ୍ୟାଣ୍ଡୱିଡ୍ଥ ବାଉଣ୍ଡ ଅଟେ। ଗୋଟିଏ ଟୋକେନ୍ ଉତ୍ପନ୍ନ କରିବାକୁ, GPU କୁ ମଡେଲର ପ୍ରତ୍ୟେକ ଓଜନ ପାରାମିଟରକୁ ମେମୋରୀରୁ ତାହାର କମ୍ପ୍ୟୁଟ୍ କୋର ମାଧ୍ୟମରେ ଷ୍ଟ୍ରିମ୍ କରିବାକୁ ପଡ଼ିବ। ଯଦି ଆପଣଙ୍କ ମଡେଲ୍ ଦଶ ଗିଗାବାଇଟ୍ ଅଟେ, ଗୋଟିଏ ଟୋକେନ୍ ଉତ୍ପନ୍ନ କରିବା ଅର୍ଥ ଦଶ ଗିଗାବାଇଟ୍ ଡାଟା ପଢିବା। 384-ବିଟ୍ ମେମୋରୀ ବସ୍ ସହିତ ଏକ Nvidia RTX 3090 ରେ, ଆପଣ ପ୍ରତି ସେକେଣ୍ଡରେ 936 ଗିଗାବାଇଟ୍ GDDR6X ବ୍ୟାଣ୍ଡୱିଡ୍ଥ ପାଆନ୍ତି, ପ୍ରତି ସେକେଣ୍ଡରେ ଅଶୀ ଟୋକେନ୍ ଉତ୍ପନ୍ନ କରି। କିନ୍ତୁ ଆପଣଙ୍କ ମଡେଲ୍ ଭୌତିକ VRAM କୁ ଅତିକ୍ରମ କରୁଥିବା ମିଲିସେକେଣ୍ଡରେ କ’ଣ ହୁଏ ଦେଖନ୍ତୁ।

1:22 ଯେତେବେଳେ VRAM ଭରିଯାଏ, ରନ୍‌ଟାଇମ୍ PCIe ବସ୍ ମାଧ୍ୟମରେ ସିଷ୍ଟମ୍ DDR5 ମେମୋରୀକୁ ଅବଶିଷ୍ଟ ଲେୟର ଅଫଲୋଡ୍ କରେ। ଆପଣଙ୍କ GPU କୋର ପ୍ରତି ସେକେଣ୍ଡରେ ଏକ ହଜାର ଗିଗାବାଇଟ୍ ଆଶା କରନ୍ତି। ଏହା ବଦଳରେ, ଡୁଆଲ୍-ଚ୍ୟାନେଲ୍ DDR5 ସେମାନଙ୍କୁ ପଚାଶ ଯୋଗାଏ, ଏବଂ PCIe 4 ଏକତିରିଶିରେ ଚୋକ୍ ହୁଏ। ତାହା ଏକ କୋଡିଏ-x ବ୍ୟାଣ୍ଡୱିଡ୍ଥ ବିପର୍ଯ୍ୟୟ। ଟୋକେନ୍ ଜେନେରେସନ୍ ପାଇପଲାଇନ୍ ତୁରନ୍ତ ବସ୍ ଉପରେ ଅପେକ୍ଷା କରିବାକୁ ଅଟକିଯାଏ, ଏବଂ ଗତି ପ୍ରତି ସେକେଣ୍ଡରେ ଚାଳିଶ ଟୋକେନ୍ ରୁ ଏକ ପଏଣ୍ଟ ପାଞ୍ଚକୁ ଖସିଯାଏ। ଆପଣ ଦୁଇ ହଜାର ଡଲାରର ରିଗ୍ କୁ ଏକ ସ୍ପେସ୍ ହିଟରରେ ପରିଣତ କରିଛନ୍ତି।

1:47 ଏବଂ ମଲ୍ଟି-ଟର୍ଣ୍ଣ ଏଜେଣ୍ଟ ରନ୍ ସମୟରେ ଏହା ଆହୁରି ଖରାପ ହୁଏ, କାରଣ ଓଜନ କେବଳ ଅଧା ଯୁଦ୍ଧ ଅଟେ। ପ୍ରତ୍ୟେକ ପ୍ରମ୍ପ୍ଟ, ଟୁଲ୍ କଲ୍, ଏବଂ ଫାଇଲ୍ ଚଙ୍କ୍ କି-ଭାଲ୍ୟୁ କ୍ୟାଚରେ ସଂରକ୍ଷିତ ହୁଏ। ଏକ ବତିଶି-k ପ୍ରସଙ୍ଗ ୱିଣ୍ଡୋ ଓଜନ ଉପରେ ଚାରିରୁ ଆଠ ଗିଗାବାଇଟ୍ VRAM ବ୍ୟବହାର କରିପାରିବ। ଯଦି ଆପଣଙ୍କ କାର୍ଡରେ ମାତ୍ର ଷୋହଳ ଗିଗାବାଇଟ୍ ଅଛି, ଆପଣଙ୍କ ଏଜେଣ୍ଟ ଦୁଇଥର ଲୁପ୍ କରେ, ପ୍ରସଙ୍ଗ କାନ୍ଥରେ ବାଜେ, ଏବଂ ମେମୋରୀ ଆଉଟ୍-ଅଫ୍-ମେମୋରୀ ତ୍ରୁଟି ସହିତ କ୍ରାସ୍ କରେ କିମ୍ବା DDR5 ରେ ଖସିଯାଏ। ଏଠାରେ ଚାରି-ବିଟ୍ ସାଇଜିଂ ଚିଟ୍ ସିଟ୍ ଅଛି। Llama 3.1 କିମ୍ବା DeepSeek Distill ପରି ସାତ କିମ୍ବା ଆଠ-ବିଲିୟନ ପାରାମିଟର ମଡେଲ

2:16 ପ୍ରାୟ ପାଞ୍ଚ ଗିଗାବାଇଟ୍ ନେଇଥାଏ। ଏକ ଚଉଦ-ବିଲିୟନ ମଡେଲ୍ ଦଶ ଗିଗାବାଇଟ୍ ନେଇଥାଏ। ଏକ ବତିଶି-ବିଲିୟନ ମଡେଲ୍, କୋଡିଂ ଏଜେଣ୍ଟମାନଙ୍କ ପାଇଁ ଇଣ୍ଟେଲିଜେନ୍ସ ସୁଇଟ୍ ସ୍ପଟ୍, କୋଡିଏ ଗିଗାବାଇଟ୍ ଆବଶ୍ୟକ କରେ। ଏବଂ ଏକ ସତୁରି-ବିଲିୟନ ଫ୍ରଣ୍ଟିୟର୍ ମଡେଲ୍ ଚାଳିଶ ଗିଗାବାଇଟ୍ ଆବଶ୍ୟକ କରେ ଆପଣ ପ୍ରସଙ୍ଗ ଆଲୋକେଟ୍ କରିବା ପୂର୍ବରୁ। ଯାହା ଆମକୁ ପ୍ରକୃତ ହାର୍ଡୱେର ନିର୍ମାଣକୁ ଆଣେ। ଟାୟର୍ 1 ହେଉଛି ଷ୍ଟାର୍ଟର୍ ରିଗ୍, ବାର ଶହରୁ ପନ୍ଦର ଶହ ଡଲାର। PC ରେ, ଆପଣଙ୍କ ଆଙ୍କର୍ ହେଉଛି ଏକ RTX 4060 Ti 16-ଗିଗାବାଇଟ୍।

2:39 ଗୁରୁତ୍ୱପୂର୍ଣ୍ଣ ସତର୍କବାଣୀ: କେବେବି ସତୁରି ଡଲାର ବଞ୍ଚାଇବା ପାଇଁ ଆଠ-ଗିଗାବାଇଟ୍ ସଂସ୍କରଣ କିଣନ୍ତୁ ନାହିଁ। 2026 ରେ ଆଠ ଗିଗାବାଇଟ୍ VRAM ଯେକୌଣସି ପ୍ରକୃତ ଏଜେଣ୍ଟ ୱାର୍କଫ୍ଲୋରେ ଏକ ତୁରନ୍ତ ଆଉଟ୍-ଅଫ୍-ମେମୋରୀ ମୃତ୍ୟୁଦଣ୍ଡ। ଏହାକୁ ଛଅ-କୋର Ryzen 5, ଚଉଷଠି ଗିଗାବାଇଟ୍ DDR5, ଏବଂ ଏକ ଦୁଇ-ଟେରାବାଇଟ୍ NVMe ଡ୍ରାଇଭ୍ ସହିତ ଯୋଡନ୍ତୁ। ଆପଲ୍ ଲାଣ୍ଡରେ, ସମାନ ହେଉଛି ଏକ Mac Mini କିମ୍ବା MacBook Pro ଷୋହଳ ଗିଗାବାଇଟ୍ ୟୁନିଫାଏଡ୍ ମେମୋରୀ ସହିତ।

3:02 ଆପଣ ଆଠ-ବିଲିୟନ ମଡେଲରେ ପ୍ରତି ସେକେଣ୍ଡରେ ଚାଳିଶରୁ ପଚାଶ ଟୋକେନ୍ ଦେଖିବେ। ଟାୟର୍ 2 ହେଉଛି ପାୱାର୍ ୟୁଜର୍ ସୁଇଟ୍ ସ୍ପଟ୍: ନିର୍ଦ୍ଦିଷ୍ଟ ଭାବରେ ଚଳାଇବା ପାଇଁ ନିର୍ମାଣ Qwen 2.5 32B ପରି ବତିଶି-ବିଲିୟନ ପାରାମିଟର ମଡେଲ। ପାଥ୍ A ହେଉଛି ଆଠ ଶହ ଡଲାର ପାଇଁ ଷୋହଳ ଗିଗାବାଇଟ୍ ସହିତ ଏକ ନୂତନ RTX 4070 Ti Super। କିନ୍ତୁ ପାଥ୍ B ମୋର ଦୃଢ଼ ସୁପାରିଶ: ଏକ ବ୍ୟବହୃତ Nvidia RTX 3090 କୋଡିଏ-ଚାରି ଗିଗାବାଇଟ୍ କିଣନ୍ତୁ। ଆପଣ eBay ରେ ଛଅ ଶହ ପଚାଶ ରୁ ସାତ ଶହ ପଚାଶ ଡଲାରରେ ସ୍ୱଚ୍ଛ 3090s ପାଇପାରିବେ। ତାହା ଆପଣଙ୍କୁ ଏକ ବିଶାଳ 384-ବିଟ୍ ବସ୍ ରେ ଚବିଶି ଗିଗାବାଇଟ୍ VRAM ଦିଏ ଯାହା

3:33 ପ୍ରତି ସେକେଣ୍ଡରେ 936 ଗିଗାବାଇଟ୍ ପୁସ୍ କରେ। ଡଲାର ପ୍ରତି ଡଲାରରେ, ଏହା କମ୍ପ୍ୟୁଟିଂରେ ସର୍ବୋତ୍ତମ VRAM ଡିଲ୍। macOS ରେ, ଟାୟର୍ 2 ପ୍ରତିପକ୍ଷ ହେଉଛି ଷଠିଏ-ଚାରି ଗିଗାବାଇଟ୍ ୟୁନିଫାଏଡ୍ ମେମୋରୀ ସହିତ ଏକ Mac Mini M4 Pro। ଏହା ଏକ ବତିଶି-ବିଲିୟନ ମଡେଲରେ ପ୍ରତି ସେକେଣ୍ଡରେ ଏଗାରରୁ ବାର ଟୋକେନ୍ ଉତ୍ପନ୍ନ କରେ: Nvidia ଠାରୁ ଧୀର, କିନ୍ତୁ ତିରିଶି ୱାଟ୍ ରେ ନୀରବ, ଏକ ବିରାଟ ପ୍ରସଙ୍ଗ ୱିଣ୍ଡୋ ପାଇଁ ସ୍ଥାନ ସହିତ। ଟାୟର୍ 3 ହେଉଛି ମଲ୍ଟି-ଏଜେଣ୍ଟ ସ୍ୱାର୍ମ ପାଇଁ ଉତ୍ସାହୀ ବ୍ରାକେଟ୍। PC ରେ, ତାହା ଅର୍ଥ ଏକ RTX 4090 ଚବିଶି ଗିଗାବାଇଟ୍ ସହିତ,

3:57 ଏକ Ryzen 9, ଏବଂ ଏକ ଶହ ଅଠେଇଶି ଗିଗାବାଇଟ୍ RAM, କିମ୍ବା ଡୁଆଲ୍ RTX 3090s ଯାହା ମୋଟ VRAM ର ଅଠଚାଳିଶି ଗିଗାବାଇଟ୍ ଯୋଗାଏ। ଆପଲ୍ ର ଲାଇନ୍‌ଅପ୍ ରେ, ଏହା ହେଉଛି ଏକ Mac Studio Ultra ଛାନବେରୁ ଏକ ଶହ କୋଡିଏ-ଆଠ ଗିଗାବାଇଟ୍ ୟୁନିଫାଏଡ୍ ମେମୋରୀ ସହିତ। ସୁପରପାୱାର୍ ହେଉଛି ମେମୋରୀ ରେସିଡେନ୍ସି: ଆପଣ ଏକ ଏମ୍ବେଡିଂ ମଡେଲ୍, ଏକ ଫାଷ୍ଟ ରାଉଟର, ଏବଂ ଏକ 32-ବିଲିୟନ କୋଡିଂ ମଡେଲ୍ ଏକାସାଙ୍ଗରେ ଲୋଡ୍ କରିପାରିବେ ଶୂନ ସ୍ୱାପ୍ ଡେରି ସହିତ। ବର୍ତ୍ତମାନ ଆମର ଫିଲ୍ଡ ଟେଷ୍ଟର ସଚ୍ଚୋଟ ବିଫଳତା ପାଇଁ: ଏଜ୍ କମ୍ପ୍ୟୁଟିଂ ଟ୍ରାପ୍।

4:24 ପ୍ରତି ସପ୍ତାହରେ ଏକ ସୋସିଆଲ୍ ପୋଷ୍ଟ ଦାବି କରେ ଯେ ଆପଣ ଏକ ଅଶୀ-ଡଲାର Raspberry Pi 5 ରେ ସ୍ୱୟଂଶାସିତ କୋଡିଂ ଏଜେଣ୍ଟ ଚଳାଇପାରିବେ। ମୁଁ ଏହାକୁ ପରୀକ୍ଷା କଲି। ଏକ ଛୋଟ ଏକ-ପଏଣ୍ଟ-ପାଞ୍ଚ ବିଲିୟନ ପାରାମିଟର ମଡେଲ୍ ଚଳାଇବା ଆପଣଙ୍କୁ କ୍ୱଚିତ୍ ପ୍ରତି ସେକେଣ୍ଡରେ ତିନୋଟି ଟୋକେନ୍ ଦିଏ ଯେତେବେଳେ ବୋର୍ଡ ପଚାଶୀ ଡିଗ୍ରୀ ସେଲସିୟସରେ ଥ୍ରୋଟଲ୍ କରେ। ଏହା ଏକ ସୁନ୍ଦର ସପ୍ତାହ ଶେଷ ଖେଳନା, କିନ୍ତୁ ଏକ ଦୈନିକ ବିକାଶ ଡ୍ରାଇଭର୍ ଭାବରେ, ଏହା ନିଶ୍ଚିତ ଦଣ୍ଡ ଅଟେ। ସଫ୍ଟୱେର୍ ପାଇଁ, ଯଦି ଆପଣ ଏକ ସ୍ୱଚ୍ଛ କମାଣ୍ଡ-ଲାଇନ୍ ଡେମନ୍ ଚାହୁଁଛନ୍ତି ଯାହା

4:47 Cursor, Cline, କିମ୍ବା VS Code ସହିତ ସିଧାସଳଖ ସଂଯୋଗ ହୁଏ ତେବେ Ollama ବ୍ୟବହାର କରନ୍ତୁ। ଯଦି ଆପଣ ମଡେଲ ଡାଉନଲୋଡ୍ ଏବଂ GPU ଲେୟର ସ୍ଲାଇଡର୍ ସହିତ ଏକ ଗ୍ରାଫିକାଲ୍ ପ୍ଲେଗ୍ରାଉଣ୍ଡ ଚାହୁଁଛନ୍ତି, LM Studio ବ୍ୟବହାର କରନ୍ତୁ। ଏବଂ ଆପଣଙ୍କ ସିଲିକନ୍ ସହିତ ଆପଣଙ୍କ ଫର୍ମାଟ୍ ମେଳ କରନ୍ତୁ। ଆପଲ୍ ସିଲିକନ୍ ଉପରେ, ସର୍ବଦା ମେଟାଲ୍ ପାଇଁ ଅପ୍ଟିମାଇଜ୍ ହୋଇଥିବା GGUF ମଡେଲ୍ ଡାଉନଲୋଡ୍ କରନ୍ତୁ। Nvidia ସହିତ ୱିଣ୍ଡୋଜ୍ କିମ୍ବା ଲିନକ୍ସରେ, AWQ କିମ୍ବା EXL2 ମଡେଲ୍ ଡାଉନଲୋଡ୍ କରନ୍ତୁ, ଯାହା କୋଡିଏରୁ ତିରିଶି ପ୍ରତିଶତ ଦ୍ରୁତତର ଇନଫରେନ୍ସ ପାଇଁ Nvidia ଟେନସର କୋର ବ୍ୟବହାର କରେ। ତେବେ, ଆପଣ ଏହାକୁ ଭାଙ୍ଗି ନ ଯାଇ କିପରି ଡିପ୍ଲୋୟ୍ କରିବେ?

5:11 ସ୍ଥାନୀୟ ହାର୍ଡୱେରକୁ ଏକ ଘରୋଇ ଜିମ୍ ବନାମ ଏକ ବ୍ୟବସାୟିକ ଜିମ୍ ପରି ଭାବନ୍ତୁ। ଘରେ ଏକ ସ୍କ୍ୱାଟ୍ ରାକ୍ ଥିବାର ଅର୍ଥ ହେଉଛି ଆପଣ ପ୍ରତିଦିନ ଶୂନ କମ୍ୟୁଟ୍, ଶୂନ ସବସ୍କ୍ରିପ୍ସନ୍ ଫି, ଏବଂ ସମ୍ପୂର୍ଣ୍ଣ ଗୋପନୀୟତା ସହିତ ତାଲିମ ନିଅନ୍ତି। ଆପଣଙ୍କ ସ୍ଥାନୀୟ ମେସିନ୍ ଆପଣଙ୍କ ଦୈନିକ କୋଡିଂର ଅଶୀ ପ୍ରତିଶତ, ୟୁନିଟ୍ ଟେଷ୍ଟିଂ, ଏବଂ ପ୍ରତି ଟୋକେନ୍ ପିଛା ଶୂନ ଡଲାରରେ ବ୍ୟକ୍ତିଗତ ଡକ୍ୟୁମେଣ୍ଟ୍ ପ୍ରକ୍ରିୟାକରଣ କରେ। ଏବଂ ଯେତେବେଳେ ଆପଣଙ୍କୁ ପାଞ୍ଚ ଶହ ପାଉଣ୍ଡ ଡେଡଲିଫ୍ଟ କରିବାକୁ ପଡ଼େ — ଯେପରି ଏକ ବିଶାଳ ରେପୋ-ୱାଇଡ୍ ପଚାଶ ଫାଇଲ୍ ଉପରେ ସ୍ଥାପତ୍ୟ ସଂଶୋଧନ — ଆପଣ ବ୍ୟବସାୟିକ ଜିମ୍ ପରିଦର୍ଶନ କରନ୍ତି: କ୍ଲାଉଡ୍ API କୁ Claude 3.5 Sonnet କିମ୍ବା OpenAI o3 ପାଇଁ ପନ୍ଦର ମିନିଟ୍ ପାଇଁ ଦେୟ ଦିଅନ୍ତୁ

5:38 ଏବଂ ଆଗକୁ ବଢ଼ନ୍ତୁ। ଏଠାରେ ବିଲ୍ ଅଛି: ଏକ ବ୍ୟବହୃତ 3090 ସହିତ ଏକ ଟାୟର୍ 2 ନିର୍ମାଣର ମୋଟ ଖର୍ଚ୍ଚ ଷୋହଳ ଶହ ଡଲାର। ଯଦି ଆପଣ API ଟୋକେନ୍ ଉପରେ ପ୍ରତି ମାସରେ ପଚାଶରୁ ଶହେ ଡଲାର ଖର୍ଚ୍ଚ କରନ୍ତି, ଏହା ଅଠର ମାସରେ ନିଜେ ପରିଶୋଧ କରିଥାଏ ଯେତେବେଳେ ଆପଣଙ୍କ ମାଲିକାନା କୋଡବେସ୍ ତୃତୀୟ-ପକ୍ଷ ସର୍ଭରରୁ ଦୂରରେ ରଖେ। ଆଜିର ଫିଲ୍ଡ ଟେଷ୍ଟର ରାୟ: SHIP IT। VRAM ଏବଂ ମେମୋରୀ ବ୍ୟାଣ୍ଡୱିଡ୍ଥ ପ୍ରତିଥର କ୍ଲକ୍ ସ୍ପିଡ୍ କୁ ହରାଇଥାଏ। AI ପାଇଁ ପାଞ୍ଚ-ଗିଗାହର୍ଜ CPU କିଣିବା ବନ୍ଦ କରନ୍ତୁ, ଏବଂ ଏକ ବ୍ୟବହୃତ 3090 ଖୋଜନ୍ତୁ।

6:04 ଆପଣ ସ୍ଥାନୀୟ ମଡେଲ ପାଇଁ କେଉଁ ହାର୍ଡୱେର ନିର୍ମାଣ ଚଳାଉଛନ୍ତି ତାହା ମନ୍ତବ୍ୟରେ ମୋତେ କୁହନ୍ତୁ। ଏବଂ ଯଦି ଆପଣ ଏହି ବର୍ଣ୍ଣନା ପଢିବାକୁ ପସନ୍ଦ କରନ୍ତି, ତେବେ daily diff dot dev ରେ ନ୍ୟୁଜଲେଟର ଗ୍ରହଣ କରନ୍ତୁ, ଲିଙ୍କ୍ ତଳେ ଅଛି। ଏବଂ ଆଜି ପାଇଁ ଏତିକି। ମୁଁ Axrisi ରୁ ନିକୋ। ଦାୟିତ୍ୱର ସହିତ ମର୍ଜ୍ କରନ୍ତୁ।

## ଉତ୍ସଗୁଡ଼ିକ

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
