+− THE DAILY DIFFdev & AI news
SHIP IT

ပြည်တွင်း AI ဟာ့ဒ်ဝဲလမ်းညွှန် (2026)

ပြည်တွင်း AI အေးဂျင့်များနှင့် open-weight LLM များအတွက် စက်တစ်လုံးတည်ဆောက်သောအခါ developer များသည် gaming PC သတ်မှတ်ချက်များ- 5.8 GHz CPUs၊ စိတ်ကြိုက်အရည်အအေးပေးစနစ်များနှင့် VRAM 8GB သာပါသော မြန်ဆန်သော gaming GPU များ ဝယ်ယူခြင်းကဲ့သို့ အမှားမျိုးကို ပြုလုပ်ကြသည်။

ပြည်တွင်း AI အေးဂျင့်များနှင့် open-weight LLM များအတွက် စက်တစ်လုံးတည်ဆောက်သောအခါ developer များသည် gaming PC သတ်မှတ်ချက်များ- 5.8 GHz CPUs၊ စိတ်ကြိုက်အရည်အအေးပေးစနစ်များနှင့် VRAM 8GB သာပါသော မြန်ဆန်သော gaming GPU များ ဝယ်ယူခြင်းကဲ့သို့ အမှားမျိုးကို ပြုလုပ်ကြသည်။ သို့သော် autoregressive token generation သည် memory-bandwidth ကန့်သတ်ချက်ရှိပြီး compute ကန့်သတ်ချက် မဟုတ်ပေ။ single token တစ်ခုထုတ်လွှတ်ရန်အတွက် model ရှိ weight တိုင်းသည် memory bus တစ်လျှောက် စီးဆင်းရမည်ဖြစ်သည်။ သင့် weight များ သို့မဟုတ် KV cache context သည် ရုပ်ပိုင်းဆိုင်ရာ VRAM ထက် ကျော်လွန်သောအခါ runtime သည် system DDR5 သို့ PCIe မှတစ်ဆင့် layer များကို offload လုပ်ကာ memory bandwidth အဆ 20 ကျဆင်းသွားသည်။ မြန်နှုန်းသည် တစ်စက္ကန့်လျှင် token 40 မှ 1.5 သို့ ကျဆင်းသွားသည်။ ဤ field test တွင် Niko က ဟာ့ဒ်ဝဲဆိုင်ရာ ယန္တရားများ၊ 4-bit quantization model sizing နည်းဥပဒေများ၊ $1,200 မှ $5,000 အထိ ဘတ်ဂျက်အဆင့်သုံးမျိုး၊ အသုံးပြုပြီးသား RTX 3090 24GB သည် ကွန်ပြူတာအတွက် VRAM-per-dollar အရ အကောင်းဆုံးဖြစ်ရခြင်းအကြောင်း၊ Raspberry Pi edge trap နှင့် local versus cloud inference အတွက် home gym ဗျူဟာတို့ကို ရှင်းပြထားသည်။ စီရင်ချက်: SHIP IT။

ရေးသားထားသော ထုတ်ဝေမှု (အင်္ဂလိပ်) ကို ဖတ်ရန် ↗

ဤဗီဒီယိုတွင် ဖော်ပြထားသောအရာများ

  • အဆ 20 memory bandwidth ကျဆင်းမှု- 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
  • Model sizing @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • အဆင့် 1 ($1,200–$1,500): RTX 4060 Ti 16GB (8GB လုံးဝမဝယ်ပါနှင့်) သို့မဟုတ် Mac Mini 16GB
  • အဆင့် 2 ($1,500–$2,000): အသုံးပြုပြီးသား RTX 3090 24GB သည် အကောင်းဆုံး သို့မဟုတ် Mac Mini M4 Pro 64GB
  • အဆင့် 3 ($3,500+): RTX 4090 24GB / dual 3090s သို့မဟုတ် Mac Studio Ultra

ဘာသာပြန်ထားသော စာသားမှတ်တမ်း

မူရင်း အင်္ဂလိပ်စကားပြောမှ ဘာသာပြန်ထားသည်။ ရရှိနိုင်သော အသံနှင့် စာတန်းထိုးများကို YouTube မှ ထိန်းချုပ်ထားသည်။

0:00 ပြည်တွင်း AI အေးဂျင့်များကို လုပ်ဆောင်ရန် PC တစ်လုံးတည်ဆောက်ရန် စီစဉ်နေပါက ဂိမ်းစက်တည်ဆောက်ခြင်းကို ရပ်တန့်ပါ။ 5.8 GHz Core i9၊ liquid cooling loop သို့မဟုတ် RGB အပြည့်ပါသော 8GB ဂရပ်ဖစ်ကတ်တို့ကို မလိုအပ်ပါ။ ပြည်တွင်း AI inference တွင် ဂိမ်းသတ်မှတ်ချက်များသည် အသုံးမဝင်သလောက်ဖြစ်သည်။ သင့်အေးဂျင့် လုပ်ဆောင်နိုင်ခြင်း သို့မဟုတ် တွန့်ဆုတ်လုပ်ဆောင်ခြင်းကို ဆုံးဖြတ်သည့် တစ်ခုတည်းသော ကိန်းဂဏန်းမှာ VRAM ပမာဏ နှင့် memory bus bandwidth ဖြစ်သည်။ ဟာ့ဒ်ဝဲစမ်းသပ်မှု၏ စည်းမျဉ်းများ- CPU clocks နှင့် rasterization benchmarks များကို မေ့လိုက်ပါ။

0:24 ကျွန်ုပ်တို့သည် ကိန်းဂဏန်းသုံးမျိုးကို စိတ်ဝင်စားသည်- memory bus width၊ တစ်စက္ကန့်လျှင် gigabytes နှင့် KV cache bloat အတွက် VRAM headroom တို့ဖြစ်သည်။ ဤ field test တွင် ကျွန်ုပ်သည် အဆ 20 memory bandwidth ကျဆင်းမှုကို ရှင်းပြမည်၊ model sizing စည်းမျဉ်းများကို ပုံဆွဲမည်၊ ဒေါ်လာ 1,200 မှ 5,000 အထိ ဘတ်ဂျက်အဆင့်သုံးမျိုးကို စမ်းသပ်မည်၊ အသုံးပြုပြီးသား 3090 သည် ကွန်ပြူတာ၏ အကောင်းဆုံး cheat code ဖြစ်နေဆဲ အကြောင်းရင်းကို ရှင်းပြမည်။ ၎င်းသည် The Daily Diff, field test ဖြစ်သည်။ ဂိမ်းစက်များ အဘယ်ကြောင့် မအောင်မြင်သည်ကို နားလည်ရန် token generation မည်သို့ လုပ်ဆောင်သည်ကို ကြည့်ပါ။ ဂိမ်းများတွင် သင့် CPU က draw calls များကို ပံ့ပိုးပေးပြီး သင့် GPU က frames များကို render လုပ်သည်။

0:54 သို့သော် autoregressive LLM decoding သည် memory bandwidth ကန့်သတ်ချက် သက်သက်သာဖြစ်သည်။ single token တစ်ခုထုတ်လုပ်ရန်အတွက် GPU သည် model ၏ weight parameter တိုင်းကို memory မှ ၎င်း၏ compute cores များဆီသို့ streaming လုပ်ရမည်။ သင့် model သည် 10 gigabytes ဖြစ်ပါက token တစ်ခုထုတ်လုပ်ခြင်းသည် 10 gigabytes ဒေတာကို ဖတ်ရှုခြင်းဖြစ်သည်။ 384-bit memory bus ပါသော Nvidia RTX 3090 တွင် တစ်စက္ကန့်လျှင် 936 gigabytes GDDR6X bandwidth ရရှိပြီး တစ်စက္ကန့်လျှင် token 80 ကို ထုတ်လုပ်သည်။ သို့သော် သင့် model သည် ရုပ်ပိုင်းဆိုင်ရာ VRAM ထက် ကျော်လွန်သည့်အချိန်တွင် ဘာဖြစ်သည်ကို ကြည့်ပါ။

1:22 VRAM ပြည့်သွားသောအခါ runtimes များသည် ကျန်ရှိသော layers များကို PCIe bus မှတစ်ဆင့် system DDR5 memory သို့ offload လုပ်သည်။ သင့် GPU cores များသည် တစ်စက္ကန့်လျှင် gigabytes 1000 ကို မျှော်လင့်ထားသည်။ အစား၊ dual-channel DDR5 က 50 ကိုသာ ပံ့ပိုးပေးပြီး PCIe 4 က 31.5 တွင် ပိတ်ဆို့သွားသည်။ ၎င်းသည် အဆ 20 bandwidth ပြိုလဲခြင်း ဖြစ်သည်။ token generation pipeline သည် bus ကို စောင့်ဆိုင်းရင်း ချက်ချင်းရပ်တန့်သွားပြီး မြန်နှုန်းသည် တစ်စက္ကန့်လျှင် token 40 မှ 1.5 သို့ ကျဆင်းသွားသည်။ သင်သည် ဒေါ်လာ 2000 တန်စက်ကို အပူပေးစက်အဖြစ် ပြောင်းလဲလိုက်သည်။

1:47 multi-turn agent run များတွင် ပိုဆိုးလာသည်။ အဘယ်ကြောင့်ဆိုသော် weights များသည် တစ်ဝက် သာဖြစ်သည်။ prompt တိုင်း၊ tool call တိုင်းနှင့် file chunk တိုင်းကို Key-Value cache တွင် သိမ်းဆည်းသည်။ 32k context window သည် weights အပြင် VRAM 4 မှ 8 gigabytes ကို သုံးစွဲနိုင်သည်။ သင့်ကတ်တွင် 16 gigabytes သာရှိပါက သင့်အေးဂျင့်သည် နှစ်ကြိမ် လုပ်ဆောင်ပြီး context wall ကို ထိကာ out-of-memory error ဖြင့် ပျက်ကျခြင်း သို့မဟုတ် DDR5 ထဲသို့ ကျဆင်းသွားသည်။ ဤသည်မှာ 4-bit sizing cheat sheet ဖြစ်သည်။ Llama 3.1 သို့မဟုတ် DeepSeek Distill ကဲ့သို့ 7 သို့မဟုတ် 8 ဘီလီယံ parameter model တစ်ခုသည်

2:16 5 gigabytes ခန့်ယူသည်။ 14 ဘီလီယံ model တစ်ခုသည် 10 gigabytes ယူသည်။ coding agents များအတွက် ဉာဏ်ရည်ဆိုင်ရာ အကောင်းဆုံး 32 ဘီလီယံ model တစ်ခုသည် 20 gigabytes လိုအပ်သည်။ ပြီးတော့ 70 ဘီလီယံ frontier model တစ်ခုက context ကို မသတ်မှတ်ခင်မှာပင် 40 gigabytes လိုအပ်သည်။ ၎င်းသည် ကျွန်ုပ်တို့ကို လက်တွေ့ဟာ့ဒ်ဝဲတည်ဆောက်မှုများဆီသို့ ခေါ်ဆောင်လာသည်။ အဆင့် 1 သည် starter rig ဖြစ်ပြီး ဒေါ်လာ 1200 မှ 1500 ဖြစ်သည်။ PC တွင် သင့်အဓိကမှာ RTX 4060 Ti 16 gigabyte ဖြစ်သည်။

2:39 အရေးကြီးသတိပေးချက်- ဒေါ်လာ 70 ချွေတာရန် 8 gigabyte version ကို လုံးဝမဝယ်ပါနှင့်။ 2026 ခုနှစ်တွင် 8 gigabytes VRAM သည် မည်သည့်လက်တွေ့ agent workflow တွင်မဆို out-of-memory သေဒဏ် ဖြစ်သည်။ ၎င်းကို 6-core Ryzen 5၊ 64 gigabytes DDR5 နှင့် 2 terabyte NVMe drive တို့နှင့် တွဲဖက်ပါ။ Apple ဘက်တွင် ၎င်းနှင့်ညီမျှသည်မှာ 16 gigabytes unified memory ပါသော Mac Mini သို့မဟုတ် MacBook Pro ဖြစ်သည်။

3:02 8 ဘီလီယံ model များတွင် တစ်စက္ကန့်လျှင် token 40 မှ 50 ကို တွေ့ရမည်။ အဆင့် 2 သည် power user sweet spot ဖြစ်သည်။ Qwen 2.5 32B ကဲ့သို့ 32 ဘီလီယံ parameter model များကို လုပ်ဆောင်ရန် အထူးတည်ဆောက်ခြင်းဖြစ်သည်။ လမ်းကြောင်း A သည် ဒေါ်လာ 800 ဖြင့် 16 gigabytes ပါသော RTX 4070 Ti Super အသစ်ဖြစ်သည်။ သို့သော် လမ်းကြောင်း B သည် ကျွန်ုပ်၏ ခိုင်မာသော အကြံပြုချက်ဖြစ်သည်။ အသုံးပြုပြီးသား Nvidia RTX 3090 24 gigabyte ကို ဝယ်ပါ။ eBay တွင် ကောင်းမွန်သော 3090 များကို ဒေါ်လာ 650 မှ 750 ဖြင့် ရှာဖွေနိုင်သည်။ ၎င်းသည် ကြီးမားသော 384-bit bus တွင် 24 gigabytes VRAM ကို ပေးစွမ်းပြီး

3:33 တစ်စက္ကန့်လျှင် 936 gigabytes ကို တွန်းအားပေးသည်။ ဒေါ်လာနှင့် ဒေါ်လာ နှိုင်းယှဉ်လျှင် ၎င်းသည် ကွန်ပြူတာတွင် အကောင်းဆုံး VRAM deal ဖြစ်သည်။ macOS တွင် အဆင့် 2 နှင့် ကိုက်ညီသည်မှာ 64 gigabytes unified memory ပါသော Mac Mini M4 Pro ဖြစ်သည်။ ၎င်းသည် 32 ဘီလီယံ model တွင် တစ်စက္ကန့်လျှင် token 11 မှ 12 ကို ထုတ်လုပ်သည်- Nvidia ထက် နှေးသော်လည်း 30 watts ဖြင့် အသံတိတ်ပြီး ကြီးမားသော context window အတွက် နေရာရှိသည်။ အဆင့် 3 သည် multi-agent swarms အတွက် enthusiast bracket ဖြစ်သည်။ PC တွင် ၎င်းသည် 24 gigabytes ပါသော RTX 4090

3:57 Ryzen 9 နှင့် 128 gigabytes RAM သို့မဟုတ် စုစုပေါင်း VRAM 48 gigabytes ပေးစွမ်းသော dual RTX 3090s တို့ကို ဆိုလိုသည်။ Apple ၏ ထုတ်ကုန်များတွင် ၎င်းသည် 96 မှ 128 gigabytes unified memory ပါသော Mac Studio Ultra ဖြစ်သည်။ အဓိကစွမ်းအားမှာ memory residency ဖြစ်သည်။ embedding model မြန်ဆန်သော router နှင့် 32 ဘီလီယံ coding model တို့ကို swap delay မရှိဘဲ တစ်ပြိုင်နက်တည်း loading လုပ်ထားနိုင်သည်။ ယခု ကျွန်ုပ်တို့၏ field test ၏ ရိုးသားသော မအောင်မြင်မှု- edge computing trap ဖြစ်သည်။

4:24 အပတ်စဉ် လူမှုမီဒီယာ ပို့စ်များတွင် ဒေါ်လာ 80 တန် Raspberry Pi 5 တွင် ကိုယ်ပိုင်အုပ်ချုပ်ခွင့်ရ coding agents များကို လုပ်ဆောင်နိုင်သည်ဟု ဆိုကြသည်။ ကျွန်ုပ် စမ်းသပ်ခဲ့သည်။ သေးငယ်သော 1.5 ဘီလီယံ parameter model တစ်ခုကို လုပ်ဆောင်ခြင်းသည် ဘုတ်အဖွဲ့က 85 ဒီဂရီစင်တီဂရိတ်တွင် ရပ်တန့်နေချိန် တစ်စက္ကန့်လျှင် token 3 ခုပင် မရရှိပါ။ ၎င်းသည် သပ်ရပ်သော စနေ၊ တနင်္ဂနွေ အရုပ်တစ်ခုဖြစ်သော်လည်း နေ့စဉ် development driver အနေဖြင့် ၎င်းသည် စစ်မှန်သော ပြစ်ဒဏ်ဖြစ်သည်။ ဆော့ဖ်ဝဲလ်အတွက် Cursor, Cline သို့မဟုတ် VS Code တို့နှင့် တိုက်ရိုက်ချိတ်ဆက်နိုင်သော

4:47 သပ်ရပ်သော command-line daemon ကို လိုချင်ပါက Ollama ကို အသုံးပြုပါ။ model downloads နှင့် GPU layer sliders ပါသော graphical playground ကို လိုချင်ပါက LM Studio ကို အသုံးပြုပါ။ သင့် format ကို သင့် silicon နှင့် ကိုက်ညီအောင် လုပ်ဆောင်ပါ။ Apple Silicon တွင် Metal အတွက် optimized လုပ်ထားသော GGUF model များကို အမြဲဒေါင်းလုဒ်လုပ်ပါ။ Nvidia ပါသော Windows သို့မဟုတ် Linux တွင် AWQ သို့မဟုတ် EXL2 model များကို ဒေါင်းလုဒ်လုပ်ပါ။ ၎င်းတို့သည် inference ကို 20 မှ 30 ရာခိုင်နှုန်း ပိုမိုမြန်ဆန်စေရန် Nvidia Tensor Cores များကို အသုံးပြုသည်။ ဒါဆို သင် ဘဏ်မပြိုအောင် ဘယ်လို deploy လုပ်မလဲ။

5:11 ပြည်တွင်းဟာ့ဒ်ဝဲကို အိမ်တွင်းအားကစားရုံနှင့် စီးပွားရေးအားကစားရုံကဲ့သို့ တွေးကြည့်ပါ။ အိမ်တွင် squat rack ရှိခြင်းသည် သွားလာရခြင်း၊ စာရင်းသွင်းခများ မရှိခြင်းနှင့် ကိုယ်ပိုင်လုံခြုံမှု အပြည့်အဝဖြင့် နေ့တိုင်းလေ့ကျင့်ခြင်းကို ဆိုလိုသည်။ သင့်ပြည်တွင်းစက်သည် သင်၏နေ့စဉ် coding unit testing နှင့် ကိုယ်ပိုင်စာရွက်စာတမ်းလုပ်ဆောင်ခြင်း၏ 80 ရာခိုင်နှုန်းကို token တစ်ခုလျှင် သုညဒေါ်လာဖြင့် ကိုင်တွယ်သည်။ ပြီးတော့ သင်သည် ပေါင် 500 ကို deadlift လုပ်ရန်လိုအပ်သောအခါ— ကြီးမားသော repo-wide architectural refactor 50 files တွင် လုပ်ဆောင်ရန်ကဲ့သို့ — သင် စီးပွားရေးအားကစားရုံသို့ သွားရောက်သည်- Claude 3.5 Sonnet သို့မဟုတ် OpenAI o3 အတွက် cloud API ကို 15 မိနစ် ပေးဆောင်ပြီး

5:38 ရှေ့ဆက်လုပ်ဆောင်ပါ။ ဤသည်မှာ ငွေတောင်းခံလွှာဖြစ်သည်။ အသုံးပြုပြီးသား 3090 ပါသော အဆင့် 2 တည်ဆောက်မှုသည် စုစုပေါင်း ဒေါ်လာ 1600 ကုန်ကျသည်။ သင်သည် API tokens များအတွက် တစ်လလျှင် ဒေါ်လာ 50 မှ 100 သုံးစွဲပါက ၎င်းသည် 18 လအတွင်း ကိုယ့်ကိုယ်ကို ပြန်လည်ပေးဆပ်မည်ဖြစ်ပြီး သင့်ကိုယ်ပိုင် codebase ကို third-party servers များမှ ကင်းဝေးစေမည်။ ယနေ့ field test စီရင်ချက်- SHIP IT။ VRAM နှင့် memory bandwidth တို့သည် clock speeds ကို အမြဲတမ်း အနိုင်ရသည်။ AI အတွက် 5 gigahertz CPUs များ ဝယ်ယူခြင်းကို ရပ်တန့်ပြီး အသုံးပြုပြီးသား 3090 ကို ရှာဖွေပါ။

6:04 မှတ်ချက်များတွင် သင်၏ ပြည်တွင်း model များအတွက် မည်သည့်ဟာ့ဒ်ဝဲတည်ဆောက်မှုကို အသုံးပြုနေသည်ကို ပြောပြပါ။ ဤရှင်းလင်းချက်ကို ဖတ်ရှုလိုပါက the daily diff dot dev တွင် သတင်းလွှာကို ရယူပါ၊ လင့်ခ်အောက်တွင် ရှိသည်။ ဒါကတော့ ဒီနေ့အတွက် diff ပါ။ ကျွန်ုပ်သည် Axrisi မှ Niko ပါ။ တာဝန်ယူမှုဖြင့် ပေါင်းစည်းပါ။

ရင်းမြစ်များ

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

ဆက်စပ်ဗီဒီယိုများ

daily · my · ၂၀၂၆ စက် ၂၈

NVIDIA က ဒီလူကို ဒေါ်လာ ၁ ဘီလီယံ ပေးစရာ ရှိပါသလား

၁၉၉၃ ခုနှစ်တွင် Jensen Huang က Eric Gullichsen ကို NVIDIA ၏ နည်းပညာ အကြံပေးဘုတ်အဖွဲ့သို့ ဖိတ်ခေါ်ပြီး ရွေးချယ်ခွင့် ၂၅,၀၀၀ ကို ပေးခဲ့သည်။ ၎င်းသည် ပေးအပ်ထားသည့်အတိုင်း တစ်နှစ်အတွင်း ရရှိခဲ့သည်။ ၁၉၉၆ ခု

4:41 ↗
under-the-hood · my · ၂၀၂၆ စက် ၂၁

Claude သည် RSA-896 ကို ခွဲခြမ်းခဲ့သည်။ RSA သည် တကယ်တမ်း မည်သို့ပျက်စီးခဲ့ပုံ။

စက်တင်ဘာ ၁၉ ရက်တွင် Anthropic အင်ဂျင်နီယာတစ်ဦးသည် RSA-896 (ဂဏန်း ၂၇၀ လုံးပါသော စိန်ခေါ်မှုနံပါတ်) ကို Claude၊ open-source CADO-NFS sieve ၏ GPU port နှင့် GPU-နှစ် ၃၀ ခန့်ကို အားလပ်နေသော GPU ၂,၀၄၈ ခုပေ

3:39 ↗
daily · my · ၂၀၂၆ စက် ၁၀

Shopify သည် Tailwind ကို ဝယ်ယူခဲ့ပြီးနောက် မူရင်းဆော့ဖ်ဝဲလ်ကို ပြန်လည်အသုံးပြုခဲ့သည်။

Shopify ၏ ပို့စ်နှစ်ခုသည် ၂၅ နာရီခြားပြီး ထွက်ပေါ်လာခဲ့သည်။ အင်္ဂါနေ့တွင် Tailwind Labs သည် Shopify နှင့် ပူးပေါင်းခဲ့သည်။ ဖရမ်ဝပ်သည် MIT လိုင်စင်ဖြင့် ဆက်လက်တည်ရှိမည်ဖြစ်သော်လည်း Tailwind Plus နှင့်

5:15 ↗
daily · my · ၂၀၂၆ အောက် ၄

AWS သုံးစွဲမှု အများဆုံး ကန့်သတ်ချက်များသည် သင်၏ ပရောဂျက်ကို ဖျက်ပစ်နိုင်သည်

AWS ၏ ပရောဂျက်အတွက် သုံးစွဲမှု ကန့်သတ်ချက် အသစ်များသည် ကန့်သတ်ချက်ရောက်သည်နှင့် လုပ်ငန်းဆောင်တာများကို ရပ်တန့်စေပြီး သင့်ဒေတာကို ကနဦးတွင် ထိန်းသိမ်းထားသည်။ ၎င်း၏လမ်းညွှန်ချက်တွင် ပရောဂျက်ဒေတာကို လုပ်ဆ

5:13 ↗