ਲੋਕਲ AI ਹਾਰਡਵੇਅਰ ਗਾਈਡ (2026)
ਸਥਾਨਕ AI ਏਜੰਟਾਂ ਅਤੇ ਓਪਨ-ਵੇਟ LLM ਲਈ ਇੱਕ ਮਸ਼ੀਨ ਬਣਾਉਂਦੇ ਸਮੇਂ, ਡਿਵੈਲਪਰ ਗੇਮਿੰਗ PC ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਖਰੀਦਣ ਦੀ ਗਲਤੀ ਕਰਦੇ ਹਨ: 5.8 GHz CPU, ਕਸਟਮ ਲਿਕਵਿਡ ਕੂਲਿੰਗ ਲੂਪਸ, ਅਤੇ ਸਿਰਫ 8GB VRAM ਵਾਲੇ ਤੇਜ਼ ਗੇਮਿੰਗ GPU।
ਸਥਾਨਕ AI ਏਜੰਟਾਂ ਅਤੇ ਓਪਨ-ਵੇਟ LLM ਲਈ ਇੱਕ ਮਸ਼ੀਨ ਬਣਾਉਂਦੇ ਸਮੇਂ, ਡਿਵੈਲਪਰ ਗੇਮਿੰਗ PC ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਖਰੀਦਣ ਦੀ ਗਲਤੀ ਕਰਦੇ ਹਨ: 5.8 GHz CPU, ਕਸਟਮ ਲਿਕਵਿਡ ਕੂਲਿੰਗ ਲੂਪਸ, ਅਤੇ ਸਿਰਫ 8GB VRAM ਵਾਲੇ ਤੇਜ਼ ਗੇਮਿੰਗ GPU। ਪਰ ਆਟੋਰਿਗਰੈਸਿਵ ਟੋਕਨ ਜਨਰੇਸ਼ਨ ਮੈਮੋਰੀ-ਬੈਂਡਵਿਡਥ ਨਾਲ ਬੰਨ੍ਹੀ ਹੋਈ ਹੈ, ਨਾ ਕਿ ਕੰਪਿਊਟ ਬਾਉਂਡ: ਇੱਕ ਸਿੰਗਲ ਟੋਕਨ ਛੱਡਣ ਲਈ, ਮਾਡਲ ਵਿੱਚ ਹਰ ਵਜ਼ਨ ਮੈਮੋਰੀ ਬੱਸ ਵਿੱਚੋਂ ਸਟ੍ਰੀਮ ਹੋਣਾ ਚਾਹੀਦਾ ਹੈ। ਜਦੋਂ ਤੁਹਾਡੇ ਵਜ਼ਨ ਜਾਂ KV ਕੈਸ਼ ਸੰਦਰਭ ਭੌਤਿਕ VRAM ਤੋਂ ਵੱਧ ਜਾਂਦੇ ਹਨ, ਤਾਂ ਰਨਟਾਈਮ PCIe ਉੱਤੇ ਸਿਸਟਮ DDR5 ਵਿੱਚ ਲੇਅਰਾਂ ਨੂੰ ਆਫਲੋਡ ਕਰਦਾ ਹੈ, ਅਤੇ ਤੁਸੀਂ 20x ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਦੀ ਕਮੀ 'ਤੇ ਪਹੁੰਚ ਜਾਂਦੇ ਹੋ: ਗਤੀ 40 ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ ਤੋਂ ਘੱਟ ਕੇ 1.5 ਹੋ ਜਾਂਦੀ ਹੈ। ਇਸ ਫੀਲਡ ਟੈਸਟ ਵਿੱਚ, ਨਿਕੋ ਹਾਰਡਵੇਅਰ ਮਕੈਨਿਕਸ, 4-ਬਿੱਟ ਕੁਆਂਟਾਈਜ਼ੇਸ਼ਨ ਮਾਡਲ ਸਾਈਜ਼ਿੰਗ ਨਿਯਮਾਂ, $1,200 ਤੋਂ $5,000 ਤੱਕ ਦੇ ਤਿੰਨ ਅਸਲ ਬਜਟ ਟੀਅਰਾਂ, ਕਿਉਂ ਇੱਕ ਵਰਤਿਆ ਗਿਆ RTX 3090 24GB ਕੰਪਿਊਟਿੰਗ ਵਿੱਚ VRAM-ਪ੍ਰਤੀ-ਡਾਲਰ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਸੌਦਾ ਹੈ, Raspberry Pi ਐੱਜ ਟ੍ਰੈਪ, ਅਤੇ ਲੋਕਲ ਬਨਾਮ ਕਲਾਉਡ ਇਨਫਰੈਂਸ ਲਈ ਘਰੇਲੂ ਜਿਮ ਰਣਨੀਤੀ ਬਾਰੇ ਦੱਸਦਾ ਹੈ। ਫੈਸਲਾ: SHIP IT।
ਲਿਖਤੀ ਐਡੀਸ਼ਨ ਪੜ੍ਹੋ (ਅੰਗਰੇਜ਼ੀ) ↗
ਇਹ ਵੀਡੀਓ ਕੀ ਕਵਰ ਕਰਦਾ ਹੈ
- 20x ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਦੀ ਕਮੀ: 936 GB/s GDDR6X ਬਨਾਮ 50 GB/s DDR5 ਅਤੇ 31.5 GB/s PCIe
- ਮਾਡਲ ਸਾਈਜ਼ਿੰਗ @ 4-ਬਿੱਟ: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- ਟੀਅਰ 1 ($1,200–$1,500): RTX 4060 Ti 16GB (ਕਦੇ ਵੀ 8GB ਨਹੀਂ) ਜਾਂ Mac Mini 16GB
- ਟੀਅਰ 2 ($1,500–$2,000): ਵਰਤਿਆ ਗਿਆ RTX 3090 24GB ਸਵੀਟ ਸਪਾਟ ਜਾਂ Mac Mini M4 Pro 64GB
- ਟੀਅਰ 3 ($3,500+): RTX 4090 24GB / ਦੋਹਰੇ 3090s ਜਾਂ Mac Studio Ultra
ਅਨੁਵਾਦਿਤ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ
ਮੂਲ ਅੰਗਰੇਜ਼ੀ ਬਿਰਤਾਂਤ ਤੋਂ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ। ਉਪਲਬਧ ਆਡੀਓ ਅਤੇ ਕੈਪਸ਼ਨ YouTube ਦੁਆਰਾ ਨਿਯੰਤਰਿਤ ਕੀਤੇ ਜਾਂਦੇ ਹਨ।
0:00 ਜੇ ਤੁਸੀਂ ਸਥਾਨਕ AI ਏਜੰਟਾਂ ਨੂੰ ਚਲਾਉਣ ਲਈ ਇੱਕ PC ਬਣਾਉਣ ਦੀ ਯੋਜਨਾ ਬਣਾ ਰਹੇ ਹੋ, ਇੱਕ ਗੇਮਿੰਗ ਰਿਗ ਬਣਾਉਣਾ ਬੰਦ ਕਰੋ। ਤੁਹਾਨੂੰ ਪੰਜ-ਪੁਆਇੰਟ-ਅੱਠ ਗੀਗਾਹਰਟਜ਼ ਕੋਰ i9, ਇੱਕ ਲਿਕਵਿਡ ਕੂਲਿੰਗ ਲੂਪ, ਜਾਂ RGB ਨਾਲ ਢਕਿਆ ਅੱਠ-ਗੀਗਾਬਾਈਟ ਗ੍ਰਾਫਿਕਸ ਕਾਰਡ ਦੀ ਲੋੜ ਨਹੀਂ ਹੈ। ਸਥਾਨਕ AI ਇਨਫਰੈਂਸ ਵਿੱਚ, ਗੇਮਿੰਗ ਦੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਲਗਭਗ ਬੇਕਾਰ ਹਨ। ਇੱਕੋ ਮਾਪਦੰਡ ਜੋ ਨਿਰਧਾਰਤ ਕਰਦਾ ਹੈ ਕਿ ਤੁਹਾਡਾ ਏਜੰਟ ਚੱਲਦਾ ਹੈ ਜਾਂ ਰੇਂਗਦਾ ਹੈ, ਉਹ VRAM ਸਮਰੱਥਾ ਹੈ ਅਤੇ ਮੈਮੋਰੀ ਬੱਸ ਬੈਂਡਵਿਡਥ। ਹਾਰਡਵੇਅਰ ਟੈਸਟ ਦੇ ਨਿਯਮ: CPU ਕਲਾਕਸ ਅਤੇ ਰਾਸਟਰਾਈਜ਼ੇਸ਼ਨ ਬੈਂਚਮਾਰਕਸ ਨੂੰ ਭੁੱਲ ਜਾਓ।
0:24 ਸਾਨੂੰ ਤਿੰਨ ਨੰਬਰਾਂ ਦੀ ਪਰਵਾਹ ਹੈ: ਮੈਮੋਰੀ ਬੱਸ ਦੀ ਚੌੜਾਈ, ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਗੀਗਾਬਾਈਟ ਵਿੱਚ ਬੈਂਡਵਿਡਥ, ਅਤੇ KV ਕੈਸ਼ ਬਲੋਟ ਲਈ ਕੱਚਾ VRAM ਹੈੱਡਰੂਮ। ਇਸ ਫੀਲਡ ਟੈਸਟ ਵਿੱਚ, ਮੈਂ ਵੀਹ-x ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਦੀ ਕਮੀ ਬਾਰੇ ਦੱਸਾਂਗਾ, ਮਾਡਲ ਸਾਈਜ਼ਿੰਗ ਨਿਯਮਾਂ ਨੂੰ ਮੈਪ ਕਰਾਂਗਾ, ਬਾਰਾਂ ਸੌ ਡਾਲਰ ਤੋਂ ਪੰਜ ਹਜ਼ਾਰ ਤੱਕ ਦੇ ਤਿੰਨ ਅਸਲ ਟੀਅਰਾਂ ਨੂੰ ਬੈਂਚਮਾਰਕ ਕਰਾਂਗਾ, ਅਤੇ ਇਹ ਦੱਸਾਂਗਾ ਕਿ ਕਿਉਂ ਇੱਕ ਵਰਤਿਆ ਗਿਆ 3090 ਅਜੇ ਵੀ ਕੰਪਿਊਟਿੰਗ ਦਾ ਸਭ ਤੋਂ ਵਧੀਆ ਚੀਟ ਕੋਡ ਹੈ। ਇਹ ਦਿ ਡੇਲੀ ਡਿਫ, ਫੀਲਡ ਟੈਸਟ ਹੈ। ਇਹ ਸਮਝਣ ਲਈ ਕਿ ਗੇਮਿੰਗ ਰਿਗਸ ਕਿਉਂ ਅਸਫਲ ਹੁੰਦੇ ਹਨ, ਦੇਖੋ ਕਿ ਟੋਕਨ ਜਨਰੇਸ਼ਨ ਅਸਲ ਵਿੱਚ ਕਿਵੇਂ ਲਾਗੂ ਹੁੰਦੀ ਹੈ। ਗੇਮਾਂ ਵਿੱਚ, ਤੁਹਾਡਾ CPU ਡਰਾਅ ਕਾਲਾਂ ਨੂੰ ਫੀਡ ਕਰਦਾ ਹੈ ਅਤੇ ਤੁਹਾਡਾ GPU ਫਰੇਮਾਂ ਨੂੰ ਰੈਂਡਰ ਕਰਦਾ ਹੈ।
0:54 ਪਰ ਆਟੋਰਿਗਰੈਸਿਵ LLM ਡੀਕੋਡਿੰਗ ਲਗਭਗ ਪੂਰੀ ਤਰ੍ਹਾਂ ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਨਾਲ ਬੰਨ੍ਹੀ ਹੋਈ ਹੈ। ਇੱਕ ਸਿੰਗਲ ਟੋਕਨ ਬਣਾਉਣ ਲਈ, GPU ਨੂੰ ਮਾਡਲ ਦੇ ਹਰ ਵਜ਼ਨ ਪੈਰਾਮੀਟਰ ਨੂੰ ਮੈਮੋਰੀ ਤੋਂ ਆਪਣੇ ਕੰਪਿਊਟ ਕੋਰਾਂ ਰਾਹੀਂ ਸਟ੍ਰੀਮ ਕਰਨਾ ਚਾਹੀਦਾ ਹੈ। ਜੇ ਤੁਹਾਡਾ ਮਾਡਲ ਦਸ ਗੀਗਾਬਾਈਟ ਦਾ ਹੈ, ਤਾਂ ਇੱਕ ਟੋਕਨ ਬਣਾਉਣ ਦਾ ਮਤਲਬ ਦਸ ਗੀਗਾਬਾਈਟ ਡੇਟਾ ਪੜ੍ਹਨਾ ਹੈ। ਇੱਕ Nvidia RTX 3090 'ਤੇ 384-ਬਿੱਟ ਮੈਮੋਰੀ ਬੱਸ ਨਾਲ, ਤੁਹਾਨੂੰ 936 ਗੀਗਾਬਾਈਟ ਪ੍ਰਤੀ ਸਕਿੰਟ GDDR6X ਬੈਂਡਵਿਡਥ ਮਿਲਦੀ ਹੈ, ਜੋ ਪ੍ਰਤੀ ਸਕਿੰਟ ਅੱਸੀ ਟੋਕਨ ਬਣਾਉਂਦਾ ਹੈ। ਪਰ ਦੇਖੋ ਕਿ ਜਦੋਂ ਤੁਹਾਡਾ ਮਾਡਲ ਭੌਤਿਕ VRAM ਤੋਂ ਵੱਧ ਜਾਂਦਾ ਹੈ ਤਾਂ ਕੀ ਹੁੰਦਾ ਹੈ।
1:22 ਜਦੋਂ VRAM ਭਰ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਰਨਟਾਈਮ ਬਾਕੀ ਬਚੀਆਂ ਲੇਅਰਾਂ ਨੂੰ PCIe ਬੱਸ ਰਾਹੀਂ ਸਿਸਟਮ DDR5 ਮੈਮੋਰੀ ਵਿੱਚ ਆਫਲੋਡ ਕਰਦਾ ਹੈ। ਤੁਹਾਡੇ GPU ਕੋਰ ਪ੍ਰਤੀ ਸਕਿੰਟ ਇੱਕ ਹਜ਼ਾਰ ਗੀਗਾਬਾਈਟ ਦੀ ਉਮੀਦ ਕਰਦੇ ਹਨ। ਇਸ ਦੀ ਬਜਾਏ, ਡਿਊਲ-ਚੈਨਲ DDR5 ਉਹਨਾਂ ਨੂੰ ਪੰਜਾਹ ਫੀਡ ਕਰਦਾ ਹੈ, ਅਤੇ PCIe 4 ਇਕੱਤੀ 'ਤੇ ਰੁਕ ਜਾਂਦਾ ਹੈ। ਇਹ ਵੀਹ-x ਬੈਂਡਵਿਡਥ ਢਹਿ ਜਾਣਾ ਹੈ। ਟੋਕਨ ਜਨਰੇਸ਼ਨ ਪਾਈਪਲਾਈਨ ਤੁਰੰਤ ਬੱਸ ਦੀ ਉਡੀਕ ਵਿੱਚ ਰੁਕ ਜਾਂਦੀ ਹੈ, ਅਤੇ ਗਤੀ ਚਾਲੀ ਟੋਕਨ ਪ੍ਰਤੀ ਸਕਿੰਟ ਤੋਂ ਘੱਟ ਕੇ ਇੱਕ ਪੁਆਇੰਟ ਪੰਜ ਹੋ ਜਾਂਦੀ ਹੈ। ਤੁਸੀਂ ਦੋ ਹਜ਼ਾਰ ਡਾਲਰ ਦੇ ਰਿਗ ਨੂੰ ਇੱਕ ਸਪੇਸ ਹੀਟਰ ਵਿੱਚ ਬਦਲ ਦਿੱਤਾ ਹੈ।
1:47 ਅਤੇ ਇਹ ਮਲਟੀ-ਟਰਨ ਏਜੰਟ ਰਨ ਦੌਰਾਨ ਹੋਰ ਵੀ ਬਦਤਰ ਹੋ ਜਾਂਦਾ ਹੈ, ਕਿਉਂਕਿ ਵਜ਼ਨ ਸਿਰਫ ਅੱਧਾ ਹੀ ਹਨ। ਹਰ ਪ੍ਰੋਂਪਟ, ਟੂਲ ਕਾਲ, ਅਤੇ ਫਾਈਲ ਚੰਕ ਕੀ-ਵੈਲਿਊ ਕੈਸ਼ ਵਿੱਚ ਸਟੋਰ ਹੁੰਦਾ ਹੈ। ਇੱਕ ਬੱਤੀ-ਕੇ ਸੰਦਰਭ ਵਿੰਡੋ ਵਜ਼ਨ ਦੇ ਸਿਖਰ 'ਤੇ ਚਾਰ ਤੋਂ ਅੱਠ ਗੀਗਾਬਾਈਟ VRAM ਖਾ ਸਕਦੀ ਹੈ। ਜੇ ਤੁਹਾਡੇ ਕਾਰਡ ਵਿੱਚ ਸਿਰਫ ਸੋਲ੍ਹਾਂ ਗੀਗਾਬਾਈਟ ਹਨ, ਤਾਂ ਤੁਹਾਡਾ ਏਜੰਟ ਦੋ ਵਾਰ ਲੂਪ ਕਰਦਾ ਹੈ, ਸੰਦਰਭ ਦੀ ਕੰਧ ਨਾਲ ਟਕਰਾਉਂਦਾ ਹੈ, ਅਤੇ ਜਾਂ ਤਾਂ ਮੈਮੋਰੀ ਤੋਂ ਬਾਹਰ ਦੀ ਗਲਤੀ ਨਾਲ ਕਰੈਸ਼ ਹੋ ਜਾਂਦਾ ਹੈ ਜਾਂ DDR5 ਵਿੱਚ ਫੈਲ ਜਾਂਦਾ ਹੈ। ਇੱਥੇ ਚਾਰ-ਬਿੱਟ ਸਾਈਜ਼ਿੰਗ ਚੀਟ ਸ਼ੀਟ ਹੈ। Llama 3.1 ਜਾਂ DeepSeek Distill ਵਰਗਾ ਸੱਤ ਜਾਂ ਅੱਠ-ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਮਾਡਲ
2:16 ਲਗਭਗ ਪੰਜ ਗੀਗਾਬਾਈਟ ਲੈਂਦਾ ਹੈ। ਇੱਕ ਚੌਦਾਂ-ਬਿਲੀਅਨ ਮਾਡਲ ਦਸ ਗੀਗਾਬਾਈਟ ਲੈਂਦਾ ਹੈ। ਇੱਕ ਬੱਤੀ-ਬਿਲੀਅਨ ਮਾਡਲ, ਕੋਡਿੰਗ ਏਜੰਟਾਂ ਲਈ ਇੰਟੈਲੀਜੈਂਸ ਦਾ ਸਵੀਟ ਸਪਾਟ, ਵੀਹ ਗੀਗਾਬਾਈਟ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਅਤੇ ਇੱਕ ਸੱਤਰ-ਬਿਲੀਅਨ ਫਰੰਟੀਅਰ ਮਾਡਲ ਚਾਲੀ ਗੀਗਾਬਾਈਟ ਦੀ ਮੰਗ ਕਰਦਾ ਹੈ, ਇਸ ਤੋਂ ਪਹਿਲਾਂ ਕਿ ਤੁਸੀਂ ਸੰਦਰਭ ਅਲਾਟ ਕਰੋ। ਜੋ ਸਾਨੂੰ ਅਸਲ ਹਾਰਡਵੇਅਰ ਬਿਲਡਾਂ 'ਤੇ ਲਿਆਉਂਦਾ ਹੈ। ਟੀਅਰ 1 ਸਟਾਰਟਰ ਰਿਗ ਹੈ, ਬਾਰਾਂ ਸੌ ਤੋਂ ਪੰਦਰਾਂ ਸੌ ਡਾਲਰ। PC 'ਤੇ, ਤੁਹਾਡਾ ਐਂਕਰ ਇੱਕ RTX 4060 Ti 16-ਗੀਗਾਬਾਈਟ ਹੈ।
2:39 ਨਾਜ਼ੁਕ ਚੇਤਾਵਨੀ: ਕਦੇ ਵੀ ਅੱਠ-ਗੀਗਾਬਾਈਟ ਸੰਸਕਰਣ ਸੱਤਰ ਡਾਲਰ ਬਚਾਉਣ ਲਈ ਨਾ ਖਰੀਦੋ। 2026 ਵਿੱਚ ਅੱਠ ਗੀਗਾਬਾਈਟ VRAM ਕਿਸੇ ਵੀ ਅਸਲ ਏਜੰਟ ਵਰਕਫਲੋ 'ਤੇ ਤੁਰੰਤ ਮੈਮੋਰੀ ਤੋਂ ਬਾਹਰ ਮੌਤ ਦੀ ਸਜ਼ਾ ਹੈ। ਇਸਨੂੰ ਛੇ-ਕੋਰ Ryzen 5, ਚੌਂਹਠ ਗੀਗਾਬਾਈਟ DDR5, ਅਤੇ ਦੋ-ਟੈਰਾਬਾਈਟ NVMe ਡਰਾਈਵ ਨਾਲ ਜੋੜੋ। ਐਪਲ ਲੈਂਡ ਵਿੱਚ, ਬਰਾਬਰ ਇੱਕ ਮੈਕ ਮਿੰਨੀ ਜਾਂ ਮੈਕਬੁੱਕ ਪ੍ਰੋ ਹੈ ਜਿਸ ਵਿੱਚ ਸੋਲ੍ਹਾਂ ਗੀਗਾਬਾਈਟ ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ ਹੈ।
3:02 ਤੁਹਾਨੂੰ ਅੱਠ-ਬਿਲੀਅਨ ਮਾਡਲਾਂ 'ਤੇ ਪ੍ਰਤੀ ਸਕਿੰਟ ਚਾਲੀ ਤੋਂ ਪੰਜਾਹ ਟੋਕਨ ਦਿਖਾਈ ਦੇਣਗੇ। ਟੀਅਰ 2 ਪਾਵਰ ਯੂਜ਼ਰ ਦਾ ਸਵੀਟ ਸਪਾਟ ਹੈ: ਖਾਸ ਤੌਰ 'ਤੇ ਬੱਤੀ-ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣ ਲਈ ਬਣਾਇਆ ਗਿਆ ਹੈ ਜਿਵੇਂ Qwen 2.5 32B। ਪਾਥ A ਇੱਕ ਨਵਾਂ RTX 4070 Ti Super ਹੈ ਜਿਸ ਵਿੱਚ ਸੋਲ੍ਹਾਂ ਗੀਗਾਬਾਈਟ ਅੱਠ ਸੌ ਡਾਲਰ ਵਿੱਚ ਹੈ। ਪਰ ਪਾਥ B ਮੇਰੀ ਸਖਤ ਸਿਫ਼ਾਰਿਸ਼ ਹੈ: ਇੱਕ ਵਰਤਿਆ ਗਿਆ Nvidia RTX 3090 ਚੌਵੀ ਗੀਗਾਬਾਈਟ ਖਰੀਦੋ। ਤੁਸੀਂ ਈਬੇ 'ਤੇ ਸਾਫ਼ 3090s ਛੇ ਸੌ ਪੰਜਾਹ ਤੋਂ ਸੱਤ ਸੌ ਪੰਜਾਹ ਡਾਲਰ ਵਿੱਚ ਲੱਭ ਸਕਦੇ ਹੋ। ਇਹ ਤੁਹਾਨੂੰ ਇੱਕ ਵੱਡੇ 384-ਬਿੱਟ ਬੱਸ 'ਤੇ ਚੌਵੀ ਗੀਗਾਬਾਈਟ VRAM ਦਿੰਦਾ ਹੈ ਜੋ
3:33 ਪ੍ਰਤੀ ਸਕਿੰਟ 936 ਗੀਗਾਬਾਈਟ ਪੁਸ਼ ਕਰਦਾ ਹੈ। ਡਾਲਰ ਦੇ ਬਦਲੇ ਡਾਲਰ, ਇਹ ਕੰਪਿਊਟਿੰਗ ਵਿੱਚ ਸਭ ਤੋਂ ਵਧੀਆ VRAM ਸੌਦਾ ਹੈ। macOS 'ਤੇ, ਟੀਅਰ 2 ਦਾ ਬਰਾਬਰ ਇੱਕ Mac Mini M4 Pro ਹੈ ਜਿਸ ਵਿੱਚ ਚੌਂਹਠ ਗੀਗਾਬਾਈਟ ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ ਹੈ। ਇਹ ਇੱਕ ਬੱਤੀ-ਬਿਲੀਅਨ ਮਾਡਲ 'ਤੇ ਪ੍ਰਤੀ ਸਕਿੰਟ ਗਿਆਰਾਂ ਤੋਂ ਬਾਰਾਂ ਟੋਕਨ ਬਣਾਉਂਦਾ ਹੈ: Nvidia ਨਾਲੋਂ ਹੌਲੀ, ਪਰ ਤੀਹ ਵਾਟ 'ਤੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਚੁੱਪ ਹੈ ਜਿਸ ਵਿੱਚ ਇੱਕ ਵਿਸ਼ਾਲ ਸੰਦਰਭ ਵਿੰਡੋ ਲਈ ਜਗ੍ਹਾ ਹੈ। ਟੀਅਰ 3 ਮਲਟੀ-ਏਜੰਟ ਸਵਾਰਮਜ਼ ਲਈ ਉਤਸ਼ਾਹੀ ਬਰੈਕਟ ਹੈ। PC 'ਤੇ, ਇਸਦਾ ਮਤਲਬ ਇੱਕ RTX 4090 ਹੈ ਜਿਸ ਵਿੱਚ ਚੌਵੀ ਗੀਗਾਬਾਈਟ,
3:57 ਇੱਕ Ryzen 9, ਅਤੇ ਇੱਕ ਸੌ ਅੱਠ ਗੀਗਾਬਾਈਟ RAM, ਜਾਂ ਦੋਹਰੇ RTX 3090s ਜੋ ਕੁੱਲ ਚਾਲੀ ਅੱਠ ਗੀਗਾਬਾਈਟ VRAM ਪ੍ਰਦਾਨ ਕਰਦੇ ਹਨ। ਐਪਲ ਦੀ ਲਾਈਨਅੱਪ ਵਿੱਚ, ਇਹ ਇੱਕ Mac Studio Ultra ਹੈ ਜਿਸ ਵਿੱਚ ਛਿਆਨਵੇ ਤੋਂ ਇੱਕ ਸੌ ਅਠਾਈ ਗੀਗਾਬਾਈਟ ਯੂਨੀਫਾਈਡ ਮੈਮੋਰੀ ਹੈ। ਸੁਪਰਪਾਵਰ ਮੈਮੋਰੀ ਰੈਜ਼ੀਡੈਂਸੀ ਹੈ: ਤੁਸੀਂ ਇੱਕ ਐਂਬੈਡਿੰਗ ਮਾਡਲ, ਇੱਕ ਤੇਜ਼ ਰਾਊਟਰ, ਅਤੇ ਇੱਕ 32-ਬਿਲੀਅਨ ਕੋਡਿੰਗ ਮਾਡਲ ਨੂੰ ਜ਼ੀਰੋ ਸਵੈਪ ਦੇਰੀ ਨਾਲ ਇੱਕੋ ਸਮੇਂ ਲੋਡ ਕਰ ਸਕਦੇ ਹੋ। ਹੁਣ ਸਾਡੇ ਫੀਲਡ ਟੈਸਟ ਦੀ ਇਮਾਨਦਾਰ ਅਸਫਲਤਾ ਲਈ: ਐੱਜ ਕੰਪਿਊਟਿੰਗ ਟ੍ਰੈਪ।
4:24 ਹਰ ਹਫ਼ਤੇ ਇੱਕ ਸੋਸ਼ਲ ਪੋਸਟ ਦਾਅਵਾ ਕਰਦੀ ਹੈ ਕਿ ਤੁਸੀਂ ਇੱਕ ਅੱਸੀ ਡਾਲਰ ਦੇ Raspberry Pi 5 'ਤੇ ਖੁਦਮੁਖਤਿਆਰ ਕੋਡਿੰਗ ਏਜੰਟ ਚਲਾ ਸਕਦੇ ਹੋ। ਮੈਂ ਇਸਦੀ ਜਾਂਚ ਕੀਤੀ। ਇੱਕ ਛੋਟੇ ਇੱਕ-ਪੁਆਇੰਟ-ਪੰਜ ਬਿਲੀਅਨ ਪੈਰਾਮੀਟਰ ਮਾਡਲ ਨੂੰ ਚਲਾਉਣ ਨਾਲ ਤੁਹਾਨੂੰ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਮੁਸ਼ਕਿਲ ਨਾਲ ਤਿੰਨ ਟੋਕਨ ਮਿਲਦੇ ਹਨ ਜਦੋਂ ਕਿ ਬੋਰਡ ਪੰਚਾਸੀ ਡਿਗਰੀ ਸੈਲਸੀਅਸ 'ਤੇ ਥਰੋਟਲ ਕਰਦਾ ਹੈ। ਇਹ ਇੱਕ ਵਧੀਆ ਵੀਕੈਂਡ ਖਿਡੌਣਾ ਹੈ, ਪਰ ਇੱਕ ਰੋਜ਼ਾਨਾ ਵਿਕਾਸ ਡਰਾਈਵਰ ਵਜੋਂ, ਇਹ ਸ਼ੁੱਧ ਸਜ਼ਾ ਹੈ। ਸਾਫਟਵੇਅਰ ਲਈ, Ollama ਦੀ ਵਰਤੋਂ ਕਰੋ ਜੇ ਤੁਸੀਂ ਇੱਕ ਸਾਫ਼ ਕਮਾਂਡ-ਲਾਈਨ ਡੇਮਨ ਚਾਹੁੰਦੇ ਹੋ ਜੋ
4:47 ਸਿੱਧਾ Cursor, Cline, ਜਾਂ VS Code ਨਾਲ ਜੁੜਦਾ ਹੈ। ਜੇ ਤੁਸੀਂ ਮਾਡਲ ਡਾਊਨਲੋਡਾਂ ਅਤੇ GPU ਲੇਅਰ ਸਲਾਈਡਰਾਂ ਨਾਲ ਇੱਕ ਗ੍ਰਾਫੀਕਲ ਪਲੇਗ੍ਰਾਉਂਡ ਚਾਹੁੰਦੇ ਹੋ, LM Studio ਦੀ ਵਰਤੋਂ ਕਰੋ। ਅਤੇ ਆਪਣੇ ਫਾਰਮੈਟ ਨੂੰ ਆਪਣੇ ਸਿਲੀਕਾਨ ਨਾਲ ਮਿਲਾਓ। ਐਪਲ ਸਿਲੀਕਾਨ 'ਤੇ, ਹਮੇਸ਼ਾ ਮੈਟਲ ਲਈ ਅਨੁਕੂਲਿਤ GGUF ਮਾਡਲ ਡਾਊਨਲੋਡ ਕਰੋ। ਵਿੰਡੋਜ਼ ਜਾਂ ਲੀਨਕਸ 'ਤੇ Nvidia ਨਾਲ, AWQ ਜਾਂ EXL2 ਮਾਡਲ ਡਾਊਨਲੋਡ ਕਰੋ, ਜੋ ਵੀਹ ਤੋਂ ਤੀਹ ਪ੍ਰਤੀਸ਼ਤ ਤੇਜ਼ ਇਨਫਰੈਂਸ ਲਈ Nvidia Tensor Cores ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ। ਤਾਂ ਤੁਸੀਂ ਇਸਨੂੰ ਬਰਬਾਦ ਹੋਏ ਬਿਨਾਂ ਕਿਵੇਂ ਤੈਨਾਤ ਕਰਦੇ ਹੋ?
5:11 ਸਥਾਨਕ ਹਾਰਡਵੇਅਰ ਨੂੰ ਇੱਕ ਘਰੇਲੂ ਜਿਮ ਬਨਾਮ ਇੱਕ ਵਪਾਰਕ ਜਿਮ ਵਾਂਗ ਸੋਚੋ। ਘਰ ਵਿੱਚ ਇੱਕ ਸਕੁਐਟ ਰੈਕ ਹੋਣ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਤੁਸੀਂ ਜ਼ੀਰੋ ਆਵਾਜਾਈ, ਜ਼ੀਰੋ ਗਾਹਕੀ ਫੀਸ, ਅਤੇ ਪੂਰੀ ਗੋਪਨੀਯਤਾ ਨਾਲ ਹਰ ਰੋਜ਼ ਸਿਖਲਾਈ ਦਿੰਦੇ ਹੋ। ਤੁਹਾਡੀ ਸਥਾਨਕ ਮਸ਼ੀਨ ਤੁਹਾਡੇ ਰੋਜ਼ਾਨਾ ਕੋਡਿੰਗ ਦਾ ਅੱਸੀ ਪ੍ਰਤੀਸ਼ਤ ਨੂੰ ਸੰਭਾਲਦੀ ਹੈ, ਯੂਨਿਟ ਟੈਸਟਿੰਗ, ਅਤੇ ਪ੍ਰਾਈਵੇਟ ਦਸਤਾਵੇਜ਼ ਪ੍ਰੋਸੈਸਿੰਗ ਪ੍ਰਤੀ ਟੋਕਨ ਜ਼ੀਰੋ ਡਾਲਰ ਵਿੱਚ। ਅਤੇ ਜਦੋਂ ਤੁਹਾਨੂੰ ਪੰਜ ਸੌ ਪੌਂਡ ਡੈੱਡਲਿਫਟ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ — ਜਿਵੇਂ ਇੱਕ ਵਿਸ਼ਾਲ ਰੈਪੋ-ਵਿਆਪਕ ਪੰਜਾਹ ਫਾਈਲਾਂ ਵਿੱਚ ਆਰਕੀਟੈਕਚਰਲ ਰੀਫੈਕਟਰ — ਤੁਸੀਂ ਵਪਾਰਕ ਜਿਮ 'ਤੇ ਜਾਂਦੇ ਹੋ: ਕਲਾਉਡ API ਲਈ Claude 3.5 Sonnet ਜਾਂ OpenAI o3 ਲਈ ਪੰਦਰਾਂ ਮਿੰਟਾਂ ਲਈ ਭੁਗਤਾਨ ਕਰੋ
5:38 ਅਤੇ ਅੱਗੇ ਵਧੋ। ਇੱਥੇ ਬਿੱਲ ਹੈ: ਇੱਕ ਵਰਤਿਆ ਗਿਆ 3090 ਵਾਲਾ ਟੀਅਰ 2 ਬਿਲਡ ਕੁੱਲ ਸੋਲ੍ਹਾਂ ਸੌ ਡਾਲਰ ਖਰਚ ਕਰਦਾ ਹੈ। ਜੇ ਤੁਸੀਂ ਪ੍ਰਤੀ ਮਹੀਨਾ ਪੰਜਾਹ ਤੋਂ ਸੌ ਡਾਲਰ API ਟੋਕਨਾਂ 'ਤੇ ਖਰਚ ਕਰਦੇ ਹੋ, ਇਹ ਅਠਾਰਾਂ ਮਹੀਨਿਆਂ ਵਿੱਚ ਆਪਣੇ ਲਈ ਭੁਗਤਾਨ ਕਰਦਾ ਹੈ ਜਦੋਂ ਕਿ ਤੁਹਾਡੇ ਮਲਕੀਅਤ ਵਾਲੇ ਕੋਡਬੇਸ ਨੂੰ ਤੀਜੀ-ਧਿਰ ਦੇ ਸਰਵਰਾਂ ਤੋਂ ਦੂਰ ਰੱਖਦਾ ਹੈ। ਅੱਜ ਦੇ ਫੀਲਡ ਟੈਸਟ ਦਾ ਫੈਸਲਾ: SHIP IT। VRAM ਅਤੇ ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਹਰ ਵਾਰ ਕਲਾਕ ਸਪੀਡਾਂ ਨੂੰ ਹਰਾਉਂਦੇ ਹਨ। AI ਲਈ ਪੰਜ-ਗੀਗਾਹਰਟਜ਼ CPU ਖਰੀਦਣਾ ਬੰਦ ਕਰੋ, ਅਤੇ ਇੱਕ ਵਰਤਿਆ ਗਿਆ 3090 ਲੱਭੋ।
6:04 ਮੈਨੂੰ ਦੱਸੋ ਕਿ ਤੁਸੀਂ ਟਿੱਪਣੀਆਂ ਵਿੱਚ ਸਥਾਨਕ ਮਾਡਲਾਂ ਲਈ ਕਿਹੜਾ ਹਾਰਡਵੇਅਰ ਬਿਲਡ ਚਲਾ ਰਹੇ ਹੋ। ਅਤੇ ਜੇ ਤੁਸੀਂ ਇਸ ਬ੍ਰੇਕਡਾਊਨ ਨੂੰ ਪੜ੍ਹਨਾ ਚਾਹੁੰਦੇ ਹੋ, ਤਾਂ ਰੋਜ਼ਾਨਾ ਡਿਫ ਡਾਟ ਡੇਵ 'ਤੇ ਨਿਊਜ਼ਲੈਟਰ ਲਓ, ਲਿੰਕ ਹੇਠਾਂ ਦਿੱਤਾ ਗਿਆ ਹੈ। ਅਤੇ ਅੱਜ ਲਈ ਇਹ ਡਿਫ ਹੈ। ਮੈਂ Axrisi ਤੋਂ ਨਿਕੋ ਹਾਂ। ਜ਼ਿੰਮੇਵਾਰੀ ਨਾਲ ਮਰਜ ਕਰੋ।
ਸਰੋਤ
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



