உள்ளூர் AI வன்பொருள் வழிகாட்டி (2026)
உள்ளூர் AI முகவர்கள் மற்றும் திறந்தநிலை LLM-களுக்காக ஒரு கணினியை உருவாக்கும்போது, டெவலப்பர்கள் கேமிங் PC விவரக்குறிப்புகளை வாங்கும் தவறை செய்கிறார்கள்: 5.8 GHz CPU-கள், தனிப்பயன் திரவ குளிரூட்டும் சுற்றுகள் மற்றும் 8GB VRAM மட்டுமே கொண்ட வேகமான கேமிங் GPU-கள்.
உள்ளூர் AI முகவர்கள் மற்றும் திறந்தநிலை LLM-களுக்காக ஒரு கணினியை உருவாக்கும்போது, டெவலப்பர்கள் கேமிங் PC விவரக்குறிப்புகளை வாங்கும் தவறை செய்கிறார்கள்: 5.8 GHz CPU-கள், தனிப்பயன் திரவ குளிரூட்டும் சுற்றுகள் மற்றும் 8GB VRAM மட்டுமே கொண்ட வேகமான கேமிங் GPU-கள். ஆனால் தன்னியக்க டோக்கன் உருவாக்கம் நினைவக அலைவரிசை-கட்டுப்படுத்தப்பட்டது, கணக்கீடு-கட்டுப்படுத்தப்பட்டது அல்ல: ஒரு டோக்கனை வெளியிட, மாதிரியில் உள்ள ஒவ்வொரு எடையும் நினைவக பஸ் வழியாக பாய வேண்டும். உங்கள் எடைகள் அல்லது KV தற்காலிக சேமிப்பு சூழல் இயற்பியல் VRAM-ஐ மீறும்போது, ரன்டைம் அடுக்குளை PCIe வழியாக கணினி DDR5-க்கு மாற்றுகிறது, மேலும் நீங்கள் 20x நினைவக அலைவரிசை சரிவை சந்திக்கிறீர்கள்: வேகம் ஒரு வினாடிக்கு 40 டோக்கன்களில் இருந்து 1.5 ஆக குறைகிறது. இந்த கள சோதனையில், Niko வன்பொருள் இயக்கவியல், 4-பிட் குவாண்டிக்சன் மாதிரி அளவீட்டு விதிகள், $1,200 முதல் $5,000 வரையிலான மூன்று உண்மையான பட்ஜெட் நிலைகள், பயன்படுத்தப்பட்ட RTX 3090 24GB ஏன் கணினியில் சிறந்த VRAM-க்கு-டாலர் ஒப்பந்தம், Raspberry Pi எட்ஜ் சிக்கல் மற்றும் உள்ளூர் Vs கிளவுட் இன்ஃபரென்ஸ்க்கான ஹோம் ஜிம் மூலோபாயம் ஆகியவற்றை விளக்குகிறார். தீர்ப்பு: SHIP IT.
எழுத்துப்பூர்வ பதிப்பைப் படிக்கவும் (ஆங்கிலம்) ↗
இந்த வீடியோ எதைப் பற்றி விவாதிக்கிறது
- 20x நினைவக அலைவரிசை சரிவு: 936 GB/s GDDR6X Vs 50 GB/s DDR5 & 31.5 GB/s PCIe
- மாடல் அளவு @ 4-பிட்: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- நிலை 1 ($1,200–$1,500): RTX 4060 Ti 16GB (ஒருபோதும் 8GB இல்லை) அல்லது Mac Mini 16GB
- நிலை 2 ($1,500–$2,000): பயன்படுத்தப்பட்ட RTX 3090 24GB சிறந்த புள்ளி அல்லது Mac Mini M4 Pro 64GB
- நிலை 3 ($3,500+): RTX 4090 24GB / இரட்டை 3090கள் அல்லது Mac Studio Ultra
மொழிபெயர்க்கப்பட்ட டிரான்ஸ்கிரிப்ட்
அசல் ஆங்கில விளக்கத்திலிருந்து மொழிபெயர்க்கப்பட்டது. கிடைக்கும் ஆடியோ மற்றும் தலைப்புகள் YouTube ஆல் கட்டுப்படுத்தப்படுகின்றன.
0:00 நீங்கள் உள்ளூர் AI முகவர்களை இயக்க ஒரு PC ஐ உருவாக்க திட்டமிட்டால், கேமிங் ரிக் உருவாக்குவதை நிறுத்துங்கள். உங்களுக்கு ஒரு 5.8 ஜிகாஹெர்ட்ஸ் Core i9, ஒரு திரவ குளிரூட்டும் சுழற்சி, அல்லது RGB-யில் மூடப்பட்ட எட்டு ஜிகபைட் கிராபிக்ஸ் கார்டு தேவையில்லை. உள்ளூர் AI இன்ஃபரென்ஸில், கேமிங் விவரக்குறிப்புகள் கிட்டத்தட்ட பயனற்றவை. உங்கள் முகவர் இயங்குகிறதா அல்லது ஊர்ந்து செல்கிறதா என்பதை நிர்ணயிக்கும் ஒரே அளவுகோல் VRAM திறன் மற்றும் நினைவக பஸ் அலைவரிசை. வன்பொருள் சோதனையின் விதிகள்: CPU கிளாக்ஸ் மற்றும் ராஸ்டரைசேஷன் பெஞ்ச்மார்க்ஸ் பற்றி மறந்து விடுங்கள்.
0:24 நாங்கள் மூன்று எண்களைப் பற்றி கவலைப்படுகிறோம்: நினைவக பஸ் அகலம், ஒரு வினாடிக்கு ஜிகபைட்களில் அலைவரிசை, மற்றும் KV தற்காலிக சேமிப்பு பெருக்கத்திற்கான மூல VRAM ஹெட்ரூம். இந்த கள சோதனையில், நான் 20x நினைவக அலைவரிசை சரிவை விளக்குகிறேன், மாடல் அளவீட்டு விதிகளை வரைபடம் செய்கிறேன், $1,200 முதல் $5,000 வரையிலான மூன்று உண்மையான நிலைகளை பெஞ்ச்மார்க் செய்கிறேன், மற்றும் பயன்படுத்தப்பட்ட 3090 ஏன் இன்னும் கணினியின் மிகப்பெரிய ஏமாற்று குறியீடு என்பதை விளக்குகிறேன். இது The Daily Diff, கள சோதனை. கேமிங் ரிக்ஸ் ஏன் தோல்வியடைகின்றன என்பதைப் புரிந்துகொள்ள, டோக்கன் உருவாக்கம் உண்மையில் எவ்வாறு செயல்படுகிறது என்பதைப் பாருங்கள். கேம்களில், உங்கள் CPU டிராவ் கால்களை அளிக்கிறது மற்றும் உங்கள் GPU பிரேம்களை ரெண்டர் செய்கிறது.
0:54 ஆனால் தன்னியக்க LLM டிகோடிங் கிட்டத்தட்ட முழுமையாக நினைவக அலைவரிசை கட்டுப்படுத்தப்பட்டது. ஒரு டோக்கனை உருவாக்க, GPU மாடலின் ஒவ்வொரு எடை அளவுருவையும் நினைவகத்திலிருந்து அதன் கணக்கீட்டு கோர்கள் வழியாகப் பாய்ச்ச வேண்டும். மாடலின் ஒவ்வொரு எடை அளவுருவையும் நினைவகத்திலிருந்து அதன் கணக்கீட்டு கோர்கள் வழியாகப் பாய்ச்ச வேண்டும். உங்கள் மாடல் பத்து ஜிகபைட் ஆக இருந்தால், ஒரு டோக்கனை உருவாக்குவது பத்து ஜிகபைட் தரவைப் படிப்பதைக் குறிக்கிறது. 384-பிட் நினைவக பஸ் கொண்ட Nvidia RTX 3090 இல், நீங்கள் ஒரு வினாடிக்கு 936 ஜிகபைட் GDDR6X அலைவரிசையைப் பெறுவீர்கள், ஒரு வினாடிக்கு எண்பது டோக்கன்களை உற்பத்தி செய்கிறது. ஆனால் உங்கள் மாடல் இயற்பியல் VRAM ஐ மீறும் வினாடியில் என்ன நடக்கிறது என்று பாருங்கள்.
1:22 VRAM நிரம்பும்போது, ரன்டைம் மீதமுள்ள அடுக்குகளை PCIe பஸ் வழியாக கணினி DDR5 நினைவகத்திற்கு மாற்றுகிறது. கணினி DDR5 நினைவகத்திற்கு மாற்றுகிறது. உங்கள் GPU கோர்கள் ஒரு வினாடிக்கு ஆயிரம் ஜிகபைட்களை எதிர்பார்க்கின்றன. அதற்குப் பதிலாக, இரட்டை-சேனல் DDR5 அவர்களுக்கு ஐம்பது அளிக்கிறது, மேலும் PCIe 4 முப்பத்தொன்றில் அடைக்கிறது. அது 20x அலைவரிசை சரிவு. டோக்கன் உருவாக்கும் பைப்லைன் உடனடியாக பஸ்ஸுக்காக காத்திருந்து ஸ்தம்பிக்கிறது, மற்றும் வேகம் ஒரு வினாடிக்கு நாற்பது டோக்கன்களில் இருந்து 1.5 ஆக குறைகிறது. நீங்கள் ஒரு $2,000 ரிக்-ஐ ஒரு ஸ்பேஸ் ஹீட்டராக மாற்றிவிட்டீர்கள்.
1:47 மற்றும் பல-முறை முகவர் இயக்கங்களின் போது அது மோசமடைகிறது, ஏனெனில் எடைகள் பாதி மட்டுமே. ஒவ்வொரு ப்ராம்ட், கருவி அழைப்பு மற்றும் கோப்புத் துண்டும் Key-Value தற்காலிக சேமிப்பில் சேமிக்கப்படும். ஒரு 32k சூழல் சாளரம் எடைகளுக்கு மேல் நான்கு முதல் எட்டு ஜிகபைட் VRAM ஐ ஜீரணிக்க முடியும். எடைகளுக்கு மேல் நான்கு முதல் எட்டு ஜிகபைட் VRAM ஐ ஜீரணிக்க முடியும். உங்கள் கார்டில் வெறும் பதினாறு ஜிகபைட் இருந்தால், உங்கள் முகவர் இரண்டு முறை சுழலும், சூழல் சுவரைத் தாக்கும், மேலும் நினைவகப் பற்றாக்குறை பிழையுடன் செயலிழக்கும் அல்லது DDR5 இல் பரவும். இங்கே 4-பிட் அளவீட்டு ஏமாற்று தாள். Llama 3.1 அல்லது DeepSeek Distill போன்ற ஏழு அல்லது எட்டு பில்லியன் அளவுரு மாடல்
2:16 சுமார் ஐந்து ஜிகபைட் எடுக்கும். ஒரு பதினான்கு பில்லியன் மாடல் பத்து ஜிகபைட் எடுக்கும். ஒரு முப்பத்தி இரண்டு பில்லியன் மாடல், கோடிங் முகவர்களுக்கான நுண்ணறிவு இனிப்பு புள்ளி, இருபது ஜிகபைட் தேவைப்படுகிறது. மற்றும் ஒரு எழுபது பில்லியன் எல்லை மாடல் நீங்கள் சூழலை ஒதுக்குவதற்கு முன்பே நாற்பது ஜிகபைட் தேவைப்படுகிறது. இதுவே உண்மையான வன்பொருள் கட்டமைப்புகளுக்கு நம்மை கொண்டு வருகிறது. நிலை 1 என்பது தொடக்க ரிக், $1,200 முதல் $1,500 வரை. PC இல், உங்கள் அன்க்கர் ஒரு RTX 4060 Ti 16-ஜிகபைட்.
2:39 முக்கிய எச்சரிக்கை: ஒருபோதும் 8GB பதிப்பை $70 சேமிப்பதற்காக வாங்காதீர்கள். 8GB பதிப்பை $70 சேமிப்பதற்காக வாங்காதீர்கள். 2026 இல் எட்டு ஜிகபைட் VRAM எந்தவொரு உண்மையான முகவர் பணிப்பாய்விலும் உடனடி நினைவகப் பற்றாக்குறை மரண தண்டனை. எந்தவொரு உண்மையான முகவர் பணிப்பாய்விலும் உடனடி நினைவகப் பற்றாக்குறை மரண தண்டனை. அதை ஒரு ஆறு-கோயர் Ryzen 5, அறுபத்தி நான்கு ஜிகபைட் DDR5, மற்றும் இரண்டு டெராபைட் NVMe டிரைவுடன் இணைக்கவும். ஆப்பிள் உலகில், அதற்கு சமமானது ஒரு Mac Mini அல்லது MacBook Pro பதினாறு ஜிகபைட் யூனிஃபைட் மெமரியுடன். ஜிகபைட் யூனிஃபைட் மெமரியுடன்.
3:02 எட்டு பில்லியன் மாடல்களில் ஒரு வினாடிக்கு நாற்பது முதல் ஐம்பது டோக்கன்களைப் பார்ப்பீர்கள். நிலை 2 என்பது பவர் யூசர் இனிப்பு புள்ளி: Qwen 2.5 32B போன்ற முப்பத்தி இரண்டு பில்லியன் அளவுரு மாடல்களை இயக்க குறிப்பாக உருவாக்குதல். Qwen 2.5 32B போன்ற முப்பத்தி இரண்டு பில்லியன் அளவுரு மாடல்களை இயக்க குறிப்பாக உருவாக்குதல். பாதை A என்பது எட்டு நூறு டாலர்களுக்கு பதினாறு ஜிகபைட் கொண்ட புதிய RTX 4070 Ti Super. ஆனால் பாதை B எனது வலுவான பரிந்துரை: பயன்படுத்தப்பட்ட Nvidia RTX 3090 இருபத்தி நான்கு ஜிகபைட் வாங்கவும். eBay இல் $650 முதல் $750 வரை சுத்தமான 3090களை நீங்கள் காணலாம். eBay இல் $650 முதல் $750 வரை சுத்தமான 3090களை நீங்கள் காணலாம். அது ஒரு பெரிய 384-பிட் பஸ்ஸில் 936 ஜிகபைட் ஒரு வினாடிக்கு செலுத்தி இருபத்தி நான்கு ஜிகபைட் VRAM ஐ உங்களுக்கு அளிக்கிறது.
3:33 936 ஜிகபைட் ஒரு வினாடிக்கு செலுத்தி இருபத்தி நான்கு ஜிகபைட் VRAM ஐ உங்களுக்கு அளிக்கிறது. டாலருக்கு டாலர், இது கணினியில் சிறந்த VRAM ஒப்பந்தம். macOS இல், நிலை 2 counterpart என்பது அறுபத்தி நான்கு ஜிகபைட் யூனிஃபைட் மெமரி கொண்ட Mac Mini M4 Pro. யூனிஃபைட் மெமரி கொண்ட Mac Mini M4 Pro. இது முப்பத்தி இரண்டு பில்லியன் மாடலில் ஒரு வினாடிக்கு பதினொரு முதல் பன்னிரண்டு டோக்கன்களை உற்பத்தி செய்கிறது: Nvidia ஐ விட மெதுவாக, ஆனால் முப்பது வாட்ஸ்-ல் மரண அமைதியானது மற்றும் ஒரு பெரிய சூழல் சாளரத்திற்கு இடம் உண்டு. நிலை 3 என்பது பல-முகவர் கூட்டங்களுக்கான ஆர்வலர் பிராக்கெட். PC இல், அதாவது இருபத்தி நான்கு ஜிகபைட் கொண்ட ஒரு RTX 4090,
3:57 ஒரு Ryzen 9, மற்றும் நூற்று இருபத்தி எட்டு ஜிகபைட் RAM, அல்லது நாற்பத்தி எட்டு ஜிகபைட் மொத்த VRAM ஐ வழங்கும் இரட்டை RTX 3090s. ஆப்பிளின் வரிசையில், இது தொண்ணூறு ஆறு முதல் நூற்று இருபத்தி எட்டு ஜிகபைட் யூனிஃபைட் மெமரி கொண்ட Mac Studio Ultra. யூனிஃபைட் மெமரி கொண்ட Mac Studio Ultra. சூப்பர் பவர் என்பது நினைவக இருப்பு: நீங்கள் ஒரு எம்பெடிங் மாடல், ஒரு வேகமான ரவுட்டர், மற்றும் ஒரு 32-பில்லியன் கோடிங் மாடலை ஒரே நேரத்தில் ஏற்றலாம் பூஜ்ஜிய ஸ்வாப் தாமதத்துடன். இப்போது எங்கள் கள சோதனையின் நேர்மையான தோல்விக்கு: எட்ஜ் கம்ப்யூட்டிங் பொறி.
4:24 ஒவ்வொரு வாரமும் ஒரு சமூக இடுகை நீங்கள் ஒரு $80 Raspberry Pi 5 இல் தன்னாட்சி கோடிங் முகவர்களை இயக்க முடியும் என்று கூறுகிறது. நான் அதை சோதித்தேன். நான் அதை சோதித்தேன். ஒரு சிறிய 1.5 பில்லியன் அளவுரு மாடலை இயக்குவது ஒரு வினாடிக்கு மூன்று டோக்கன்களை மட்டுமே அளிக்கிறது, அதே நேரத்தில் போர்டு எண்பத்தி ஐந்து டிகிரி செல்சியஸில் தடைபடுகிறது. ஒரு வினாடிக்கு மூன்று டோக்கன்களை மட்டுமே அளிக்கிறது, அதே நேரத்தில் போர்டு எண்பத்தி ஐந்து டிகிரி செல்சியஸில் தடைபடுகிறது. இது ஒரு அருமையான வார இறுதி பொம்மை, ஆனால் ஒரு தினசரி வளர்ச்சி இயக்கி ஆக, இது தூய தண்டனை. மென்பொருளுக்கு, Cursor, Cline, அல்லது VS Code உடன் நேரடியாக இணைக்கும் ஒரு சுத்தமான கட்டளை-வரிசை டீமன் வேண்டும் என்றால் Ollama ஐப் பயன்படுத்தவும்.
4:47 நேரடியாக இணைக்கும் ஒரு சுத்தமான கட்டளை-வரிசை டீமன் வேண்டும் என்றால் Ollama ஐப் பயன்படுத்தவும். மாடல் டவுன்லோடுகள் மற்றும் GPU லேயர் ஸ்லைடர்களுடன் கூடிய கிராஃபிக்கல் விளையாட்டு மைதானம் வேண்டும் என்றால், LM Studio ஐப் பயன்படுத்தவும். மற்றும் உங்கள் வடிவத்தை உங்கள் சிலிக்கானுடன் பொருத்தவும். ஆப்பிள் சிலிக்கானில், எப்போதும் Metal க்காக உகந்ததாக வடிவமைக்கப்பட்ட GGUF மாடல்களைப் பதிவிறக்கவும். Windows அல்லது Linux இல் Nvidia உடன், AWQ அல்லது EXL2 மாடல்களைப் பதிவிறக்கவும், இது 20 முதல் 30 சதவீதம் வேகமான இன்ஃபரென்ஸ்க்கு Nvidia Tensor Cores ஐப் பயன்படுத்துகிறது. எனவே நீங்கள் நொடித்துப் போகாமல் இதை எவ்வாறு பயன்படுத்துவது?
5:11 உள்ளூர் வன்பொருளை ஒரு வீட்டு உடற்பயிற்சிக் கூடமாக அல்லது வணிக உடற்பயிற்சிக் கூடமாக சிந்தியுங்கள். வீட்டில் ஒரு ஸ்குவாட் ரேக் இருப்பது பூஜ்ஜிய பயணத்துடன், பூஜ்ஜிய சந்தா கட்டணங்களுடன், மற்றும் முழுமையான தனியுரிமையுடன் தினமும் பயிற்சி பெறலாம். பூஜ்ஜிய சந்தா கட்டணங்களுடன், மற்றும் முழுமையான தனியுரிமையுடன் தினமும் பயிற்சி பெறலாம். உங்கள் உள்ளூர் இயந்திரம் உங்கள் தினசரி கோடிங், யூனிட் சோதனை, மற்றும் ஒரு டோக்கனுக்கு பூஜ்ஜிய டாலர்களுக்கு தனிப்பட்ட ஆவண செயலாக்கத்தை எண்பது சதவீதம் கையாள்கிறது. யூனிட் சோதனை, மற்றும் ஒரு டோக்கனுக்கு பூஜ்ஜிய டாலர்களுக்கு தனிப்பட்ட ஆவண செயலாக்கத்தை எண்பது சதவீதம் கையாள்கிறது. நீங்கள் ஐந்நூறு பவுண்டுகள் டெட்லிஃப்ட் செய்ய வேண்டியிருக்கும் போது - ஐம்பது கோப்புகளில் ஒரு பெரிய களஞ்சிய-அகல கட்டிடக்கலை மறுசீரமைப்பு போல - நீங்கள் வணிக உடற்பயிற்சிக் கூடத்திற்குச் செல்கிறீர்கள்: Claude 3.5 Sonnet அல்லது OpenAI o3 க்கு கிளவுட் API க்கு பதினைந்து நிமிடங்களுக்கு பணம் செலுத்தி आगे தொடருங்கள். Claude 3.5 Sonnet அல்லது OpenAI o3 க்கு கிளவுட் API க்கு பதினைந்து நிமிடங்களுக்கு பணம் செலுத்தி आगे தொடருங்கள். Claude 3.5 Sonnet அல்லது OpenAI o3 க்கு கிளவுட் API க்கு பதினைந்து நிமிடங்களுக்கு பணம் செலுத்தி आगे தொடருங்கள்.
5:38 மற்றும் आगे தொடருங்கள். இங்கே பில்: பயன்படுத்தப்பட்ட 3090 கொண்ட ஒரு நிலை 2 உருவாக்கம் அனைத்தும் சேர்த்து $1,600 செலவாகும். நீங்கள் மாதத்திற்கு $50 முதல் $100 வரை API டோக்கன்களில் செலவழித்தால், இது பதினெட்டு மாதங்களில் தன்னைத்தானே செலுத்திவிடும், அதே நேரத்தில் உங்கள் தனியுரிம குறியீட்டுத் தளத்தை மூன்றாம் தரப்பு சேவையகங்களிலிருந்து விலக்கி வைக்கும். மூன்றாம் தரப்பு சேவையகங்களிலிருந்து விலக்கி வைக்கும். இன்றைய கள சோதனை தீர்ப்பு: SHIP IT. VRAM மற்றும் நினைவக அலைவரிசை ஒவ்வொரு முறையும் கிளாக் வேகத்தை வெல்லும். AI க்காக ஐந்து ஜிகாஹெர்ட்ஸ் CPU-கள் வாங்குவதை நிறுத்துங்கள், மற்றும் ஒரு பயன்படுத்தப்பட்ட 3090 ஐக் கண்டறியுங்கள்.
6:04 உள்ளூர் மாடல்களுக்காக நீங்கள் என்ன வன்பொருள் கட்டமைப்பை இயக்குகிறீர்கள் என்பதை கருத்துகளில் சொல்லுங்கள். மற்றும் நீங்கள் இந்த விளக்கத்தைப் படிக்க விரும்பினால், தினசரி டிஃப் டாட் டெவ் இல் செய்திமடலைப் பெறுங்கள், கீழே உள்ள இணைப்பு. மற்றும் நீங்கள் இந்த விளக்கத்தைப் படிக்க விரும்பினால், தினசரி டிஃப் டாட் டெவ் இல் செய்திமடலைப் பெறுங்கள், கீழே உள்ள இணைப்பு. மற்றும் இன்றைய வேறுபாடு அவ்வளவுதான். நான் Axrisi இலிருந்து Niko. பொறுப்புடன் ஒன்றிணைக்கவும்.
ஆதாரங்கள்
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



