# Paikallisen tekoälylaitteiston opas (2026)

Published: 2026-09-14

Rakentaessaan konetta paikallisille tekoälyagenteille ja avoimen painon LLM-malleille kehittäjät tekevät virheen ostaessaan pelitietokoneen teknisiä tietoja: 5.8 GHz suorittimia, räätälöityjä nestejäähdytyssilmukoita ja nopeita pelinäytönohjaimia, joissa on vain 8 Gt VRAMia. Mutta autoregressiivinen tokenien generointi on muistin kaistanleveyden rajoittamaa, ei laskentatehon: yhden tokenin lähettämiseksi jokaisen mallin painon on virrattava muistiväylän kautta. Kun painosi tai KV-välimuistin konteksti ylittää fyysisen VRAMin, ajonaikainen ympäristö siirtää kerrokset järjestelmän DDR5-muistiin PCIe-väylän kautta, ja törmäät 20-kertaiseen muistin kaistanleveyden pudotukseen: nopeus romahtaa 40 tokenista sekunnissa 1,5:een. Tässä kenttätestissä Niko selittää laitteiston mekaniikan, 4-bittisen kvantisointimallin koon säännöt, kolme todellista budjettitasoa 1 200 dollarista 5 000 dollariin, miksi käytetty RTX 3090 24GB on paras VRAM-per-dollari-tarjous tietotekniikassa, Raspberry Pi -reunahaitarin ja kotikuntosalistrategian paikallisen ja pilven päätelmille. Tuomio: SHIP IT.

Canonical: https://thedailydiff.dev/fi/video/2026-09-14-local-ai-hardware/

## Mitä tämä video käsittelee

- 20-kertainen muistin kaistanleveyden pudotus: 936 Gt/s GDDR6X vs 50 Gt/s DDR5 ja 31.5 Gt/s PCIe
- Mallin koko @ 4-bittinen: 8B (5 Gt), 14B (10 Gt), 32B (20 Gt), 70B (40 Gt)
- Taso 1 (1 200–1 500 dollaria): RTX 4060 Ti 16GB (ei koskaan 8GB) tai Mac Mini 16GB
- Taso 2 (1 500–2 000 dollaria): Käytetty RTX 3090 24GB "sweet spot" tai Mac Mini M4 Pro 64GB
- Taso 3 (3 500+ dollaria): RTX 4090 24GB / kaksi 3090-korttia tai Mac Studio Ultra

## Käännetty transkriptio

Käännetty alkuperäisestä englanninkielisestä selostuksesta. Käytettävissä olevan äänen ja tekstitysten hallinta tapahtuu YouTuben kautta.

0:00 Jos aiot rakentaa tietokoneen paikallisten tekoälyagenttien ajamiseen, lopeta pelikoneen rakentaminen. Et tarvitse 5.8 gigahertsin Core i9:ää, nestejäähdytyssilmukkaa, tai kahdeksan gigatavun näytönohjainta täynnä RGB-valaistusta. Paikallisessa tekoälypäätelmässä pelin tekniset tiedot ovat käytännössä hyödyttömiä. Ainoa mittari, joka määrää, toimiiko agenttisi vai hiipiikö se, on VRAM-kapasiteetti ja muistiväylän kaistanleveys. Laitteistotestin säännöt: unohda suorittimen kellot ja rasterointivertailut.

0:24 Välitämme kolmesta luvusta: muistiväylän leveys, kaistanleveys gigatavuina per sekunti ja raaka VRAM-tila KV-välimuistin turpoamista varten. Tässä kenttätestissä käyn läpi 20-kertaisen muistin kaistanleveyden pudotuksen, kartoitan mallin mitoitussäännöt, vertailen kolme todellista hintatasoa kahdestatuhannesta dollarista viiteen tuhanteen, ja selitän, miksi käytetty 3090 on edelleen tietokoneiden suurin huijauskoodi. Tämä on The Daily Diff, kenttätesti. Ymmärtääksesi, miksi pelikoneet epäonnistuvat, katso, miten tokenien generointi todella toteutuu. Peleissä suorittimesi syöttää piirtokutsuja ja näytönohjaimesi renderöi kehyksiä.

0:54 Mutta autoregressiivinen LLM-dekoodaus on lähes puhtaasti muistin kaistanleveyden rajoittamaa. Yhden tokenin generoimiseksi näytönohjaimen on virrattava jokainen mallin painoparametri muistista laskentaytimiinsä. Jos mallisi on kymmenen gigatavua, yhden tokenin tuottaminen tarkoittaa kymmenen gigatavun datan lukemista. Nvidia RTX 3090:ssä, jossa on 384-bittinen muistiväylä, saat 936 gigatavua sekunnissa GDDR6X-kaistanleveyttä, tuottaen kahdeksankymmentä tokenia sekunnissa. Mutta katso, mitä tapahtuu sillä hetkellä, kun mallisi ylittää fyysisen VRAMin.

1:22 Kun VRAM täyttyy, ajonaikaiset ympäristöt purkavat jäljellä olevat kerrokset PCIe-väylän kautta järjestelmän DDR5-muistiin. Näytönohjaimen ytimet odottavat tuhat gigatavua sekunnissa. Sen sijaan kaksikanavainen DDR5 syöttää niille viisikymmentä, ja PCIe 4 tukkeutuu kolmessakymmenessäyhdessä. Tämä on 20-kertainen kaistanleveyden romahtaminen. Tokenien generointiputki pysähtyy välittömästi odottaen väylää, ja nopeus romahtaa neljästäkymmenestä tokenista sekunnissa yhteen ja puoleen. Olet muuttanut kahdentuhannen dollarin koneen lämmittimeksi.

1:47 Ja se pahenee usean kierroksen agenttiajojen aikana, koska painot ovat vain puolet taistelusta. Jokainen kehotus, työkalukutsu ja tiedostopala tallennetaan Key-Value- välimuistiin. 32K-konteksti-ikkuna voi käyttää neljästä kahdeksaan gigatavua VRAMia painojen lisäksi. Jos kortissasi on vain kuusitoista gigatavua, agenttisi silmukoi kahdesti, törmää kontekstiseinään ja joko kaatuu muistivajausvirheeseen tai vuotaa DDR5-muistiin. Tässä on 4-bittinen mitoitusohje. Seitsemän tai kahdeksan miljardin parametrin malli, kuten Llama 3.1 tai DeepSeek Distill,

2:16 vie noin viisi gigatavua. Neljäntoista miljardin malli vie kymmenen gigatavua. Kolmenkymmenenkahden miljardin malli, koodausagenttien älykkyyden "sweet spot", vaatii kaksikymmentä gigatavua. Ja seitsemänkymmenen miljardin rajapajamalli vaatii neljäkymmentä gigatavua, ennen kuin edes varataan kontekstia. Mikä tuo meidät todellisiin laitteistorakenteisiin. Taso 1 on aloitusvarustus, 1 200–1 500 dollaria. PC:llä ankkurisi on RTX 4060 Ti 16-gigatavuinen.

2:39 Kriittinen varoitus: älä koskaan osta kahdeksan gigatavun versiota säästääksesi seitsemänkymmentä dollaria. Kahdeksan gigatavua VRAMia vuonna 2026 on välitön muistivajauskuolemantuomio missä tahansa todellisessa agenttityönkulussa. Yhdistä se kuusiytimiseen Ryzen 5:een, kuuteenkymmeneenneljään gigatavuun DDR5:tä, ja kahden teratavun NVMe-asemaan. Apple-maailmassa vastaava on Mac Mini tai MacBook Pro kuudellatoista gigatavulla yhtenäistä muistia.

3:02 Saat 40–50 tokenia sekunnissa kahdeksan miljardin malleilla. Taso 2 on tehokäyttäjän "sweet spot": rakennetaan erityisesti 32 miljardin parametrin mallien, kuten Qwen 2.5 32B:n, ajamiseen. Reitti A on uusi RTX 4070 Ti Super kuudellatoista gigatavulla kahdeksalla sadalla dollarilla. Mutta Reitti B on vahva suositukseni: osta käytetty Nvidia RTX 3090 24 gigatavua. Löydät siistejä 3090-kortteja eBaysta 650–750 dollarilla. Tämä antaa sinulle 24 gigatavua VRAMia massiivisella 384-bittisellä väylällä, joka työntää

3:33 936 gigatavua sekunnissa. Dollari dollarilta, se on paras VRAM-tarjous tietotekniikassa. macOS:llä Tason 2 vastine on Mac Mini M4 Pro kuudellakymmenelläneljällä gigatavulla yhtenäistä muistia. Se tuottaa 11–12 tokenia sekunnissa 32 miljardin mallilla: hitaampi kuin Nvidia, mutta täysin hiljainen 30 watilla ja tilaa jättimäiselle konteksti-ikkunalle. Taso 3 on harrastajaluokka moniagenttiparvia varten. PC:llä se tarkoittaa RTX 4090:tä 24 gigatavulla,

3:57 Ryzen 9:ää ja 128 gigatavua RAMia, tai kahta RTX 3090:tä, jotka tarjoavat yhteensä 48 gigatavua VRAMia. Applen valikoimassa tämä on Mac Studio Ultra 96–128 gigatavulla yhtenäistä muistia. Supervoima on muistin pysyvyys: voit pitää upotusmallin, nopean reitittimen ja 32 miljardin koodausmallin ladattuna samanaikaisesti ilman vaihtoviivettä. Nyt kenttätestimme rehelliseen epäonnistumiseen: reunalaskennan ansa.

4:24 Joka viikko sosiaalisessa mediassa väitetään, että voit ajaa autonomisia koodausagentteja kahdeksankymmenen dollarin Raspberry Pi 5:llä. Testasin sen. Ajaminen pientä 1.5 miljardin parametrin mallia antaa sinulle tuskin kolme tokenia sekunnissa, kun kortti kuristaa itsensä 85 Celsius-asteessa. Se on näppärä viikonloppulelu, mutta päivittäisenä kehitystyökaluna se on puhdasta rangaistusta. Ohjelmistojen osalta käytä Ollamaa, jos haluat puhtaan komentorivipalvelun, joka yhdistyy

4:47 suoraan Cursooriin, Clineen tai VS Codeen. Jos haluat graafisen leikkikentän mallilatauksilla ja näytönohjaimen kerrosliukusäätimillä, käytä LM Studiota. Ja sovita formaattisi piisi kanssa. Apple Siliconilla lataa aina GGUF-mallit, jotka on optimoitu Metalille. Windowsilla tai Linuxilla Nvidian kanssa lataa AWQ- tai EXL2-mallit, jotka hyödyntävät Nvidia Tensor Coreja 20–30 prosenttia nopeampaan päättelyyn. Miten siis toteutat tämän ilman, että joudut vararikkoon?

5:11 Ajattele paikallista laitteistoa kuin kotikuntosalia verrattuna kaupalliseen kuntosaliin. Kyykkyräkin omistaminen kotona tarkoittaa, että harjoittelet joka päivä ilman matkustamista, ilman tilausmaksuja ja täysin yksityisesti. Paikallinen koneesi hoitaa kahdeksankymmentä prosenttia päivittäisestä koodauksestasi, yksikkötestauksesta ja yksityisten asiakirjojen käsittelystä nolla dollaria per token. Ja kun sinun on nostettava viisisataa kiloa – kuten massiivinen repo-laajuinen arkkitehtoninen uudelleenjärjestely viidenkymmenen tiedoston yli – vierailet kaupallisella kuntosalilla: maksa pilvi-API:lle Claude 3.5 Sonnetista tai OpenAI o3:sta viidentoista minuutin ajan

5:38 ja jatka eteenpäin. Tässä on lasku: Tason 2 rakennelma käytetyllä 3090:llä maksaa 1 600 dollaria kaikki mukaan lukien. Jos käytät 50–100 dollaria kuukaudessa API-tokeneihin, se maksaa itsensä takaisin kahdeksassatoista kuukaudessa pitäen samalla oman koodikannan poissa kolmannen osapuolen palvelimilta. Tämän päivän kenttätestin tuomio: SHIP IT. VRAM ja muistin kaistanleveys voittavat kellotaajuudet joka kerta. Lopeta viiden gigahertsin suorittimien ostaminen tekoälyä varten ja hanki käytetty 3090.

6:04 Kerro kommenteissa, mitä laitteistorakennetta käytät paikallisille malleille. Ja jos haluat mieluummin lukea tämän analyysin, tilaa uutiskirje osoitteesta the daily diff dot dev, linkki alla. Ja se on tämän päivän ero. Olen Niko Axrisista. Yhdistä vastuullisesti.

## Lähteet

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
