+− THE DAILY DIFFdev & AI news
SHIP IT

ローカルAIハードウェアガイド (2026)

ローカルAIエージェントとオープンウェイトLLM用のマシンを構築する際、開発者はゲーミングPCのスペックを購入するという過ちを犯します。

ローカルAIエージェントとオープンウェイトLLM用のマシンを構築する際、開発者はゲーミングPCのスペックを購入するという過ちを犯します。例えば、5.8GHzのCPU、カスタム液冷ループ、VRAMが8GBしかない高速ゲーミングGPUなどです。しかし、自己回帰型トークン生成は計算能力ではなくメモリ帯域幅に制約されます。1つのトークンを生成するために、モデル内のすべてのウェイトがメモリバスを介してストリーミングされる必要があります。ウェイトまたはKVキャッシュコンテキストが物理VRAMを超えると、ランタイムはPCIe経由でレイヤーをシステムDDR5にオフロードし、メモリ帯域幅が20倍低下します。これにより、速度は毎秒40トークンから1.5トークンに急落します。このフィールドテストでは、Nikoがハードウェアの仕組み、4ビット量子化モデルのサイズ決定ルール、1,200ドルから5,000ドルの3つの実際の予算ティア、中古のRTX 3090 24GBがコンピューティングで最高のVRAM対価格比である理由、Raspberry Piのエッジトラップ、およびローカル推論とクラウド推論のためのホームジム戦略を詳しく説明します。結論: SHIP IT。

書面版を読む(英語) ↗

この動画の要点

  • 20倍のメモリ帯域幅の断崖絶壁: 936GB/s GDDR6X vs 50GB/s DDR5 & 31.5GB/s PCIe
  • モデルサイジング@4ビット: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Tier 1 (1,200ドル~1,500ドル): RTX 4060 Ti 16GB (8GBは絶対NG) または Mac Mini 16GB
  • Tier 2 (1,500ドル~2,000ドル): 中古のRTX 3090 24GBがスイートスポット または Mac Mini M4 Pro 64GB
  • Tier 3 (3,500ドル以上): RTX 4090 24GB / デュアル3090 または Mac Studio Ultra

翻訳されたトランスクリプト

オリジナルの英語ナレーションから翻訳されています。利用可能なオーディオとキャプションはYouTubeによって管理されています。

0:00 ローカルAIエージェントを実行するためのPCを構築する予定があるなら、 ゲーミングリグを構築するのはやめてください。 5.8GHzのCore i9も、液冷ループも、 RGBで覆われた8GBのグラフィックカードも必要ありません。 ローカルAI推論において、ゲーミングスペックは実質的に役に立ちません。 エージェントが動作するか、それともカクカクするかを決定する唯一の指標はVRAM容量です。 そしてメモリバス帯域幅です。 ハードウェアテストのルール:CPUクロックとラスタライゼーションベンチマークは忘れてください。

0:24 私たちが気にするのは、メモリバス幅、1秒あたりのギガバイト単位の帯域幅、 そしてKVキャッシュの肥大化のための生VRAMヘッドルームという3つの数字です。 このフィールドテストでは、20倍のメモリ帯域幅の断崖絶壁を詳しく説明し、 モデルのサイジングルールをマッピングし、1200ドルから5000ドルまでの3つの実際のティアをベンチマークし、 なぜ中古の3090が依然としてコンピューティングの最大のチートコードであるかを説明します。これはThe Daily Diff、フィールドテストです。 チートコードです。これはThe Daily Diff、フィールドテストです。 ゲーミングリグが失敗する理由を理解するには、トークン生成が実際に どのように実行されるかを見てください。ゲームでは、CPUがドローコールを供給し、GPUがフレームをレンダリングします。

0:54 しかし、自己回帰型LLMデコードは、ほぼ純粋にメモリ帯域幅に 制約されます。1つのトークンを生成するために、GPUはモデルのすべてのウェイトパラメータをメモリから その計算コアを通してストリーミングする必要があります。 モデルが10GBの場合、1つのトークンを生成するには10GBのデータを 読み取ることを意味します。384ビットメモリバスを持つNvidia RTX 3090では、 936ギガバイト/秒のGDDR6X帯域幅が得られ、 毎秒80トークンを生成します。 しかし、モデルが物理VRAMを超えた瞬間に何が起こるか見てください。

1:22 VRAMがいっぱいになると、ランタイムは残りのレイヤーをPCIeバス経由で システムDDR5メモリにオフロードします。 GPUコアは毎秒1000ギガバイトを期待します。 しかし、デュアルチャネルDDR5は50ギガバイトしか供給せず、PCIe 4は31ギガバイトで詰まります。 これは20倍の帯域幅の崩壊です。 トークン生成パイプラインはバスを待って即座に停止し、 速度は毎秒40トークンから1.5トークンに急落します。 2000ドルのリグを暖房器具に変えてしまったのです。

1:47 そして、複数ターンのエージェント実行ではさらに悪化します。なぜなら、ウェイトは戦いの半分に 過ぎないからです。すべてのプロンプト、ツール呼び出し、ファイルチャンクはキーバリュー キャッシュに保存されます。32kのコンテキストウィンドウは、ウェイトに加えて4〜8ギガバイトの VRAMを消費する可能性があります。 カードが16ギガバイトしかない場合、エージェントは2回ループし、 コンテキストの壁にぶつかり、メモリ不足エラーでクラッシュするか、DDR5に あふれ出ます。これが4ビットサイジングのチートシートです。 Llama 3.1やDeepSeek Distillのような70億または80億パラメータのモデルは、

2:16 約5ギガバイトを消費します。 140億パラメータのモデルは10ギガバイトを消費します。 320億パラメータのモデルは、コーディングエージェントにとってのインテリジェンスのスイートスポットで、 20ギガバイトを必要とします。 そして、700億パラメータのフロンティアモデルは、コンテキストを割り当てる前から40ギガバイトを 要求します。これで実際のハードウェアビルドに移りましょう。 Tier 1はスターターリグで、1200ドルから1500ドルです。 PCでは、RTX 4060 Ti 16ギガバイトがアンカーとなります。

2:39 重大な警告: 70ドル節約するために8ギガバイト版を 決して購入しないでください。 2026年における8ギガバイトのVRAMは、実際のエージェントワークフローでは 即座にメモリ不足による死刑宣告となります。 これを6コアのRyzen 5、64ギガバイトのDDR5、 2テラバイトのNVMeドライブと組み合わせてください。 Apple製品では、同等品は16ギガバイトのユニファイドメモリを搭載したMac MiniまたはMacBook Proです。 ギガバイトのユニファイドメモリです。

3:02 80億パラメータのモデルで毎秒40〜50トークンを確認できます。 Tier 2はパワーユーザーのスイートスポットです。特にQwen 2.5 32Bのような 320億パラメータのモデルを実行するために構築されます。 パスAは、800ドルで16ギガバイトの新しいRTX 4070 Ti Superです。 しかし、パスBが私の強い推奨です。中古のNvidia RTX 3090 24ギガバイトを購入してください。eBayで650ドルから750ドルで きれいな3090を見つけることができます。 これにより、384ビットの巨大なバスで24ギガバイトのVRAMが得られ、

3:33 毎秒936ギガバイトをプッシュします。 ドルあたりで見ると、コンピューティングで最高のVRAM取引です。 macOSでは、Tier 2の対応機種は64ギガバイトのユニファイドメモリを搭載したMac Mini M4 Proです。 のユニファイドメモリです。 320億パラメータのモデルで毎秒11〜12トークンを生成します。 Nvidiaより遅いですが、30ワットで完全に静かで、巨大なコンテキスト ウィンドウの余地があります。Tier 3はマルチエージェントスウォーム Enthusiastブラケットです。 PCでは、これは24ギガバイトのRTX 4090、

3:57 Ryzen 9、128ギガバイトのRAM、 または合計48ギガバイトのVRAMを提供するデュアルRTX 3090を意味します。 Appleのラインアップでは、これは96〜128ギガバイトのユニファイドメモリを搭載したMac Studio Ultraです。 のユニファイドメモリです。 その超能力はメモリ常駐です。埋め込みモデル、高速ルーター、 320億パラメータのコーディングモデルを同時にロードでき、 スワップ遅延はゼロです。 さて、このフィールドテストの正直な失敗についてです。エッジコンピューティングの落とし穴です。

4:24 毎週、80ドルのRaspberry Pi 5で自律コーディングエージェントを 実行できるというソーシャル投稿があります。 試してみました。 小さな15億パラメータのモデルを実行すると、基板が85度摂氏でスロットルしながら、かろうじて毎秒3トークンしか 得られません。 楽しい週末のおもちゃとしては良いですが、日常の開発ドライバーとしては、 純粋な罰です。 ソフトウェアについては、Cursor、Cline、またはVS Codeに直接接続するクリーンなコマンドラインデーモンが必要な場合は、Ollamaを使用してください。

4:47 Use Ollama if you want a clean command-line daemon that connects モデルのダウンロードとGPUレイヤースライダーを備えたグラフィカルなプレイグラウンドが必要な場合は、 LM Studioを使用してください。 そして、フォーマットをシリコンに合わせてください。 Apple Siliconでは、常にMetalに最適化されたGGUFモデルをダウンロードしてください。 Nvidiaを搭載したWindowsまたはLinuxでは、AWQまたはEXL2モデルをダウンロードしてください。 これはNvidia Tensor Coresを利用して、20〜30パーセント高速な推論を実現します。 では、破産せずにこれを展開するにはどうすればよいでしょうか?

5:11 ローカルハードウェアをホームジムと商業ジムのように考えてください。 自宅にスクワットラックがあれば、通勤ゼロ、会費ゼロ、完全にプライベートな環境で毎日トレーニングできます。 通勤ゼロ、会費ゼロ、完全にプライベートです。 ローカルマシンは、日常のコーディング、ユニットテスト、 およびプライベートな文書処理の80パーセントを、トークンあたりゼロドルで処理します。 そして、500ポンドのデッドリフトが必要なとき(例えば、50ファイルにわたる大規模なリポジトリ全体の アーキテクチャ再構築)は、商業ジムに行きます。クラウドAPIでClaude 3.5 SonnetまたはOpenAI o3に15分間 料金を支払い、先に進みます。

5:38 支払い、先に進みます。 費用はこうです。中古の3090を搭載したTier 2ビルドは、すべて込みで1600ドルかかります。 毎月50〜100ドルをAPIトークンに費やす場合、 18か月で元が取れ、独自のコードベースをサードパーティサーバーから 守ることができます。 今日のフィールドテストの結論: SHIP IT。 VRAMとメモリ帯域幅は常にクロック速度を打ち負かします。 AIのために5ギガヘルツのCPUを購入するのはやめて、中古の3090を探してください。

6:04 コメントで、ローカルモデル用にどんなハードウェアビルドを実行しているか教えてください。 この内訳を読みたい場合は、daily diff.devでニュースレターを入手してください。リンクは以下です。 リンクは以下です。 以上、今日のThe Daily Diffでした。 AxrisiのNikoでした。 責任を持ってマージしてください。

情報源

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

関連動画

daily · ja · 2026/09/28

NVIDIAはこの男性に10億ドルを支払う義務があるのか?

1993年、ジェンスン・フアンはエリック・グリクセンをNVIDIAの技術諮問委員会に招き、25,000株のオプションを付与しました。このオプションは、付与された条件に従い1年で権利確定するはずでした。しかし1996年、NVIDIAのCFOはそれを4年スケジュールで計算しました。6回の株式分割を経て、失われた9,375株のオプションは、約450万株、およそ10億ドルに相当すると彼は主張しています。彼

4:41 ↗
under-the-hood · ja · 2026/09/21

ClaudeがRSA-896を因数分解。RSAが実際に破られる仕組み

9月19日、Anthropicのエンジニアが、オープンソースのCADO-NFSふるいのGPUポートであるClaudeと、2,048台のアイドル状態のGPUで10日間で約30GPU年を使い、270桁の挑戦数であるRSA-896を因数分解しました。これは、CognitionのDevinがRSA-260に同じことを行ってから16日後の出来事です。舞台裏では、因数分解の記録が実際にどのように設定されるか(

3:39 ↗
daily · ja · 2026/09/10

ShopifyはTailwindを買収したが、その後ネイティブに戻った。

Shopifyの2つの投稿が25時間差で公開された。火曜日:Tailwind LabsがShopifyに参加。フレームワークはMITのままだが、Adam WathanがAIによってドキュメントのトラフィックが40%減少し、エンジニアリングチームの75%が解雇されたと書いてから8か月後、Tailwind Plusとui.shは新規顧客向けに閉鎖された。水曜日:「ネイティブがShopifyにおけるモバ

5:15 ↗
daily · ja · 2026/10/04

AWS の利用額上限によりプロジェクトが削除される可能性

AWS の新しいプロジェクト利用額制限は、上限に達するとリソースを停止し、初期にはデータを保持します。しかし、ガイドによると、90日間アクションなしで停止されたプロジェクトデータは永久に削除されます。本稿では、限られた展開、Google の残りの費用、ドイツの Kolibri モデル、および COSMIC の貢献ルールについて解説します。評決: NEEDS REVIEW。

5:13 ↗