# המדריך המקומי לחומרת AI (2026)

Published: 2026-09-14

בעת בניית מכונה עבור סוכני AI מקומיים ו-LLM בעלי משקל פתוח, מפתחים עושים את הטעות של קניית מפרטי מחשב גיימינג: מעבדי 5.8 GHz, לולאות קירור נוזלי מותאמות אישית, וכרטיסי מסך מהירים לגיימינג עם 8GB VRAM בלבד. אבל יצירת אסימונים אוטורגרסיבית מוגבלת ברוחב פס זיכרון, לא בחישוב: כדי לפלוט אסימון יחיד, כל משקל במודל חייב לזרום על פני אפיק הזיכרון. כאשר המשקלים או הקונטקסט של מטמון ה-KV חורגים מ-VRAM פיזי, זמן הריצה פורק שכבות ל-DDR5 המערכתי דרך PCIe, ואתה נתקל בצניחת רוחב פס זיכרון פי 20: המהירות צונחת מ-40 אסימונים לשנייה ל-1.5. במבחן שטח זה, ניקו מפרק את מכניקת החומרה, את כללי הגודל של מודל קוונטיזציה 4 סיביות, שלוש רמות תקציב אמיתיות מ-$1,200 עד $5,000, מדוע RTX 3090 24GB משומש הוא העסקה הטובה ביותר של VRAM לדולר במחשוב, מלכודת קצה ה-Raspberry Pi, ואסטרטגיית חדר הכושר הביתי להסקת מסקנות מקומית לעומת ענן. פסק דין: SHIP IT.

Canonical: https://thedailydiff.dev/he/video/2026-09-14-local-ai-hardware/

## מה מכסה הסרטון הזה

- צניחת רוחב פס זיכרון פי 20: 936 GB/s GDDR6X לעומת 50 GB/s DDR5 ו-31.5 GB/s PCIe
- גודל מודל @ 4 סיביות: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- רמה 1 ($1,200–$1,500): RTX 4060 Ti 16GB (לעולם לא 8GB) או Mac Mini 16GB
- רמה 2 ($1,500–$2,000): RTX 3090 24GB משומש נקודת מתיקות או Mac Mini M4 Pro 64GB
- רמה 3 ($3,500+): RTX 4090 24GB / שני 3090 או Mac Studio Ultra

## תמליל מתורגם

תורגם מהקריינות המקורית באנגלית. זמינות אודיו וכתוביות נשלטת על ידי YouTube.

0:00 אם אתה מתכנן לבנות מחשב להפעלת סוכני AI מקומיים, הפסק לבנות ציוד גיימינג. אתה לא צריך Core i9 בחמישה נקודה שמונה גיגה-הרץ, לולאת קירור נוזלית, או כרטיס מסך של שמונה גיגה-בייט מכוסה ב-RGB. בהסקת מסקנות AI מקומית, מפרטי גיימינג הם כמעט חסרי תועלת. המדד היחיד שקובע אם הסוכן שלך פועל או זוחל הוא קיבולת VRAM ורוחב פס של אפיק הזיכרון. כללי בדיקת החומרה: תשכח ממהירויות מעבד ומבנצ'מרקים של רינדור.

0:24 אכפת לנו משלושה מספרים: רוחב אפיק זיכרון, רוחב פס בגיגה-בייטים ל שנייה, ומרווח VRAM גולמי עבור הצפת מטמון KV. בבדיקת שטח זו, אני אפרק את צניחת רוחב הפס של זיכרון פי עשרים, אמפה את כללי גודל המודל, אבצע בנצ'מרק של שלוש רמות אמיתיות מאלף מאתיים דולר לחמשת אלפים, ואסביר מדוע 3090 משומש הוא עדיין קוד הצ'יט הגדול ביותר של המחשוב. זהו The Daily Diff, בדיקת שטח. כדי להבין מדוע ציוד גיימינג נכשל, הסתכל כיצד יצירת אסימונים באמת מבוצעת. במשחקים, המעבד שלך מזין קריאות ציור והמעבד הגרפי שלך מעבד פריימים.

0:54 אבל פענוח LLM אוטורגרסיבי תלוי כמעט כולו ברוחב פס הזיכרון. כדי לייצר אסימון יחיד, המעבד הגרפי חייב להזרים כל פרמטר משקל של המודל מהזיכרון דרך ליבות החישוב שלו. אם המודל שלך הוא עשרה גיגה-בייטים, ייצור אסימון אחד פירושו קריאת עשרה גיגה-בייטים של נתונים. על Nvidia RTX 3090 עם אפיק זיכרון של 384 סיביות, אתה מקבל 936 גיגה-בייטים לשנייה של רוחב פס GDDR6X, המייצר שמונים אסימונים לשנייה. אבל תראה מה קורה ברגע שהמודל שלך חורג מ-VRAM פיזי.

1:22 כאשר ה-VRAM מתמלא, זמני הריצה פורקים שכבות נשארות על פני אפיק ה-PCIe ל זיכרון DDR5 של המערכת. ליבות המעבד הגרפי שלך מצפות לאלף גיגה-בייטים לשנייה. במקום זאת, DDR5 כפול ערוצים מזין אותן בחמישים, ו-PCIe 4 נחנק בשלושים ואחת. זוהי קריסת רוחב פס פי עשרים. צינור יצירת האסימונים נתקע באופן מיידי בהמתנה על האפיק, והמהירות צונחת מארבעים אסימונים לשנייה עד לאחד וחצי. הפכת ציוד של אלפיים דולר לתנור חימום.

1:47 וזה מחמיר במהלך הפעלות סוכנים מרובות סיבובים, כי משקלים הם רק חצי מהקרב. כל הנחיה, קריאת כלי, ונתח קובץ נשמרים במטמון Key-Value. חלון קונטקסט של שלושים ושניים אלף יכול לכרסם ארבעה עד שמונה גיגה-בייטים של VRAM בנוסף למשקלים. אם לכרטיס שלך יש רק שישה עשר גיגה-בייטים, הסוכן שלך עושה לולאה פעמיים, פוגע בקיר הקונטקסט, וקורס עם שגיאת חוסר זיכרון או נשפך ל-DDR5. הנה דף הצ'יטים לגודל 4 סיביות. מודל של שבעה או שמונה מיליארד פרמטרים כמו Llama 3.1 או DeepSeek Distill

2:16 לוקח כחמישה גיגה-בייטים. מודל של ארבעה עשר מיליארד לוקח עשרה גיגה-בייטים. מודל של שלושים ושניים מיליארד, נקודת המתיקות של אינטליגנציה לסוכני קידוד, דורש עשרים גיגה-בייטים. ומודל חזית של שבעים מיליארד דורש ארבעים גיגה-בייטים עוד לפני שאתה מקצה קונטקסט. מה שמביא אותנו לבניית החומרה בפועל. רמה 1 היא ציוד ההתחלה, אלף מאתיים עד אלף וחמש מאות דולר. במחשב, העוגן שלך הוא RTX 4060 Ti 16 גיגה-בייט.

2:39 אזהרה קריטית: לעולם אל תקנה את גרסת השמונה גיגה-בייט כדי לחסוך שבעים דולר. שמונה גיגה-בייטים של VRAM בשנת 2026 הם גזר דין מוות מיידי מחוסר זיכרון בכל זרימת עבודה אמיתית של סוכן. חבר אותו עם Ryzen 5 בעל שש ליבות, שישים וארבעה גיגה-בייטים של DDR5, וכונן NVMe בנפח שני טרה-בייט. בארץ אפל, המקביל הוא Mac Mini או MacBook Pro עם שישה עשר גיגה-בייטים של זיכרון מאוחד.

3:02 תראה ארבעים עד חמישים אסימונים לשנייה במודלים של שמונה מיליארד. רמה 2 היא נקודת המתיקות למשתמשי כוח: בנייה ספציפית להפעלה של מודלים של שלושים ושניים מיליארד פרמטרים כמו Qwen 2.5 32B. מסלול א' הוא RTX 4070 Ti Super חדש עם שישה עשר גיגה-בייטים במחיר שמונה מאות דולר. אבל מסלול ב' הוא המלצתי החזקה: קנה Nvidia RTX 3090 משומש עשרים וארבעה גיגה-בייט. אתה יכול למצוא 3090 נקיים ב-eBay במחיר שש מאות וחמישים עד שבע מאות וחמישים דולר. זה נותן לך עשרים וארבעה גיגה-בייטים של VRAM על אפיק ענק של 384 סיביות הדוחף

3:33 936 גיגה-בייטים לשנייה. דולר לדולר, זו העסקה הטובה ביותר של VRAM במחשוב. ב-macOS, המקביל לרמה 2 הוא Mac Mini M4 Pro עם שישים וארבעה גיגה-בייטים של זיכרון מאוחד. הוא מייצר אחד עשר עד שנים עשר אסימונים לשנייה במודל של שלושים ושניים מיליארד: איטי יותר מ-Nvidia, אבל שקט לחלוטין ב-30 וואט עם מקום לחלון קונטקסט ענק. רמה 3 היא קטגוריית החובבים עבור נחילים מרובי סוכנים. במחשב, זה אומר RTX 4090 עם עשרים וארבעה גיגה-בייטים,

3:57 Ryzen 9, ומאה עשרים ושמונה גיגה-בייטים של RAM, או שני RTX 3090 המספקים ארבעים ושמונה גיגה-בייטים של VRAM בסך הכל. במערך המוצרים של אפל, זהו Mac Studio Ultra עם שישים ותשע עד מאה ו עשרים ושמונה גיגה-בייטים של זיכרון מאוחד. כוח העל הוא שהזיכרון תמיד זמין: אתה יכול לשמור מודל הטמעה, נתב מהיר, ומודל קידוד 32 מיליארד טעונים בו זמנית עם אפס השהיית החלפה. ועכשיו לכישלון הכנה של מבחן השטח שלנו: מלכודת מחשוב הקצה.

4:24 בכל שבוע פוסט חברתי טוען שאתה יכול להריץ סוכני קידוד אוטונומיים על Raspberry Pi 5 בשמונים דולר. בדקתי את זה. הפעלת מודל קטן של מיליארד וחצי פרמטרים נותנת לך בקושי שלושה אסימונים לשנייה בזמן שהלוח משנה מהירות ב-85 מעלות צלזיוס. זהו צעצוע נחמד לסוף שבוע, אבל כמפתח יומי, זה עונש טהור. לתוכנה, השתמש ב-Ollama אם אתה רוצה דיימון נקי של שורת פקודה שמתחבר

4:47 ישירות ל-Cursor, Cline או VS Code. אם אתה רוצה סביבת עבודה גרפית עם הורדות מודלים ומחווני שכבות GPU, השתמש ב-LM Studio. והתאם את הפורמט שלך לסיליקון שלך. ב-Apple Silicon, תמיד הורד מודלי GGUF המותאמים ל-Metal. ב-Windows או Linux עם Nvidia, הורד מודלי AWQ או EXL2, המנצלים את ליבות ה-Tensor של Nvidia להסקת מסקנות מהירה יותר ב-20 עד 30 אחוזים. אז איך פורסים את זה בלי לפשוט רגל?

5:11 חשוב על חומרה מקומית כמו על חדר כושר ביתי לעומת חדר כושר מסחרי. מתקן סקווט בבית פירושו שאתה מתאמן כל יום ללא נסיעות, ללא דמי מנוי, ופרטיות מלאה. המחשב המקומי שלך מטפל בשמונים אחוז מהקידוד היומי שלך, בדיקות יחידה, ועיבוד מסמכים פרטי באפס דולרים לאסימון. וכאשר אתה צריך להרים חמש מאות פאונד – כמו שחזור ארכיטקטוני עצום בקנה מידה של כל הריפו על פני חמישים קבצים – אתה מבקר בחדר הכושר המסחרי: שלם ל-API של הענן עבור Claude 3.5 Sonnet או OpenAI o3 למשך חמש עשרה דקות

5:38 והמשך הלאה. הנה החשבון: בניית רמה 2 עם 3090 משומש עולה אלף שש מאות דולר הכל כלול. אם אתה מוציא חמישים עד מאה דולר בחודש על אסימוני API, זה משתלם תוך שמונה עשר חודשים תוך שמירה על בסיס הקוד הקנייני שלך מחוץ לשרתים של צד שלישי. פסק הדין של מבחן השטח היום: SHIP IT. VRAM ורוחב פס זיכרון מנצחים מהירויות שעון בכל פעם. הפסק לקנות מעבדי חמישה גיגה-הרץ עבור AI, ולך מצא 3090 משומש.

6:04 ספר לי באיזה בניית חומרה אתה משתמש עבור מודלים מקומיים בתגובות. ואם אתה מעדיף לקרוא את הפירוט הזה, קח את הניוזלטר ב-thedailydiff dot dev, קישור למטה. וזה הדיף להיום. אני ניקו מ-Axrisi. מזג באחריות.

## מקורות

- [Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PC](https://axrisi.com/) — axrisi.com
- [NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)](https://www.nvidia.com/) — www.nvidia.com
- [llama.cpp Memory Bandwidth &amp; Offloading Architecture](https://github.com/ggerganov/llama.cpp) — github.com
- [Ollama Model Library &amp; Benchmarks](https://ollama.com/) — ollama.com
- [vLLM PagedAttention &amp; KV Cache Memory Management](https://github.com/vllm-project/vllm) — github.com
- [JEDEC DDR5 Memory Standard Specifications](https://www.jedec.org/) — www.jedec.org
