1. החומרה: הכל תלוי בזיכרון
המשקלות של המודל צריכים להיכנס לזיכרון הווידאו (VRAM) של כרטיס המסך או לזיכרון המאוחד (למשל במק). מודל שאינו נכנס שלם נשפך לזיכרון המערכת, והמהירות צונחת. גם כשהמשקלות נכנסות, ההקשר הארוך (context) צורך זיכרון נוסף.
| רמת חומרה | מודלים שמופיעים בפרסומים כמתאימים | הערה |
|---|---|---|
| 16GB זיכרון, ללא כרטיס ייעודי | gpt-oss-20b | נוצר ב-MXFP4, כ-14GB להורדה, הקשר 128K, רשיון Apache 2.0. |
| כרטיס 24GB (למשל RTX 3090/4090) | Qwen3.6-27B (4-bit), qwen3-coder:30b | 27B ב-4 ביט נכנס על 24GB כשמצמצמים הקשר, וכ-17GB להורדה. 30B-MoE כ-19GB. |
| 48GB עד 80GB | Qwen3 32B, Mistral Small 3.1, Qwen3-Coder-Next (מכומת) | מודל בן 80B פרמטרים צריך כ-40GB ב-4 ביט לפני תקורה. |
| כרטיס 80GB (H100/MI300X) | gpt-oss-120b | כ-65GB להורדה (MXFP4). לפי היצרן, נכנס על כרטיס 80GB יחיד. |
| שרת מרובה כרטיסים | DeepSeek V4 Flash, GLM-5.3-Flash | כ-167GB ו-328GB (FP8) בהתאמה. דורשים כמה כרטיסי 80GB. |
| אשכול | DeepSeek V4 Pro, Kimi K3, GLM-5.3 | מאות GB ועד יותר מטרה-בייט (למשל כ-893GB, כ-1.5TB). מחוץ לתחום של מעבדה ביתית. |
גם רשיונות משתנים: חלק מהמודלים בעלי רשיון Apache 2.0 או MIT, ואחרים (למשל Kimi K3 ו-Qwen3.8-Max, לפי הפרסומים) כוללים רשיונות מותאמים שתלויים בהכנסות. קראו את הרשיון לפני שימוש מסחרי.
מחשבון זיכרון למשקלות
חישוב משקל המודל בלבד: פרמטרים × ביטים ÷ 8. המחשבון מוסיף מרווח כללי של 20% להקשר ולתקורה, אך זו הערכה גסה. הקשר ארוך, מנועים שונים וסוג המודל עלולים לדרוש יותר.
הערכים לכימות נלקחו מקירוב של גדלי קבצים שפורסמו (למשל 27B ב-Q4 כ-17GB, ו-gpt-oss-120b ב-MXFP4 כ-65GB). בכרטיסים מרובים יש תקורת תקשורת, ולא תמיד כל הזיכרון ניתן לניצול.
2. מנוע הרצה וממשק
Ollama
הדרך הפשוטה להתחיל. מוריד ומריץ מודל בפקודה אחת, ומתאים לשימוש אישי ולצוות קטן.
vLLM / SGLang
לשרות עם הרבה משתמשים במקביל ושימוש כבד בכרטיסים מרובים. דורשים הגדרה מורכבת יותר.
llama.cpp
שליטה מרבית והרצה גם על מעבד. מתאים למי שרוצה לכוונן.
Open WebUI הוא ממשק צ'אט בדפדפן שמתחבר ל-Ollama. לפי התיעוד שלו הוא כולל חיפוש ברשת בעזרת ספקים כמו SearXNG, Brave Search ו-Tavily, וגם העלאת מסמכים (RAG). פרטי הפיצ'רים משתנים בין גרסאות, ולכן בדקו בתיעוד של הגרסה שלכם.
3. התקנה על Ubuntu (במחשב עם כרטיס NVIDIA)
התקינו את הדרייבר המומלץ למערכת שלכם (ולא גרסה קבועה ממדריך ישן), הפעילו מחדש ובדקו שהכרטיס מזוהה.
Ollama רץ ישירות על המחשב וניגש לכרטיס. בחרו מודל שמתאים לזיכרון שלכם. התגיות כאן הופיעו ברשימת ה-Ollama של ספטמבר 2026.
הפקודה מתוך ההוראות של Open WebUI. Docker אינו צריך גישה לכרטיס לצורך הממשק, כי Ollama הוא שמריץ את המודל.
אם הקונטיינר לא מצליח להתחבר ל-Ollama, ההוראות מציעות להריץ עם --network=host:
פתחו בדפדפן http://localhost:3000 (או כתובת ה-IP של השרת ברשת המקומית), וצרו משתמש מנהל ראשון.
שימו לב: מדריכים ישנים כוללים גם התקנה של NVIDIA Container Toolkit. היא נחוצה רק אם מריצים את המודל עצמו בתוך קונטיינר עם GPU, ולא נדרשת בהתקנה שמוצגת כאן.
אבטחה ופרטיות
- אל תחשפו שרת פרטי לאינטרנט ללא הגנה. ה-API של Ollama אינו כולל אימות כברירת מחדל, ולכן אל תפתחו את הפורט שלו לרשת הציבורית. אם צריך גישה מרחוק, השתמשו ב-VPN או במנגנון אימות מול ממשק מאובטח.
- "מידע לא יוצא מהשרת" נכון כשהמודל והמסמכים נשארים מקומיים. אם מפעילים חיפוש באינטרנט, השאילתות נשלחות לספק החיפוש, וצריך לשקול זאת.
- הקפידו על עדכוני אבטחה למערכת, ל-Docker ולממשק.
מקורות
- Pinggy: Best Open Source Self-Hosted LLMs for Coding in 2026 (אוגוסט 2026)
- Morph: Best Ollama Models 2026 (ספטמבר 2026)
- AceCloud: Best Open-Source LLMs (יולי 2026) ו-ComputingForGeeks: Open Source LLM Comparison 2026
- Hugging Face blog: Best open-source LLM models to run locally in 2026
- התיעוד והמאגר של Open WebUI בנוגע להתקנה ולחיפוש ברשת
אלה פרסומים של צד שלישי, ולא ביצענו בעצמנו מדידות ביצועים. בדקו את המספרים על החומרה שלכם.