להריץ מודל שפה על השרת שלכם

אין צורך לאמן מודל: מורידים מודל בקוד פתוח (Open Weights) ומריצים אותו על כרטיס מסך. מה שקובע הוא זיכרון הווידאו. כאן מה אפשר להריץ לפי החומרה, אילו מודלים רלוונטיים עכשיו, ואיך מתקינים.

⚠️ ציפיות: מודל שרץ על חומרה ביתית או על שרת יחיד קטן ממודלי הדגל הענקיים. מדריכים ישנים טענו שמודלים בגודל 70B מתקרבים ל"קלוד הגדול", אבל המודלים החזקים ביותר היום הם ענקיים ודורשים אשכול שרתים. לא מצאנו השוואה ישירה מול Claude העדכני, ולכן אל תניחו שוויון. בדקו בהשוואות עצמאיות ובמבחן על המשימות שלכם.
הנתונים כאן נלקחו מפרסומים מאוגוסט עד ספטמבר 2026 ומשתנים מהר.

1. החומרה: הכל תלוי בזיכרון

המשקלות של המודל צריכים להיכנס לזיכרון הווידאו (VRAM) של כרטיס המסך או לזיכרון המאוחד (למשל במק). מודל שאינו נכנס שלם נשפך לזיכרון המערכת, והמהירות צונחת. גם כשהמשקלות נכנסות, ההקשר הארוך (context) צורך זיכרון נוסף.

רמת חומרהמודלים שמופיעים בפרסומים כמתאימיםהערה
16GB זיכרון, ללא כרטיס ייעודיgpt-oss-20bנוצר ב-MXFP4, כ-14GB להורדה, הקשר 128K, רשיון Apache 2.0.
כרטיס 24GB (למשל RTX 3090/4090)Qwen3.6-27B (4-bit), qwen3-coder:30b27B ב-4 ביט נכנס על 24GB כשמצמצמים הקשר, וכ-17GB להורדה. 30B-MoE כ-19GB.
48GB עד 80GBQwen3 32B, Mistral Small 3.1, Qwen3-Coder-Next (מכומת)מודל בן 80B פרמטרים צריך כ-40GB ב-4 ביט לפני תקורה.
כרטיס 80GB (H100/MI300X)gpt-oss-120bכ-65GB להורדה (MXFP4). לפי היצרן, נכנס על כרטיס 80GB יחיד.
שרת מרובה כרטיסיםDeepSeek V4 Flash, GLM-5.3-Flashכ-167GB ו-328GB (FP8) בהתאמה. דורשים כמה כרטיסי 80GB.
אשכולDeepSeek V4 Pro, Kimi K3, GLM-5.3מאות GB ועד יותר מטרה-בייט (למשל כ-893GB, כ-1.5TB). מחוץ לתחום של מעבדה ביתית.

גם רשיונות משתנים: חלק מהמודלים בעלי רשיון Apache 2.0 או MIT, ואחרים (למשל Kimi K3 ו-Qwen3.8-Max, לפי הפרסומים) כוללים רשיונות מותאמים שתלויים בהכנסות. קראו את הרשיון לפני שימוש מסחרי.

מחשבון זיכרון למשקלות

חישוב משקל המודל בלבד: פרמטרים × ביטים ÷ 8. המחשבון מוסיף מרווח כללי של 20% להקשר ולתקורה, אך זו הערכה גסה. הקשר ארוך, מנועים שונים וסוג המודל עלולים לדרוש יותר.

משקלות בלבד:
עם מרווח של 20%:
סך הזיכרון שלך:

הערכים לכימות נלקחו מקירוב של גדלי קבצים שפורסמו (למשל 27B ב-Q4 כ-17GB, ו-gpt-oss-120b ב-MXFP4 כ-65GB). בכרטיסים מרובים יש תקורת תקשורת, ולא תמיד כל הזיכרון ניתן לניצול.

2. מנוע הרצה וממשק

Ollama

הדרך הפשוטה להתחיל. מוריד ומריץ מודל בפקודה אחת, ומתאים לשימוש אישי ולצוות קטן.

vLLM / SGLang

לשרות עם הרבה משתמשים במקביל ושימוש כבד בכרטיסים מרובים. דורשים הגדרה מורכבת יותר.

llama.cpp

שליטה מרבית והרצה גם על מעבד. מתאים למי שרוצה לכוונן.

Open WebUI הוא ממשק צ'אט בדפדפן שמתחבר ל-Ollama. לפי התיעוד שלו הוא כולל חיפוש ברשת בעזרת ספקים כמו SearXNG, Brave Search ו-Tavily, וגם העלאת מסמכים (RAG). פרטי הפיצ'רים משתנים בין גרסאות, ולכן בדקו בתיעוד של הגרסה שלכם.

3. התקנה על Ubuntu (במחשב עם כרטיס NVIDIA)

שלב 1: דרייבר של NVIDIA

התקינו את הדרייבר המומלץ למערכת שלכם (ולא גרסה קבועה ממדריך ישן), הפעילו מחדש ובדקו שהכרטיס מזוהה.


        
שלב 2: Ollama ומודל

Ollama רץ ישירות על המחשב וניגש לכרטיס. בחרו מודל שמתאים לזיכרון שלכם. התגיות כאן הופיעו ברשימת ה-Ollama של ספטמבר 2026.


        
שלב 3: Open WebUI עם Docker

הפקודה מתוך ההוראות של Open WebUI. Docker אינו צריך גישה לכרטיס לצורך הממשק, כי Ollama הוא שמריץ את המודל.


          

אם הקונטיינר לא מצליח להתחבר ל-Ollama, ההוראות מציעות להריץ עם --network=host:


        
שלב 4: גישה

פתחו בדפדפן http://localhost:3000 (או כתובת ה-IP של השרת ברשת המקומית), וצרו משתמש מנהל ראשון.

שימו לב: מדריכים ישנים כוללים גם התקנה של NVIDIA Container Toolkit. היא נחוצה רק אם מריצים את המודל עצמו בתוך קונטיינר עם GPU, ולא נדרשת בהתקנה שמוצגת כאן.

אבטחה ופרטיות

מקורות

אלה פרסומים של צד שלישי, ולא ביצענו בעצמנו מדידות ביצועים. בדקו את המספרים על החומרה שלכם.