AI IN
כלי פיתוחרשמי - נסרק ואומת ע"י AI IN · 78%

חבילת הערכת LLM בעברית

כלי שמריץ מבחני השוואה סטנדרטיים בין מודלי שפה שונים כדי לבדוק מי מהם הכי טוב בעברית - הבנה, ניתוח רגשות, תרגום וידע ישראלי - ומחזיר דוח תוצאות ברור וקל להשוואה.

עובד עם

Claude CodeCursorCodex

הכלי הזה נבנה כדי לענות על שאלה שכל מי שמפתח מוצר בעברית נתקל בה במוקדם או במאוחר: איזה מודל שפה באמת מתפקד הכי טוב כשמדובר בעברית? הוא מריץ סט של מבחנים סטנדרטיים שבודקים הבנת טקסט, זיהוי סנטימנט, יכולות תרגום, השלמת משפטים בסטייל וינוגרד, סיכום טקסט, ניקוד וידע כללי על ישראל - ומריץ אותם על מגוון מודלים כמו Claude, GPT, Gemini, AI21 Jamba, DictaLM, Llama ומודלים מקומיים מ-HuggingFace.

הכלי מתאים בעיקר לצוותי פיתוח ומוצר שצריכים להחליט איזה מודל שפה להטמיע במוצר עברי, לאנשי רכש שצריכים תשובות מבוססות נתונים לגבי ביצועים בעברית, ולמי שמכוונן מודל עברי בעצמו ורוצה לבדוק אם השינויים שביצע שיפרו את התוצאות או פגעו בהן.

לדוגמה, אם אתם בונים צ'אטבוט שירות לקוחות בעברית ולא בטוחים אם להשתמש ב-GPT או ב-Claude, אפשר להריץ את הכלי ולקבל כרטיס תוצאות מסודר ב-JSON או ב-Markdown שמשווה ביניהם על כל המדדים הרלוונטיים - ואז לבחור לפי נתונים ולא לפי ניחוש.

איך להשתמש בסקיל הזה

  1. 1.הורידו וחילצו את קובץ ה-ZIP.
  2. 2.העתיקו את התיקייה המחולצת לתוך .claude/skills/ בפרויקט (או ~/.claude/skills/ להתקנה גלובלית).
  3. 3.התחילו סשן חדש - Claude Code יזהה את הסקיל אוטומטית לפי הנושא.

פרומפטים לדוגמה

השוואת מודלים לפני בחירה

הרץ השוואה בין Claude, GPT ו-Gemini על משימות הבנת עברית וסנטימנט והצג לי טבלת תוצאות

בדיקת מודל עברי מכוונן

בדוק את המודל המכוונן שלי על מבחני DictaLM כמו ניקוד וסיכום טקסט בעברית

מעקב רגרסיה אחרי עדכון

השווה את ביצועי הגרסה החדשה של המודל שלנו בעברית לגרסה הקודמת ותן לי דוח שינויים

שאלות נפוצות

אילו מודלים אפשר לבדוק עם הכלי?

אפשר להריץ הערכות על Claude, GPT, Gemini, AI21 Jamba, DictaLM, Llama וגם על מודלים מקומיים מ-HuggingFace, כדי להשוות ביניהם על אותם מבחנים.

איזה סוג פלט מתקבל בסוף הבדיקה?

הכלי מפיק כרטיס תוצאות בפורמט JSON או Markdown שמראה בצורה ברורה איך כל מודל ביצע בכל אחת מהמשימות, כך שקל להשוות בין האפשרויות.

האם הכלי מתאים לבדיקת ערבית, זיהוי דיבור או מבחני אנגלית?

לא, הכלי מיועד ספציפית להערכת ביצועים בעברית ולא נועד לשימוש עבור ערבית, זיהוי דיבור (ASR) או בנצ'מרקים כלליים באנגלית.

מוכנים להתקין את חבילת הערכת LLM בעברית?