דירוגי מודלי AI

דירוגי AI מרובי מקורות לצ'אט, דיבור, TTS, ASR, קוד, תמונה, וידאו וסוכנים — מ-arena.ai, OpenRouter ו-Artificial Analysis.

מיקוםמודלספקמדד אינטליגנציה ?Input ?OutputCache ?
1AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic63.15.0025.00.500
2AnthropicClaude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic62.55.0025.00.500
3AnthropicClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.110.050.01.00
4AnthropicClaude Opus 5 (Adaptive Reasoning, High Effort)Anthropic61.55.0025.00.500
5OpenAIGPT-5.6 Sol (max)OpenAI60.92.0010.00.200
6SpaceXAIGrok 4.6 (high)SpaceXAI60.92.006.000.500
7SpaceXAIGrok 4.6 (xhigh)SpaceXAI602.006.000.500
8KimiKimi K3 (max)Kimi59.73.0015.00.300
9Z AIGLM-5.3 (max)Z AI59.51.404.400.260
10OpenAIGPT-5.6 Sol (xhigh)OpenAI592.0010.00.200
11SpaceXAIGrok 4.6 (medium)SpaceXAI592.006.000.500
12AnthropicClaude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic58.65.0025.00.500
13AlibabaQwen3.8 MaxAlibaba58.12.006.000.250
14AlibabaQwen3.8 2.4T A95BAlibaba57.72.006.000.250
15Z AIGLM-5.3-FlashZ AI57.50.0750.2500.015

מקור: Artificial Analysis · עודכן Aug 29, 2026 · PandaNpc עודכן 29 באוג׳ 2026, 06:00 UTCהצג דירוג מלא →

קריאת המספרים

arena.ai (לשעבר LMArena) מציגה למשתמשים שתי תשובות אנונימיות לאותה הנחיה ומבקשת מהם לבחור אחת, ואז גוזרת דירוג Elo מהקרבות הללו. היא מודדת איזו תשובה אנשים מעדיפים — לא יכולת אובייקטיבית. סגנון חביב יכול לנצח, בעוד תשובה מדויקת אך מפורטת מדי עלולה להפסיד.

הצבעות הן הקרבות שמודל צבר. למודל שזה עתה נרשם יש מעט הצבעות ורווח בר סמך רחב, כך שהדירוג שלו משתנה בקלות — קרא תמיד את הדירוג יחד עם רווח ה-±.

לוח הסוכן פועל אחרת משאר הלוחות: הוא מודד הפעלות סוכן אמיתיות ולא העדפות של קולות עיוורים. מדד הכותרת שלו, Net Improvement, הוא רווח באחוזים — לא דירוג Elo — ולכן לא ניתן להשוותו בין לוחות. arena.ai גם מדווח על חמישה ממדים נוספים (Confirmed Success, Steerability, Bash Recovery ואחרים) בלוח המלא.

לוח השימוש מגיע מ-OpenRouter וסופר את חלק ה-API token האמיתי — מפתחים מצביעים עם הארנקים שלהם, מה שמשלים את לוחות ההעדפה הסובייקטיביים.

לוחות הדיבור מגיעים מ-Artificial Analysis: TTS משתמש ב-Speech Arena Elo עם האזנה עיוורת; ASR משתמש ב-AA-WER v2, שבו נמוך יותר עדיף; ו-Speech-to-Speech מקורי משתמש במדד משוקלל שווה של Big Bench Audio, Full Duplex Bench ו-τ-Voice, שבו גבוה יותר עדיף. יש להשוות ציונים רק בתוך אותו לוח. מקור: artificialanalysis.ai.

לוח ה-Intelligence Index מגיע מ-Artificial Analysis: הוא מזקק מדדים ציבוריים רבים למדד Intelligence Index יחיד מ-0 עד 100, המודד יכולת אובייקטיבית ולא העדפה סובייקטיבית — משלים טבעי להצבעה עיוורת אנושית של arena.ai. מקור: artificialanalysis.ai.