דירוגי מודלי AI

דירוגי AI מרובי מקורות לצ'אט, דיבור, TTS, ASR, קוד, תמונה, וידאו וסוכנים — מ-arena.ai, OpenRouter ו-Artificial Analysis.

מיקוםמודלספקElo ?קולות ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

מקור: arena.ai · עודכן Aug 21, 2026 · PandaNpc עודכן 29 באוג׳ 2026, 06:00 UTCהצג דירוג מלא →

קריאת המספרים

arena.ai (לשעבר LMArena) מציגה למשתמשים שתי תשובות אנונימיות לאותה הנחיה ומבקשת מהם לבחור אחת, ואז גוזרת דירוג Elo מהקרבות הללו. היא מודדת איזו תשובה אנשים מעדיפים — לא יכולת אובייקטיבית. סגנון חביב יכול לנצח, בעוד תשובה מדויקת אך מפורטת מדי עלולה להפסיד.

הצבעות הן הקרבות שמודל צבר. למודל שזה עתה נרשם יש מעט הצבעות ורווח בר סמך רחב, כך שהדירוג שלו משתנה בקלות — קרא תמיד את הדירוג יחד עם רווח ה-±.

לוח הסוכן פועל אחרת משאר הלוחות: הוא מודד הפעלות סוכן אמיתיות ולא העדפות של קולות עיוורים. מדד הכותרת שלו, Net Improvement, הוא רווח באחוזים — לא דירוג Elo — ולכן לא ניתן להשוותו בין לוחות. arena.ai גם מדווח על חמישה ממדים נוספים (Confirmed Success, Steerability, Bash Recovery ואחרים) בלוח המלא.

לוח השימוש מגיע מ-OpenRouter וסופר את חלק ה-API token האמיתי — מפתחים מצביעים עם הארנקים שלהם, מה שמשלים את לוחות ההעדפה הסובייקטיביים.

לוחות הדיבור מגיעים מ-Artificial Analysis: TTS משתמש ב-Speech Arena Elo עם האזנה עיוורת; ASR משתמש ב-AA-WER v2, שבו נמוך יותר עדיף; ו-Speech-to-Speech מקורי משתמש במדד משוקלל שווה של Big Bench Audio, Full Duplex Bench ו-τ-Voice, שבו גבוה יותר עדיף. יש להשוות ציונים רק בתוך אותו לוח. מקור: artificialanalysis.ai.

לוח ה-Intelligence Index מגיע מ-Artificial Analysis: הוא מזקק מדדים ציבוריים רבים למדד Intelligence Index יחיד מ-0 עד 100, המודד יכולת אובייקטיבית ולא העדפה סובייקטיבית — משלים טבעי להצבעה עיוורת אנושית של arena.ai. מקור: artificialanalysis.ai.