דירוגי מודלי AI

דירוגי AI מרובי מקורות לצ'אט, דיבור, TTS, ASR, קוד, תמונה, וידאו וסוכנים — מ-arena.ai, OpenRouter ו-Artificial Analysis.

מיקוםמודלספקElo ?קולות ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1312 ±99,56210.050.01.00
2Alibabaqwen3.8-maxAlibaba1302 ±86,7432.006.000.250
3Anthropicclaude-opus-4-7-highAnthropic1301 ±721,1225.0025.00.500
4Anthropicclaude-opus-4-7Anthropic1299 ±721,4455.0025.00.500
5Anthropicclaude-opus-4-6-highAnthropic1299 ±720,8675.0025.00.500
6Metamuse-sparkMeta1294 ±95,582
7Anthropicclaude-opus-4-6Anthropic1293 ±725,1695.0025.00.500
8Metamuse-spark-1.2 (xHigh)Meta1292 ±151,8531.254.250.150
9Anthropicclaude-opus-5-highAnthropic1292 ±97,0495.0025.00.500
10Googlegemini-3-proGoogle1289 ±813,134
11Googlegemini-3.5-flash-highGoogle1286 ±97,5861.509.000.150
12Anthropicclaude-opus-4-8-highAnthropic1285 ±812,8945.0025.00.500
13Googlegemini-3.6-flash-highGoogle1285 ±123,1190.7503.750.075
14OpenAIgpt-5.5OpenAI1285 ±720,7275.0030.00.500
15Googlegemini-3.5-flash-mediumGoogle1285 ±97,5331.509.000.150

מקור: arena.ai · עודכן Aug 21, 2026 · PandaNpc עודכן 29 באוג׳ 2026, 06:00 UTCהצג דירוג מלא →

קריאת המספרים

arena.ai (לשעבר LMArena) מציגה למשתמשים שתי תשובות אנונימיות לאותה הנחיה ומבקשת מהם לבחור אחת, ואז גוזרת דירוג Elo מהקרבות הללו. היא מודדת איזו תשובה אנשים מעדיפים — לא יכולת אובייקטיבית. סגנון חביב יכול לנצח, בעוד תשובה מדויקת אך מפורטת מדי עלולה להפסיד.

הצבעות הן הקרבות שמודל צבר. למודל שזה עתה נרשם יש מעט הצבעות ורווח בר סמך רחב, כך שהדירוג שלו משתנה בקלות — קרא תמיד את הדירוג יחד עם רווח ה-±.

לוח הסוכן פועל אחרת משאר הלוחות: הוא מודד הפעלות סוכן אמיתיות ולא העדפות של קולות עיוורים. מדד הכותרת שלו, Net Improvement, הוא רווח באחוזים — לא דירוג Elo — ולכן לא ניתן להשוותו בין לוחות. arena.ai גם מדווח על חמישה ממדים נוספים (Confirmed Success, Steerability, Bash Recovery ואחרים) בלוח המלא.

לוח השימוש מגיע מ-OpenRouter וסופר את חלק ה-API token האמיתי — מפתחים מצביעים עם הארנקים שלהם, מה שמשלים את לוחות ההעדפה הסובייקטיביים.

לוחות הדיבור מגיעים מ-Artificial Analysis: TTS משתמש ב-Speech Arena Elo עם האזנה עיוורת; ASR משתמש ב-AA-WER v2, שבו נמוך יותר עדיף; ו-Speech-to-Speech מקורי משתמש במדד משוקלל שווה של Big Bench Audio, Full Duplex Bench ו-τ-Voice, שבו גבוה יותר עדיף. יש להשוות ציונים רק בתוך אותו לוח. מקור: artificialanalysis.ai.

לוח ה-Intelligence Index מגיע מ-Artificial Analysis: הוא מזקק מדדים ציבוריים רבים למדד Intelligence Index יחיד מ-0 עד 100, המודד יכולת אובייקטיבית ולא העדפה סובייקטיבית — משלים טבעי להצבעה עיוורת אנושית של arena.ai. מקור: artificialanalysis.ai.