דירוגי מודלי AI

דירוגי AI מרובי מקורות לצ'אט, דיבור, TTS, ASR, קוד, תמונה, וידאו וסוכנים — מ-arena.ai, OpenRouter ו-Artificial Analysis.

מיקוםמודלספקElo ?קולות ?
1Googlegemini-omni-flashGoogle1512 ±1116,916
2Black Forest Labsflux-3-videoBlack Forest Labs1494 ±171,291
3Bytedancedreamina-seedance-2.0-720pBytedance1482 ±1049,058
4Bytedancedreamina-seedance-2.5-720pBytedance1477 ±191,337
5Metamuse-videoMeta1457 ±152,176
6MiniMaxminimax-h3MiniMax1453 ±133,081
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1428 ±1322,113
8OpenAIsora-2-proOpenAI1364 ±746,509
9Googleveo-3.1-audioGoogle1364 ±1413,743
10Googleveo-3.1-audio-1080pGoogle1363 ±1024,979
11Googleveo-3.1-fast-audioGoogle1361 ±1039,441
12Googleveo-3.1-fast-audio-1080pGoogle1358 ±1025,771
13Googleveo-3-fast-audioGoogle1347 ±1125,219
14SpaceXAIgrok-imagine-video-720pSpaceXAI1345 ±7154,827
15Alibabawan2.7-t2vAlibaba1344 ±917,769

מקור: arena.ai · עודכן Aug 14, 2026 · PandaNpc עודכן 29 באוג׳ 2026, 06:00 UTCהצג דירוג מלא →

קריאת המספרים

arena.ai (לשעבר LMArena) מציגה למשתמשים שתי תשובות אנונימיות לאותה הנחיה ומבקשת מהם לבחור אחת, ואז גוזרת דירוג Elo מהקרבות הללו. היא מודדת איזו תשובה אנשים מעדיפים — לא יכולת אובייקטיבית. סגנון חביב יכול לנצח, בעוד תשובה מדויקת אך מפורטת מדי עלולה להפסיד.

הצבעות הן הקרבות שמודל צבר. למודל שזה עתה נרשם יש מעט הצבעות ורווח בר סמך רחב, כך שהדירוג שלו משתנה בקלות — קרא תמיד את הדירוג יחד עם רווח ה-±.

לוח הסוכן פועל אחרת משאר הלוחות: הוא מודד הפעלות סוכן אמיתיות ולא העדפות של קולות עיוורים. מדד הכותרת שלו, Net Improvement, הוא רווח באחוזים — לא דירוג Elo — ולכן לא ניתן להשוותו בין לוחות. arena.ai גם מדווח על חמישה ממדים נוספים (Confirmed Success, Steerability, Bash Recovery ואחרים) בלוח המלא.

לוח השימוש מגיע מ-OpenRouter וסופר את חלק ה-API token האמיתי — מפתחים מצביעים עם הארנקים שלהם, מה שמשלים את לוחות ההעדפה הסובייקטיביים.

לוחות הדיבור מגיעים מ-Artificial Analysis: TTS משתמש ב-Speech Arena Elo עם האזנה עיוורת; ASR משתמש ב-AA-WER v2, שבו נמוך יותר עדיף; ו-Speech-to-Speech מקורי משתמש במדד משוקלל שווה של Big Bench Audio, Full Duplex Bench ו-τ-Voice, שבו גבוה יותר עדיף. יש להשוות ציונים רק בתוך אותו לוח. מקור: artificialanalysis.ai.

לוח ה-Intelligence Index מגיע מ-Artificial Analysis: הוא מזקק מדדים ציבוריים רבים למדד Intelligence Index יחיד מ-0 עד 100, המודד יכולת אובייקטיבית ולא העדפה סובייקטיבית — משלים טבעי להצבעה עיוורת אנושית של arena.ai. מקור: artificialanalysis.ai.