דירוגי מודלי AI
דירוגי AI מרובי מקורות לצ'אט, דיבור, TTS, ASR, קוד, תמונה, וידאו וסוכנים — מ-arena.ai, OpenRouter ו-Artificial Analysis.
| מיקום | מודל | ספק | אחוז נתח ? | Tokens ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-5.6-luna-20260709 | OpenAI | 11.9% | 1.7T | 0.200 | 1.20 | 0.020 |
| 2 | deepseek-v4-flash-20260731 | DeepSeek | 11.3% | 1.6T | 0.030 | 0.100 | 0.0070 |
| 3 | mimo-v2.5-20260422 | Xiaomi | 11.1% | 1.6T | 0.140 | 0.280 | 0.0028 |
| 4 | glm-5.3-flash-20260826 | Zhipu | 10.9% | 1.6T | 0.075 | 0.250 | 0.015 |
| 5 | hy3-20260706 | Tencent | 6.8% | 963.0B | 0.132 | 0.528 | 0.033 |
| 6 | nemotron-3-ultra-550b-a55b-20260604 | Nvidia | 5.3% | 750.2B | 0.500 | 2.20 | 0.100 |
| 7 | deepseek-v4-flash-20260423 | DeepSeek | 5% | 711.5B | 0.030 | 0.100 | 0.0070 |
| 8 | minimax-m3-20260531 | MiniMax | 4.2% | 605.1B | 0.300 | 1.20 | 0.060 |
| 9 | hy4-preview-20260827 | Tencent | 2.6% | 363.8B | 0.834 | 2.50 | 0.042 |
| 10 | gemini-3.7-flash-20260813 | 2.5% | 353.6B | 0.750 | 3.75 | 0.075 | |
| 11 | glm-5.2-20260616 | Zhipu | 2.4% | 338.1B | 1.19 | 3.74 | 0.221 |
| 12 | gpt-5.6-sol-20260709 | OpenAI | 1.7% | 248.2B | 2.00 | 10.0 | 0.200 |
| 13 | deepseek-v4-pro-20260423 | DeepSeek | 1.6% | 233.3B | 0.660 | 1.98 | 0.022 |
| 14 | kimi-k3-20260715 | Moonshot | 1.6% | 226.0B | 3.00 | 15.0 | 0.300 |
| 15 | claude-opus-5-20260723 | Anthropic | 1.5% | 220.7B | 5.00 | 25.0 | 0.500 |
מקור: OpenRouter · עודכן 2026-08-28 · PandaNpc עודכן 29 באוג׳ 2026, 06:00 UTCהצג דירוג מלא →
קריאת המספרים
arena.ai (לשעבר LMArena) מציגה למשתמשים שתי תשובות אנונימיות לאותה הנחיה ומבקשת מהם לבחור אחת, ואז גוזרת דירוג Elo מהקרבות הללו. היא מודדת איזו תשובה אנשים מעדיפים — לא יכולת אובייקטיבית. סגנון חביב יכול לנצח, בעוד תשובה מדויקת אך מפורטת מדי עלולה להפסיד.
הצבעות הן הקרבות שמודל צבר. למודל שזה עתה נרשם יש מעט הצבעות ורווח בר סמך רחב, כך שהדירוג שלו משתנה בקלות — קרא תמיד את הדירוג יחד עם רווח ה-±.
לוח הסוכן פועל אחרת משאר הלוחות: הוא מודד הפעלות סוכן אמיתיות ולא העדפות של קולות עיוורים. מדד הכותרת שלו, Net Improvement, הוא רווח באחוזים — לא דירוג Elo — ולכן לא ניתן להשוותו בין לוחות. arena.ai גם מדווח על חמישה ממדים נוספים (Confirmed Success, Steerability, Bash Recovery ואחרים) בלוח המלא.
לוח השימוש מגיע מ-OpenRouter וסופר את חלק ה-API token האמיתי — מפתחים מצביעים עם הארנקים שלהם, מה שמשלים את לוחות ההעדפה הסובייקטיביים.
לוחות הדיבור מגיעים מ-Artificial Analysis: TTS משתמש ב-Speech Arena Elo עם האזנה עיוורת; ASR משתמש ב-AA-WER v2, שבו נמוך יותר עדיף; ו-Speech-to-Speech מקורי משתמש במדד משוקלל שווה של Big Bench Audio, Full Duplex Bench ו-τ-Voice, שבו גבוה יותר עדיף. יש להשוות ציונים רק בתוך אותו לוח. מקור: artificialanalysis.ai.
לוח ה-Intelligence Index מגיע מ-Artificial Analysis: הוא מזקק מדדים ציבוריים רבים למדד Intelligence Index יחיד מ-0 עד 100, המודד יכולת אובייקטיבית ולא העדפה סובייקטיבית — משלים טבעי להצבעה עיוורת אנושית של arena.ai. מקור: artificialanalysis.ai.
