Πίνακες κατάταξης μοντέλων AI

Πολυ-πηγαίες κατατάξεις AI για συνομιλία, ομιλία, TTS, ASR, κώδικα, εικόνα, βίντεο και πράκτορες — από arena.ai, OpenRouter και Artificial Analysis.

ΚατάταξηΜοντέλοΠρομηθευτήςElo ?Ψήφοι ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Πηγή: arena.ai · Ενημερώθηκε Aug 21, 2026 · PandaNpc Ενημερώθηκε 29 Αυγ 2026, 06:00 (Συντονισμένη Παγκόσμια Ώρα)Προβολή πλήρους πίνακα κατάταξης →

Πώς να διαβάσετε τους αριθμούς

arena.ai (πρώην LMArena) δείχνει στους χρήστες δύο ανώνυμες απαντήσεις στο ίδιο ερώτημα και τους ζητά να επιλέξουν μία, στη συνέχεια εξάγει μια βαθμολογία Elo από αυτές τις μάχες. Μετρά ποια απάντηση προτιμούν οι άνθρωποι — όχι αντικειμενική ικανότητα. Ένα συμπαθητικό ύφος μπορεί να κερδίσει, ενώ μια αυστηρή αλλά φλύαρη απάντηση μπορεί να χάσει.

Οι ψήφοι είναι οι μάχες που έχει συσσωρεύσει ένα μοντέλο. Ένα νεοπροστεθέν μοντέλο έχει λίγες ψήφους και μεγάλο διάστημα εμπιστοσύνης, επομένως η κατάταξή του αλλάζει εύκολα — πάντα να διαβάζετε την κατάταξη μαζί με το διάστημα ±.

Ο πίνακας Πράκτορα λειτουργεί διαφορετικά από τους υπόλοιπους: μετρά πραγματικές συνεδρίες πρακτόρων αντί για προτιμήσεις τυφλής ψηφοφορίας. Η κύρια μετρική του, Net Improvement, είναι μια ποσοστιαία βελτίωση — όχι βαθμολογία Elo — επομένως δεν μπορεί να συγκριθεί μεταξύ πινάκων. Το arena.ai αναφέρει επίσης πέντε ακόμη διαστάσεις (Confirmed Success, Steerability, Bash Recovery και άλλες) στον πλήρη πίνακα κατάταξης.

Ο πίνακας χρήσης προέρχεται από το OpenRouter και μετρά το πραγματικό μερίδιο token API — οι προγραμματιστές ψηφίζουν με τα πορτοφόλια τους, το οποίο συμπληρώνει τους υποκειμενικούς πίνακες προτίμησης.

Οι πίνακες ομιλίας προέρχονται από την Artificial Analysis: Το TTS χρησιμοποιεί το Speech Arena Elo με τυφλή ακρόαση· το ASR χρησιμοποιεί το AA-WER v2, όπου το χαμηλότερο είναι καλύτερο· και το εγγενές Speech-to-Speech χρησιμοποιεί ένα σύνθετο ίσων βαρών από τα Big Bench Audio, Full Duplex Bench και τ-Voice, όπου το υψηλότερο είναι καλύτερο. Συγκρίνετε τις βαθμολογίες μόνο εντός του ίδιου πίνακα. Πηγή: artificialanalysis.ai.

Ο πίνακας Intelligence Index προέρχεται από το Artificial Analysis: συμπυκνώνει πολλά δημόσια benchmarks σε έναν ενιαίο δείκτη Intelligence Index από 0 έως 100, μετρώντας αντικειμενική ικανότητα αντί για υποκειμενική προτίμηση — ένα φυσικό συμπλήρωμα στην ανθρώπινη τυφλή ψηφοφορία του arena.ai. Πηγή: artificialanalysis.ai.