Πίνακες κατάταξης μοντέλων AI

Πολυ-πηγαίες κατατάξεις AI για συνομιλία, ομιλία, TTS, ASR, κώδικα, εικόνα, βίντεο και πράκτορες — από arena.ai, OpenRouter και Artificial Analysis.

ΚατάταξηΜοντέλοΠρομηθευτήςΜερίδιο % ?Tokens ?Input ?OutputCache ?
1OpenAIgpt-5.6-luna-20260709OpenAI11.9%1.7T0.2001.200.020
2DeepSeekdeepseek-v4-flash-20260731DeepSeek11.3%1.6T0.0300.1000.0070
3Xiaomimimo-v2.5-20260422Xiaomi11.1%1.6T0.1400.2800.0028
4Zhipuglm-5.3-flash-20260826Zhipu10.9%1.6T0.0750.2500.015
5Tencenthy3-20260706Tencent6.8%963.0B0.1320.5280.033
6Nvidianemotron-3-ultra-550b-a55b-20260604Nvidia5.3%750.2B0.5002.200.100
7DeepSeekdeepseek-v4-flash-20260423DeepSeek5%711.5B0.0300.1000.0070
8MiniMaxminimax-m3-20260531MiniMax4.2%605.1B0.3001.200.060
9Tencenthy4-preview-20260827Tencent2.6%363.8B0.8342.500.042
10Googlegemini-3.7-flash-20260813Google2.5%353.6B0.7503.750.075
11Zhipuglm-5.2-20260616Zhipu2.4%338.1B1.193.740.221
12OpenAIgpt-5.6-sol-20260709OpenAI1.7%248.2B2.0010.00.200
13DeepSeekdeepseek-v4-pro-20260423DeepSeek1.6%233.3B0.6601.980.022
14Moonshotkimi-k3-20260715Moonshot1.6%226.0B3.0015.00.300
15Anthropicclaude-opus-5-20260723Anthropic1.5%220.7B5.0025.00.500

Πηγή: OpenRouter · Ενημερώθηκε 2026-08-28 · PandaNpc Ενημερώθηκε 29 Αυγ 2026, 06:00 (Συντονισμένη Παγκόσμια Ώρα)Προβολή πλήρους πίνακα κατάταξης →

Πώς να διαβάσετε τους αριθμούς

arena.ai (πρώην LMArena) δείχνει στους χρήστες δύο ανώνυμες απαντήσεις στο ίδιο ερώτημα και τους ζητά να επιλέξουν μία, στη συνέχεια εξάγει μια βαθμολογία Elo από αυτές τις μάχες. Μετρά ποια απάντηση προτιμούν οι άνθρωποι — όχι αντικειμενική ικανότητα. Ένα συμπαθητικό ύφος μπορεί να κερδίσει, ενώ μια αυστηρή αλλά φλύαρη απάντηση μπορεί να χάσει.

Οι ψήφοι είναι οι μάχες που έχει συσσωρεύσει ένα μοντέλο. Ένα νεοπροστεθέν μοντέλο έχει λίγες ψήφους και μεγάλο διάστημα εμπιστοσύνης, επομένως η κατάταξή του αλλάζει εύκολα — πάντα να διαβάζετε την κατάταξη μαζί με το διάστημα ±.

Ο πίνακας Πράκτορα λειτουργεί διαφορετικά από τους υπόλοιπους: μετρά πραγματικές συνεδρίες πρακτόρων αντί για προτιμήσεις τυφλής ψηφοφορίας. Η κύρια μετρική του, Net Improvement, είναι μια ποσοστιαία βελτίωση — όχι βαθμολογία Elo — επομένως δεν μπορεί να συγκριθεί μεταξύ πινάκων. Το arena.ai αναφέρει επίσης πέντε ακόμη διαστάσεις (Confirmed Success, Steerability, Bash Recovery και άλλες) στον πλήρη πίνακα κατάταξης.

Ο πίνακας χρήσης προέρχεται από το OpenRouter και μετρά το πραγματικό μερίδιο token API — οι προγραμματιστές ψηφίζουν με τα πορτοφόλια τους, το οποίο συμπληρώνει τους υποκειμενικούς πίνακες προτίμησης.

Οι πίνακες ομιλίας προέρχονται από την Artificial Analysis: Το TTS χρησιμοποιεί το Speech Arena Elo με τυφλή ακρόαση· το ASR χρησιμοποιεί το AA-WER v2, όπου το χαμηλότερο είναι καλύτερο· και το εγγενές Speech-to-Speech χρησιμοποιεί ένα σύνθετο ίσων βαρών από τα Big Bench Audio, Full Duplex Bench και τ-Voice, όπου το υψηλότερο είναι καλύτερο. Συγκρίνετε τις βαθμολογίες μόνο εντός του ίδιου πίνακα. Πηγή: artificialanalysis.ai.

Ο πίνακας Intelligence Index προέρχεται από το Artificial Analysis: συμπυκνώνει πολλά δημόσια benchmarks σε έναν ενιαίο δείκτη Intelligence Index από 0 έως 100, μετρώντας αντικειμενική ικανότητα αντί για υποκειμενική προτίμηση — ένα φυσικό συμπλήρωμα στην ανθρώπινη τυφλή ψηφοφορία του arena.ai. Πηγή: artificialanalysis.ai.