Πίνακες κατάταξης μοντέλων AI

Πολυ-πηγαίες κατατάξεις AI για συνομιλία, ομιλία, TTS, ASR, κώδικα, εικόνα, βίντεο και πράκτορες — από arena.ai, OpenRouter και Artificial Analysis.

ΚατάταξηΜοντέλοΠρομηθευτήςElo ?Ψήφοι ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Πηγή: arena.ai · Ενημερώθηκε Aug 25, 2026 · PandaNpc Ενημερώθηκε 29 Αυγ 2026, 06:00 (Συντονισμένη Παγκόσμια Ώρα)Προβολή πλήρους πίνακα κατάταξης →

Πώς να διαβάσετε τους αριθμούς

arena.ai (πρώην LMArena) δείχνει στους χρήστες δύο ανώνυμες απαντήσεις στο ίδιο ερώτημα και τους ζητά να επιλέξουν μία, στη συνέχεια εξάγει μια βαθμολογία Elo από αυτές τις μάχες. Μετρά ποια απάντηση προτιμούν οι άνθρωποι — όχι αντικειμενική ικανότητα. Ένα συμπαθητικό ύφος μπορεί να κερδίσει, ενώ μια αυστηρή αλλά φλύαρη απάντηση μπορεί να χάσει.

Οι ψήφοι είναι οι μάχες που έχει συσσωρεύσει ένα μοντέλο. Ένα νεοπροστεθέν μοντέλο έχει λίγες ψήφους και μεγάλο διάστημα εμπιστοσύνης, επομένως η κατάταξή του αλλάζει εύκολα — πάντα να διαβάζετε την κατάταξη μαζί με το διάστημα ±.

Ο πίνακας Πράκτορα λειτουργεί διαφορετικά από τους υπόλοιπους: μετρά πραγματικές συνεδρίες πρακτόρων αντί για προτιμήσεις τυφλής ψηφοφορίας. Η κύρια μετρική του, Net Improvement, είναι μια ποσοστιαία βελτίωση — όχι βαθμολογία Elo — επομένως δεν μπορεί να συγκριθεί μεταξύ πινάκων. Το arena.ai αναφέρει επίσης πέντε ακόμη διαστάσεις (Confirmed Success, Steerability, Bash Recovery και άλλες) στον πλήρη πίνακα κατάταξης.

Ο πίνακας χρήσης προέρχεται από το OpenRouter και μετρά το πραγματικό μερίδιο token API — οι προγραμματιστές ψηφίζουν με τα πορτοφόλια τους, το οποίο συμπληρώνει τους υποκειμενικούς πίνακες προτίμησης.

Οι πίνακες ομιλίας προέρχονται από την Artificial Analysis: Το TTS χρησιμοποιεί το Speech Arena Elo με τυφλή ακρόαση· το ASR χρησιμοποιεί το AA-WER v2, όπου το χαμηλότερο είναι καλύτερο· και το εγγενές Speech-to-Speech χρησιμοποιεί ένα σύνθετο ίσων βαρών από τα Big Bench Audio, Full Duplex Bench και τ-Voice, όπου το υψηλότερο είναι καλύτερο. Συγκρίνετε τις βαθμολογίες μόνο εντός του ίδιου πίνακα. Πηγή: artificialanalysis.ai.

Ο πίνακας Intelligence Index προέρχεται από το Artificial Analysis: συμπυκνώνει πολλά δημόσια benchmarks σε έναν ενιαίο δείκτη Intelligence Index από 0 έως 100, μετρώντας αντικειμενική ικανότητα αντί για υποκειμενική προτίμηση — ένα φυσικό συμπλήρωμα στην ανθρώπινη τυφλή ψηφοφορία του arena.ai. Πηγή: artificialanalysis.ai.