Πίνακες κατάταξης μοντέλων AI

Πολυ-πηγαίες κατατάξεις AI για συνομιλία, ομιλία, TTS, ASR, κώδικα, εικόνα, βίντεο και πράκτορες — από arena.ai, OpenRouter και Artificial Analysis.

ΚατάταξηΜοντέλοΠρομηθευτήςElo ?Ψήφοι ?
1Googlegemini-omni-flashGoogle1512 ±1116,916
2Black Forest Labsflux-3-videoBlack Forest Labs1494 ±171,291
3Bytedancedreamina-seedance-2.0-720pBytedance1482 ±1049,058
4Bytedancedreamina-seedance-2.5-720pBytedance1477 ±191,337
5Metamuse-videoMeta1457 ±152,176
6MiniMaxminimax-h3MiniMax1453 ±133,081
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1428 ±1322,113
8OpenAIsora-2-proOpenAI1364 ±746,509
9Googleveo-3.1-audioGoogle1364 ±1413,743
10Googleveo-3.1-audio-1080pGoogle1363 ±1024,979
11Googleveo-3.1-fast-audioGoogle1361 ±1039,441
12Googleveo-3.1-fast-audio-1080pGoogle1358 ±1025,771
13Googleveo-3-fast-audioGoogle1347 ±1125,219
14SpaceXAIgrok-imagine-video-720pSpaceXAI1345 ±7154,827
15Alibabawan2.7-t2vAlibaba1344 ±917,769

Πηγή: arena.ai · Ενημερώθηκε Aug 14, 2026 · PandaNpc Ενημερώθηκε 29 Αυγ 2026, 06:00 (Συντονισμένη Παγκόσμια Ώρα)Προβολή πλήρους πίνακα κατάταξης →

Πώς να διαβάσετε τους αριθμούς

arena.ai (πρώην LMArena) δείχνει στους χρήστες δύο ανώνυμες απαντήσεις στο ίδιο ερώτημα και τους ζητά να επιλέξουν μία, στη συνέχεια εξάγει μια βαθμολογία Elo από αυτές τις μάχες. Μετρά ποια απάντηση προτιμούν οι άνθρωποι — όχι αντικειμενική ικανότητα. Ένα συμπαθητικό ύφος μπορεί να κερδίσει, ενώ μια αυστηρή αλλά φλύαρη απάντηση μπορεί να χάσει.

Οι ψήφοι είναι οι μάχες που έχει συσσωρεύσει ένα μοντέλο. Ένα νεοπροστεθέν μοντέλο έχει λίγες ψήφους και μεγάλο διάστημα εμπιστοσύνης, επομένως η κατάταξή του αλλάζει εύκολα — πάντα να διαβάζετε την κατάταξη μαζί με το διάστημα ±.

Ο πίνακας Πράκτορα λειτουργεί διαφορετικά από τους υπόλοιπους: μετρά πραγματικές συνεδρίες πρακτόρων αντί για προτιμήσεις τυφλής ψηφοφορίας. Η κύρια μετρική του, Net Improvement, είναι μια ποσοστιαία βελτίωση — όχι βαθμολογία Elo — επομένως δεν μπορεί να συγκριθεί μεταξύ πινάκων. Το arena.ai αναφέρει επίσης πέντε ακόμη διαστάσεις (Confirmed Success, Steerability, Bash Recovery και άλλες) στον πλήρη πίνακα κατάταξης.

Ο πίνακας χρήσης προέρχεται από το OpenRouter και μετρά το πραγματικό μερίδιο token API — οι προγραμματιστές ψηφίζουν με τα πορτοφόλια τους, το οποίο συμπληρώνει τους υποκειμενικούς πίνακες προτίμησης.

Οι πίνακες ομιλίας προέρχονται από την Artificial Analysis: Το TTS χρησιμοποιεί το Speech Arena Elo με τυφλή ακρόαση· το ASR χρησιμοποιεί το AA-WER v2, όπου το χαμηλότερο είναι καλύτερο· και το εγγενές Speech-to-Speech χρησιμοποιεί ένα σύνθετο ίσων βαρών από τα Big Bench Audio, Full Duplex Bench και τ-Voice, όπου το υψηλότερο είναι καλύτερο. Συγκρίνετε τις βαθμολογίες μόνο εντός του ίδιου πίνακα. Πηγή: artificialanalysis.ai.

Ο πίνακας Intelligence Index προέρχεται από το Artificial Analysis: συμπυκνώνει πολλά δημόσια benchmarks σε έναν ενιαίο δείκτη Intelligence Index από 0 έως 100, μετρώντας αντικειμενική ικανότητα αντί για υποκειμενική προτίμηση — ένα φυσικό συμπλήρωμα στην ανθρώπινη τυφλή ψηφοφορία του arena.ai. Πηγή: artificialanalysis.ai.