Πίνακες κατάταξης μοντέλων AI
Πολυ-πηγαίες κατατάξεις AI για συνομιλία, ομιλία, TTS, ASR, κώδικα, εικόνα, βίντεο και πράκτορες — από arena.ai, OpenRouter και Artificial Analysis.
| Κατάταξη | Μοντέλο | Προμηθευτής | AA-WER ↓ ? |
|---|---|---|---|
| 1 | Fun-Realtime-ASR-preview | Alibaba | 1.73% |
| 2 | Scribe v2, ElevenLabs | ElevenLabs | 2.18% |
| 3 | MAI-Transcribe-1.5 | Microsoft AI | 2.38% |
| 4 | Smallest AI Pulse Pro | Smallest.ai | 2.43% |
| 5 | Gemini 3.5 Transcribe | 2.6% | |
| 6 | Voxtral Small, Mistral | Mistral | 2.77% |
| 7 | Gemini 3.1 Pro Preview (High) | 2.82% | |
| 8 | Universal-3.5 Pro, AssemblyAI | AssemblyAI | 3.02% |
| 9 | Solaria-3, Gladia | Gladia | 3.23% |
| 10 | GPT Transcribe, OpenAI | OpenAI | 3.31% |
| 11 | Resonant-1 | Reson8 | 3.39% |
| 12 | Inkling (256K), Thinking Machines | Thinking Machines | 3.47% |
| 13 | Qwen3.5 Omni Plus | Alibaba | 3.55% |
| 14 | Gemini 3.1 Pro Preview (Low) | 3.58% | |
| 15 | Voxtral Mini Transcribe 2, Mistral | Mistral | 3.59% |
Πηγή: Artificial Analysis · Ενημερώθηκε Aug 29, 2026 · PandaNpc Ενημερώθηκε 29 Αυγ 2026, 06:00 (Συντονισμένη Παγκόσμια Ώρα)Προβολή πλήρους πίνακα κατάταξης →
Πώς να διαβάσετε τους αριθμούς
arena.ai (πρώην LMArena) δείχνει στους χρήστες δύο ανώνυμες απαντήσεις στο ίδιο ερώτημα και τους ζητά να επιλέξουν μία, στη συνέχεια εξάγει μια βαθμολογία Elo από αυτές τις μάχες. Μετρά ποια απάντηση προτιμούν οι άνθρωποι — όχι αντικειμενική ικανότητα. Ένα συμπαθητικό ύφος μπορεί να κερδίσει, ενώ μια αυστηρή αλλά φλύαρη απάντηση μπορεί να χάσει.
Οι ψήφοι είναι οι μάχες που έχει συσσωρεύσει ένα μοντέλο. Ένα νεοπροστεθέν μοντέλο έχει λίγες ψήφους και μεγάλο διάστημα εμπιστοσύνης, επομένως η κατάταξή του αλλάζει εύκολα — πάντα να διαβάζετε την κατάταξη μαζί με το διάστημα ±.
Ο πίνακας Πράκτορα λειτουργεί διαφορετικά από τους υπόλοιπους: μετρά πραγματικές συνεδρίες πρακτόρων αντί για προτιμήσεις τυφλής ψηφοφορίας. Η κύρια μετρική του, Net Improvement, είναι μια ποσοστιαία βελτίωση — όχι βαθμολογία Elo — επομένως δεν μπορεί να συγκριθεί μεταξύ πινάκων. Το arena.ai αναφέρει επίσης πέντε ακόμη διαστάσεις (Confirmed Success, Steerability, Bash Recovery και άλλες) στον πλήρη πίνακα κατάταξης.
Ο πίνακας χρήσης προέρχεται από το OpenRouter και μετρά το πραγματικό μερίδιο token API — οι προγραμματιστές ψηφίζουν με τα πορτοφόλια τους, το οποίο συμπληρώνει τους υποκειμενικούς πίνακες προτίμησης.
Οι πίνακες ομιλίας προέρχονται από την Artificial Analysis: Το TTS χρησιμοποιεί το Speech Arena Elo με τυφλή ακρόαση· το ASR χρησιμοποιεί το AA-WER v2, όπου το χαμηλότερο είναι καλύτερο· και το εγγενές Speech-to-Speech χρησιμοποιεί ένα σύνθετο ίσων βαρών από τα Big Bench Audio, Full Duplex Bench και τ-Voice, όπου το υψηλότερο είναι καλύτερο. Συγκρίνετε τις βαθμολογίες μόνο εντός του ίδιου πίνακα. Πηγή: artificialanalysis.ai.
Ο πίνακας Intelligence Index προέρχεται από το Artificial Analysis: συμπυκνώνει πολλά δημόσια benchmarks σε έναν ενιαίο δείκτη Intelligence Index από 0 έως 100, μετρώντας αντικειμενική ικανότητα αντί για υποκειμενική προτίμηση — ένα φυσικό συμπλήρωμα στην ανθρώπινη τυφλή ψηφοφορία του arena.ai. Πηγή: artificialanalysis.ai.
