กระดานผู้นำโมเดล AI

การจัดอันดับ AI หลายแหล่งสำหรับแชท คำพูด TTS ASR โค้ด รูปภาพ วิดีโอ และเอเจนต์ — จาก arena.ai, OpenRouter และ Artificial Analysis

อันดับโมเดลผู้ให้บริการส่วนแบ่ง % ?Tokens ?Input ?OutputCache ?
1OpenAIgpt-5.6-luna-20260709OpenAI11.9%1.7T0.2001.200.020
2DeepSeekdeepseek-v4-flash-20260731DeepSeek11.3%1.6T0.0300.1000.0070
3Xiaomimimo-v2.5-20260422Xiaomi11.1%1.6T0.1400.2800.0028
4Zhipuglm-5.3-flash-20260826Zhipu10.9%1.6T0.0750.2500.015
5Tencenthy3-20260706Tencent6.8%963.0B0.1320.5280.033
6Nvidianemotron-3-ultra-550b-a55b-20260604Nvidia5.3%750.2B0.5002.200.100
7DeepSeekdeepseek-v4-flash-20260423DeepSeek5%711.5B0.0300.1000.0070
8MiniMaxminimax-m3-20260531MiniMax4.2%605.1B0.3001.200.060
9Tencenthy4-preview-20260827Tencent2.6%363.8B0.8342.500.042
10Googlegemini-3.7-flash-20260813Google2.5%353.6B0.7503.750.075
11Zhipuglm-5.2-20260616Zhipu2.4%338.1B1.193.740.221
12OpenAIgpt-5.6-sol-20260709OpenAI1.7%248.2B2.0010.00.200
13DeepSeekdeepseek-v4-pro-20260423DeepSeek1.6%233.3B0.6601.980.022
14Moonshotkimi-k3-20260715Moonshot1.6%226.0B3.0015.00.300
15Anthropicclaude-opus-5-20260723Anthropic1.5%220.7B5.0025.00.500

แหล่งที่มา: OpenRouter · อัปเดต 2026-08-28 · PandaNpc อัปเดต 29 ส.ค. 2569 06:00 UTCดูกระดานผู้นำเต็ม →

วิธีอ่านตัวเลข

arena.ai (เดิมชื่อ LMArena) แสดงคำตอบที่ไม่เปิดเผยชื่อสองคำตอบสำหรับคำถามเดียวกันให้ผู้ใช้ดู และขอให้พวกเขาเลือกหนึ่งคำตอบ จากนั้นจึงคำนวณคะแนน Elo จากการเปรียบเทียบนั้น มันวัดว่าผู้คนชอบคำตอบไหน — ไม่ใช่ความสามารถตามวัตถุประสงค์ สไตล์ที่ถูกใจสามารถชนะได้ ในขณะที่คำตอบที่เคร่งครัดแต่ยืดเยื้ออาจแพ้

คะแนนโหวตคือจำนวนการต่อสู้ที่โมเดลได้สะสมไว้ โมเดลที่เพิ่งถูกเพิ่มเข้ามามีคะแนนโหวตน้อยและช่วงความเชื่อมั่นกว้าง ดังนั้นอันดับจึงเปลี่ยนแปลงได้ง่าย — ควรอ่านอันดับควบคู่กับช่วง ± เสมอ

กระดาน Agent ทำงานแตกต่างจากกระดานอื่น ๆ: มันวัดเซสชันของเอเจนต์จริง แทนที่จะเป็นความชอบจากการโหวตแบบไม่เห็นหน้า เมตริกหลักคือ Net Improvement ซึ่งเป็นการเพิ่มเป็นเปอร์เซ็นต์ — ไม่ใช่คะแนน Elo — ดังนั้นจึงไม่สามารถเปรียบเทียบข้ามกระดานได้ arena.ai ยังรายงานอีกห้ามิติ (Confirmed Success, Steerability, Bash Recovery และอื่น ๆ) ในกระดานคะแนนเต็ม

กระดานการใช้งานมาจาก OpenRouter และนับส่วนแบ่ง token API จริง — นักพัฒนาโหวตด้วยกระเป๋าเงินของพวกเขา ซึ่งเสริมกระดานความชอบตามอัตวิสัย

กระดานเสียงพูดมาจาก Artificial Analysis: TTS ใช้ Speech Arena Elo จากการฟังแบบปกปิด; ASR ใช้ AA-WER v2 โดยค่ายิ่งต่ำยิ่งดี; และ Speech-to-Speech แบบเนทีฟใช้คะแนนรวมแบบถ่วงน้ำหนักเท่ากันของ Big Bench Audio, Full Duplex Bench และ τ-Voice โดยค่ายิ่งสูงยิ่งดี เปรียบเทียบคะแนนเฉพาะภายในกระดานเดียวกันเท่านั้น แหล่งที่มา: artificialanalysis.ai

กระดาน Intelligence Index มาจาก Artificial Analysis: มันรวบรวมเกณฑ์มาตรฐานสาธารณะหลายๆ อย่างเข้าด้วยกันเป็นดัชนี Intelligence Index ตั้งแต่ 0-100 ซึ่งวัดความสามารถตามวัตถุประสงค์มากกว่าความชอบส่วนตัว — เป็นส่วนเสริมที่เหมาะสมกับการโหวตแบบปกปิดของมนุษย์จาก arena.ai ที่มา: artificialanalysis.ai