All scores
Query current results and exact history by benchmark.
Data as of 9/13/2026
94 current scores
Current scores
| Benchmark | Date | Brand | Model / evaluation config | Raw score |
|---|---|---|---|---|
| LMArena Text | Claude | Claude Fable 5 | 1506 | |
| LMArena Text | Muse | Muse Spark 1.2 · XHigh | 1500 | |
| LMArena Text | Gemini | Gemini 3.8 Flash · High | 1493 | |
| LMArena Text | Kimi | Kimi K3 · Max | 1485 | |
| LMArena Text | GPT | GPT-5.6 Sol · XHigh | 1483 | |
| LMArena Text | GLM | GLM-5.3 · Max | 1483 | |
| LMArena Text | Qwen | Qwen 3.8 Max | 1481 | |
| LMArena Text | Grok | Grok 4.20 Beta 1 | 1475 | |
| LMArena Text | ERNIE | ERNIE 5.1 | 1468 | |
| LMArena Text | MiMo | MiMo-V2.5-Pro | 1467 | |
| LMArena Text | DeepSeek | DeepSeek V4 Pro · High | 1463 | |
| LMArena Text | MiniMax | MiniMax M3 | 1441 | |
| LMArena Text | o-series | o3 | 1432 | |
| LMArena Text | Mistral | Mistral Large 3 | 1413 | |
| LMArena Text | Step | Step 3.5 Flash | 1394 | |
| LMArena Text | Hunyuan | Hunyuan T1 | 1387 | |
| LMArena Text | Athene | Athene 70B | 1306 | |
| LMArena Text | Reka | Reka Core | 1288 | |
| LMArena Text | OLMo | OLMo 2 32B Instruct | 1251 | |
| LMArena Text | OpenChat | OpenChat 3.5 | 1183 | |
| LiveBench Agentic Coding | Qwen | Qwen 3.8 Max | 64.65% | |
| LiveBench Agentic Coding | Kimi | Kimi K3 | 62.17% | |
| LiveBench Agentic Coding | GLM | GLM-5.3 | 60.91% | |
| LiveBench Agentic Coding | Muse | Muse Spark 1.1 · XHigh | 58.54% | |
| LiveBench Agentic Coding | Gemini | Gemini 3.7 Flash · High | 58.28% | |
| LiveBench Agentic Coding | Grok | Grok 4.6 | 57.02% | |
| LiveBench Agentic Coding | GPT | GPT-5.6 Sol · Max | 56.21% | |
| LiveBench Agentic Coding | DeepSeek | DeepSeek V4 Pro | 54.95% | |
| LiveBench Agentic Coding | Claude | Claude Sonnet 4.5 · Thinking 64K | 53.33% | |
| LiveBench Agentic Coding | MiniMax | MiniMax M3 | 40.66% | |
| τ³ Banking Knowledge | Qwen | Qwen 3.8 Max · XHigh | 55.15% | |
| τ³ Banking Knowledge | Claude | Claude Opus 5 · Max | 48.71% | |
| τ³ Banking Knowledge | Grok | Grok 4.5 · High | 47.94% | |
| τ³ Banking Knowledge | GPT | GPT-5.6 Sol · XHigh | 46.91% | |
| τ³ Banking Knowledge | Muse | Muse Spark 1.1 · XHigh | 40.46% | |
| τ³ Banking Knowledge | GLM | GLM-5.2 · XHigh | 37.11% | |
| τ³ Banking Knowledge | Kimi | Kimi K3 · Max | 37.11% | |
| τ³ Banking Knowledge | Gemini | Gemini 3.1 Pro Preview · High | 26.03% | |
| GPQA-Diamond | GPT | GPT-6 Astra · Max | 95.77% | |
| GPQA-Diamond | Gemini | Gemini 3.8 Flash · High | 95.39% | |
| GPQA-Diamond | Grok | Grok 4.6 · XHigh | 93.18% | |
| GPQA-Diamond | Claude | Claude Opus 5 | 92.93% | |
| GPQA-Diamond | Kimi | Kimi K3 · High | 91.92% | |
| GPQA-Diamond | DeepSeek | DeepSeek V4 Pro · Max | 91.67% | |
| GPQA-Diamond | GLM | GLM-5.3 · Max | 90.91% | |
| GPQA-Diamond | MiniMax | MiniMax M3 | 90.91% | |
| GPQA-Diamond | Qwen | Qwen 3.7 Max | 90.91% | |
| GPQA-Diamond | Muse | Muse Spark | 89.8% | |
| GPQA-Diamond | Inkling | Inkling Small · XHigh | 88.51% | |
| GPQA-Diamond | Nemotron | Nemotron 3 Ultra | 85.35% | |
| GPQA-Diamond | o-series | o3 · Medium | 80.81% | |
| OTIS Mock AIME 2024-2025 | Claude | Claude Fable 5.1 · Max | 100% | |
| OTIS Mock AIME 2024-2025 | GPT | GPT-6 Astra · Max | 100% | |
| OTIS Mock AIME 2024-2025 | Grok | Grok 4.6 · XHigh | 99.17% | |
| OTIS Mock AIME 2024-2025 | Gemini | Gemini 3.8 Flash · High | 98.89% | |
| OTIS Mock AIME 2024-2025 | DeepSeek | DeepSeek V4 Pro · Max | 98.61% | |
| OTIS Mock AIME 2024-2025 | Kimi | Kimi K2.7 Code | 95.56% | |
| OTIS Mock AIME 2024-2025 | Qwen | Qwen 3.7 Max | 95.56% | |
| OTIS Mock AIME 2024-2025 | GLM | GLM-5.3 · Max | 91.11% | |
| OTIS Mock AIME 2024-2025 | Inkling | Inkling Small · XHigh | 90% | |
| OTIS Mock AIME 2024-2025 | Muse | Muse Spark | 88.9% | |
| OTIS Mock AIME 2024-2025 | Nemotron | Nemotron 3 Ultra | 86.67% | |
| OTIS Mock AIME 2024-2025 | o-series | o3 · Medium | 84.44% | |
| OTIS Mock AIME 2024-2025 | MiniMax | MiniMax M3 | 71.11% | |
| AIME 2025 · OpenCompass | GLM | GLM-5 | 95.8% | |
| AIME 2025 · OpenCompass | Step | Step 3.5 Flash | 95.7% | |
| AIME 2025 · OpenCompass | GPT | GPT-5 · High | 94.1% | |
| AIME 2025 · OpenCompass | Gemini | Gemini 3 Pro Preview | 93.4% | |
| AIME 2025 · OpenCompass | Kimi | Kimi K2.5 | 91.9% | |
| AIME 2025 · OpenCompass | o-series | o4-mini · High | 91% | |
| AIME 2025 · OpenCompass | DeepSeek | DeepSeek R1 | 89% | |
| AIME 2025 · OpenCompass | Claude | Claude Sonnet 4 · Thinking | 68.7% | |
| SWE-bench Verified | Claude | Claude Opus 4.7 · Max | 83.47% | |
| SWE-bench Verified | GPT | GPT-5.5 Pre-release · XHigh | 80.58% | |
| SWE-bench Verified | Gemini | Gemini 3.5 Flash · High | 79.34% | |
| SWE-bench Verified | GLM | GLM-5.2 · Max | 78.7% | |
| SWE-bench Verified | DeepSeek | DeepSeek V4 Pro · Max | 77.64% | |
| SWE-bench Verified | Qwen | Qwen 3.7 Max | 77.27% | |
| SWE-bench Verified | Kimi | Kimi K2.6 | 76.65% | |
| SWE-bench Verified | o-series | o3 · Medium | 62.32% | |
| LiveCodeBench V6 · OpenCompass | GLM | GLM-5 | 86.2% | |
| LiveCodeBench V6 · OpenCompass | Step | Step 3.5 Flash | 83.9% | |
| LiveCodeBench V6 · OpenCompass | GPT | GPT-5 · High | 83.2% | |
| LiveCodeBench V6 · OpenCompass | Gemini | Gemini 3 Pro Preview | 82.9% | |
| LiveCodeBench V6 · OpenCompass | Kimi | Kimi K2.5 | 80.6% | |
| LiveCodeBench V6 · OpenCompass | o-series | o3 | 72.7% | |
| LiveCodeBench V6 · OpenCompass | DeepSeek | DeepSeek R1 | 61% | |
| LiveCodeBench V6 · OpenCompass | Claude | Claude Sonnet 4 · Thinking | 47.5% | |
| Terminal-Bench 2.1 | Grok | Grok 4.5 · Cursor CLI · High | 79.33% | |
| Terminal-Bench 2.1 | Claude | Claude Opus 4.8 · Claude Code · High | 78.88% | |
| Terminal-Bench 2.1 | GPT | GPT-5.6 Terra · Codex · Max | 78.43% | |
| Terminal-Bench 2.1 | Muse | Muse Spark 1.1 · mini-SWE-agent · XHigh | 76.18% | |
| Terminal-Bench 2.1 | Gemini | Gemini 3.1 Pro Preview · Gemini CLI · High | 65.84% | |
| Terminal-Bench 2.1 | GLM | GLM-5.1 · Claude Code · Max | 58.65% |