Official AI Models & LLM Benchmark Hub (2026 Live Verified)
AI Models & LLM Intelligence Leaderboard
Comprehensive, zero-drift AI benchmarks aggregated across LMSYS Arena.ai (human Elo), Artificial Analysis (quality/speed ratio & price), SWE-bench Verified, GPQA Diamond, LiveBench, and MTEB.
#1 Frontier Reasoning
Claude Opus 5 (High)
Anthropic • Ultra-MoE
1504 Arena Elo • 78.6% SWE
#1 Test-Time Compute
GPT-5.6 Sol (xHigh)
OpenAI • Adaptive MoE
1498 Arena Elo • 97.6 Intel
#1 Quality / Speed Ratio
Gemini 3.7 Flash
Google • 2M Context
158 pts Ratio • 165 tps ($0.61/M)
#1 Open Weights MIT
DeepSeek-V4 Pro
DeepSeek • 750B MoE
1474 Arena Elo • $0.35/M
| # | Model & Architecture | Arena Elo (Human) | SWE / GPQA | Speed & Ratio | Price ($/1M) | Context | Actions |
|---|---|---|---|---|---|---|---|
| 1 |
Qwen 3.8 Max
|
1482
(10.0k)
|
70.4%
SWE
GPQA: 77.8%
|
115 tps
108 pts
TTFT: 260ms
|
$1.05
Blended 3:1
|
256k
Tokens
|
|
| 2 |
GLM 5.3 Max (MIT)
|
1477
(3.8k)
|
68.2%
SWE
GPQA: 76.2%
|
88 tps
81 pts
TTFT: 360ms
|
$0.60
Blended 3:1
|
256k
Tokens
|
|
| 3 |
Qwen 3.5 397B-A17B
|
1455
(70.2k)
|
68.9%
SWE
GPQA: 76.5%
|
95 tps
87 pts
TTFT: 310ms
|
$0.27
Blended 3:1
|
256k
Tokens
|
|
| 4 |
Gemma 4 26B-A4B
|
1448
(5.8k)
|
65.8%
SWE
GPQA: 73.9%
|
155 tps
139 pts
TTFT: 180ms
|
$0.12
Blended 3:1
|
128k
Tokens
|
|
| 5 |
DeepSeek-V4 Flash
|
1445
(49.0k)
|
64.9%
SWE
GPQA: 73.1%
|
180 tps
161 pts
TTFT: 160ms
|
$0.12
Blended 3:1
|
256k
Tokens
|
|
| 6 |
Mistral Large 3
|
1440
(62.6k)
|
63.8%
SWE
GPQA: 72.4%
|
82 tps
73 pts
TTFT: 380ms
|
$0.75
Blended 3:1
|
256k
Tokens
|
Query this Leaderboard via REST API & Agents
Instant, zero-auth JSON endpoint with edge caching for programmatic model selection.
GET https://yakaai.com/api/leaderboard