Official AI Models & LLM Benchmark Hub (2026 Live Verified)

AI Models & LLM Intelligence Leaderboard

Comprehensive, zero-drift AI benchmarks aggregated across LMSYS Arena.ai (human Elo), Artificial Analysis (quality/speed ratio & price), SWE-bench Verified, GPQA Diamond, LiveBench, and MTEB.

#1 Frontier Reasoning
Claude Opus 5 (High)
Anthropic • Ultra-MoE
1504 Arena Elo • 78.6% SWE
#1 Test-Time Compute
GPT-5.6 Sol (xHigh)
OpenAI • Adaptive MoE
1498 Arena Elo • 97.6 Intel
#1 Quality / Speed Ratio
Gemini 3.7 Flash
Google • 2M Context
158 pts Ratio • 165 tps ($0.61/M)
#1 Open Weights MIT
DeepSeek-V4 Pro
DeepSeek • 750B MoE
1474 Arena Elo • $0.35/M
License: All Open Proprietary
# Model & Architecture Arena Elo (Human) SWE / GPQA Speed & Ratio Price ($/1M) Context Actions
1
Qwen 3.8 Max
Alibaba Qwen Mega-MoE proprietary
1482 (10.0k)
70.4% SWE
GPQA: 77.8%
115 tps 108 pts
TTFT: 260ms
$1.05
Blended 3:1
256k
Tokens
2
GLM 5.3 Max (MIT)
Zhipu AI 380B (42B active) 48GB open-source
1477 (3.8k)
68.2% SWE
GPQA: 76.2%
88 tps 81 pts
TTFT: 360ms
$0.60
Blended 3:1
256k
Tokens
3
Qwen 3.5 397B-A17B
Alibaba Qwen 397B (17B active) 32GB open-source
1455 (70.2k)
68.9% SWE
GPQA: 76.5%
95 tps 87 pts
TTFT: 310ms
$0.27
Blended 3:1
256k
Tokens
4
Gemma 4 26B-A4B
Google DeepMind 26B (4B active) 12GB open-source
1448 (5.8k)
65.8% SWE
GPQA: 73.9%
155 tps 139 pts
TTFT: 180ms
$0.12
Blended 3:1
128k
Tokens
5
DeepSeek-V4 Flash
DeepSeek 128B (12B active) 24GB open-source
1445 (49.0k)
64.9% SWE
GPQA: 73.1%
180 tps 161 pts
TTFT: 160ms
$0.12
Blended 3:1
256k
Tokens
6
Mistral Large 3
Mistral AI 140B Dense 48GB open-source
1440 (62.6k)
63.8% SWE
GPQA: 72.4%
82 tps 73 pts
TTFT: 380ms
$0.75
Blended 3:1
256k
Tokens

Query this Leaderboard via REST API & Agents

Instant, zero-auth JSON endpoint with edge caching for programmatic model selection.

GET https://yakaai.com/api/leaderboard