Run #2436

success · fetched 2026-09-21 22:00:20 · 1.41 MB raw HTML · 134 models

Open this run in comparison view · JSON results

Top quality: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (53.4 pts)

Cost/task vs quality?

134 models · 12 on the Pareto frontier · intelligence quality vs Cost per Task

216294356$0.01$0.10$1$10 cost per task, log scale intelligence quality Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) · Cost/task: $3.91 · Time/task: 7.23m · Quality: 51.2Claude Opus 5 (Adaptive Reasoning, Max Effort) · Cost/task: $5.86 · Time/task: 13.6m · Quality: 50.8Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) · Cost/task: $4.88 · Time/task: 11.5m · Quality: 49.7Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) · Cost/task: $8.75 · Time/task: 10.3m · Quality: 49.6Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) · Cost/task: $2.98 · Time/task: 5.39m · Quality: 48.9Claude Opus 5 (Adaptive Reasoning, High Effort) · Cost/task: $3.61 · Time/task: 8.47m · Quality: 48.1Muse Spark 1.3 (max) · Cost/task: $1.60 · Time/task: 4.54m · Quality: 48.1GPT-5.6 Sol (max) · Cost/task: $1.99 · Time/task: 6.10m · Quality: 47.0Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) · Cost/task: $2.37 · Time/task: 4.21m · Quality: 46.8Grok 4.7 (xhigh) · Cost/task: $3.74 · Time/task: 19.9m · Quality: 46.4Grok 4.7 (high) · Cost/task: $2.73 · Time/task: 18.1m · Quality: 46.3GPT-6 Astra (low) · Cost/task: $0.818 · Time/task: 1.36m · Quality: 45.8Qwen3.8 Max (0902) · Cost/task: $5.41 · Time/task: 33.3m · Quality: 45.4Muse Spark 1.3 (xhigh) · Cost/task: $1.37 · Time/task: 3.67m · Quality: 45.1Claude Opus 5 (Adaptive Reasoning, Medium Effort) · Cost/task: $2.19 · Time/task: 5.24m · Quality: 44.8GLM-5.3 (max) · Cost/task: $2.01 · Time/task: 16.5m · Quality: 44.8Grok 4.6 (high) · Cost/task: $1.86 · Time/task: 10.0m · Quality: 44.3Grok 4.6 (xhigh) · Cost/task: $2.32 · Time/task: 11.1m · Quality: 44.2GPT-5.6 Sol (xhigh) · Cost/task: $1.18 · Time/task: 4.80m · Quality: 44.0Step 5 Preview · Cost/task: $0.716 · Time/task: 10.8m · Quality: 43.7Kimi K3 (max) · Cost/task: $2.00 · Time/task: 17.1m · Quality: 43.6Grok 4.6 (medium) · Cost/task: $1.50 · Time/task: 8.58m · Quality: 42.8GPT-5.6 Sol (high) · Cost/task: $0.808 · Time/task: 3.15m · Quality: 42.3GPT-5.6 Terra (max) · Cost/task: $1.40 · Time/task: 5.93m · Quality: 42.1GLM 5.3 Flash · Cost/task: $0.253 · Time/task: 10.9m · Quality: 41.8Claude Opus 4.8 (Adaptive Reasoning, Max Effort) · Cost/task: $4.08 · Time/task: 13.1m · Quality: 41.8Gemini 3.8 Flash (high) · Cost/task: $1.24 · Time/task: 3.39m · Quality: 40.9Qwen3.8 Max · Cost/task: $2.67 · Time/task: 20.2m · Quality: 40.2Qwen3.8 2.4T A95B · Cost/task: $2.16 · Time/task: 21.3m · Quality: 39.9Qwen3.8-Flash-Next · Cost/task: $0.372 · Time/task: 25.7m · Quality: 39.8Gemini 3.8 Flash (medium) · Cost/task: $0.931 · Time/task: - · Quality: 39.8Muse Spark 1.2 (xhigh) · Cost/task: $0.975 · Time/task: 4.34m · Quality: 39.6DeepSeek V4.1 Flash (Reasoning, Max Effort) · Cost/task: $0.265 · Time/task: 4.89m · Quality: 39.5Claude Opus 5 (Adaptive Reasoning, Low Effort) · Cost/task: $1.10 · Time/task: 2.49m · Quality: 39.4GPT-5.6 Sol (medium) · Cost/task: $0.505 · Time/task: 2.17m · Quality: 39.2Gemini 3.7 Flash (high) · Cost/task: $0.925 · Time/task: 2.78m · Quality: 39.1Grok 4.5 (high) · Cost/task: $1.04 · Time/task: 7.65m · Quality: 38.8GPT-5.5 (xhigh) · Cost/task: $2.63 · Time/task: 3.77m · Quality: 38.4Claude Sonnet 5 (Adaptive Reasoning, Max Effort) · Cost/task: $5.09 · Time/task: 15.7m · Quality: 38.2GPT-5.6 Terra (xhigh) · Cost/task: $0.632 · Time/task: 3.52m · Quality: 38.0GPT-5.6 Luna (max) · Cost/task: $0.178 · Time/task: 4.23m · Quality: 37.3GPT-5.5 (high) · Cost/task: $1.54 · Time/task: 2.69m · Quality: 37.0DeepSeek V4 Pro 0813 (Reasoning, Max Effort) · Cost/task: $0.674 · Time/task: 7.79m · Quality: 36.0Grok 4.6 (low) · Cost/task: $0.475 · Time/task: 3.16m · Quality: 35.1DeepSeek V4 Flash Vision (Reasoning, Max Effort) · Cost/task: $0.314 · Time/task: 3.69m · Quality: 34.8Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) · Cost/task: $2.87 · Time/task: 9.35m · Quality: 34.4DeepSeek V4 Flash 0731 (Reasoning, Max Effort) · Cost/task: $0.220 · Time/task: 3.42m · Quality: 34.3GPT-5.6 Terra (high) · Cost/task: $0.338 · Time/task: 2.09m · Quality: 34.2Gemini 3.6 Flash (high) · Cost/task: $0.929 · Time/task: 3.04m · Quality: 34.0GPT-5.5 (medium) · Cost/task: $0.902 · Time/task: 1.48m · Quality: 33.8Muse Spark 1.1 (xhigh) · Cost/task: $1.38 · Time/task: - · Quality: 33.7GLM-5.2 (max) · Cost/task: $0.965 · Time/task: 12.2m · Quality: 33.7Qwen3.8 27B (xhigh) · Cost/task: $0.820 · Time/task: 17.5m · Quality: 33.7GPT-5.6 Sol (low) · Cost/task: $0.261 · Time/task: 1.01m · Quality: 33.5Gemini 3.5 Flash (high) · Cost/task: $1.56 · Time/task: 3.95m · Quality: 32.6Claude Sonnet 5 (Adaptive Reasoning, High Effort) · Cost/task: $1.79 · Time/task: 6.93m · Quality: 31.7DeepSeek V4 Pro 0424 (Reasoning, Max Effort) · Cost/task: $0.122 · Time/task: 6.56m · Quality: 30.4GPT-5.6 Terra (medium) · Cost/task: $0.183 · Time/task: 60s · Quality: 30.1Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) · Cost/task: $2.49 · Time/task: 20.6m · Quality: 30.1Gemini 3.1 Pro Preview · Cost/task: $0.675 · Time/task: 2.46m · Quality: 29.7Qwen3.7 Max · Cost/task: $1.15 · Time/task: 2.32m · Quality: 29.5MiniMax-M3 · Cost/task: $0.508 · Time/task: 4.78m · Quality: 29.2Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) · Cost/task: $0.999 · Time/task: 4.43m · Quality: 28.1Qwen3.8 27B (medium) · Cost/task: $0.903 · Time/task: 15.9m · Quality: 27.6GPT-5.6 Terra (low) · Cost/task: $0.144 · Time/task: 43s · Quality: 27.5Kimi K2.6 · Cost/task: $0.800 · Time/task: 22.0m · Quality: 27.0Quasar 438B (max, based on GLM-5.2) · Cost/task: $2.02 · Time/task: 7.65m · Quality: 26.7Qwen3.8 27B (low) · Cost/task: $0.834 · Time/task: 13.9m · Quality: 26.2GLM-5.1 (Reasoning) · Cost/task: $0.922 · Time/task: 17.3m · Quality: 26.1GPT-5.5 Instant (June 2026) · Cost/task: $0.691 · Time/task: 35s · Quality: 26.0MiMo-V2.5-Pro · Cost/task: $0.0541 · Time/task: 9.75m · Quality: 26.0Kimi K2.7 Code · Cost/task: $0.541 · Time/task: 7.88m · Quality: 25.8Hy3 · Cost/task: $0.0743 · Time/task: 7.85m · Quality: 25.3Qwen3.7 Plus · Cost/task: $0.325 · Time/task: 7.92m · Quality: 25.2Inkling (xhigh) · Cost/task: $0.607 · Time/task: 5.33m · Quality: 25.0Grok 4.3 (high) · Cost/task: $0.165 · Time/task: 2.80m · Quality: 24.9Claude Sonnet 5 (Adaptive Reasoning, Low Effort) · Cost/task: $0.509 · Time/task: 2.54m · Quality: 24.3DeepSeek V4 Flash 0420 (Reasoning, Max Effort) · Cost/task: $0.118 · Time/task: - · Quality: 24.2GPT-5.4 mini (xhigh) · Cost/task: $0.410 · Time/task: 4.01m · Quality: 24.1Nemotron 3 Ultra 550B A55B (Reasoning) · Cost/task: $0.579 · Time/task: 2.35m · Quality: 22.9MiniMax-M2.7 · Cost/task: $0.102 · Time/task: 4.77m · Quality: 22.8Gemini 3.5 Flash-Lite · Cost/task: $0.124 · Time/task: 44s · Quality: 22.2Qwen3.6 27B (Reasoning) · Cost/task: $0.621 · Time/task: 7.66m · Quality: 21.4GPT-5.6 Terra (Non-reasoning) · Cost/task: $0.140 · Time/task: 37s · Quality: 20.8GPT-5.4 nano (xhigh) · Cost/task: $0.183 · Time/task: 6.60m · Quality: 20.7Claude 4.5 Sonnet (Reasoning) · Cost/task: $0.557 · Time/task: 5.53m · Quality: 20.7Qwen3.8 27B (Non-reasoning) · Cost/task: $1.91 · Time/task: 9.57m · Quality: 20.2LongCat 2.0 · Cost/task: $0.0590 · Time/task: - · Quality: 19.1Qwen3.5 397B A17B (Reasoning) · Cost/task: $0.475 · Time/task: 3.02m · Quality: 18.4Qwen3.6 35B A3B (Reasoning) · Cost/task: $0.475 · Time/task: 5.07m · Quality: 18.2Muse Glimmer (high) · Cost/task: $0.0551 · Time/task: 2.57m · Quality: 17.5Claude 4.5 Haiku (Reasoning) · Cost/task: $0.208 · Time/task: 2.57m · Quality: 16.9GPT-5 mini (high) · Cost/task: $0.0535 · Time/task: 2.60m · Quality: 16.8Ring-2.6-1T · Cost/task: $0.287 · Time/task: 5.23m · Quality: 16.6Gemini 2.5 Pro · Cost/task: $0.232 · Time/task: 1.25m · Quality: 16.1Qwen3.5 122B A10B (Reasoning) · Cost/task: $0.325 · Time/task: 2.14m · Quality: 15.6Gemini 3.1 Flash-Lite · Cost/task: $0.0394 · Time/task: 35s · Quality: 15.6GPT-5.6 Luna (Non-reasoning) · Cost/task: $0.0101 · Time/task: 13s · Quality: 15.5Mistral Medium 3.5 · Cost/task: $0.437 · Time/task: 2.94m · Quality: 14.2Grok 4.3 (Non-reasoning) · Cost/task: $0.137 · Time/task: 1.62m · Quality: 14.0Nemotron 3.5 Lightning · Cost/task: $0.0931 · Time/task: 1.95m · Quality: 12.9Nemotron 3 Super 120B A12B (Reasoning) · Cost/task: $1.06 · Time/task: 7.74m · Quality: 12.8Qwen3 235B A22B 2507 (Reasoning) · Cost/task: $0.0806 · Time/task: 6.00m · Quality: 12.7gpt-oss-120b (high) · Cost/task: $0.107 · Time/task: 2.11m · Quality: 11.6DeepSeek R1 (Jan '25) · Cost/task: $0.262 · Time/task: - · Quality: 11.4Mistral Small 4 (Reasoning) · Cost/task: $0.0451 · Time/task: 1.55m · Quality: 11.3Granite 4.2 8B · Cost/task: $0.0236 · Time/task: 5.64m · Quality: 11.1Trinity Large Thinking · Cost/task: $0.353 · Time/task: 2.42m · Quality: 10.8Qwen3 30B A3B 2507 (Reasoning) · Cost/task: $0.0766 · Time/task: 2.39m · Quality: 9.8DeepSeek V3 0324 · Cost/task: $0.105 · Time/task: - · Quality: 9.7Mistral Large 3 · Cost/task: $0.104 · Time/task: 1.20m · Quality: 9.3Qwen3 Coder Next · Cost/task: $0.552 · Time/task: 2.20m · Quality: 9.2Mistral Medium 3.1 · Cost/task: $0.392 · Time/task: 1.61m · Quality: 9.2gpt-oss-20b (high) · Cost/task: $0.0113 · Time/task: 1.60m · Quality: 9.0NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) · Cost/task: $0.0168 · Time/task: 3.05m · Quality: 8.9DeepSeek V3 (Dec '24) · Cost/task: $0.0198 · Time/task: - · Quality: 8.5Solar Pro 3 · Cost/task: $0.0794 · Time/task: 4.92m · Quality: 7.8Mistral Small 3.1 · Cost/task: $0.0328 · Time/task: 42s · Quality: 7.1Celeris-1 · Cost/task: $0.0502 · Time/task: 3.0s · Quality: 6.3Ministral 3 14B · Cost/task: $0.139 · Time/task: 1.05m · Quality: 6.0Ministral 3 8B · Cost/task: $0.0655 · Time/task: 1.49m · Quality: 5.5Ministral 3 3B · Cost/task: $0.0423 · Time/task: 53s · Quality: 4.8Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) · Cost/task: $7.63 · Time/task: 12.4m · Quality: 53.4 · Pareto frontierClaude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) · Cost/task: $5.98 · Time/task: 10.4m · Quality: 53.2 · Pareto frontierGPT-6 Astra (max) · Cost/task: $3.26 · Time/task: 6.76m · Quality: 52.7 · Pareto frontierGPT-6 Astra (xhigh) · Cost/task: $2.31 · Time/task: 5.06m · Quality: 52.4 · Pareto frontierGPT-6 Astra (high) · Cost/task: $1.73 · Time/task: 3.33m · Quality: 50.9 · Pareto frontierGPT-6 Astra (medium) · Cost/task: $1.54 · Time/task: 3.04m · Quality: 49.6 · Pareto frontierMiMo-V2.6-Pro · Cost/task: $0.133 · Time/task: 7.72m · Quality: 46.3 · Pareto frontierGPT-5.6 Luna (xhigh) · Cost/task: $0.0853 · Time/task: 2.36m · Quality: 34.6 · Pareto frontierGPT-5.6 Luna (high) · Cost/task: $0.0440 · Time/task: 1.60m · Quality: 32.1 · Pareto frontierGPT-5.6 Luna (medium) · Cost/task: $0.0156 · Time/task: 32s · Quality: 25.0 · Pareto frontierGPT-5.6 Luna (low) · Cost/task: $0.00983 · Time/task: 17s · Quality: 21.0 · Pareto frontierGranite 4.2 3B · Cost/task: $0.00598 · Time/task: 1.32m · Quality: 9.1 · Pareto frontier Granite 4.2 3BGPT-5.6 Luna (low)GPT-5.6 Luna (med…GPT-5.6 Luna (hig…GPT-5.6 Luna (xhi…MiMo-V2.6-ProGPT-6 Astra (medi…GPT-6 Astra (high)GPT-6 Astra (xhig…GPT-6 Astra (max)Claude Fable 5.1 …Claude Fable 5.1 …
#?Pareto?Model?Released?Cost/task?Time/task?$/Q?Qual?ΔTop?Intel?Agent?Pen?Score?
1 ✓ Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
Anthropic
2026-09-01 $7.63 12.4m 0.1430 53.4 0.0 53.4 - 28.8 53.4
2 ✓ Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)
Anthropic
2026-09-01 $5.98 10.4m 0.1124 53.2 -0.2 53.2 - 27.8 53.2
3 ✓ GPT-6 Astra (max)
OpenAI
2026-09-03 $3.26 6.76m 0.0618 52.7 -0.7 52.7 - 25.1 52.7
4 ✓ GPT-6 Astra (xhigh)
OpenAI
2026-09-03 $2.31 5.06m 0.0441 52.4 -1.0 52.4 - 23.6 52.4
5 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)
Anthropic
2026-09-01 $3.91 7.23m 0.0765 51.2 -2.2 51.2 - 25.9 51.2
6 ✓ GPT-6 Astra (high)
OpenAI
2026-09-03 $1.73 3.33m 0.0339 50.9 -2.4 50.9 - 22.4 50.9
7 Claude Opus 5 (Adaptive Reasoning, Max Effort)
Anthropic
2026-07-24 $5.86 13.6m 0.1154 50.8 -2.6 50.8 - 27.7 50.8
8 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
Anthropic
2026-07-24 $4.88 11.5m 0.0982 49.7 -3.7 49.7 - 26.9 49.7
9 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
Anthropic
2026-06-09 $8.75 10.3m 0.1762 49.6 -3.7 49.6 - 29.4 49.6
10 ✓ GPT-6 Astra (medium)
OpenAI
2026-09-03 $1.54 3.04m 0.0311 49.6 -3.8 49.6 - 21.9 49.6
11 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)
Anthropic
2026-09-01 $2.98 5.39m 0.0610 48.9 -4.4 48.9 - 24.7 48.9
12 Claude Opus 5 (Adaptive Reasoning, High Effort)
Anthropic
2026-07-24 $3.61 8.47m 0.0751 48.1 -5.2 48.1 - 25.6 48.1
13 Muse Spark 1.3 (max)
Meta
2026-09-02 $1.60 4.54m 0.0334 48.1 -5.3 48.1 - 22.1 48.1
14 GPT-5.6 Sol (max)
OpenAI
2026-07-09 $1.99 6.10m 0.0423 47.0 -6.4 47.0 - 23.0 47.0
15 Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)
Anthropic
2026-09-01 $2.37 4.21m 0.0506 46.8 -6.5 46.8 - 23.7 46.8
16 Grok 4.7 (xhigh)
SpaceXAI
2026-09-21 $3.74 19.9m 0.0805 46.4 -6.9 46.4 - 25.7 46.4
17 Grok 4.7 (high)
SpaceXAI
2026-09-21 $2.73 18.1m 0.0588 46.3 -7.0 46.3 - 24.4 46.3
18 ✓ MiMo-V2.6-Pro
Xiaomi
2026-09-21 $0.133 7.72m 0.0029 46.3 -7.0 46.3 - 11.2 46.3
19 GPT-6 Astra (low)
OpenAI
2026-09-03 $0.818 1.36m 0.0179 45.8 -7.6 45.8 - 19.1 45.8
20 Qwen3.8 Max (0902)
Alibaba
2026-09-02 $5.41 33.3m 0.1191 45.4 -7.9 45.4 - 27.3 45.4
21 Muse Spark 1.3 (xhigh)
Meta
2026-09-02 $1.37 3.67m 0.0303 45.1 -8.3 45.1 - 21.4 45.1
22 Claude Opus 5 (Adaptive Reasoning, Medium Effort)
Anthropic
2026-07-24 $2.19 5.24m 0.0488 44.8 -8.5 44.8 - 23.4 44.8
23 GLM-5.3 (max)
Z AI
2026-08-18 $2.01 16.5m 0.0448 44.8 -8.6 44.8 - 23.0 44.8
24 Grok 4.6 (high)
SpaceXAI
2026-08-12 $1.86 10.0m 0.0420 44.3 -9.0 44.3 - 22.7 44.3
25 Grok 4.6 (xhigh)
SpaceXAI
2026-08-12 $2.32 11.1m 0.0526 44.2 -9.2 44.2 - 23.7 44.2
26 GPT-5.6 Sol (xhigh)
OpenAI
2026-07-09 $1.18 4.80m 0.0269 44.0 -9.3 44.0 - 20.7 44.0
27 Step 5 Preview
StepFun
2026-09-18 $0.716 10.8m 0.0164 43.7 -9.6 43.7 - 18.5 43.7
28 Kimi K3 (max)
Kimi
2026-07-16 $2.00 17.1m 0.0459 43.6 -9.8 43.6 - 23.0 43.6
29 Grok 4.6 (medium)
SpaceXAI
2026-08-12 $1.50 8.58m 0.0349 42.8 -10.5 42.8 - 21.8 42.8
30 GPT-5.6 Sol (high)
OpenAI
2026-07-09 $0.808 3.15m 0.0191 42.3 -11.0 42.3 - 19.1 42.3
31 GPT-5.6 Terra (max)
OpenAI
2026-07-09 $1.40 5.93m 0.0332 42.1 -11.3 42.1 - 21.5 42.1
32 GLM 5.3 Flash
Z AI
2026-08-26 $0.253 10.9m 0.0061 41.8 -11.5 41.8 - 14.0 41.8
33 Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
Anthropic
2026-05-28 $4.08 13.1m 0.0977 41.8 -11.6 41.8 - 26.1 41.8
34 Gemini 3.8 Flash (high)
Google
2026-09-02 $1.24 3.39m 0.0304 40.9 -12.4 40.9 - 20.9 40.9
35 Qwen3.8 Max
Alibaba
2026-08-03 $2.67 20.2m 0.0665 40.2 -13.2 40.2 - 24.3 40.2
36 Qwen3.8 2.4T A95B
Alibaba
2026-08-12 $2.16 21.3m 0.0541 39.9 -13.5 39.9 - 23.3 39.9
37 Qwen3.8-Flash-Next
Alibaba
2026-08-26 $0.372 25.7m 0.0093 39.8 -13.5 39.8 - 15.7 39.8
38 Gemini 3.8 Flash (medium)
Google
2026-09-02 $0.931 - 0.0234 39.8 -13.6 39.8 - 19.7 39.8
39 Muse Spark 1.2 (xhigh)
Meta
2026-08-05 $0.975 4.34m 0.0246 39.6 -13.8 39.6 - 19.9 39.6
40 DeepSeek V4.1 Flash (Reasoning, Max Effort)
DeepSeek
2026-09-10 $0.265 4.89m 0.0067 39.5 -13.9 39.5 - 14.2 39.5
41 Claude Opus 5 (Adaptive Reasoning, Low Effort)
Anthropic
2026-07-24 $1.10 2.49m 0.0279 39.4 -14.0 39.4 - 20.4 39.4
42 GPT-5.6 Sol (medium)
OpenAI
2026-07-09 $0.505 2.17m 0.0129 39.2 -14.1 39.2 - 17.0 39.2
43 Gemini 3.7 Flash (high)
Google
2026-08-13 $0.925 2.78m 0.0237 39.1 -14.3 39.1 - 19.7 39.1
44 Grok 4.5 (high)
SpaceXAI
2026-07-08 $1.04 7.65m 0.0267 38.8 -14.5 38.8 - 20.2 38.8
45 GPT-5.5 (xhigh)
OpenAI
2026-04-23 $2.63 3.77m 0.0687 38.4 -15.0 38.4 - 24.2 38.4
46 Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
Anthropic
2026-06-30 $5.09 15.7m 0.1334 38.2 -15.2 38.2 - 27.1 38.2
47 GPT-5.6 Terra (xhigh)
OpenAI
2026-07-09 $0.632 3.52m 0.0166 38.0 -15.4 38.0 - 18.0 38.0
48 GPT-5.6 Luna (max)
OpenAI
2026-07-09 $0.178 4.23m 0.0048 37.3 -16.0 37.3 - 12.5 37.3
49 GPT-5.5 (high)
OpenAI
2026-04-23 $1.54 2.69m 0.0417 37.0 -16.4 37.0 - 21.9 37.0
50 DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
DeepSeek
2026-08-13 $0.674 7.79m 0.0187 36.0 -17.4 36.0 - 18.3 36.0
51 Grok 4.6 (low)
SpaceXAI
2026-08-12 $0.475 3.16m 0.0135 35.1 -18.2 35.1 - 16.8 35.1
52 DeepSeek V4 Flash Vision (Reasoning, Max Effort)
DeepSeek
2026-08-21 $0.314 3.69m 0.0090 34.8 -18.5 34.8 - 15.0 34.8
53 ✓ GPT-5.6 Luna (xhigh)
OpenAI
2026-07-09 $0.0853 2.36m 0.0025 34.6 -18.8 34.6 - 9.3 34.6
54 Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)
Anthropic
2026-06-30 $2.87 9.35m 0.0835 34.4 -19.0 34.4 - 24.6 34.4
55 DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
DeepSeek
2026-07-31 $0.220 3.42m 0.0064 34.3 -19.0 34.3 - 13.4 34.3
56 GPT-5.6 Terra (high)
OpenAI
2026-07-09 $0.338 2.09m 0.0099 34.2 -19.1 34.2 - 15.3 34.2
57 Gemini 3.6 Flash (high)
Google
2026-07-21 $0.929 3.04m 0.0273 34.0 -19.4 34.0 - 19.7 34.0
58 GPT-5.5 (medium)
OpenAI
2026-04-23 $0.902 1.48m 0.0267 33.8 -19.6 33.8 - 19.6 33.8
59 Muse Spark 1.1 (xhigh)
Meta
2026-07-09 $1.38 - 0.0409 33.7 -19.6 33.7 - 21.4 33.7
60 GLM-5.2 (max)
Z AI
2026-06-16 $0.965 12.2m 0.0286 33.7 -19.6 33.7 - 19.8 33.7
61 Qwen3.8 27B (xhigh)
Alibaba
2026-08-14 $0.820 17.5m 0.0243 33.7 -19.7 33.7 - 19.1 33.7
62 GPT-5.6 Sol (low)
OpenAI
2026-07-09 $0.261 1.01m 0.0078 33.5 -19.9 33.5 - 14.2 33.5
63 Gemini 3.5 Flash (high)
Google
2026-05-19 $1.56 3.95m 0.0479 32.6 -20.8 32.6 - 21.9 32.6
64 ✓ GPT-5.6 Luna (high)
OpenAI
2026-07-09 $0.0440 1.60m 0.0014 32.1 -21.2 32.1 - 6.4 32.1
65 Claude Sonnet 5 (Adaptive Reasoning, High Effort)
Anthropic
2026-06-30 $1.79 6.93m 0.0566 31.7 -21.7 31.7 - 22.5 31.7
66 DeepSeek V4 Pro 0424 (Reasoning, Max Effort)
DeepSeek
2026-04-24 $0.122 6.56m 0.0040 30.4 -22.9 30.4 - 10.8 30.4
67 GPT-5.6 Terra (medium)
OpenAI
2026-07-09 $0.183 60s 0.0061 30.1 -23.3 30.1 - 12.6 30.1
68 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)
Anthropic
2026-02-17 $2.49 20.6m 0.0827 30.1 -23.3 30.1 - 24.0 30.1
69 Gemini 3.1 Pro Preview
Google
2026-02-19 $0.675 2.46m 0.0227 29.7 -23.6 29.7 - 18.3 29.7
70 Qwen3.7 Max
Alibaba
2026-05-19 $1.15 2.32m 0.0389 29.5 -23.9 29.5 - 20.6 29.5
71 MiniMax-M3
MiniMax
2026-06-01 $0.508 4.78m 0.0174 29.2 -24.1 29.2 - 17.1 29.2
72 Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)
Anthropic
2026-06-30 $0.999 4.43m 0.0356 28.1 -25.3 28.1 - 20.0 28.1
73 Qwen3.8 27B (medium)
Alibaba
2026-08-14 $0.903 15.9m 0.0328 27.6 -25.8 27.6 - 19.6 27.6
74 GPT-5.6 Terra (low)
OpenAI
2026-07-09 $0.144 43s 0.0053 27.5 -25.9 27.5 - 11.6 27.5
75 Kimi K2.6
Kimi
2026-04-20 $0.800 22.0m 0.0296 27.0 -26.4 27.0 - 19.0 27.0
76 Quasar 438B (max, based on GLM-5.2)
Multiverse Computing
2026-08-10 $2.02 7.65m 0.0757 26.7 -26.6 26.7 - 23.1 26.7
77 Qwen3.8 27B (low)
Alibaba
2026-08-14 $0.834 13.9m 0.0318 26.2 -27.2 26.2 - 19.2 26.2
78 GLM-5.1 (Reasoning)
Z AI
2026-04-07 $0.922 17.3m 0.0354 26.1 -27.3 26.1 - 19.6 26.1
79 GPT-5.5 Instant (June 2026)
OpenAI
2026-06-25 $0.691 35s 0.0266 26.0 -27.3 26.0 - 18.4 26.0
80 MiMo-V2.5-Pro
Xiaomi
2026-04-22 $0.0541 9.75m 0.0021 26.0 -27.4 26.0 - 7.3 26.0
81 Kimi K2.7 Code
Kimi
2026-06-12 $0.541 7.88m 0.0210 25.8 -27.5 25.8 - 17.3 25.8
82 Hy3
Tencent
2026-07-06 $0.0743 7.85m 0.0029 25.3 -28.1 25.3 - 8.7 25.3
83 Qwen3.7 Plus
Alibaba
2026-06-01 $0.325 7.92m 0.0129 25.2 -28.2 25.2 - 15.1 25.2
84 ✓ GPT-5.6 Luna (medium)
OpenAI
2026-07-09 $0.0156 32s 0.0006 25.0 -28.3 25.0 - 1.9 25.0
85 Inkling (xhigh)
Thinking Machines
2026-07-15 $0.607 5.33m 0.0243 25.0 -28.4 25.0 - 17.8 25.0
86 Grok 4.3 (high)
SpaceXAI
2026-04-30 $0.165 2.80m 0.0066 24.9 -28.5 24.9 - 12.2 24.9
87 Claude Sonnet 5 (Adaptive Reasoning, Low Effort)
Anthropic
2026-06-30 $0.509 2.54m 0.0210 24.3 -29.1 24.3 - 17.1 24.3
88 DeepSeek V4 Flash 0420 (Reasoning, Max Effort)
DeepSeek
2026-04-24 $0.118 - 0.0049 24.2 -29.2 24.2 - 10.7 24.2
89 GPT-5.4 mini (xhigh)
OpenAI
2026-03-17 $0.410 4.01m 0.0170 24.1 -29.3 24.1 - 16.1 24.1
90 Nemotron 3 Ultra 550B A55B (Reasoning)
NVIDIA
2026-06-04 $0.579 2.35m 0.0253 22.9 -30.4 22.9 - 17.6 22.9
91 MiniMax-M2.7
MiniMax
2026-03-18 $0.102 4.77m 0.0045 22.8 -30.6 22.8 - 10.1 22.8
92 Gemini 3.5 Flash-Lite
Google
2026-07-21 $0.124 44s 0.0056 22.2 -31.2 22.2 - 10.9 22.2
93 Qwen3.6 27B (Reasoning)
Alibaba
2026-04-22 $0.621 7.66m 0.0290 21.4 -31.9 21.4 - 17.9 21.4
94 ✓ GPT-5.6 Luna (low)
OpenAI
2026-07-09 $0.00983 17s 0.0005 21.0 -32.3 21.0 - 0.0 21.0
95 GPT-5.6 Terra (Non-reasoning)
OpenAI
2026-07-09 $0.140 37s 0.0067 20.8 -32.6 20.8 - 11.5 20.8
96 GPT-5.4 nano (xhigh)
OpenAI
2026-03-17 $0.183 6.60m 0.0088 20.7 -32.6 20.7 - 12.6 20.7
97 Claude 4.5 Sonnet (Reasoning)
Anthropic
2025-09-29 $0.557 5.53m 0.0269 20.7 -32.7 20.7 - 17.5 20.7
98 Qwen3.8 27B (Non-reasoning)
Alibaba
2026-08-14 $1.91 9.57m 0.0946 20.2 -33.2 20.2 - 22.8 20.2
99 LongCat 2.0
LongCat
2026-06-29 $0.0590 - 0.0031 19.1 -34.2 19.1 - 7.7 19.1
100 Qwen3.5 397B A17B (Reasoning)
Alibaba
2026-02-16 $0.475 3.02m 0.0258 18.4 -34.9 18.4 - 16.8 18.4