Run #2332

success · fetched 2026-09-17 09:00:23 · 1.34 MB raw HTML · 138 models

Open this run in comparison view · JSON results

Top quality: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (53.4 pts)

Cost/task vs quality?

138 models · 15 on the Pareto frontier · intelligence quality vs Cost per Task

216294356$0.01$0.10$1$10 cost per task, log scale intelligence quality Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) · Cost/task: $3.91 · Time/task: 6.83m · Quality: 51.2Claude Opus 5 (Adaptive Reasoning, Max Effort) · Cost/task: $5.86 · Time/task: 13.9m · Quality: 50.7Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) · Cost/task: $8.75 · Time/task: 10.2m · Quality: 49.7Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) · Cost/task: $4.88 · Time/task: 11.6m · Quality: 49.7Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) · Cost/task: $2.98 · Time/task: 5.28m · Quality: 49.1Claude Opus 5 (Adaptive Reasoning, High Effort) · Cost/task: $3.61 · Time/task: 8.89m · Quality: 48.2Muse Spark 1.3 (max) · Cost/task: $1.60 · Time/task: 3.94m · Quality: 48.2GPT-5.6 Sol (max) · Cost/task: $1.99 · Time/task: 6.56m · Quality: 47.1Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) · Cost/task: $2.37 · Time/task: 4.09m · Quality: 47.0Qwen3.8 Max (0902) · Cost/task: $5.41 · Time/task: 34.9m · Quality: 45.4Muse Spark 1.3 (xhigh) · Cost/task: $1.37 · Time/task: 3.88m · Quality: 45.2Claude Opus 5 (Adaptive Reasoning, Medium Effort) · Cost/task: $2.19 · Time/task: 5.59m · Quality: 45.1GLM-5.3 (max) · Cost/task: $2.01 · Time/task: 13.7m · Quality: 44.9Grok 4.6 (high) · Cost/task: $1.86 · Time/task: 9.14m · Quality: 44.4Grok 4.6 (xhigh) · Cost/task: $2.32 · Time/task: 10.7m · Quality: 44.3GPT-5.6 Sol (xhigh) · Cost/task: $1.18 · Time/task: 4.72m · Quality: 44.1Kimi K3 (max) · Cost/task: $2.00 · Time/task: 21.4m · Quality: 43.8Grok 4.6 (medium) · Cost/task: $1.50 · Time/task: 7.79m · Quality: 43.0GPT-5.6 Terra (max) · Cost/task: $1.40 · Time/task: 7.23m · Quality: 42.3Claude Opus 4.8 (Adaptive Reasoning, Max Effort) · Cost/task: $4.08 · Time/task: 12.6m · Quality: 42.0Gemini 3.8 Flash (high) · Cost/task: $1.24 · Time/task: 3.25m · Quality: 41.2Qwen3.8 Max · Cost/task: $2.67 · Time/task: 20.1m · Quality: 40.3Qwen3.8 2.4T A95B · Cost/task: $2.16 · Time/task: 22.5m · Quality: 40.0Gemini 3.8 Flash (medium) · Cost/task: $0.931 · Time/task: - · Quality: 40.0Qwen3.8-Flash-Next · Cost/task: $0.372 · Time/task: 25.7m · Quality: 39.9Muse Spark 1.2 (xhigh) · Cost/task: $0.975 · Time/task: 4.03m · Quality: 39.8Claude Opus 5 (Adaptive Reasoning, Low Effort) · Cost/task: $1.10 · Time/task: 3.00m · Quality: 39.8DeepSeek V4.1 Flash (Reasoning, Max Effort) · Cost/task: $0.265 · Time/task: 4.90m · Quality: 39.5GPT-5.6 Sol (medium) · Cost/task: $0.505 · Time/task: 2.03m · Quality: 39.5Gemini 3.7 Flash (high) · Cost/task: $0.925 · Time/task: 2.84m · Quality: 39.4Grok 4.5 (high) · Cost/task: $1.04 · Time/task: 7.40m · Quality: 39.1GPT-5.5 (xhigh) · Cost/task: $2.63 · Time/task: 4.37m · Quality: 38.6Claude Sonnet 5 (Adaptive Reasoning, Max Effort) · Cost/task: $5.09 · Time/task: 16.4m · Quality: 38.4GPT-5.6 Terra (xhigh) · Cost/task: $0.632 · Time/task: 3.85m · Quality: 38.2GPT-5.5 (high) · Cost/task: $1.54 · Time/task: 2.73m · Quality: 37.3DeepSeek V4 Pro 0813 (Reasoning, Max Effort) · Cost/task: $0.674 · Time/task: 8.09m · Quality: 36.3Grok 4.6 (low) · Cost/task: $0.475 · Time/task: 3.08m · Quality: 35.4DeepSeek V4 Flash 0731 Vision (Reasoning, Max Effort) · Cost/task: $0.314 · Time/task: 3.86m · Quality: 35.0Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) · Cost/task: $2.87 · Time/task: 9.90m · Quality: 34.7DeepSeek V4 Flash 0731 (Reasoning, Max Effort) · Cost/task: $0.220 · Time/task: 3.54m · Quality: 34.5GPT-5.6 Terra (high) · Cost/task: $0.338 · Time/task: 2.19m · Quality: 34.5Gemini 3.6 Flash (high) · Cost/task: $0.929 · Time/task: 3.64m · Quality: 34.3Muse Spark 1.1 (xhigh) · Cost/task: $1.38 · Time/task: - · Quality: 34.3GPT-5.5 (medium) · Cost/task: $0.902 · Time/task: 1.69m · Quality: 34.2GLM-5.2 (max) · Cost/task: $0.965 · Time/task: 14.3m · Quality: 34.0Qwen3.8 27B (xhigh) · Cost/task: $0.820 · Time/task: 17.8m · Quality: 33.9GPT-5.6 Sol (low) · Cost/task: $0.261 · Time/task: 1.02m · Quality: 33.8Gemini 3.5 Flash (high) · Cost/task: $1.56 · Time/task: 3.64m · Quality: 33.0Claude Sonnet 5 (Adaptive Reasoning, High Effort) · Cost/task: $1.79 · Time/task: 6.54m · Quality: 32.0DeepSeek V4 Pro 0424 (Reasoning, Max Effort) · Cost/task: $0.122 · Time/task: 7.20m · Quality: 30.9Kimi K3 (low) · Cost/task: $1.15 · Time/task: 5.45m · Quality: 30.5Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) · Cost/task: $2.49 · Time/task: 20.3m · Quality: 30.5GPT-5.6 Terra (medium) · Cost/task: $0.183 · Time/task: 1.07m · Quality: 30.4Gemini 3.1 Pro Preview · Cost/task: $0.675 · Time/task: 2.42m · Quality: 30.4Qwen3.7 Max · Cost/task: $1.15 · Time/task: 2.47m · Quality: 29.9MiniMax-M3 · Cost/task: $0.508 · Time/task: 6.02m · Quality: 29.6Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) · Cost/task: $0.999 · Time/task: 4.15m · Quality: 28.4GPT-5.6 Terra (low) · Cost/task: $0.144 · Time/task: 44s · Quality: 27.9Qwen3.8 27B (medium) · Cost/task: $0.903 · Time/task: 16.2m · Quality: 27.8Kimi K2.6 · Cost/task: $0.800 · Time/task: 18.2m · Quality: 27.5Quasar 438B (max, based on GLM-5.2) · Cost/task: $2.02 · Time/task: 6.88m · Quality: 27.1GPT-5.5 Instant (June 2026) · Cost/task: $0.691 · Time/task: 35s · Quality: 26.8Qwen3.8 27B (low) · Cost/task: $0.834 · Time/task: 14.5m · Quality: 26.5GLM-5.1 (Reasoning) · Cost/task: $0.922 · Time/task: 14.2m · Quality: 26.4MiMo-V2.5-Pro · Cost/task: $0.0541 · Time/task: 8.74m · Quality: 26.4Kimi K2.7 Code · Cost/task: $0.541 · Time/task: 8.30m · Quality: 26.3Inkling Small · Cost/task: $0.0895 · Time/task: 2.59m · Quality: 26.1Qwen3.7 Plus · Cost/task: $0.325 · Time/task: 7.66m · Quality: 25.8Hy3 · Cost/task: $0.0743 · Time/task: 8.53m · Quality: 25.8Inkling (xhigh) · Cost/task: $0.607 · Time/task: 7.08m · Quality: 25.5Grok 4.3 (high) · Cost/task: $0.165 · Time/task: 2.40m · Quality: 25.4DeepSeek V4 Flash 0420 (Reasoning, High Effort) · Cost/task: $0.193 · Time/task: - · Quality: 24.8Claude Sonnet 5 (Adaptive Reasoning, Low Effort) · Cost/task: $0.509 · Time/task: 2.43m · Quality: 24.7DeepSeek V4 Flash 0420 (Reasoning, Max Effort) · Cost/task: $0.118 · Time/task: - · Quality: 24.6GPT-5.4 mini (xhigh) · Cost/task: $0.410 · Time/task: 4.49m · Quality: 24.6Nemotron 3 Ultra 550B A55B (Reasoning) · Cost/task: $0.579 · Time/task: 2.49m · Quality: 23.4MiniMax-M2.7 · Cost/task: $0.102 · Time/task: 5.22m · Quality: 23.2Gemini 3.5 Flash-Lite · Cost/task: $0.124 · Time/task: 45s · Quality: 22.7MiMo-V2.5 · Cost/task: $0.0191 · Time/task: 9.21m · Quality: 22.3Qwen3.6 27B (Reasoning) · Cost/task: $0.621 · Time/task: 8.19m · Quality: 21.9GPT-5.4 nano (xhigh) · Cost/task: $0.183 · Time/task: 6.98m · Quality: 21.2GPT-5.6 Terra (Non-reasoning) · Cost/task: $0.140 · Time/task: 35s · Quality: 21.2Claude 4.5 Sonnet (Reasoning) · Cost/task: $0.557 · Time/task: 5.49m · Quality: 21.2Ling 3.0 Flash · Cost/task: $0.0337 · Time/task: 2.14m · Quality: 20.6LongCat 2.0 · Cost/task: $0.0590 · Time/task: - · Quality: 19.7Qwen3.5 397B A17B (Reasoning) · Cost/task: $0.475 · Time/task: 3.47m · Quality: 19.1Qwen3.6 35B A3B (Reasoning) · Cost/task: $0.475 · Time/task: 4.37m · Quality: 18.8Muse Glimmer (high) · Cost/task: $0.0551 · Time/task: 2.37m · Quality: 18.1Claude 4.5 Haiku (Reasoning) · Cost/task: $0.208 · Time/task: 2.68m · Quality: 17.6GPT-5 mini (high) · Cost/task: $0.0535 · Time/task: 3.94m · Quality: 17.4Ring-2.6-1T · Cost/task: $0.287 · Time/task: 5.36m · Quality: 17.3Gemini 2.5 Pro · Cost/task: $0.232 · Time/task: 1.33m · Quality: 16.7Qwen3.5 122B A10B (Reasoning) · Cost/task: $0.325 · Time/task: 2.09m · Quality: 16.2GPT-5.6 Luna (Non-reasoning) · Cost/task: $0.0101 · Time/task: 20s · Quality: 16.1Gemini 3.1 Flash-Lite · Cost/task: $0.0394 · Time/task: 37s · Quality: 16.0Mistral Medium 3.5 · Cost/task: $0.437 · Time/task: 2.79m · Quality: 14.9Grok 4.3 (Non-reasoning) · Cost/task: $0.137 · Time/task: 1.49m · Quality: 14.5Nemotron 3.5 Lightning · Cost/task: $0.0931 · Time/task: 1.97m · Quality: 13.6Nemotron 3 Super 120B A12B (Reasoning) · Cost/task: $1.06 · Time/task: 13.0m · Quality: 13.6Qwen3 235B A22B 2507 (Reasoning) · Cost/task: $0.0806 · Time/task: 6.74m · Quality: 12.7gpt-oss-120b (high) · Cost/task: $0.107 · Time/task: 2.44m · Quality: 12.3Granite 4.2 8B · Cost/task: $0.0236 · Time/task: 6.23m · Quality: 11.8Mercury 2 · Cost/task: $0.0733 · Time/task: 41s · Quality: 11.5Mistral Small 4 (Reasoning) · Cost/task: $0.0451 · Time/task: 1.67m · Quality: 11.5DeepSeek R1 (Jan '25) · Cost/task: $0.262 · Time/task: - · Quality: 11.4Trinity Large Thinking · Cost/task: $0.353 · Time/task: 2.34m · Quality: 10.9Qwen3 Coder Next · Cost/task: $0.552 · Time/task: 2.31m · Quality: 10.1Qwen3 30B A3B 2507 (Reasoning) · Cost/task: $0.0766 · Time/task: 2.29m · Quality: 9.8DeepSeek V3 0324 · Cost/task: $0.105 · Time/task: - · Quality: 9.7Mistral Large 3 · Cost/task: $0.104 · Time/task: 1.16m · Quality: 9.7Mistral Medium 3.1 · Cost/task: $0.392 · Time/task: 1.56m · Quality: 9.5Llama 4 Maverick · Cost/task: $0.0397 · Time/task: 19s · Quality: 9.3gpt-oss-20b (high) · Cost/task: $0.0113 · Time/task: 1.43m · Quality: 9.0NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) · Cost/task: $0.0168 · Time/task: 3.74m · Quality: 8.9DeepSeek V3 (Dec '24) · Cost/task: $0.0198 · Time/task: - · Quality: 8.5Solar Pro 3 · Cost/task: $0.0794 · Time/task: 4.88m · Quality: 7.8Mistral Small 3.1 · Cost/task: $0.0328 · Time/task: 38s · Quality: 7.4Mistral Small 3.2 · Cost/task: $0.146 · Time/task: 46s · Quality: 7.0Llama 4 Scout · Cost/task: $0.118 · Time/task: 20s · Quality: 6.5Celeris-1 · Cost/task: $0.0502 · Time/task: 3.3s · Quality: 6.3Ministral 3 14B · Cost/task: $0.139 · Time/task: 1.08m · Quality: 6.0Ministral 3 8B · Cost/task: $0.0655 · Time/task: 1.42m · Quality: 5.5Ministral 3 3B · Cost/task: $0.0423 · Time/task: 55s · Quality: 4.8Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) · Cost/task: $7.63 · Time/task: 12.4m · Quality: 53.4 · Pareto frontierClaude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) · Cost/task: $5.98 · Time/task: 11.4m · Quality: 53.2 · Pareto frontierGPT-6 Astra (max) · Cost/task: $3.26 · Time/task: 8.47m · Quality: 52.8 · Pareto frontierGPT-6 Astra (xhigh) · Cost/task: $2.31 · Time/task: 5.27m · Quality: 52.5 · Pareto frontierGPT-6 Astra (high) · Cost/task: $1.72 · Time/task: 3.75m · Quality: 51.0 · Pareto frontierGPT-6 Astra (medium) · Cost/task: $1.54 · Time/task: 3.02m · Quality: 49.7 · Pareto frontierGPT-6 Astra (low) · Cost/task: $0.818 · Time/task: 1.45m · Quality: 46.0 · Pareto frontierGPT-5.6 Sol (high) · Cost/task: $0.808 · Time/task: 3.60m · Quality: 42.5 · Pareto frontierGLM 5.3 Flash · Cost/task: $0.253 · Time/task: 8.19m · Quality: 41.9 · Pareto frontierGPT-5.6 Luna (max) · Cost/task: $0.178 · Time/task: 5.67m · Quality: 37.5 · Pareto frontierGPT-5.6 Luna (xhigh) · Cost/task: $0.0853 · Time/task: 3.30m · Quality: 34.8 · Pareto frontierGPT-5.6 Luna (high) · Cost/task: $0.0440 · Time/task: 2.12m · Quality: 32.4 · Pareto frontierGPT-5.6 Luna (medium) · Cost/task: $0.0156 · Time/task: 40s · Quality: 25.5 · Pareto frontierGPT-5.6 Luna (low) · Cost/task: $0.00983 · Time/task: 24s · Quality: 21.5 · Pareto frontierGranite 4.2 3B · Cost/task: $0.00596 · Time/task: 1.39m · Quality: 9.1 · Pareto frontier Granite 4.2 3BGPT-5.6 Luna (low)GPT-5.6 Luna (med…GPT-5.6 Luna (hig…GPT-5.6 Luna (xhi…GPT-5.6 Luna (max)GLM-5.3-FlashGPT-5.6 Sol (high)GPT-6 Astra (low)GPT-6 Astra (medi…GPT-6 Astra (high)GPT-6 Astra (xhig…GPT-6 Astra (max)Claude Fable 5.1 …Claude Fable 5.1 …
#?Pareto?Model?Released?Cost/task?Time/task?$/Q?Qual?ΔTop?Intel?Agent?Pen?Score?
1 ✓ Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
Anthropic
2026-09-01 $7.63 12.4m 0.1429 53.4 0.0 53.4 - 28.8 53.4
2 ✓ Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)
Anthropic
2026-09-01 $5.98 11.4m 0.1124 53.2 -0.2 53.2 - 27.8 53.2
3 ✓ GPT-6 Astra (max)
OpenAI
2026-09-03 $3.26 8.47m 0.0617 52.8 -0.6 52.8 - 25.1 52.8
4 ✓ GPT-6 Astra (xhigh)
OpenAI
2026-09-03 $2.31 5.27m 0.0440 52.5 -0.9 52.5 - 23.6 52.5
5 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)
Anthropic
2026-09-01 $3.91 6.83m 0.0764 51.2 -2.2 51.2 - 25.9 51.2
6 ✓ GPT-6 Astra (high)
OpenAI
2026-09-03 $1.72 3.75m 0.0337 51.0 -2.3 51.0 - 22.4 51.0
7 Claude Opus 5 (Adaptive Reasoning, Max Effort)
Anthropic
2026-07-24 $5.86 13.9m 0.1155 50.7 -2.7 50.7 - 27.7 50.7
8 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
Anthropic
2026-06-09 $8.75 10.2m 0.1760 49.7 -3.7 49.7 - 29.4 49.7
9 ✓ GPT-6 Astra (medium)
OpenAI
2026-09-03 $1.54 3.02m 0.0310 49.7 -3.7 49.7 - 21.9 49.7
10 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
Anthropic
2026-07-24 $4.88 11.6m 0.0982 49.7 -3.7 49.7 - 26.9 49.7
11 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)
Anthropic
2026-09-01 $2.98 5.28m 0.0608 49.1 -4.3 49.1 - 24.7 49.1
12 Claude Opus 5 (Adaptive Reasoning, High Effort)
Anthropic
2026-07-24 $3.61 8.89m 0.0749 48.2 -5.1 48.2 - 25.6 48.2
13 Muse Spark 1.3 (max)
Meta
2026-09-02 $1.60 3.94m 0.0333 48.2 -5.2 48.2 - 22.1 48.2
14 GPT-5.6 Sol (max)
OpenAI
2026-07-09 $1.99 6.56m 0.0423 47.1 -6.3 47.1 - 23.0 47.1
15 Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)
Anthropic
2026-09-01 $2.37 4.09m 0.0504 47.0 -6.3 47.0 - 23.7 47.0
16 ✓ GPT-6 Astra (low)
OpenAI
2026-09-03 $0.818 1.45m 0.0178 46.0 -7.4 46.0 - 19.1 46.0
17 Qwen3.8 Max (0902)
Alibaba
2026-09-02 $5.41 34.9m 0.1190 45.4 -7.9 45.4 - 27.3 45.4
18 Muse Spark 1.3 (xhigh)
Meta
2026-09-02 $1.37 3.88m 0.0303 45.2 -8.2 45.2 - 21.4 45.2
19 Claude Opus 5 (Adaptive Reasoning, Medium Effort)
Anthropic
2026-07-24 $2.19 5.59m 0.0486 45.1 -8.3 45.1 - 23.4 45.1
20 GLM-5.3 (max)
Z AI
2026-08-18 $2.01 13.7m 0.0447 44.9 -8.5 44.9 - 23.0 44.9
21 Grok 4.6 (high)
SpaceXAI
2026-08-12 $1.86 9.14m 0.0419 44.4 -9.0 44.4 - 22.7 44.4
22 Grok 4.6 (xhigh)
SpaceXAI
2026-08-12 $2.32 10.7m 0.0525 44.3 -9.1 44.3 - 23.7 44.3
23 GPT-5.6 Sol (xhigh)
OpenAI
2026-07-09 $1.18 4.72m 0.0268 44.1 -9.2 44.1 - 20.7 44.1
24 Kimi K3 (max)
Kimi
2026-07-16 $2.00 21.4m 0.0457 43.8 -9.6 43.8 - 23.0 43.8
25 Grok 4.6 (medium)
SpaceXAI
2026-08-12 $1.50 7.79m 0.0348 43.0 -10.4 43.0 - 21.8 43.0
26 ✓ GPT-5.6 Sol (high)
OpenAI
2026-07-09 $0.808 3.60m 0.0190 42.5 -10.9 42.5 - 19.1 42.5
27 GPT-5.6 Terra (max)
OpenAI
2026-07-09 $1.40 7.23m 0.0331 42.3 -11.1 42.3 - 21.5 42.3
28 Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
Anthropic
2026-05-28 $4.08 12.6m 0.0972 42.0 -11.4 42.0 - 26.1 42.0
29 ✓ GLM 5.3 Flash
Z AI
2026-08-26 $0.253 8.19m 0.0060 41.9 -11.5 41.9 - 14.0 41.9
30 Gemini 3.8 Flash (high)
Google
2026-09-02 $1.24 3.25m 0.0302 41.2 -12.2 41.2 - 20.9 41.2
31 Qwen3.8 Max
Alibaba
2026-08-03 $2.67 20.1m 0.0662 40.3 -13.1 40.3 - 24.3 40.3
32 Qwen3.8 2.4T A95B
Alibaba
2026-08-12 $2.16 22.5m 0.0538 40.0 -13.3 40.0 - 23.3 40.0
33 Gemini 3.8 Flash (medium)
Google
2026-09-02 $0.931 - 0.0233 40.0 -13.4 40.0 - 19.7 40.0
34 Qwen3.8-Flash-Next
Alibaba
2026-08-26 $0.372 25.7m 0.0093 39.9 -13.5 39.9 - 15.7 39.9
35 Muse Spark 1.2 (xhigh)
Meta
2026-08-05 $0.975 4.03m 0.0245 39.8 -13.6 39.8 - 19.9 39.8
36 Claude Opus 5 (Adaptive Reasoning, Low Effort)
Anthropic
2026-07-24 $1.10 3.00m 0.0276 39.8 -13.6 39.8 - 20.4 39.8
37 DeepSeek V4.1 Flash (Reasoning, Max Effort)
DeepSeek
2026-09-10 $0.265 4.90m 0.0067 39.5 -13.8 39.5 - 14.2 39.5
38 GPT-5.6 Sol (medium)
OpenAI
2026-07-09 $0.505 2.03m 0.0128 39.5 -13.9 39.5 - 17.0 39.5
39 Gemini 3.7 Flash (high)
Google
2026-08-13 $0.925 2.84m 0.0235 39.4 -13.9 39.4 - 19.7 39.4
40 Grok 4.5 (high)
SpaceXAI
2026-07-08 $1.04 7.40m 0.0265 39.1 -14.3 39.1 - 20.2 39.1
41 GPT-5.5 (xhigh)
OpenAI
2026-04-23 $2.63 4.37m 0.0682 38.6 -14.7 38.6 - 24.2 38.6
42 Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
Anthropic
2026-06-30 $5.09 16.4m 0.1327 38.4 -15.0 38.4 - 27.1 38.4
43 GPT-5.6 Terra (xhigh)
OpenAI
2026-07-09 $0.632 3.85m 0.0165 38.2 -15.2 38.2 - 18.0 38.2
44 ✓ GPT-5.6 Luna (max)
OpenAI
2026-07-09 $0.178 5.67m 0.0048 37.5 -15.9 37.5 - 12.5 37.5
45 GPT-5.5 (high)
OpenAI
2026-04-23 $1.54 2.73m 0.0413 37.3 -16.1 37.3 - 21.9 37.3
46 DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
DeepSeek
2026-08-13 $0.674 8.09m 0.0186 36.3 -17.1 36.3 - 18.3 36.3
47 Grok 4.6 (low)
SpaceXAI
2026-08-12 $0.475 3.08m 0.0134 35.4 -18.0 35.4 - 16.8 35.4
48 DeepSeek V4 Flash 0731 Vision (Reasoning, Max Effort)
DeepSeek
2026-08-21 $0.314 3.86m 0.0090 35.0 -18.4 35.0 - 15.0 35.0
49 ✓ GPT-5.6 Luna (xhigh)
OpenAI
2026-07-09 $0.0853 3.30m 0.0025 34.8 -18.6 34.8 - 9.3 34.8
50 Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)
Anthropic
2026-06-30 $2.87 9.90m 0.0828 34.7 -18.7 34.7 - 24.6 34.7
51 DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
DeepSeek
2026-07-31 $0.220 3.54m 0.0064 34.5 -18.8 34.5 - 13.4 34.5
52 GPT-5.6 Terra (high)
OpenAI
2026-07-09 $0.338 2.19m 0.0098 34.5 -18.9 34.5 - 15.3 34.5
53 Gemini 3.6 Flash (high)
Google
2026-07-21 $0.929 3.64m 0.0270 34.3 -19.0 34.3 - 19.7 34.3
54 Muse Spark 1.1 (xhigh)
Meta
2026-07-09 $1.38 - 0.0403 34.3 -19.1 34.3 - 21.4 34.3
55 GPT-5.5 (medium)
OpenAI
2026-04-23 $0.902 1.69m 0.0264 34.2 -19.2 34.2 - 19.6 34.2
56 GLM-5.2 (max)
Z AI
2026-06-16 $0.965 14.3m 0.0284 34.0 -19.4 34.0 - 19.8 34.0
57 Qwen3.8 27B (xhigh)
Alibaba
2026-08-14 $0.820 17.8m 0.0242 33.9 -19.5 33.9 - 19.1 33.9
58 GPT-5.6 Sol (low)
OpenAI
2026-07-09 $0.261 1.02m 0.0077 33.8 -19.6 33.8 - 14.2 33.8
59 Gemini 3.5 Flash (high)
Google
2026-05-19 $1.56 3.64m 0.0474 33.0 -20.4 33.0 - 21.9 33.0
60 ✓ GPT-5.6 Luna (high)
OpenAI
2026-07-09 $0.0440 2.12m 0.0014 32.4 -21.0 32.4 - 6.4 32.4
61 Claude Sonnet 5 (Adaptive Reasoning, High Effort)
Anthropic
2026-06-30 $1.79 6.54m 0.0560 32.0 -21.3 32.0 - 22.5 32.0
62 DeepSeek V4 Pro 0424 (Reasoning, Max Effort)
DeepSeek
2026-04-24 $0.122 7.20m 0.0039 30.9 -22.5 30.9 - 10.8 30.9
63 Kimi K3 (low)
Kimi
2026-07-16 $1.15 5.45m 0.0376 30.5 -22.9 30.5 - 20.6 30.5
64 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)
Anthropic
2026-02-17 $2.49 20.3m 0.0816 30.5 -22.9 30.5 - 24.0 30.5
65 GPT-5.6 Terra (medium)
OpenAI
2026-07-09 $0.183 1.07m 0.0060 30.4 -23.0 30.4 - 12.6 30.4
66 Gemini 3.1 Pro Preview
Google
2026-02-19 $0.675 2.42m 0.0222 30.4 -23.0 30.4 - 18.3 30.4
67 Qwen3.7 Max
Alibaba
2026-05-19 $1.15 2.47m 0.0384 29.9 -23.5 29.9 - 20.6 29.9
68 MiniMax-M3
MiniMax
2026-06-01 $0.508 6.02m 0.0171 29.6 -23.8 29.6 - 17.1 29.6
69 Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)
Anthropic
2026-06-30 $0.999 4.15m 0.0351 28.4 -24.9 28.4 - 20.0 28.4
70 GPT-5.6 Terra (low)
OpenAI
2026-07-09 $0.144 44s 0.0052 27.9 -25.5 27.9 - 11.6 27.9
71 Qwen3.8 27B (medium)
Alibaba
2026-08-14 $0.903 16.2m 0.0325 27.8 -25.6 27.8 - 19.6 27.8
72 Kimi K2.6
Kimi
2026-04-20 $0.800 18.2m 0.0291 27.5 -25.9 27.5 - 19.0 27.5
73 Quasar 438B (max, based on GLM-5.2)
Multiverse Computing
2026-08-10 $2.02 6.88m 0.0746 27.1 -26.2 27.1 - 23.1 27.1
74 GPT-5.5 Instant (June 2026)
OpenAI
2026-06-25 $0.691 35s 0.0258 26.8 -26.6 26.8 - 18.4 26.8
75 Qwen3.8 27B (low)
Alibaba
2026-08-14 $0.834 14.5m 0.0315 26.5 -26.9 26.5 - 19.2 26.5
76 GLM-5.1 (Reasoning)
Z AI
2026-04-07 $0.922 14.2m 0.0349 26.4 -26.9 26.4 - 19.6 26.4
77 MiMo-V2.5-Pro
Xiaomi
2026-04-22 $0.0541 8.74m 0.0020 26.4 -27.0 26.4 - 7.3 26.4
78 Kimi K2.7 Code
Kimi
2026-06-12 $0.541 8.30m 0.0206 26.3 -27.1 26.3 - 17.3 26.3
79 Inkling Small
Thinking Machines
2026-07-30 $0.0895 2.59m 0.0034 26.1 -27.3 26.1 - 9.5 26.1
80 Qwen3.7 Plus
Alibaba
2026-06-01 $0.325 7.66m 0.0126 25.8 -27.6 25.8 - 15.1 25.8
81 Hy3
Tencent
2026-07-06 $0.0743 8.53m 0.0029 25.8 -27.6 25.8 - 8.7 25.8
82 Inkling (xhigh)
Thinking Machines
2026-07-15 $0.607 7.08m 0.0238 25.5 -27.8 25.5 - 17.8 25.5
83 ✓ GPT-5.6 Luna (medium)
OpenAI
2026-07-09 $0.0156 40s 0.0006 25.5 -27.9 25.5 - 1.9 25.5
84 Grok 4.3 (high)
SpaceXAI
2026-04-30 $0.165 2.40m 0.0065 25.4 -28.0 25.4 - 12.2 25.4
85 DeepSeek V4 Flash 0420 (Reasoning, High Effort)
DeepSeek
2026-04-24 $0.193 - 0.0078 24.8 -28.5 24.8 - 12.9 24.8
86 Claude Sonnet 5 (Adaptive Reasoning, Low Effort)
Anthropic
2026-06-30 $0.509 2.43m 0.0206 24.7 -28.6 24.7 - 17.1 24.7
87 DeepSeek V4 Flash 0420 (Reasoning, Max Effort)
DeepSeek
2026-04-24 $0.118 - 0.0048 24.6 -28.7 24.6 - 10.7 24.6
88 GPT-5.4 mini (xhigh)
OpenAI
2026-03-17 $0.410 4.49m 0.0167 24.6 -28.8 24.6 - 16.1 24.6
89 Nemotron 3 Ultra 550B A55B (Reasoning)
NVIDIA
2026-06-04 $0.579 2.49m 0.0247 23.4 -30.0 23.4 - 17.6 23.4
90 MiniMax-M2.7
MiniMax
2026-03-18 $0.102 5.22m 0.0044 23.2 -30.2 23.2 - 10.1 23.2
91 Gemini 3.5 Flash-Lite
Google
2026-07-21 $0.124 45s 0.0055 22.7 -30.7 22.7 - 10.9 22.7
92 MiMo-V2.5
Xiaomi
2026-04-22 $0.0191 9.21m 0.0009 22.3 -31.1 22.3 - 2.8 22.3
93 Qwen3.6 27B (Reasoning)
Alibaba
2026-04-22 $0.621 8.19m 0.0284 21.9 -31.5 21.9 - 17.9 21.9
94 ✓ GPT-5.6 Luna (low)
OpenAI
2026-07-09 $0.00983 24s 0.0005 21.5 -31.8 21.5 - 0.0 21.5
95 GPT-5.4 nano (xhigh)
OpenAI
2026-03-17 $0.183 6.98m 0.0086 21.2 -32.1 21.2 - 12.6 21.2
96 GPT-5.6 Terra (Non-reasoning)
OpenAI
2026-07-09 $0.140 35s 0.0066 21.2 -32.2 21.2 - 11.5 21.2
97 Claude 4.5 Sonnet (Reasoning)
Anthropic
2025-09-29 $0.557 5.49m 0.0263 21.2 -32.2 21.2 - 17.5 21.2
98 Ling 3.0 Flash
InclusionAI
2026-08-04 $0.0337 2.14m 0.0016 20.6 -32.7 20.6 - 5.3 20.6
99 LongCat 2.0
LongCat
2026-06-29 $0.0590 - 0.0030 19.7 -33.7 19.7 - 7.7 19.7
100 Qwen3.5 397B A17B (Reasoning)
Alibaba
2026-02-16 $0.475 3.47m 0.0248 19.1 -34.3 19.1 - 16.8 19.1