Run #2146

success · fetched 2026-09-09 14:00:47 · 1.32 MB raw HTML · 118 models

Open this run in comparison view · JSON results

Top quality: Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (53.4 pts)

Cost/task vs quality?

118 models · 14 on the Pareto frontier · intelligence quality vs Cost per Task

216294356$0.01$0.10$1$10 cost per task, log scale intelligence quality Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) · Cost/task: $3.91 · Time/task: 7.40m · Quality: 51.2Claude Opus 5 (Adaptive Reasoning, Max Effort) · Cost/task: $5.86 · Time/task: 14.4m · Quality: 50.7Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) · Cost/task: $8.75 · Time/task: 11.3m · Quality: 49.7Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) · Cost/task: $4.88 · Time/task: 12.5m · Quality: 49.7Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) · Cost/task: $2.98 · Time/task: 5.42m · Quality: 49.1Claude Opus 5 (Adaptive Reasoning, High Effort) · Cost/task: $3.61 · Time/task: 9.40m · Quality: 48.2Muse Spark 1.3 (max) · Cost/task: $1.60 · Time/task: 4.66m · Quality: 48.2GPT-5.6 Sol (max) · Cost/task: $1.99 · Time/task: 7.37m · Quality: 47.1Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) · Cost/task: $2.37 · Time/task: 4.55m · Quality: 47.0GPT-6 Astra (Non-reasoning) · Cost/task: $1.71 · Time/task: - · Quality: 45.2Muse Spark 1.3 (xhigh) · Cost/task: $1.37 · Time/task: 5.01m · Quality: 45.2Claude Opus 5 (Adaptive Reasoning, Medium Effort) · Cost/task: $2.19 · Time/task: 5.99m · Quality: 45.1GLM-5.3 (max) · Cost/task: $2.01 · Time/task: 15.8m · Quality: 44.9Grok 4.6 (high) · Cost/task: $1.86 · Time/task: 11.0m · Quality: 44.4Grok 4.6 (xhigh) · Cost/task: $2.32 · Time/task: 11.7m · Quality: 44.3GPT-5.6 Sol (xhigh) · Cost/task: $1.18 · Time/task: 5.16m · Quality: 44.1Kimi K3 (max) · Cost/task: $2.00 · Time/task: 20.2m · Quality: 43.8Grok 4.6 (medium) · Cost/task: $1.50 · Time/task: 8.82m · Quality: 43.0GPT-5.6 Terra (max) · Cost/task: $1.40 · Time/task: 6.54m · Quality: 42.3Claude Opus 4.8 (Adaptive Reasoning, Max Effort) · Cost/task: $4.08 · Time/task: 13.7m · Quality: 42.0Gemini 3.8 Flash (high) · Cost/task: $1.24 · Time/task: 4.16m · Quality: 41.2Qwen3.8 Max · Cost/task: $2.67 · Time/task: 21.6m · Quality: 40.3Qwen3.8 2.4T A95B · Cost/task: $2.16 · Time/task: 22.6m · Quality: 40.0Gemini 3.8 Flash (medium) · Cost/task: $0.931 · Time/task: - · Quality: 40.0Muse Spark 1.2 (xhigh) · Cost/task: $0.975 · Time/task: 3.69m · Quality: 39.8Claude Opus 5 (Adaptive Reasoning, Low Effort) · Cost/task: $1.10 · Time/task: 2.95m · Quality: 39.8GPT-5.6 Sol (medium) · Cost/task: $0.505 · Time/task: 2.08m · Quality: 39.5Gemini 3.7 Flash (high) · Cost/task: $0.925 · Time/task: 3.31m · Quality: 39.4Grok 4.5 (high) · Cost/task: $1.04 · Time/task: 8.21m · Quality: 39.1GPT-5.5 (xhigh) · Cost/task: $2.63 · Time/task: 4.46m · Quality: 38.6Claude Sonnet 5 (Adaptive Reasoning, Max Effort) · Cost/task: $5.09 · Time/task: 15.8m · Quality: 38.4GPT-5.6 Terra (xhigh) · Cost/task: $0.632 · Time/task: 3.65m · Quality: 38.2GPT-5.5 (high) · Cost/task: $1.54 · Time/task: 3.30m · Quality: 37.3DeepSeek V4 Pro 0813 (Reasoning, Max Effort) · Cost/task: $0.674 · Time/task: 10.8m · Quality: 36.3Grok 4.6 (low) · Cost/task: $0.475 · Time/task: 3.16m · Quality: 35.4DeepSeek V4 Flash Vision (Reasoning, Max Effort) · Cost/task: $0.314 · Time/task: 9.39m · Quality: 35.0DeepSeek V4 Flash 0731 (Reasoning, Max Effort) · Cost/task: $0.220 · Time/task: 7.13m · Quality: 34.5GPT-5.6 Terra (high) · Cost/task: $0.338 · Time/task: 2.15m · Quality: 34.5Gemini 3.6 Flash (high) · Cost/task: $0.929 · Time/task: 3.73m · Quality: 34.3Muse Spark 1.1 (xhigh) · Cost/task: $1.38 · Time/task: - · Quality: 34.3GPT-5.5 (medium) · Cost/task: $0.902 · Time/task: 1.70m · Quality: 34.2Qwen3.8 27B (xhigh) · Cost/task: $0.820 · Time/task: 19.4m · Quality: 33.9GPT-5.6 Sol (low) · Cost/task: $0.261 · Time/task: 1.11m · Quality: 33.8Gemini 3.5 Flash (high) · Cost/task: $1.56 · Time/task: 4.24m · Quality: 33.0DeepSeek V4 Pro (Reasoning, Max Effort) · Cost/task: $0.122 · Time/task: 9.08m · Quality: 30.9Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) · Cost/task: $2.49 · Time/task: 21.8m · Quality: 30.5Gemini 3.1 Pro Preview · Cost/task: $0.675 · Time/task: 2.74m · Quality: 30.4Qwen3.7 Max · Cost/task: $1.15 · Time/task: 2.32m · Quality: 29.9MiniMax-M3 · Cost/task: $0.508 · Time/task: 8.21m · Quality: 29.6Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) · Cost/task: $0.999 · Time/task: 4.66m · Quality: 28.4Quasar 438B (max, based on GLM-5.2) · Cost/task: $2.02 · Time/task: 5.96m · Quality: 27.1GPT-5.5 Instant (June 2026) · Cost/task: $0.691 · Time/task: 41s · Quality: 26.8GLM-5.1 (Reasoning) · Cost/task: $0.922 · Time/task: 10.3m · Quality: 26.4Kimi K2.7 Code · Cost/task: $0.541 · Time/task: 8.43m · Quality: 26.3Inkling Small · Cost/task: $0.0895 · Time/task: 3.44m · Quality: 26.1Qwen3.7 Plus · Cost/task: $0.325 · Time/task: 10.3m · Quality: 25.8Hy3 · Cost/task: $0.0718 · Time/task: 8.23m · Quality: 25.8Inkling (xhigh) · Cost/task: $0.607 · Time/task: 8.01m · Quality: 25.5Grok 4.3 (high) · Cost/task: $0.165 · Time/task: 2.68m · Quality: 25.4DeepSeek V4 Flash (Reasoning, High Effort) · Cost/task: $0.193 · Time/task: - · Quality: 24.8Claude Sonnet 5 (Adaptive Reasoning, Low Effort) · Cost/task: $0.509 · Time/task: 2.49m · Quality: 24.7DeepSeek V4 Flash (Reasoning, Max Effort) · Cost/task: $0.118 · Time/task: - · Quality: 24.6GPT-5.4 mini (xhigh) · Cost/task: $0.410 · Time/task: 4.73m · Quality: 24.6Nemotron 3 Ultra 550B A55B (Reasoning) · Cost/task: $0.585 · Time/task: 2.81m · Quality: 23.4MiniMax-M2.7 · Cost/task: $0.102 · Time/task: 5.21m · Quality: 23.2Gemini 3.5 Flash-Lite · Cost/task: $0.124 · Time/task: 49s · Quality: 22.7Qwen3.6 27B (Reasoning) · Cost/task: $0.621 · Time/task: 8.90m · Quality: 21.9GPT-5.4 nano (xhigh) · Cost/task: $0.183 · Time/task: 6.65m · Quality: 21.2Claude 4.5 Sonnet (Reasoning) · Cost/task: $0.557 · Time/task: 5.39m · Quality: 21.2LongCat 2.0 · Cost/task: $0.146 · Time/task: 7.88m · Quality: 19.7Qwen3.5 397B A17B (Reasoning) · Cost/task: $0.475 · Time/task: 3.46m · Quality: 19.1Muse Glimmer (high) · Cost/task: $0.0551 · Time/task: 2.33m · Quality: 18.1Claude 4.5 Haiku (Reasoning) · Cost/task: $0.208 · Time/task: 2.88m · Quality: 17.6GPT-5 mini (high) · Cost/task: $0.0535 · Time/task: 2.65m · Quality: 17.4Ring-2.6-1T · Cost/task: $0.287 · Time/task: 5.54m · Quality: 17.3Gemini 2.5 Pro · Cost/task: $0.232 · Time/task: 1.36m · Quality: 16.7Qwen3.5 122B A10B (Reasoning) · Cost/task: $0.325 · Time/task: 2.12m · Quality: 16.2Gemini 3.1 Flash-Lite · Cost/task: $0.0394 · Time/task: 41s · Quality: 16.0Mistral Medium 3.5 · Cost/task: $0.437 · Time/task: 2.79m · Quality: 14.9Grok 4.3 (Non-reasoning) · Cost/task: $0.137 · Time/task: 1.28m · Quality: 14.5Nemotron 3.5 Lightning · Cost/task: $0.0931 · Time/task: 1.95m · Quality: 13.6Nemotron 3 Super 120B A12B (Reasoning) · Cost/task: $1.06 · Time/task: 16.5m · Quality: 13.6Qwen3 235B A22B 2507 (Reasoning) · Cost/task: $0.0806 · Time/task: 6.99m · Quality: 12.7gpt-oss-120b (high) · Cost/task: $0.107 · Time/task: 2.11m · Quality: 12.3Mercury 2 · Cost/task: $0.0733 · Time/task: 35s · Quality: 11.5Mistral Small 4 (Reasoning) · Cost/task: $0.0451 · Time/task: 1.60m · Quality: 11.5DeepSeek R1 (Jan '25) · Cost/task: $0.262 · Time/task: - · Quality: 11.4Trinity Large Thinking · Cost/task: $0.353 · Time/task: 2.28m · Quality: 10.9Qwen3 Coder Next · Cost/task: $0.552 · Time/task: 1.94m · Quality: 10.1Qwen3 30B A3B 2507 (Reasoning) · Cost/task: $0.0766 · Time/task: 2.35m · Quality: 9.8DeepSeek V3 0324 · Cost/task: $0.105 · Time/task: - · Quality: 9.7Mistral Large 3 · Cost/task: $0.104 · Time/task: 1.16m · Quality: 9.7Llama 4 Maverick · Cost/task: $0.0397 · Time/task: 22s · Quality: 9.3gpt-oss-20b (high) · Cost/task: $0.0113 · Time/task: 1.59m · Quality: 9.0NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) · Cost/task: $0.0168 · Time/task: 1.86m · Quality: 8.9DeepSeek V3 (Dec '24) · Cost/task: $0.0198 · Time/task: - · Quality: 8.5Solar Pro 3 · Cost/task: $0.0794 · Time/task: 4.83m · Quality: 7.8Mistral Small 3.1 · Cost/task: $0.0328 · Time/task: 41s · Quality: 7.4Mistral Small 3.2 · Cost/task: $0.146 · Time/task: 45s · Quality: 7.0Llama 4 Scout · Cost/task: $0.118 · Time/task: 24s · Quality: 6.5Celeris-1 · Cost/task: $0.0502 · Time/task: 3.5s · Quality: 6.3Ministral 3 14B · Cost/task: $0.139 · Time/task: 1.07m · Quality: 6.0Ministral 3 8B · Cost/task: $0.0655 · Time/task: 1.46m · Quality: 5.5Ministral 3 3B · Cost/task: $0.0423 · Time/task: 1.14m · Quality: 4.8Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) · Cost/task: $7.63 · Time/task: 12.2m · Quality: 53.4 · Pareto frontierClaude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) · Cost/task: $5.98 · Time/task: 11.0m · Quality: 53.2 · Pareto frontierGPT-6 Astra (max) · Cost/task: $3.26 · Time/task: 8.56m · Quality: 52.8 · Pareto frontierGPT-6 Astra (xhigh) · Cost/task: $2.31 · Time/task: 5.78m · Quality: 52.5 · Pareto frontierGPT-6 Astra (high) · Cost/task: $1.72 · Time/task: 4.27m · Quality: 51.0 · Pareto frontierGPT-6 Astra (medium) · Cost/task: $1.54 · Time/task: 3.68m · Quality: 49.7 · Pareto frontierGPT-6 Astra (low) · Cost/task: $0.818 · Time/task: 1.64m · Quality: 46.0 · Pareto frontierGPT-5.6 Sol (high) · Cost/task: $0.808 · Time/task: 3.74m · Quality: 42.5 · Pareto frontierGLM-5.3-Flash · Cost/task: $0.253 · Time/task: 14.5m · Quality: 41.9 · Pareto frontierGPT-5.6 Luna (max) · Cost/task: $0.178 · Time/task: 6.22m · Quality: 37.5 · Pareto frontierGPT-5.6 Luna (xhigh) · Cost/task: $0.0853 · Time/task: 3.68m · Quality: 34.8 · Pareto frontierMiMo-V2.5-Pro · Cost/task: $0.0541 · Time/task: 13.2m · Quality: 26.4 · Pareto frontierMiMo-V2.5 · Cost/task: $0.0191 · Time/task: 8.69m · Quality: 22.3 · Pareto frontierGranite 4.2 3B · Cost/task: $0.00596 · Time/task: 1.38m · Quality: 9.1 · Pareto frontier Granite 4.2 3BMiMo-V2.5MiMo-V2.5-ProGPT-5.6 Luna (xhi…GPT-5.6 Luna (max)GLM-5.3-FlashGPT-5.6 Sol (high)GPT-6 Astra (low)GPT-6 Astra (medi…GPT-6 Astra (high)GPT-6 Astra (xhig…GPT-6 Astra (max)Claude Fable 5.1 …Claude Fable 5.1 …
#?Pareto?Model?Released?Cost/task?Time/task?$/Q?Qual?ΔTop?Intel?Agent?Pen?Score?
1 ✓ Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)
Anthropic
2026-09-01 $7.63 12.2m 0.1429 53.4 0.0 53.4 - 28.8 53.4
2 ✓ Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)
Anthropic
2026-09-01 $5.98 11.0m 0.1124 53.2 -0.2 53.2 - 27.8 53.2
3 ✓ GPT-6 Astra (max)
OpenAI
2026-09-03 $3.26 8.56m 0.0617 52.8 -0.6 52.8 - 25.1 52.8
4 ✓ GPT-6 Astra (xhigh)
OpenAI
2026-09-03 $2.31 5.78m 0.0440 52.5 -0.9 52.5 - 23.6 52.5
5 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)
Anthropic
2026-09-01 $3.91 7.40m 0.0764 51.2 -2.2 51.2 - 25.9 51.2
6 ✓ GPT-6 Astra (high)
OpenAI
2026-09-03 $1.72 4.27m 0.0337 51.0 -2.3 51.0 - 22.4 51.0
7 Claude Opus 5 (Adaptive Reasoning, Max Effort)
Anthropic
2026-07-24 $5.86 14.4m 0.1155 50.7 -2.7 50.7 - 27.7 50.7
8 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)
Anthropic
2026-06-09 $8.75 11.3m 0.1760 49.7 -3.7 49.7 - 29.4 49.7
9 ✓ GPT-6 Astra (medium)
OpenAI
2026-09-03 $1.54 3.68m 0.0310 49.7 -3.7 49.7 - 21.9 49.7
10 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)
Anthropic
2026-07-24 $4.88 12.5m 0.0982 49.7 -3.7 49.7 - 26.9 49.7
11 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)
Anthropic
2026-09-01 $2.98 5.42m 0.0608 49.1 -4.3 49.1 - 24.7 49.1
12 Claude Opus 5 (Adaptive Reasoning, High Effort)
Anthropic
2026-07-24 $3.61 9.40m 0.0749 48.2 -5.1 48.2 - 25.6 48.2
13 Muse Spark 1.3 (max)
Meta
2026-09-02 $1.60 4.66m 0.0333 48.2 -5.2 48.2 - 22.1 48.2
14 GPT-5.6 Sol (max)
OpenAI
2026-07-09 $1.99 7.37m 0.0423 47.1 -6.3 47.1 - 23.0 47.1
15 Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)
Anthropic
2026-09-01 $2.37 4.55m 0.0504 47.0 -6.3 47.0 - 23.7 47.0
16 ✓ GPT-6 Astra (low)
OpenAI
2026-09-03 $0.818 1.64m 0.0178 46.0 -7.4 46.0 - 19.1 46.0
17 GPT-6 Astra (Non-reasoning)
OpenAI
2026-09-03 $1.71 - 0.0379 45.2 -8.2 45.2 - 22.3 45.2
18 Muse Spark 1.3 (xhigh)
Meta
2026-09-02 $1.37 5.01m 0.0303 45.2 -8.2 45.2 - 21.4 45.2
19 Claude Opus 5 (Adaptive Reasoning, Medium Effort)
Anthropic
2026-07-24 $2.19 5.99m 0.0486 45.1 -8.3 45.1 - 23.4 45.1
20 GLM-5.3 (max)
Z AI
2026-08-18 $2.01 15.8m 0.0447 44.9 -8.5 44.9 - 23.0 44.9
21 Grok 4.6 (high)
SpaceXAI
2026-08-12 $1.86 11.0m 0.0419 44.4 -9.0 44.4 - 22.7 44.4
22 Grok 4.6 (xhigh)
SpaceXAI
2026-08-12 $2.32 11.7m 0.0525 44.3 -9.1 44.3 - 23.7 44.3
23 GPT-5.6 Sol (xhigh)
OpenAI
2026-07-09 $1.18 5.16m 0.0268 44.1 -9.2 44.1 - 20.7 44.1
24 Kimi K3 (max)
Kimi
2026-07-16 $2.00 20.2m 0.0457 43.8 -9.6 43.8 - 23.0 43.8
25 Grok 4.6 (medium)
SpaceXAI
2026-08-12 $1.50 8.82m 0.0348 43.0 -10.4 43.0 - 21.8 43.0
26 ✓ GPT-5.6 Sol (high)
OpenAI
2026-07-09 $0.808 3.74m 0.0190 42.5 -10.9 42.5 - 19.1 42.5
27 GPT-5.6 Terra (max)
OpenAI
2026-07-09 $1.40 6.54m 0.0331 42.3 -11.1 42.3 - 21.5 42.3
28 Claude Opus 4.8 (Adaptive Reasoning, Max Effort)
Anthropic
2026-05-28 $4.08 13.7m 0.0972 42.0 -11.4 42.0 - 26.1 42.0
29 ✓ GLM-5.3-Flash
Z AI
2026-08-26 $0.253 14.5m 0.0060 41.9 -11.5 41.9 - 14.0 41.9
30 Gemini 3.8 Flash (high)
Google
2026-09-02 $1.24 4.16m 0.0302 41.2 -12.2 41.2 - 20.9 41.2
31 Qwen3.8 Max
Alibaba
2026-08-03 $2.67 21.6m 0.0662 40.3 -13.1 40.3 - 24.3 40.3
32 Qwen3.8 2.4T A95B
Alibaba
2026-08-12 $2.16 22.6m 0.0538 40.0 -13.3 40.0 - 23.3 40.0
33 Gemini 3.8 Flash (medium)
Google
2026-09-02 $0.931 - 0.0233 40.0 -13.4 40.0 - 19.7 40.0
34 Muse Spark 1.2 (xhigh)
Meta
2026-08-05 $0.975 3.69m 0.0245 39.8 -13.6 39.8 - 19.9 39.8
35 Claude Opus 5 (Adaptive Reasoning, Low Effort)
Anthropic
2026-07-24 $1.10 2.95m 0.0276 39.8 -13.6 39.8 - 20.4 39.8
36 GPT-5.6 Sol (medium)
OpenAI
2026-07-09 $0.505 2.08m 0.0128 39.5 -13.9 39.5 - 17.0 39.5
37 Gemini 3.7 Flash (high)
Google
2026-08-13 $0.925 3.31m 0.0235 39.4 -13.9 39.4 - 19.7 39.4
38 Grok 4.5 (high)
SpaceXAI
2026-07-08 $1.04 8.21m 0.0265 39.1 -14.3 39.1 - 20.2 39.1
39 GPT-5.5 (xhigh)
OpenAI
2026-04-23 $2.63 4.46m 0.0682 38.6 -14.7 38.6 - 24.2 38.6
40 Claude Sonnet 5 (Adaptive Reasoning, Max Effort)
Anthropic
2026-06-30 $5.09 15.8m 0.1327 38.4 -15.0 38.4 - 27.1 38.4
41 GPT-5.6 Terra (xhigh)
OpenAI
2026-07-09 $0.632 3.65m 0.0165 38.2 -15.2 38.2 - 18.0 38.2
42 ✓ GPT-5.6 Luna (max)
OpenAI
2026-07-09 $0.178 6.22m 0.0048 37.5 -15.9 37.5 - 12.5 37.5
43 GPT-5.5 (high)
OpenAI
2026-04-23 $1.54 3.30m 0.0413 37.3 -16.1 37.3 - 21.9 37.3
44 DeepSeek V4 Pro 0813 (Reasoning, Max Effort)
DeepSeek
2026-08-13 $0.674 10.8m 0.0186 36.3 -17.1 36.3 - 18.3 36.3
45 Grok 4.6 (low)
SpaceXAI
2026-08-12 $0.475 3.16m 0.0134 35.4 -18.0 35.4 - 16.8 35.4
46 DeepSeek V4 Flash Vision (Reasoning, Max Effort)
DeepSeek
2026-08-21 $0.314 9.39m 0.0090 35.0 -18.4 35.0 - 15.0 35.0
47 ✓ GPT-5.6 Luna (xhigh)
OpenAI
2026-07-09 $0.0853 3.68m 0.0025 34.8 -18.6 34.8 - 9.3 34.8
48 DeepSeek V4 Flash 0731 (Reasoning, Max Effort)
DeepSeek
2026-07-31 $0.220 7.13m 0.0064 34.5 -18.8 34.5 - 13.4 34.5
49 GPT-5.6 Terra (high)
OpenAI
2026-07-09 $0.338 2.15m 0.0098 34.5 -18.9 34.5 - 15.3 34.5
50 Gemini 3.6 Flash (high)
Google
2026-07-21 $0.929 3.73m 0.0270 34.3 -19.0 34.3 - 19.7 34.3
51 Muse Spark 1.1 (xhigh)
Meta
2026-07-09 $1.38 - 0.0403 34.3 -19.1 34.3 - 21.4 34.3
52 GPT-5.5 (medium)
OpenAI
2026-04-23 $0.902 1.70m 0.0264 34.2 -19.2 34.2 - 19.6 34.2
53 Qwen3.8 27B (xhigh)
Alibaba
2026-08-14 $0.820 19.4m 0.0242 33.9 -19.5 33.9 - 19.1 33.9
54 GPT-5.6 Sol (low)
OpenAI
2026-07-09 $0.261 1.11m 0.0077 33.8 -19.6 33.8 - 14.2 33.8
55 Gemini 3.5 Flash (high)
Google
2026-05-19 $1.56 4.24m 0.0474 33.0 -20.4 33.0 - 21.9 33.0
56 DeepSeek V4 Pro (Reasoning, Max Effort)
DeepSeek
2026-04-24 $0.122 9.08m 0.0039 30.9 -22.5 30.9 - 10.8 30.9
57 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)
Anthropic
2026-02-17 $2.49 21.8m 0.0816 30.5 -22.9 30.5 - 24.0 30.5
58 Gemini 3.1 Pro Preview
Google
2026-02-19 $0.675 2.74m 0.0222 30.4 -23.0 30.4 - 18.3 30.4
59 Qwen3.7 Max
Alibaba
2026-05-19 $1.15 2.32m 0.0384 29.9 -23.5 29.9 - 20.6 29.9
60 MiniMax-M3
MiniMax
2026-06-01 $0.508 8.21m 0.0171 29.6 -23.8 29.6 - 17.1 29.6
61 Claude Sonnet 5 (Adaptive Reasoning, Medium Effort)
Anthropic
2026-06-30 $0.999 4.66m 0.0351 28.4 -24.9 28.4 - 20.0 28.4
62 Quasar 438B (max, based on GLM-5.2)
Multiverse Computing
2026-08-10 $2.02 5.96m 0.0746 27.1 -26.2 27.1 - 23.1 27.1
63 GPT-5.5 Instant (June 2026)
OpenAI
2026-06-25 $0.691 41s 0.0258 26.8 -26.6 26.8 - 18.4 26.8
64 GLM-5.1 (Reasoning)
Z AI
2026-04-07 $0.922 10.3m 0.0349 26.4 -26.9 26.4 - 19.6 26.4
65 ✓ MiMo-V2.5-Pro
Xiaomi
2026-04-22 $0.0541 13.2m 0.0020 26.4 -27.0 26.4 - 7.3 26.4
66 Kimi K2.7 Code
Kimi
2026-06-12 $0.541 8.43m 0.0206 26.3 -27.1 26.3 - 17.3 26.3
67 Inkling Small
Thinking Machines
2026-07-30 $0.0895 3.44m 0.0034 26.1 -27.3 26.1 - 9.5 26.1
68 Qwen3.7 Plus
Alibaba
2026-06-01 $0.325 10.3m 0.0126 25.8 -27.6 25.8 - 15.1 25.8
69 Hy3
Tencent
2026-07-06 $0.0718 8.23m 0.0028 25.8 -27.6 25.8 - 8.6 25.8
70 Inkling (xhigh)
Thinking Machines
2026-07-15 $0.607 8.01m 0.0238 25.5 -27.8 25.5 - 17.8 25.5
71 Grok 4.3 (high)
SpaceXAI
2026-04-30 $0.165 2.68m 0.0065 25.4 -28.0 25.4 - 12.2 25.4
72 DeepSeek V4 Flash (Reasoning, High Effort)
DeepSeek
2026-04-24 $0.193 - 0.0078 24.8 -28.5 24.8 - 12.9 24.8
73 Claude Sonnet 5 (Adaptive Reasoning, Low Effort)
Anthropic
2026-06-30 $0.509 2.49m 0.0206 24.7 -28.6 24.7 - 17.1 24.7
74 DeepSeek V4 Flash (Reasoning, Max Effort)
DeepSeek
2026-04-24 $0.118 - 0.0048 24.6 -28.7 24.6 - 10.7 24.6
75 GPT-5.4 mini (xhigh)
OpenAI
2026-03-17 $0.410 4.73m 0.0167 24.6 -28.8 24.6 - 16.1 24.6
76 Nemotron 3 Ultra 550B A55B (Reasoning)
NVIDIA
2026-06-04 $0.585 2.81m 0.0250 23.4 -30.0 23.4 - 17.7 23.4
77 MiniMax-M2.7
MiniMax
2026-03-18 $0.102 5.21m 0.0044 23.2 -30.2 23.2 - 10.1 23.2
78 Gemini 3.5 Flash-Lite
Google
2026-07-21 $0.124 49s 0.0055 22.7 -30.7 22.7 - 10.9 22.7
79 ✓ MiMo-V2.5
Xiaomi
2026-04-22 $0.0191 8.69m 0.0009 22.3 -31.1 22.3 - 2.8 22.3
80 Qwen3.6 27B (Reasoning)
Alibaba
2026-04-22 $0.621 8.90m 0.0284 21.9 -31.5 21.9 - 17.9 21.9
81 GPT-5.4 nano (xhigh)
OpenAI
2026-03-17 $0.183 6.65m 0.0086 21.2 -32.1 21.2 - 12.6 21.2
82 Claude 4.5 Sonnet (Reasoning)
Anthropic
2025-09-29 $0.557 5.39m 0.0263 21.2 -32.2 21.2 - 17.5 21.2
83 LongCat 2.0
LongCat
2026-06-29 $0.146 7.88m 0.0074 19.7 -33.7 19.7 - 11.7 19.7
84 Qwen3.5 397B A17B (Reasoning)
Alibaba
2026-02-16 $0.475 3.46m 0.0248 19.1 -34.3 19.1 - 16.8 19.1
85 Muse Glimmer (high)
Meta
2026-08-10 $0.0551 2.33m 0.0030 18.1 -35.3 18.1 - 7.4 18.1
86 Claude 4.5 Haiku (Reasoning)
Anthropic
2025-10-15 $0.208 2.88m 0.0118 17.6 -35.8 17.6 - 13.2 17.6
87 GPT-5 mini (high)
OpenAI
2025-08-07 $0.0535 2.65m 0.0031 17.4 -36.0 17.4 - 7.3 17.4
88 Ring-2.6-1T
InclusionAI
2026-05-08 $0.287 5.54m 0.0166 17.3 -36.1 17.3 - 14.6 17.3
89 Gemini 2.5 Pro
Google
2025-06-05 $0.232 1.36m 0.0139 16.7 -36.7 16.7 - 13.6 16.7
90 Qwen3.5 122B A10B (Reasoning)
Alibaba
2026-02-24 $0.325 2.12m 0.0201 16.2 -37.2 16.2 - 15.1 16.2
91 Gemini 3.1 Flash-Lite
Google
2026-03-03 $0.0394 41s 0.0025 16.0 -37.3 16.0 - 6.0 16.0
92 Mistral Medium 3.5
Mistral
2026-04-29 $0.437 2.79m 0.0293 14.9 -38.5 14.9 - 16.4 14.9
93 Grok 4.3 (Non-reasoning)
SpaceXAI
2026-04-30 $0.137 1.28m 0.0095 14.5 -38.8 14.5 - 11.4 14.5
94 Nemotron 3.5 Lightning
NVIDIA
2026-08-11 $0.0931 1.95m 0.0068 13.6 -39.7 13.6 - 9.7 13.6
95 Nemotron 3 Super 120B A12B (Reasoning)
NVIDIA
2026-03-11 $1.06 16.5m 0.0782 13.6 -39.8 13.6 - 20.3 13.6
96 Qwen3 235B A22B 2507 (Reasoning)
Alibaba
2025-07-25 $0.0806 6.99m 0.0063 12.7 -40.7 12.7 - 9.1 12.7
97 gpt-oss-120b (high)
OpenAI
2025-08-05 $0.107 2.11m 0.0087 12.3 -41.0 12.3 - 10.3 12.3
98 Mercury 2
Inception
2026-02-20 $0.0733 35s 0.0064 11.5 -41.9 11.5 - 8.7 11.5
99 Mistral Small 4 (Reasoning)
Mistral
2026-03-16 $0.0451 1.60m 0.0039 11.5 -41.9 11.5 - 6.5 11.5
100 DeepSeek R1 (Jan '25)
DeepSeek
2025-01-20 $0.262 - 0.0229 11.4 -42.0 11.4 - 14.2 11.4