AI 大模型排名 ArtificialAnalysis AI 大模型排行榜

本页面排行数据来自 Artificial Analysis ,它对超过 100 个 AI 模型(LLM)的性能进行了比较和排名,评估指标包括智能程度、价格等。另外排行也汇总其他权威 AI 基准测试结果以供参考。

AI 大模型排名(基于 Artificial Analysis

重置筛选
模型信息 Artificial Analysis测试基准结果 其他 AI 测试基准结果
排名 模型名称 机构 综合指数 Coding Math 价格 ($/1M) MMLU Pro ? GPQA ? HLE ? LiveCodeBench ? SciCode ? Math 500 ? AIME ?
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) Anthropic 53.4 81.6 - $20 - 0.937 0.591 - 0.631 - -
2 Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) Anthropic 53.2 80.7 - $20 - 0.934 0.587 - 0.609 - -
3 GPT-6 Astra (max) OpenAI 52.8 76.9 - $20 - 0.961 0.547 - 0.565 - -
4 GPT-6 Astra (xhigh) OpenAI 52.5 75.9 - $20 - 0.963 0.546 - 0.557 - -
5 Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) Anthropic 51.2 79.1 - $20 - 0.906 0.559 - 0.587 - -
6 GPT-6 Astra (high) OpenAI 51 77.1 - $20 - 0.949 0.531 - 0.554 - -
7 Claude Opus 5 (Adaptive Reasoning, Max Effort) Anthropic 50.7 78 - $10 - 0.932 0.549 - 0.564 - -
8 GPT-6 Astra (medium) OpenAI 49.7 76.7 - $20 - 0.939 0.527 - 0.542 - -
9 Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) Anthropic 49.7 76.5 - $20 - 0.926 0.555 - 0.61 - -
10 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) Anthropic 49.7 77 - $10 - 0.937 0.544 - 0.557 - -
11 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) Anthropic 49.1 77.1 - $20 - 0.886 0.538 - 0.564 - -
12 Muse Spark 1.3 (max) Meta 48.2 75.8 - $2 - 0.935 0.487 - 0.588 - -
13 Claude Opus 5 (Adaptive Reasoning, High Effort) Anthropic 48.2 76.5 - $10 - 0.937 0.528 - 0.554 - -
14 GPT-5.6 Sol (max) OpenAI 47.1 77.4 - $8 - 0.941 0.495 - 0.571 - -
15 Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) Anthropic 47 75.2 - $20 - 0.881 0.489 - 0.567 - -
16 GPT-6 Astra (low) OpenAI 46 75.7 - $20 - 0.931 0.492 - 0.541 - -
17 GPT-6 Astra (Non-reasoning) OpenAI 45.2 76.2 - $20 - 0.895 0.371 - 0.535 - -
18 Muse Spark 1.3 (xhigh) Meta 45.2 76.5 - $2 - 0.941 0.475 - 0.597 - -
19 Claude Opus 5 (Adaptive Reasoning, Medium Effort) Anthropic 45.1 74.3 - $10 - 0.919 0.513 - 0.515 - -
20 GLM-5.3 (max) Z AI 44.9 74.8 - $2.15 - 0.917 0.423 - 0.59 - -
21 Grok 4.6 (high) SpaceXAI 44.4 76.8 - $3 - 0.949 0.429 - 0.565 - -
22 Grok 4.6 (xhigh) SpaceXAI 44.3 75.9 - $3 - 0.935 0.441 - 0.53 - -
23 GPT-5.6 Sol (xhigh) OpenAI 44.1 78.3 - $8 - 0.931 0.473 - 0.571 - -
24 Kimi K3 (max) Kimi 43.8 76.2 - $6 - 0.935 0.469 - 0.595 - -
25 Grok 4.6 (medium) SpaceXAI 43 74.4 - $3 - 0.935 0.421 - 0.559 - -
26 GPT-5.6 Sol (high) OpenAI 42.5 77.2 - $8 - 0.928 0.46 - 0.578 - -
27 GPT-5.6 Terra (max) OpenAI 42.3 76.7 - $4.5 - 0.925 0.429 - 0.55 - -
28 Qwen3.8-Flash-Next Alibaba 42.2 73.1 - $0.23 - 0.923 0.38 - 0.506 - -
29 Claude Opus 4.8 (Adaptive Reasoning, Max Effort) Anthropic 42 74.3 - $10 - 0.92 0.487 - 0.544 - -
30 GLM-5.3-Flash Z AI 41.9 71.5 - $0.237 - 0.912 0.399 - 0.516 - -
31 Gemini 3.8 Flash (high) Google 41.2 76.3 - $1.5 - 0.953 0.478 - 0.566 - -
32 Claude Opus 4.7 (Adaptive Reasoning, Max Effort) Anthropic 40.7 73.6 - $10 - 0.914 0.423 - - - -
33 Qwen3.8 Max Alibaba 40.3 71.8 - $3 - 0.927 0.43 - 0.532 - -
34 Gemini 3.8 Flash (medium) Google 40 74.1 - $1.5 - 0.935 0.421 - 0.551 - -
35 Qwen3.8 2.4T A95B Alibaba 40 71.9 - $3 - 0.935 0.424 - 0.541 - -
36 Muse Spark 1.2 (xhigh) Meta 39.8 72.2 - $2 - 0.904 0.455 - 0.574 - -
37 Claude Opus 5 (Adaptive Reasoning, Low Effort) Anthropic 39.8 66.9 - $10 - 0.889 0.434 - 0.492 - -
38 Gemini 3.7 Flash (medium) Google 39.6 71.5 - $1.5 - 0.921 0.39 - 0.598 - -
39 GPT-5.6 Sol (medium) OpenAI 39.5 76.3 - $8 - 0.926 0.422 - 0.574 - -
40 Gemini 3.7 Flash (high) Google 39.4 76.1 - $1.5 - 0.945 0.479 - 0.572 - -
41 Grok 4.5 (high) SpaceXAI 39.1 72.4 - $3 - 0.931 0.427 - 0.55 - -
42 GPT-5.4 (xhigh) OpenAI 39 71.1 - $5.625 - 0.92 0.437 - - - -
43 GLM-5.2 (max) Z AI 38.6 68.8 - $2.15 - 0.895 0.411 - 0.512 - -
44 GPT-5.5 (xhigh) OpenAI 38.6 74.9 - $11.25 - 0.935 0.458 - 0.558 - -
45 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) Anthropic 38.4 71.5 - $4 - 0.911 0.413 - 0.543 - -
46 GPT-5.6 Terra (xhigh) OpenAI 38.2 70.6 - $4.5 - 0.908 0.419 - 0.523 - -
47 GPT-5.6 Luna (max) OpenAI 37.5 71.4 - $0.45 - 0.911 0.395 - 0.536 - -
48 GPT-5.5 (high) OpenAI 37.3 71.6 - $11.25 - 0.932 0.45 - 0.561 - -
49 Gemini 3.7 Flash (low) Google 36.9 71 - $1.5 - 0.901 0.351 - 0.557 - -
50 DeepSeek V4 Pro 0813 (Reasoning, Max Effort) DeepSeek 36.3 68.8 - $1.98 - 0.928 0.41 - 0.51 - -
51 Grok 4.6 (low) SpaceXAI 35.4 66.3 - $3 - 0.879 0.276 - 0.494 - -
52 Agnes 2.5 Pro Beta Sapiens AI 35.2 62.3 - $0.15 - 0.905 0.375 - 0.488 - -
53 DeepSeek V4 Flash Vision (Reasoning, Max Effort) DeepSeek 35 65 - $0.66 - 0.913 0.345 - 0.497 - -
54 GPT-5.6 Luna (xhigh) OpenAI 34.8 68.6 - $0.45 - 0.895 0.37 - 0.505 - -
55 GPT-5.6 Terra (high) OpenAI 34.5 67.1 - $4.5 - 0.896 0.385 - 0.524 - -
56 DeepSeek V4 Flash 0731 (Reasoning, Max Effort) DeepSeek 34.5 69.1 - $0.66 - 0.908 0.386 - 0.503 - -
57 Kimi K3 (low) Kimi 34.5 72 - $6 - 0.842 0.25 - 0.527 - -
58 Gemini 3.6 Flash (high) Google 34.3 69.2 - $1.5 - 0.928 0.408 - 0.534 - -
59 Muse Spark 1.1 (xhigh) Meta 34.3 71.3 - $2 - 0.898 0.462 - 0.588 - -
60 GPT-5.5 (medium) OpenAI 34.2 71.5 - $11.25 - 0.926 0.424 - 0.545 - -
61 K2 Horizon 375B A23B MBZUAI Institute of Foundation Models 33.9 61.5 - $0 - 0.873 0.32 - 0.429 - -
62 Qwen3.8 27B (xhigh) Alibaba 33.9 68.1 - $1.125 - 0.905 0.339 - 0.466 - -
63 Gemini 3.8 Flash (low) Google 33.8 73.5 - $1.5 - 0.92 0.371 - 0.55 - -
64 GPT-5.6 Sol (low) OpenAI 33.8 69.7 - $8 - 0.898 0.394 - 0.564 - -
65 Gemini 3.5 Flash (medium) Google 33.6 - - $3.375 - 0.921 0.413 - - - -
66 Motif 3 Motif Technologies 33.6 63.5 - $0 - 0.834 0.37 - 0.422 - -
67 Gemini 3.5 Flash (high) Google 33 70.1 - $3.375 - 0.922 0.427 - 0.539 - -
68 GPT-5.6 Luna (high) OpenAI 32.9 63.3 - $0.45 - 0.892 0.334 - 0.516 - -
69 GPT-5.6 Terra (medium) OpenAI 32.8 64.7 - $4.5 - 0.872 0.333 - 0.505 - -
70 GPT-5.3 Codex (xhigh) OpenAI 32.5 - - $4.813 - 0.915 0.425 - - - -
71 Motif 3 (Beta) Motif Technologies 32.3 62 - $0 - 0.869 0.404 - - - -
72 Claude Opus 4.6 (Adaptive Reasoning, Max Effort) Anthropic 31.9 - - $10 - 0.896 0.399 - - - -
73 Muse Spark Meta 31.3 58.6 - $0 - 0.884 0.407 - - - -
74 Kimi K2.6 Kimi 31.3 61.8 - $1.712 - 0.911 0.375 - 0.515 - -
75 DeepSeek V4 Pro (Reasoning, Max Effort) DeepSeek 30.9 59.4 - $0.544 - 0.888 0.375 - 0.508 - -
76 Claude Opus 4.7 (Non-reasoning, High Effort) Anthropic 30.9 - - $10 - 0.885 0.333 - - - -
77 Qwen3.8 27B (medium) Alibaba 30.7 56.1 - $1.125 - 0.845 0.141 - 0.39 - -
78 GPT-5.5 (low) OpenAI 30.7 60.9 - $11.25 - 0.91 0.327 - - - -
79 Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) Anthropic 30.5 63 - $6 - 0.875 0.336 - 0.501 - -
80 Gemini 3.1 Pro Preview Google 30.4 68.8 - $4.5 - 0.941 0.47 - 0.587 - -
81 Apodex 1.1 Apodex 30.4 60.8 - $0.975 - 0.864 0.341 - 0.455 - -
82 GPT-5.2 (xhigh) OpenAI 30.4 - 99 $4.813 0.874 0.903 0.377 0.889 - - -
83 DeepSeek V4 Pro (Reasoning, High Effort) DeepSeek 30.1 58.7 - $0.544 - 0.905 0.352 - - - -
84 Qwen3.7 Max Alibaba 29.9 66 - $3.75 - 0.923 0.405 - 0.495 - -
85 MiniMax-M3 MiniMax 29.6 58.6 - $0.525 - 0.929 0.39 - 0.471 - -
86 Qwen3.8 27B (low) Alibaba 29.2 58.2 - $1.125 - 0.845 0.14 - 0.4 - -
87 Claude Opus 4.5 (Reasoning) Anthropic 29.1 - 91.3 $10 0.895 0.866 0.301 0.871 - - -
88 Claude Sonnet 5 (Non-reasoning, High Effort) Anthropic 28.9 66.4 - $4 - 0.8 0.19 - - - -
89 MiMo-V2-Pro Xiaomi 28.6 - - $0 - 0.87 0.304 - - - -
90 GPT-5.2 Codex (xhigh) OpenAI 28.5 - - $4.813 - 0.899 0.357 - - - -
91 Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) Anthropic 28.4 - - $4 - - 0.3 - 0.516 - -
92 Qwen3.6 Max Preview Alibaba 28.4 - - $2.925 - 0.888 0.308 - - - -
93 GPT-5.6 Sol (Non-reasoning) OpenAI 28.3 65.1 - $8 - 0.79 0.167 - - - -
94 Solar Pro 4 Upstage 28.2 52.7 - $0.525 - 0.891 0.292 - 0.446 - -
95 Nex-N2-Pro Nex AGI 28.2 59.1 - $1 - 0.892 0.337 - 0.433 - -
96 Gemini 3 Pro Preview (high) Google 28 - 95.7 $4.5 0.898 0.908 0.397 0.917 - - -
97 GPT-5.6 Terra (low) OpenAI 27.9 58.1 - $4.5 - 0.843 0.292 - 0.499 - -
98 GLM-5 (Reasoning) Z AI 27.9 - - $1.55 - 0.82 0.293 - - - -
99 GPT-5.4 (low) OpenAI 27.6 - - $5.625 - 0.871 0.308 - - - -
100 GLM-5.1 (Reasoning) Z AI 27.4 55.8 - $2 - 0.868 0.301 - 0.448 - -
101 JT-4.1 Flash 236B A21B China Mobile 27.3 52.4 - $0 - 0.845 0.178 - - - -
102 Grok Build 0.1 0616 SpaceXAI 27.2 51.5 - $1.25 - 0.895 0.383 - - - -
103 Quasar 438B (max, based on GLM-5.2) Multiverse Computing 27.1 61.2 - $0.9 - 0.732 0.187 - 0.481 - -
104 Qwen3.6 Plus Alibaba 27 54.5 - $1.125 - 0.882 0.278 - - - -
105 GPT-5.5 Instant (June 2026) OpenAI 26.8 39.4 - $11.25 - 0.823 0.199 - 0.525 - -
106 Agnes 2.5 Pro Alpha Sapiens AI 26.8 58.8 - $0.563 - 0.876 0.336 - 0.429 - -
107 GLM-5-Turbo Z AI 26.6 - - $0 - 0.847 0.278 - - - -
108 GPT-5.2 (medium) OpenAI 26.5 - 96.7 $4.813 0.859 0.864 0.267 0.894 - - -
109 MiMo-V2.5-Pro Xiaomi 26.4 60.2 - $0.544 - 0.866 0.357 - 0.506 - -
110 Claude Opus 4.6 (Non-reasoning, High Effort) Anthropic 26.4 - - $10 - 0.84 0.191 - - - -
111 Kimi K2.7 Code Kimi 26.3 60.8 - $1.712 - 0.896 0.35 - 0.478 - -
112 Gemini 3 Flash Preview (Reasoning) Google 26.3 - 97 $1.125 0.89 0.898 0.366 0.908 - - -
113 Inkling Small Thinking Machines 26.1 52.9 - $0.525 - 0.895 0.333 - 0.497 - -
114 GPT-5.6 Luna (medium) OpenAI 25.8 50.7 - $0.45 - 0.859 0.258 - 0.468 - -
115 Hy3 Tencent 25.8 58.8 - $0.241 - 0.897 0.335 - 0.486 - -
116 Qwen3.7 Plus Alibaba 25.8 55.9 - $0.7 - 0.9 0.356 - 0.461 - -
117 Grok 4.20 0309 v2 (Reasoning) SpaceXAI 25.7 - - $1.563 - 0.911 0.345 - - - -
118 Inkling (xhigh) Thinking Machines 25.5 52.1 - $1.762 - 0.872 0.319 - 0.47 - -
119 Grok 4.3 (high) SpaceXAI 25.4 42.2 - $1.563 - 0.901 0.372 - 0.483 - -
120 Grok 4.20 0309 (Reasoning) SpaceXAI 25.2 - - $3 - 0.885 0.324 - - - -
121 MiMo-V2-Omni-0327 Xiaomi 25.1 - - $0 - 0.855 0.226 - - - -
122 Ling 3.0 Flash InclusionAI 24.9 50.6 - $0.111 - 0.855 0.237 - 0.42 - -
123 GPT-5 Codex (high) OpenAI 24.9 - 98.7 $3.438 0.865 0.837 0.278 0.84 - - -
124 Grok 4.3 (medium) SpaceXAI 24.8 - - $1.563 - 0.89 0.3 - - - -
125 DeepSeek V4 Flash (Reasoning, High Effort) DeepSeek 24.8 52 - $0.168 - 0.867 0.303 - 0.402 - -
126 Claude Sonnet 5 (Adaptive Reasoning, Low Effort) Anthropic 24.7 - - $4 - - 0.219 - 0.501 - -
127 Solar Open2 250B Upstage 24.7 45 - $0 - 0.857 0.285 - 0.48 - -
128 GPT-5.1 (high) OpenAI 24.7 49.4 94 $3.438 0.87 0.873 0.285 0.868 - - -
129 Claude Sonnet 4.6 (Non-reasoning, High Effort) Anthropic 24.7 - - $6 - 0.799 0.133 - - - -
130 GPT-5.4 mini (xhigh) OpenAI 24.6 56.1 - $1.688 - 0.875 0.281 - 0.521 - -
131 DeepSeek V4 Flash (Reasoning, Max Effort) DeepSeek 24.6 56.2 - $0.168 - 0.894 0.348 - 0.453 - -
132 Grok 4.3 (low) SpaceXAI 24.3 - - $1.563 - 0.843 0.184 - - - -
133 GLM-5.1 (Non-reasoning) Z AI 24.2 - - $2.135 - 0.839 0.279 - - - -
134 MiMo-V2-Omni Xiaomi 23.9 - - $0 - 0.828 0.221 - - - -
135 Gemini 3.5 Flash (minimal) Google 23.8 - - $3.375 - 0.828 0.241 - - - -
136 GPT-5.1 Codex (high) OpenAI 23.7 - 95.7 $3.438 0.86 0.86 0.257 0.849 - - -
137 Claude Opus 4.5 (Non-reasoning) Anthropic 23.7 - 62.7 $10 0.889 0.81 0.132 0.738 - - -
138 Kimi K2.6 (Non-reasoning) Kimi 23.6 - - $1.712 - 0.788 0.196 - - - -
139 Kimi K2.5 (Reasoning) Kimi 23.5 46.8 - $1.137 - 0.879 0.307 - - - -
140 GLM 5V Turbo (Reasoning) Z AI 23.5 - - $0 - 0.809 0.171 - - - -
141 Nemotron 3 Ultra 550B A55B (Reasoning) NVIDIA 23.4 49.3 - $1.1 - 0.867 0.284 - 0.403 - -
142 Claude Sonnet 4.6 (Non-reasoning, Low Effort) Anthropic 23.3 - - $6 - 0.797 0.112 - - - -
143 GPT-5.5 (Non-reasoning) OpenAI 23.2 56.5 - $11.25 - 0.768 0.137 - - - -
144 MiniMax-M2.7 MiniMax 23.2 52.6 - $0.525 - 0.874 0.296 - 0.501 - -
145 GPT-5 (high) OpenAI 23 37.8 94.3 $3.438 0.871 0.854 0.285 0.846 - 0.994 0.95666666666667
146 GPT-5 (medium) OpenAI 22.9 - 91.7 $3.438 0.867 0.842 0.254 0.703 - 0.99133333333333 0.91666666666667
147 Qwen3.5 27B (Reasoning) Alibaba 22.9 - - $0.825 - 0.858 0.239 - - - -
148 Claude 4.1 Opus (Reasoning) Anthropic 22.8 - 80.3 $30 0.88 0.809 0.125 0.654 - - -
149 MiniMax-M2.5 MiniMax 22.8 - - $0.525 - 0.848 0.205 - - - -
150 Gemini 3.5 Flash-Lite Google 22.7 49.3 - $0.85 - 0.838 0.188 - 0.413 - -
151 A.X-K2 SK Telecom 22.7 38.8 - $0 - 0.857 0.296 - 0.41 - -
152 GPT-5.5 Instant (May 2026) OpenAI 22.7 - - $11.25 - 0.846 0.216 - - - -
153 Hy3-preview (Reasoning) Tencent 22.7 - - $0.1 - 0.867 0.278 - - - -
154 Grok 4 SpaceXAI 22.5 - 92.7 $6 0.866 0.877 0.267 0.819 - 0.99 0.94333333333333
155 MiMo-V2-Flash (Feb 2026) Xiaomi 22.4 - - $0 - 0.835 0.221 - - - -
156 GLM-5.2 (Non-reasoning) Z AI 22.4 46.5 - $2.15 - 0.686 0.098 - - - -
157 Qwen3.8 27B (Non-reasoning) Alibaba 22.4 44.6 - $1.125 - 0.818 0.121 - 0.362 - -
158 GPT-5.6 Terra (Non-reasoning) OpenAI 22.3 52.3 - $4.5 - 0.746 0.114 - - - -
159 MiMo-V2.5 Xiaomi 22.3 56.8 - $0.175 - 0.849 0.272 - 0.439 - -
160 Qwen3.6 35B A3B (Reasoning) Alibaba 22.3 41.9 - $0.844 - 0.841 0.222 - 0.366 - -
161 Gemini 3 Pro Preview (low) Google 22.3 - 86.7 $4.5 0.895 0.887 0.295 0.857 - - -
162 GLM-4.7 (Reasoning) Z AI 22.2 45.3 95 $1 0.856 0.859 0.274 0.894 - - -
163 Kimi K2 Thinking Kimi 22 - 94.7 $1.075 0.848 0.838 0.238 0.853 - - -
164 Qwen3.6 27B (Reasoning) Alibaba 21.9 53.7 - $1.35 - 0.842 0.231 - 0.428 - -
165 o3-pro OpenAI 21.9 - - $35 - 0.845 - - - - -
166 GPT-5.6 Luna (low) OpenAI 21.8 44.2 - $0.45 - 0.835 0.198 - 0.461 - -
167 G9v3-39A5B AI9Stars 21.8 33.1 - $0 - 0.805 0.175 - 0.368 - -
168 GLM-5 (Non-reasoning) Z AI 21.8 - - $1.55 - 0.666 0.076 - - - -
169 KAT Coder Pro V2 KwaiKAT 21.7 59.5 - $0.525 - 0.855 0.161 - - - -
170 DeepSeek V3.2 (Reasoning) DeepSeek 21.5 44.2 92 $0.315 0.862 0.84 0.246 0.862 - - -
171 Qwen3.5 397B A17B (Non-reasoning) Alibaba 21.4 - - $1.35 - 0.861 0.198 - - - -
172 Qwen3 Max Thinking Alibaba 21.3 - - $0 - 0.861 0.28 - - - -
173 GPT-5.4 nano (xhigh) OpenAI 21.2 56.1 - $0.463 - 0.817 0.283 - 0.472 - -
174 Claude 4.5 Sonnet (Reasoning) Anthropic 21.2 52.1 88 $6 0.875 0.834 0.178 0.714 0.457 - -
175 MiniMax-M2.1 MiniMax 20.9 - 82.7 $0.525 0.875 0.83 0.232 0.81 - - -
176 DeepSeek V4 Pro (Non-reasoning) DeepSeek 20.8 - - $0.544 - 0.717 0.082 - - - -
177 GPT-5 (low) OpenAI 20.8 - 83 $3.438 0.86 0.808 0.196 0.763 - 0.98733333333333 0.83
178 MiMo-V2-Flash (Reasoning) Xiaomi 20.8 - 96.3 $0.15 0.843 0.846 0.228 0.868 - - -
179 GPT-5 mini (medium) OpenAI 20.6 - 85 $0.688 0.828 0.803 0.159 0.692 - - -
180 Claude 4 Opus (Reasoning) Anthropic 20.6 - 73.3 $30 0.873 0.796 0.123 0.636 - 0.982 0.75666666666667
181 Qwen3.5 Omni Plus Alibaba 20.4 - - $1.5 - 0.826 0.149 - - - -
182 GPT-5.1 Codex mini (high) OpenAI 20.4 - 91.7 $0.688 0.82 0.813 0.185 0.836 - - -
183 Grok 4.1 Fast (Reasoning) SpaceXAI 20.4 - 89.3 $0 0.854 0.853 0.193 0.822 - - -
184 o3 OpenAI 20.2 - 88.3 $3.5 0.853 0.827 0.201 0.808 - 0.992 0.90333333333333
185 GPT-5.4 nano (medium) OpenAI 20 - - $0.463 - 0.761 0.159 - - - -
186 Qwen3.6 27B (Non-reasoning) Alibaba 19.8 46.6 - $1.35 - 0.829 0.151 - - - -
187 K-EXAONE 2.0 LG AI Research 19.7 40.6 - $0 - 0.829 0.186 - 0.42 - -
188 LongCat 2.0 LongCat 19.7 45.3 - $1.3 - 0.78 0.337 - 0.363 - -
189 GPT-5.4 mini (medium) OpenAI 19.7 - - $1.688 - 0.823 0.186 - - - -
190 Step 3.7 Flash StepFun 19.5 39.6 - $0.438 - 0.809 0.214 - 0.439 - -
191 Kimi K2.5 (Non-reasoning) Kimi 19.4 - - $1.2 - 0.789 0.132 - - - -
192 Qwen3.5 27B (Non-reasoning) Alibaba 19.4 - - $0.825 - 0.842 0.139 - - - -
193 Claude 4.5 Sonnet (Non-reasoning) Anthropic 19.3 - 37 $6 0.86 0.727 0.072 0.59 - - -
194 Qwen3.5 35B A3B (Reasoning) Alibaba 19.3 - - $0.688 - 0.845 0.21 - - - -
195 Qwen3.5 397B A17B (Reasoning) Alibaba 19.1 48.2 - $1.35 - 0.893 0.29 - 0.448 - -
196 DeepSeek V4 Flash (Non-reasoning) DeepSeek 18.9 - - $0.119 - 0.716 0.078 - - - -
197 Claude 4 Sonnet (Reasoning) Anthropic 18.9 37.6 74.3 $6 0.842 0.777 0.107 0.655 - 0.99066666666667 0.77333333333333
198 JT-35B-Flash China Mobile 18.7 - - $0 - 0.829 0.064 - - - -
199 Claude 4.1 Opus (Non-reasoning) Anthropic 18.6 - - $30 - - - - - - -
200 MiniMax-M2 MiniMax 18.6 - 78.3 $0.525 0.82 0.777 0.137 0.826 - - -
201 KAT-Coder-Pro V1 KwaiKAT 18.6 - 94.7 $0 0.813 0.764 0.336 0.747 - - -
202 GLM-4.6 (Reasoning) Z AI 18.5 45.8 86 $0.963 0.829 0.78 0.145 0.695 - - -
203 MiMo-V2.5-Pro (Non-reasoning) Xiaomi 18.3 - - $0.544 - 0.762 0.148 - - - -
204 GPT-5.4 (Non-reasoning) OpenAI 18.2 - - $5.625 - 0.748 0.113 - - - -
205 Muse Glimmer (high) Meta 18.1 49 - $0.637 - 0.835 0.22 - 0.449 - -
206 Gemini 3 Flash Preview (Non-reasoning) Google 17.9 - 55.7 $1.125 0.882 0.812 0.15 0.797 - - -
207 Grok 4 Fast (Reasoning) SpaceXAI 17.9 - 89.7 $0.275 0.85 0.847 0.191 0.832 - - -
208 Qwen3.5 122B A10B (Non-reasoning) Alibaba 17.7 43.3 - $1.1 - 0.827 0.159 - - - -
209 Claude 3.7 Sonnet (Reasoning) Anthropic 17.7 36.4 56.3 $0 0.837 0.772 0.097 0.473 - 0.94666666666667 0.48666666666667
210 Claude 4.5 Haiku (Reasoning) Anthropic 17.6 43.9 83.7 $2 0.76 0.672 0.104 0.615 0.422 - -
211 GPT-5 mini (high) OpenAI 17.4 15.6 90.7 $0.688 0.837 0.828 0.215 0.838 0.39 - -
212 GLM-4.7 (Non-reasoning) Z AI 17.4 - 48 $1 0.794 0.664 0.064 0.562 - - -
213 Ring-2.6-1T InclusionAI 17.3 42.8 - $0.85 - 0.857 0.216 - 0.45 - -
214 GPT-5.2 (Non-reasoning) OpenAI 17 - 51 $4.813 0.814 0.712 0.08 0.669 - - -
215 Step 3.5 Flash 2603 StepFun 17 - - $0.15 - 0.826 0.245 - - - -
216 Hy3-preview (Non-reasoning) Tencent 17 - - $0.1 - 0.732 0.07 - - - -
217 Ling-2.6-1T InclusionAI 17 - - $0.85 - 0.752 0.087 - - - -
218 Doubao Seed Code ByteDance Seed 16.9 - 79.3 $0 0.854 0.764 0.141 0.766 - - -
219 GPT-5.6 Luna (Non-reasoning) OpenAI 16.8 39.3 - $0.45 - 0.645 0.072 - - - -
220 Gemma 4 26B A4B (Reasoning) Google 16.7 39.3 - $0.179 - 0.792 0.193 - - - -
221 o4-mini (high) OpenAI 16.7 - 90.7 $1.925 0.832 0.784 0.165 0.859 - 0.98866666666667 0.94
222 Gemini 2.5 Pro Google 16.7 33.3 87.7 $3.438 0.862 0.844 0.225 0.801 0.463 0.96733333333333 0.88666666666667
223 Claude 4 Sonnet (Non-reasoning) Anthropic 16.6 - 38 $6 0.837 0.683 0.043 0.449 - 0.934 0.40666666666667
224 Claude 4 Opus (Non-reasoning) Anthropic 16.6 - 36.3 $30 0.86 0.701 0.062 0.542 - 0.94066666666667 0.56333333333333
225 DeepSeek V3.2 Exp (Reasoning) DeepSeek 16.6 - 87.7 $0.315 0.85 0.797 0.149 0.789 - - -
226 Step 3.5 Flash StepFun 16.6 - - $0.15 - 0.831 0.211 - - - -
227 Qwen3 Max Thinking (Preview) Alibaba 16.3 - 82.3 $2.4 0.824 0.776 0.127 0.535 - - -
228 Qwen3.5 122B A10B (Reasoning) Alibaba 16.2 45.7 - $1.1 - 0.857 0.252 - 0.397 - -
229 MiMo-V2-Flash (Non-reasoning) Xiaomi 16 49.8 67.7 $0 0.744 0.656 0.086 0.402 - - -
230 Gemini 3.1 Flash-Lite Google 16 34.7 - $0.563 - 0.822 0.172 - 0.434 - -
231 DeepSeek V3.2 (Non-reasoning) DeepSeek 16 - 59 $0.315 0.837 0.751 0.112 0.593 - - -
232 Qwen3 Max Alibaba 15.6 - 80.7 $2.4 0.841 0.764 0.119 0.767 - - -
233 Gemini 2.5 Flash Preview (Sep '25) (Reasoning) Google 15.5 - 78.3 $0 0.842 0.793 0.138 0.713 - - -
234 Gemma 4 31B (Reasoning) Google 15.4 43.4 - $0 - 0.857 0.236 - 0.455 - -
235 Claude 4.5 Haiku (Non-reasoning) Anthropic 15.4 - 39 $2 0.8 0.646 0.042 0.511 - - -
236 DeepSeek V3.1 Terminus (Reasoning) DeepSeek 15.4 43.5 89.7 $1.914 0.851 0.792 0.164 0.798 0.38 - -
237 Claude 3.7 Sonnet (Non-reasoning) Anthropic 15.3 - 21 $6 0.803 0.656 0.042 0.394 - 0.85 0.22333333333333
238 Kimi K2 0905 Kimi 15.3 - 57.3 $1.075 0.819 0.767 0.064 0.61 - - -
239 Qwen3.6 35B A3B (Non-reasoning) Alibaba 15.2 28.1 - $0.844 - 0.817 0.139 - - - -
240 o1 OpenAI 15.2 39.7 - $26.25 0.841 0.747 0.07 0.679 - 0.97 0.72333333333333
241 Qwen3.5 35B A3B (Non-reasoning) Alibaba 15.1 37 - $0.688 - 0.819 0.134 - - - -
242 Gemini 2.5 Pro Preview (Mar' 25) Google 15 46.7 - $0 0.858 0.836 0.18 0.778 - 0.98 0.87
243 Mistral Medium 3.5 Mistral 14.9 46.9 - $3 - 0.748 0.138 - 0.402 - -
244 GLM-4.7-Flash (Reasoning) Z AI 14.9 - - $0.153 - 0.581 0.076 - - - -
245 GLM-4.6 (Non-reasoning) Z AI 14.9 - 44.3 $0.981 0.784 0.632 0.055 0.561 - - -
246 Granite 4.2 30B IBM 14.8 29.9 - $0.282 - 0.644 0.112 - 0.378 - -
247 Grok 3 mini Reasoning (high) SpaceXAI 14.6 - 84.7 $0.35 0.828 0.791 0.11 0.696 - 0.992 0.93333333333333
248 Grok 4.20 0309 (Non-reasoning) SpaceXAI 14.6 - - $3 - 0.785 0.245 - - - -
249 Grok 4.3 (Non-reasoning) SpaceXAI 14.5 35.2 - $1.563 - 0.658 0.068 - 0.394 - -
250 Gemini 2.5 Pro Preview (May' 25) Google 14.5 - - $3.438 0.837 0.822 0.199 0.77 - 0.986 0.84333333333333
251 DeepSeek V3.2 Speciale DeepSeek 14.5 - 96.7 $0 0.863 0.871 0.287 0.896 - - -
252 K-EXAONE (Reasoning) LG AI Research 14.4 32.1 90.3 $0 0.838 0.783 0.139 0.768 - - -
253 MiniCPM5-2B OpenBMB 14.3 14.5 - $0 - 0.702 0.089 - 0.263 - -
254 ERNIE 5.0 Thinking Preview Baidu 14.3 - 85 $0 0.83 0.777 0.133 0.812 - - -
255 Gemma 4 12B (Reasoning) Google 14.2 31 - $0.15 - 0.753 0.157 - - - -
256 Nova 2.0 Pro Preview (medium) Amazon 14.2 34 89 $3.438 0.83 0.785 0.094 0.73 - - -
257 Grok 4.20 0309 v2 (Non-reasoning) SpaceXAI 14.2 - - $1.563 - 0.776 0.279 - - - -
258 Grok Code Fast 1 SpaceXAI 14.1 - 43.3 $0 0.793 0.727 0.08 0.657 - - -
259 Gemma 4 31B (Non-reasoning) Google 13.9 33.2 - $0.205 - 0.763 0.118 - - - -
260 Command A+ Cohere 13.9 27.8 - $0 - 0.761 0.12 - 0.385 - -
261 DeepSeek V3.2 Exp (Non-reasoning) DeepSeek 13.9 - 57.7 $0.315 0.836 0.738 0.09 0.554 - - -
262 DeepSeek V3.1 Terminus (Non-reasoning) DeepSeek 13.9 - 53.7 $0.453 0.836 0.751 0.087 0.529 - - -
263 Apriel-v1.5-15B-Thinker ServiceNow 13.8 - 87.5 $0 0.773 0.713 0.121 0.728 - - -
264 Qwen3.5 9B (Reasoning) Alibaba 13.7 28.7 - $0.151 - 0.806 0.149 - - - -
265 DeepSeek V3.1 (Non-reasoning) DeepSeek 13.7 - 49.7 $0.848 0.833 0.735 0.067 0.577 - - -
266 Nova 2.0 Omni (medium) Amazon 13.6 - 89.7 $0.85 0.809 0.76 0.07 0.66 - - -
267 Nemotron 3.5 Lightning NVIDIA 13.6 26.8 - $0.095 - 0.743 0.106 - 0.321 - -
268 Nemotron 3 Super 120B A12B (Reasoning) NVIDIA 13.6 37.7 - $0.307 - 0.8 0.208 - 0.362 - -
269 DeepSeek V3.1 (Reasoning) DeepSeek 13.5 - 89.7 $0.865 0.851 0.779 0.143 0.784 - - -
270 Nova 2.0 Lite (high) Amazon 13.4 23 94.3 $0.85 0.818 0.811 0.116 0.711 - - -
271 Apriel-v1.6-15B-Thinker ServiceNow 13.4 - 88 $0 0.79 0.733 0.108 0.807 - - -
272 Qwen3 VL 235B A22B (Reasoning) Alibaba 13.4 - 88.3 $1.3 0.836 0.772 0.119 0.646 - - -
273 Qwen3.5 9B (Non-reasoning) Alibaba 13.3 23.5 - $0.19 - 0.786 0.094 - - - -
274 GPT-5.1 (Non-reasoning) OpenAI 13.3 - 38 $3.438 0.801 0.643 0.053 0.494 - - -
275 EXAONE 4.5 33B LG AI Research 13.2 23.6 - $0 - 0.794 0.129 - - - -
276 Gemma 4 26B A4B (Non-reasoning) Google 13.1 - - $0.198 - 0.714 0.115 - - - -
277 Qwen3.5 4B (Reasoning) Alibaba 13.1 22.6 - $0.06 - 0.771 0.099 - - - -
278 Gemini 2.5 Flash (Reasoning) Google 13.1 - 73.3 $0.85 0.832 0.79 0.121 0.695 - 0.98133333333333 0.82333333333333
279 DeepSeek R1 0528 (May '25) DeepSeek 13.1 - 76 $1.763 0.849 0.813 0.158 0.77 - 0.98266666666667 0.89333333333333
280 GPT-5 nano (high) OpenAI 13 - 83.7 $0.138 0.78 0.676 0.095 0.789 - - -
281 Nova 2.0 Pro Preview (low) Amazon 12.8 25.9 63.3 $3.438 0.822 0.751 0.052 0.638 - - -
282 North Mini Code Cohere 12.8 36.5 - $0 - 0.757 0.111 - 0.388 - -
283 GLM-4.5 (Reasoning) Z AI 12.8 - 73.7 $0 0.835 0.782 0.13 0.738 - 0.97866666666667 0.87333333333333
284 GPT-4.1 OpenAI 12.7 - 34.7 $3.5 0.806 0.666 0.042 0.457 - 0.91266666666667 0.43666666666667
285 Kimi K2 Kimi 12.7 - 57 $1.002 0.824 0.766 0.074 0.556 - 0.97133333333333 0.69333333333333
286 Qwen3 235B A22B 2507 (Reasoning) Alibaba 12.7 22.1 91 $0.747 0.843 0.79 0.159 0.788 0.414 0.984 0.94
287 Qwen3 Max (Preview) Alibaba 12.6 - 75 $2.4 0.838 0.764 0.101 0.651 - - -
288 Nova 2.0 Lite (medium) Amazon 12.5 - 88.7 $0.85 0.813 0.768 0.09 0.663 - - -
289 Qwen3.5 Omni Flash Alibaba 12.5 - - $0.275 - 0.742 0.076 - - - -
290 o3-mini OpenAI 12.5 - - $1.925 0.791 0.748 0.079 0.717 - 0.97333333333333 0.77
291 GPT-5 nano (medium) OpenAI 12.5 - 78.3 $0.138 0.772 0.67 0.087 0.763 - - -
292 Granite 4.2 8B IBM 12.4 22.4 - $0.107 - 0.631 0.097 - 0.315 - -
293 o1-pro OpenAI 12.4 - - $262.5 - - - - - - -
294 Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) Google 12.4 - 56.7 $0 0.836 0.766 0.087 0.625 - - -
295 gpt-oss-120b (high) OpenAI 12.3 30.4 93.4 $0.261 0.808 0.782 0.196 0.878 0.34 - -
296 JT-MINI China Mobile 12.2 - - $0 - 0.676 0.064 - - - -
297 Grok 3 SpaceXAI 12.1 - 58 $8 0.799 0.693 0.041 0.425 - 0.87 0.33
298 Seed-OSS-36B-Instruct ByteDance Seed 12.1 - 84.7 $0.3 0.815 0.726 0.099 0.765 - - -
299 Qwen3 235B A22B 2507 Instruct Alibaba 12 - 71.7 $0.403 0.828 0.753 0.111 0.524 - 0.98 0.71666666666667
300 Ling 3.0 Tiny InclusionAI 11.9 26.5 - $0 - 0.734 0.093 - 0.242 - -
301 Qwen3 Coder 480B A35B Instruct Alibaba 11.9 - 39.3 $3 0.788 0.618 0.045 0.585 - 0.942 0.47666666666667
302 Qwen3 VL 32B (Reasoning) Alibaba 11.9 - 84.7 $0.28 0.818 0.733 0.101 0.738 - - -
303 Magistral Medium 1.2 Mistral 11.8 21.3 82 $0 0.815 0.739 0.103 0.75 - - -
304 Nova 2.0 Lite (low) Amazon 11.8 - 46.7 $0.85 0.788 0.698 0.04 0.469 - - -
305 Sonar Reasoning Pro Perplexity 11.8 - - $0 - - - - - 0.95733333333333 0.79
306 Nemotron Cascade 2 30B A3B NVIDIA 11.7 25.3 - $0 - 0.758 0.12 - - - -
307 HyperNova 60B 2605 (high, based on gpt-oss-120b) Multiverse Computing 11.7 23.2 - $0.065 - 0.733 0.166 - - - -
308 GPT-5.4 nano (Non-Reasoning) OpenAI 11.7 - - $0.463 - 0.558 0.041 - - - -
309 Gemini 2.5 Flash Preview (Reasoning) Google 11.7 - - $0 0.8 0.698 0.121 0.505 - 0.98066666666667 0.84333333333333
310 MiniMax M1 80k MiniMax 11.7 - 61 $0.963 0.816 0.697 0.089 0.711 - 0.98 0.84666666666667
311 Mistral Small 4 (Reasoning) Mistral 11.5 26.6 - $0.262 - 0.769 0.099 - 0.388 - -
312 Mercury 2 Inception 11.5 31.1 - $0.375 - 0.77 0.171 - 0.377 - -
313 K2 Think V2 MBZUAI Institute of Foundation Models 11.5 21 - $0 - 0.713 0.101 - - - -
314 LongCat Flash Lite LongCat 11.5 - - $0 - 0.636 0.058 - - - -
315 HyperCLOVA X SEED Think (32B) Naver 11.4 - 59 $0 0.785 0.615 0.055 0.629 - - -
316 o1-preview OpenAI 11.4 34 79.7 $28.875 0.848 0.765 - - - 0.924 -
317 GPT-5 (minimal) OpenAI 11.4 - 31.7 $3.438 0.806 0.673 0.06 0.558 - 0.86133333333333 0.36666666666667
318 DeepSeek R1 (Jan '25) DeepSeek 11.4 24.6 68 $2.5 0.844 0.708 0.085 0.617 0.383 0.966 0.68333333333333
319 Grok 4.1 Fast (Non-reasoning) SpaceXAI 11.3 - 34.3 $0 0.743 0.637 0.051 0.399 - - -
320 K-EXAONE (Non-reasoning) LG AI Research 11.2 - 44 $0 0.81 0.695 0.057 - - - -
321 Qwen3 Next 80B A3B (Reasoning) Alibaba 11.2 17.4 84.3 $0.412 0.824 0.759 0.126 0.784 - - -
322 GLM-4.6V (Reasoning) Z AI 11.2 - 85.3 $0.45 0.799 0.719 0.096 0.16 - - -
323 Nova 2.0 Omni (low) Amazon 11.1 - 56 $0.85 0.798 0.699 - 0.592 - - -
324 GPT-5.4 mini (Non-Reasoning) OpenAI 11.1 - - $1.688 - 0.606 0.059 - - - -
325 Grok 4 Fast (Non-reasoning) SpaceXAI 11.1 - 41.3 $0.275 0.73 0.606 0.045 0.401 - - -
326 GLM-4.5-Air Z AI 11.1 - 80.7 $0.372 0.815 0.733 0.07 0.684 - 0.96533333333333 0.67333333333333
327 Mi:dm K 2.5 Pro Korea Telecom 11 - 76.7 $0 0.809 0.701 0.081 0.656 - - -
328 o3-mini (high) OpenAI 11 16.3 - $1.925 0.802 0.773 0.12 0.734 0.428 0.98466666666667 0.86
329 Trinity Large Thinking Arcee AI 10.9 25.8 - $0.412 - 0.752 0.158 - 0.406 - -
330 Ring-1T InclusionAI 10.9 - 89.3 $0 0.806 0.774 0.111 0.643 - - -
331 G9v3-3B AI9Stars 10.8 9.9 - $0 - 0.438 0.045 - - - -
332 Qwen3.5 4B (Non-reasoning) Alibaba 10.8 20.3 - $0.06 - 0.712 0.08 - - - -
333 INTELLECT-3 Prime Intellect 10.6 - 88 $0 0.822 0.761 0.131 0.777 - - -
334 GLM-4.7-Flash (Non-reasoning) Z AI 10.6 - - $0.153 - 0.452 0.05 - - - -
335 Solar Open 100B (Reasoning) Upstage 10.4 - - $0 - 0.657 0.104 - - - -
336 GPT-5 (ChatGPT) OpenAI 10.4 - 48.3 $0 0.82 0.686 0.066 0.543 - - -
337 Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) Google 10.4 - 68.7 $0.175 0.808 0.709 0.07 0.688 - - -
338 Grok 3 Reasoning Beta SpaceXAI 10.4 - - $0 - - - - - - -
339 Nemotron 3 Nano Omni 30B A3B Reasoning NVIDIA 10.3 13.8 - $0.158 - 0.469 0.048 - - - -
340 gpt-oss-120b (low) OpenAI 10.2 21.2 66.7 $0.249 0.775 0.672 0.059 0.707 - - -
341 GPT-4.1 mini OpenAI 10.2 20.2 46.3 $0.7 0.781 0.664 0.05 0.483 - 0.92533333333333 0.43
342 Qwen3 Coder Next Alibaba 10.1 36.2 - $0.563 - 0.737 0.101 - 0.362 - -
343 gpt-oss-20b (low) OpenAI 10 - 62.3 $0.103 0.718 0.611 0.053 0.652 - - -
344 Nova 2.0 Pro Preview (Non-reasoning) Amazon 10 20.9 30.7 $3.438 0.772 0.636 0.039 0.473 - - -
345 MiniMax M1 40k MiniMax 10 - 13.7 $0 0.808 0.682 0.078 0.657 - 0.972 0.81333333333333
346 K2-V2 (high) MBZUAI Institute of Foundation Models 9.9 - 78.3 $0 0.786 0.681 0.105 0.694 - - -
347 GPT-5 mini (minimal) OpenAI 9.9 - 46.7 $0.688 0.775 0.687 0.051 0.545 - - -
348 Gemini 2.5 Flash (Non-reasoning) Google 9.9 - 60.3 $0.85 0.809 0.683 0.047 0.495 - 0.932 0.5
349 Mistral Medium 3.1 Mistral 9.9 20.5 38.3 $0.8 0.683 0.588 0.047 0.406 0.324 - -
350 Qwen3 VL 235B A22B Instruct Alibaba 9.9 - 70.7 $0.7 0.823 0.712 0.066 0.594 - - -
351 o1-mini OpenAI 9.8 - - $0 0.742 0.603 0.036 0.576 - 0.944 0.60333333333333
352 Qwen3 30B A3B 2507 (Reasoning) Alibaba 9.8 12.1 56.3 $0.75 0.805 0.707 0.103 0.707 0.33 0.976 0.90666666666667
353 Mistral Large 3 Mistral 9.7 20.1 38 $0.75 0.807 0.68 0.042 0.465 0.366 - -
354 DeepSeek V3 0324 DeepSeek 9.7 21.2 41 $0.927 0.819 0.655 0.047 0.405 0.39 0.942 0.52
355 Ling 2.6 Flash InclusionAI 9.7 25.3 - $0 - 0.593 0.063 - - - -
356 Qwen3 Next 80B A3B Instruct Alibaba 9.6 - 66.3 $0.412 0.819 0.738 0.076 0.684 - - -
357 GPT-4.5 (Preview) OpenAI 9.6 - - $0 - - - - - - -
358 Tri-21B-think Preview Trillion Labs 9.6 - - $0 - 0.538 0.058 - - - -
359 Qwen3 Coder 30B A3B Instruct Alibaba 9.6 - 29 $0.9 0.706 0.516 0.038 0.403 - 0.89333333333333 0.29666666666667
360 DiffusionGemma 26B A4B Google 9.5 19.7 - $0 - 0.669 0.108 - - - -
361 QwQ 32B Alibaba 9.5 - 29 $0.745 0.764 0.593 0.073 0.631 - 0.95733333333333 0.78
362 Qwen3 VL 30B A3B (Reasoning) Alibaba 9.5 - 82.3 $0.75 0.807 0.72 0.089 0.697 - - -
363 Qwen3 235B A22B (Reasoning) Alibaba 9.5 - 82 $2.625 0.828 0.7 0.11 0.622 - 0.93 0.84
364 Gemma 4 12B (Non-reasoning) Google 9.4 - - $0.15 - 0.661 0.063 - - - -
365 Devstral 2 Mistral 9.4 31.3 36.7 $0 0.762 0.594 0.036 0.448 0.328 - -
366 Gemini 2.0 Flash Thinking Experimental (Jan '25) Google 9.4 24.1 - $0 0.798 0.701 0.064 0.321 - 0.944 0.5
367 Llama 4 Maverick Meta 9.3 16.3 19.3 $0.422 0.809 0.671 0.049 0.397 0.317 0.88866666666667 0.39
368 Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) Google 9.3 - 46.7 $0.175 0.796 0.651 0.051 0.641 - - -
369 Nova Premier Amazon 9.2 - 17.3 $5 0.733 0.569 0.042 0.317 - 0.83933333333333 0.17
370 Motif-2-12.7B-Reasoning Motif Technologies 9.2 - 80.3 $0 0.796 0.695 0.088 0.651 - - -
371 Ling-1T InclusionAI 9.2 - 71.3 $0 0.822 0.719 0.073 0.677 - - -
372 Granite 4.2 3B IBM 9.1 17.5 - $0.052 - 0.559 0.066 - 0.253 - -
373 Magistral Medium 1 Mistral 9.1 - 40.3 $0 0.753 0.679 0.098 0.527 - 0.91733333333333 0.7
374 Solar Pro 2 (Preview) (Reasoning) Upstage 9.1 - - $0 0.768 0.578 0.061 0.462 - 0.9 0.66333333333333
375 gpt-oss-20b (high) OpenAI 9 20.7 89.3 $0.092 0.748 0.688 0.11 0.777 0.389 - -
376 Mistral Small 4 (Non-reasoning) Mistral 9 - - $0.262 - 0.571 0.038 - - - -
377 Llama Nemotron Super 49B v1.5 (Reasoning) NVIDIA 9 - 76.7 $0.4 0.814 0.748 0.073 0.737 - 0.98333333333333 0.86
378 K2-V2 (medium) MBZUAI Institute of Foundation Models 9 - 64.7 $0 0.761 0.598 0.044 0.541 - - -
379 Tri-21B-Think Trillion Labs 9 - - $0 - 0.601 0.059 - - - -
380 GPT-4o (March 2025, chatgpt-4o-latest) OpenAI 9 - 25.7 $0 0.803 0.655 0.04 0.425 - 0.89266666666667 0.32666666666667
381 Devstral Medium Mistral 9 - 4.7 $0 0.708 0.492 0.038 0.337 - 0.70733333333333 0.066666666666667
382 Mistral Medium 3 Mistral 9 - 30.3 $0.8 0.76 0.578 0.041 0.4 - 0.90666666666667 0.44
383 Gemma 4 E4B (Reasoning) Google 8.9 9.4 - $0.04 - 0.576 0.038 - - - -
384 NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) NVIDIA 8.9 14.4 91 $0.088 0.794 0.757 0.114 0.741 0.306 - -
385 Gemini 2.0 Flash (Feb '25) Google 8.9 - 21.7 $0 0.779 0.623 0.043 0.334 - 0.93 0.33
386 Claude 3.5 Haiku Anthropic 8.9 15.9 - $0 0.634 0.408 0.036 0.314 - 0.72066666666667 0.033333333333333
387 Llama 3.3 Nemotron Super 49B v1 (Reasoning) NVIDIA 8.9 - 54.7 $0 0.785 0.643 0.056 0.277 - 0.95866666666667 0.58333333333333
388 Sarvam 105B (high) Sarvam 8.8 - - $0.074 - 0.738 0.11 - - - -
389 MiniCPM5-1B (Reasoning) OpenBMB 8.8 - - $0 - 0.278 0.065 - - - -
390 Qwen3 4B 2507 (Reasoning) Alibaba 8.8 - 82.7 $0 0.743 0.667 0.062 0.641 - - -
391 Nova 2.0 Lite (Non-reasoning) Amazon 8.7 - 33.7 $0.85 0.743 0.603 0.029 0.346 - - -
392 MiniCPM5-1B (Non-reasoning) OpenBMB 8.7 - - $0 - 0.269 0.045 - - - -
393 Gemini 2.0 Pro Experimental (Feb '25) Google 8.7 25.5 - $0 0.805 0.622 0.062 0.347 - 0.92266666666667 0.36
394 Gemini 2.5 Flash Preview (Non-reasoning) Google 8.7 - - $0 0.783 0.594 0.038 0.406 - 0.926 0.43333333333333
395 Claude 3 Opus Anthropic 8.7 19.5 - $30 0.696 0.489 0.028 0.279 - 0.64066666666667 0.033333333333333
396 Devstral Small (May '25) Mistral 8.7 - - $0 0.632 0.434 0.04 0.258 - 0.684 0.066666666666667
397 Sonar Reasoning Perplexity 8.7 - - $0 - 0.623 - - - 0.92133333333333 0.77
398 Magistral Small 1.2 Mistral 8.6 14.7 80.3 $0.75 0.768 0.663 0.064 0.723 - - -
399 Gemini 2.5 Flash-Lite (Reasoning) Google 8.5 - 53.3 $0.175 0.759 0.625 0.068 0.593 - 0.96866666666667 0.70333333333333
400 DeepSeek V3 (Dec '24) DeepSeek 8.5 23 26 $0.463 0.752 0.557 0.029 0.359 0.358 0.88666666666667 0.25333333333333
401 Devstral Small 2 Mistral 8.4 29.3 34.3 $0 0.678 0.532 0.035 0.348 0.324 - -
402 LFM2.5-2.6B Liquid AI 8.4 7.7 - $0 - 0.558 0.062 - 0.144 - -
403 Nanbeige4.1-3B Nanbeige 8.4 9.6 - $0 - 0.849 0.109 - - - -
404 GPT-4o (Nov '24) OpenAI 8.4 - 6 $4.375 0.748 0.543 0.024 0.309 - 0.75933333333333 0.15
405 DeepSeek R1 Distill Qwen 32B DeepSeek 8.4 - 63 $0 0.739 0.615 0.046 0.27 - 0.94066666666667 0.68666666666667
406 GLM-4.6V (Non-reasoning) Z AI 8.4 - 26.3 $0.45 0.752 0.566 0.037 0.411 - - -
407 Qwen3 VL 32B Instruct Alibaba 8.4 - 68.3 $0.28 0.791 0.671 0.068 0.514 - - -
408 Qwen3 235B A22B (Non-reasoning) Alibaba 8.3 - 23.7 $1.225 0.762 0.613 0.042 0.343 - 0.902 0.32666666666667
409 Nova 2.0 Omni (Non-reasoning) Amazon 8.2 - 37 $0.85 0.719 0.555 0.038 0.305 - - -
410 EXAONE 4.0 32B (Reasoning) LG AI Research 8.2 - 80 $0 0.818 0.739 0.114 0.747 - 0.97666666666667 0.84333333333333
411 Gemini 2.0 Flash (experimental) Google 8.2 - - $0 0.782 0.636 0.041 0.21 - 0.91066666666667 0.3
412 Magistral Small 1 Mistral 8.2 - 41.3 $0 0.746 0.641 0.076 0.514 - 0.96266666666667 0.71333333333333
413 Qwen3 VL 8B (Reasoning) Alibaba 8.2 - 30.7 $0.66 0.749 0.579 0.038 0.353 - - -
414 DeepSeek R1 0528 Qwen3 8B DeepSeek 8.1 - 63.7 $0 0.739 0.612 0.059 0.513 - 0.932 0.65
415 Qwen2.5 Max Alibaba 8 - - $0 0.762 0.587 0.038 0.359 - 0.83466666666667 0.23333333333333
416 Hermes 4 - Llama-3.1 70B (Reasoning) Nous Research 7.9 - 68.7 $0 0.811 0.699 0.088 0.653 - - -
417 Gemini 1.5 Pro (Sep '24) Google 7.9 23.6 - $0 0.75 0.589 0.046 0.316 - 0.876 0.23
418 Claude 3.5 Sonnet (Oct '24) Anthropic 7.9 30.2 - $6 0.772 0.599 0.037 0.381 - 0.77133333333333 0.15666666666667
419 DeepSeek R1 Distill Llama 70B DeepSeek 7.9 - 53.7 $0.8 0.795 0.402 0.051 0.266 - 0.93466666666667 0.67
420 Solar Pro 2 (Preview) (Non-reasoning) Upstage 7.9 - - $0 0.725 0.544 0.037 0.385 - 0.87066666666667 0.29666666666667
421 Qwen3 VL 30B A3B Instruct Alibaba 7.9 - 72.3 $0.35 0.764 0.695 0.063 0.476 - - -
422 Gemma 4 E2B (Reasoning) Google 7.8 7.2 - $0 - 0.433 0.048 - - - -
423 Falcon-H1R-7B TII UAE 7.8 - 80 $0 0.725 0.661 0.11 0.724 - - -
424 Solar Pro 3 Upstage 7.8 16.2 - $0.262 - 0.724 0.103 - 0.255 - -
425 Qwen3 Omni 30B A3B (Reasoning) Alibaba 7.8 - 74 $0.43 0.792 0.726 0.075 0.679 - - -
426 GPT-4.1 nano OpenAI 7.8 11.1 24 $0.175 0.657 0.512 0.038 0.326 - 0.848 0.23666666666667
427 DeepSeek R1 Distill Qwen 14B DeepSeek 7.8 - 55.7 $0 0.74 0.484 0.041 0.376 - 0.94866666666667 0.66666666666667
428 Ling-flash-2.0 InclusionAI 7.8 - 65.3 $0.247 0.777 0.657 0.062 0.589 - - -
429 Llama 3.3 Instruct 70B Meta 7.7 11.9 7.7 $0.671 0.713 0.498 0.036 0.288 - 0.77266666666667 0.3
430 Step3 VL 10B StepFun 7.7 - - $0 - 0.69 0.108 - - - -
431 GPT-4o (Aug '24) OpenAI 7.7 - - $4.375 - 0.521 0.023 0.317 - 0.79466666666667 0.11666666666667
432 Sonar Perplexity 7.7 - - $0 0.689 0.471 0.049 0.295 - 0.81666666666667 0.48666666666667
433 Qwen2.5 Instruct 72B Alibaba 7.7 - 14 $0.48 0.72 0.491 0.036 0.276 - 0.858 0.16
434 Mistral Large 2 (Nov '24) Mistral 7.6 - 14 $0 0.697 0.486 0.033 0.293 - 0.736 0.11
435 Devstral Small (Jul '25) Mistral 7.6 - 29.3 $0 0.622 0.414 0.038 0.254 - 0.63466666666667 0.0033333333333333
436 Sonar Pro Perplexity 7.6 - - $0 0.755 0.578 0.066 0.275 - 0.74466666666667 0.29
437 GLM-4.5V (Reasoning) Z AI 7.6 - 73 $0.9 0.788 0.684 0.063 0.604 - - -
438 QwQ 32B-Preview Alibaba 7.6 - - $0 0.648 0.557 0.039 0.337 - 0.91 0.45333333333333
439 Qwen3 30B A3B (Reasoning) Alibaba 7.6 - 72.3 $0.75 0.777 0.616 0.062 0.506 - 0.95933333333333 0.75333333333333
440 Gemma 4 E4B (Non-reasoning) Google 7.5 - - $0.04 - 0.549 0.048 - - - -
441 Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) NVIDIA 7.5 - 63.7 $0 0.825 0.728 0.074 0.641 - 0.952 0.74666666666667
442 NVIDIA Nemotron Nano 12B v2 VL (Reasoning) NVIDIA 7.5 - 75 $0.3 0.759 0.572 0.055 0.694 - - -
443 Hermes 4 - Llama-3.1 405B (Reasoning) Nous Research 7.5 - 69.7 $1.5 0.829 0.727 0.109 0.686 - - -
444 ERNIE 4.5 300B A47B Baidu 7.5 - 41.3 $0.485 0.776 0.811 0.033 0.467 - 0.93066666666667 0.49333333333333
445 Solar Pro 2 (Reasoning) Upstage 7.5 - 61.3 $0 0.805 0.687 0.074 0.616 - 0.96666666666667 0.69
446 Qwen3 30B A3B 2507 Instruct Alibaba 7.5 - 66.3 $0.35 0.777 0.659 0.069 0.515 - 0.97533333333333 0.72666666666667
447 NVIDIA Nemotron Nano 9B V2 (Reasoning) NVIDIA 7.4 - 69.7 $0.07 0.742 0.57 0.049 0.724 - - -
448 Llama Nemotron Super 49B v1.5 (Non-reasoning) NVIDIA 7.4 - 8 $0.4 0.692 0.481 0.043 0.29 - 0.77 0.13666666666667
449 NVIDIA Nemotron 3 Nano 4B NVIDIA 7.4 8 - $0 - 0.513 0.049 - - - -
450 Granite 4.1 30B IBM 7.4 10.4 - $0 - 0.481 0.041 - - - -
451 Hermes 4 - Llama-3.1 405B (Non-reasoning) Nous Research 7.4 - 15.3 $1.5 0.729 0.536 0.042 0.546 - - -
452 Gemini 2.0 Flash-Lite (Feb '25) Google 7.4 - - $0 0.724 0.535 0.034 0.185 - 0.87266666666667 0.27666666666667
453 Mistral Small 3.1 Mistral 7.4 26.3 3.7 $0.15 0.659 0.454 0.043 0.212 0.278 0.70666666666667 0.093333333333333
454 Llama 3.1 Instruct 405B Meta 7.3 - 3 $0 0.732 0.515 0.04 0.305 - 0.70333333333333 0.21333333333333
455 Kimi Linear 48B A3B Instruct Kimi 7.3 - 36.3 $0 0.585 0.412 0.025 0.378 - - -
456 K2-V2 (low) MBZUAI Institute of Foundation Models 7.3 - 35.3 $0 0.713 0.541 0.036 0.393 - - -
457 GPT-4o (May '24) OpenAI 7.3 24.2 - $7.5 0.74 0.526 0.018 0.334 - 0.79133333333333 0.11
458 Gemini 2.0 Flash-Lite (Preview) Google 7.3 - - $0 - 0.542 0.041 0.179 - 0.87333333333333 0.30333333333333
459 Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) NVIDIA 7.3 - 7.7 $0 0.698 0.517 0.038 0.28 - 0.77533333333333 0.19333333333333
460 Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) NVIDIA 7.3 - 50 $0 0.556 0.408 0.052 0.493 - 0.94666666666667 0.70666666666667
461 Qwen3 32B (Non-reasoning) Alibaba 7.3 - 19.7 $0.28 0.727 0.535 0.041 0.288 - 0.86866666666667 0.30333333333333
462 Qwen3 VL 8B Instruct Alibaba 7.3 - 27.3 $0.31 0.686 0.427 0.027 0.332 - - -
463 LFM2.5-8B-A1B Liquid AI 7.2 - - $0 - 0.513 0.069 - - - -
464 Ring-flash-2.0 InclusionAI 7.2 - 83.7 $0.247 0.793 0.725 0.096 0.628 - - -
465 GPT-4o (ChatGPT) OpenAI 7.2 - - $0 0.773 0.511 0.027 - - 0.79733333333333 0.10333333333333
466 Claude 3.5 Sonnet (June '24) Anthropic 7.2 26 - $6 0.751 0.56 0.032 - - 0.69533333333333 0.096666666666667
467 Llama 3.1 Tulu3 405B Allen Institute for AI 7.2 - - $0 0.716 0.516 0.033 0.291 - 0.778 0.13333333333333
468 Qwen3 32B (Reasoning) Alibaba 7.2 15.3 73 $0.28 0.798 0.668 0.074 0.546 0.36 0.96066666666667 0.80666666666667
469 Qwen3 4B (Reasoning) Alibaba 7.2 - 22.3 $0 0.696 0.522 0.044 0.465 - 0.93333333333333 0.65666666666667
470 Olmo 3.1 32B Think Allen Institute for AI 7.1 - 77.3 $0 0.763 0.591 0.063 0.695 - - -
471 GPT-5 nano (minimal) OpenAI 7.1 - 27.3 $0.138 0.556 0.428 0.04 0.47 - - -
472 Gemini 1.5 Flash (Sep '24) Google 7.1 - - $0 0.68 0.463 0.032 0.273 - 0.82733333333333 0.18
473 Pixtral Large Mistral 7.1 - 2.3 $0 0.701 0.505 0.028 0.261 - 0.714 0.07
474 Grok 2 (Dec '24) SpaceXAI 7.1 - - $0 0.709 0.51 0.031 0.267 - 0.778 0.13333333333333
475 Command A Cohere 7 - 13 $4.375 0.712 0.527 0.04 0.287 - 0.81866666666667 0.096666666666667
476 GPT-4 Turbo OpenAI 7 21.5 - $15 0.694 - 0.031 0.291 - 0.73666666666667 0.15
477 Mistral Small 3.2 Mistral 7 12.5 27 $0.15 0.681 0.505 0.043 0.275 0.286 0.88266666666667 0.32333333333333
478 Nova Pro Amazon 7 - 7 $1.4 0.691 0.499 0.032 0.233 - 0.786 0.10666666666667
479 Solar Pro 2 (Non-reasoning) Upstage 7 - 30 $0 0.75 0.561 0.037 0.424 - 0.88866666666667 0.40666666666667
480 Qwen3 VL 4B (Reasoning) Alibaba 7 - 25.7 $0 0.7 0.494 0.046 0.32 - - -
481 Llama 3.1 Nemotron Instruct 70B NVIDIA 6.9 - 11 $1.2 0.69 0.465 0.042 0.169 - 0.73266666666667 0.24666666666667
482 Qwen3.5 2B (Reasoning) Alibaba 6.9 2.9 - $0 - 0.456 0.026 - - - -
483 Llama 3.1 Instruct 8B Meta 6.9 5.4 4.3 $0.028 0.476 0.259 0.053 0.116 - 0.51933333333333 0.076666666666667
484 Grok Beta SpaceXAI 6.9 - - $0 0.703 0.471 0.044 0.241 - 0.73666666666667 0.10333333333333
485 Qwen2.5 Instruct 32B Alibaba 6.9 - - $0 0.697 0.466 0.04 0.248 - 0.80533333333333 0.11
486 NVIDIA Nemotron Nano 9B V2 (Non-reasoning) NVIDIA 6.8 - 62.3 $0.086 0.739 0.557 0.046 0.701 - - -
487 NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) NVIDIA 6.8 - 13.3 $0.088 0.579 0.399 0.046 0.36 - - -
488 Mistral Large 2 (Jul '24) Mistral 6.8 - 0 $3 0.683 0.472 0.029 0.267 - 0.714 0.093333333333333
489 Hermes 4 - Llama-3.1 70B (Non-reasoning) Nous Research 6.7 - 11.3 $0 0.664 0.491 0.036 0.269 - - -
490 GPT-4o mini OpenAI 6.7 11.4 14.7 $0.262 0.648 0.426 0.042 0.234 - 0.78866666666667 0.11666666666667
491 GPT-4 OpenAI 6.7 13.1 - $37.5 0.562 0.349 - - - 0.568 -
492 Gemini 2.5 Flash-Lite (Non-reasoning) Google 6.7 - 35.3 $0.175 0.724 0.474 0.037 0.4 - 0.926 0.5
493 Mistral Small 3 Mistral 6.7 - 4.3 $0.15 0.652 0.462 0.038 0.252 - 0.71533333333333 0.08
494 Nova Lite Amazon 6.7 - 7 $0.105 0.59 0.433 0.043 0.167 - 0.76466666666667 0.10666666666667
495 GLM-4.5V (Non-reasoning) Z AI 6.7 - 15.3 $0.9 0.751 0.573 0.035 0.352 - - -
496 Qwen2.5 Coder Instruct 32B Alibaba 6.7 - - $0 0.635 0.417 0.035 0.295 - 0.76666666666667 0.12
497 Qwen3 14B (Non-reasoning) Alibaba 6.7 - 58 $0.612 0.675 0.47 0.041 0.28 - 0.87133333333333 0.28
498 Qwen3 4B 2507 Instruct Alibaba 6.7 - 52.3 $0 0.672 0.517 0.045 0.377 - - -
499 Granite 4.1 8B IBM 6.6 9.5 - $0.063 - 0.433 0.038 - - - -
500 Sarvam 30B (high) Sarvam 6.6 - - $0.047 - 0.633 0.075 - - - -
501 Llama 3.1 Instruct 70B Meta 6.6 - 4 $0.56 0.676 0.409 0.045 0.232 - 0.64933333333333 0.17333333333333
502 Gemini 2.0 Flash Thinking Experimental (Dec '24) Google 6.6 - - $0 - - - - - 0.48 -
503 DeepSeek-V2.5 (Dec '24) DeepSeek 6.6 - - $0 0.666 0.423 - - - 0.76266666666667 -
504 DeepSeek-V2.5 DeepSeek 6.6 - - $0 - - - - - - -
505 Qwen3 4B (Non-reasoning) Alibaba 6.6 - - $0 0.586 0.398 0.033 0.233 - 0.84266666666667 0.21333333333333
506 Qwen3 30B A3B (Non-reasoning) Alibaba 6.6 - 21.7 $0.35 0.71 0.515 0.046 0.322 - 0.86266666666667 0.26
507 Llama 4 Scout Meta 6.5 8.2 14 $0.313 0.752 0.587 0.038 0.299 0.213 0.844 0.28333333333333
508 Gemma 4 E2B (Non-reasoning) Google 6.5 - - $0 - 0.405 0.047 - - - -
509 Olmo 3.1 32B Instruct Allen Institute for AI 6.5 - - $0 - 0.539 0.05 - - - -
510 Mistral Saba Mistral 6.5 - - $0 0.611 0.424 0.043 - - 0.67666666666667 0.13
511 DeepSeek R1 Distill Llama 8B DeepSeek 6.5 - 41.3 $0 0.543 0.302 - 0.233 - 0.85266666666667 0.33333333333333
512 Olmo 3 32B Think Allen Institute for AI 6.5 - 73.7 $0 0.759 0.61 0.064 0.672 - - -
513 Llama 3.2 Instruct 90B (Vision) Meta 6.4 - - $0 0.671 0.432 0.045 0.214 - 0.62933333333333 0.05
514 R1 1776 Perplexity 6.4 - - $0 - - - - - 0.954 -
515 Gemini 1.5 Pro (May '24) Google 6.4 19.8 - $0 0.657 0.371 0.035 0.244 - 0.67333333333333 0.08
516 Solar Mini Upstage 6.4 - - $0.15 - - - - - 0.33133333333333 -
517 Reka Flash (Sep '24) Reka AI 6.4 - - $0.35 - - - - - 0.52866666666667 -
518 Qwen2.5 Turbo Alibaba 6.4 - - $0.088 0.633 0.41 0.041 0.163 - 0.80533333333333 0.12
519 Qwen3 14B (Reasoning) Alibaba 6.4 13.8 55.7 $1.313 0.774 0.604 0.045 0.523 0.307 0.96133333333333 0.76333333333333
520 Grok-1 SpaceXAI 6.3 - - $0 - - - - - - -
521 Phi-4 Mini Instruct Microsoft 6.3 3.8 6.7 $0 0.465 0.331 0.044 0.126 - 0.696 0.03
522 EXAONE 4.0 32B (Non-reasoning) LG AI Research 6.3 - 39.3 $0 0.768 0.628 0.05 0.472 - 0.93933333333333 0.47
523 Celeris-1 Celeris 6.3 14.4 - $0.325 0.78 0.631 0.068 - 0.216 - -
524 Qwen2 Instruct 72B Alibaba 6.3 - - $0 0.622 0.371 0.037 0.159 - 0.70133333333333 0.14666666666667
525 Qwen3.5 2B (Non-reasoning) Alibaba 6.2 2.4 - $0 - 0.438 0.05 - - - -
526 Gemini 1.5 Flash-8B Google 6.2 - - $0 0.569 0.359 0.047 0.217 - 0.68933333333333 0.033333333333333
527 DeepHermes 3 - Mistral 24B Preview (Non-reasoning) Nous Research 6.1 - - $0 0.58 0.382 0.038 0.195 - 0.59466666666667 0.046666666666667
528 Jamba 1.7 Large AI21 Labs 6.1 - 2.3 $0 0.577 0.39 0.037 0.181 - 0.6 0.056666666666667
529 Qwen3.5 0.8B (Reasoning) Alibaba 6.1 0 - $0 - 0.111 0.011 - - - -
530 Ministral 3 14B Mistral 6 14.4 30 $0.2 0.693 0.572 0.046 0.351 0.238 - -
531 Granite 4.0 H Small IBM 6 - 13.7 $0.107 0.624 0.416 0.038 0.251 - - -
532 Qwen3 Omni 30B A3B Instruct Alibaba 6 - 52.3 $0.43 0.725 0.62 0.046 0.422 - - -
533 DeepSeek-Coder-V2 DeepSeek 6 - - $0 - - - - - 0.74266666666667 -
534 OLMo 2 32B Allen Institute for AI 6 - 3.3 $0 0.511 0.328 0.036 0.068 - - -
535 Hermes 3 - Llama-3.1 70B Nous Research 6 - - $0.7 0.571 0.401 0.04 0.188 - 0.538 0.023333333333333
536 Jamba 1.5 Large AI21 Labs 6 - - $3.5 0.572 0.427 0.041 0.143 - 0.606 0.046666666666667
537 Jamba 1.6 Large AI21 Labs 6 - - $0 0.565 0.387 0.036 0.172 - 0.58 0.046666666666667
538 Qwen3 8B (Non-reasoning) Alibaba 6 - 24.3 $0.31 0.643 0.452 0.019 0.202 - 0.828 0.24333333333333
539 Nova Micro Amazon 5.9 - 6 $0.061 0.531 0.358 0.046 0.14 - 0.70333333333333 0.08
540 Phi-4 Microsoft 5.9 - 18 $0.219 0.714 0.575 0.038 0.231 - 0.81 0.14333333333333
541 LFM2 24B A2B Liquid AI 5.9 - - $0 - 0.474 0.042 - - - -
542 Granite 4.1 3B IBM 5.9 4.7 - $0 - 0.314 0.034 - - - -
543 Gemini 1.5 Flash (May '24) Google 5.9 - - $0 0.574 0.324 0.044 0.196 - 0.554 0.093333333333333
544 Claude 3 Sonnet Anthropic 5.9 - - $0 0.579 0.4 0.036 0.175 - 0.414 0.046666666666667
545 Phi-4 Multimodal Instruct Microsoft 5.8 - - $0 0.485 0.315 0.05 0.131 - 0.69266666666667 0.093333333333333
546 NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) NVIDIA 5.8 - 26.7 $0.3 0.649 0.439 0.043 0.345 - - -
547 Gemma 3n E4B Instruct Preview (May '25) Google 5.8 - - $0 0.483 0.278 0.048 0.138 - 0.74866666666667 0.10666666666667
548 Gemini 1.0 Ultra Google 5.8 17.6 - $0 - - - - - - -
549 Mistral Small (Sep '24) Mistral 5.8 - - $0.3 0.529 0.381 0.043 0.141 - 0.56266666666667 0.063333333333333
550 Mistral Large (Feb '24) Mistral 5.8 - - $6 0.515 0.351 0.035 0.178 - 0.52666666666667 0
551 Phi-3 Mini Instruct 3.8B Microsoft 5.8 - 0.3 $0 0.435 0.319 0.05 0.116 - 0.45666666666667 0.04
552 Qwen2.5 Coder Instruct 7B Alibaba 5.8 - - $0 0.473 0.339 0.049 0.126 - 0.66 0.053333333333333
553 MiniCPM-V 4.6 1.3B OpenBMB 5.7 0.7 - $0 - 0.305 0.051 - - - -
554 Jamba Reasoning 3B AI21 Labs 5.7 - 10.7 $0 0.577 0.333 0.038 0.21 - - -
555 Llama 3.2 Instruct 3B Meta 5.7 - 3.3 $0 0.347 0.255 0.053 0.083 - 0.48866666666667 0.066666666666667
556 Llama 2 Chat 7B Meta 5.7 - - $0.1 0.164 0.227 0.053 0.002 - 0.058666666666667 0
557 Mixtral 8x22B Instruct Mistral 5.7 - - $0 0.537 0.332 0.04 0.148 - 0.54466666666667 0
558 Qwen3 VL 4B Instruct Alibaba 5.7 - 37 $0 0.634 0.371 0.036 0.29 - - -
559 Qwen1.5 Chat 110B Alibaba 5.7 - - $0 - 0.289 - - - - -
560 Olmo 3 7B Think Allen Institute for AI 5.6 - 70.7 $0 0.655 0.516 0.06 0.617 - - -
561 Molmo 7B-D Allen Institute for AI 5.6 - 0 $0 0.371 0.24 0.051 0.039 - - -
562 Reka Flash 3 Reka AI 5.6 - 33.7 $0.35 0.669 0.529 0.044 0.435 - 0.89266666666667 0.51
563 Claude 3 Haiku Anthropic 5.6 - - $0.5 - 0.374 0.041 0.154 - 0.394 0.01
564 Claude 2.1 Anthropic 5.6 14 - $0 0.495 0.319 0.039 0.195 - 0.374 0.033333333333333
565 OLMo 2 7B Allen Institute for AI 5.6 - 0.7 $0 0.282 0.288 0.054 0.041 - - -
566 Ministral 3 8B Mistral 5.5 9.7 31.7 $0.15 0.642 0.471 0.043 0.303 0.207 - -
567 GPT-3.5 Turbo OpenAI 5.5 10.7 - $0.75 0.462 0.297 - - - 0.44066666666667 -
568 Llama 3 Instruct 70B Meta 5.5 - - $1.175 0.574 0.379 0.045 0.198 - 0.48266666666667 0
569 Claude 2.0 Anthropic 5.5 12.9 - $0 0.486 0.344 - 0.171 - - 0
570 Mistral Small (Feb '24) Mistral 5.5 - - $0.262 0.419 0.302 0.041 0.111 - 0.562 0.0066666666666667
571 Mistral Medium Mistral 5.5 - - $3 0.491 0.349 0.035 0.099 - 0.40466666666667 0.036666666666667
572 DeepSeek R1 Distill Qwen 1.5B DeepSeek 5.5 - 22 $0 0.269 0.098 0.031 0.07 - 0.68733333333333 0.17666666666667
573 DeepSeek-V2-Chat DeepSeek 5.5 - - $0 - - - - - - -
574 Ling-mini-2.0 InclusionAI 5.5 - 49.3 $0 0.671 0.562 0.051 0.429 - - -
575 Llama 3.2 Instruct 11B (Vision) Meta 5.4 - 1.7 $0.345 0.464 0.221 0.055 0.11 - 0.516 0.093333333333333
576 Qwen3.5 0.8B (Non-reasoning) Alibaba 5.4 1.2 - $0 - 0.236 0.051 - - - -
577 PALM-2 Google 5.4 4.6 - $0 - - - - - - -
578 LFM 40B Liquid AI 5.4 - - $0 0.425 0.327 0.049 0.096 - 0.48 0.023333333333333
579 Arctic Instruct Snowflake 5.4 - - $0 - - - - - - -
580 Qwen Chat 72B Alibaba 5.4 - - $0 - - - - - - -
581 Exaone 4.0 1.2B (Reasoning) LG AI Research 5.3 - 50.3 $0 0.588 0.515 0.06 0.516 - - -
582 Llama 2 Chat 70B Meta 5.3 - - $0 0.406 0.327 0.052 0.098 - 0.32266666666667 0
583 Llama 2 Chat 13B Meta 5.3 - - $0 0.406 0.321 0.048 0.098 - 0.32866666666667 0.016666666666667
584 Gemini 1.0 Pro Google 5.3 - - $0 0.431 0.277 0.042 0.116 - 0.40266666666667 0.0066666666666667
585 DeepSeek LLM 67B Chat (V1) DeepSeek 5.3 - - $0 - - - - - - -
586 DeepSeek Coder V2 Lite Instruct DeepSeek 5.3 - - $0 0.429 0.319 0.054 0.158 - - -
587 OpenChat 3.5 (1210) OpenChat 5.3 - - $0 0.31 0.23 0.048 0.115 - 0.30733333333333 0
588 DBRX Instruct Databricks 5.3 - - $0 0.397 0.331 0.029 0.093 - 0.27933333333333 0.03
589 Sarvam M (Reasoning) Sarvam 5.3 - - $0 0.696 0.416 0.031 0.295 - 0.84733333333333 0.20333333333333
590 Command-R+ (Apr '24) Cohere 5.3 - - $0 0.432 0.323 0.046 0.122 - 0.27866666666667 0.0066666666666667
591 LFM2.5-1.2B-Thinking Liquid AI 5.2 - - $0 - 0.339 0.062 - - - -
592 LFM2 2.6B Liquid AI 5.2 - 8.3 $0 0.298 0.306 0.055 0.081 - - -
593 LFM2.5-1.2B-Instruct Liquid AI 5.2 - - $0 - 0.326 0.067 - - - -
594 Olmo 3 7B Instruct Allen Institute for AI 5.2 - 41.3 $0.125 0.522 0.4 0.058 0.266 - - -
595 Granite 4.0 H 1B IBM 5.2 - 6.3 $0 0.277 0.263 0.05 0.115 - - -
596 Exaone 4.0 1.2B (Non-reasoning) LG AI Research 5.2 - 24 $0 0.5 0.424 0.057 0.293 - - -
597 Jamba 1.7 Mini AI21 Labs 5.2 - 0.3 $0 0.388 0.322 0.044 0.061 - 0.258 0.013333333333333
598 Jamba 1.6 Mini AI21 Labs 5.2 - - $0 0.367 0.3 0.043 0.071 - 0.25666666666667 0.033333333333333
599 Jamba 1.5 Mini AI21 Labs 5.2 - - $0.25 0.371 0.302 0.051 0.062 - 0.35666666666667 0.01
600 Qwen3 8B (Reasoning) Alibaba 5.2 9 19 $0.66 0.743 0.589 0.039 0.406 0.279 0.904 0.74666666666667
601 Qwen3 1.7B (Reasoning) Alibaba 5.2 - 38.7 $0 0.57 0.356 0.046 0.308 - 0.894 0.51
602 Gemma 3 270M Google 5.1 - 2.3 $0 0.055 0.224 0.036 0.003 - - -
603 Granite 4.0 Micro IBM 5.1 - 6 $0 0.447 0.336 0.05 0.18 - - -
604 DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) Nous Research 5.1 - - $0 0.365 0.27 0.043 0.085 - 0.218 0
605 Apertus 70B Instruct Swiss AI Initiative 5.1 - - $1.345 - 0.272 0.055 - - - -
606 Mixtral 8x7B Instruct Mistral 5.1 - - $0.512 0.387 0.292 0.047 0.066 - 0.29933333333333 0
607 Llama 65B Meta 5 - - $0 - - - - - - -
608 Qwen Chat 14B Alibaba 5 - - $0 - - - - - - -
609 Molmo2-8B Allen Institute for AI 5 - - $0 - 0.425 0.043 - - - -
610 Granite 4.0 1B IBM 5 - 6.3 $0 0.325 0.281 0.048 0.047 - - -
611 Claude Instant Anthropic 5 7.8 - $0 0.434 0.33 0.035 0.109 - 0.264 0
612 Mistral 7B Instruct Mistral 5 - - $0.25 0.245 0.177 0.045 0.046 - 0.12133333333333 0
613 Command-R (Mar '24) Cohere 5 - - $0 0.338 0.284 0.048 0.048 - 0.164 0.0066666666666667
614 LFM2 8B A1B Liquid AI 4.9 - 25.3 $0 0.505 0.344 0.049 0.151 - - -
615 Gemma 3 27B Instruct Google 4.9 10.1 20.7 $0 0.669 0.428 0.044 0.137 0.233 0.88266666666667 0.25333333333333
616 Granite 3.3 8B (Non-reasoning) IBM 4.9 - 6.7 $0.085 0.468 0.338 0.042 0.127 - 0.66466666666667 0.046666666666667
617 Qwen3 1.7B (Non-reasoning) Alibaba 4.9 - 7.3 $0 0.411 0.283 0.053 0.126 - 0.71733333333333 0.096666666666667
618 Ministral 3 3B Mistral 4.8 4.8 22 $0.1 0.524 0.358 0.054 0.247 0.153 - -
619 LFM2.5-VL-1.6B Liquid AI 4.8 - - $0 - 0.289 0.051 - - - -
620 Granite 4.0 350M IBM 4.8 - 0 $0 0.124 0.261 0.055 0.024 - - -
621 Granite 4.0 H 350M IBM 4.8 - 1.3 $0 0.127 0.257 0.064 0.019 - - -
622 Apertus 8B Instruct Swiss AI Initiative 4.8 - - $0.125 - 0.256 0.05 - - - -
623 Tiny Aya Global Cohere 4.8 - - $0 - 0.305 0.052 - - - -
624 Llama 3 Instruct 8B Meta 4.8 - - $0.07 0.405 0.296 0.051 0.096 - 0.49933333333333 0
625 Llama 3.2 Instruct 1B Meta 4.8 - 0 $0 0.2 0.196 0.055 0.019 - 0.14 0
626 Gemma 3 1B Instruct Google 4.8 - 3.3 $0 0.135 0.237 0.053 0.017 - 0.484 0
627 Gemma 3 4B Instruct Google 4.8 2.7 12.7 $0 0.417 0.291 0.053 0.112 - 0.766 0.063333333333333
628 Gemma 3n E2B Instruct Google 4.8 - 10.3 $0 0.378 0.229 0.042 0.095 - 0.69133333333333 0.09
629 Gemma 3n E4B Instruct Google 4.8 3.2 14.3 $0 0.488 0.296 0.045 0.146 - 0.77066666666667 0.13666666666667
630 LFM2 1.2B Liquid AI 4.8 - 3.3 $0 0.257 0.228 0.056 0.02 - - -
631 Qwen3 0.6B (Non-reasoning) Alibaba 4.8 - 10.3 $0 0.231 0.231 0.049 0.073 - 0.52066666666667 0.016666666666667
632 Qwen3 0.6B (Reasoning) Alibaba 4.8 - 18 $0 0.347 0.239 0.056 0.121 - 0.75 0.1
633 Gemma 3 12B Instruct Google 3.8 5.8 18.3 $0 0.595 0.349 0.042 0.137 0.164 0.85333333333333 0.22
634 GPT-5.5 Pro (xhigh) OpenAI - - - $0 - - - - - - -
635 Gemini 3 Deep Think Google - - - $0 - - - - - - -
636 Claude Sonnet 5 (Adaptive Reasoning, High Effort) Anthropic - - - $4 - - 0.357 - 0.543 - -
637 Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) Anthropic - - - $4 - - 0.39 - 0.541 - -
638 EXAONE 4.5 33B (Non-reasoning) LG AI Research - - - $0 - - - - - - -
639 Cogito v2.1 (Reasoning) Deep Cogito - - 72.7 $1.25 0.849 0.768 0.12 0.688 - - -
640 GPT-5.4 Pro (xhigh) OpenAI - - - $67.5 - - - - - - -
641 GPT-4o mini Realtime (Dec '24) OpenAI - - - $0 - - - - - - -
642 GPT-4o Realtime (Dec '24) OpenAI - - - $0 - - - - - - -
643 GPT-3.5 Turbo (0613) OpenAI - - - $0 - - - - - - -
644 Mi:dm K 2.5 Pro Preview Korea Telecom - - 78.7 $0 0.813 0.722 0.091 0.576 - - -

* 价格为每百万 Token 的混合价格 (3:1 输入/输出)

Artificial Analysis AI 大模型排名 介绍

Artificial Analysis 是一家独立的 AI 基准测试和分析公司,提供独立的基准测试和分析,以支持开发者、研究人员、企业和其他 AI 用户。Artificial Analysis同时测试专有与开放权重模型,并以端到端用户体验为核心,测量实际使用中的响应时间、输出速度及成本。

质量基准涵盖语言理解与推理能力;性能基准则关注首次令牌到达时间、输出速度、端到端响应时间等真实可感知指标。我们区分 OpenAI Tokens 与原生 Tokens,以便在不同模型之间进行统一、公平的对比,并使用按 3:1 的输入/输出比计算混合价。基准对象包括模型、端点、系统与提供商,覆盖语言模型、语音、图像生成等多个方向,旨在帮助用户准确了解不同 AI 服务的真实表现与性价比。

Artificial Analysis AI 测试基准介绍

上下文窗口

输入和输出令牌的最大总数。输出令牌的数量限制通常要低得多(具体数量因模型而异)。

输出速度

模型生成令牌时每秒接收到的令牌数(即,对于支持流式传输的模型,在从 API 接收到第一个数据块之后)。

延迟(首次令牌到达时间)

API 请求发送后,收到第一个推理令牌所需的时间(以秒为单位)。对于共享推理令牌的推理模型,这将是第一个推理令牌。对于不支持流式传输的模型,这表示收到完成状态所需的时间。

价格

每个代币的价格,以美元/百万代币表示。价格是输入代币和输出代币价格的混合(比例为 3:1)。

常见 AI 大模型测试基准介绍

MMLU Pro

Massive Multitask Language Understanding Professional。MMLU 的增强版,旨在评估大语言模型的推理能力。它通过过滤简单问题、增加选项数量(从4个增加到10个)以及强调复杂的多步推理,来解决原版 MMLU 的局限性。涵盖 14 个领域的约 12,000 个问题。

GPQA

Graduate-Level Google-Proof Q&A Benchmark。一个具有挑战性的研究生级别问答基准,旨在评估 AI 系统在物理、化学和生物等复杂科学领域提供真实信息的能力。这些问题被设计为“防谷歌搜索”,即需要深度理解和推理,而不仅仅是简单的事实回忆。

HLE

Humanity's Last Exam。一个全面的评估框架,旨在测试 AI 系统在模仿人类水平推理、解决问题和知识整合方面的能力。包含 100 多个学科的 2,500 到 3,000 个专家级问题,强调多步推理和处理新颖场景的能力。

LiveCodeBench

一个无污染的 LLM 代码能力评估基准。它持续从 LeetCode、AtCoder 和 Codeforces 等平台的竞赛中收集新问题,以防止训练集数据污染。除了代码生成,还评估自我修复、代码执行和测试输出预测等能力。

SciCode

评估语言模型解决现实科学研究问题代码生成能力的基准。涵盖物理、数学、材料科学、生物和化学等 6 个领域的 16 个子领域。问题源自真实的科学工作流,通常需要知识回忆、推理和代码合成。

Math 500

旨在评估语言模型数学推理和解决问题能力的基准。包含 500 个来自 AMC 和 AIME 等高水平高中数学竞赛的难题,涵盖代数、组合数学、几何、数论和预微积分等领域。

AIME

American Invitational Mathematics Examination。基于美国数学邀请赛问题的基准,被认为是测试高级数学推理的最具挑战性的 AI 测试之一。包含 30 个“奥林匹克级别”的整数答案数学问题,测试多步推理、抽象和解决问题的能力。

微信公众号 私信站长
天梯图小程序 天梯图小程序