跳到正文
把进展读清楚
开源

公开评测 · 按能力比较

AI 模型榜

按公开评测成绩比较模型。点击模型名称,查看各项能力分数和测试配置。

来源:LiveBench ↗评测版本 2026-06-25快照核验

数学榜 60 / 60 个模型配置

LiveBench 数学评测成绩,同分并列,搜索保留名次
名次模型与配置数学分数
1
Claude 5.5 Opus Thinking Max Effort
综合
83.2
推理
92.2
编程
89.3
智能体编程
71.7
数学
97.1
数据分析
80.3
语言
86.3
指令遵循
65.7
Anthropic
97.1
2
Claude Fable 5.1 Max Effort
综合
83.4
推理
91.7
编程
86.4
智能体编程
66.1
数学
97.0
数据分析
80.3
语言
89.5
指令遵循
73.0
Anthropic
97.0
3
GPT-6 Astra Max Effort
综合
82.2
推理
92.7
编程
80.4
智能体编程
57.3
数学
96.8
数据分析
83.0
语言
89.4
指令遵循
75.6
OpenAI
96.8
3
GPT-6.1 Sol Max Effort
综合
81.6
推理
92.6
编程
80.4
智能体编程
54.5
数学
96.8
数据分析
82.7
语言
90.1
指令遵循
74.2
OpenAI
96.8
5
Claude Sonnet 5.5 xHigh Effort
综合
77.8
推理
86.8
编程
88.9
智能体编程
39.3
数学
96.7
数据分析
78.6
语言
83.4
指令遵循
70.5
Anthropic
96.7
6
GPT-6 Sol Max Effort
综合
79.3
推理
88.7
编程
81.8
智能体编程
52.9
数学
96.4
数据分析
81.2
语言
85.3
指令遵循
68.6
OpenAI
96.4
7
GPT-5.6 Sol Max Effort
综合
81.0
推理
91.7
编程
83.9
智能体编程
56.2
数学
96.2
数据分析
79.8
语言
87.7
指令遵循
71.8
OpenAI
96.2
8
Claude Fable 5 Max Effort
综合
83.0
推理
89.7
编程
86.0
智能体编程
62.2
数学
96.0
数据分析
80.5
语言
90.7
指令遵循
75.8
Anthropic
96.0
9
Muse Spark 1.3 xHigh Effort
综合
81.6
推理
89.7
编程
81.1
智能体编程
64.1
数学
95.9
数据分析
79.6
语言
82.8
指令遵循
78.0
Meta
95.9
9
GPT-5.5 Thinking xHigh Effort
综合
80.2
推理
89.7
编程
82.1
智能体编程
54.0
数学
95.9
数据分析
81.6
语言
87.4
指令遵循
70.7
OpenAI
95.9
11
Claude 5 Opus Thinking Max Effort
综合
80.1
推理
91.2
编程
81.4
智能体编程
65.2
数学
95.7
数据分析
74.6
语言
88.7
指令遵循
63.8
Anthropic
95.7
11
Grok 4.7 xHigh
综合
77.4
推理
82.7
编程
77.2
智能体编程
54.0
数学
95.7
数据分析
76.9
语言
80.1
指令遵循
75.3
xAI
95.7
13
DeepSeek V4 Pro 0813
综合
77.4
推理
85.8
编程
77.2
智能体编程
54.9
数学
95.1
数据分析
79.2
语言
82.1
指令遵循
67.7
DeepSeek开放权重
95.1
14
GPT-5.6 Terra Max Effort
综合
77.9
推理
90.6
编程
78.2
智能体编程
54.9
数学
94.9
数据分析
79.3
语言
82.9
指令遵循
64.6
OpenAI
94.9
15
Claude 4.8 Opus Thinking Max Effort
综合
76.2
推理
89.2
编程
81.8
智能体编程
50.5
数学
94.3
数据分析
66.0
语言
79.7
指令遵循
72.0
Anthropic
94.3
16
GPT-5.4 Thinking xHigh Effort
综合
78.0
推理
88.1
编程
77.5
智能体编程
53.8
数学
94.1
数据分析
79.3
语言
82.6
指令遵循
70.2
OpenAI
94.1
17
Mistral Large 4 High
综合
71.8
推理
83.9
编程
77.2
智能体编程
57.2
数学
93.6
数据分析
76.5
语言
49.6
指令遵循
64.8
Mistral AI
93.6
18
Gemini 3.7 Flash High
综合
78.8
推理
87.8
编程
78.9
智能体编程
58.3
数学
93.5
数据分析
68.0
语言
85.5
指令遵循
79.9
Google
93.5
19
DeepSeek V4.1 Flash Max Effort
综合
81.1
推理
86.7
编程
80.0
智能体编程
77.3
数学
93.3
数据分析
79.3
语言
81.2
指令遵循
70.0
DeepSeek开放权重
93.3
20
GPT-5.2 High
综合
74.6
推理
83.2
编程
76.1
智能体编程
50.3
数学
93.2
数据分析
78.2
语言
79.8
指令遵循
61.8
OpenAI
93.2
21
Claude 4.7 Opus Thinking xHigh Effort
综合
76.5
推理
87.2
编程
82.1
智能体编程
50.7
数学
92.9
数据分析
78.3
语言
77.9
指令遵循
66.7
Anthropic
92.9
21
Claude Sonnet 5 xHigh Effort
综合
76.0
推理
88.7
编程
80.7
智能体编程
59.4
数学
92.9
数据分析
71.7
语言
75.0
指令遵循
63.9
Anthropic
92.9
23
Claude Haiku 5.5 xHigh Effort
综合
72.1
推理
81.2
编程
76.4
智能体编程
51.4
数学
92.8
数据分析
72.8
语言
63.5
指令遵循
66.5
Anthropic
92.8
24
Grok 4.6 xHigh
综合
78.0
推理
90.5
编程
76.8
智能体编程
57.0
数学
92.6
数据分析
73.9
语言
83.7
指令遵循
71.9
xAI
92.6
25
Gemini 3.8 Flash High
综合
75.8
推理
89.3
编程
72.5
智能体编程
54.2
数学
91.6
数据分析
54.0
语言
87.8
指令遵循
81.4
Google
91.6
26
Qwen 3.8 Max
综合
78.5
推理
88.2
编程
72.9
智能体编程
64.6
数学
91.3
数据分析
78.4
语言
79.7
指令遵循
74.1
Alibaba开放权重
91.3
27
Muse Spark 1.2 xHigh Effort
综合
78.0
推理
90.0
编程
77.5
智能体编程
57.6
数学
91.2
数据分析
76.5
语言
78.6
指令遵循
74.3
Meta
91.2
28
Gemini 3.1 Pro Preview High
综合
77.0
推理
84.0
编程
76.5
智能体编程
44.1
数学
91.0
数据分析
78.5
语言
85.4
指令遵循
79.1
Google
91.0
28
GPT-5.4 Nano xHigh
综合
69.6
推理
81.1
编程
70.8
智能体编程
46.8
数学
91.0
数据分析
67.6
语言
62.5
指令遵循
67.2
OpenAI
91.0
30
Grok 4.5
综合
75.8
推理
87.2
编程
68.6
智能体编程
56.5
数学
90.8
数据分析
73.0
语言
82.8
指令遵循
71.5
xAI
90.8
31
Claude 4.5 Opus Thinking High Effort
综合
72.6
推理
80.1
编程
79.7
智能体编程
39.7
数学
90.4
数据分析
74.4
语言
81.3
指令遵循
62.5
Anthropic
90.4
32
GLM-5.2
综合
73.2
推理
78.6
编程
79.7
智能体编程
51.8
数学
89.8
数据分析
73.7
语言
76.2
指令遵循
62.3
Z.AI开放权重
89.8
33
Claude 4.6 Opus Thinking High Effort
综合
74.5
推理
88.7
编程
78.2
智能体编程
49.0
数学
89.3
数据分析
69.9
语言
83.3
指令遵循
63.3
Anthropic
89.3
34
GPT-6 Luna Max Effort
综合
72.0
推理
81.8
编程
79.0
智能体编程
51.2
数学
89.1
数据分析
73.4
语言
73.8
指令遵循
55.9
OpenAI
89.1
35
GPT-5.2 Codex
综合
74.0
推理
77.7
编程
83.6
智能体编程
49.4
数学
88.8
数据分析
78.2
语言
73.7
指令遵循
66.4
OpenAI
88.8
36
Nemotron 3 Ultra 550B A55B
综合
67.4
推理
74.7
编程
70.7
智能体编程
38.7
数学
88.7
数据分析
54.5
语言
70.8
指令遵循
73.4
NVIDIA开放权重
88.7
37
Inkling xHigh Effort
综合
71.9
推理
78.3
编程
71.0
智能体编程
49.4
数学
88.4
数据分析
72.8
语言
73.5
指令遵循
70.1
Thinking Machines开放权重
88.4
38
Gemini 3.5 Flash High
综合
74.6
推理
82.0
编程
78.2
智能体编程
49.0
数学
88.2
数据分析
64.9
语言
84.6
指令遵循
75.6
Google
88.2
39
GLM-5.3
综合
76.1
推理
85.8
编程
79.0
智能体编程
60.9
数学
87.9
数据分析
70.2
语言
79.9
指令遵循
69.3
Z.AI开放权重
87.9
40
DeepSeek V4 Flash Vision Exp
综合
76.8
推理
85.4
编程
68.2
智能体编程
65.1
数学
87.8
数据分析
79.5
语言
80.4
指令遵循
71.0
DeepSeek开放权重
87.8
41
GPT-5.6 Luna Max Effort
综合
73.6
推理
85.6
编程
82.9
智能体编程
48.4
数学
87.2
数据分析
78.0
语言
72.6
指令遵循
60.1
OpenAI
87.2
42
Muse Spark 1.1 xHigh Effort
综合
75.3
推理
87.7
编程
77.2
智能体编程
58.5
数学
87.1
数据分析
72.5
语言
74.3
指令遵循
69.6
Meta
87.1
43
Claude 4.6 Sonnet Thinking Medium Effort
综合
73.0
推理
84.8
编程
79.3
智能体编程
42.6
数学
87.0
数据分析
77.9
语言
76.1
指令遵循
63.2
Anthropic
87.0
44
DeepSeek V4 Flash 0731
综合
74.2
推理
86.6
编程
75.0
智能体编程
46.8
数学
86.8
数据分析
79.3
语言
79.2
指令遵循
65.5
DeepSeek开放权重
86.8
45
Gemini 3.6 Flash High
综合
73.6
推理
85.1
编程
77.9
智能体编程
43.4
数学
86.4
数据分析
63.0
语言
83.9
指令遵循
75.4
Google
86.4
46
Qwen3.8 27B
综合
75.3
推理
80.0
编程
75.7
智能体编程
61.4
数学
86.2
数据分析
76.6
语言
74.3
指令遵循
72.7
Alibaba开放权重
86.2
47
Qwen 3.8 Flash Next
综合
76.2
推理
87.4
编程
72.6
智能体编程
61.6
数学
85.8
数据分析
74.2
语言
74.6
指令遵循
77.1
Alibaba开放权重
85.8
48
Qwen 3.7 Max
综合
73.1
推理
83.3
编程
74.2
智能体编程
43.6
数学
85.2
数据分析
71.8
语言
79.7
指令遵循
74.0
Alibaba
85.2
49
Kimi K3
综合
79.2
推理
90.7
编程
81.4
智能体编程
62.2
数学
84.4
数据分析
78.7
语言
85.5
指令遵循
71.4
Moonshot AI开放权重
84.4
50
Kimi K2.6 Thinking
综合
70.5
推理
79.4
编程
78.6
智能体编程
46.9
数学
84.3
数据分析
65.1
语言
75.1
指令遵循
64.4
Moonshot AI开放权重
84.3
50
Grok 4.3
综合
62.3
推理
70.8
编程
69.9
智能体编程
18.5
数学
84.3
数据分析
55.8
语言
73.6
指令遵循
62.8
xAI
84.3
52
Qwen 3.6 Plus
综合
68.9
推理
75.8
编程
78.2
智能体编程
41.4
数学
83.7
数据分析
69.9
语言
75.0
指令遵循
58.3
Alibaba
83.7
53
GLM-5.3 Flash
综合
71.6
推理
77.6
编程
79.0
智能体编程
56.8
数学
81.2
数据分析
76.4
语言
77.3
指令遵循
52.8
Z.AI开放权重
81.2
54
Qwen 3.6 27B
综合
64.0
推理
70.3
编程
71.8
智能体编程
39.3
数学
79.9
数据分析
70.4
语言
63.3
指令遵循
53.2
Alibaba开放权重
79.9
55
Kimi K2.7 Code
综合
68.4
推理
82.8
编程
74.0
智能体编程
45.7
数学
79.6
数据分析
62.7
语言
77.9
指令遵循
56.3
Moonshot AI开放权重
79.6
56
GPT-5.4 Mini xHigh
综合
66.4
推理
71.3
编程
71.6
智能体编程
41.7
数学
78.5
数据分析
70.8
语言
71.0
指令遵循
59.8
OpenAI
78.5
57
Grok Build 0.1
综合
67.8
推理
76.4
编程
65.4
智能体编程
45.8
数学
78.4
数据分析
70.8
语言
72.5
指令遵循
65.2
xAI
78.4
58
ox-alpha-max
综合
69.2
推理
76.6
编程
75.8
智能体编程
52.6
数学
77.5
数据分析
75.8
语言
66.1
指令遵循
60.3
Stealth
77.5
59
Minimax M3
综合
67.3
推理
74.5
编程
68.2
智能体编程
40.7
数学
76.9
数据分析
76.2
语言
76.8
指令遵循
57.5
Minimax
76.9
60
Gemini 3.5 Flash-Lite High
综合
63.9
推理
60.2
编程
76.1
智能体编程
45.3
数学
73.7
数据分析
53.2
语言
71.8
指令遵循
67.2
Google
73.7

综合分来自 LiveBench 各类评测平均分。名次按本页所选维度排序,同分并列;搜索保留完整榜单名次。

这是已核验的公开快照,非实时榜单。成绩对应名称中标注的测试配置,不代表所有场景的使用效果;不同评测机构的分数不能直接混用。