跳到正文
把进展读清楚
开源

公开评测 · 按能力比较

AI 模型榜

按公开评测成绩比较模型。点击模型名称,查看各项能力分数和测试配置。

来源:LiveBench ↗评测版本 2026-06-25快照核验

数据分析榜 60 / 60 个模型配置

LiveBench 数据分析评测成绩,同分并列,搜索保留名次
名次模型与配置数据分析分数
1
GPT-6 Astra Max Effort
综合
82.2
推理
92.7
编程
80.4
智能体编程
57.3
数学
96.8
数据分析
83.0
语言
89.4
指令遵循
75.6
OpenAI
83.0
2
GPT-6.1 Sol Max Effort
综合
81.6
推理
92.6
编程
80.4
智能体编程
54.5
数学
96.8
数据分析
82.7
语言
90.1
指令遵循
74.2
OpenAI
82.7
3
GPT-5.5 Thinking xHigh Effort
综合
80.2
推理
89.7
编程
82.1
智能体编程
54.0
数学
95.9
数据分析
81.6
语言
87.4
指令遵循
70.7
OpenAI
81.6
4
GPT-6 Sol Max Effort
综合
79.3
推理
88.7
编程
81.8
智能体编程
52.9
数学
96.4
数据分析
81.2
语言
85.3
指令遵循
68.6
OpenAI
81.2
5
Claude Fable 5 Max Effort
综合
83.0
推理
89.7
编程
86.0
智能体编程
62.2
数学
96.0
数据分析
80.5
语言
90.7
指令遵循
75.8
Anthropic
80.5
6
Claude Fable 5.1 Max Effort
综合
83.4
推理
91.7
编程
86.4
智能体编程
66.1
数学
97.0
数据分析
80.3
语言
89.5
指令遵循
73.0
Anthropic
80.3
6
Claude 5.5 Opus Thinking Max Effort
综合
83.2
推理
92.2
编程
89.3
智能体编程
71.7
数学
97.1
数据分析
80.3
语言
86.3
指令遵循
65.7
Anthropic
80.3
8
GPT-5.6 Sol Max Effort
综合
81.0
推理
91.7
编程
83.9
智能体编程
56.2
数学
96.2
数据分析
79.8
语言
87.7
指令遵循
71.8
OpenAI
79.8
9
Muse Spark 1.3 xHigh Effort
综合
81.6
推理
89.7
编程
81.1
智能体编程
64.1
数学
95.9
数据分析
79.6
语言
82.8
指令遵循
78.0
Meta
79.6
10
DeepSeek V4 Flash Vision Exp
综合
76.8
推理
85.4
编程
68.2
智能体编程
65.1
数学
87.8
数据分析
79.5
语言
80.4
指令遵循
71.0
DeepSeek开放权重
79.5
11
DeepSeek V4.1 Flash Max Effort
综合
81.1
推理
86.7
编程
80.0
智能体编程
77.3
数学
93.3
数据分析
79.3
语言
81.2
指令遵循
70.0
DeepSeek开放权重
79.3
11
GPT-5.4 Thinking xHigh Effort
综合
78.0
推理
88.1
编程
77.5
智能体编程
53.8
数学
94.1
数据分析
79.3
语言
82.6
指令遵循
70.2
OpenAI
79.3
11
GPT-5.6 Terra Max Effort
综合
77.9
推理
90.6
编程
78.2
智能体编程
54.9
数学
94.9
数据分析
79.3
语言
82.9
指令遵循
64.6
OpenAI
79.3
11
DeepSeek V4 Flash 0731
综合
74.2
推理
86.6
编程
75.0
智能体编程
46.8
数学
86.8
数据分析
79.3
语言
79.2
指令遵循
65.5
DeepSeek开放权重
79.3
15
DeepSeek V4 Pro 0813
综合
77.4
推理
85.8
编程
77.2
智能体编程
54.9
数学
95.1
数据分析
79.2
语言
82.1
指令遵循
67.7
DeepSeek开放权重
79.2
16
Kimi K3
综合
79.2
推理
90.7
编程
81.4
智能体编程
62.2
数学
84.4
数据分析
78.7
语言
85.5
指令遵循
71.4
Moonshot AI开放权重
78.7
17
Claude Sonnet 5.5 xHigh Effort
综合
77.8
推理
86.8
编程
88.9
智能体编程
39.3
数学
96.7
数据分析
78.6
语言
83.4
指令遵循
70.5
Anthropic
78.6
18
Gemini 3.1 Pro Preview High
综合
77.0
推理
84.0
编程
76.5
智能体编程
44.1
数学
91.0
数据分析
78.5
语言
85.4
指令遵循
79.1
Google
78.5
19
Qwen 3.8 Max
综合
78.5
推理
88.2
编程
72.9
智能体编程
64.6
数学
91.3
数据分析
78.4
语言
79.7
指令遵循
74.1
Alibaba开放权重
78.4
20
Claude 4.7 Opus Thinking xHigh Effort
综合
76.5
推理
87.2
编程
82.1
智能体编程
50.7
数学
92.9
数据分析
78.3
语言
77.9
指令遵循
66.7
Anthropic
78.3
21
GPT-5.2 High
综合
74.6
推理
83.2
编程
76.1
智能体编程
50.3
数学
93.2
数据分析
78.2
语言
79.8
指令遵循
61.8
OpenAI
78.2
21
GPT-5.2 Codex
综合
74.0
推理
77.7
编程
83.6
智能体编程
49.4
数学
88.8
数据分析
78.2
语言
73.7
指令遵循
66.4
OpenAI
78.2
23
GPT-5.6 Luna Max Effort
综合
73.6
推理
85.6
编程
82.9
智能体编程
48.4
数学
87.2
数据分析
78.0
语言
72.6
指令遵循
60.1
OpenAI
78.0
24
Claude 4.6 Sonnet Thinking Medium Effort
综合
73.0
推理
84.8
编程
79.3
智能体编程
42.6
数学
87.0
数据分析
77.9
语言
76.1
指令遵循
63.2
Anthropic
77.9
25
Grok 4.7 xHigh
综合
77.4
推理
82.7
编程
77.2
智能体编程
54.0
数学
95.7
数据分析
76.9
语言
80.1
指令遵循
75.3
xAI
76.9
26
Qwen3.8 27B
综合
75.3
推理
80.0
编程
75.7
智能体编程
61.4
数学
86.2
数据分析
76.6
语言
74.3
指令遵循
72.7
Alibaba开放权重
76.6
27
Muse Spark 1.2 xHigh Effort
综合
78.0
推理
90.0
编程
77.5
智能体编程
57.6
数学
91.2
数据分析
76.5
语言
78.6
指令遵循
74.3
Meta
76.5
27
Mistral Large 4 High
综合
71.8
推理
83.9
编程
77.2
智能体编程
57.2
数学
93.6
数据分析
76.5
语言
49.6
指令遵循
64.8
Mistral AI
76.5
29
GLM-5.3 Flash
综合
71.6
推理
77.6
编程
79.0
智能体编程
56.8
数学
81.2
数据分析
76.4
语言
77.3
指令遵循
52.8
Z.AI开放权重
76.4
30
Minimax M3
综合
67.3
推理
74.5
编程
68.2
智能体编程
40.7
数学
76.9
数据分析
76.2
语言
76.8
指令遵循
57.5
Minimax
76.2
31
ox-alpha-max
综合
69.2
推理
76.6
编程
75.8
智能体编程
52.6
数学
77.5
数据分析
75.8
语言
66.1
指令遵循
60.3
Stealth
75.8
32
Claude 5 Opus Thinking Max Effort
综合
80.1
推理
91.2
编程
81.4
智能体编程
65.2
数学
95.7
数据分析
74.6
语言
88.7
指令遵循
63.8
Anthropic
74.6
33
Claude 4.5 Opus Thinking High Effort
综合
72.6
推理
80.1
编程
79.7
智能体编程
39.7
数学
90.4
数据分析
74.4
语言
81.3
指令遵循
62.5
Anthropic
74.4
34
Qwen 3.8 Flash Next
综合
76.2
推理
87.4
编程
72.6
智能体编程
61.6
数学
85.8
数据分析
74.2
语言
74.6
指令遵循
77.1
Alibaba开放权重
74.2
35
Grok 4.6 xHigh
综合
78.0
推理
90.5
编程
76.8
智能体编程
57.0
数学
92.6
数据分析
73.9
语言
83.7
指令遵循
71.9
xAI
73.9
36
GLM-5.2
综合
73.2
推理
78.6
编程
79.7
智能体编程
51.8
数学
89.8
数据分析
73.7
语言
76.2
指令遵循
62.3
Z.AI开放权重
73.7
37
GPT-6 Luna Max Effort
综合
72.0
推理
81.8
编程
79.0
智能体编程
51.2
数学
89.1
数据分析
73.4
语言
73.8
指令遵循
55.9
OpenAI
73.4
38
Grok 4.5
综合
75.8
推理
87.2
编程
68.6
智能体编程
56.5
数学
90.8
数据分析
73.0
语言
82.8
指令遵循
71.5
xAI
73.0
39
Claude Haiku 5.5 xHigh Effort
综合
72.1
推理
81.2
编程
76.4
智能体编程
51.4
数学
92.8
数据分析
72.8
语言
63.5
指令遵循
66.5
Anthropic
72.8
39
Inkling xHigh Effort
综合
71.9
推理
78.3
编程
71.0
智能体编程
49.4
数学
88.4
数据分析
72.8
语言
73.5
指令遵循
70.1
Thinking Machines开放权重
72.8
41
Muse Spark 1.1 xHigh Effort
综合
75.3
推理
87.7
编程
77.2
智能体编程
58.5
数学
87.1
数据分析
72.5
语言
74.3
指令遵循
69.6
Meta
72.5
42
Qwen 3.7 Max
综合
73.1
推理
83.3
编程
74.2
智能体编程
43.6
数学
85.2
数据分析
71.8
语言
79.7
指令遵循
74.0
Alibaba
71.8
43
Claude Sonnet 5 xHigh Effort
综合
76.0
推理
88.7
编程
80.7
智能体编程
59.4
数学
92.9
数据分析
71.7
语言
75.0
指令遵循
63.9
Anthropic
71.7
44
Grok Build 0.1
综合
67.8
推理
76.4
编程
65.4
智能体编程
45.8
数学
78.4
数据分析
70.8
语言
72.5
指令遵循
65.2
xAI
70.8
44
GPT-5.4 Mini xHigh
综合
66.4
推理
71.3
编程
71.6
智能体编程
41.7
数学
78.5
数据分析
70.8
语言
71.0
指令遵循
59.8
OpenAI
70.8
46
Qwen 3.6 27B
综合
64.0
推理
70.3
编程
71.8
智能体编程
39.3
数学
79.9
数据分析
70.4
语言
63.3
指令遵循
53.2
Alibaba开放权重
70.4
47
GLM-5.3
综合
76.1
推理
85.8
编程
79.0
智能体编程
60.9
数学
87.9
数据分析
70.2
语言
79.9
指令遵循
69.3
Z.AI开放权重
70.2
48
Claude 4.6 Opus Thinking High Effort
综合
74.5
推理
88.7
编程
78.2
智能体编程
49.0
数学
89.3
数据分析
69.9
语言
83.3
指令遵循
63.3
Anthropic
69.9
48
Qwen 3.6 Plus
综合
68.9
推理
75.8
编程
78.2
智能体编程
41.4
数学
83.7
数据分析
69.9
语言
75.0
指令遵循
58.3
Alibaba
69.9
50
Gemini 3.7 Flash High
综合
78.8
推理
87.8
编程
78.9
智能体编程
58.3
数学
93.5
数据分析
68.0
语言
85.5
指令遵循
79.9
Google
68.0
51
GPT-5.4 Nano xHigh
综合
69.6
推理
81.1
编程
70.8
智能体编程
46.8
数学
91.0
数据分析
67.6
语言
62.5
指令遵循
67.2
OpenAI
67.6
52
Claude 4.8 Opus Thinking Max Effort
综合
76.2
推理
89.2
编程
81.8
智能体编程
50.5
数学
94.3
数据分析
66.0
语言
79.7
指令遵循
72.0
Anthropic
66.0
53
Kimi K2.6 Thinking
综合
70.5
推理
79.4
编程
78.6
智能体编程
46.9
数学
84.3
数据分析
65.1
语言
75.1
指令遵循
64.4
Moonshot AI开放权重
65.1
54
Gemini 3.5 Flash High
综合
74.6
推理
82.0
编程
78.2
智能体编程
49.0
数学
88.2
数据分析
64.9
语言
84.6
指令遵循
75.6
Google
64.9
55
Gemini 3.6 Flash High
综合
73.6
推理
85.1
编程
77.9
智能体编程
43.4
数学
86.4
数据分析
63.0
语言
83.9
指令遵循
75.4
Google
63.0
56
Kimi K2.7 Code
综合
68.4
推理
82.8
编程
74.0
智能体编程
45.7
数学
79.6
数据分析
62.7
语言
77.9
指令遵循
56.3
Moonshot AI开放权重
62.7
57
Grok 4.3
综合
62.3
推理
70.8
编程
69.9
智能体编程
18.5
数学
84.3
数据分析
55.8
语言
73.6
指令遵循
62.8
xAI
55.8
58
Nemotron 3 Ultra 550B A55B
综合
67.4
推理
74.7
编程
70.7
智能体编程
38.7
数学
88.7
数据分析
54.5
语言
70.8
指令遵循
73.4
NVIDIA开放权重
54.5
59
Gemini 3.8 Flash High
综合
75.8
推理
89.3
编程
72.5
智能体编程
54.2
数学
91.6
数据分析
54.0
语言
87.8
指令遵循
81.4
Google
54.0
60
Gemini 3.5 Flash-Lite High
综合
63.9
推理
60.2
编程
76.1
智能体编程
45.3
数学
73.7
数据分析
53.2
语言
71.8
指令遵循
67.2
Google
53.2

综合分来自 LiveBench 各类评测平均分。名次按本页所选维度排序,同分并列;搜索保留完整榜单名次。

这是已核验的公开快照,非实时榜单。成绩对应名称中标注的测试配置,不代表所有场景的使用效果;不同评测机构的分数不能直接混用。