跳到正文
把进展读清楚
开源

公开评测 · 按能力比较

AI 模型榜

按公开评测成绩比较模型。点击模型名称,查看各项能力分数和测试配置。

来源:LiveBench ↗评测版本 2026-06-25快照核验

语言榜 60 / 60 个模型配置

LiveBench 语言评测成绩,同分并列,搜索保留名次
名次模型与配置语言分数
1
Claude Fable 5 Max Effort
综合
83.0
推理
89.7
编程
86.0
智能体编程
62.2
数学
96.0
数据分析
80.5
语言
90.7
指令遵循
75.8
Anthropic
90.7
2
GPT-6.1 Sol Max Effort
综合
81.6
推理
92.6
编程
80.4
智能体编程
54.5
数学
96.8
数据分析
82.7
语言
90.1
指令遵循
74.2
OpenAI
90.1
3
Claude Fable 5.1 Max Effort
综合
83.4
推理
91.7
编程
86.4
智能体编程
66.1
数学
97.0
数据分析
80.3
语言
89.5
指令遵循
73.0
Anthropic
89.5
4
GPT-6 Astra Max Effort
综合
82.2
推理
92.7
编程
80.4
智能体编程
57.3
数学
96.8
数据分析
83.0
语言
89.4
指令遵循
75.6
OpenAI
89.4
5
Claude 5 Opus Thinking Max Effort
综合
80.1
推理
91.2
编程
81.4
智能体编程
65.2
数学
95.7
数据分析
74.6
语言
88.7
指令遵循
63.8
Anthropic
88.7
6
Gemini 3.8 Flash High
综合
75.8
推理
89.3
编程
72.5
智能体编程
54.2
数学
91.6
数据分析
54.0
语言
87.8
指令遵循
81.4
Google
87.8
7
GPT-5.6 Sol Max Effort
综合
81.0
推理
91.7
编程
83.9
智能体编程
56.2
数学
96.2
数据分析
79.8
语言
87.7
指令遵循
71.8
OpenAI
87.7
8
GPT-5.5 Thinking xHigh Effort
综合
80.2
推理
89.7
编程
82.1
智能体编程
54.0
数学
95.9
数据分析
81.6
语言
87.4
指令遵循
70.7
OpenAI
87.4
9
Claude 5.5 Opus Thinking Max Effort
综合
83.2
推理
92.2
编程
89.3
智能体编程
71.7
数学
97.1
数据分析
80.3
语言
86.3
指令遵循
65.7
Anthropic
86.3
10
Kimi K3
综合
79.2
推理
90.7
编程
81.4
智能体编程
62.2
数学
84.4
数据分析
78.7
语言
85.5
指令遵循
71.4
Moonshot AI开放权重
85.5
10
Gemini 3.7 Flash High
综合
78.8
推理
87.8
编程
78.9
智能体编程
58.3
数学
93.5
数据分析
68.0
语言
85.5
指令遵循
79.9
Google
85.5
12
Gemini 3.1 Pro Preview High
综合
77.0
推理
84.0
编程
76.5
智能体编程
44.1
数学
91.0
数据分析
78.5
语言
85.4
指令遵循
79.1
Google
85.4
13
GPT-6 Sol Max Effort
综合
79.3
推理
88.7
编程
81.8
智能体编程
52.9
数学
96.4
数据分析
81.2
语言
85.3
指令遵循
68.6
OpenAI
85.3
14
Gemini 3.5 Flash High
综合
74.6
推理
82.0
编程
78.2
智能体编程
49.0
数学
88.2
数据分析
64.9
语言
84.6
指令遵循
75.6
Google
84.6
15
Gemini 3.6 Flash High
综合
73.6
推理
85.1
编程
77.9
智能体编程
43.4
数学
86.4
数据分析
63.0
语言
83.9
指令遵循
75.4
Google
83.9
16
Grok 4.6 xHigh
综合
78.0
推理
90.5
编程
76.8
智能体编程
57.0
数学
92.6
数据分析
73.9
语言
83.7
指令遵循
71.9
xAI
83.7
17
Claude Sonnet 5.5 xHigh Effort
综合
77.8
推理
86.8
编程
88.9
智能体编程
39.3
数学
96.7
数据分析
78.6
语言
83.4
指令遵循
70.5
Anthropic
83.4
18
Claude 4.6 Opus Thinking High Effort
综合
74.5
推理
88.7
编程
78.2
智能体编程
49.0
数学
89.3
数据分析
69.9
语言
83.3
指令遵循
63.3
Anthropic
83.3
19
GPT-5.6 Terra Max Effort
综合
77.9
推理
90.6
编程
78.2
智能体编程
54.9
数学
94.9
数据分析
79.3
语言
82.9
指令遵循
64.6
OpenAI
82.9
20
Muse Spark 1.3 xHigh Effort
综合
81.6
推理
89.7
编程
81.1
智能体编程
64.1
数学
95.9
数据分析
79.6
语言
82.8
指令遵循
78.0
Meta
82.8
20
Grok 4.5
综合
75.8
推理
87.2
编程
68.6
智能体编程
56.5
数学
90.8
数据分析
73.0
语言
82.8
指令遵循
71.5
xAI
82.8
22
GPT-5.4 Thinking xHigh Effort
综合
78.0
推理
88.1
编程
77.5
智能体编程
53.8
数学
94.1
数据分析
79.3
语言
82.6
指令遵循
70.2
OpenAI
82.6
23
DeepSeek V4 Pro 0813
综合
77.4
推理
85.8
编程
77.2
智能体编程
54.9
数学
95.1
数据分析
79.2
语言
82.1
指令遵循
67.7
DeepSeek开放权重
82.1
24
Claude 4.5 Opus Thinking High Effort
综合
72.6
推理
80.1
编程
79.7
智能体编程
39.7
数学
90.4
数据分析
74.4
语言
81.3
指令遵循
62.5
Anthropic
81.3
25
DeepSeek V4.1 Flash Max Effort
综合
81.1
推理
86.7
编程
80.0
智能体编程
77.3
数学
93.3
数据分析
79.3
语言
81.2
指令遵循
70.0
DeepSeek开放权重
81.2
26
DeepSeek V4 Flash Vision Exp
综合
76.8
推理
85.4
编程
68.2
智能体编程
65.1
数学
87.8
数据分析
79.5
语言
80.4
指令遵循
71.0
DeepSeek开放权重
80.4
27
Grok 4.7 xHigh
综合
77.4
推理
82.7
编程
77.2
智能体编程
54.0
数学
95.7
数据分析
76.9
语言
80.1
指令遵循
75.3
xAI
80.1
28
GLM-5.3
综合
76.1
推理
85.8
编程
79.0
智能体编程
60.9
数学
87.9
数据分析
70.2
语言
79.9
指令遵循
69.3
Z.AI开放权重
79.9
29
GPT-5.2 High
综合
74.6
推理
83.2
编程
76.1
智能体编程
50.3
数学
93.2
数据分析
78.2
语言
79.8
指令遵循
61.8
OpenAI
79.8
30
Qwen 3.8 Max
综合
78.5
推理
88.2
编程
72.9
智能体编程
64.6
数学
91.3
数据分析
78.4
语言
79.7
指令遵循
74.1
Alibaba开放权重
79.7
30
Claude 4.8 Opus Thinking Max Effort
综合
76.2
推理
89.2
编程
81.8
智能体编程
50.5
数学
94.3
数据分析
66.0
语言
79.7
指令遵循
72.0
Anthropic
79.7
30
Qwen 3.7 Max
综合
73.1
推理
83.3
编程
74.2
智能体编程
43.6
数学
85.2
数据分析
71.8
语言
79.7
指令遵循
74.0
Alibaba
79.7
33
DeepSeek V4 Flash 0731
综合
74.2
推理
86.6
编程
75.0
智能体编程
46.8
数学
86.8
数据分析
79.3
语言
79.2
指令遵循
65.5
DeepSeek开放权重
79.2
34
Muse Spark 1.2 xHigh Effort
综合
78.0
推理
90.0
编程
77.5
智能体编程
57.6
数学
91.2
数据分析
76.5
语言
78.6
指令遵循
74.3
Meta
78.6
35
Claude 4.7 Opus Thinking xHigh Effort
综合
76.5
推理
87.2
编程
82.1
智能体编程
50.7
数学
92.9
数据分析
78.3
语言
77.9
指令遵循
66.7
Anthropic
77.9
35
Kimi K2.7 Code
综合
68.4
推理
82.8
编程
74.0
智能体编程
45.7
数学
79.6
数据分析
62.7
语言
77.9
指令遵循
56.3
Moonshot AI开放权重
77.9
37
GLM-5.3 Flash
综合
71.6
推理
77.6
编程
79.0
智能体编程
56.8
数学
81.2
数据分析
76.4
语言
77.3
指令遵循
52.8
Z.AI开放权重
77.3
38
Minimax M3
综合
67.3
推理
74.5
编程
68.2
智能体编程
40.7
数学
76.9
数据分析
76.2
语言
76.8
指令遵循
57.5
Minimax
76.8
39
GLM-5.2
综合
73.2
推理
78.6
编程
79.7
智能体编程
51.8
数学
89.8
数据分析
73.7
语言
76.2
指令遵循
62.3
Z.AI开放权重
76.2
40
Claude 4.6 Sonnet Thinking Medium Effort
综合
73.0
推理
84.8
编程
79.3
智能体编程
42.6
数学
87.0
数据分析
77.9
语言
76.1
指令遵循
63.2
Anthropic
76.1
41
Kimi K2.6 Thinking
综合
70.5
推理
79.4
编程
78.6
智能体编程
46.9
数学
84.3
数据分析
65.1
语言
75.1
指令遵循
64.4
Moonshot AI开放权重
75.1
42
Claude Sonnet 5 xHigh Effort
综合
76.0
推理
88.7
编程
80.7
智能体编程
59.4
数学
92.9
数据分析
71.7
语言
75.0
指令遵循
63.9
Anthropic
75.0
42
Qwen 3.6 Plus
综合
68.9
推理
75.8
编程
78.2
智能体编程
41.4
数学
83.7
数据分析
69.9
语言
75.0
指令遵循
58.3
Alibaba
75.0
44
Qwen 3.8 Flash Next
综合
76.2
推理
87.4
编程
72.6
智能体编程
61.6
数学
85.8
数据分析
74.2
语言
74.6
指令遵循
77.1
Alibaba开放权重
74.6
45
Muse Spark 1.1 xHigh Effort
综合
75.3
推理
87.7
编程
77.2
智能体编程
58.5
数学
87.1
数据分析
72.5
语言
74.3
指令遵循
69.6
Meta
74.3
45
Qwen3.8 27B
综合
75.3
推理
80.0
编程
75.7
智能体编程
61.4
数学
86.2
数据分析
76.6
语言
74.3
指令遵循
72.7
Alibaba开放权重
74.3
47
GPT-6 Luna Max Effort
综合
72.0
推理
81.8
编程
79.0
智能体编程
51.2
数学
89.1
数据分析
73.4
语言
73.8
指令遵循
55.9
OpenAI
73.8
48
GPT-5.2 Codex
综合
74.0
推理
77.7
编程
83.6
智能体编程
49.4
数学
88.8
数据分析
78.2
语言
73.7
指令遵循
66.4
OpenAI
73.7
49
Grok 4.3
综合
62.3
推理
70.8
编程
69.9
智能体编程
18.5
数学
84.3
数据分析
55.8
语言
73.6
指令遵循
62.8
xAI
73.6
50
Inkling xHigh Effort
综合
71.9
推理
78.3
编程
71.0
智能体编程
49.4
数学
88.4
数据分析
72.8
语言
73.5
指令遵循
70.1
Thinking Machines开放权重
73.5
51
GPT-5.6 Luna Max Effort
综合
73.6
推理
85.6
编程
82.9
智能体编程
48.4
数学
87.2
数据分析
78.0
语言
72.6
指令遵循
60.1
OpenAI
72.6
52
Grok Build 0.1
综合
67.8
推理
76.4
编程
65.4
智能体编程
45.8
数学
78.4
数据分析
70.8
语言
72.5
指令遵循
65.2
xAI
72.5
53
Gemini 3.5 Flash-Lite High
综合
63.9
推理
60.2
编程
76.1
智能体编程
45.3
数学
73.7
数据分析
53.2
语言
71.8
指令遵循
67.2
Google
71.8
54
GPT-5.4 Mini xHigh
综合
66.4
推理
71.3
编程
71.6
智能体编程
41.7
数学
78.5
数据分析
70.8
语言
71.0
指令遵循
59.8
OpenAI
71.0
55
Nemotron 3 Ultra 550B A55B
综合
67.4
推理
74.7
编程
70.7
智能体编程
38.7
数学
88.7
数据分析
54.5
语言
70.8
指令遵循
73.4
NVIDIA开放权重
70.8
56
ox-alpha-max
综合
69.2
推理
76.6
编程
75.8
智能体编程
52.6
数学
77.5
数据分析
75.8
语言
66.1
指令遵循
60.3
Stealth
66.1
57
Claude Haiku 5.5 xHigh Effort
综合
72.1
推理
81.2
编程
76.4
智能体编程
51.4
数学
92.8
数据分析
72.8
语言
63.5
指令遵循
66.5
Anthropic
63.5
58
Qwen 3.6 27B
综合
64.0
推理
70.3
编程
71.8
智能体编程
39.3
数学
79.9
数据分析
70.4
语言
63.3
指令遵循
53.2
Alibaba开放权重
63.3
59
GPT-5.4 Nano xHigh
综合
69.6
推理
81.1
编程
70.8
智能体编程
46.8
数学
91.0
数据分析
67.6
语言
62.5
指令遵循
67.2
OpenAI
62.5
60
Mistral Large 4 High
综合
71.8
推理
83.9
编程
77.2
智能体编程
57.2
数学
93.6
数据分析
76.5
语言
49.6
指令遵循
64.8
Mistral AI
49.6

综合分来自 LiveBench 各类评测平均分。名次按本页所选维度排序,同分并列;搜索保留完整榜单名次。

这是已核验的公开快照,非实时榜单。成绩对应名称中标注的测试配置,不代表所有场景的使用效果;不同评测机构的分数不能直接混用。