跳到正文
把进展读清楚
开源

公开评测 · 按能力比较

AI 模型榜

按公开评测成绩比较模型。点击模型名称,查看各项能力分数和测试配置。

来源:LiveBench ↗评测版本 2026-06-25快照核验

编程榜 60 / 60 个模型配置

LiveBench 编程评测成绩,同分并列,搜索保留名次
名次模型与配置编程分数
1
Claude 5.5 Opus Thinking Max Effort
综合
83.2
推理
92.2
编程
89.3
智能体编程
71.7
数学
97.1
数据分析
80.3
语言
86.3
指令遵循
65.7
Anthropic
89.3
2
Claude Sonnet 5.5 xHigh Effort
综合
77.8
推理
86.8
编程
88.9
智能体编程
39.3
数学
96.7
数据分析
78.6
语言
83.4
指令遵循
70.5
Anthropic
88.9
3
Claude Fable 5.1 Max Effort
综合
83.4
推理
91.7
编程
86.4
智能体编程
66.1
数学
97.0
数据分析
80.3
语言
89.5
指令遵循
73.0
Anthropic
86.4
4
Claude Fable 5 Max Effort
综合
83.0
推理
89.7
编程
86.0
智能体编程
62.2
数学
96.0
数据分析
80.5
语言
90.7
指令遵循
75.8
Anthropic
86.0
5
GPT-5.6 Sol Max Effort
综合
81.0
推理
91.7
编程
83.9
智能体编程
56.2
数学
96.2
数据分析
79.8
语言
87.7
指令遵循
71.8
OpenAI
83.9
6
GPT-5.2 Codex
综合
74.0
推理
77.7
编程
83.6
智能体编程
49.4
数学
88.8
数据分析
78.2
语言
73.7
指令遵循
66.4
OpenAI
83.6
7
GPT-5.6 Luna Max Effort
综合
73.6
推理
85.6
编程
82.9
智能体编程
48.4
数学
87.2
数据分析
78.0
语言
72.6
指令遵循
60.1
OpenAI
82.9
8
GPT-5.5 Thinking xHigh Effort
综合
80.2
推理
89.7
编程
82.1
智能体编程
54.0
数学
95.9
数据分析
81.6
语言
87.4
指令遵循
70.7
OpenAI
82.1
8
Claude 4.7 Opus Thinking xHigh Effort
综合
76.5
推理
87.2
编程
82.1
智能体编程
50.7
数学
92.9
数据分析
78.3
语言
77.9
指令遵循
66.7
Anthropic
82.1
10
GPT-6 Sol Max Effort
综合
79.3
推理
88.7
编程
81.8
智能体编程
52.9
数学
96.4
数据分析
81.2
语言
85.3
指令遵循
68.6
OpenAI
81.8
10
Claude 4.8 Opus Thinking Max Effort
综合
76.2
推理
89.2
编程
81.8
智能体编程
50.5
数学
94.3
数据分析
66.0
语言
79.7
指令遵循
72.0
Anthropic
81.8
12
Claude 5 Opus Thinking Max Effort
综合
80.1
推理
91.2
编程
81.4
智能体编程
65.2
数学
95.7
数据分析
74.6
语言
88.7
指令遵循
63.8
Anthropic
81.4
12
Kimi K3
综合
79.2
推理
90.7
编程
81.4
智能体编程
62.2
数学
84.4
数据分析
78.7
语言
85.5
指令遵循
71.4
Moonshot AI开放权重
81.4
14
Muse Spark 1.3 xHigh Effort
综合
81.6
推理
89.7
编程
81.1
智能体编程
64.1
数学
95.9
数据分析
79.6
语言
82.8
指令遵循
78.0
Meta
81.1
15
Claude Sonnet 5 xHigh Effort
综合
76.0
推理
88.7
编程
80.7
智能体编程
59.4
数学
92.9
数据分析
71.7
语言
75.0
指令遵循
63.9
Anthropic
80.7
16
GPT-6 Astra Max Effort
综合
82.2
推理
92.7
编程
80.4
智能体编程
57.3
数学
96.8
数据分析
83.0
语言
89.4
指令遵循
75.6
OpenAI
80.4
16
GPT-6.1 Sol Max Effort
综合
81.6
推理
92.6
编程
80.4
智能体编程
54.5
数学
96.8
数据分析
82.7
语言
90.1
指令遵循
74.2
OpenAI
80.4
18
DeepSeek V4.1 Flash Max Effort
综合
81.1
推理
86.7
编程
80.0
智能体编程
77.3
数学
93.3
数据分析
79.3
语言
81.2
指令遵循
70.0
DeepSeek开放权重
80.0
19
GLM-5.2
综合
73.2
推理
78.6
编程
79.7
智能体编程
51.8
数学
89.8
数据分析
73.7
语言
76.2
指令遵循
62.3
Z.AI开放权重
79.7
19
Claude 4.5 Opus Thinking High Effort
综合
72.6
推理
80.1
编程
79.7
智能体编程
39.7
数学
90.4
数据分析
74.4
语言
81.3
指令遵循
62.5
Anthropic
79.7
21
Claude 4.6 Sonnet Thinking Medium Effort
综合
73.0
推理
84.8
编程
79.3
智能体编程
42.6
数学
87.0
数据分析
77.9
语言
76.1
指令遵循
63.2
Anthropic
79.3
22
GLM-5.3
综合
76.1
推理
85.8
编程
79.0
智能体编程
60.9
数学
87.9
数据分析
70.2
语言
79.9
指令遵循
69.3
Z.AI开放权重
79.0
22
GPT-6 Luna Max Effort
综合
72.0
推理
81.8
编程
79.0
智能体编程
51.2
数学
89.1
数据分析
73.4
语言
73.8
指令遵循
55.9
OpenAI
79.0
22
GLM-5.3 Flash
综合
71.6
推理
77.6
编程
79.0
智能体编程
56.8
数学
81.2
数据分析
76.4
语言
77.3
指令遵循
52.8
Z.AI开放权重
79.0
25
Gemini 3.7 Flash High
综合
78.8
推理
87.8
编程
78.9
智能体编程
58.3
数学
93.5
数据分析
68.0
语言
85.5
指令遵循
79.9
Google
78.9
26
Kimi K2.6 Thinking
综合
70.5
推理
79.4
编程
78.6
智能体编程
46.9
数学
84.3
数据分析
65.1
语言
75.1
指令遵循
64.4
Moonshot AI开放权重
78.6
27
GPT-5.6 Terra Max Effort
综合
77.9
推理
90.6
编程
78.2
智能体编程
54.9
数学
94.9
数据分析
79.3
语言
82.9
指令遵循
64.6
OpenAI
78.2
27
Gemini 3.5 Flash High
综合
74.6
推理
82.0
编程
78.2
智能体编程
49.0
数学
88.2
数据分析
64.9
语言
84.6
指令遵循
75.6
Google
78.2
27
Claude 4.6 Opus Thinking High Effort
综合
74.5
推理
88.7
编程
78.2
智能体编程
49.0
数学
89.3
数据分析
69.9
语言
83.3
指令遵循
63.3
Anthropic
78.2
27
Qwen 3.6 Plus
综合
68.9
推理
75.8
编程
78.2
智能体编程
41.4
数学
83.7
数据分析
69.9
语言
75.0
指令遵循
58.3
Alibaba
78.2
31
Gemini 3.6 Flash High
综合
73.6
推理
85.1
编程
77.9
智能体编程
43.4
数学
86.4
数据分析
63.0
语言
83.9
指令遵循
75.4
Google
77.9
32
GPT-5.4 Thinking xHigh Effort
综合
78.0
推理
88.1
编程
77.5
智能体编程
53.8
数学
94.1
数据分析
79.3
语言
82.6
指令遵循
70.2
OpenAI
77.5
32
Muse Spark 1.2 xHigh Effort
综合
78.0
推理
90.0
编程
77.5
智能体编程
57.6
数学
91.2
数据分析
76.5
语言
78.6
指令遵循
74.3
Meta
77.5
34
DeepSeek V4 Pro 0813
综合
77.4
推理
85.8
编程
77.2
智能体编程
54.9
数学
95.1
数据分析
79.2
语言
82.1
指令遵循
67.7
DeepSeek开放权重
77.2
34
Grok 4.7 xHigh
综合
77.4
推理
82.7
编程
77.2
智能体编程
54.0
数学
95.7
数据分析
76.9
语言
80.1
指令遵循
75.3
xAI
77.2
34
Muse Spark 1.1 xHigh Effort
综合
75.3
推理
87.7
编程
77.2
智能体编程
58.5
数学
87.1
数据分析
72.5
语言
74.3
指令遵循
69.6
Meta
77.2
34
Mistral Large 4 High
综合
71.8
推理
83.9
编程
77.2
智能体编程
57.2
数学
93.6
数据分析
76.5
语言
49.6
指令遵循
64.8
Mistral AI
77.2
38
Grok 4.6 xHigh
综合
78.0
推理
90.5
编程
76.8
智能体编程
57.0
数学
92.6
数据分析
73.9
语言
83.7
指令遵循
71.9
xAI
76.8
39
Gemini 3.1 Pro Preview High
综合
77.0
推理
84.0
编程
76.5
智能体编程
44.1
数学
91.0
数据分析
78.5
语言
85.4
指令遵循
79.1
Google
76.5
40
Claude Haiku 5.5 xHigh Effort
综合
72.1
推理
81.2
编程
76.4
智能体编程
51.4
数学
92.8
数据分析
72.8
语言
63.5
指令遵循
66.5
Anthropic
76.4
41
GPT-5.2 High
综合
74.6
推理
83.2
编程
76.1
智能体编程
50.3
数学
93.2
数据分析
78.2
语言
79.8
指令遵循
61.8
OpenAI
76.1
41
Gemini 3.5 Flash-Lite High
综合
63.9
推理
60.2
编程
76.1
智能体编程
45.3
数学
73.7
数据分析
53.2
语言
71.8
指令遵循
67.2
Google
76.1
43
ox-alpha-max
综合
69.2
推理
76.6
编程
75.8
智能体编程
52.6
数学
77.5
数据分析
75.8
语言
66.1
指令遵循
60.3
Stealth
75.8
44
Qwen3.8 27B
综合
75.3
推理
80.0
编程
75.7
智能体编程
61.4
数学
86.2
数据分析
76.6
语言
74.3
指令遵循
72.7
Alibaba开放权重
75.7
45
DeepSeek V4 Flash 0731
综合
74.2
推理
86.6
编程
75.0
智能体编程
46.8
数学
86.8
数据分析
79.3
语言
79.2
指令遵循
65.5
DeepSeek开放权重
75.0
46
Qwen 3.7 Max
综合
73.1
推理
83.3
编程
74.2
智能体编程
43.6
数学
85.2
数据分析
71.8
语言
79.7
指令遵循
74.0
Alibaba
74.2
47
Kimi K2.7 Code
综合
68.4
推理
82.8
编程
74.0
智能体编程
45.7
数学
79.6
数据分析
62.7
语言
77.9
指令遵循
56.3
Moonshot AI开放权重
74.0
48
Qwen 3.8 Max
综合
78.5
推理
88.2
编程
72.9
智能体编程
64.6
数学
91.3
数据分析
78.4
语言
79.7
指令遵循
74.1
Alibaba开放权重
72.9
49
Qwen 3.8 Flash Next
综合
76.2
推理
87.4
编程
72.6
智能体编程
61.6
数学
85.8
数据分析
74.2
语言
74.6
指令遵循
77.1
Alibaba开放权重
72.6
50
Gemini 3.8 Flash High
综合
75.8
推理
89.3
编程
72.5
智能体编程
54.2
数学
91.6
数据分析
54.0
语言
87.8
指令遵循
81.4
Google
72.5
51
Qwen 3.6 27B
综合
64.0
推理
70.3
编程
71.8
智能体编程
39.3
数学
79.9
数据分析
70.4
语言
63.3
指令遵循
53.2
Alibaba开放权重
71.8
52
GPT-5.4 Mini xHigh
综合
66.4
推理
71.3
编程
71.6
智能体编程
41.7
数学
78.5
数据分析
70.8
语言
71.0
指令遵循
59.8
OpenAI
71.6
53
Inkling xHigh Effort
综合
71.9
推理
78.3
编程
71.0
智能体编程
49.4
数学
88.4
数据分析
72.8
语言
73.5
指令遵循
70.1
Thinking Machines开放权重
71.0
54
GPT-5.4 Nano xHigh
综合
69.6
推理
81.1
编程
70.8
智能体编程
46.8
数学
91.0
数据分析
67.6
语言
62.5
指令遵循
67.2
OpenAI
70.8
55
Nemotron 3 Ultra 550B A55B
综合
67.4
推理
74.7
编程
70.7
智能体编程
38.7
数学
88.7
数据分析
54.5
语言
70.8
指令遵循
73.4
NVIDIA开放权重
70.7
56
Grok 4.3
综合
62.3
推理
70.8
编程
69.9
智能体编程
18.5
数学
84.3
数据分析
55.8
语言
73.6
指令遵循
62.8
xAI
69.9
57
Grok 4.5
综合
75.8
推理
87.2
编程
68.6
智能体编程
56.5
数学
90.8
数据分析
73.0
语言
82.8
指令遵循
71.5
xAI
68.6
58
DeepSeek V4 Flash Vision Exp
综合
76.8
推理
85.4
编程
68.2
智能体编程
65.1
数学
87.8
数据分析
79.5
语言
80.4
指令遵循
71.0
DeepSeek开放权重
68.2
58
Minimax M3
综合
67.3
推理
74.5
编程
68.2
智能体编程
40.7
数学
76.9
数据分析
76.2
语言
76.8
指令遵循
57.5
Minimax
68.2
60
Grok Build 0.1
综合
67.8
推理
76.4
编程
65.4
智能体编程
45.8
数学
78.4
数据分析
70.8
语言
72.5
指令遵循
65.2
xAI
65.4

综合分来自 LiveBench 各类评测平均分。名次按本页所选维度排序,同分并列;搜索保留完整榜单名次。

这是已核验的公开快照,非实时榜单。成绩对应名称中标注的测试配置,不代表所有场景的使用效果;不同评测机构的分数不能直接混用。