跳到正文
把进展读清楚
开源

公开评测 · 按能力比较

AI 模型榜

按公开评测成绩比较模型。点击模型名称,查看各项能力分数和测试配置。

来源:LiveBench ↗评测版本 2026-06-25快照核验

智能体编程榜 60 / 60 个模型配置

LiveBench 智能体编程评测成绩,同分并列,搜索保留名次
名次模型与配置智能体编程分数
1
DeepSeek V4.1 Flash Max Effort
综合
81.1
推理
86.7
编程
80.0
智能体编程
77.3
数学
93.3
数据分析
79.3
语言
81.2
指令遵循
70.0
DeepSeek开放权重
77.3
2
Claude 5.5 Opus Thinking Max Effort
综合
83.2
推理
92.2
编程
89.3
智能体编程
71.7
数学
97.1
数据分析
80.3
语言
86.3
指令遵循
65.7
Anthropic
71.7
3
Claude Fable 5.1 Max Effort
综合
83.4
推理
91.7
编程
86.4
智能体编程
66.1
数学
97.0
数据分析
80.3
语言
89.5
指令遵循
73.0
Anthropic
66.1
4
Claude 5 Opus Thinking Max Effort
综合
80.1
推理
91.2
编程
81.4
智能体编程
65.2
数学
95.7
数据分析
74.6
语言
88.7
指令遵循
63.8
Anthropic
65.2
5
DeepSeek V4 Flash Vision Exp
综合
76.8
推理
85.4
编程
68.2
智能体编程
65.1
数学
87.8
数据分析
79.5
语言
80.4
指令遵循
71.0
DeepSeek开放权重
65.1
6
Qwen 3.8 Max
综合
78.5
推理
88.2
编程
72.9
智能体编程
64.6
数学
91.3
数据分析
78.4
语言
79.7
指令遵循
74.1
Alibaba开放权重
64.6
7
Muse Spark 1.3 xHigh Effort
综合
81.6
推理
89.7
编程
81.1
智能体编程
64.1
数学
95.9
数据分析
79.6
语言
82.8
指令遵循
78.0
Meta
64.1
8
Claude Fable 5 Max Effort
综合
83.0
推理
89.7
编程
86.0
智能体编程
62.2
数学
96.0
数据分析
80.5
语言
90.7
指令遵循
75.8
Anthropic
62.2
8
Kimi K3
综合
79.2
推理
90.7
编程
81.4
智能体编程
62.2
数学
84.4
数据分析
78.7
语言
85.5
指令遵循
71.4
Moonshot AI开放权重
62.2
10
Qwen 3.8 Flash Next
综合
76.2
推理
87.4
编程
72.6
智能体编程
61.6
数学
85.8
数据分析
74.2
语言
74.6
指令遵循
77.1
Alibaba开放权重
61.6
11
Qwen3.8 27B
综合
75.3
推理
80.0
编程
75.7
智能体编程
61.4
数学
86.2
数据分析
76.6
语言
74.3
指令遵循
72.7
Alibaba开放权重
61.4
12
GLM-5.3
综合
76.1
推理
85.8
编程
79.0
智能体编程
60.9
数学
87.9
数据分析
70.2
语言
79.9
指令遵循
69.3
Z.AI开放权重
60.9
13
Claude Sonnet 5 xHigh Effort
综合
76.0
推理
88.7
编程
80.7
智能体编程
59.4
数学
92.9
数据分析
71.7
语言
75.0
指令遵循
63.9
Anthropic
59.4
14
Muse Spark 1.1 xHigh Effort
综合
75.3
推理
87.7
编程
77.2
智能体编程
58.5
数学
87.1
数据分析
72.5
语言
74.3
指令遵循
69.6
Meta
58.5
15
Gemini 3.7 Flash High
综合
78.8
推理
87.8
编程
78.9
智能体编程
58.3
数学
93.5
数据分析
68.0
语言
85.5
指令遵循
79.9
Google
58.3
16
Muse Spark 1.2 xHigh Effort
综合
78.0
推理
90.0
编程
77.5
智能体编程
57.6
数学
91.2
数据分析
76.5
语言
78.6
指令遵循
74.3
Meta
57.6
17
GPT-6 Astra Max Effort
综合
82.2
推理
92.7
编程
80.4
智能体编程
57.3
数学
96.8
数据分析
83.0
语言
89.4
指令遵循
75.6
OpenAI
57.3
18
Mistral Large 4 High
综合
71.8
推理
83.9
编程
77.2
智能体编程
57.2
数学
93.6
数据分析
76.5
语言
49.6
指令遵循
64.8
Mistral AI
57.2
19
Grok 4.6 xHigh
综合
78.0
推理
90.5
编程
76.8
智能体编程
57.0
数学
92.6
数据分析
73.9
语言
83.7
指令遵循
71.9
xAI
57.0
20
GLM-5.3 Flash
综合
71.6
推理
77.6
编程
79.0
智能体编程
56.8
数学
81.2
数据分析
76.4
语言
77.3
指令遵循
52.8
Z.AI开放权重
56.8
21
Grok 4.5
综合
75.8
推理
87.2
编程
68.6
智能体编程
56.5
数学
90.8
数据分析
73.0
语言
82.8
指令遵循
71.5
xAI
56.5
22
GPT-5.6 Sol Max Effort
综合
81.0
推理
91.7
编程
83.9
智能体编程
56.2
数学
96.2
数据分析
79.8
语言
87.7
指令遵循
71.8
OpenAI
56.2
23
GPT-5.6 Terra Max Effort
综合
77.9
推理
90.6
编程
78.2
智能体编程
54.9
数学
94.9
数据分析
79.3
语言
82.9
指令遵循
64.6
OpenAI
54.9
23
DeepSeek V4 Pro 0813
综合
77.4
推理
85.8
编程
77.2
智能体编程
54.9
数学
95.1
数据分析
79.2
语言
82.1
指令遵循
67.7
DeepSeek开放权重
54.9
25
GPT-6.1 Sol Max Effort
综合
81.6
推理
92.6
编程
80.4
智能体编程
54.5
数学
96.8
数据分析
82.7
语言
90.1
指令遵循
74.2
OpenAI
54.5
26
Gemini 3.8 Flash High
综合
75.8
推理
89.3
编程
72.5
智能体编程
54.2
数学
91.6
数据分析
54.0
语言
87.8
指令遵循
81.4
Google
54.2
27
GPT-5.5 Thinking xHigh Effort
综合
80.2
推理
89.7
编程
82.1
智能体编程
54.0
数学
95.9
数据分析
81.6
语言
87.4
指令遵循
70.7
OpenAI
54.0
27
Grok 4.7 xHigh
综合
77.4
推理
82.7
编程
77.2
智能体编程
54.0
数学
95.7
数据分析
76.9
语言
80.1
指令遵循
75.3
xAI
54.0
29
GPT-5.4 Thinking xHigh Effort
综合
78.0
推理
88.1
编程
77.5
智能体编程
53.8
数学
94.1
数据分析
79.3
语言
82.6
指令遵循
70.2
OpenAI
53.8
30
GPT-6 Sol Max Effort
综合
79.3
推理
88.7
编程
81.8
智能体编程
52.9
数学
96.4
数据分析
81.2
语言
85.3
指令遵循
68.6
OpenAI
52.9
31
ox-alpha-max
综合
69.2
推理
76.6
编程
75.8
智能体编程
52.6
数学
77.5
数据分析
75.8
语言
66.1
指令遵循
60.3
Stealth
52.6
32
GLM-5.2
综合
73.2
推理
78.6
编程
79.7
智能体编程
51.8
数学
89.8
数据分析
73.7
语言
76.2
指令遵循
62.3
Z.AI开放权重
51.8
33
Claude Haiku 5.5 xHigh Effort
综合
72.1
推理
81.2
编程
76.4
智能体编程
51.4
数学
92.8
数据分析
72.8
语言
63.5
指令遵循
66.5
Anthropic
51.4
34
GPT-6 Luna Max Effort
综合
72.0
推理
81.8
编程
79.0
智能体编程
51.2
数学
89.1
数据分析
73.4
语言
73.8
指令遵循
55.9
OpenAI
51.2
35
Claude 4.7 Opus Thinking xHigh Effort
综合
76.5
推理
87.2
编程
82.1
智能体编程
50.7
数学
92.9
数据分析
78.3
语言
77.9
指令遵循
66.7
Anthropic
50.7
36
Claude 4.8 Opus Thinking Max Effort
综合
76.2
推理
89.2
编程
81.8
智能体编程
50.5
数学
94.3
数据分析
66.0
语言
79.7
指令遵循
72.0
Anthropic
50.5
37
GPT-5.2 High
综合
74.6
推理
83.2
编程
76.1
智能体编程
50.3
数学
93.2
数据分析
78.2
语言
79.8
指令遵循
61.8
OpenAI
50.3
38
GPT-5.2 Codex
综合
74.0
推理
77.7
编程
83.6
智能体编程
49.4
数学
88.8
数据分析
78.2
语言
73.7
指令遵循
66.4
OpenAI
49.4
38
Inkling xHigh Effort
综合
71.9
推理
78.3
编程
71.0
智能体编程
49.4
数学
88.4
数据分析
72.8
语言
73.5
指令遵循
70.1
Thinking Machines开放权重
49.4
40
Gemini 3.5 Flash High
综合
74.6
推理
82.0
编程
78.2
智能体编程
49.0
数学
88.2
数据分析
64.9
语言
84.6
指令遵循
75.6
Google
49.0
40
Claude 4.6 Opus Thinking High Effort
综合
74.5
推理
88.7
编程
78.2
智能体编程
49.0
数学
89.3
数据分析
69.9
语言
83.3
指令遵循
63.3
Anthropic
49.0
42
GPT-5.6 Luna Max Effort
综合
73.6
推理
85.6
编程
82.9
智能体编程
48.4
数学
87.2
数据分析
78.0
语言
72.6
指令遵循
60.1
OpenAI
48.4
43
Kimi K2.6 Thinking
综合
70.5
推理
79.4
编程
78.6
智能体编程
46.9
数学
84.3
数据分析
65.1
语言
75.1
指令遵循
64.4
Moonshot AI开放权重
46.9
44
DeepSeek V4 Flash 0731
综合
74.2
推理
86.6
编程
75.0
智能体编程
46.8
数学
86.8
数据分析
79.3
语言
79.2
指令遵循
65.5
DeepSeek开放权重
46.8
44
GPT-5.4 Nano xHigh
综合
69.6
推理
81.1
编程
70.8
智能体编程
46.8
数学
91.0
数据分析
67.6
语言
62.5
指令遵循
67.2
OpenAI
46.8
46
Grok Build 0.1
综合
67.8
推理
76.4
编程
65.4
智能体编程
45.8
数学
78.4
数据分析
70.8
语言
72.5
指令遵循
65.2
xAI
45.8
47
Kimi K2.7 Code
综合
68.4
推理
82.8
编程
74.0
智能体编程
45.7
数学
79.6
数据分析
62.7
语言
77.9
指令遵循
56.3
Moonshot AI开放权重
45.7
48
Gemini 3.5 Flash-Lite High
综合
63.9
推理
60.2
编程
76.1
智能体编程
45.3
数学
73.7
数据分析
53.2
语言
71.8
指令遵循
67.2
Google
45.3
49
Gemini 3.1 Pro Preview High
综合
77.0
推理
84.0
编程
76.5
智能体编程
44.1
数学
91.0
数据分析
78.5
语言
85.4
指令遵循
79.1
Google
44.1
50
Qwen 3.7 Max
综合
73.1
推理
83.3
编程
74.2
智能体编程
43.6
数学
85.2
数据分析
71.8
语言
79.7
指令遵循
74.0
Alibaba
43.6
51
Gemini 3.6 Flash High
综合
73.6
推理
85.1
编程
77.9
智能体编程
43.4
数学
86.4
数据分析
63.0
语言
83.9
指令遵循
75.4
Google
43.4
52
Claude 4.6 Sonnet Thinking Medium Effort
综合
73.0
推理
84.8
编程
79.3
智能体编程
42.6
数学
87.0
数据分析
77.9
语言
76.1
指令遵循
63.2
Anthropic
42.6
53
GPT-5.4 Mini xHigh
综合
66.4
推理
71.3
编程
71.6
智能体编程
41.7
数学
78.5
数据分析
70.8
语言
71.0
指令遵循
59.8
OpenAI
41.7
54
Qwen 3.6 Plus
综合
68.9
推理
75.8
编程
78.2
智能体编程
41.4
数学
83.7
数据分析
69.9
语言
75.0
指令遵循
58.3
Alibaba
41.4
55
Minimax M3
综合
67.3
推理
74.5
编程
68.2
智能体编程
40.7
数学
76.9
数据分析
76.2
语言
76.8
指令遵循
57.5
Minimax
40.7
56
Claude 4.5 Opus Thinking High Effort
综合
72.6
推理
80.1
编程
79.7
智能体编程
39.7
数学
90.4
数据分析
74.4
语言
81.3
指令遵循
62.5
Anthropic
39.7
57
Claude Sonnet 5.5 xHigh Effort
综合
77.8
推理
86.8
编程
88.9
智能体编程
39.3
数学
96.7
数据分析
78.6
语言
83.4
指令遵循
70.5
Anthropic
39.3
57
Qwen 3.6 27B
综合
64.0
推理
70.3
编程
71.8
智能体编程
39.3
数学
79.9
数据分析
70.4
语言
63.3
指令遵循
53.2
Alibaba开放权重
39.3
59
Nemotron 3 Ultra 550B A55B
综合
67.4
推理
74.7
编程
70.7
智能体编程
38.7
数学
88.7
数据分析
54.5
语言
70.8
指令遵循
73.4
NVIDIA开放权重
38.7
60
Grok 4.3
综合
62.3
推理
70.8
编程
69.9
智能体编程
18.5
数学
84.3
数据分析
55.8
语言
73.6
指令遵循
62.8
xAI
18.5

综合分来自 LiveBench 各类评测平均分。名次按本页所选维度排序,同分并列;搜索保留完整榜单名次。

这是已核验的公开快照,非实时榜单。成绩对应名称中标注的测试配置,不代表所有场景的使用效果;不同评测机构的分数不能直接混用。