跳转到主要内容
ModelPriceLab

搜索模型价格

按模型、厂商或平台查找可核验费率。

← 返回首页
评测专题 · PinchBench

AI Coding Agent 实力排行

基于 PinchBench 标准化评测的 AI 编程 Agent 成功率排行,叠加 ModelPriceLab 已存挂牌价记录,帮助你对照评测表现与公开价格。

57 个模型· 15 项 Code & DevOps 任务· 价格叠加·

成功率排行榜

成功率 = 通过的标准化 OpenClaw Agent 任务数占比。分数通过自动检查 + LLM 评审综合评定。

#1
🦞Xiaomi MiMo-V2.5 Pro
xiaomi/mimo-v2.5-pro
成功率
98.0%
评测花费
11.39
Input / 1M
$0.43
Output / 1M
$0.87
#2
🦀Xiaomi MiMo-V2.5
xiaomi/mimo-v2.5
成功率
97.9%
评测花费
5.44
Input / 1M
$0.14
Output / 1M
$0.28
#3
🦐MiniMax M2.7
minimax/minimax-m2.7
成功率
96.2%
评测花费
2.08
Input / 1M
$0.21
Output / 1M
$0.84
#4
Claude Opus 4.7
anthropic/claude-opus-4.7
成功率
95.9%
评测花费
38.04
Input / 1M
$2.50
Output / 1M
$12.50
#5
ByteDance Seed 2.0 Lite
bytedance-seed/seed-2.0-lite
成功率
94.9%
评测花费
1.74
Input / 1M
$0.25
Output / 1M
$2.00
#6
GLM 5V Turbo
z-ai/glm-5v-turbo
成功率
94.9%
评测花费
12.81
Input / 1M
$1.20
Output / 1M
$4.00
#7
Claude Opus 4.8 Fast
anthropic/claude-opus-4.8-fast
成功率
94.5%
评测花费
159.60
Input / 1M
$2.50
Output / 1M
$12.50
#8
Claude Sonnet 4.6
anthropic/claude-sonnet-4.6
成功率
94.5%
评测花费
15.18
Input / 1M
$1.50
Output / 1M
$7.50
#9
DeepSeek-V4 Flash
deepseek/deepseek-v4-flash
成功率
94.0%
评测花费
0.88
Input / 1M
$0.15
Output / 1M
$0.60
#10
Gemma 4 26B
google/gemma-4-26b-a4b-it
成功率
93.9%
评测花费
0.45
Input / 1M
$0.07
Output / 1M
$0.23
#11
Qwen3.7 Max
qwen/qwen3.7-max
成功率
93.8%
评测花费
19.43
Input / 1M
$1.48
Output / 1M
$4.42
#12
Grok 4.3
x-ai/grok-4.3
成功率
93.7%
评测花费
13.00
Input / 1M
$1.25
Output / 1M
$2.50
#13
Gemma 4 31B
google/gemma-4-31b-it
成功率
93.6%
评测花费
1.03
Input / 1M
$0.09
Output / 1M
$0.34
#14
Qwen3.6 Plus
qwen/qwen3.6-plus
成功率
93.6%
评测花费
6.97
Input / 1M
$0.33
Output / 1M
$1.95
#15
Nemotron 3.5 Lightning 30B
nvidia/nemotron-3.5-lightning-30b-a3b
成功率
93.4%
评测花费
-
Input / 1M
$0
Output / 1M
$0
#16
Mistral Devstral 2512
mistralai/devstral-2512
成功率
93.4%
评测花费
2.30
Input / 1M
$0.40
Output / 1M
$2.00
#17
Claude Opus 4.8
anthropic/claude-opus-4.8
成功率
92.8%
评测花费
80.10
Input / 1M
$2.50
Output / 1M
$12.50
#18
GLM 5.1
z-ai/glm-5.1
成功率
92.6%
评测花费
-
Input / 1M
$1.40
Output / 1M
$4.40
#19
DeepSeek-V4 Pro
deepseek/deepseek-v4-pro
成功率
92.3%
评测花费
-
Input / 1M
$0.66
Output / 1M
$1.98
#20
GPT-5.5
openai/gpt-5.5
成功率
92.3%
评测花费
22.17
Input / 1M
$2.50
Output / 1M
$15.00
#21
Gemini 3 Flash Preview
google/gemini-3-flash-preview
成功率
92.3%
评测花费
3.09
Input / 1M
$0.50
Output / 1M
$3.00
#22
Nemotron 3 Ultra 550B
nvidia/nemotron-3-ultra-550b-a55b
成功率
92.0%
评测花费
-
Input / 1M
$0.50
Output / 1M
$2.20
#23
Gemini 3.1 Flash Lite
google/gemini-3.1-flash-lite
成功率
91.3%
评测花费
3.79
Input / 1M
$0.25
Output / 1M
$1.50
#24
GPT-5.6 Sol
openai/gpt-5.6-sol
成功率
90.9%
评测花费
65.60
Input / 1M
$4.00
Output / 1M
$20.00
#25
Qwen3.6 Flash
qwen/qwen3.6-flash
成功率
89.9%
评测花费
12.59
Input / 1M
$0.19
Output / 1M
$1.13
#26
Claude Haiku 4.5
anthropic/claude-haiku-4.5
成功率
89.8%
评测花费
1.69
Input / 1M
$1.00
Output / 1M
$5.00
#27
Gemini 3.5 Flash
google/gemini-3.5-flash
成功率
89.8%
评测花费
25.84
Input / 1M
$1.50
Output / 1M
$9.00
#28
Gemini 3.1 Pro Preview
google/gemini-3.1-pro-preview
成功率
89.6%
评测花费
15.84
Input / 1M
$2.00
Output / 1M
$12.00
#29
Grok 4.5
x-ai/grok-4.5
成功率
89.5%
评测花费
6.15
Input / 1M
$2.00
Output / 1M
$6.00
#30
Grok 4.20
x-ai/grok-4.20
成功率
89.4%
评测花费
16.68
Input / 1M
$1.25
Output / 1M
$2.50
#31
Step 3.5 Flash
stepfun/step-3.5-flash
成功率
89.3%
评测花费
0.50
Input / 1M
$0.10
Output / 1M
$0.30
#32
Sakana Fugu Ultra
sakana/fugu-ultra
成功率
89.0%
评测花费
86.11
Input / 1M
$5.00
Output / 1M
$30.00
#33
GLM 5 Turbo
z-ai/glm-5-turbo
成功率
88.9%
评测花费
5.89
Input / 1M
$1.20
Output / 1M
$4.00
#34
GPT-5.4
openai/gpt-5.4
成功率
88.3%
评测花费
10.38
Input / 1M
$1.25
Output / 1M
$7.50
#35
Kimi K2.7 Code
moonshotai/kimi-k2.7-code
成功率
88.1%
评测花费
10.32
Input / 1M
$0.67
Output / 1M
$3.35
#36
GPT-5.4 Mini
openai/gpt-5.4-mini
成功率
87.8%
评测花费
3.40
Input / 1M
$0.38
Output / 1M
$2.25
#37
Trinity Large Thinking
arcee-ai/trinity-large-thinking
成功率
87.0%
评测花费
1.29
Input / 1M
$0.25
Output / 1M
$0.80
#38
GPT-5.6 Luna
openai/gpt-5.6-luna
成功率
86.7%
评测花费
14.36
Input / 1M
$0.10
Output / 1M
$0.60
#39
Aion 3.0
aion-labs/aion-3.0
成功率
85.8%
评测花费
30.26
Input / 1M
$3.00
Output / 1M
$6.00
#40
Grok Build 0.1
x-ai/grok-build-0.1
成功率
85.8%
评测花费
19.03
Input / 1M
$1.00
Output / 1M
$2.00
#41
Kimi K2.5
moonshotai/kimi-k2.5
成功率
83.4%
评测花费
2.77
Input / 1M
$0.45
Output / 1M
$2.25
#42
Mistral Small 2603
mistralai/mistral-small-2603
成功率
82.8%
评测花费
2.17
Input / 1M
$0.15
Output / 1M
$0.60
#43
GLM 5.2
z-ai/glm-5.2
成功率
81.9%
评测花费
18.20
Input / 1M
$0.02
Output / 1M
$16.00
#44
Mistral Large 2512
mistralai/mistral-large-2512
成功率
81.8%
评测花费
0.48
Input / 1M
$0.50
Output / 1M
$1.50
#45
Ling 2.6 1T
inclusionai/ling-2.6-1t
成功率
81.4%
评测花费
7.00
Input / 1M
$0.02
Output / 1M
$0.06
#46
GPT-5.4 Nano
openai/gpt-5.4-nano
成功率
78.6%
评测花费
0.78
Input / 1M
$0.20
Output / 1M
$1.25
#47
GPT-5.6 Terra
openai/gpt-5.6-terra
成功率
76.0%
评测花费
24.13
Input / 1M
$1.00
Output / 1M
$6.00
#48
Trinity Large Preview
arcee-ai/trinity-large-preview
成功率
72.2%
评测花费
1.90
Input / 1M
$0.25
Output / 1M
$0.80
#49
Nemotron 3 Super 120B
nvidia/nemotron-3-super-120b-a12b
成功率
67.0%
评测花费
-
Input / 1M
$0.08
Output / 1M
$0.45
#50
GPT OSS 120B
openai/gpt-oss-120b
成功率
64.7%
评测花费
0.30
Input / 1M
$0.04
Output / 1M
$0.17
#51
Amazon Nova 2 Lite V1
amazon/nova-2-lite-v1
成功率
50.8%
评测花费
0.84
Input / 1M
$0.30
Output / 1M
$2.50
#52
GPT OSS 20B
openai/gpt-oss-20b
成功率
50.0%
评测花费
0.31
Input / 1M
$0.02
Output / 1M
$0.09
#53
GPT-5.5 Pro
openai/gpt-5.5-pro
成功率
48.9%
评测花费
153.44
Input / 1M
$15.00
Output / 1M
$90.00
#54
Claude Fable 5
anthropic/claude-fable-5
成功率
37.8%
评测花费
114.16
Input / 1M
$10.00
Output / 1M
$50.00
#55
Claude Sonnet 4
anthropic/claude-sonnet-4
成功率
22.3%
评测花费
21.19
Input / 1M
$3.00
Output / 1M
$15.00
#56
Llama 3.1 70B Instruct
meta-llama/llama-3.1-70b-instruct
成功率
19.0%
评测花费
5.00
Input / 1M
$0.40
Output / 1M
$0.40
#57
Llama 4 Scout
meta-llama/llama-4-scout
成功率
8.4%
评测花费
0.24
Input / 1M
$0.10
Output / 1M
$0.30

评测数据来源:PinchBench (pinchbench.com),每日自动同步,最新记录 2026-10-05。价格数据来源:ModelPriceLab。该排行榜仅供参考,不构成决策建议。

关于 PinchBench

PinchBench 是一个开源的 AI Agent 编程能力评测系统,使用 15 个 Code & DevOps 标准化任务测试 LLM 作为 OpenClaw 编程 Agent 的表现。与传统 LLM 基准测试不同,PinchBench 着重测试工具调用、多步推理、处理模糊指令的能力,以及实际交付结果。

工具调用
能否正确调用工具并传入合适参数
多步推理
能否把多个步骤串联起来完成复杂任务
真实场景
能否处理模糊指令和不完整信息
实际交付
是否真正创建了文件、发送了邮件、安排了日程

23 项评测任务

涵盖日历创建、代码编写、文档摘要、邮件分类、市场调研等真实场景。每项任务通过自动检查、LLM 评审或混合方式评分。

✅Sanity Check
自动评分
📅Calendar Event
自动评分
📈Stock Research
自动评分
✍️Blog Writing
LLM 评审
🌤️Weather Script
自动评分
📄Doc Summary
LLM 评审
🎤Conference Research
LLM 评审
✉️Email Drafting
LLM 评审
🧠Memory Retrieval
自动评分
📁File Structure
自动评分
🔄API Workflow
混合评分
🔌Skill Install
自动评分
🔍Skill Search
自动评分
🎨Image Generation
混合评分
🤖Humanize AI Text
LLM 评审
📊Research Summary
LLM 评审
📬Email Triage
混合评分
🔎Email Search
混合评分
🏢Market Research
混合评分
📑CSV/Excel Analysis
混合评分
👶ELI5 PDF Summary
LLM 评审
📖Report Comprehension
自动评分
💾Knowledge Persistence
混合评分

关键发现

双满分领跑

Claude Opus 4.6 与 Inception Mercury 2 同获 100% 成功率;Claude Opus 4.8 Fast 以 94.5% 紧随其后。

Anthropic 深度霸榜

6 款 Claude 全部上榜,Top 13 占 5 席——从 Opus 4.6 (100%) 到 Haiku 4.5 (90.4%) 保持一致水准。

成本差 57 倍

DeepSeek-V4 Flash 成功率 91.5%、单次评测仅 $1.44;榜首梯队单次 $47–$165。成功率相近时价格值得优先比较。

把评测分数和 API 价格放在一起看,才能做出更好的选型决策

在 ModelPriceLab 查看完整的价格矩阵、场景榜单和方案库,找到适合你业务的最优组合。