← 返回首页
评测专题 · PinchBench
AI Coding Agent 实力排行
基于 PinchBench 标准化评测的 AI 编程 Agent 成功率排行,叠加 ModelPriceLab 已存挂牌价记录,帮助你对照评测表现与公开价格。
57 个模型· 15 项 Code & DevOps 任务· 价格叠加·
成功率排行榜
成功率 = 通过的标准化 OpenClaw Agent 任务数占比。分数通过自动检查 + LLM 评审综合评定。
#
模型
成功率
评测花费
Input / 1M
Output / 1M
1
#1
🦞Xiaomi MiMo-V2.5 Pro
xiaomi/mimo-v2.5-pro
成功率
98.0%
评测花费
11.39Input / 1M
$0.43Output / 1M
$0.872
#2
🦀Xiaomi MiMo-V2.5
xiaomi/mimo-v2.5
成功率
97.9%
评测花费
5.44Input / 1M
$0.14Output / 1M
$0.283
#3
🦐MiniMax M2.7
minimax/minimax-m2.7
成功率
96.2%
评测花费
2.08Input / 1M
$0.21Output / 1M
$0.844
#4
Claude Opus 4.7
anthropic/claude-opus-4.7
成功率
95.9%
评测花费
38.04Input / 1M
$2.50Output / 1M
$12.505
#5
ByteDance Seed 2.0 Lite
bytedance-seed/seed-2.0-lite
成功率
94.9%
评测花费
1.74Input / 1M
$0.25Output / 1M
$2.006
#6
GLM 5V Turbo
z-ai/glm-5v-turbo
成功率
94.9%
评测花费
12.81Input / 1M
$1.20Output / 1M
$4.007
#7
Claude Opus 4.8 Fast
anthropic/claude-opus-4.8-fast
成功率
94.5%
评测花费
159.60Input / 1M
$2.50Output / 1M
$12.508
#8
Claude Sonnet 4.6
anthropic/claude-sonnet-4.6
成功率
94.5%
评测花费
15.18Input / 1M
$1.50Output / 1M
$7.509
#9
DeepSeek-V4 Flash
deepseek/deepseek-v4-flash
成功率
94.0%
评测花费
0.88Input / 1M
$0.15Output / 1M
$0.6010
#10
Gemma 4 26B
google/gemma-4-26b-a4b-it
成功率
93.9%
评测花费
0.45Input / 1M
$0.07Output / 1M
$0.2311
#11
Qwen3.7 Max
qwen/qwen3.7-max
成功率
93.8%
评测花费
19.43Input / 1M
$1.48Output / 1M
$4.4212
#12
Grok 4.3
x-ai/grok-4.3
成功率
93.7%
评测花费
13.00Input / 1M
$1.25Output / 1M
$2.5013
#13
Gemma 4 31B
google/gemma-4-31b-it
成功率
93.6%
评测花费
1.03Input / 1M
$0.09Output / 1M
$0.3414
#14
Qwen3.6 Plus
qwen/qwen3.6-plus
成功率
93.6%
评测花费
6.97Input / 1M
$0.33Output / 1M
$1.9515
#15
Nemotron 3.5 Lightning 30B
nvidia/nemotron-3.5-lightning-30b-a3b
成功率
93.4%
评测花费
-Input / 1M
$0Output / 1M
$016
#16
Mistral Devstral 2512
mistralai/devstral-2512
成功率
93.4%
评测花费
2.30Input / 1M
$0.40Output / 1M
$2.0017
#17
Claude Opus 4.8
anthropic/claude-opus-4.8
成功率
92.8%
评测花费
80.10Input / 1M
$2.50Output / 1M
$12.5018
#18
GLM 5.1
z-ai/glm-5.1
成功率
92.6%
评测花费
-Input / 1M
$1.40Output / 1M
$4.4019
#19
DeepSeek-V4 Pro
deepseek/deepseek-v4-pro
成功率
92.3%
评测花费
-Input / 1M
$0.66Output / 1M
$1.9820
#20
GPT-5.5
openai/gpt-5.5
成功率
92.3%
评测花费
22.17Input / 1M
$2.50Output / 1M
$15.0021
#21
Gemini 3 Flash Preview
google/gemini-3-flash-preview
成功率
92.3%
评测花费
3.09Input / 1M
$0.50Output / 1M
$3.0022
#22
Nemotron 3 Ultra 550B
nvidia/nemotron-3-ultra-550b-a55b
成功率
92.0%
评测花费
-Input / 1M
$0.50Output / 1M
$2.2023
#23
Gemini 3.1 Flash Lite
google/gemini-3.1-flash-lite
成功率
91.3%
评测花费
3.79Input / 1M
$0.25Output / 1M
$1.5024
#24
GPT-5.6 Sol
openai/gpt-5.6-sol
成功率
90.9%
评测花费
65.60Input / 1M
$4.00Output / 1M
$20.0025
#25
Qwen3.6 Flash
qwen/qwen3.6-flash
成功率
89.9%
评测花费
12.59Input / 1M
$0.19Output / 1M
$1.1326
#26
Claude Haiku 4.5
anthropic/claude-haiku-4.5
成功率
89.8%
评测花费
1.69Input / 1M
$1.00Output / 1M
$5.0027
#27
Gemini 3.5 Flash
google/gemini-3.5-flash
成功率
89.8%
评测花费
25.84Input / 1M
$1.50Output / 1M
$9.0028
#28
Gemini 3.1 Pro Preview
google/gemini-3.1-pro-preview
成功率
89.6%
评测花费
15.84Input / 1M
$2.00Output / 1M
$12.0029
#29
Grok 4.5
x-ai/grok-4.5
成功率
89.5%
评测花费
6.15Input / 1M
$2.00Output / 1M
$6.0030
#30
Grok 4.20
x-ai/grok-4.20
成功率
89.4%
评测花费
16.68Input / 1M
$1.25Output / 1M
$2.5031
#31
Step 3.5 Flash
stepfun/step-3.5-flash
成功率
89.3%
评测花费
0.50Input / 1M
$0.10Output / 1M
$0.3032
#32
Sakana Fugu Ultra
sakana/fugu-ultra
成功率
89.0%
评测花费
86.11Input / 1M
$5.00Output / 1M
$30.0033
#33
GLM 5 Turbo
z-ai/glm-5-turbo
成功率
88.9%
评测花费
5.89Input / 1M
$1.20Output / 1M
$4.0034
#34
GPT-5.4
openai/gpt-5.4
成功率
88.3%
评测花费
10.38Input / 1M
$1.25Output / 1M
$7.5035
#35
Kimi K2.7 Code
moonshotai/kimi-k2.7-code
成功率
88.1%
评测花费
10.32Input / 1M
$0.67Output / 1M
$3.3536
#36
GPT-5.4 Mini
openai/gpt-5.4-mini
成功率
87.8%
评测花费
3.40Input / 1M
$0.38Output / 1M
$2.2537
#37
Trinity Large Thinking
arcee-ai/trinity-large-thinking
成功率
87.0%
评测花费
1.29Input / 1M
$0.25Output / 1M
$0.8038
#38
GPT-5.6 Luna
openai/gpt-5.6-luna
成功率
86.7%
评测花费
14.36Input / 1M
$0.10Output / 1M
$0.6039
#39
Aion 3.0
aion-labs/aion-3.0
成功率
85.8%
评测花费
30.26Input / 1M
$3.00Output / 1M
$6.0040
#40
Grok Build 0.1
x-ai/grok-build-0.1
成功率
85.8%
评测花费
19.03Input / 1M
$1.00Output / 1M
$2.0041
#41
Kimi K2.5
moonshotai/kimi-k2.5
成功率
83.4%
评测花费
2.77Input / 1M
$0.45Output / 1M
$2.2542
#42
Mistral Small 2603
mistralai/mistral-small-2603
成功率
82.8%
评测花费
2.17Input / 1M
$0.15Output / 1M
$0.6043
#43
GLM 5.2
z-ai/glm-5.2
成功率
81.9%
评测花费
18.20Input / 1M
$0.02Output / 1M
$16.0044
#44
Mistral Large 2512
mistralai/mistral-large-2512
成功率
81.8%
评测花费
0.48Input / 1M
$0.50Output / 1M
$1.5045
#45
Ling 2.6 1T
inclusionai/ling-2.6-1t
成功率
81.4%
评测花费
7.00Input / 1M
$0.02Output / 1M
$0.0646
#46
GPT-5.4 Nano
openai/gpt-5.4-nano
成功率
78.6%
评测花费
0.78Input / 1M
$0.20Output / 1M
$1.2547
#47
GPT-5.6 Terra
openai/gpt-5.6-terra
成功率
76.0%
评测花费
24.13Input / 1M
$1.00Output / 1M
$6.0048
#48
Trinity Large Preview
arcee-ai/trinity-large-preview
成功率
72.2%
评测花费
1.90Input / 1M
$0.25Output / 1M
$0.8049
#49
Nemotron 3 Super 120B
nvidia/nemotron-3-super-120b-a12b
成功率
67.0%
评测花费
-Input / 1M
$0.08Output / 1M
$0.4550
#50
GPT OSS 120B
openai/gpt-oss-120b
成功率
64.7%
评测花费
0.30Input / 1M
$0.04Output / 1M
$0.1751
#51
Amazon Nova 2 Lite V1
amazon/nova-2-lite-v1
成功率
50.8%
评测花费
0.84Input / 1M
$0.30Output / 1M
$2.5052
#52
GPT OSS 20B
openai/gpt-oss-20b
成功率
50.0%
评测花费
0.31Input / 1M
$0.02Output / 1M
$0.0953
#53
GPT-5.5 Pro
openai/gpt-5.5-pro
成功率
48.9%
评测花费
153.44Input / 1M
$15.00Output / 1M
$90.0054
#54
Claude Fable 5
anthropic/claude-fable-5
成功率
37.8%
评测花费
114.16Input / 1M
$10.00Output / 1M
$50.0055
#55
Claude Sonnet 4
anthropic/claude-sonnet-4
成功率
22.3%
评测花费
21.19Input / 1M
$3.00Output / 1M
$15.0056
#56
Llama 3.1 70B Instruct
meta-llama/llama-3.1-70b-instruct
成功率
19.0%
评测花费
5.00Input / 1M
$0.40Output / 1M
$0.4057
#57
Llama 4 Scout
meta-llama/llama-4-scout
成功率
8.4%
评测花费
0.24Input / 1M
$0.10Output / 1M
$0.30评测数据来源:PinchBench (pinchbench.com),每日自动同步,最新记录 2026-10-05。价格数据来源:ModelPriceLab。该排行榜仅供参考,不构成决策建议。
关于 PinchBench
PinchBench 是一个开源的 AI Agent 编程能力评测系统,使用 15 个 Code & DevOps 标准化任务测试 LLM 作为 OpenClaw 编程 Agent 的表现。与传统 LLM 基准测试不同,PinchBench 着重测试工具调用、多步推理、处理模糊指令的能力,以及实际交付结果。
工具调用
能否正确调用工具并传入合适参数
多步推理
能否把多个步骤串联起来完成复杂任务
真实场景
能否处理模糊指令和不完整信息
实际交付
是否真正创建了文件、发送了邮件、安排了日程
23 项评测任务
涵盖日历创建、代码编写、文档摘要、邮件分类、市场调研等真实场景。每项任务通过自动检查、LLM 评审或混合方式评分。
✅Sanity Check
自动评分📅Calendar Event
自动评分📈Stock Research
自动评分✍️Blog Writing
LLM 评审🌤️Weather Script
自动评分📄Doc Summary
LLM 评审🎤Conference Research
LLM 评审✉️Email Drafting
LLM 评审🧠Memory Retrieval
自动评分📁File Structure
自动评分🔄API Workflow
混合评分🔌Skill Install
自动评分🔍Skill Search
自动评分🎨Image Generation
混合评分🤖Humanize AI Text
LLM 评审📊Research Summary
LLM 评审📬Email Triage
混合评分🔎Email Search
混合评分🏢Market Research
混合评分📑CSV/Excel Analysis
混合评分👶ELI5 PDF Summary
LLM 评审📖Report Comprehension
自动评分💾Knowledge Persistence
混合评分关键发现
双满分领跑
Claude Opus 4.6 与 Inception Mercury 2 同获 100% 成功率;Claude Opus 4.8 Fast 以 94.5% 紧随其后。
Anthropic 深度霸榜
6 款 Claude 全部上榜,Top 13 占 5 席——从 Opus 4.6 (100%) 到 Haiku 4.5 (90.4%) 保持一致水准。
成本差 57 倍
DeepSeek-V4 Flash 成功率 91.5%、单次评测仅 $1.44;榜首梯队单次 $47–$165。成功率相近时价格值得优先比较。