论坛
BBS
默认
简体中文
繁體中文
登录
全球主机MJJ交流论坛
»
论坛
›
主机交流
›
VPS综合讨论
›
谷歌 Gemini CLI 垫底!首个 AI 编程 Agent
返回列表
发新帖
查看:
5
|
回复:
0
谷歌 Gemini CLI 垫底!首个 AI 编程 Agent
[复制链接]
hlx
hlx
当前离线
积分
59313
1万
主题
0
回帖
5万
积分
论坛元老
论坛元老, 积分 59313, 距离下一级还需 9940686 积分
论坛元老, 积分 59313, 距离下一级还需 9940686 积分
积分
59313
关注TA
发消息
发表于 2026-5-14 22:36:08
|
显示全部楼层
|
阅读模式
同一个 Claude Opus 4.7,放进 Cursor CLI 里能拿 61 分,放进 Claude Code 拿 60 分。
模型一样,工具不一样,结果就不一样。
第三方 AI 评测机构 Artificial Analysis 最近发布了首个「编程 Agent 全栈测评」。不只测模型,带着 Agent 工具一起测试。三个基准,包含 358 道题,修 bug、终端操作、读代码答题,三类能力。
以前的 AI 榜单都是分开的。模型是模型,工具是工具。
这次终于有人把「模型 + 工具」捆绑在一起测了。
结果有点意思。
【图片1】
Cursor CLI 搭配 Claude Opus 4.7,综合得分 61,全场第一。
Codex + GPT-5.5 和 Claude Code + Claude Opus 4.7,并列第二,60 分。接下来是 Cursor CLI 搭配 GPT-5.5,拿了 58 分。
差距其实不大,但也符合逻辑。同一个模型,换一套工具,分数就有差别。
以后选编程 Agent,别只看模型排行榜了。
开源阵营三个选手全部挤进前七。
智谱 GLM-5.1 + Claude Code 拿了 53 分,开源第一。Kimi K2.6 和 DeepSeek V4 Pro 紧随其后,各得 50 分。
相比于闭源模型,虽然还没追上,但差距已经是个位数了。
而且,这三个国产开源模型都要强于中等推理强度的 Claude Sonnet 4.6(49 分)。
谷歌这次的成绩不太好看。
Gemini CLI 搭配 Gemini 3.1 Pro,43 分。全场垫底。
Gemini 3.1 Pro 在模型综合榜单上排名不低。但放进自家的 Gemini CLI,编程实战成绩直接拉胯。
模型是一方面,但更大的问题,可能在于工具。
GitHub 上 Gemini CLI 的 issue 区最近也不太平。有开发者反馈,让 Gemini CLI 在游戏文件里改一个岛屿名字,搜了 15 分钟,改了 3 分钟。还有人简单问一句「你用的什么模型」,等了 13 分钟才回答。
只能说开发者工具这块,谷歌还差点火候。不论是反重力 Antigravity,还是 Gemini CLI。
除了性能,速度也很重要。
【图片2】
Claude Code 搭配 Claude Opus 4.7,平均每个任务 5.8 分钟,全场最快。
Cursor CLI + GPT-5.5 第二名,6.2 分钟。Codex + GPT-5.5 第三,7.1 分钟。
最慢的组合,是最快组合的 7 倍。
任务时长 7 倍的背后,是 token 用量的巨大差异。Claude Opus 4.7 平均每个任务消耗 170 万 token,Kimi K2.6 消耗 370 万,GLM-5.1 消耗 480 万。
【图片3】
Artificial Analysis 在报告里提到,GLM-5.1 token 消耗量大的部分原因,是模型在某些任务上陷入了循环。
如果考虑 token 成本,DeepSeek 是绝对的王者。
【图片4】
Cursor CLI + Composer 2(一个 Cursor 自研的模型),每个任务 0.07 美元。折合人民币大约 5 毛钱。
DeepSeek V4 Pro 搭配 Claude Code,0.35 美元。又强又便宜。
最贵的两个组合,Codex + GPT-5.5 要 2.21 美元,GLM-5.1 + Claude Code 要 2.26 美元。
最便宜和最贵的,相差大约 30 倍。
Composer 2 是一个有故事的模型。今年 3 月 Cursor 发布 Composer 2,不到 24 小时,就有开发者在 API 响应里扒出了模型 ID,写着 kimi-k2p5-rl-0317。
月之暗面官方随后在 X 上发帖祝贺,说「我们很自豪 Kimi K2.5 能成为 Composer 2 的基础。」Cursor 承认了,说在 Kimi K2.5 上做了大量持续预训练和强化学习。
这份榜单由三个基准测试构成。
【图片5】
SWE-Bench-Pro-Hard-AA,Scale AI 出品,150 道真实代码修复题,难度很大。
Terminal-Bench v2,Laude 研究院出品,84 道终端操作题,涵盖系统管理、密码学、机器学习。
SWE-Atlas-QnA,也是 Scale AI 出品,124 道代码理解题,问代码怎么运行的、bug 的根本原因是什么。
综合指数是三个基准各运行 3 遍取 pass@1 平均分。358 道题里,修 bug 占 42%,读代码占 35%,终端操作占 23%。
编程不是 AI 模型单打独斗。
同样的模型,放在不同的工具里体感可能截然不同。模型是发动机,工具是底盘,都会影响最终效果。
最后,榜单只能作为参考,一切以真实体验为准。
内容来源于互联网[玫瑰]
回复
使用道具
举报
返回列表
发新帖
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖并转播
回帖后跳转到最后一页
浏览过的版块
水池
Archiver
|
手机版
|
小黑屋
|
全球主机MJJ交流论坛
Powered by
Discuz!
X5.0
© 2001-2026
Discuz! Team
.
在本版发帖
返回顶部
快速回复
返回顶部
返回列表