查看: 5|回复: 0

谷歌 Gemini CLI 垫底!首个 AI 编程 Agent

[复制链接]

1万

主题

0

回帖

5万

积分

论坛元老

积分
59313
发表于 2026-5-14 22:36:08 | 显示全部楼层 |阅读模式
同一个 Claude Opus 4.7,放进 Cursor CLI 里能拿 61 分,放进 Claude Code 拿 60 分。

模型一样,工具不一样,结果就不一样。

第三方 AI 评测机构 Artificial Analysis 最近发布了首个「编程 Agent 全栈测评」。不只测模型,带着 Agent 工具一起测试。三个基准,包含 358 道题,修 bug、终端操作、读代码答题,三类能力。

以前的 AI 榜单都是分开的。模型是模型,工具是工具。

这次终于有人把「模型 + 工具」捆绑在一起测了。

结果有点意思。

【图片1】
Cursor CLI 搭配 Claude Opus 4.7,综合得分 61,全场第一。

Codex + GPT-5.5 和 Claude Code + Claude Opus 4.7,并列第二,60 分。接下来是 Cursor CLI 搭配 GPT-5.5,拿了 58 分。

差距其实不大,但也符合逻辑。同一个模型,换一套工具,分数就有差别。

以后选编程 Agent,别只看模型排行榜了。

开源阵营三个选手全部挤进前七。

智谱 GLM-5.1 + Claude Code 拿了 53 分,开源第一。Kimi K2.6 和 DeepSeek V4 Pro 紧随其后,各得 50 分。

相比于闭源模型,虽然还没追上,但差距已经是个位数了。

而且,这三个国产开源模型都要强于中等推理强度的 Claude Sonnet 4.6(49 分)。

谷歌这次的成绩不太好看。

Gemini CLI 搭配 Gemini 3.1 Pro,43 分。全场垫底。

Gemini 3.1 Pro 在模型综合榜单上排名不低。但放进自家的 Gemini CLI,编程实战成绩直接拉胯。

模型是一方面,但更大的问题,可能在于工具。

GitHub 上 Gemini CLI 的 issue 区最近也不太平。有开发者反馈,让 Gemini CLI 在游戏文件里改一个岛屿名字,搜了 15 分钟,改了 3 分钟。还有人简单问一句「你用的什么模型」,等了 13 分钟才回答。

只能说开发者工具这块,谷歌还差点火候。不论是反重力 Antigravity,还是 Gemini CLI。

除了性能,速度也很重要。
【图片2】
Claude Code 搭配 Claude Opus 4.7,平均每个任务 5.8 分钟,全场最快。

Cursor CLI + GPT-5.5 第二名,6.2 分钟。Codex + GPT-5.5 第三,7.1 分钟。

最慢的组合,是最快组合的 7 倍。

任务时长 7 倍的背后,是 token 用量的巨大差异。Claude Opus 4.7 平均每个任务消耗 170 万 token,Kimi K2.6 消耗 370 万,GLM-5.1 消耗 480 万。
【图片3】
Artificial Analysis 在报告里提到,GLM-5.1 token 消耗量大的部分原因,是模型在某些任务上陷入了循环。

如果考虑 token 成本,DeepSeek 是绝对的王者。
【图片4】
Cursor CLI + Composer 2(一个 Cursor 自研的模型),每个任务 0.07 美元。折合人民币大约 5 毛钱。

DeepSeek V4 Pro 搭配 Claude Code,0.35 美元。又强又便宜。

最贵的两个组合,Codex + GPT-5.5 要 2.21 美元,GLM-5.1 + Claude Code 要 2.26 美元。

最便宜和最贵的,相差大约 30 倍。

Composer 2 是一个有故事的模型。今年 3 月 Cursor 发布 Composer 2,不到 24 小时,就有开发者在 API 响应里扒出了模型 ID,写着 kimi-k2p5-rl-0317。

月之暗面官方随后在 X 上发帖祝贺,说「我们很自豪 Kimi K2.5 能成为 Composer 2 的基础。」Cursor 承认了,说在 Kimi K2.5 上做了大量持续预训练和强化学习。

这份榜单由三个基准测试构成。
【图片5】
SWE-Bench-Pro-Hard-AA,Scale AI 出品,150 道真实代码修复题,难度很大。

Terminal-Bench v2,Laude 研究院出品,84 道终端操作题,涵盖系统管理、密码学、机器学习。

SWE-Atlas-QnA,也是 Scale AI 出品,124 道代码理解题,问代码怎么运行的、bug 的根本原因是什么。

综合指数是三个基准各运行 3 遍取 pass@1 平均分。358 道题里,修 bug 占 42%,读代码占 35%,终端操作占 23%。

编程不是 AI 模型单打独斗。

同样的模型,放在不同的工具里体感可能截然不同。模型是发动机,工具是底盘,都会影响最终效果。

最后,榜单只能作为参考,一切以真实体验为准。

内容来源于互联网[玫瑰]






回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部