查看: 10|回复: 10

做 DeepSeek Agent 近一个月,同步下 Orca 的进展

[复制链接]

1

主题

5

回帖

13

积分

新手上路

积分
13
发表于 2026-7-17 14:10:53 | 显示全部楼层 |阅读模式
上个月发帖说要做一个 DeepSeek-Native 的 Agent ( Orca ) https://www.v2ex.com/t/1222331

差不多块一个月了,来给 V 友们同步下进展:

这一个月 880 多个提交,Rust 从 3.9 万行涨到 18 万行,代码全部是 codex 、claude code 和 orca 自己写的。我的工作只有两件:提需求和定质量门禁。

先说门禁:

2300+ 个测试,其中 20 个契约测试套件,把 agent loop 、审批、provider 、shell 会话、子代理、workflow 这些边界锁死

需求先落 spec 再落 plan 才准动手,目前攒了 25 篇设计、60 篇实施计划

223 篇 release note ,204 篇带可复现的验证命令,有的直接附 TDD 红绿证据

发布链路:fmt / clippy -D warnings / 全量测试 → 四平台构建 → npm staging 冒烟 → 发布 → 发布后从 npm 和 GitHub 拉真实产物装上再跑一遍 → 真实 DeepSeek API 的端到端 gate

所以我不需要再盯着 agent 写代码,提了需求开 goal 模式直接做任务就好。为此我还做了一个多 agent 协同基座,这个后面有时间可以开源。
一个旁证:这个月 refactor 提交( 335 个)比 feat ( 182 个)还多——债是它自己主动还的。

我一直围绕全放手、自动化跑任务这个目标,通过这套流程来迭代,主要做了:

OS 级沙箱:Linux 优先 bwrap 隔离,降级 Landlock + seccomp ,都没有就拒绝执行,绝不裸跑; macOS 走 Seatbelt

陌生仓库默认只读断网,项目配置 / AGENTS.md / skills 全不加载,/trust 之后才放行

每个工具调用恰好一个终态,被打断的、状态不明的如实记录,续跑不会把"没跑完"当"跑完了"

goal 模式去掉轮数上限,换成停滞检测 + token 预算;报"完成"前必须真调过工具

跑着的任务丢后台,随便开新对话,要审批弹回来,重启能恢复

终端交互单独算一条线:145 个提交,TUI 从 8 千行到 2.8 万行。历史和实时视图分离(终端原生滚动)、鼠标选择 + OSC52 复制、任务面板、内联 diff 、上下文水位和压缩过程全程可见。长会话上万行 transcript 的场景下,滚动响应从 4s 优化到 5ms 左右

接下来继续打磨 runtime ,然后做 Windows 。

上个帖子评论区争过 harness 有没有价值。这次不辩了,这个帖子就是我的答案:模型负责写,harness 负责让我敢信它写的东西。

GitHub:github.com/echoVic/blade-deepseek

npm:npm install -g @blade-ai/orca

官网:orcaagent.dev
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 2026-7-17 14:29:36 | 显示全部楼层
比较好奇这些一共花费多少钱
回复

使用道具 举报

1

主题

13

回帖

29

积分

新手上路

积分
29
发表于 2026-7-17 14:32:42 | 显示全部楼层
其实问题不是否认 harness 的价值,而是如何做才是更有价值的 harness 。如何衡量每个机制、改动对于最终的产出到底是正向,还是负面作用。费效比是提升还是下降了。
回复

使用道具 举报

0

主题

3

回帖

6

积分

新手上路

积分
6
发表于 2026-7-17 14:33:39 | 显示全部楼层
还以为是这个 orca https://www.onorca.dev/
回复

使用道具 举报

1

主题

5

回帖

13

积分

新手上路

积分
13
 楼主| 发表于 2026-7-17 14:35:45 | 显示全部楼层
@zbinlin 上个月家里那台电脑消耗 200 多亿 token
回复

使用道具 举报

1

主题

5

回帖

13

积分

新手上路

积分
13
 楼主| 发表于 2026-7-17 14:37:03 | 显示全部楼层
@sentinelK 嗯嗯,所以从研发流程这里我是质量门禁先行,然后再开发。agent 设计部分就是一定要有 verifier
回复

使用道具 举报

0

主题

6

回帖

12

积分

新手上路

积分
12
发表于 2026-7-17 15:04:09 | 显示全部楼层
deepseek 自己已经在做 agent 了吧,大家自己搞三方的还有意义吗,比如还有那个 reasonix
回复

使用道具 举报

0

主题

4

回帖

8

积分

新手上路

积分
8
发表于 2026-7-17 15:18:31 | 显示全部楼层
哥们,你别光说提交与测试,能不能发发一下 bechmark 情况,对比任务结果,完成率等等。还说是你单纯的想发一下如果从头到尾开发一个 agent ?
回复

使用道具 举报

1

主题

5

回帖

13

积分

新手上路

积分
13
 楼主| 发表于 2026-7-17 15:19:25 | 显示全部楼层
@FrankAdler 这个项目发起其实比较早,当时 ds 还没铺天盖地的消息。从另一个角度来说,我想验证我自己这套全自动化的流程
回复

使用道具 举报

0

主题

9

回帖

18

积分

新手上路

积分
18
发表于 2026-7-17 15:23:11 | 显示全部楼层
所以其实特别是新项目,把基准、底线定好,让 AI 来执行,实际真的比我自己写的代码好。这点我也是深有感悟,
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部