查看: 6|回复: 0

牛了,Skills集齐了AI Agents四件套

[复制链接]

1万

主题

0

回帖

5万

积分

论坛元老

积分
59268
发表于 2026-7-7 19:28:53 | 显示全部楼层 |阅读模式
过去两年,很多人谈 AI Agent,第一反应还是:模型是不是更大、推理是不是更强、上下文是不是更长。
【图片1】Memory, Skills, Protocols 与 Harness Engineering
但这上交大&Oppo这篇综述给出的判断更像一次转向:AI Agent 真正变强,不只是因为模型本身更强,而是因为越来越多能力正在被搬到模型外面,变成可保存、可复用、可治理的运行环境。
【图片2】
论文把这件事叫作 externalization,可以翻成“外置化”。它的意思不是给模型外挂几个工具,而是把原本需要模型临场记住、临场发明、临场协调的东西,拆成外部结构:Memory 负责外置状态,Skills 负责外置流程经验,Protocols 负责外置交互规则,Harness 负责把它们组织成可控系统。

它解决的不是模型够不够聪明,而是聪明怎么稳定复用

这篇论文最有价值的地方,不是提出一个新 Agent 框架,而是给过去几年 Agent 研究画了一条线:从 weights,到 context,再到 harness。
【图片3】
第一阶段,大家把能力主要放在模型权重里。模型越大、训练越好,能力越强。这个阶段当然重要,但它有一个天然问题:权重里的知识很难选择性更新,也很难解释、审计和个性化。

第二阶段,能力开始转向上下文。Prompt、RAG、Chain-of-Thought、ReAct 等方法,本质上都是把模型需要的信息和任务结构放进输入里。论文把这解释成一种任务转换:模型不必“回忆”所有事实,只要“识别并使用”上下文里已经放好的材料。
【图片4】
但上下文也有边界:窗口有限,越长越贵,还可能出现信息被淹没的问题。于是第三阶段出现了:能力不再只放在模型或提示词里,而是放进一套长期运行的 harness。

这里的 harness 可以理解为 Agent 的工作台和操作系统:它包括文件、记忆库、工具注册表、权限、日志、评估、子 Agent 编排、失败恢复和审批流程。论文的核心判断是:成熟 Agent 的可靠性,越来越取决于这个外部环境,而不是单次模型调用。

能力外置具体外置了什么?

论文把 Agent 外置化拆成三个最核心的模块。
【图片5】
第一是 Memory:把状态外置。裸模型每次调用都像重新开始,长任务里的文件状态、失败经验、用户偏好、环境变化都很容易丢。外部记忆把这些信息保存下来,再在需要时筛选、压缩、召回。关键不是“存得越多越好”,而是让当前决策看见正确的过去。
【图片6】
第二是 Skills:把流程经验外置。很多 Agent 失败,不是因为不会某个动作,而是因为流程不稳定:该先检查的没检查,该重试的没重试,该停止的时候继续乱跑。Skill 的价值,就是把专家写好的步骤、判断规则和边界条件做成可复用包。这样模型面对任务时,不再每次从零发明工作流,而是在已有程序上组合和执行。
【图片7】
第三是 Protocols:把交互规则外置。Agent 要和工具、用户、其他 Agent、外部系统协作,只靠自然语言约定很脆弱。协议把发现、调用、授权、返回格式和生命周期变成机器可读的契约。论文提到的 MCP、A2A、AG-UI 这类方向,本质上都是让 Agent 的交互从“临场沟通”变成可验证、可治理的接口规则。
【图片8】
这三者不是孤立组件。记忆会影响技能选择,技能执行会产生新的记忆,协议会约束行动并把结果标准化写回系统。论文用一张图总结了这种耦合关系:Memory、Skills、Protocols 互相强化,而 Harness 负责调度、约束和观察整个循环。

最后

模型仍然是核心推理引擎,但对 Agent 来说,真正把能力变成可长期使用的产品,靠的是模型外那套可管理的认知基础设施。
【图片9】论文标题: Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering
论文链接: https://arxiv.org/abs/2604.08224v1

内容来源于互联网[玫瑰]










回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部