yizhiqianyan 发表于 8 小时前

直接手搓吧,完全不用框架顶多引入 openai 的 api 调用包,其他的 vibe 出来难度不大
基本结构就是 上下文管理 + tools + loop + 状态管理
还有上下文压缩也属于上下文管理
LLM 的接入一般都是 openai 格式的,但不同 LLM 还是会有一些差异需要微调和兼容

再往后就可以关注可观测性、恢复执行、执行沙箱(我也没玩到)、命令执行授权、记忆管理 大概记得的就这些了

先从最简单的 loop + tools 开始玩就行了, 搓出来后还是有一点正反馈的

ttsh 发表于 8 小时前

学完了发现这些东西都是现有 ai 编辑器有的功能,哈哈,我刚学完

ren7346 发表于 8 小时前

最近在看这个 https://yixiangshijie.github.io/ai-agents-in-action-2nd-edition-cn/#/

v2NPC 发表于 7 小时前

上手就完事儿了,没那么复杂pydantic-ai

AdminNB 发表于 7 小时前

1 、学的慢了可以不用学了,每过一段时间都会出新的概念,照着新概念去学,比如最开始的提示词工程、上下文管理、再到 Agent Loop 和 ReAct 、Harness 等等,照着新的学,新的包含了旧的
2 、不学框架。自己去实现调用过程,研究各个参数是干什么的,然后去手搓框架,照着这 3 种 api 去做兼容:Chat Completions API 、Responses API 、Messages API
4 、从基本的聊天开始,然后加上工具调用,就是写一些 read 、write 、grep 、glob 之类的工具,老项目接入 ai ,无非就是通过工具包装一下接口,ai 生成调用接口的参数,反正就是调 API ;
如果要接外部的工具,就去实现 MCP 协议,无非就是通过 jsonrpc 传递参数和工具名称之类的;
至于 RAG ,就是把文字变成向量然后去检索,找个向量库去试试,学一下切片策略,然后把向量库检索作为一个工具,这就变成了 Agentic RAG ;
然后就是 Skill 了,就是在提示词里把 skill 的名称、简介、路径放上,ai 去选择 read 等等工具,去读 markdown ,把读出来的内容放到上下文里;
接下来研究下上下文怎么控制、上下文怎么压缩之类的了
再往后就是任务规划、任务编排、记忆了,照着各个 agent 工具抄就行,比如,提供一个 todo-list 工具,让 ai 把规划好的任务和任务状态给存进去,让 ai 即使反馈和维护状态,就参考 superpower 、trellis ,去抄设计思路就完了;
5 、对着现有的功能去抄,比如抄 Codex 、OpenCode 、Claude Code 等等
6 、直接去读各个模型供应商的文档,碰到不懂的去查

menfrexu 发表于 6 小时前

https://github.com/Menfre01/waveloom 可供学习,从 0 到 1 撸出来的 code agent ,实际没有想象中难。花了两个月烧了 75 亿 token 从 0 经验开发出来

ntdll 发表于 6 小时前

原理可以先了解,然后手搓简单版本的试一下效果,比如 tool call 是怎么实现的

原理本质上并不复杂,AgentLoop 、ReAct 往简单了说就是 for/while 循环

但是没手搓过,可能对这个循环的概念并不深刻

menfrexu 发表于 6 小时前

可以看看我的 blog ,会 share code agent 一线开发的资料 https://github.com/Menfre01/waveloom-blog

yh7gdiaYW 发表于 6 小时前

最基本的原理就是个大循环,一直调大模型,大模型返回 tool call ,你执行完调用把结果塞回去,直到循环到大模型不返回 tool call 就结束了,输出结果。

原理没啥可看的,直接上框架

coderxy 发表于 6 小时前

我也写了 4 个月 agent 了, 到现在也没理解那些框架的意义在哪里。 特别是 langchain 这种,不就是组装个 llm 请求吗?
页: 1 [2] 3
查看完整版本: 从零学习 AI Agent,先学原理还是直接上框架?