豆包的文件解析是怎么做的, 我想仿照做一个
原始需求是公司员工不想读招标文件, 只想摘要出其中最关键的信息, 比如商品/数量/规整等等我自己用 rag 做了一下, 感觉和豆包的解析效果差远了, 我还做了很对针对性的调整
豆包应该是一个通用的方式, 是用什么方式实现的呢, 我先要抄一下本地部署 写个文件解析的 MCP 服务,然后把文件内容读取出来塞给大模型总结,这样应该可以吧 @yongyuanfan2 把所有内容都给大模型的话 上下文不够, 只给部分的话, 不知道如何挑选哪部分 nothing is all 。把 ls findrg (ripgrep) grep cat/sed 工具开放给它。 我比较好奇的是,豆包能不能做到百分百正确 为什么不用腾讯的 ima copilot 一边读,一般压缩啊 一边读,一边压缩啊 我看了 workbuddy 的实现,我们有个合同( 600kb )要解析并做要素提取,他好像是直接使用 python 的 pdf 工具直接分页读大概,然后让 LLM 判断如何查找的 @Yishanshan 我自己按照这个思路试了一下,的确很快很准确
页:
[1]
2