mythjava 发表于 2026-7-14 08:37:16

豆包的文件解析是怎么做的, 我想仿照做一个

原始需求是公司员工不想读招标文件, 只想摘要出其中最关键的信息, 比如商品/数量/规整等等

我自己用 rag 做了一下, 感觉和豆包的解析效果差远了, 我还做了很对针对性的调整

豆包应该是一个通用的方式, 是用什么方式实现的呢, 我先要抄一下本地部署

yongyuanfan2 发表于 2026-7-14 08:44:25

写个文件解析的 MCP 服务,然后把文件内容读取出来塞给大模型总结,这样应该可以吧

mythjava 发表于 2026-7-14 08:59:08

@yongyuanfan2 把所有内容都给大模型的话 上下文不够, 只给部分的话, 不知道如何挑选哪部分

skuuhui 发表于 2026-7-14 09:20:47

nothing is all 。把 ls findrg (ripgrep) grep cat/sed 工具开放给它。

YanSeven 发表于 2026-7-14 09:32:37

我比较好奇的是,豆包能不能做到百分百正确

since2021 发表于 2026-7-14 09:35:37

为什么不用腾讯的 ima copilot

peteretep 发表于 2026-7-14 09:38:46

一边读,一般压缩啊

peteretep 发表于 2026-7-14 09:38:55

一边读,一边压缩啊

Yishanshan 发表于 2026-7-14 09:46:19

我看了 workbuddy 的实现,我们有个合同( 600kb )要解析并做要素提取,他好像是直接使用 python 的 pdf 工具直接分页读大概,然后让 LLM 判断如何查找的

Yishanshan 发表于 2026-7-14 09:46:41

@Yishanshan 我自己按照这个思路试了一下,的确很快很准确
页: [1] 2
查看完整版本: 豆包的文件解析是怎么做的, 我想仿照做一个