查看: 12|回复: 12

豆包的文件解析是怎么做的, 我想仿照做一个

[复制链接]

1

主题

1

回帖

5

积分

新手上路

积分
5
发表于 2026-7-14 08:37:16 | 显示全部楼层 |阅读模式
原始需求是公司员工不想读招标文件, 只想摘要出其中最关键的信息, 比如商品/数量/规整等等

我自己用 rag 做了一下, 感觉和豆包的解析效果差远了, 我还做了很对针对性的调整

豆包应该是一个通用的方式, 是用什么方式实现的呢, 我先要抄一下本地部署
回复

使用道具 举报

0

主题

1

回帖

2

积分

新手上路

积分
2
发表于 2026-7-14 08:44:25 | 显示全部楼层
写个文件解析的 MCP 服务,然后把文件内容读取出来塞给大模型总结,这样应该可以吧
回复

使用道具 举报

1

主题

1

回帖

5

积分

新手上路

积分
5
 楼主| 发表于 2026-7-14 08:59:08 | 显示全部楼层
@yongyuanfan2 把所有内容都给大模型的话 上下文不够, 只给部分的话, 不知道如何挑选哪部分
回复

使用道具 举报

4

主题

36

回帖

84

积分

注册会员

积分
84
发表于 2026-7-14 09:20:47 | 显示全部楼层
nothing is all 。把 ls find  rg (ripgrep) grep cat/sed 工具开放给它。
回复

使用道具 举报

6

主题

35

回帖

88

积分

注册会员

积分
88
发表于 2026-7-14 09:32:37 | 显示全部楼层
我比较好奇的是,豆包能不能做到百分百正确
回复

使用道具 举报

0

主题

5

回帖

10

积分

新手上路

积分
10
发表于 2026-7-14 09:35:37 | 显示全部楼层
为什么不用腾讯的 ima copilot
回复

使用道具 举报

0

主题

13

回帖

26

积分

新手上路

积分
26
发表于 2026-7-14 09:38:46 | 显示全部楼层
一边读,一般压缩啊
回复

使用道具 举报

0

主题

13

回帖

26

积分

新手上路

积分
26
发表于 2026-7-14 09:38:55 | 显示全部楼层
一边读,一边压缩啊
回复

使用道具 举报

0

主题

9

回帖

18

积分

新手上路

积分
18
发表于 2026-7-14 09:46:19 | 显示全部楼层
我看了 workbuddy 的实现,我们有个合同( 600kb )要解析并做要素提取,他好像是直接使用 python 的 pdf 工具直接分页读大概,然后让 LLM 判断如何查找的
回复

使用道具 举报

0

主题

9

回帖

18

积分

新手上路

积分
18
发表于 2026-7-14 09:46:41 | 显示全部楼层
@Yishanshan 我自己按照这个思路试了一下,的确很快很准确
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部