查看: 6|回复: 6

我把 7000 多篇 AI 顶会论文,整理成了一份可以被机器读懂的数据集,需要自取

[复制链接]

3

主题

3

回帖

15

积分

新手上路

积分
15
发表于 前天 22:29 | 显示全部楼层 |阅读模式
我是做 AI 研究的,经常为了确认一个实验设置,在几十篇 PDF 里来回翻。比方说我想知道某个方向常用哪些数据集、指标和训练方案,只能自己建表、自己比对。

但是,一篇论文动辄几十页,管线架构、算法模块、训练参数、算力消耗、表现指标和其他方法细节,都藏在正文、表格、图注和附录里。几千篇论文堆在一起,还没有目录:想找“用过同一组数据集、针对同一个 benchmark”的工作,只能手动翻,效率太慢了。

所以,借助自研的开源文档解析工具 Knowhere ,我把 AI 顶会论文批量整理为结构化数据,提取了关键实验参数,并在 🤗 Hugging Face 上开源了。已上线的 2023 年数据集覆盖 NeurIPS 、ICML 、ICLR 约 7300 篇论文,包含标题、摘要、作者、会议、研究主题、结构化内容摘要和语义向量,方便检索、筛选和发现相似论文。

需要的老哥可以自取: https://huggingface.co/datasets/JensCS/top-ml-conference-papers-2023





可能有些老哥不做科研这个方向,所以我先简单介绍一下数据集是干嘛的:

在研究和工程里,除了查找论文,还有一类像技术选型、方案比较这样的场景,比方说:这个方法是在什么条件下有效的?同类工作普遍采用什么指标?一项结果花了多少训练资源?不同论文的对比是否站在同一条起跑线上?

这些答案通常不在标题和摘要里,而在论文内部。我希望把这部分内容也逐步变得可查、可比。

直接让大模型读论文当然也有用,但逐篇对话并不能天然变成一个跨数千篇论文、可重复检索和横向比较的资料库。结构化数据做的,就是把“临时找答案”变成一套可以持续使用的索引,让论文里面的内容能被检索、被对比、被拿来算点什么。





OK ,那拿到数据集,具体可以怎么用呢?(不要觉得“顶会论文数据集”听着挺学术,其实它的用处不止在实验室里。)

- 刚入行的人可以把它当成一张地图——不用在几千篇论文里瞎逛,按年份、会议、主题扫一遍,就能看出一个方向是怎么冒出来、火起来、又分出几个流派的。

- 做产品、做投资研究的人可以用它分辨真趋势和假热点:一个概念突然被反复提起,是真的有突破,还是换了个新名字继续讲故事?把好几年的论文摆在一起看,答案通常比看新闻稿清楚得多。

- 工程团队选技术方案的时候,也不用只信一篇论文的结论,可以把几个方案用的数据、指标、训练成本摆在一起比一比,再决定要不要用。

- 老师、学生、做科普的人则能省掉不少手工整理的功夫——做个领域时间线、开门课的阅读清单,直接从数据里挑就行,不用从头一篇篇啃。

- 对审稿、复现研究和跨学科的 AI for Science 工作来说,这种横向比较同样有价值。过去需要手工做的资料整理,如今工作量减半了。

所以,这份数据集相当于把原来只有少数人能高效阅读的论文内容,变成大家都能查、都能懂的东西了。





除了给人用,这份数据还有一个更远一点的用途:给科研 Agent 当知识底座。

一个能打的科研 Agent ,至少要能查到前人做过什么,记住自己试过什么,并验证自己的结论,还要能随时检测最新的领域动向。我整理的这份结构化论文数据,恰好能解决其中的第一步:让 Agent 不必每次都从零翻 PDF ,也能查到论文里的方法、实验设置和结论,并把找到的信息追溯回原文。未来,它可以先从数据集中归纳某类任务的常见方案,再设计实验,与文献基线比较,并留下失败记录供下一轮参考。

当然,2023 年的数据只是个开头。接下来我会把 2024 到 2026 年的论文陆续补上,往具身智能以及 NSC 正刊和子刊这些方向扩展会议范围,也会挖得更深——实验参数、训练配置、论文之间的引用关系都在计划里。时间跨度拉长以后,这份数据能回答的就不只是“现在有哪些论文”,还能看出一个方向是怎么一步步变成现在这样的。

供大家参考。

最后,如果你觉得数据集喂 AI 这个想法很有用,但是 AI 研究和具身智能不是你的方向,那我也可以把工具介绍给你,就是这个项目 Knowhere ,开源的: https://knowhereto.ai/github?utm_source=v2ex

因为学术论文其实是文档解析里比较难啃的一类:多栏排版、复杂公式、跨页表格、图和图注分得老远,正文和附录之间还有大量互相引用。直接把 PDF 转成纯文本,很容易把阅读顺序打乱,表格和上下文也保不住。

所以,这个从文档识别、解析到 chunking 、embedding 再到最后形成 memory 一条龙服务的工具就很有用。Knowhere 会从解析和结构重建开始,识别文字、表格、图片、公式,把章节层级还原出来,并且尽量保住内容之间的关联。比如抽到“learning rate = 1e-4”这条信息,不是光记个数字,还会记得它是哪篇论文、哪组实验、哪个模型的参数。

然后是检索,在用户或者 Agent 提问以后,系统结合语义、文档结构和关联关系去找答案,再把结果指回原文的具体位置。就是它不是凭空给你答案的,它还会给你一条能回头核对的线索。对于做知识库或者数据集、Agent 开发,尤其是专家型的智能体开发,会很有用。

有需要的各位可以自取,有其他疑问也可以留言~
回复

使用道具 举报

6

主题

35

回帖

88

积分

注册会员

积分
88
发表于 前天 22:36 | 显示全部楼层
感觉这个给做“论文阅读工具”做“论文推荐检索”业务的很有用。
回复

使用道具 举报

0

主题

5

回帖

10

积分

新手上路

积分
10
发表于 前天 22:45 | 显示全部楼层
谢谢分享。
有点好奇 op 的工具和市面上的大模型的 Deep Research ,还有 Agent 工具自动任务执行对比,有何优势呢?
回复

使用道具 举报

0

主题

3

回帖

6

积分

新手上路

积分
6
发表于 前天 23:04 | 显示全部楼层
感谢分享,这个数据集应该挺有用的,不过想问下为什么选了 2023 年?
回复

使用道具 举报

3

主题

3

回帖

15

积分

新手上路

积分
15
 楼主| 发表于 前天 23:21 | 显示全部楼层
@wecan 因为 AI 大模型是从 23 年开始爆发的。
回复

使用道具 举报

0

主题

1

回帖

2

积分

新手上路

积分
2
发表于 昨天 00:19 | 显示全部楼层
大佬,我请教下你: 使用 knowhere 可以搜“材料科学与工程”方面的 EI 、SCI ,然后建模、建数据库吗?
回复

使用道具 举报

0

主题

2

回帖

4

积分

新手上路

积分
4
发表于 昨天 01:02 | 显示全部楼层
大佬牛,这也可以训练出来
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.

在本版发帖
返回顶部