我要结构化入库一本书《内科学 十四五 第十版.pdf》

2 小时 55 分钟前
 EasonIndie

现在的做法是按照目录切分成块,后面想根据不同疾病来抽取书本知识,这一步计划工程做,然后组装 prompt 给大模型出针对某个疾病的专业的学习资料+考核题目+模拟接诊。

目前在结构化入库阶段

但是其中的图标怎么解析与什么样数据结构存比较好呢? V 友有没有经验的,望不吝赐教(抱拳)

以下是几个典型的图,我让 ai 给 coding 出解析脚本一直不理想。

697 次点击
所在节点    程序员
5 条回复
maocat
2 小时 31 分钟前
`根据不同疾病来抽取书本知识`

那只能用 GrapRAG 了

图和表的处理,一般就是提取文字,再加上 vlm 对图表的描述,建议提取的表格要保持结构(markdown/html table)
mx2dream
1 小时 7 分钟前
我参与过类似的项目,如果你要求精准度,就不是一个人能完成的,很麻烦,费时费力。需要换个思路,不要被这个 PDF 限制了,关注目标而不是一定通过某种方式实现,可识别文本+专业题库 API+人工校对。不要想着一键提取。这种教材原版一般也是 Word 转 PDF 制成的,然后由排版设计完成最后一步
wroyal
1 小时 0 分钟前
关注这个实现方式,最近也有这个需求,需要结构化一个知识库
zhangli2946
40 分钟前
1. 先试试 IMA (tencent)
2. 如有本地化要求,试试 IMA 的开源版本,自托管一下。
qazzhouwei123
几秒前
你这些图表都算好处理的,提取文字是核心,确保 AI 能够用传统的文字方式检索到。那些没有文字的如风景图、人物图、抽象图才是真的麻烦,只能用 AI 模型单独跑图像识别

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://www.v2ex.com/t/1244392

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX