• 请不要在回答技术问题时复制粘贴 AI 生成的内容
EasonIndie
0.11D
V2EX  ›  程序员

我要结构化入库一本书《内科学 十四五 第十版.pdf》

  •  
  •   EasonIndie · 2h 54m ago · 694 views

    现在的做法是按照目录切分成块,后面想根据不同疾病来抽取书本知识,这一步计划工程做,然后组装 prompt 给大模型出针对某个疾病的专业的学习资料+考核题目+模拟接诊。

    目前在结构化入库阶段

    但是其中的图标怎么解析与什么样数据结构存比较好呢? V 友有没有经验的,望不吝赐教(抱拳)

    以下是几个典型的图,我让 ai 给 coding 出解析脚本一直不理想。

    4 replies    2026-09-24 10:38:43 +08:00
    maocat
        1
    maocat  
       2h 29m ago
    `根据不同疾病来抽取书本知识`

    那只能用 GrapRAG 了

    图和表的处理,一般就是提取文字,再加上 vlm 对图表的描述,建议提取的表格要保持结构(markdown/html table)
    mx2dream
        2
    mx2dream  
       1h 6m ago
    我参与过类似的项目,如果你要求精准度,就不是一个人能完成的,很麻烦,费时费力。需要换个思路,不要被这个 PDF 限制了,关注目标而不是一定通过某种方式实现,可识别文本+专业题库 API+人工校对。不要想着一键提取。这种教材原版一般也是 Word 转 PDF 制成的,然后由排版设计完成最后一步
    wroyal
        3
    wroyal  
       59 mins ago
    关注这个实现方式,最近也有这个需求,需要结构化一个知识库
    zhangli2946
        4
    zhangli2946  
       39 mins ago
    1. 先试试 IMA (tencent)
    2. 如有本地化要求,试试 IMA 的开源版本,自托管一下。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5639 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 32ms · UTC 03:17 · PVG 11:17 · LAX 20:17 · JFK 23:17
    ♥ Do have faith in what you're doing.