zcbot/skills/literature/SKILL.md

4.6 KiB
Raw Blame History

name description
literature 检索、获取、合并与核验各类学术和技术出版物,包括期刊论文、书籍、书籍章节、会议论文、学位论文、技术报告、标准、专利、预印本及未来接入的其他出版物。适用于主题检索、精确题名/作者/DOI/ISBN/标准号查找、全文获取、跨来源去重、引文真实性和论断支撑度核验;按任务选择 paper_server、内部材料知识库及其他可用来源。不用于从零撰写论文、标准、专利或科研简报。

Literature

把出版物视为统一检索对象,把 paper_server、内部材料知识库和未来来源视为可替换的数据后端。按用户问题选择来源、证据深度和输出形式,不按来源拆成多个 skill。

边界

  • 本 skill 负责发现、精确查找、题录识别、原件获取、跨源去重和证据核验。
  • 论文、书籍、章节、会议论文、学位论文、报告、标准、专利和预印本都可作为候选;新类型保留来源原始类型,不强行归为论文。
  • 写论文或综述使用 paper,生成科研简报使用 brief,写标准使用 standard,写专利交底书使用 patent;这些 skill 可消费本 skill 的证据。
  • 用户已提供文件或个人知识库路径时,直接读取该来源;只有任务要求补充、核验或扩展出版物时再检索。

按需读取

  • 任何任务先读 references/publication-model.md,统一类型、标识符、来源和证据字段。
  • 使用 paper_server 时读 references/source-paper-server.md
  • 使用内部材料知识库时读 references/source-materials-library.md
  • 合并两个以上来源或处理版本、章节、标准、专利时读 references/deduplication.md
  • 核验引文、数据、公式、表格、页码或具体论断时读 references/evidence-verification.md

来源选择

  • 材料主题、性能、配方、工艺、表征或全文语义检索:优先内部材料知识库。
  • DOI、题名、作者、期刊、年份、出版物类型或跨学科发现paper_search 可用时优先 paper_server
  • 系统调研、综述、重要引用或关键论断:并查可用来源。
  • 用户指定来源:只查指定来源,除非该来源无法满足用户要求并需要说明降级方案。
  • 某一路不可用:继续使用其他来源,并明确实际覆盖范围。

出版物类型与来源是正交字段。例如一本书可来自内部材料库,一篇论文可同时来自两个后端;来源不同不等于出版物不同。

工作流

  1. 识别任务是主题发现、精确查找、原件获取还是论断核验;提取类型、主题、时间、作者、载体和标识符约束。

  2. 形成少量有区分度的中英文查询。英文题名占多数的来源优先使用标准英文术语,同时保留缩写、全称和必要同义词。

  3. 按来源规则搜索并筛选候选。题名只用于初筛;摘要、正文片段或全文决定能否支持具体论断。

  4. 将多来源原始结果分别保存为 JSON需要合并时运行

    python <skill_dir>/scripts/merge_publications.py \
      --input paper_server=raw-paper-server.json \
      --input materials_library=raw-materials-library.json \
      --output publications.json
    
  5. 只对精确标识或完全一致的题名、主要责任者和年份自动合并;疑似重复保留并标记。不同版次、章节、标准修订版和专利族成员不得直接覆盖。

  6. 根据问题所需深度读取摘要、片段或全文。下载原件但没有实际读取,不得写成“全文已核对”。

  7. 输出真实题名、责任者、年份、载体、标识符、来源和证据等级,并列出未核实字段、来源冲突和可能重复项。

证据等级

  • metadata_only:仅题录或标识符已核对。
  • abstract_verified:摘要已读取并核对。
  • snippet_verified:相关正文片段已读取并核对。
  • fulltext_verified:全文中的相关部分已读取并核对。

出版物真实存在不代表它支持当前论断。支撑不足时缩窄或删除论断,不修改证据迁就论断。

失败与真实性

  • 认证、网络或来源不可用时,指出具体来源和失败类型,不把单源失败写成全部文献不可用。
  • 未命中时可调整术语、语言、类型或过滤条件;没有新的检索思路时如实说明覆盖不足。
  • 只使用来源实际返回的题名、责任者、标识符、版本、页码和正文,不推测缺失字段。
  • 不把搜索摘要当作者摘要,不把目录命中当章节正文,不把下载成功当内容已经核验。