zcbot/skills/literature/references/deduplication.md

31 lines
1.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# 出版物去重
自动合并必须保守。先规范化标识符,再按出版物类型选择键;不确定时保留两条并标记可能重复。
## 精确键
- 论文、预印本、章节:规范化 DOI。
- 书籍:规范化 ISBN 与版次;不同版次不合并。
- 会议论文DOI或完全一致的题名、主要责任者、会议和年份。
- 学位论文:完全一致的题名、作者、授予机构和年份。
- 标准:发布机构、标准号和年份或版本。
- 专利:公开号;申请号和专利族只用于关联。
- 技术报告:发布机构和报告号。
DOI 去除 `doi:`、`https://doi.org/`、空白和末尾标点并转为小写。ISBN 去除分隔符并统一 ISBN-10/13 表示。
## 无稳定标识符
只有规范化题名、主要责任者和年份完全一致时自动合并。题名高度相似但字段不全或存在冲突时,只加入 `possible_duplicates`
章节不得与整书合并;不同版本、译本、标准修订版和专利族成员不得因题名相似自动覆盖。
## 合并优先级
- 保留所有来源的 `backend``source_id`
- 正式标识元数据优先于文件名推断。
- 正文更完整的来源用于内容证据,但不因此覆盖另一来源更可靠的题录。
- 非空字段冲突时保留首条值并记录 `conflicts`,不静默改写。
使用 `scripts/merge_publications.py` 做机械规范化和精确合并。学术相关性、版本关系和论断支撑度仍由模型基于原始记录判断。