2026-10-02 · 本机实测 · 书族:针灸专著类(首个完成本)· 源:人卫《中医临床必读丛书(典藏版)》
| 项 | 值 |
|---|---|
| 源 EPUB | C:\Users\xy192\DSH云端备份\4-原始底本\epubtest\00-原始EPUB\中医临床必读丛书典藏版.epub |
| 书内范围 | spine 第 691–712 页(part0690.xhtml – part0711.xhtml),22 页 |
| 边界依据 | 本书 CIP 页 = 第 693 页;其前 2 页(691、692)为本书封面/内封(纯图片、0 字)。已修正旧边界(693–714)的两处问题:① 漏掉本书封面/内封;② 把下一本《脉经》的封面/内封(713、714)算了进来 |
| 落地库 | 临时库 _tmp-针灸大成-结构C(1642 片 / 234 篇文档),id 见 _tmp\books\jd_base.json |
| 未改动 | 原始 EPUB、旧「中医」库、检索开关、插件文件 |
边界修正已对全部 38 本合集内图书生成统一表:_tmp\five\boundaries_fixed.json(每本均为「CIP 页 −2」起步,38/38 通过图片页校验)。
体例:h1=卷,h2=篇/赋/门,h4=子目,h6=子目细分,div.h8=门内小标题;div.pCls=正文段(3961),div.jr_text_class_center=歌诀/居中行(1294),div.Picture+div.p_title=插图与图题(各 119),div.Table=表格(实为图片),div.sgc-toc-*=书内目录(521 个链接)。
源缺陷 1:卷标题误标。 源文件 h1 只正确标出「针灸大成卷之一」「针灸大成卷之十」;卷二~卷九 全部误标为「针灸大成卷之八」(EPUB 自带目录同样如此,本书 md 版亦然 → 属出版方文件缺陷,非抽取问题)。 处理:原文按源保留(h1 文本仍在其所属文档内,未改字);文档标题只用「篇名」,不使用错误的卷名。 按内容推定的真实卷次(仅供参考,未写入库内文本):
| 页 | 推定卷 | 首篇 |
|---|---|---|
| part0701 | 卷一 | 针道源流(针灸直指《素问》、《难经》) |
| part0702 | 卷二 | 周身经穴赋、百症赋、标幽赋、席弘赋、金针赋、玉龙赋、通玄指要赋、灵光赋、兰江赋、流注指微赋 |
| part0703 | 卷三 | 五运主病歌、六气为病歌、百穴法歌、十二经脉歌、玉龙歌、胜玉歌、杂病穴法歌…策(杨氏考卷) |
| part0704 | 卷四 | 仰人/伏人穴图、九针论、制针煮针、各家补泻、禁针禁灸歌、太乙九宫、人神禁忌 |
| part0705 | 卷五 | 十二经井穴图、井荥输原经合、徐氏子午流注逐日按时定穴歌、灵龟八法、八脉图并治症穴 |
| part0706 | 卷五(续) | 八脉图并治症穴(续)、八法手诀歌 |
| part0707 | 卷六 | 五脏六腑图、十四经经穴歌 + 考正穴法 |
| part0708 | 卷七 | 仰人/伏人经穴图、十四经脉长短、经外奇穴、穴同名异类 |
| part0709 | 卷八 | 穴法图(《神应经》)、诸风门…疮毒门、续增治法 |
| part0710 | 卷九 | 治症总要、东垣针法、名医治法、针邪秘要、灸法各论、杨氏医案 |
| part0711 | 卷十 | 保婴神术《按摩经》、小儿推拿诸法、补遗 |
源缺陷 2:表格是图片 —— div.Table 内只有一张 jpeg,无 HTML 表格行;已按图片占位保留(),文字未丢。
源缺陷 3:目录标记嵌套导致同一段文字被重复包两次。 本书内目录(part0700.xhtml,522 个元素)用嵌套 div 层层包含:sgc-toc-level-1 里已经含有其下 level-2/3/4 的全部链接文本,逐层重复。例:第 317 号 level-1 元素 3291 字,其内部第 318 号 level-2 元素 381 字是它的子串,同一批目录名因此在源文件里出现 2 次。 处理:目录整体并入「书目信息」篇,内容原样保留;无损核验改用「12 字滑窗全覆盖」判据(见第五节),不再用「元素文本多重集」判据(后者会因源文件重复计数而误报缺字)。
源缺陷 4:前置页/版权页/目录页混在正文流中。 part0690/0691(封面、内封,纯图片)、part0692(版权页+CIP)、part0700(本书内目录)原先与正文一起参与成条,目录里的书名、篇名会作为正文块被检索到。 处理(2026-10-02 复核决定):以上 4 页标记为「书目信息/目录」,从正文流中移出,合并成单独一篇(针灸大成·书目信息(封面·内封·版权页·目录)),篇首有固定标记行: 〔书目信息/目录〕本篇为封面、内封、版权页(CIP)与本书内目录,非正文;内容原样保留,仅供版本与书目核对。 文字一字未删,但不参与正文成条,检索时一眼可辨。「出版者的话」不属此列,它讲本丛书的整理原则与选目,仍作正文篇保留。
文档 = 篇(h2;书前 h1 序跋各自成篇)。单元 = 「条」,按小节体例自适应:
| 模式 | 判定 | 单元 | 例 |
|---|---|---|---|
| A 歌赋注解型 | 同篇内既有 ≤25 字短句又有长段 | 一条 = 歌句 + 紧随注解段 | 标幽赋、金针赋、通玄指要赋 |
| B 短行型 | 篇内正文行长中位 ≤60 字 | 连续短行按 ≤400 字打包,行不跨片断开;[第N]、一、等记录序号处断条 | 神应经诸风门/伤寒门、治症总要、十二经脉歌 |
| C 长段型 | 篇内正文行长中位 >60 字 | 一段 = 一条 | 针道源流、百症赋、目录 |
| D 考正穴法型 | 见 h4 考正穴法 之后的段落 | 一穴 = 一条(穴名+别名+定位+针灸法+主治,其后引文归本条) | 十四经 359 个穴条 |
h1/h2/h4/h6/h8 与紧随内容同片;连续标题合并。〔源:…〕 标记,逐条仍可回解;共 140 片含 ≥2 标记)。〔源:partNNNN.xhtml 元素N(锚点id)〕,切分片另在正文首行注入 针灸大成 · 篇名 上下文。splitBlocks 以空行为边界);再按每篇文档自身的字符预算收口一次。part0690/0691/0692/0700)整篇一片、不参与成条(见第二节源缺陷 4)。处置:只按白名单(本书实际经穴名表)判定起首;白名单之外的命中一律不拆分。 因此即使一片内出现多个「像穴名」的行首,也不得自动断成多条;确实需要拆分的,只认「白名单穴名+其后为独立定位描述」这一种结构。 本条已用实测核过:本书一片内含 2 个以上穴条起首 = 0 例(严格白名单判定与宽松正则判定皆为 0),即本轮未发生该误报;列为规则说明是为了避免在后续书籍(尤其古籍刻本点校质量差的)上误判。
| 事项 | 决定 | 落地位置 |
|---|---|---|
| EPUB 原文里的「针灸大成卷之八」 | 原样保留,一字不改(含卷二~卷九被误标的那些) | 各篇 h1 原文、以及书目信息篇里的书内目录 |
| 推定卷次(卷一~卷十) | 不写入正文;只作检索辅助 | ① 本文件第二节的表;② 库内文档元数据 |
| 元数据写法 | 「推定卷次:……(非原文、待核)」,必须与正文分开 | _tmp\books\jd_meta.json 的 inferred_juan / inferred_juan_note 字段(库内文档正文不含任何卷次推定) |
| 文档标题 | 只用篇名,不用(错误的)卷名 | 233 篇文档标题 |
| 源码缺陷标注 | 「源 EPUB 卷标题疑似错误」 | jd_meta.json 的 source_defect_juan 字段 |
一句话:卷次只作「推定/待核」元数据,不改正文。 这样既保住原文可追溯性,又给检索留了线索。
| 指标 | 结果 |
|---|---|
| 元素 → 文档 → 片 | 6645 → 233 → 1573(书目信息页并入 1 篇;短条合并后 1572,按篇预算收口补切 1) |
| 片长 中位 / 均值 / p90 / 最长 | 165 / 235 / 431 / 1811 字符 |
| 超 1824 字符的片 | 0 |
| 逐字无损(12 字滑窗全覆盖:原 XHTML 全部 6645 个元素的每一段 12 字都能在库内文本中找到) | ✅ 0 处缺口 |
| 入库:篇数 / 块数一致 / 逐篇无损 | 233 / 233、233 / 233、233 / 233 |
| 库内块数 | 1573(与送入片数一致) |
| 出处标记可回解(页码存在 + 元素号在范围内) | 1859 / 1859(书目信息篇的 34 条标记写作「元素 N」,早期核验正则不容空格而误计为超范围,已改正) |
| 图片占位 | 294(其中 .gif 字形图 62,jpeg 插图 232) |
| 跨条粘连(一片含 ≥2 个穴条起首) | 0 |
| 结构上的孤立小片(去标记后 ≤30 字符) | 19(图题+图、序末署名、短注) |
| 不足 50 字符的块 | 6(0.4%,均为完整短记录) |
| 考正穴法穴条 | 359 / 359(逐经吻合,见下) |
| 按每篇预算收口后超预算文档 | 0 |
上一版(书目信息修正前)为 234 篇 / 1642 片;本轮把 4 页书目信息页合并成 1 篇(其中目录原为 70 片,现 34 片),并把「逐字无损」判据换成 12 字滑窗全覆盖(原判据用元素文本多重集,会被源目录的嵌套重复计数误报)。
逐经穴条核对(本书为 359,标准十四经穴 361 —— 本书肝经未列「急脉」、督脉未列「中枢」,是《针灸大成》版本常态):
| 经 | 本书识别/应为 | 经 | 本书识别/应为 |
|---|---|---|---|
| 手太阴肺经 | 11 / 11 | 足太阳膀胱经 | 67 / 67 |
| 手阳明大肠经 | 20 / 20 | 足少阴肾经 | 27 / 27 |
| 足阳明胃经 | 45 / 45 | 手厥阴心包络经 | 9 / 9 |
| 足太阴脾经 | 21 / 21 | 手少阳三焦经 | 23 / 23 |
| 手少阴心经 | 9 / 9 | 足少阳胆经 | 44 / 44 |
| 手太阳小肠经 | 19 / 19 | 足厥阴肝经 | 13 / 13(无急脉) |
| 任脉 | 24 / 24 | 督脉 | 27 / 27(无中枢) |
检索 A/B(26 题,TopK=4,均限定本书)
| 单块精确命中 | 落空 | 命中块长中位 | |
|---|---|---|---|
| 新结构库(一句/一条/一穴成片) | 26 / 26 | 0 | 292 字符 |
| 旧「中医」库 md 版(约 1200 字一块) | 21 / 26 | 5 | 1207 字符 |
落空 5 题(旧库):十二经井穴图、禁针穴歌、席弘赋、灵光赋、杂病穴法歌 —— 均为旧 md 分块下被切成半条或丢失关键词。
工作区\抽查单-针灸大成-20261002.md)已经你转外部复核通过;本节以下为复核后的收尾记录。# 标题会转成块的 heading),不影响内容,也不影响逐字无损。.gif)是缺字位(例:口眼  斜),属「字形图提字」单独立项,本轮未处理。| 项 | 值 |
|---|---|
| 库 | 中医·结构优先 = 8bf27782-5f61-49c8-8d9a-af2b89158239(原「经络腧穴学·结构优先」改名,库 id 未变 → 检索开关无需再动) |
| 目录 | 针灸专著类 / 针灸大成(目录 id 见 _tmp\main_reorg.json) |
| 入库内容 | 正文 233 篇(1573 片 → 库内 1574 块)+ 处理记录 1 篇(本文件,31 块) |
| 入库核验 | 逐篇块数一致 232 / 233;唯一不一致即上述「书目信息篇 35 = 34 + 1 条上下文」;12 字滑窗全覆盖 0 缺口 |
| 临时验收库 | _tmp-针灸大成-结构C(5cde9779-…,同内容)保留备查;旧 73de11d4-… 已清空 |
_tmp\gen_jd.py(EPUB 元素级抽取 + 四模式成条 + 书目信息页分离 + 12 字滑窗无损自检 + 每篇预算收口)_tmp\verify_jd.py(临时库导入 + 逐篇块数/无损 + 12 字滑窗 + 出处回解)、_tmp\accept_jd.py(异常块 + 结构检查 + 32 条抽查单)、_tmp\retrieval_jd.py(A/B 检索)_tmp\main_reorg.py(主库改名 + 建目录 + 经络腧穴学迁入)、_tmp\import_jd_main.py(本导入主库 + 逐篇核验)_tmp\books\jd_docs\(233 篇文本)、jd_pieces.json(1573 片)、jd_meta.json(含推定卷次与源缺陷字段)、jd_pages.json、jd_stats.json、jd_units_diag.json、jd_verify.json、jd_retrieval.json、jd_elems_all.json_tmp\five\boundaries_fixed.json、_tmp\fix_boundaries.py本文件不含任何 API key 或凭据。