以御定为师 · 自动反推权重
把「程序按王力规则判非、而御定《全唐诗》著录为近体」的漏检诗反过来教公式:在特异护栏内自动搜索一组权重,最大化御定召回,并给出每处调整的语言学理由。数据或标注(含日后新版御定)一变,点"重新拟合"即得新公式。拟合对象为全库基准权重;拟合满意后仍可在下方按期做差异化微调。
特异护栏(负样判非下限):
拟合调整:
满意后可用页内「保存为自定义权重」固化
核心公式与参数边界
近体度 = 100 − w粘×失粘′ − w对×失对′ − w律×每行违律分 − w三平×三平尾 − w孤×孤平 − w未×未收录字 − 韵况扣分
′ = 次数 × min(1, 8/行数)(排律折算);每行违律分 = 含拗救得分 ÷ 行数;韵况按 同韵0 → 兼收字 → 邻韵 → 仄韵 → 无韵 递增扣分。
得分 ≥ 本期判级线 T1 → 公式近体;[T1−15, T1) → 公式存疑;<T1−15 → 公式非近体。第 23 轮起十项扣分权重亦可按期差异化(初唐格律未定、御定收诗从宽,可对失粘/邻韵更宽容;晚唐规则定型则可从严)。逐步算例见 docs/近体度计算手册.md,可用下方「单首试算」现场验证。
权重编辑器 改动后自动重算全库金标准验证
分期判级线 T1 得分过此线判"公式近体",各期独立
保存/回退需管理员登录;保存即写入 data/jinti-weights.custom.json(含各期差异化覆盖)并热更新辨析、数据中台与实时评分接口,删除该文件亦可回退。
指标怎么读(白话对照)
- 三个金标准集合
- A类=御定《全唐诗》标注为近体诗而王力程序标注为古体诗的诗——程序的漏检集,公式的任务是把它们收回来;均标近体诗=御定与程序都说"是"——公认近体,一首都不能丢;均标古体诗=双方都说"否"——公认非近体,被公式判成近体即误放。
- 召回 / 保留 / 越线 / 存疑带
- A类召回=A类中得分过线(判"公式近体")的比例,越高越好;均标近体诗保留=公认近体仍过线的比例,须 100%(掉了说明权重过严);均标古体诗越线=公认非近体反而过线的首数,越少越好(正常只剩太宗《帝京篇》等声律合格、御定按体裁编入古体的编排口径个案);存疑带=[T1−15, T1) 分数段,进带的诗分流给人工复核,不算收回也不算判非。
- 调权重时看什么
- 目标是A类召回升、均标近体诗保留 100% 不动、均标古体诗越线不增。三者互相牵制:一味调低扣分能抬召回,但会把公认非近体也放进来。下方「分期细览」把这套指标按初唐→唐末五代逐期给出;「扣分项作用面」告诉你每个权重实际在扣哪些诗、平均扣多少分——先看它主要落在 A类还是均标近体诗身上,再决定动哪个。
- 为什么权重可以按期不同
- 近体规则是渐次定型的:御定“近体诗”集内带失粘的诗,初唐占 26.3%、晚唐仅 2.6%。同一处失粘,在初唐是"宽格常态"、在晚唐是"明显破律",一刀切的扣分对两头都不公平。点上方期名页签,即可只对该期覆盖某几项权重(未覆盖的项自动跟随全库基准),判级线 T1 亦各期独立。