指南注入实测 · V5(四模型同尺对比)

验证假设:医生把专业临床指南发给大模型 → 模型据此制定更准确的后续治疗方案。
四个模型同一起跑线、同一套题、同一把尺子、同一种配对设计。

一句话结论
完全统一的评分标尺下,注入 2026 CBCS 指南后,四个模型的提升幅度高度一致——+6 ~ +10 分,没有任何一个模型出现"被指南救活"的戏剧性跃升。指南的作用是稳定的细节精校(AI 疗程不延长、免多基因检测、CDK4/6 无指征、随访间隔),而不是能力补足。指南无法修正模型对病例本身的误读(把"全切"误读为"保乳"→错荐放疗、把"3簇间质浸润"误读为"脉管瘤栓"→错判中危)。

0. 实验设计(四模型完全对等)

四个模型采用完全相同的设计:同一乳腺癌病例、同一简化指令、3 次独立运行同一会话内前后配对(第 1 轮不给指南 → 第 2 轮注入 2026 CBCS 指南原文),唯一变量 = 是否注入指南。每个模型取中位分没有对照组、没有参照系、没有任何模型被预设为强或弱。

模型3 次运行 (session)接口配对方式
DeepSeek V4 Pro819362bf · 5c76ec53 · 38e99fc1agent会话内前后配对
DeepSeek V4 Flashc59c18d0 · 5020ef10 · 7582ed5cagent会话内前后配对
智谱 GLM 5.2657a0e42 · d61d6459 · 5c9b823dagent会话内前后配对
Kimi K2.61d51fbee · ca275469 · 55a7cc11agent会话内前后配对
本版方法学修正:全系列统一到唯一评分表
本系列早期文章曾并行使用过两套评分表——临床基准框架的 16 项 / 100 分表,以及一套 10 项 / 100 分简化表。两套表不可相互比较,也不可混在同一张榜上排名: 本版四个模型全部从原始会话记录重新提取回答,用同一份 16 项表重新打分,任何模型都不设对照组、不做特例处理。

1. 评分方法(唯一标尺 · 四模型一致)

2. 全量评分矩阵(四模型 · 同尺 · 中位)

模型 / 样本无指南
基线
有指南
增强
提升残留问题(指南未修正)
DeepSeek V4 Pro(中位 60 → 67,+7)
819362bf5867+9T 分期用 0.6cm→pT1b(应 pT1a);未做 3.2a 全切/保乳区分
5c76ec536066+6全切误读为保乳 → 错荐放疗(两轮均错)
38e99fc16671+5T 分期仍 pT1b;指南主要补"延长→不延长"细节
DeepSeek V4 Flash(中位 62 → 68,+6)
c59c18d06253−9"3簇间质浸润"误读为"脉管瘤栓3灶"→错判中危;指南轮反而考虑化疗
5020ef107276+4pT1a 正确;指南修正"延长 7-10 年→不延长"
7582ed5c5868+10T 分期用 0.6cm→pT1b
智谱 GLM 5.2(中位 68 → 76,+8)
657a0e427276+4pT1a(mi) 正确;指南修正"延长"
d61d64595867+9全切误读为保乳 → 错荐放疗(两轮均错)
5c9b823d6882+14指南补全核心题 3.2a 区分 + 修正"延长";T 仍 pT1b
Kimi K2.6(中位 65 → 75,+10)
1d51fbee075基线轮直接拒答("outside the scope of my capabilities")→ 稳定性红旗;指南轮漏答抗 HER2
ca2754696576+11基线未承诺终期;指南轮 pT1a 标签对但推导错(称 0.6cm 属 T1a)
55a7cc116874+6T 分期用 0.6cm→pT1b;随访把肿瘤标志物列为常规

Kimi 基线三次为 0 / 65 / 68 → 中位 65;指南三次为 75 / 76 / 74 → 中位 75。取中位正是为了让「1 次拒答」这类离群值不污染结论,同时该拒答仍作为稳定性缺陷单独记录(见第 4 节 ④)。

3. 四模型同尺对比图

0 20 40 60 80 100 基线(无指南) 指南增强 60 67 V4 Pro +7 62 68 V4 Flash +6 68 76 GLM 5.2 +8 65 75 Kimi K2.6 +10

全部 8 根柱子用同一条标尺绘制(2.4 px/分,0 = 底部,100 = 顶部),四个模型同一配色、同一权重,无对照组样式。柱高与第 2 节中位分严格一一对应:基线 GLM 68 > Kimi 65 > Flash 62 > Pro 60;指南后 GLM 76 > Kimi 75 > Flash 68 > Pro 67。四条提升幅度落在 +6 ~ +10 的窄区间内。

4. 四个关键失败模式(指南均未修复)

① 全切 → 保乳 误读(最危险)
5c76ec53(V4 Pro) 与 d61d6459(GLM) 把"右乳单纯切除"误读为"保乳术",两轮都据此错荐放疗。指南注入后仍然错(指南反被用来"论证"保乳需放疗)。这违背"全切 + pN0 免放疗"原则——指南解决"按什么治",修不了"读错术式"。
② 间质浸润 → 脉管瘤栓 误读(指南放大错误)
c59c18d0(V4 Flash) 把"3 簇间质浸润 (0.05/0.06/0.2cm)"误读为"LVI 脉管瘤栓 3 灶阳性",错判中危。基线尚能"不化疗",指南轮反而依此"可考虑化疗"(62→53,唯一一个不升反降的样本)。指南在此成了错误判读的"背书"。
③ T 分期标签漂移(跨模型普遍)
四个模型都出现过把 0.6 cm(DCIS 总体径线)当 T 分期径线 → 写 pT1b;正确应取 0.2 cm 浸润灶 → pT1a。Kimi 指南轮虽写对 pT1a 标签,推导却是"0.6cm 属于 T1a(≤1cm)"——标签对、依据错。该错误不改变本例治疗决策,但属需医生把关的硬伤。
④ 拒答型稳定性缺陷(Kimi 特有)
1d51fbee 基线轮直接返回 This topic is currently outside the scope of my capabilities,3 次运行中 1 次首轮拒答(33%)。注入指南 PDF 后同一会话恢复正常并给出 75 分答案。这是可用性风险而非能力风险,但在临床场景下同样致命。

5. 回答时间与积分消耗

任务模型无指南耗时有指南耗时整轮积分
(session 合计)
说明
819362bfv4-pro~10s~60s12.66解析 244 页 PDF
5c76ec53v4-pro~10s~55s13.81
38e99fc1v4-pro~4s~52s10.57
c59c18d0v4-flash~8s~55s5.08
5020ef10v4-flash~8s~50s4.17
7582ed5cv4-flash~8s~55s4.38
657a0e42glm-5.2~10s~120s105.72全场最贵
d61d6459glm-5.2~10s~110s74.64
5c9b823dglm-5.2~5s~137s82.37
1d51fbeekimi-k2.6~82s~84s25.84基线轮含拒答与重试,耗时失真
ca275469kimi-k2.6~5s~40s16.43
55a7cc11kimi-k2.6~8s~92s20.58

成本梯度(整轮 session 合计):DeepSeek V4 Flash 4–5 分 < V4 Pro 11–14 分 < Kimi K2.6 16–26 分 < GLM 5.2 75–106 分。GLM 约为 V4 Flash 的 15–25 倍,而两者指南后中位分仅差 8 分(76 vs 68)。按"每分钱买到的分数"算,DeepSeek 系列性价比最高;Kimi 居中且分数接近 GLM,是本轮的性价比黑马。耗时上,指南轮因需解析 244 页 PDF 普遍 40–140s,基线轮仅 4–10s。

6. 对"终极测试"设想的最终验证

你的设想——"医生把手头专业指南发给大模型,让它据此制定更准确的后续方案"——在四模型同尺数据下得到如下结论:

维度结论
提升幅度✅ 四模型一致 +6 ~ +10 分(Pro +7 / Flash +6 / GLM +8 / Kimi +10)。指南是稳定有效的增强手段,但幅度温和、无戏剧性反转。
提升来自哪里集中在指南表格能直接查到的规则:不延长内分泌、无 CDK4/6 指征、低危免多基因检测、绝经后 AI 优先、随访间隔。
事实判读层❌ 指南修不了模型对病例的误读(术式、浸润性质、T 分期)。误读会在指南"背书"下更顽固甚至更错(唯一负增长样本即源于此)。
临床安全⚠️ 全切/保乳误读导致错荐放疗是真实风险;Kimi 33% 首轮拒答是可用性风险。术式与放疗指征必须由医生最终把关。
选型建议四模型指南后分数区间仅 67–76,差距小于成本差距(4–106 积分,25 倍)。做"指南增强"工作流,DeepSeek V4 Flash 性价比最优;追求最高分选 GLM 5.2;Kimi K2.6 是分数接近 GLM、成本仅 1/4 的折中选择(需容忍偶发拒答)。
实验结论:在四模型完全对等的设计与唯一标尺下,指南注入是一个可靠但温和的增强器(+6 ~ +10 分),其价值在于把"记忆中的临床规则"替换为"可查证的指南条款",而不改变模型读病例的能力
本版撤回的旧结论:上一版基于错误标尺得出的"指南杠杆 = 基线越弱收益越大(Kimi +37)"不成立——那个 +37 是两套评分表相减的产物。在同一把尺子下,四个模型的基线(60–68)与提升(+6~+10)都高度接近,不存在"弱模型被救活"的现象

数据来源:WorkBuddy 本地 ~/.workbuddy/workbuddy.db(sessions / session_usage)+ projects/*/<session>.jsonl 原始会话记录,全部 24 段回答均从原文提取后人工逐项打分。评分 Rubric:tanhaosheng.asia/clinical-benchmark/framework(16 项 / 100,本实验统一上限 90)。
模型标识说明:Kimi 三次运行在会话记录中的 message 级 model 字段均为 kimi-k2.6。另有 3 次 07-30 的 kimi-k3-1 运行(6e9b135f / 13067526 / 47a56d49只有基线轮、没有指南配对轮,无法进入本文的"配对提升"实验,故不在本表;其基线回答已按同一份 16 项表重新打分(74 / 78 / 84,中位 78),收录于《全系列统一评分标准》一文的 简化指令组(简化指令)基线榜。
本报告为 AI 选型评估,不构成任何临床建议;模型输出不可用于真实患者决策。