验证假设:医生把专业临床指南发给大模型 → 模型据此制定更准确的后续治疗方案。
四个模型同一起跑线、同一套题、同一把尺子、同一种配对设计。
四个模型采用完全相同的设计:同一乳腺癌病例、同一简化指令、3 次独立运行、同一会话内前后配对(第 1 轮不给指南 → 第 2 轮注入 2026 CBCS 指南原文),唯一变量 = 是否注入指南。每个模型取中位分。没有对照组、没有参照系、没有任何模型被预设为强或弱。
| 模型 | 3 次运行 (session) | 接口 | 配对方式 |
|---|---|---|---|
| DeepSeek V4 Pro | 819362bf · 5c76ec53 · 38e99fc1 | agent | 会话内前后配对 |
| DeepSeek V4 Flash | c59c18d0 · 5020ef10 · 7582ed5c | agent | 会话内前后配对 |
| 智谱 GLM 5.2 | 657a0e42 · d61d6459 · 5c9b823d | agent | 会话内前后配对 |
| Kimi K2.6 | 1d51fbee · ca275469 · 55a7cc11 | agent | 会话内前后配对 |
clinical-benchmark/framework 的 16 项 / 100 分 Rubric,四个模型使用同一份。| 模型 / 样本 | 无指南 基线 | 有指南 增强 | 提升 | 残留问题(指南未修正) |
|---|---|---|---|---|
| DeepSeek V4 Pro(中位 60 → 67,+7) | ||||
| 819362bf | 58 | 67 | +9 | T 分期用 0.6cm→pT1b(应 pT1a);未做 3.2a 全切/保乳区分 |
| 5c76ec53 | 60 | 66 | +6 | 全切误读为保乳 → 错荐放疗(两轮均错) |
| 38e99fc1 | 66 | 71 | +5 | T 分期仍 pT1b;指南主要补"延长→不延长"细节 |
| DeepSeek V4 Flash(中位 62 → 68,+6) | ||||
| c59c18d0 | 62 | 53 | −9 | "3簇间质浸润"误读为"脉管瘤栓3灶"→错判中危;指南轮反而考虑化疗 |
| 5020ef10 | 72 | 76 | +4 | pT1a 正确;指南修正"延长 7-10 年→不延长" |
| 7582ed5c | 58 | 68 | +10 | T 分期用 0.6cm→pT1b |
| 智谱 GLM 5.2(中位 68 → 76,+8) | ||||
| 657a0e42 | 72 | 76 | +4 | pT1a(mi) 正确;指南修正"延长" |
| d61d6459 | 58 | 67 | +9 | 全切误读为保乳 → 错荐放疗(两轮均错) |
| 5c9b823d | 68 | 82 | +14 | 指南补全核心题 3.2a 区分 + 修正"延长";T 仍 pT1b |
| Kimi K2.6(中位 65 → 75,+10) | ||||
| 1d51fbee | 0 | 75 | — | 基线轮直接拒答("outside the scope of my capabilities")→ 稳定性红旗;指南轮漏答抗 HER2 |
| ca275469 | 65 | 76 | +11 | 基线未承诺终期;指南轮 pT1a 标签对但推导错(称 0.6cm 属 T1a) |
| 55a7cc11 | 68 | 74 | +6 | T 分期用 0.6cm→pT1b;随访把肿瘤标志物列为常规 |
Kimi 基线三次为 0 / 65 / 68 → 中位 65;指南三次为 75 / 76 / 74 → 中位 75。取中位正是为了让「1 次拒答」这类离群值不污染结论,同时该拒答仍作为稳定性缺陷单独记录(见第 4 节 ④)。
全部 8 根柱子用同一条标尺绘制(2.4 px/分,0 = 底部,100 = 顶部),四个模型同一配色、同一权重,无对照组样式。柱高与第 2 节中位分严格一一对应:基线 GLM 68 > Kimi 65 > Flash 62 > Pro 60;指南后 GLM 76 > Kimi 75 > Flash 68 > Pro 67。四条提升幅度落在 +6 ~ +10 的窄区间内。
5c76ec53(V4 Pro) 与 d61d6459(GLM) 把"右乳单纯切除"误读为"保乳术",两轮都据此错荐放疗。指南注入后仍然错(指南反被用来"论证"保乳需放疗)。这违背"全切 + pN0 免放疗"原则——指南解决"按什么治",修不了"读错术式"。
c59c18d0(V4 Flash) 把"3 簇间质浸润 (0.05/0.06/0.2cm)"误读为"LVI 脉管瘤栓 3 灶阳性",错判中危。基线尚能"不化疗",指南轮反而依此"可考虑化疗"(62→53,唯一一个不升反降的样本)。指南在此成了错误判读的"背书"。
1d51fbee 基线轮直接返回 This topic is currently outside the scope of my capabilities,3 次运行中 1 次首轮拒答(33%)。注入指南 PDF 后同一会话恢复正常并给出 75 分答案。这是可用性风险而非能力风险,但在临床场景下同样致命。
| 任务 | 模型 | 无指南耗时 | 有指南耗时 | 整轮积分 (session 合计) | 说明 |
|---|---|---|---|---|---|
| 819362bf | v4-pro | ~10s | ~60s | 12.66 | 解析 244 页 PDF |
| 5c76ec53 | v4-pro | ~10s | ~55s | 13.81 | |
| 38e99fc1 | v4-pro | ~4s | ~52s | 10.57 | |
| c59c18d0 | v4-flash | ~8s | ~55s | 5.08 | |
| 5020ef10 | v4-flash | ~8s | ~50s | 4.17 | |
| 7582ed5c | v4-flash | ~8s | ~55s | 4.38 | |
| 657a0e42 | glm-5.2 | ~10s | ~120s | 105.72 | 全场最贵 |
| d61d6459 | glm-5.2 | ~10s | ~110s | 74.64 | |
| 5c9b823d | glm-5.2 | ~5s | ~137s | 82.37 | |
| 1d51fbee | kimi-k2.6 | ~82s | ~84s | 25.84 | 基线轮含拒答与重试,耗时失真 |
| ca275469 | kimi-k2.6 | ~5s | ~40s | 16.43 | |
| 55a7cc11 | kimi-k2.6 | ~8s | ~92s | 20.58 |
成本梯度(整轮 session 合计):DeepSeek V4 Flash 4–5 分 < V4 Pro 11–14 分 < Kimi K2.6 16–26 分 < GLM 5.2 75–106 分。GLM 约为 V4 Flash 的 15–25 倍,而两者指南后中位分仅差 8 分(76 vs 68)。按"每分钱买到的分数"算,DeepSeek 系列性价比最高;Kimi 居中且分数接近 GLM,是本轮的性价比黑马。耗时上,指南轮因需解析 244 页 PDF 普遍 40–140s,基线轮仅 4–10s。
你的设想——"医生把手头专业指南发给大模型,让它据此制定更准确的后续方案"——在四模型同尺数据下得到如下结论:
| 维度 | 结论 |
|---|---|
| 提升幅度 | ✅ 四模型一致 +6 ~ +10 分(Pro +7 / Flash +6 / GLM +8 / Kimi +10)。指南是稳定有效的增强手段,但幅度温和、无戏剧性反转。 |
| 提升来自哪里 | 集中在指南表格能直接查到的规则:不延长内分泌、无 CDK4/6 指征、低危免多基因检测、绝经后 AI 优先、随访间隔。 |
| 事实判读层 | ❌ 指南修不了模型对病例的误读(术式、浸润性质、T 分期)。误读会在指南"背书"下更顽固甚至更错(唯一负增长样本即源于此)。 |
| 临床安全 | ⚠️ 全切/保乳误读导致错荐放疗是真实风险;Kimi 33% 首轮拒答是可用性风险。术式与放疗指征必须由医生最终把关。 |
| 选型建议 | 四模型指南后分数区间仅 67–76,差距小于成本差距(4–106 积分,25 倍)。做"指南增强"工作流,DeepSeek V4 Flash 性价比最优;追求最高分选 GLM 5.2;Kimi K2.6 是分数接近 GLM、成本仅 1/4 的折中选择(需容忍偶发拒答)。 |
数据来源:WorkBuddy 本地 ~/.workbuddy/workbuddy.db(sessions / session_usage)+ projects/*/<session>.jsonl 原始会话记录,全部 24 段回答均从原文提取后人工逐项打分。评分 Rubric:tanhaosheng.asia/clinical-benchmark/framework(16 项 / 100,本实验统一上限 90)。
模型标识说明:Kimi 三次运行在会话记录中的 message 级 model 字段均为 kimi-k2.6。另有 3 次 07-30 的 kimi-k3-1 运行(6e9b135f / 13067526 / 47a56d49)只有基线轮、没有指南配对轮,无法进入本文的"配对提升"实验,故不在本表;其基线回答已按同一份 16 项表重新打分(74 / 78 / 84,中位 78),收录于《全系列统一评分标准》一文的 简化指令组(简化指令)基线榜。
本报告为 AI 选型评估,不构成任何临床建议;模型输出不可用于真实患者决策。