🔁 Benchmark Repeats · 规范复测 #5 / 2026-08-02 · 元分析
100+ 次运行揭示的五个真相:临床 LLM 稳定性元分析
By
Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · Published 2026-08-02
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only . They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment . For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment.
TL;DR(60 秒结论)
汇总 规范复测专栏 前 4 篇的 157 次独立运行 (DeepSeek 快速 / DeepSeek R1 / GLM-5.2 / 5 组提示词实验),同一病例、同一评分表
发现 1 :没有任何一种配置通过稳定性标准(极差 < 8 分)——最好的配置极差仍有 13 分
发现 2 :内分泌治疗是所有模型的共同盲区 ,跨越模型和模式,不是个别模型的短板
发现 3 :深度思考提升均值 +16.8 分,但不能同步改善稳定性 (极差反而从 12 扩到 14)
发现 4 :GLM-5.2 的极差达 35 分——是 DeepSeek R1 的 2.5 倍,属于灾难性不稳定
发现 5 :提示词优化存在天花板——混合策略仅将极差缩小 7%(14→13),架构是稳定性的决定因素
1. 为什么要做元分析
前四篇规范复测分别从不同角度回答了局部问题:DeepSeek 网页版稳不稳定(#1 )、深度思考有没有用(#2 )、GLM 和 R1 谁更稳(#3 )、提示词能不能降低波动(#4 )。
但当我们把 157 次运行放在一起看时,浮现出了一些单篇看不到的全局规律 。这些规律不是某一个模型的特征,而是当前临床 LLM 的共性 ——它们对「能不能用 AI 做临床决策辅助」这个根本问题有直接启示。
本文不是新实验,而是对已有数据的
二次分析 。所有原始数据可在各篇正文中回溯,原始响应已
公开 。
2. 数据全景:157 次运行一览
配置 模型 模式 运行数 均值 极差 标准差 判定
#1 DeepSeek 快速模式 + 联网 20 69.8 12 (63–75) 3.54 不稳定
#2 DeepSeek R1 深度思考 + 联网 20 86.6 14 4.4 不稳定
#3a GLM-5.2 深度思考 + 联网 16* 80.8 35 (63–98) 9.9 不稳定
#3b DeepSeek R1 深度思考 + 联网 20 86.5 14 4.4 不稳定
#4 对照 DeepSeek R1 标准提示词 20 86.6 14 — 不稳定
#4 混合 DeepSeek R1 结构化+指南+自检 20 88.2 13 — 不稳定
#4 精简 DeepSeek R1 减少认知负荷 20 84.3 17 — 不稳定
合计 ~157 7 组配置,全部判定不稳定
*GLM 20 次中 1 次 INVALID(拒答),16 次有效评分,3 次数据待补。#2 与 #4 对照组为同一批 R1 数据。
通过稳定性标准的配置
0
无一通过(极差均 ≥ 8)
3. 五个核心发现
1
稳定性是当前 LLM 的结构性短板 所有配置未通过
我们的框架稳定性标准很简单:极差 < 8 分 (即 20 次运行中最高分与最低分之差不超过 8 分)。这个标准不算苛刻——相当于允许总分波动 ±4%。
但 157 次运行、7 组配置中,没有任何一组通过 。最好的成绩是混合策略提示词组(#4),极差 13 分——仍是阈值的 1.6 倍。最差的是 GLM-5.2(#3a),极差 35 分——意味着同一个模型、同一份提示词,跑出来的分数从 63 分到 98 分,跨了 4 个五分档。
这意味着什么: 如果你用 LLM 做临床决策辅助,第一次跑出来的答案不能代表这个模型的真实水平 。你可能恰好碰上了它表现好的一次,也可能碰上了翻车的一次。这在临床场景中是不可接受的——你不能告诉患者「这个治疗方案是 AI 建议的,但它有 1/4 的概率会给出完全不同的建议」。
实践建议: 对于重要的临床决策,至少独立运行 3 次 并比较答案。如果 3 次结论一致,可信度较高;如果有分歧,必须人工裁决。不要依赖单次输出。
2
内分泌治疗是跨模型的共同盲区 系统性失分
16 项评分表中,内分泌治疗相关 4 题(3.2a 必要性 / 3.2b AI vs TAM / 3.2c 剂量疗程 / 3.2d OFS/CDK4/6)在所有模型、所有模式 下都是最弱环节:
配置 3.2a (12分) 3.2b (10分) 3.2c (6分) 3.2d (6分) 内分泌维度%
DeepSeek 快速 6.0 6.0 2.5 1.5 47%
DeepSeek R1 10.8 10.0 5.5 4.0 89%
GLM-5.2 9.6 7.5 4.8 3.2 74%
百分比 = 4 题得分之和 ÷ 34 分满分。红色标注 < 90%。
三个值得注意的模式:
3.2a(全切 vs 保乳差异) :DeepSeek 快速模式 20 次无一满分——所有回答都未区分 「浸润癌强推荐内分泌治疗」与「DCIS 全切后属化学预防」两种场景
3.2b(AI vs TAM 年龄切点) :所有模型都推荐 AI,但从未提及 60 岁年龄切点 (≥60 岁 AI 与 TAM 几乎等价),缺乏关键决策 nuance
3.2d(OFS / CDK4/6) :这是整个评分表最弱的一题——DeepSeek 快速模式 20 次均分仅 1.5/6(25%),连 R1 也只有 4.0/6(67%)。模型普遍无法讨论 OFS 不适用(已绝经)和 CDK4/6 适应证
这意味着什么: 内分泌治疗不是某一个模型的短板,而是当前 LLM 在乳腺癌领域的系统性知识盲区 。原因可能是:① OFS/CDK4/6 等概念需要精细的绝经状态判断,模型容易混淆;② 全切 vs 保乳的内分泌治疗逻辑差异在训练语料中可能被稀释;③ 60 岁 AI vs TAM 决策需要理解 EBCTCG 荟萃的 nuance,而非简单的「绝经后用 AI」。
实践建议: 对于内分泌治疗决策,不能依赖 AI 给出的方案 ,必须人工核对:① 是否区分了浸润癌治疗 vs DCIS 预防;② 是否考虑了年龄切点;③ OFS 和 CDK4/6 的适应证是否正确。这是 AI 最容易出错的地方。
3
深度思考提升准确性,但不改善稳定性 均值 +16.8 极差 +2
这是整个系列中最反直觉的发现之一。开启 DeepSeek R1 深度思考后:
指标 快速模式 R1 深度思考 变化
均值 69.8 86.6 +16.8 ✓
极差 12 14 +2 ✗
标准差 3.54 4.4 +0.86 ✗
变异系数 5.1% 5.1% —
深度思考让答案更准 (+16.8 分),但没有更稳 (极差反而扩大 2 分)。变异系数几乎没变(5.1%),说明波动的幅度比例 没有改变——只是整体水平被抬高了。
换句话说:深度思考像给模型装了更好的引擎,跑得更高了,但方向盘的抖动没有减小 。它消除了「不会做」的问题(内分泌维度从 47% 跃至 89%),但没有消除「有时做对有时做错」的问题。
更深一层的发现——「把握度悖论」: 快速模式下,模型自我评估得分 20/20(100%),总说自己「很有把握」;R1 模式下反而只有 1.3/2(65%),开始承认不确定性。这说明深度思考让模型更诚实地认识到自己的局限 ——知道得越多,越知道自己不知道什么。这反而是好事:一个说「我不是 100% 确定」的 AI 比一个永远说「我很有把握」的 AI 更安全。
4
GLM-5.2 存在灾难性不稳定 极差 35 分
在所有配置中,GLM-5.2 的稳定性数据最为触目惊心:
DeepSeek R1 极差
14
79–93 分
DeepSeek 快速 极差
12
63–75 分
35 分的极差意味着什么?如果用五分档来分:
GLM 有几次跑出了98 分 ——这是整个系列所有模型所有配置的单次最高分
但 GLM 也有几次只有63 分 ——和 DeepSeek 快速模式的最差水平一样
在 16 次有效运行中,分数跨越了 4 个五分档(60–65 / 65–70 / … / 95–100)
标准差 9.9 是 DeepSeek R1 的 2.25 倍
更值得警惕的是,GLM 有 1 次 INVALID (拒答医疗问题)——在 20 次中占 5%。虽然拒答比给错误答案安全,但这说明模型的安全过滤不够稳定 ,有时放行、有时拦截,用户无法预期。
实践建议: GLM-5.2 在深度思考模式下不适合独立临床决策辅助 。它的上限很高(98 分),但下限太低(63 分),用户无法区分当前这次输出是「98 分的那次」还是「63 分的那次」。如果要用,必须配合人工逐条核验,尤其是分期和内分泌治疗部分。
5
提示词优化存在天花板 极差仅缩小 7%
第 4 篇实验测试了 5 种提示词策略(每组 20 次,共 100 次额外运行),试图通过提示词工程降低 DeepSeek R1 的输出波动:
组别 策略 均值 极差 vs 对照
对照组 标准提示词 86.6 14 —
实验组 1 结构化(7 步分析) 87.1 14 均值 +0.5 · 极差 ±0
实验组 2 指南嵌入 87.5 15 均值 +0.9 · 极差 +1
实验组 3 自检机制 86.8 14 均值 +0.2 · 极差 ±0
实验组 4 混合策略 88.2 13 均值 +1.6 · 极差 -1
实验组 5 精简版 84.3 17 均值 -2.3 · 极差 +3
结果令人清醒:
最好的混合策略 仅将极差从 14 缩小到 13——7% 的改善 ,仍远超稳定性阈值
单独使用任何一种策略(结构化、指南嵌入、自检),对稳定性几乎没有改善
精简版提示词反而更差 ——均值下降 2.3 分,极差扩大 3 分,说明减少信息量比增加结构更有害
这意味着什么: 提示词优化能改善「平均做得多好」,但改善不了「每次做得多一致」 。输出的波动性主要由模型架构决定,不是提示词能控制的。这就像调整汤的调味——你可以让它整体更好喝,但无法让每勺的味道完全一样,因为那是厨师(模型)的稳定性问题,不是食谱(提示词)的问题。
实践建议: 不要花太多时间在提示词工程上追求「稳定性」。混合策略(结构化 + 指南 + 自检)值得用,因为它同时提升了均值 ——但不要期待它能解决「偶发翻车」的问题。多跑几次比较答案,比精心设计提示词更有效。
4. 能力维度横向对比
将 16 项评分归并为 7 个能力维度,三种主要配置的对比一目了然:
维度 满分 DeepSeek 快速 DeepSeek R1 GLM-5.2 谁最强
诊断分期 20 85% 90% 91% GLM ≈ R1
局部治疗 12 98% 81% 86% 快速
化疗决策 10 79% 95% 81% R1
内分泌治疗 34 47% 89% 74% R1
靶向治疗 4 100% 88% 95% 快速
长期管理 14 63% 68% 69% GLM ≈ R1
把握度 2 100% 65% 90% 快速
三个关键观察:
快速模式在简单题上满分级 (局部治疗 98%、靶向 100%、把握度 100%),但在复杂题上崩盘(内分泌 47%)——它「会做的全对,不会做的全错」
R1 的代价 :深度思考在简单题上反而退步(局部治疗 98%→81%、把握度 100%→65%),可能是过度思考导致的——R1 有时会质疑本不需要质疑的结论
没有「全能王」 :每种配置都有明显的强项和弱项。选模型不是选「最好的」,而是选「在你关心的维度上最可靠的」
5. 给外科医生的建议
基于 157 次数据的五条实践准则
永远开深度思考 :快速模式均值 69.8 分,R1 模式 86.6 分——差距 16.8 分,相当于一个完整评分档。在临床场景中,这个差距可能意味着「漏掉内分泌治疗」和「正确推荐 AI + TAM 决策」的区别
至少跑 3 次再决策 :没有任何配置通过稳定性标准。3 次结论一致 → 可信度高;3 次有分歧 → 人工裁决。这是 157 次数据给出的最核心建议
重点核对内分泌治疗 :这是所有模型的共同盲区。特别是 OFS/CDK4/6 适应证、全切 vs 保乳差异、AI vs TAM 年龄切点——这三个点 AI 最容易出错
谨慎使用 GLM-5.2 :它的极差 35 分意味着输出质量不可预期。如果使用,必须逐条核验,不能因为「上次跑得好」就信任下次
提示词用混合策略即可,不要过度优化 :结构化 + 指南 + 自检的组合在均值和极差上都是最优的。但不要期待提示词能解决稳定性问题——那是模型架构的事
6. 局限性
单一病例 :全部 157 次运行使用同一份乳腺癌病例。不同瘤种、不同复杂度的病例可能呈现不同的稳定性模式
网页版而非 API :所有测试通过网页版进行,模型版本可能随时更新。API 调用的温度参数、system prompt 等设置可能与网页版不同
单一评分者 :所有评分由作者一人完成,虽然逐项精读,但存在主观偏差可能。多人评分 + 评分者间一致性检验是下一步
样本量 :虽然 157 次远超 V1–V5 的 1–3 次/模型,但对于统计推断仍偏小。特别是 GLM 的 16 次有效运行,置信区间较宽
模型版本 :实验期间模型可能进行了后台更新,跨时间的运行可能不完全可比
7. 下一步计划
本专栏将继续扩展,计划中的方向包括:
更多模型 :Kimi K2.6、通义千问、文心一言等主流中文 LLM 的 20 次复测
更多病例 :甲状腺癌病例(作者本专业)、复杂多原发癌病例,检验发现是否跨瘤种成立
API vs 网页版 :同一模型用 API(temperature=0)与网页版对比,检验温度参数对稳定性的影响
多人评分 :引入第二位临床医师独立评分,计算 Cohen's kappa 评分者间一致性
FAQ
为什么所有模型配置都没通过稳定性标准?
框架稳定性标准是极差 < 8 分。157 次运行中,最好的配置极差仍有 13 分。这提示 LLM 的输出波动是架构层面的固有特征,提示词优化无法根本解决。可能的原因包括:模型推理路径的随机性(即使 temperature=0,网页版仍有采样噪声)、联网搜索结果的不确定性、以及深度思考链的路径分歧。
深度思考和快速模式哪个更好?
深度思考将均值从 69.8 提升到 86.6(+16.8 分),但极差从 12 扩大到 14。准确性和稳定性不是同步改善的——深度思考让答案更准,但不一定更稳。临床场景中,应优先使用深度思考(准确性更重要),同时接受需要多跑几次来对冲波动。
这个结论能推广到其他瘤种吗?
不能直接推广。本研究的所有数据基于一份乳腺癌病例。不同瘤种的指南复杂度、知识在训练语料中的覆盖度不同。内分泌治疗盲区可能与乳腺癌指南的特定复杂性有关。甲状腺癌等作者本专业领域的测试正在进行中。
157 次运行够不够做统计推断?
对于描述性统计(均值、极差、标准差)足够。但对于置信区间、假设检验等推断统计,样本量偏小,特别是 GLM 的 16 次有效运行。我们报告的是观察到的模式,而非总体参数的精确估计。更多运行正在积累中。
与 Model Reviews(V1–V5)的关系: 本元分析仅汇总规范复测专栏数据。V1–V5 为小样本(1–3 次/模型)且含多种提问方式,不可与本专栏数据直接相加或相减 。请勿跨栏做减法比较。
本专栏内容仅供个人 LLM 选型与学习参考,不构成临床建议。相关阅读:规范复测专栏首页 · Model Reviews 系列(V1–V5) · 评分框架 · 原始响应全文
© 2024-2026 Tan Haosheng · 副主任医师 (Associate Chief Physician) / 医学博士 (MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital)Home · About · Privacy · Sitemap