🔁 Benchmark Repeats · 规范复测 #5 / 2026-08-02 · 元分析

100+ 次运行揭示的五个真相:临床 LLM 稳定性元分析

By Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · Published 2026-08-02
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only. They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment. For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment.
TL;DR(60 秒结论)

1. 为什么要做元分析

前四篇规范复测分别从不同角度回答了局部问题:DeepSeek 网页版稳不稳定(#1)、深度思考有没有用(#2)、GLM 和 R1 谁更稳(#3)、提示词能不能降低波动(#4)。

但当我们把 157 次运行放在一起看时,浮现出了一些单篇看不到的全局规律。这些规律不是某一个模型的特征,而是当前临床 LLM 的共性——它们对「能不能用 AI 做临床决策辅助」这个根本问题有直接启示。

本文不是新实验,而是对已有数据的二次分析。所有原始数据可在各篇正文中回溯,原始响应已公开

2. 数据全景:157 次运行一览

配置模型模式运行数均值极差标准差判定
#1DeepSeek快速模式 + 联网2069.812 (63–75)3.54不稳定
#2DeepSeek R1深度思考 + 联网2086.6144.4不稳定
#3aGLM-5.2深度思考 + 联网16*80.835 (63–98)9.9不稳定
#3bDeepSeek R1深度思考 + 联网2086.5144.4不稳定
#4 对照DeepSeek R1标准提示词2086.614不稳定
#4 混合DeepSeek R1结构化+指南+自检2088.213不稳定
#4 精简DeepSeek R1减少认知负荷2084.317不稳定
合计~1577 组配置,全部判定不稳定

*GLM 20 次中 1 次 INVALID(拒答),16 次有效评分,3 次数据待补。#2 与 #4 对照组为同一批 R1 数据。

总运行次数
157
4 篇实验 · 7 组配置
通过稳定性标准的配置
0
无一通过(极差均 ≥ 8)
最佳极差
13
混合策略组(仍超阈值)

3. 五个核心发现

1

稳定性是当前 LLM 的结构性短板

所有配置未通过

我们的框架稳定性标准很简单:极差 < 8 分(即 20 次运行中最高分与最低分之差不超过 8 分)。这个标准不算苛刻——相当于允许总分波动 ±4%。

但 157 次运行、7 组配置中,没有任何一组通过。最好的成绩是混合策略提示词组(#4),极差 13 分——仍是阈值的 1.6 倍。最差的是 GLM-5.2(#3a),极差 35 分——意味着同一个模型、同一份提示词,跑出来的分数从 63 分到 98 分,跨了 4 个五分档。

这意味着什么:如果你用 LLM 做临床决策辅助,第一次跑出来的答案不能代表这个模型的真实水平。你可能恰好碰上了它表现好的一次,也可能碰上了翻车的一次。这在临床场景中是不可接受的——你不能告诉患者「这个治疗方案是 AI 建议的,但它有 1/4 的概率会给出完全不同的建议」。

实践建议:对于重要的临床决策,至少独立运行 3 次并比较答案。如果 3 次结论一致,可信度较高;如果有分歧,必须人工裁决。不要依赖单次输出。

2

内分泌治疗是跨模型的共同盲区

系统性失分

16 项评分表中,内分泌治疗相关 4 题(3.2a 必要性 / 3.2b AI vs TAM / 3.2c 剂量疗程 / 3.2d OFS/CDK4/6)在所有模型、所有模式下都是最弱环节:

配置3.2a (12分)3.2b (10分)3.2c (6分)3.2d (6分)内分泌维度%
DeepSeek 快速6.06.02.51.547%
DeepSeek R110.810.05.54.089%
GLM-5.29.67.54.83.274%

百分比 = 4 题得分之和 ÷ 34 分满分。红色标注 < 90%。

三个值得注意的模式:

这意味着什么:内分泌治疗不是某一个模型的短板,而是当前 LLM 在乳腺癌领域的系统性知识盲区。原因可能是:① OFS/CDK4/6 等概念需要精细的绝经状态判断,模型容易混淆;② 全切 vs 保乳的内分泌治疗逻辑差异在训练语料中可能被稀释;③ 60 岁 AI vs TAM 决策需要理解 EBCTCG 荟萃的 nuance,而非简单的「绝经后用 AI」。

实践建议:对于内分泌治疗决策,不能依赖 AI 给出的方案,必须人工核对:① 是否区分了浸润癌治疗 vs DCIS 预防;② 是否考虑了年龄切点;③ OFS 和 CDK4/6 的适应证是否正确。这是 AI 最容易出错的地方。

3

深度思考提升准确性,但不改善稳定性

均值 +16.8极差 +2

这是整个系列中最反直觉的发现之一。开启 DeepSeek R1 深度思考后:

指标快速模式R1 深度思考变化
均值69.886.6+16.8 ✓
极差1214+2 ✗
标准差3.544.4+0.86 ✗
变异系数5.1%5.1%

深度思考让答案更准(+16.8 分),但没有更稳(极差反而扩大 2 分)。变异系数几乎没变(5.1%),说明波动的幅度比例没有改变——只是整体水平被抬高了。

换句话说:深度思考像给模型装了更好的引擎,跑得更高了,但方向盘的抖动没有减小。它消除了「不会做」的问题(内分泌维度从 47% 跃至 89%),但没有消除「有时做对有时做错」的问题。

更深一层的发现——「把握度悖论」:快速模式下,模型自我评估得分 20/20(100%),总说自己「很有把握」;R1 模式下反而只有 1.3/2(65%),开始承认不确定性。这说明深度思考让模型更诚实地认识到自己的局限——知道得越多,越知道自己不知道什么。这反而是好事:一个说「我不是 100% 确定」的 AI 比一个永远说「我很有把握」的 AI 更安全。
4

GLM-5.2 存在灾难性不稳定

极差 35 分

在所有配置中,GLM-5.2 的稳定性数据最为触目惊心:

DeepSeek R1 极差
14
79–93 分
DeepSeek 快速 极差
12
63–75 分
GLM-5.2 极差
35
63–98 分

35 分的极差意味着什么?如果用五分档来分:

更值得警惕的是,GLM 有 1 次 INVALID(拒答医疗问题)——在 20 次中占 5%。虽然拒答比给错误答案安全,但这说明模型的安全过滤不够稳定,有时放行、有时拦截,用户无法预期。

实践建议:GLM-5.2 在深度思考模式下不适合独立临床决策辅助。它的上限很高(98 分),但下限太低(63 分),用户无法区分当前这次输出是「98 分的那次」还是「63 分的那次」。如果要用,必须配合人工逐条核验,尤其是分期和内分泌治疗部分。
5

提示词优化存在天花板

极差仅缩小 7%

第 4 篇实验测试了 5 种提示词策略(每组 20 次,共 100 次额外运行),试图通过提示词工程降低 DeepSeek R1 的输出波动:

组别策略均值极差vs 对照
对照组标准提示词86.614
实验组 1结构化(7 步分析)87.114均值 +0.5 · 极差 ±0
实验组 2指南嵌入87.515均值 +0.9 · 极差 +1
实验组 3自检机制86.814均值 +0.2 · 极差 ±0
实验组 4混合策略88.213均值 +1.6 · 极差 -1
实验组 5精简版84.317均值 -2.3 · 极差 +3

结果令人清醒:

这意味着什么:提示词优化能改善「平均做得多好」,但改善不了「每次做得多一致」。输出的波动性主要由模型架构决定,不是提示词能控制的。这就像调整汤的调味——你可以让它整体更好喝,但无法让每勺的味道完全一样,因为那是厨师(模型)的稳定性问题,不是食谱(提示词)的问题。

实践建议:不要花太多时间在提示词工程上追求「稳定性」。混合策略(结构化 + 指南 + 自检)值得用,因为它同时提升了均值——但不要期待它能解决「偶发翻车」的问题。多跑几次比较答案,比精心设计提示词更有效。

4. 能力维度横向对比

将 16 项评分归并为 7 个能力维度,三种主要配置的对比一目了然:

维度满分DeepSeek 快速DeepSeek R1GLM-5.2谁最强
诊断分期2085%90%91%GLM ≈ R1
局部治疗1298%81%86%快速
化疗决策1079%95%81%R1
内分泌治疗3447%89%74%R1
靶向治疗4100%88%95%快速
长期管理1463%68%69%GLM ≈ R1
把握度2100%65%90%快速

三个关键观察:

  1. 快速模式在简单题上满分级(局部治疗 98%、靶向 100%、把握度 100%),但在复杂题上崩盘(内分泌 47%)——它「会做的全对,不会做的全错」
  2. R1 的代价:深度思考在简单题上反而退步(局部治疗 98%→81%、把握度 100%→65%),可能是过度思考导致的——R1 有时会质疑本不需要质疑的结论
  3. 没有「全能王」:每种配置都有明显的强项和弱项。选模型不是选「最好的」,而是选「在你关心的维度上最可靠的」

5. 给外科医生的建议

基于 157 次数据的五条实践准则

  1. 永远开深度思考:快速模式均值 69.8 分,R1 模式 86.6 分——差距 16.8 分,相当于一个完整评分档。在临床场景中,这个差距可能意味着「漏掉内分泌治疗」和「正确推荐 AI + TAM 决策」的区别
  2. 至少跑 3 次再决策:没有任何配置通过稳定性标准。3 次结论一致 → 可信度高;3 次有分歧 → 人工裁决。这是 157 次数据给出的最核心建议
  3. 重点核对内分泌治疗:这是所有模型的共同盲区。特别是 OFS/CDK4/6 适应证、全切 vs 保乳差异、AI vs TAM 年龄切点——这三个点 AI 最容易出错
  4. 谨慎使用 GLM-5.2:它的极差 35 分意味着输出质量不可预期。如果使用,必须逐条核验,不能因为「上次跑得好」就信任下次
  5. 提示词用混合策略即可,不要过度优化:结构化 + 指南 + 自检的组合在均值和极差上都是最优的。但不要期待提示词能解决稳定性问题——那是模型架构的事

6. 局限性

7. 下一步计划

本专栏将继续扩展,计划中的方向包括:

FAQ

为什么所有模型配置都没通过稳定性标准?

框架稳定性标准是极差 < 8 分。157 次运行中,最好的配置极差仍有 13 分。这提示 LLM 的输出波动是架构层面的固有特征,提示词优化无法根本解决。可能的原因包括:模型推理路径的随机性(即使 temperature=0,网页版仍有采样噪声)、联网搜索结果的不确定性、以及深度思考链的路径分歧。

深度思考和快速模式哪个更好?

深度思考将均值从 69.8 提升到 86.6(+16.8 分),但极差从 12 扩大到 14。准确性和稳定性不是同步改善的——深度思考让答案更准,但不一定更稳。临床场景中,应优先使用深度思考(准确性更重要),同时接受需要多跑几次来对冲波动。

这个结论能推广到其他瘤种吗?

不能直接推广。本研究的所有数据基于一份乳腺癌病例。不同瘤种的指南复杂度、知识在训练语料中的覆盖度不同。内分泌治疗盲区可能与乳腺癌指南的特定复杂性有关。甲状腺癌等作者本专业领域的测试正在进行中。

157 次运行够不够做统计推断?

对于描述性统计(均值、极差、标准差)足够。但对于置信区间、假设检验等推断统计,样本量偏小,特别是 GLM 的 16 次有效运行。我们报告的是观察到的模式,而非总体参数的精确估计。更多运行正在积累中。

与 Model Reviews(V1–V5)的关系:本元分析仅汇总规范复测专栏数据。V1–V5 为小样本(1–3 次/模型)且含多种提问方式,不可与本专栏数据直接相加或相减。请勿跨栏做减法比较。

本专栏内容仅供个人 LLM 选型与学习参考,不构成临床建议。相关阅读:规范复测专栏首页 · Model Reviews 系列(V1–V5) · 评分框架 · 原始响应全文