🔁 Benchmark Repeats · 规范复测 #1 / 2026-08-01

DeepSeek 网页版 20 次完整复测:同一病例、同一评分表,答案稳不稳定?

By Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · Published 2026-08-01
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only. They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment. For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment. Last reviewed / 最后审阅: 2026-08-01.
TL;DR(30 秒结论)

1. 为什么跑 20 次:从「哪个模型好」到「答案稳不稳」

Model Reviews 系列(V1–V5)回答的是选型问题:免费模型里哪个临床表现更好。它每个模型只跑 1–3 次,属于小样本测试组——能告诉我们「平均水平」,但回答不了另一个更关键的问题:

同一个模型,同一张病例截图,跑 20 次——会不会翻车?

对临床场景而言,一次跑得好不能证明可靠。如果模型 20 次里有 5 次把「无需放疗」判成「强烈建议放疗」,那它均值再高也不适合独立决策。这就是本专栏(Benchmark Repeats)存在的意义:用重复运行暴露偶发与系统性问题

2. 方法(与 Model Reviews 同一病例、同一评分表)

3. 20 次总分与分布

Run分数分布总分档位
Run 1█████████████░░░░░░░65RED
Run 2█████████████░░░░░░░69AMBER
Run 3█████████████░░░░░░░68AMBER
Run 4██████████████░░░░░░72GREEN
Run 5███████████████░░░░░75GREEN
Run 6████████████░░░░░░░░63RED
Run 7█████████████░░░░░░░66RED
Run 8█████████████░░░░░░░66RED
Run 9██████████████░░░░░░70AMBER
Run 10███████████████░░░░░75GREEN
Run 11██████████████░░░░░░72GREEN
Run 12█████████████░░░░░░░68AMBER
Run 13████████████░░░░░░░░64RED
Run 14██████████████░░░░░░71AMBER
Run 15██████████████░░░░░░72GREEN
Run 16██████████████░░░░░░73GREEN
Run 17██████████████░░░░░░72GREEN
Run 18██████████████░░░░░░72GREEN
Run 19██████████████░░░░░░72GREEN
Run 20██████████████░░░░░░72GREEN
统计量数值
均值69.8 / 100
中位数71.5
标准差 (SD)3.54
方差12.56
极差 (max−min)12(max 75 / min 63)
变异系数 (CV)5.1%
⚠️ 稳定性判定:不稳定 极差 12 分 ≥ 框架标准 8 分。20 次中:高档(72–75)10 次、中档(66–71)5 次、低档(63–65)5 次——每 4 次就有 1 次掉到低档

4. 逐项得分:哪些稳定,哪些是盲区

题目满分均分满分次数0 分次数
1.1 是否认同 TisN0M065.919/200/20
1.2 分期修正107.02/200/20
1.3 分子分型44.020/200/20
2.1 手术合理性 + ALND87.919/200/20
2.2 辅助放疗43.818/200/20
3.1 化疗指征 + 多基因检测107.90/200/20
3.2a 内分泌必要性 + 全切/保乳差异 ★126.00/200/20
3.2b AI vs TAM + 年龄切点 ★106.00/200/20
3.2c 药物剂量疗程62.50/200/20
3.2d OFS / 延长 / CDK4/661.50/200/20
3.3 抗 HER244.020/200/20
4.1 内分泌不良反应监测62.50/200/20
4.2 骨密度与生活方式41.91/200/20
4.3 随访计划43.511/200/20
4.4 对侧乳腺 + BRCA43.49/200/20
5 自我评估 + 不确定性22.020/200/20

4.1 强项(20 次高度一致满分 ✅)

4.2 系统性盲区(20 次无一满分 —— 可复现,非偶发)

题目均分/满分丢失问题
3.2a 内分泌必要性+全切/保乳差异 ★6.0/12−620 次全部未区分「浸润癌强推荐 vs DCIS 全切后属化学预防(考虑/可选)」两种场景
3.2b AI vs TAM + 年龄切点 ★6.0/10−4全部推荐 AI,但无一次提及 60 岁年龄切点(≥60 岁 AI 与 TAM 几乎等价)
3.2c 药物剂量疗程2.5/6−3.5只写「5 年」无具体药物+剂量(来曲唑 2.5mg/d 等)
3.2d OFS/延长/CDK4/61.5/6−4.5多数未提 OFS 不适用(已绝经)、CDK4/6 不符合指征
4.1 不良反应监测2.5/6−3.5只泛提「监测骨密度/血脂」,缺具体不良反应与监测频率
4.2 骨密度与生活方式1.9/4−2.1缺钙剂 + Vit D + 负重运动等生活方式建议
1.2 分期修正7.0/10−3.00.2cm 已超微浸润定义却多数判 pT1mi(OCR 读数问题);Run 15 误读 0.6cm 判 pT1b

4.3 波动项(偶发失分 —— 不稳定性的来源)

5. 临床一致性观察

6. 结论与使用建议

综合表现:均值 69.8/100(良好,未达优秀)。强项集中在「指南明确、决策树清晰」的题目(分期认可、手术、化疗、靶向、自我评估);核心短板集中在内分泌治疗细节(3.2a/b/c/d 合计丢失约 18 分)。

稳定性:❌ 极差 12 分,按框架标准判定不稳定——报告与对外发布时必须标明。

使用建议:DeepSeek 网页版可作为临床决策的初筛助手;但涉及内分泌治疗细节、年龄分层决策时必须人工复核;放疗等高风险决策存在偶发翻车,不可独立采信单次输出。

7. 数据与复现

Frequently asked questions

为什么同一个模型跑 20 次分数会差 12 分?

LLM 采样具有随机性,且 DeepSeek 网页版每次自动联网搜索(阅读 7–15 个网页),检索到的证据不同会影响分期判断与放疗决策。20 次极差 12 分(63–75)跨 3 个分数档,说明单次运行结果不足以代表模型水平。

本专栏与 Model Reviews(V1–V5)的分数能直接比较吗?

不能。V1–V5 是小样本组(1–3 次/模型、含多种提问方式),本专栏是 20 次重复的规范测试。两栏分数相加或相减会得出错误结论,需拆开解读。

DeepSeek 20 次复测有哪些稳定盲区?

内分泌治疗细节 4 题 20 次无一满分:3.2a 全部未区分「浸润癌强推荐 vs DCIS 全切后属化学预防」;3.2b 全部推荐 AI 但从未提及 60 岁年龄切点;3.2c/3.2d 缺具体药物剂量与 OFS/CDK4/6 评估。这是可复现的模型盲区。

分期结论为什么每次不一样?

本病例最大浸润灶 0.2cm(2mm)恰好超出微浸润定义(≤1mm)。20 次中多数判 pT1mi、2 次正确判 pT1a、1 次误读为 pT1b——属模型从截图中读取病理数值的视觉/OCR 差异,而非临床推理缺陷。

为什么输入是截图而不是文字?

全系列统一输入形式为门诊病例脱敏截图(一张图同时含病例 + 16 项问题),模型从图片读取信息。这能同时考察模型的视觉理解与临床推理能力,也与真实使用场景一致。

🔁 返回 Benchmark Repeats 专栏 · 🔬 Model Reviews 系列(V1–V5) · 📊 评分框架