🇺🇸 Read in English · Also available in English.

🔁 Benchmark Repeats · 规范复测 #2 / 2026-08-01

GLM 网页版 20 次完整复测:同一病例、同一评分表,答案稳不稳定?

By Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · Published 2026-08-01
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only. They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment. For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment. Last reviewed / 最后审阅: 2026-08-01.
⚠️ 框架草稿 / DRAFT:本文为 Benchmark Repeats 第二篇的结构框架,GLM 20 次复测数据待填充。GLM 网页版登录态此前过期,已重建后运行复测,评分完成后本页将替换为含真实数据的正式版。
TL;DR(30 秒结论)

1. 为什么跑 20 次:从「哪个模型好」到「答案稳不稳」

Model Reviews 系列(V1–V5)回答的是选型问题:免费模型里哪个临床表现更好。它每个模型只跑 1–3 次,属于小样本测试组——能告诉我们「平均水平」,但回答不了另一个更关键的问题:

同一个模型,同一份规范文本提示词,跑 20 次——会不会翻车?

对临床场景而言,一次跑得好不能证明可靠。如果模型 20 次里有若干次把「无需放疗」判成「强烈建议放疗」,那它均值再高也不适合独立决策。这就是本专栏(Benchmark Repeats)存在的意义:用重复运行暴露偶发与系统性问题。首篇(DeepSeek 网页版)已显示极差达 12 分、判定不稳定;本篇用同一病例、同一评分表、同一输入口径测试 GLM,检验另一主流模型的稳定性表现。

2. 方法(与 Model Reviews、首篇复测同一病例、同一评分表)

3. 20 次总分与分布

Run分数分布总分档位
Run 1░░░░░░░░░░░░░░░░░░
Run 2░░░░░░░░░░░░░░░░░░
Run 3░░░░░░░░░░░░░░░░░░
Run 4░░░░░░░░░░░░░░░░░░
Run 5░░░░░░░░░░░░░░░░░░
Run 6░░░░░░░░░░░░░░░░░░
Run 7░░░░░░░░░░░░░░░░░░
Run 8░░░░░░░░░░░░░░░░░░
Run 9░░░░░░░░░░░░░░░░░░
Run 10░░░░░░░░░░░░░░░░░░
Run 11░░░░░░░░░░░░░░░░░░
Run 12░░░░░░░░░░░░░░░░░░
Run 13░░░░░░░░░░░░░░░░░░
Run 14░░░░░░░░░░░░░░░░░░
Run 15░░░░░░░░░░░░░░░░░░
Run 16░░░░░░░░░░░░░░░░░░
Run 17░░░░░░░░░░░░░░░░░░
Run 18░░░░░░░░░░░░░░░░░░
Run 19░░░░░░░░░░░░░░░░░░
Run 20░░░░░░░░░░░░░░░░░░
统计量数值
均值
均值
均值
均值
均值
均值
⚠️ 稳定性判定:待填充 GLM 20 次复测数据运行中(登录态已恢复后将自动填充)。

4. 逐项得分:哪些稳定,哪些是盲区

题目满分均分满分次数0 分次数
1.1 是否认同 TisN0M06
1.2 分期修正10
1.3 分子分型4
2.1 手术合理性 + ALND8
2.2 辅助放疗4
3.1 化疗指征 + 多基因检测10
3.2a 内分泌必要性 + 全切/保乳差异 ★12
3.2b AI vs TAM + 年龄切点 ★10
3.2c 药物剂量疗程6
3.2d OFS / 延长 / CDK4/66
3.3 抗 HER24
4.1 内分泌不良反应监测6
4.2 骨密度与生活方式4
4.3 随访计划4
4.4 对侧乳腺 + BRCA4
5 自我评估 + 不确定性4

4.1 强项(20 次高度一致满分 ✅)

4.2 系统性盲区(20 次无一满分 —— 可复现,非偶发)

题目均分/满分丢失问题
(待数据填充)

4.3 波动项(偶发失分 —— 不稳定性的来源)

5. 临床一致性观察

6. 结论与使用建议

(综合表现、稳定性判定与使用建议将在评分完成后填充。)

7. 数据与复现

Frequently asked questions

本专栏与 Model Reviews(V1–V5)的分数能直接比较吗?

不能。V1–V5 是小样本组(1–3 次/模型、含多种提问方式),本专栏是 20 次重复的规范测试。两栏分数相加或相减会得出错误结论,需拆开解读。

为什么输入是文字提示词而不是截图?

全系列统一输入形式为规范文本提示词(非门诊病例脱敏截图),模型直接从文字读取信息。这能同时考察模型的纯文本推理与临床决策能力,也让「读数波动」归因更清晰——波动源于文本数值解析而非 OCR 误差。

🔁 返回 Benchmark Repeats 专栏 · 🔬 Model Reviews 系列(V1–V5) · 📊 评分框架