🌐 English 中文
🇺🇸 Read in English · Also available in English.
🔁 Benchmark Repeats · 规范复测 #2 / 2026-08-01
GLM 网页版 20 次完整复测:同一病例、同一评分表,答案稳不稳定?
By
Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · Published 2026-08-01
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only . They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment . For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment. Last reviewed / 最后审阅: 2026-08-01.
⚠️ 框架草稿 / DRAFT: 本文为 Benchmark Repeats 第二篇的结构框架 ,GLM 20 次复测数据待填充。GLM 网页版登录态此前过期,已重建后运行复测,评分完成后本页将替换为含真实数据的正式版。
TL;DR(30 秒结论)
GLM 网页版(智谱清言 · GLM-5.2) 对同一份规范文本提示词 连续输入 20 次,按 16 项/100 评分表逐项精读评分
结果:均值 — (中位 —),标准差 —,极差 —
按框架稳定性标准(极差 ≥ 8 分 = 不稳定)与学术标准(极差 > 1.96×SD)综合判定稳定性(待数据填充)
强项稳定:分子分型、抗 HER2、自我评估(待数据确认)
稳定盲区 :内分泌治疗细节(3.2a/b/c/d)为框架刻意设计的区分点,待数据确认是否存在系统性失分
1. 为什么跑 20 次:从「哪个模型好」到「答案稳不稳」
Model Reviews 系列(V1–V5)回答的是选型 问题:免费模型里哪个临床表现更好。它每个模型只跑 1–3 次,属于小样本测试组 ——能告诉我们「平均水平」,但回答不了另一个更关键的问题:
同一个模型,同一份规范文本提示词,跑 20 次——会不会翻车?
对临床场景而言,一次跑得好不能证明可靠。如果模型 20 次里有若干次把「无需放疗」判成「强烈建议放疗」,那它均值再高也不适合独立决策。这就是本专栏(Benchmark Repeats)存在的意义:用重复运行暴露偶发与系统性问题 。首篇(DeepSeek 网页版)已显示极差达 12 分、判定不稳定;本篇用同一病例、同一评分表、同一输入口径测试 GLM,检验另一主流模型的稳定性表现。
2. 方法(与 Model Reviews、首篇复测同一病例、同一评分表)
输入 :规范文本提示词(逐字发送,非截图)—— 全系列统一使用 标准提示词 ,纯文本推理对比,排除视觉/OCR 误差
病例 :60 岁女性,右乳单纯切除 + SLNB;低级别 DCIS 伴导管内乳头状癌,癌肿最大径 0.6cm,切片内见 3 簇间质浸润,范围约 0.05cm、0.06cm、0.2cm;ER 3+(90%)、PR 3+(90%)、HER2 0、Ki-67 5%;前哨 0/2 + 1 枚阴性;出院误标 TisN0M0
模型 :GLM 网页版(智谱清言 · GLM-5.2);每次运行新建浏览器会话(验证登录态后发送提示词),无上下文继承
模型设置 :深度思考 + 联网搜索均保持开启 。理由——医生做慎重临床决策时,更看重深度推理 + 实时检索后的答案,故本复测刻意不关闭这两项(这与首篇 DeepSeek 复测的「快速模式 + 自动联网」在思考模式上不同,两篇不强行直接横评,GLM 结果独立呈现)。
运行 :20 次各自独立会话,框架自动发送指令、提取完整响应,原始数据存档可回溯;运行间隔随机 60–180 秒以规避网页版自动化风控
评分 :唯一 Rubric = clinical-benchmark/framework 16 项/100;每篇响应由临床医师逐项精读评分
统计 :均值 / 中位数 / 标准差 / 方差 / 极差 / 变异系数;稳定性判定沿用框架标准(极差 ≥ 8 分 = 不稳定),同时采用学术标准(极差 > 1.96×SD 亦判不稳定)
3. 20 次总分与分布
Run 分数分布 总分 档位
Run 1 ░░░░░░░░░░░░░░░░░░ — —
Run 2 ░░░░░░░░░░░░░░░░░░ — —
Run 3 ░░░░░░░░░░░░░░░░░░ — —
Run 4 ░░░░░░░░░░░░░░░░░░ — —
Run 5 ░░░░░░░░░░░░░░░░░░ — —
Run 6 ░░░░░░░░░░░░░░░░░░ — —
Run 7 ░░░░░░░░░░░░░░░░░░ — —
Run 8 ░░░░░░░░░░░░░░░░░░ — —
Run 9 ░░░░░░░░░░░░░░░░░░ — —
Run 10 ░░░░░░░░░░░░░░░░░░ — —
Run 11 ░░░░░░░░░░░░░░░░░░ — —
Run 12 ░░░░░░░░░░░░░░░░░░ — —
Run 13 ░░░░░░░░░░░░░░░░░░ — —
Run 14 ░░░░░░░░░░░░░░░░░░ — —
Run 15 ░░░░░░░░░░░░░░░░░░ — —
Run 16 ░░░░░░░░░░░░░░░░░░ — —
Run 17 ░░░░░░░░░░░░░░░░░░ — —
Run 18 ░░░░░░░░░░░░░░░░░░ — —
Run 19 ░░░░░░░░░░░░░░░░░░ — —
Run 20 ░░░░░░░░░░░░░░░░░░ — —
统计量 数值
均值 —
均值 —
均值 —
均值 —
均值 —
均值 —
⚠️ 稳定性判定:待填充 GLM 20 次复测数据运行中(登录态已恢复后将自动填充)。
4. 逐项得分:哪些稳定,哪些是盲区
题目 满分 均分 满分次数 0 分次数
1.1 是否认同 TisN0M0 6 — — —
1.2 分期修正 10 — — —
1.3 分子分型 4 — — —
2.1 手术合理性 + ALND 8 — — —
2.2 辅助放疗 4 — — —
3.1 化疗指征 + 多基因检测 10 — — —
3.2a 内分泌必要性 + 全切/保乳差异 ★ 12 — — —
3.2b AI vs TAM + 年龄切点 ★ 10 — — —
3.2c 药物剂量疗程 6 — — —
3.2d OFS / 延长 / CDK4/6 6 — — —
3.3 抗 HER2 4 — — —
4.1 内分泌不良反应监测 6 — — —
4.2 骨密度与生活方式 4 — — —
4.3 随访计划 4 — — —
4.4 对侧乳腺 + BRCA 4 — — —
5 自我评估 + 不确定性 4 — — —
4.1 强项(20 次高度一致满分 ✅)
4.2 系统性盲区(20 次无一满分 —— 可复现,非偶发)
4.3 波动项(偶发失分 —— 不稳定性的来源)
5. 临床一致性观察
(GLM 20 次复测的读数波动、联网搜索变量、稳定盲区等临床一致性观察将在数据就绪后填充。)
6. 结论与使用建议
(综合表现、稳定性判定与使用建议将在评分完成后填充。)
7. 数据与复现
Frequently asked questions
本专栏与 Model Reviews(V1–V5)的分数能直接比较吗? 不能。V1–V5 是小样本组(1–3 次/模型、含多种提问方式),本专栏是 20 次重复的规范测试。两栏分数相加或相减会得出错误结论,需拆开解读。
为什么输入是文字提示词而不是截图? 全系列统一输入形式为规范文本提示词(非门诊病例脱敏截图),模型直接从文字读取信息。这能同时考察模型的纯文本推理与临床决策能力,也让「读数波动」归因更清晰——波动源于文本数值解析而非 OCR 误差。
🔁 返回 Benchmark Repeats 专栏 · 🔬 Model Reviews 系列(V1–V5) · 📊 评分框架