Model Reviews 系列(V1–V5)回答的是选型问题:免费模型里哪个临床表现更好。它每个模型只跑 1–3 次,属于小样本测试组——能告诉我们「平均水平」,但回答不了另一个更关键的问题:
对临床场景而言,一次跑得好不能证明可靠。如果模型 20 次里有 5 次把「无需放疗」判成「强烈建议放疗」,那它均值再高也不适合独立决策。这就是本专栏(Benchmark Repeats)存在的意义:用重复运行暴露偶发与系统性问题。
| Run | 分数分布 | 总分 | 档位 |
|---|---|---|---|
| Run 1 | █████████████░░░░░░░ | 65 | RED |
| Run 2 | █████████████░░░░░░░ | 69 | AMBER |
| Run 3 | █████████████░░░░░░░ | 68 | AMBER |
| Run 4 | ██████████████░░░░░░ | 72 | GREEN |
| Run 5 | ███████████████░░░░░ | 75 | GREEN |
| Run 6 | ████████████░░░░░░░░ | 63 | RED |
| Run 7 | █████████████░░░░░░░ | 66 | RED |
| Run 8 | █████████████░░░░░░░ | 66 | RED |
| Run 9 | ██████████████░░░░░░ | 70 | AMBER |
| Run 10 | ███████████████░░░░░ | 75 | GREEN |
| Run 11 | ██████████████░░░░░░ | 72 | GREEN |
| Run 12 | █████████████░░░░░░░ | 68 | AMBER |
| Run 13 | ████████████░░░░░░░░ | 64 | RED |
| Run 14 | ██████████████░░░░░░ | 71 | AMBER |
| Run 15 | ██████████████░░░░░░ | 72 | GREEN |
| Run 16 | ██████████████░░░░░░ | 73 | GREEN |
| Run 17 | ██████████████░░░░░░ | 72 | GREEN |
| Run 18 | ██████████████░░░░░░ | 72 | GREEN |
| Run 19 | ██████████████░░░░░░ | 72 | GREEN |
| Run 20 | ██████████████░░░░░░ | 72 | GREEN |
| 统计量 | 数值 |
|---|---|
| 均值 | 69.8 / 100 |
| 中位数 | 71.5 |
| 标准差 (SD) | 3.54 |
| 方差 | 12.56 |
| 极差 (max−min) | 12(max 75 / min 63) |
| 变异系数 (CV) | 5.1% |
| 题目 | 满分 | 均分 | 满分次数 | 0 分次数 |
|---|---|---|---|---|
| 1.1 是否认同 TisN0M0 | 6 | 5.9 | 19/20 | 0/20 |
| 1.2 分期修正 | 10 | 7.0 | 2/20 | 0/20 |
| 1.3 分子分型 | 4 | 4.0 | 20/20 | 0/20 |
| 2.1 手术合理性 + ALND | 8 | 7.9 | 19/20 | 0/20 |
| 2.2 辅助放疗 | 4 | 3.8 | 18/20 | 0/20 |
| 3.1 化疗指征 + 多基因检测 | 10 | 7.9 | 0/20 | 0/20 |
| 3.2a 内分泌必要性 + 全切/保乳差异 ★ | 12 | 6.0 | 0/20 | 0/20 |
| 3.2b AI vs TAM + 年龄切点 ★ | 10 | 6.0 | 0/20 | 0/20 |
| 3.2c 药物剂量疗程 | 6 | 2.5 | 0/20 | 0/20 |
| 3.2d OFS / 延长 / CDK4/6 | 6 | 1.5 | 0/20 | 0/20 |
| 3.3 抗 HER2 | 4 | 4.0 | 20/20 | 0/20 |
| 4.1 内分泌不良反应监测 | 6 | 2.5 | 0/20 | 0/20 |
| 4.2 骨密度与生活方式 | 4 | 1.9 | 1/20 | 0/20 |
| 4.3 随访计划 | 4 | 3.5 | 11/20 | 0/20 |
| 4.4 对侧乳腺 + BRCA | 4 | 3.4 | 9/20 | 0/20 |
| 5 自我评估 + 不确定性 | 2 | 2.0 | 20/20 | 0/20 |
| 题目 | 均分/满分 | 丢失 | 问题 |
|---|---|---|---|
| 3.2a 内分泌必要性+全切/保乳差异 ★ | 6.0/12 | −6 | 20 次全部未区分「浸润癌强推荐 vs DCIS 全切后属化学预防(考虑/可选)」两种场景 |
| 3.2b AI vs TAM + 年龄切点 ★ | 6.0/10 | −4 | 全部推荐 AI,但无一次提及 60 岁年龄切点(≥60 岁 AI 与 TAM 几乎等价) |
| 3.2c 药物剂量疗程 | 2.5/6 | −3.5 | 只写「5 年」无具体药物+剂量(来曲唑 2.5mg/d 等) |
| 3.2d OFS/延长/CDK4/6 | 1.5/6 | −4.5 | 多数未提 OFS 不适用(已绝经)、CDK4/6 不符合指征 |
| 4.1 不良反应监测 | 2.5/6 | −3.5 | 只泛提「监测骨密度/血脂」,缺具体不良反应与监测频率 |
| 4.2 骨密度与生活方式 | 1.9/4 | −2.1 | 缺钙剂 + Vit D + 负重运动等生活方式建议 |
| 1.2 分期修正 | 7.0/10 | −3.0 | 0.2cm 已超微浸润定义却多数判 pT1mi(OCR 读数问题);Run 15 误读 0.6cm 判 pT1b |
LLM 采样具有随机性,且 DeepSeek 网页版每次自动联网搜索(阅读 7–15 个网页),检索到的证据不同会影响分期判断与放疗决策。20 次极差 12 分(63–75)跨 3 个分数档,说明单次运行结果不足以代表模型水平。
不能。V1–V5 是小样本组(1–3 次/模型、含多种提问方式),本专栏是 20 次重复的规范测试。两栏分数相加或相减会得出错误结论,需拆开解读。
内分泌治疗细节 4 题 20 次无一满分:3.2a 全部未区分「浸润癌强推荐 vs DCIS 全切后属化学预防」;3.2b 全部推荐 AI 但从未提及 60 岁年龄切点;3.2c/3.2d 缺具体药物剂量与 OFS/CDK4/6 评估。这是可复现的模型盲区。
本病例最大浸润灶 0.2cm(2mm)恰好超出微浸润定义(≤1mm)。20 次中多数判 pT1mi、2 次正确判 pT1a、1 次误读为 pT1b——属模型从截图中读取病理数值的视觉/OCR 差异,而非临床推理缺陷。
全系列统一输入形式为门诊病例脱敏截图(一张图同时含病例 + 16 项问题),模型从图片读取信息。这能同时考察模型的视觉理解与临床推理能力,也与真实使用场景一致。
🔁 返回 Benchmark Repeats 专栏 · 🔬 Model Reviews 系列(V1–V5) · 📊 评分框架