全系列统一评分标准 · V1–V5 重算

一个病例、一把尺子:把第一版到第五版的全部模型评分,统一到临床基准框架的 16 项 Rubric 上重新计算。

本文要解决的四件事
纠正一处框架性错误:全系列自始至终只有一个病例。此前文档里的「Case A / Case B」措辞把同一位患者写成了两个人,予以撤回。
② 系列里曾并行使用两套评分表(16 项 / 10 项),且把两套表的分数混在同一张榜上排名——无效比较,必须撤回。
DeepSeek V4 Pro 与智谱 GLM 5.2 已换成新的干净运行,凡引用这两个模型旧数据的文章都要同步改。
Grok 4.5 fast 与 Kimi K2.6 网页版的原始回答已补齐存档,两者从"无法重算"转为正式入榜。

1. 唯一病例(全系列只有这一位患者)

撤回声明:不存在「Case A」与「Case B」两位患者。
此前文档用 Case A / Case B 区分两组测试,并写成"两个不同的患者、不同的陷阱"——这是错的。全系列从第一版到第五版,测的自始至终是同一位患者的同一份病历。两组测试的差别只在提问方式,不在病例。凡基于"不同患者"作出的推论一并撤回。
项目内容
基本情况60 岁女性,2026-04-26 行右乳单纯切除术 + 前哨淋巴结活检
病理低级别导管原位癌伴浸润性导管癌(乳头状为主)
病灶整体最大径 0.6 cm;3 簇间质浸润 0.05 / 0.06 / 0.2 cm
切缘 / 淋巴结乳头、皮肤、基底、侧切缘均阴性;前哨 0/2 + 前哨旁 1 枚阴性
脉管 / 神经未见脉管瘤栓,未见神经侵犯
免疫组化ER 3+ 90%,PR 3+ 90%,HER-2 0,Ki-67 5%,P53 野生型
病历原诊断pTNM TisN0M0(0 期)这是陷阱
正确答案pT1a N0(sn) M0,ⅠA 期 · Luminal A 样(取最大浸润灶 0.2 cm;>1 mm 故非 T1mi;多灶不叠加)

唯一的实验变量:提问方式

组别提问未考察条目适用满分使用版本
完整指令组16 项逐条提问(framework 标准 Prompt 全文)100V1、V2
简化指令组仅问一句 «Next therapy ?»2.1 手术合理性+ALND(8)
5 自我评估(2)
90V3、V4、V5

2. 唯一评分标准(此后不再有第二套)

Rubrictanhaosheng.asia/clinical-benchmark/framework16 项 / 100 分表,全系列唯一,不再新增或简化任何量表。

#评分项满分#评分项满分
1.1是否认同 TisN0M063.2bAI vs TAM + 年龄切点【核心】10
1.2分期修正 (pT1a ⅠA)103.2c药物剂量疗程6
1.3分子分型 Luminal A43.2dOFS / 延长 / CDK4-66
2.1手术合理性 + ALND83.3抗 HER2(免用)4
2.2辅助放疗(免放疗)44.1内分泌不良反应监测6
3.1化疗指征 + 多基因检测104.2骨密度与生活方式4
3.2a内分泌必要性 + 全切/保乳差异【核心】124.3随访计划4
   4.4对侧乳腺 + BRCA4
   5自我评估 + 不确定性2
归一化规则(解决"提问深浅不同"的可比性问题)
简化指令没有问到的条目不能算模型失分,处理办法是:

标准分 = 实得分 ÷ 适用满分 × 100

可比性红线(理由已更新):标准分统一了量表病例,但统一不了提问深度。两组不可并列排名,原因有二:
① 完整指令会逼模型对难题表态(如"全切 vs 保乳的内分泌推荐差异"),答错即失分;简化指令下模型往往不触及该问题,按"只答必要性"给部分分 8/12。同一份答卷在两种提问下的给分惯例不同。
② 完整指令组多考了 2.1 与 5 两项。
因此本文给出两张独立榜,绝不再合并成一张"全系列总榜"。

3. 为什么必须重算:旧口径的三个硬伤

#问题后果
10 项表把"引用指南具体章节页码"单列 12 分裸测(不给指南)时任何模型都只能得 0 → 全场统一凭空扣 12 分,且对"凭训练知识答对"的模型惩罚最重。
10 项表与 16 项表条目无法一一对应10 项表把"骨保护"提到 10 分、"间质浸润归类"提到 10 分,而 16 项表里这两项合计仅 8 分;权重结构完全不同,分数不可互换
旧总榜把两套表的分数混排线上《Ranked leaderboard — all 8 models》直接把 Part 2(16 项)与 Part 3(10 项)的分数放进同一列排名 → 排名无效

此外还有一处数据层面的问题:GLM 5.2 原来的 3 次运行中有 1 次会话被其他模型混入,样本不干净;DeepSeek V4 Pro 在简化指令组根本没有自己的数据,旧榜是直接借用了它在完整指令组的分数。两者都已用新的干净运行补齐。

4. 两个模型的样本更换(V4 Pro / GLM 5.2)

模型旧样本新样本(本次采用)更换原因
智谱 GLM 5.2657a0e42 · d61d6459 · 47fd2ee3657a0e42 · d61d6459 · 5c9b823d47fd2ee3 会话被其他模型混入,非 GLM 纯净输出 → 整轮作废,由重跑任务「智谱」替换。
DeepSeek V4 Pro819362bf · ad155179 · 5c76ec53
(简化指令组数据从未发表,旧榜借用完整指令组的 50 分)
819362bf · 5c76ec53 · 38e99fc1ad155179 首轮返回的是其他模型的拒答话术 → 整轮作废,由重跑任务「deepseek」替换。

两个模型现在各自都有 3 次干净、可复核的运行,满足框架"每模型跑 3 次取中位"的要求。

5. 简化指令组榜单(适用满分 90 · 同尺标准分)

下表为同一把 16 项尺子下、仅问 "Next therapy ?" 时的重算结果。标准分 = 实得分 ÷ 90 × 100。带「智能体」者为 WorkBuddy 内运行,「网页版」为外部网页运行(仅基线轮,无指南配对轮)。

排名模型版本基线同尺(满分90)标准分指南后标准分Δ
1Kimi K3智能体78 / 9086.7— 仅基线*
2智谱 GLM 5.2智能体68 / 9075.684.4+8.8
3Kimi K2.6智能体65 / 9072.283.3+11.1
4DeepSeek V4 Flash智能体62 / 9068.975.6+6.7
4Kimi K2.6网页版62 / 9068.9— 仅基线*
5DeepSeek V4 Pro智能体60 / 9066.774.4+7.7
6Grok 4.5 fast网页版43 / 9047.8— 仅基线*

* Kimi K3、Kimi K2.6 网页版、Grok 4.5 fast 网页版在外部网页运行,只保留了基线轮原始回答(已存档),未做指南注入配对,故无「指南后」一列。Δ = 指南后标准分 − 基线标准分。

读图要点
① 标准分统一了量表与病例,但不合并到完整指令组(见第 2 节红线)。本榜只排「简化指令」这一种提问方式。
② Kimi K2.6 的「智能体版」与「网页版」是两个不同运行形态,标准分接近(72.2 vs 68.9),但智能体版有指南配对轮、网页版没有,不能直接比「指南增益」。
③ Grok 4.5 fast 网页版中位仅 47.8,是这一组里唯一明显掉队的;其三次运行 39/43/50 波动大(见 raw-answers/grok-4.5-fast/),第一次粘贴还误把 therapy 读成心理治疗(已存为 variant,不计入)。
智能体版 网页版 0 20 40 60 80 Kimi K3(智能体) 86.7 智谱 GLM 5.2(智能体) 75.6 Kimi K2.6(智能体) 72.2 DeepSeek V4 Flash(智能体) 68.9 Kimi K2.6(网页版) 68.9 DeepSeek V4 Pro(智能体) 66.7 Grok 4.5 fast(网页版) 47.8

柱高 = 标准分 × 2.4 px。全系列同尺可比:智能体版与网页版同色系区分;Grok 网页版明显垫底。

6. 完整指令组榜单(适用满分 100 · 同尺标准分)

这一组用 framework 标准 Prompt 全文逐条提问(16 项全考,适用满分 100),标准分 = 原始分。均为网页版运行,只有逐项评分表、无回答全文存档,故本节不参与与第 5 节合并排名。

排名模型版本同尺(满分100)标准分
1DeepSeek V4 Pro智能体50 / 10050.0
2豆包网页版41 / 10041.0
3DeepSeek(网页版)网页版28 / 10028.0
4ChatGLM(网页版)网页版5 / 1005.0
注意:本组 ChatGLM(网页版)仅 5 分,但那是完整指令组下的表现;第 5 节里「智谱 GLM 5.2(智能体)」拿 75.6 分——两者不是同一个模型/同一种提问(一个是 ChatGLM 网页版在完整指令下,一个是 GLM 5.2 智能体在简化指令下),旧文曾把"GLM 网页 5 → 智能体 44,+39"当作同模型跨表相减,已撤回。

7. 逐篇改动清单(同步到线上四篇 + V5 报告)

文章组别旧问题本次改动状态
V1 · chatglm-vs-deepseek完整"Two cases" 措辞、ChatGLM 网页 5 分孤立加「全系列唯一病例」声明;澄清 ChatGLM 网页版仅进完整指令组榜待改(轻)
V2 · four-models完整四模型含豆包41/DeepSeek网页28/V4Pro50/ChatGLM5,措辞含 Case A/B统一为完整指令组榜;补「唯一病例」声明待改(轻)
V3 · agent-vs-web-isolation简化10 项表、GLM/DeepSeekPro 旧样本、未拆榜换 GLM→5c9b823d、V4Pro→38e99fc1;改用 16 项同尺;拆成"简化指令组"单榜待改(重)
V4 · kimi-k2-6-web-vs-agent简化10 项表、Kimi 网页版无数据、与智能体版误比Kimi 网页版现在已存档并入榜(68.9 中位);与智能体版(72.2)分开列、不混算待改(重)
V5 · guideline-report简化第 4 节把 Kimi 当"特例弱模型被救活";四模型旧表删第 4 节特例;四模型同尺(GLM/Flash/Pro/K2.6 智能体);加 Grok/Kimi 网页版基线说明待改
本文 · unified-scoring-v1-v5原 Case A/B 两榜、混排已重写为单一病例 + 两张独立榜 + 原始数据存档已完成
framework / clinical-benchmarkRubric 不变(16 项/100 为唯一标准)不变

8. 结论

一句话:全系列自始至终只测了同一位患者,唯一的实验变量是「提问方式」;所有模型现在都站在同一把 16 项尺子上,分两组(完整指令 / 简化指令)各自排名,不再合并

重算后最稳的三条结论
指南救不了读错病例:全切误读保乳(d61d6459 / 5c76ec53)、间质浸润误读脉管瘤栓(c59c18d0 指南后反降)仍是核心红线,指南注入提升的是「表述规范性」而非「纠正根本误读」。
简化指令下头部是 Kimi K3(86.7)与 GLM 5.2(75.6);DeepSeek 双版本(Flash 68.9 / Pro 66.7)居中;Grok 4.5 fast 网页版(47.8)垫底。
指南注入对四模型均有正增益(+6.7 ~ +11.1 标准分),但增益幅度与"基线强弱"无关,不存在"越弱被救得越多"——那是旧 10 项表相减造出的假象。

数据来源(全部可回溯)
· 原始数据总索引:/Users/xx/WorkBuddy/2026-07-26-20-39-53/raw-answers/INDEX.md
· Grok 4.5 fast 网页版原始回答:raw-answers/grok-4.5-fast/(run1/2/3 + variant 误读)
· Kimi K2.6 网页版原始回答:raw-answers/kimi-k2.6-web/(run1/2/3)
· 评测框架 Rubric:/tmp/live-site/clinical-benchmark/framework.md(线上 tanhaosheng.asia/clinical-benchmark/framework
· 本地会话可回溯:v5-extract/ · v5-kimi/ · v5-k3/ · v7-clean/
归档规则:先存档后评分;外部网页运行同样落盘全文;作废样本标注 ❌ 保留供审计。