一个病例、一把尺子:把第一版到第五版的全部模型评分,统一到临床基准框架的 16 项 Rubric 上重新计算。
| 项目 | 内容 |
|---|---|
| 基本情况 | 60 岁女性,2026-04-26 行右乳单纯切除术 + 前哨淋巴结活检 |
| 病理 | 低级别导管原位癌伴浸润性导管癌(乳头状为主) |
| 病灶 | 整体最大径 0.6 cm;3 簇间质浸润 0.05 / 0.06 / 0.2 cm |
| 切缘 / 淋巴结 | 乳头、皮肤、基底、侧切缘均阴性;前哨 0/2 + 前哨旁 1 枚阴性 |
| 脉管 / 神经 | 未见脉管瘤栓,未见神经侵犯 |
| 免疫组化 | ER 3+ 90%,PR 3+ 90%,HER-2 0,Ki-67 5%,P53 野生型 |
| 病历原诊断 | pTNM TisN0M0(0 期) ← 这是陷阱 |
| 正确答案 | pT1a N0(sn) M0,ⅠA 期 · Luminal A 样(取最大浸润灶 0.2 cm;>1 mm 故非 T1mi;多灶不叠加) |
| 组别 | 提问 | 未考察条目 | 适用满分 | 使用版本 |
|---|---|---|---|---|
| 完整指令组 | 16 项逐条提问(framework 标准 Prompt 全文) | 无 | 100 | V1、V2 |
| 简化指令组 | 仅问一句 «Next therapy ?» | 2.1 手术合理性+ALND(8) 5 自我评估(2) | 90 | V3、V4、V5 |
Rubric:tanhaosheng.asia/clinical-benchmark/framework 的 16 项 / 100 分表,全系列唯一,不再新增或简化任何量表。
| # | 评分项 | 满分 | # | 评分项 | 满分 |
|---|---|---|---|---|---|
| 1.1 | 是否认同 TisN0M0 | 6 | 3.2b | AI vs TAM + 年龄切点【核心】 | 10 |
| 1.2 | 分期修正 (pT1a ⅠA) | 10 | 3.2c | 药物剂量疗程 | 6 |
| 1.3 | 分子分型 Luminal A | 4 | 3.2d | OFS / 延长 / CDK4-6 | 6 |
| 2.1 | 手术合理性 + ALND | 8 | 3.3 | 抗 HER2(免用) | 4 |
| 2.2 | 辅助放疗(免放疗) | 4 | 4.1 | 内分泌不良反应监测 | 6 |
| 3.1 | 化疗指征 + 多基因检测 | 10 | 4.2 | 骨密度与生活方式 | 4 |
| 3.2a | 内分泌必要性 + 全切/保乳差异【核心】 | 12 | 4.3 | 随访计划 | 4 |
| 4.4 | 对侧乳腺 + BRCA | 4 | |||
| 5 | 自我评估 + 不确定性 | 2 |
标准分 = 实得分 ÷ 适用满分 × 100
| # | 问题 | 后果 |
|---|---|---|
| ① | 10 项表把"引用指南具体章节页码"单列 12 分 | 裸测(不给指南)时任何模型都只能得 0 → 全场统一凭空扣 12 分,且对"凭训练知识答对"的模型惩罚最重。 |
| ② | 10 项表与 16 项表条目无法一一对应 | 10 项表把"骨保护"提到 10 分、"间质浸润归类"提到 10 分,而 16 项表里这两项合计仅 8 分;权重结构完全不同,分数不可互换。 |
| ③ | 旧总榜把两套表的分数混排 | 线上《Ranked leaderboard — all 8 models》直接把 Part 2(16 项)与 Part 3(10 项)的分数放进同一列排名 → 排名无效。 |
此外还有一处数据层面的问题:GLM 5.2 原来的 3 次运行中有 1 次会话被其他模型混入,样本不干净;DeepSeek V4 Pro 在简化指令组根本没有自己的数据,旧榜是直接借用了它在完整指令组的分数。两者都已用新的干净运行补齐。
| 模型 | 旧样本 | 新样本(本次采用) | 更换原因 |
|---|---|---|---|
| 智谱 GLM 5.2 | 657a0e42 · d61d6459 · 47fd2ee3 | 657a0e42 · d61d6459 · 5c9b823d | 47fd2ee3 会话被其他模型混入,非 GLM 纯净输出 → 整轮作废,由重跑任务「智谱」替换。 |
| DeepSeek V4 Pro | 819362bf · ad155179 · 5c76ec53 (简化指令组数据从未发表,旧榜借用完整指令组的 50 分) | 819362bf · 5c76ec53 · 38e99fc1 | ad155179 首轮返回的是其他模型的拒答话术 → 整轮作废,由重跑任务「deepseek」替换。 |
两个模型现在各自都有 3 次干净、可复核的运行,满足框架"每模型跑 3 次取中位"的要求。
下表为同一把 16 项尺子下、仅问 "Next therapy ?" 时的重算结果。标准分 = 实得分 ÷ 90 × 100。带「智能体」者为 WorkBuddy 内运行,「网页版」为外部网页运行(仅基线轮,无指南配对轮)。
| 排名 | 模型 | 版本 | 基线同尺(满分90) | 标准分 | 指南后标准分 | Δ |
|---|---|---|---|---|---|---|
| 1 | Kimi K3 | 智能体 | 78 / 90 | 86.7 | — 仅基线* | — |
| 2 | 智谱 GLM 5.2 | 智能体 | 68 / 90 | 75.6 | 84.4 | +8.8 |
| 3 | Kimi K2.6 | 智能体 | 65 / 90 | 72.2 | 83.3 | +11.1 |
| 4 | DeepSeek V4 Flash | 智能体 | 62 / 90 | 68.9 | 75.6 | +6.7 |
| 4 | Kimi K2.6 | 网页版 | 62 / 90 | 68.9 | — 仅基线* | — |
| 5 | DeepSeek V4 Pro | 智能体 | 60 / 90 | 66.7 | 74.4 | +7.7 |
| 6 | Grok 4.5 fast | 网页版 | 43 / 90 | 47.8 | — 仅基线* | — |
* Kimi K3、Kimi K2.6 网页版、Grok 4.5 fast 网页版在外部网页运行,只保留了基线轮原始回答(已存档),未做指南注入配对,故无「指南后」一列。Δ = 指南后标准分 − 基线标准分。
raw-answers/grok-4.5-fast/),第一次粘贴还误把 therapy 读成心理治疗(已存为 variant,不计入)。
柱高 = 标准分 × 2.4 px。全系列同尺可比:智能体版与网页版同色系区分;Grok 网页版明显垫底。
这一组用 framework 标准 Prompt 全文逐条提问(16 项全考,适用满分 100),标准分 = 原始分。均为网页版运行,只有逐项评分表、无回答全文存档,故本节不参与与第 5 节合并排名。
| 排名 | 模型 | 版本 | 同尺(满分100) | 标准分 |
|---|---|---|---|---|
| 1 | DeepSeek V4 Pro | 智能体 | 50 / 100 | 50.0 |
| 2 | 豆包 | 网页版 | 41 / 100 | 41.0 |
| 3 | DeepSeek(网页版) | 网页版 | 28 / 100 | 28.0 |
| 4 | ChatGLM(网页版) | 网页版 | 5 / 100 | 5.0 |
| 文章 | 组别 | 旧问题 | 本次改动 | 状态 |
|---|---|---|---|---|
| V1 · chatglm-vs-deepseek | 完整 | "Two cases" 措辞、ChatGLM 网页 5 分孤立 | 加「全系列唯一病例」声明;澄清 ChatGLM 网页版仅进完整指令组榜 | 待改(轻) |
| V2 · four-models | 完整 | 四模型含豆包41/DeepSeek网页28/V4Pro50/ChatGLM5,措辞含 Case A/B | 统一为完整指令组榜;补「唯一病例」声明 | 待改(轻) |
| V3 · agent-vs-web-isolation | 简化 | 10 项表、GLM/DeepSeekPro 旧样本、未拆榜 | 换 GLM→5c9b823d、V4Pro→38e99fc1;改用 16 项同尺;拆成"简化指令组"单榜 | 待改(重) |
| V4 · kimi-k2-6-web-vs-agent | 简化 | 10 项表、Kimi 网页版无数据、与智能体版误比 | Kimi 网页版现在已存档并入榜(68.9 中位);与智能体版(72.2)分开列、不混算 | 待改(重) |
| V5 · guideline-report | 简化 | 第 4 节把 Kimi 当"特例弱模型被救活";四模型旧表 | 删第 4 节特例;四模型同尺(GLM/Flash/Pro/K2.6 智能体);加 Grok/Kimi 网页版基线说明 | 待改 |
| 本文 · unified-scoring-v1-v5 | — | 原 Case A/B 两榜、混排 | 已重写为单一病例 + 两张独立榜 + 原始数据存档 | 已完成 |
| framework / clinical-benchmark | — | — | Rubric 不变(16 项/100 为唯一标准) | 不变 |
数据来源(全部可回溯)
· 原始数据总索引:/Users/xx/WorkBuddy/2026-07-26-20-39-53/raw-answers/INDEX.md
· Grok 4.5 fast 网页版原始回答:raw-answers/grok-4.5-fast/(run1/2/3 + variant 误读)
· Kimi K2.6 网页版原始回答:raw-answers/kimi-k2.6-web/(run1/2/3)
· 评测框架 Rubric:/tmp/live-site/clinical-benchmark/framework.md(线上 tanhaosheng.asia/clinical-benchmark/framework)
· 本地会话可回溯:v5-extract/ · v5-kimi/ · v5-k3/ · v7-clean/
归档规则:先存档后评分;外部网页运行同样落盘全文;作废样本标注 ❌ 保留供审计。