规范复测专栏 · Benchmark Repeats

完整规范测试系列:每个模型 20 次重复运行 · 同一病例 · 同一 16 项/100 评分表 · 稳定性优先
🔁 20 runs per model 📋 2026 CBCS rubric 📈 Mean / SD / range stats 🩺 Author: breast / thyroid surgeon, MD/PhD
By Tan Haosheng · 副主任医师 / 医学博士 (Associate Chief Physician, MD/PhD) · 甲状腺乳腺外科 (Thyroid & Breast Surgery), 泰州市人民医院 (Taizhou People's Hospital) · 专栏建立 2026-08-01
⚠️ Medical disclaimer / 医疗免责声明: All clinical case analyses, model evaluations, and treatment discussions on this site are for educational and research purposes only. They are based on a single anonymized case and do not constitute individual medical advice, diagnosis, or treatment. For any real patient, always consult your own qualified physician and follow current guidelines (NCCN / CSCO / CBCS). AI outputs are not a substitute for professional clinical judgment. Last reviewed / 最后审阅: 2026-08-01.

这个专栏解决什么问题?

V1–V5 系列(Model Reviews)回答的是「哪个模型更好」——每个模型跑 1–3 次,属于小样本测试组

本专栏(Benchmark Repeats)回答的是「同一个模型,跑 20 次,答案稳不稳定」——这是临床决策场景更关键的问题:一次跑得好不算数,20 次里有没有翻车才重要

每一期:同一张门诊病例截图、同一条 16 项指令、同一份 16 项/100 评分表,模型独立运行 20 次,报告均值 / 中位数 / 标准差 / 极差,并按框架标准判定稳定性。

系列文章

#1 · 2026-08-01

DeepSeek 网页版 20 次完整复测:同一病例、同一评分表

DeepSeek Web · 快速模式 · 自动联网搜索
均值 69.8 / 100 · 中位 71.5 · SD 3.54 · 极差 12(63–75)→ 按框架标准判定:不稳定 强项:分子分型/抗HER2/自我评估(20/20 满分) 盲区:内分泌治疗细节 4 题(3.2a/b/c/d 丢失约 18 分)
阅读全文 → 评分框架 →

方法论(全系列统一)

与 Model Reviews(V1–V5)的关系:两专栏使用同一病例、同一评分表,但评分结果不可直接跨栏相加对比——V1–V5 为小样本(1–3 次/模型)且含多种提问方式,本专栏为 20 次重复的规范测试。请勿将本专栏分数与 V1–V5 分数进行减法或同图对比。

Frequently asked questions

为什么要跑 20 次而不是 3 次?

3 次只能给出「大致水平」,20 次才能暴露偶发翻车(如本系列 DeepSeek 某次把"无需放疗"错判为"强烈建议放疗")。极差 ≥ 8 分的模型,即使均值高,也不适合独立临床使用。

本专栏与 Model Reviews 的分数能比较吗?

不能直接比较。V1–V5 是小样本组(1–3 次/模型),本专栏是 20 次规范复测,样本量与提问方式不同,跨栏相减会得出错误结论。

复测数据从哪里来?

由本机 Playwright 自动化框架驱动真实浏览器,每轮新建会话,自动截图、发送 16 项指令、提取完整响应,原始数据存档可回溯。

本专栏内容仅供个人 LLM 选型与学习参考,不构成临床建议。相关阅读:Model Reviews 系列(V1–V5) · 评分框架