V1–V5 系列(Model Reviews)回答的是「哪个模型更好」——每个模型跑 1–3 次,属于小样本测试组。
本专栏(Benchmark Repeats)回答的是「同一个模型,跑 20 次,答案稳不稳定」——这是临床决策场景更关键的问题:一次跑得好不算数,20 次里有没有翻车才重要。
每一期:同一张门诊病例截图、同一条 16 项指令、同一份 16 项/100 评分表,模型独立运行 20 次,报告均值 / 中位数 / 标准差 / 极差,并按框架标准判定稳定性。
3 次只能给出「大致水平」,20 次才能暴露偶发翻车(如本系列 DeepSeek 某次把"无需放疗"错判为"强烈建议放疗")。极差 ≥ 8 分的模型,即使均值高,也不适合独立临床使用。
不能直接比较。V1–V5 是小样本组(1–3 次/模型),本专栏是 20 次规范复测,样本量与提问方式不同,跨栏相减会得出错误结论。
由本机 Playwright 自动化框架驱动真实浏览器,每轮新建会话,自动截图、发送 16 项指令、提取完整响应,原始数据存档可回溯。
本专栏内容仅供个人 LLM 选型与学习参考,不构成临床建议。相关阅读:Model Reviews 系列(V1–V5) · 评分框架。