Claude 3 Opus · 临床决策实测 — 乳腺癌病例
🎯 核心理念 / Core Philosophy
AI 是医生的辅助工具,而非替代者。我们利用 AI 协助医生对照临床指南、发现病例中可能漏掉的疑点,并指向指南的具体章节和页码。最终治疗决策仍由医生基于循证医学做出。
Anthropic 旗舰模型在乳腺癌术后病例上的表现。数据收集中。
为什么测试 Claude 3 Opus?
Claude 3 Opus 是 Anthropic 最强的推理模型。我们在乳腺癌病例上测试它的临床决策能力。
测试方法
- 病例:乳腺癌术后(60岁女性,pT1aN0M0 IA)
- 输入:门诊病例脱敏截图
- 评分:16项 rubric vs 2026 CBCS 指南(满分 100)
- 次数:20 次迭代测稳定性
结果
数据收集完成后将在此发布。
与其他模型对比
Claude 3 Opus 将与 DeepSeek V4、ChatGLM 5.2、Kimi K2.6、豆包进行统一排名对比。
常见问题
结果什么时候发布?
正在收集 20 次运行数据。预计 2026 年 8 月完成。
Claude 3 Opus 和 GPT-4 谁更强?
两者使用相同方法测试,结果将在统一排名中公布。