quaful 在 Artificial Analysis发布医学复杂推理评测MLCR-AA,Claude断崖式领先,Kimi K3紧随其后 中发帖
Artificial Analysis发布医学复杂推理评测MLCR-AA,考察模型对复杂医疗病例报告的分析、推理能力,评分项包括完整性、准确性和简洁性:Medical Long Context Reasoning (MLCR-AA) | Artificial Analysis
评测结果,从完整性上,Claude Fable 5、Opus 5遥遥领先:
[截屏2026-08-24 11.04.16]
Kimi K3的完整性居然超过了GPT-5.6。
但准确性上,GPT-5.6 Sol和Terra强于Claude和Kimi K3,说明幻觉少。综合排名:
[截屏2026-08-24 11.10.45]
看来医学方面的问题,应该是Claude Fable 5/Opus 5 + GPT-5.6 Sol组合着看