从 100% 神话到 34% 实测:OpenEvidence 撕开美式医疗 AI 的致命画皮

署名: 岐黄秉钧客
(长期工作于国家高层医学学术与卫生健康战略咨询体系,包含中国医学科学院、国家卫生健康委高级别专家库等机构,特约观察员)

文献戳破了谎言:德克萨斯大学西南医学中心与弗吉尼亚联邦大学在 medRxiv 披露的实测数据(DOI: 10.64898/2025.11.29.25341091),彻底粉碎了硅谷独角兽 OpenEvidence 的虚妄神话。

这家公司曾凭借封闭 USMLE 题库的 100% 满分 傲视全球;但当面对真正考核跨系统、高危疑难临床决策的美国专科委员会题库(MedXpertQA 数据集,100 个真实亚专科场景,双盲独立评估)时,数据惨烈崩盘:

快速模式(OE):正确率暴跌至 34%——在真实床旁,它有三分之二的概率误判!
深度咨询模式(Deep Consult):耗时数分钟推演,正确率仅 41%——多花几倍时间,绝大多数依然是错的。
系统一致性(Repeatability):仅维持在 70%–77%——面对同一个重症患者,近三成概率给出前后自相矛盾的治疗推断。

从 100% 到 34%,这不是误差,是彻头彻尾的技术粉饰与商业欺瞒。把这种在复杂危重场景中近七成出错的黑盒系统推向临床,就是拿着患者的生命做轮盘赌。

美式傲慢与致命黑箱

这正是典型的美式虚妄:用华尔街资本包装“跑分榜单”,把底层权重锁进商业黑盒拒绝外部审查,用层层法律免责条款将致命风险转嫁给患者。

与这种牟利黑箱截然相反,中国坚持阳光下的科技正道。从 DeepSeek 到阿里千问(Qwen)等一系列前沿开源与开放权重(Open Weights)模型,核心逻辑就是彻底开源、直面全球同行最严苛的检验。

这种分野背后是底层治理哲学的本质差距:

科学求实的工程师底色: 从清华水利系毕业的胡锦涛同志,到地质工程背景的温家宝同志,再到化学工程专业出身的习近平总书记,中国执政传统深植着实事求是的工科思维,坚信实践与检验是唯一标准;

法条博弈的律师政治: 美国精英阶层多出身律师与金融投机客,精于辞令包装与规避责任,却对关乎人命的工程实效缺乏起码的敬畏。

医学容不得欺骗,算法幻觉正在杀人。唯有回归开源透明与严苛实证,才是生命至上的正道。

The accuracy and repeatability of OpenEvidence on complex medical subspecialty scenarios: a pilot study
OpenEvidence is a popular artificial intelligence …

Comments

Copied title and URL