AI 日报hiw3c.com

AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线

量子位 www.qbitai.com 网页快照

AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线

2016年,Hinton老爷子就预言:“人们现在就应该停止培养放射科医生。”他甚至认为,五年内,AI就会在医疗影像识别上超过放射科医生。

老爷子一生谨慎,但历史和他开了个玩笑。十年过去了,人们离AGI已经越来越近,但 在医疗场景里, 即使图像识别这样的AI新手村任务,依然是hard模式。

——对模型精度的极高要求,在别的领域,模型幻觉可以一笑了之,但在这里却是人命关天。

一个模型,看146种病

DAMO RADAR,全称Rapid Abdominal Diagnosis with AI and Radiology,面向腹部快速诊断的AI模型。

这个AI“雷达”,研发团队就是阿里达摩院,过去几年他们用AI识别CT中肉眼难见的早期癌症病灶,在胰腺癌、胃癌、肠癌等专病上取得重大突破,发表5篇Nature Medicine。

但做着做着,达摩院有些人觉得不对劲了。达摩院高级算法专家张建鹏说,一个病种啃下来至少两三年,人类疾病成千上万种,那他们搞一辈子都搞不完……

更棘手的是,真实世界里,病人不会只带着一种病来医院,对着专病模型问他是不是有这种病。事实上,一份CT影像里,很可能同时存在多种器官,多种病变。

达摩院联合浙大一院等全球众多医院向腹部CT发起冲击,希望AI能一次性识别出腹部各种疾病。

因为腹部涉及消化系统、泌尿系统、生殖系统,肝胆胰脾肠道全挤在一起,肠道还盘绕整个腹腔,所有器官几乎都是软组织,密度接近,全靠肉眼对密度差的敏感度把病灶揪出来。

之前,已经有了针对肺结节之类的AI辅助工具,但腹部太复杂了,一直是个禁区,没人敢碰。

最终它覆盖了18种解剖结构、146种病,涵盖肝脏、胰腺、胆囊、肾脏、脾脏、肠道等主要器官,基本覆盖了临床常见病变。

AUC是衡量诊断模型区分患者和正常人能力的指标,1是完美区分,0.5等于瞎猜,超过0.9就算优异。

之后,团队又在来自8家外部医院的超过2.4万例CT上验证,这些案例覆盖不同地区、不同扫描设备,RADAR的AUC仍然达到0.895。

急诊场景与一般门诊的区别是,由于时间紧急,来不及等造影剂发挥最佳效果,患者也不一定有能力配合,CT成像效果偏差。

RADAR的训练目标并未包括急诊,但测试时团队拿2.7万例急诊数据一测,结果AUC依然有0.904。

而且达摩院在肝癌、胰腺癌、胃癌、肠癌四种癌症的诊断上,还提高了对RADAR的要求。

在这四种癌症上,他们用来考验RADAR的依据,是“病理金标准”,也就是以病理活检结果作为Ground truth,确认影像判断准不准。

这波对比共有来自14家医院的26名放射科医生参与,RADAR和TA们在同一批病例上各自独立诊断,结果RADAR的准确率超过了其中23名医生,只稍弱于3名资深医生。

与此同时,达摩院还测试了人机协同场景,发现医生在有AI帮助的情况下读片,整体敏感度提升了大约10%,平均阅片时间减少了30%以上。

过去的医疗影像AI用的是监督学习,简单说就是让医生一张一张地标注CT图像,然后AI照着标注学。

医院里天然存在大量CT影像和对应的诊断报告,RADAR直接从影像和报告文本的对应关系中学习,不需要医生额外逐片标注。

这有点像医学生跟着主任查房,主任看片子的时候会说“肝脏有一个低密度灶,考虑血管瘤”,学生听多了,自然就知道什么影像特征对应什么诊断。

团队一开始就试过这条路,结果发现模型只能学到一些粗糙的统计特征,建立不起来“哪个器官对应哪段描述”的关联。

因为一套腹部CT有几百张切片,包含好多个器官,真正有问题的可能只是某个器官上一个很小的病灶,如果让模型拿整张图去理解,关键信号就被大量正常组织淹没了。

它先从CT中定位出肝脏、胰腺、胆囊、肾脏等各个器官,把一整套CT拆解成一个个器官单元,再把每个器官单元和报告中对应的描述精确对齐。

医生看腹部CT时,也不会把整个腹部当一个整体扫一眼,TA们会依次看肝脏、胰腺、胆道、肾脏、肠道,一个器官一个器官地过。RADAR让AI也按这种方式去学习。

标准的对比学习默认把不同病人的特征严格区分,但在医疗场景里,如果两个人的肝脏都是健康的,就不应该被割裂看待。

而且论文里展示的Scaling Law曲线显示,随着数据增长,模型性能还在持续上升,曲线没有饱和的迹象。

帮医生“少漏一个病灶”

Scaling Law曲线还在涨,但眼下RADAR够到的能力,已经开始改变一线医生的工作节奏了。

“第一次看到RADAR的验证数据,我都不敢相信。”浙大一院放射科主任肖文波说,AI能在腹部这么多相似结构里一下子检出146种病,AUC还有0.9上下,完全超乎医生们的想象。

科室里开始沸腾,很多医生说:赶紧部署起来!很多外面医院的医生也闻讯前来,希望AI能帮助他们解决腹部CT这个头疼的问题。

写一份腹部CT报告,哪怕中高年资的医生,没有20分钟下不来,一例CT包括数百张图像,挨个过。

影像科有句话叫“同病异影、异病同影”,同一种疾病可以长成完全不同的样子,不同的病又可能看起来一模一样。

肖文波坦言,一个医生可能要看几十万张片子才能把各种特征都见过一遍,可能穷其一生也见不到如此多的病例。

尤其在良恶性鉴别这种生死攸关的场景,医生的压力非常大;这时候有了AI,就相当于随时有一个影像助手在手边,在医生犹豫的时候给一个补充性参考。

年轻医生用了AI,报告可能会达到主任级水平,一旦形成路径依赖,反而把培养路径截断了。

她说现在科室300多人分布在好几个院区,过去那种老师坐旁边一份一份带着看的模式,已经很少了。

但AI可以替代这个角色,年轻医生按常规写完报告,再用AI做一次自我检测,哪个病灶漏了、哪个判断偏了,当场就知道。

再往远看,RADAR的器官级对齐框架,也适配其他影像模态,只要有相关数据,MRI、PET、超声都可以成为迁移的目标。

而且这些东西,达摩院没有藏着,模型、代码、技术框架已经全部开源,任何团队都可以拿去复现、改进、迁移到自己的场景。

医疗是所有行业里对精度要求最极端、对错误容忍度最低的场景,一个误判就可能改变一个人的治疗方案甚至生存期。

达摩院资深算法专家张灵说,“Science极少发医疗影像AI的文章,因为它长期被当做工程技术问题。RADAR首次证明了通用的医疗影像AI是一条具有现实可行性的技术路线,改变了Science审稿人的想法,审稿人开始把它当作‘科学问题’来对待。”

回过头看,从达摩院几年前用PANDA模型攻克胰腺癌筛查难题,到今天RADAR登上Science,其实都是在求证AI到底能不能在最苛刻的真实场景里真正顶上去。

论文链接: https://www.science.org/doi/10.1126/science.aec6129 开源地址:https://github.com/alibaba-damo-academy/damo-radar

手机替我跑了一整套流程!我就说了一句话,AI执行了100步 2026-09-15

OpenAI年内不上市了!奥特曼支持对手Dario呼吁:AI该踩刹车了 2026-09-13

一周连发6个模型!这家公司把具身智能的闭环跑通了 2026-09-10

3秒出片比播放还快,MiniMax打开了AI视频的实时商业化路径 2026-09-01

相关阅读

硅谷来信 | 投资人张璐:AI正在造就超级人类,医疗应用潜力无穷

阿里自研解码器Ali266助力高通骁龙平台AI PC首次实现H.266超高清播放

达摩院回应量子计算实验室调整:联合浙大发展

阿里提供中文搜索新选项!AI引擎+达摩院黑科技,你要试试吗?

阿里的“扫地僧”,2年“抄”了20万页古籍

阿里达摩院用AI,让“离家百年、去国万里”的中华传统古籍,以非传统的方式回归祖国>>>>

高考数学只有1分的马云,为全球组织了一场数学竞赛

热门文章

Kimi突发K2.8:性能逼近K3,百万上下文全员开放

AI数学的最后一道高墙,塌了!GPT-6 Astra刷穿FrontierMath Tier 4

A社承认Claude安全对齐存在缺陷,但“尚无解决方案”

探索RSI,生数新世界模型让机器人开始自我进化

首届蚂蚁灵波具身大模型挑战赛正式启动

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1