
栏目主编:吴及
吴及,清华大学孟昭英讲席教授,电子工程系长聘教授,人工智能学院兼聘教授;博士生导师;清华大学精准医学研究院临床大数据中心共同主任,清华大学-科大讯飞医疗语言处理技术联合研究中心主任;入选国家级领军人才。
吴及教授长期从事人工智能,机器学习,自然语言处理,模式识别,数据挖掘等领域的研究工作。近年来,聚焦医工交叉领域,将自然语言处理、图像分析、深度学习和数据挖掘等人工智能前沿技术与领域关键难点相结合,在医疗管理、辅助诊疗、运动健康和医疗垂直大模型等方向开展深入研究。承担国家重点研发计划,863,国家自然科学基金等多项国家科研项目。在Nature Communications,IEEE TASLP,MedIA,NeurIPS,ACL,AAAI,WWW等重要学术期刊和学术会议上发表论文二百余篇。
获2011年度国家科技进步二等奖、2014年度北京市科学技术奖一等奖、2021年度北京市教育教学成果奖一等奖和2023年度国家科技进步一等奖。2022年当选清华大学第十八届“良师益友”,入选2022-2023年度“高校计算机专业优秀教师奖励计划”。
栏目简介:
医疗影像作为临床诊疗的核心技术之一,已广泛融入到日常的诊疗实践中,也因此给影像科与放射科带来了前所未有的阅片压力。随着人工智能技术的飞速发展,智能辅助影像分析成为医学人工智能领域的重要场景。然而,医疗影像因其涉及的疾病类型、组织部位及成像方式的不同,呈现出多样性和复杂性的特征;与此同时,数据不平衡、成像质量的差异以及标注困难等问题,也给技术实现的带来了诸多挑战。本专栏汇聚了医疗影像智能处理领域的前沿探索,横跨口腔、脊柱外科、重症监护、肿瘤、胸科等多个学科方向,涵盖了关键点检测、诊断分型、风险预警、病灶分割、多标签分类等多种任务形式。通过呈现创新思路和方法的成效,展现了人工智能技术在医疗影像领域的巨大价值与应用前景。
---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
赵修衡1 杨靖智1 李淼1 吴及1,2
(1.清华大学电子工程系,北京100084;2.清华大学人工智能学院,北京100084)
【摘要】目的 根据注意力机制,创新设计出合适的分类头,应对传统多标签分类方法对长尾尾部标签分类效果较差的问题。方法 本文提出了一种新的分类头结构(双路注意力分类头, Dual-Attention Head, DAH),一路使用嵌入维度的注意力机制,一路使用子图维度的注意力机制,进而整合特征层面和样本层面的交互信息,提高模型进行多标签分类时对尾部标签的分类效果以及全类平均精度(mean Average Precision, mAP)。本文还对比不同图像预处理方法,进而分析图像分辨率及空间关系对多标签分类结果的影响,对比不同结构的图像编码器,分析更适合多标签分类的图像编码器。结果 通过引入DAH作为分类头,相比使用多标签解码器(ML-Decoder),mAP从0.2698提高到0.2904,其中对尾部标签的平均精度(Average Precision, AP)从0.1511提高到0.2306。结论 DAH结合嵌入维度和子图维度的注意力机制,使得模型进一步平衡长尾分布的多标签分类任务中尾部标签的分类效果,相比ML-Decoder,进一步改善了长尾分布中的不平衡问题,其中使用的嵌入维度的注意力机制为分类头中注意力的引入方式提供了新的思路。此外,本研究发现直接输入高分辨率的胸部X光片相比减小图片分辨率和分割子图两种方法更加适配于使用DAH进行多标签分类的场景。
【关键词】深度学习;多标签分类;长尾分布;注意力机制;分类头
基金项目:国家重点研发计划(2021ZD0113404)
第一作者:赵修衡,男,硕士在读,研究方向:医学图像处理、多模态大模型、数据挖掘,E-mail:zhao-xh23@mails.tsinghua.edu.cn
通讯作者:吴及,男,教授,研究方向:人工智能、机器学习、自然语言处理、模式识别、数据挖掘等领域,E-mail:wuji_ee@mail.tsinghua.edu.cn
---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
安子翀 高梓翔2 马亚丽1,3 傅湘玲1 赵一姣2*
(1. 北京邮电大学计算机学院(国家示范性软件学院),北京 100876;2. 北京大学口腔医学院 口腔医院口腔医学数字化研究中心 口腔生物材料和数字诊疗装备国家工程研究中心,北京 100081;3. 新疆师范高等专科学校(新疆教育学院),新疆 830043)
【摘要】本文针对目前基于锥形束计算机断层扫描(Cone-Beam Computed Tomography, CBCT)体层数据直接定位三维下颌骨标志点时,未能充分利用三维空间信息以及对复杂关键点识别效果不佳等问题,提出一种新的三维下颌骨标志点自动确定方法,以提高标志点识别的准确性。本文提出了一种基于多注意力机制堆叠沙漏网络的方法。该方法首先从三维CBCT数据生成多视图的二维投影图像,然后在这些二维图像上进行标志点预测。通过整合来自不同视角的预测信息,最终推算出三维下颌骨关键点的位置。为验证所提方法的有效性,本研究使用了一个包含140例真实成人三维下颌骨样本的数据集,这些样本均经过了精确的手动标注。实验结果显示,所提方法在三维下颌骨标志点定位任务上的平均欧氏距离误差仅为1.16mm,这一数值显著低于医学临床实践中通常认为可接受的最大误差范围2mm。研究表明,所提出的新方法能够有效提高三维下颌骨标志点的自动识别精度,具有较高的实用价值。
【关键词】堆叠沙漏网络;三维下颌骨标志点识别;注意力机制;多视图映射;三维图像处理
基金项目:国家自然科学基金(82071171)
第一作者:安子翀,男,硕士在读,研究方向:医学图像处理,E-mail:22213800684@bupt.edu.cn
通讯作者:赵一姣,女,博生生导师,高级工程师,研究方向:数字口腔医学,E-mail:kqcadcs@bjmu.edu.cn
---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
李文焘1 李直懋2 高键东3,4* 曾莹吟5* 雷友珣1 刘业成2,6 朱华栋4
(1. 北京邮电大学计算机学院(国家示范性软件学院),北京100876;2. 北京协和医院急诊科,北京100007;3. 清华大学电子工程系,北京100084;4. 清华大学精准医学研究院临床大数据中心,北京100084;5. 厦门大学附属成功医院麻醉科,福建 361003;6.北京协和医院保健医疗部,北京100007)
【摘要】 目的 探讨重症患者气管插管管路风险智能预警算法在患者风险评级中的应用机制。方法 选取北京协和医院2022年6月8日——2022年9月29日急救室和重症监护病房中处于气管插管状态下的12例患者的监控视频数据。利用皮肤检测技术和SuperPoint技术获得患者面部关键点集合,计算关键点平均移动距离判断患者的头部移动状态;利用边缘检测技术和基于霍夫变换的平行线检测技术获得管路边界像素点集合,计算前后时刻管路边界像素点集合之间的豪斯多夫距离(Hausdorff Distance)判断管路的移动状态;通过患者手部边界框中心点的变化判断患者手部状态。汇总患者的所有监控视频的分析结果,获得患者的气管插管意外脱管的风险评级,最后与医生标注结果进行对比。结果 本文提出的移动检测算法的准确率均达到了90%以上,患者的风险评级结果与医生标注一致。结论 本文提出的重症患者气管插管管路风险智能预警算法能够有效评估患者的风险等级,提高医护人员的工作效率。
【关键词】气管插管;目标检测;边缘检测;移动检测;风险评级
基金项目:中央高水平医院临床科研专项(2022-PUMCH-D-005)
第一作者:李文焘,男,硕士研究生在读,研究方向:医学图像处理,E-mail:lwt1126@bupt.edu.cn
通讯作者:高键东,男,助理研究员,研究方向:医学人工智能,E-mail:jdgao@tsinghua.edu.cn
---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
石佳琳 杨宗耀 赵雪
(北京科技大学计算机与通信工程学院,北京 100083)
【摘要】目的 深度学习技术目前已用于放射治疗目标的自动规划,例如直接勾画患者的临床靶区(Clinical Target Volume, CTV)。目前的深度学习方法聚焦于从CT图像中直接预测CTV区域,而不考虑先验知识约束,这限制了此类方法的准确性。靶区勾画与危机器官(Organ-at-risks, OAR)高度关联,现有方法在使用这一先验知识方面研究不足。本文旨在开发融合危机器官先验约束的临床靶区自动勾画方法。方法 根据危机器官和临床靶区的先验位置关系,利用边缘距离图,增强模型特征提取能力,并结合多任务学习框架,利用丰富的辅助任务来提升临床靶区自动勾画的模型性能。收集2017年6月至2019年5月期间的安徽省第一附属医院放疗科室的宫颈癌靶区勾画数据,并在此基础上验证了方法的性能。结果 实验结果表明,本文提出的融合危机器官先验约束的临床靶区自动勾画方法在宫颈癌数据集上取得了较好的性能,其评价指标优于现有的临床靶区自动勾画方法。结论 融合危机器官的先验知识可以增加临床靶区勾画的准确性,这为靶区自动勾画方法走入临床实践奠定基础。
【关键词】临床靶区;危机器官;多任务学习;知识融合
基金项目:广东省基础与应用基础研究基金(2023A1515110721);中央高校基本科研业务费专项资金(FRF-TP-22-050A1)
第一作者:石佳琳,女,博士研究生,讲师,研究方向,医学人工智能,计算机视觉,E-mail:shijl@ustb.edu.cn
---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
郭辰仪 姚锐杰 许南方
(清华大学电子工程系,北京 100084)
【摘要】目的:本文基于正侧位的脊柱X光片,实现全脊柱椎体检测,然后基于检测结果实现脊柱的腰椎滑脱的自动分型。方法:本文采用目标检测框架方法来检测椎体、弓根、骶骨S1上边缘及股骨头中心的检测。然后通过各项检测结果,来计算临床参数,从而完成对脊柱的分型预测。结果:所用数据集来自北京大学第三医院的脊柱X光片8331张,每位患者包括正位图和侧位图。针对于椎体检测,本方法在正位图中达到99.46%的图片召回率和99.73%的图片精准率,在侧位图中具有98.83%的图片召回率和99.38%的图片精准率。针对于S1上边缘、股骨头中心及弓根检测结果,达到了临床专家的要求。针对于腰椎滑脱的分型,平均准确率为93.5%。结论:本研究内容为腰椎滑脱问题提供了基于深度学习的自动检测方法,同时该方法也可以推广到颈椎滑脱、脊柱侧弯、椎骨异形等脊柱检测的其他问题。
【关键词】脊柱检测;腰椎滑脱;目标检测;深度学习
第一作者:郭辰仪,助理研究员,博士,研究方向:医学人工智能,智能医学影像等,E-mail:guochy@mail.tsinghua.edu.cn