Token导航 LogoToken导航

人工智能辅助智慧医疗

更新时间 2026-09-23来源 世界科学正文 5345字阅读约 17分钟5 张图片

设置星标★关注,从此你的世界多点科学~

大家 · 科技前沿   

MASTERS

人工智能(AI)的快速发展正引领医疗行业走入变革,生成式人工智能是这一变革中的关键技术。生成式人工智能是一种基于深度学习的语言模型,能够模拟人类的对话风格和思维过程,它结合了自然语言处理、机器学习和大数据分析等技术,为医疗领域提供了强大的辅助功能。此外,它还可以分析复杂的医学数据,为医生提供准确的分析结果和建议,从而协助医疗团队进行疾病预测和风险评估,制定个性化的预防措施。生成式人工智能可以提高医疗服务效率、准确性与医疗体验,有望推动医疗行业的发展。

戴文斌

上海交通大学自动化与感知学院教授

人工智能的原理

首先,我们需要先了解一下生成式人工智能的原理,知道它为什么能够有这么大的提升。计算机设计之初的主要任务就是计算,随着问题的难度逐渐增大,在求解的过程中除了计算之外,更需要解决推理等手段。

针对这些任务,传统软件的开发逻辑是基于规则的,即由人类先总结经验知识,然后将这些知识用代码的方式来实现。比如,如果一个条件满足的时候,我们将执行一部分的代码,如果不满足的话,我们就将执行另外一部分的代码。

规则是有限的,但是我们遇到的实际问题却是无穷无尽的,基于规则的软件永远不能满足所有问题,于是我们就需要不断根据遇到的新问题增加规则,这就使得我们的软件开发工作永远没有结束的那一天。

人工智能本质上还是一种工具,主要作用是大幅度地扩展我们传统软件的能力边界,最终也是为了解决实际问题。因为我们无法预判未来会遇到的各式问题,因此我们希望通过建立通用人工智能来解决这个难题。

第一波人工智能浪潮是1950年代从图灵测试开始的,当时出现了大量的对话机器人(图1)。1960年代,科学家开始琢磨有没有一种办法,能够让计算机自己来学习规则,从而自己生成经验知识来解决问题。直到1970年代,人工智能进入了第一个寒冬,主要原因是第一代的人工智能全部都是基于规则的,如果问题不在这个规则当中,人工智能也不会知道答案。

从1980年代开始,第二波人工智能浪潮通过统计学的思路对数据归纳分类从而形成经验知识,1997年的深蓝等人工智能在语音识别等方向上取得了突破性进展。

2006年到现在,人工智能除了算力得到大幅度提升之外,互联网的普及也为大规模训练数据的获取奠定了基础。因此在算力和海量数据的加持下,人工智能第三波热潮在图像识别、自然语言处理等方面已经取得了非常不错的效果。

图片

图1 人工智能发展历史

人工智能的核心任务是怎么样把现实问题抽象成数学问题(图2),因此我们需要先建立相应的数学模型。这个模型可以理解为一个拥有很多不同参数的函数f(x),我们需要通过大量的数据来学习这些参数。那标准机器学习的流程是什么样的?一般来说可以分成三个部分:

第一部分就是数据预处理,将样本质量好的数据留下,数据量越多且数据质量越好,训练的效果也就越好。

第二步是特征抓取,这些特征可以人工标记,也可以让机器自己学习,比如脑部计算机断层扫描(CT)图像中,医生可以根据实际经验来标记异常区域。当然,这里有两个需要注意的地方,一方面是数据集里没有出现的特征是没有办法学习到的,另一方面是如果训练数据内存在错误则学习到的特征也是错误的。

所以第三步,在模型训练完成之后,还需要对模型进行评估。因为所有深度学习模型是一个黑盒,当模型输出与预期有所偏差时,我们没有办法直接去调整模型来解决问题,只能通过不断地增加新数据继续训练再评估的方法来不断迭代优化,直到模型输出满足我们的预期。

图片

图2 人工智能、机器学习与深度学习

机器学习主要有三种不同的训练方法。

第一种是监督学习,给算法一个数据集,并且给定正确答案,机器通过数据来学习正确答案的计算方法。这种方法可以比喻为老师给学生们上课,通过讲解原理与课堂练习的方式来学习知识点。比如图3需要从大量图片中快速筛选出食管的图片,我们将已经分类完成的数据集作为输入来训练神经网络。监督学习的效果是最好的,但是对数据质量要求非常高,因此需要大量的标记数据,通常需要人工来打标签,耗时又耗力且成本高昂。

第二种是无监督学习,是一种在没有“正确答案”的数据集中,挖掘出潜在的结构来分类的方法。这种方法可以比喻为自学成才,通过自身发现规律寻找规则,最后归纳总结为知识。例如,把所有的食管跟非食管的器官照片一起交给机器去学习,最后根据特征分成两类。因此无监督学习是一个分类问题,在给定的数据中挖掘出了两种不同的结构。无监督学习相对监督学习来说成本要低很多,也不需要大量人工去打标签。

第三种是强化学习,设计奖惩机制使得多个智能体在环境中能自主地采取一系列行为,从而获得最大的累积回报。强化学习可以比喻成胡萝卜与大棒,当机器准确识别物体时,我们给予高分奖励,当有待改进时,我们给予相对低的得分,机器以得到越高分越好的目标来选择自己的行为。

图片

图3 机器学习的训练方法

生成式人工智能

那生成式人工智能(大语言模型)为什么能够这么智能呢?需要分析一下它的工作原理来回答这个问题。

大语言模型本是一个拥有庞大参数的神经网络,并不是一个知识库或者搜索引擎。生成式AI的原理是一个类似于“文字接龙”的游戏,通过词语的首尾接龙方式继续下去。

我们可以把大语言模型看作一个巨大的数学函数,不同于我们平时学习的函数,例如一次函数的输入是x,输出是y,而大语言模型的输入是一个完整的问题,大语言模型会根据这个问题搜寻到的答案中的第一个字出现的频率给出不同的选择概率,然后通过“掷骰子”的方式随机选择一个字作为答案。

例如,我们输入“手不停地颤抖是得了什么病”,模型给出甲亢、肝炎、帕金森的分布概率,并随机选择一个答案的第一个字输出,于是答案就是“帕”,但明显大语言模型不会只给出一个字的答案。

用过大语言模型的都知道问题答案都是一个一个字“蹦”出来的,所以大语言模型会将问题以及刚才的答案“帕”一同作为输入再次输入模型,这时候的问题变成了“手不停颤抖是得了什么病?帕”,而相应地得到第二个字的答案,因为“帕”是生成答案的第一个字,所以第二字大概率会是“金”(图4)。于是通过不断地迭代,直到生成一个完整的回答。

这时候会有一个新的问题,那就是大语言模型什么时候知道回答结束了?为了防止无止境地生成答案,当模型得到输出的结果是句号或者结束符号时,就可以认为这个答案已经生成完了。

这个文字接龙的游戏在答案生成的过程中有很多的随机性,所以每一次生成的答案并不会完全相同。

图片

图4 大语言模型工作原理

当然大语言模型并不是一次函数这么简单,那它是一个什么样的函数呢?通常一次函数就只有两个参数,y=ax+b中只有ab两个参数。在大语言模型中,通常这个参数量级已经达到千亿级,比如ChatGPT就有1750亿个参数,因此这是一个维度非常高、非常复杂的函数,我们根本无法解释这些参数到底代表什么。

一般来说,大语言模型学习分成两个部分,一部分是学习了大量的资料,另外一部分靠人类来指导。生成式模型的核心是生成式预训练转化模型(generative pre-trained transformer, GPT)。

Generative代表生成式模型,也就是刚才介绍的文字接龙游戏。Transformer是生成式AI的基础模型架构,2017年的时候由谷歌翻译团队发表的一篇著名论文《注意力是你所需要的》(Attention Is All You Need),首次提出了注意力机制。

注意力机制指人类并不需要完整读完就能理解句子的意思,比如在快速阅读中,通常不会逐字逐句去读,通过挑选其中的一些关键字就能理解整个句子的意思。注意力机制也是避免让机器被句子中不重要的信息影响,可以提取出句子中关键信息以及关联关系。

最后Pre-trained指对模型进行大规模预训练,以ChatGPT为例,训练数据量达到了45 TB,相当于四大名著文本量总和的472万倍。当然大语言模型不是只学了四大名著,还通过在线百科全书词条学会了翻译、解释与基本常识;为学会与人类对话沟通,通过网页内容学到了很多的网络用语,使得对话看起来生动有趣,更加像人的口吻;通过学习所有的电子书籍与学术论文,学会了写作;通过学习开源网站上所有的代码,学会了生成程序代码并给代码加注释。

最后加上基于人类反馈的强化学习(RLHF),由人类给生成的答案打分来赋予价值观,防止生成的答案与人类基本价值观产生重大偏差。因此基于人类反馈信息是一个非常重要的环节,使得大语言模型能够回答得更符合人类的预期。

生成式人工智能在医疗领域的应用

那生成式AI到底能够在医疗领域产生什么样的效果呢?

首先我们来看一下在医学图像中的应用,谷歌研究团队发表的论文《分割任何东西》(Segment Anything),基于大模型能够实现快速的图像分割。基于此模型,无论是CT还是X射线的医学图像分割,无论是二维图像还是三维图像,生成式AI都能实现快速分割图像从而减轻医生的工作量。目前已在脑肿瘤多标签三维分割、腹部多器官分割等领域都实现了重要的突破。

其次,大语言模型对医学诊断也能起到重要的作用。目前三甲医院的问诊量非常庞大,医生无法应对如此大的门诊量,大语言模型通过对现有病例的学习,可以根据提问中描述的症状来给出合适的病情分析,这样可以大幅减低医生的工作量。目前已经有MedGPT、IvyGPT 等基于大语言模型的在线医生诞生,这些在线医疗问答工具具备多轮连续对话和文字与图像结合的多模态能力,在百名患者测试中的治疗方案与真人医生给出的方案达到96%一致。这些基于GPT的在线医生使用了大量高质量的医患对话数据作为训练数据,已经初步具备了看诊的能力。

最后,大语言模型还可以提升药物早期研发效率,通过生成新的分子结构,优化已知的药物分子,并预测它们的活性和提升药效,有助于加速药物发现的进程,从而找到潜在的更有效的治疗药物。但在药物验证阶段,生成式AI还无法发挥更大的价值。候选化合物通过筛选后会进入临床前阶段,包括动物模型实验,而后是药物研发过程中非常重要的临床试验,评估药物的药效、安全性和代谢动力学等特性,整体周期一般在7~10年,目前生成式AI还无法将这些评估和测试的时间缩短太多。

2024年,大语言模型在蛋白质结构的预测上获得了空前的成功。谷歌的AI团队DeepMind正式发布了AlphaFold 2数据库,目前已经将预测蛋白质结构的数量从近100万扩大到2.14亿,比AlphaFold提升了200多倍,几乎涵盖了地球上所有已进行过基因组测序的生物体。在超过2亿个蛋白质结构预测中,大约35%的结构具有高精度,并且已达到了实验手段获取的结构精度,80%的结构可靠性足以用于多项后续分析。现在科研人员通过使用AlphaFold 2可以快速筛选出需要的蛋白质结构,效率得到了大幅度提升。2024年的诺贝尔化学奖也颁给了AlphaFold的作者团队,这是对生成式AI的一个肯定。

目前大语言模型在智慧医疗方面存在诸多挑战。

其中最大的一个挑战是数据的隐私与安全问题,大模型成功的关键就是需要拥有足够多的数据,数据越大模型的普适性越好。而医疗数据涉及隐私与权益,所有信息都需要做脱敏处理,不像其他领域的数据那样易于获取,开放和共享将会是一个世界性难题,这制约了AI模型的训练与优化,使其难以达到需要的精度水平。未来如何获取海量的医疗数据进行训练仍是巨大挑战。

除了数据获取方面,数据安全方面同样面临巨大的挑战。由于对算力的巨大要求,大语言模型通常使用云端存储,一方面存在数据泄漏等风险,另一方面面临网络和黑客攻击等隐患。

第二个挑战是成本,当不断扩大大语言模型,需要更加强大的算力来支撑,并且部署成本高昂。训练大语言模型的电力消耗非常大,每训练一次就要消耗 90 万度电,这对企业来说也是一笔沉重的负担。此外,人力成本也不容忽视,人工智能依然还是“人工的智能”,需要大量数据标注师,而医学对数据的标注需要有专业知识,除了医生之外,其他人很难胜任。而专业医生平时工作也都非常繁忙,无法抽出足够的时间来对数据进行标注。

第三是医学伦理与人文挑战,我们如何在训练阶段保护患者的隐私?怎么能够体现医学伦理?如何展示医学人文关怀?大语言模型是应该告诉病患实情,还是应该酌情考虑说一些安慰的话?

第四个挑战是法律监管,国家网信办已经发布了《生成式人工智能服务管理暂行办法》,提供AI服务的供应商必须对这个模型的输出结果负责。医疗AI需要面临复杂的法律法规要求,这使其商业化应用进度受限,研究机构与企业难以判断某些应用是否会触及监管红线。

最后是适用性的问题,AI对于医疗的治疗方案还需要考虑不同区域的医疗政策,每个国家或地区治疗方案不同,推荐的治疗方案是否适用?包括药品的管制规定也不同,如何保证给出的方案能够符合当地的药品管制规定?

尽管面临诸多挑战,但未来仍是光明的,今后一段时间内会有很多研究人员不断深耕医疗 AI,希望在不久的未来大模型能够大幅度减轻医生的工作量,解放医生的生产力去做一些更有意义的事情。

-本文刊载于《世界科学》杂志2026年第9期“大家·科技前沿”栏目;文章根据笔者在上海市科学技术普及志愿者协会主办的“海上科普讲坛”上的报告撰写而成-

文章标签大模型政策监管
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多