谷歌推出“医学版ChatGPT”,已开始临床测试
来源:旭日大数据发布时间:2023-07-172085浏览
询问 AI2022年底,OpenAI推出的大型语言模型ChatGPT展示了令人印象深刻的强大能力,但大型语言模型在临床应用的门槛很高。
医学是一项充满人文关怀的事业,其中语言是临床医生、研究人员和患者之间沟通互动的关键。人工智能(AI)模型,尤其是最近取得进展的大型语言模型(LLMs),为医学领域的AI应用带来了新的希望。它们在医学领域拥有广阔的潜力,包括知识检索和支持临床决策。
然而,这些AI模型虽然在一定程度上可用,但主要是单任务系统,缺乏表达和交互能力,还可能编造令人信服的医疗错误信息,甚至加剧健康不平等。因此,现有的AI模型与临床实践中对它们的期望之间存在不一致,这使得它们难以在现实世界中发挥可靠和有价值的作用。
最近,于2023年7月12日,谷歌和旗下人工智能公司DeepMind的研究人员在顶尖学术期刊Nature上发表题为“大型语言模型编码临床知识”的研究论文。该研究展示了一个评估大型语言模型(LLMs)回答医学问题的基准,并介绍了一个专为医学领域而设计的大型语言模型——Med-PaLM。
为了评估大型语言模型(LLMs)编码临床医学知识的能力,研究团队进行了医学问题回答的探索。这项任务非常具有挑战性,因为为医学问题提供高质量的答案需要理解医学背景,回忆合适的医学知识,并根据专家信息进行推理。在该研究中,提出了一个名为MultiMedQA的评估基准,它结合了6个现有的问题回答数据集,涵盖了专业医疗、研究和消费者查询,以及一个新的数据集HealthSearchQA,包含了3173个在线搜索的医学问题。通过这个基准,对大型语言模型回答医学问题的真实性、专业知识的应用、有用性、准确性、医疗公平性和潜在危害进行了评估。
他们随后评估了PaLM(5400亿参数的大型语言模型)及其变体Flan-PaLM,并发现Flan-PaLM在一些数据集中达到了最先进的水平。在结合了美国医师执照考试类问题的MedQA数据集中,Flan-PaLM的准确率达到了67.6%,超过了之前最先进的大型语言模型17%的水平,并达到了及格线(60%)。然而,尽管FLAN-PaLM在多项选择题上表现优秀,进一步评估显示其在回答消费者的医疗问题方面存在差距。
结果产生的新模型Med-PaLM在试行评估中表现令人鼓舞。例如,Flan-PaLM被一组医师评分与科学共识一致程度仅61.9%的长回答,Med-PaLM的回答评分为92.6%,相当于医师做出的回答(92.9%)。同样地,Flan-PaLM有29.7%的回答被评为可能导致有害结果,Med-PaLM仅5.9%,相当于医师所作回答(6.5%)。

今年5月份, 谷歌发表论文,推出了升级版的 Med-PaLM 2。论文中显示,Med-PaLM 2是第一个在美国医疗执照考试(USMLE) 类问题 上达到专家级表现的大语言模型, 能够正确回答多项选择题和开放式问题,并对答案进行推理,准确率高达86.5%, 大幅超越了 Med-PaLM以及GPT 3.5。
据报道,Med-PaLM 2目前正在世界顶尖的医疗机构梅奥医学中心进行初步试验。谷歌认为,这种模式在“看病机会有限”的国家尤其有用。他们还表示,在Med-PaLM 2试验期间提交的用户数据将被加密,谷歌无法访问,并由用户自己控制。
总的来说,Med-PaLM是一个强大的专精医学领域的大语言模型,而设计指令微调是一种有效的数据和参数校准技术,能够提高大语言模型的准确性、真实性、一致性、安全性,减少危害和偏差等因素,有助于缩小模型与临床专家的差距,使这些模型更接近现实世界的临床应用。
2023中国微创医疗产业大会
近年来,随着数字化技术的发展,医疗行业也面临着巨大的变革。微创技术作为一种创新的治疗方法,受到了越来越多医生在治疗过程中首选和推崇的治疗方式。随着数字化医疗技术的发展,数字化医疗技术正在赋能微创技术,使治疗过程更加方便、高效、减少病患痛苦。本次论坛将探讨微创技术数字化的趋势、机遇和挑战,分享数字化医疗技术在微创领域的应用与前景,旨在激发更多医疗机构开展微创技术数字化的探索与实践,推动数字化医疗技术在微创领域的创新与发展。我们邀请了微创技术专家、数字化医疗领域的从业者、学者、著名企业家及资深媒体代表等参加本次论坛,共同为数字化时代下微创技术的发展探路、出谋划策。



新闻来源:旭日大数据,文中所述为作者独立观点,不代表icspec立场。更多精彩资讯请下载icspec App。如对本稿件有异议,请联系微信客服specltkj。

