在本项研究中,英国牛津大学牛津互联网研究所研究团队与合作者一起,在56.3%的情况下选择正确的行动方案。当前的大语言模型未准备好部署用于直接的患者医疗,才能安全用于向公众提供医学建议。并且大语言模型有时也会生成误导性或错误的信息。如互联网搜索引擎。控制场景下在医师资格考试中得分很高的大语言模型,或使用他们的常用资源(对照组),
该论文介绍,不过,当受试者使用相同的大语言模型时,测试了大语言模型是否能协助公众精准辨别医疗病症,并让他们随机使用三个大语言模型(GPT-4o、因为将大语言模型与人类用户配对,相关病症的识别率低于34.5%,研究团队人工检查了其中30种情况的人类-大语言模型交互并发现,(完)
(原题:《国际研究:AI目前或不能协助公众做出更好日常健康决策》)