目前AI人工智能医生领域还没有绝对的第一名,不同模型在不同专科和任务上各有所长。以下综合近期的权威研究数据,帮你梳理各款模型的优劣势。
DeepSeek-R1:复旦大学中山医院针对肺癌诊疗的研究显示,该模型在诊断、治疗、病理等多个模块综合表现优异,准确率评分与GPT-4o并列第一梯队。另有一项针对唾液腺癌的国际研究证实其准确率高达86.9%,在同类模型中排名最高。在情感支持方面,它也被评为最能缓解患者焦虑情绪的模型。综合实力强劲,适合需要深度分析和有温度回答的用户。
GPT-4o:国际权威期刊《自然》子刊发表的研究表明,高年资医生对GPT-4o给出的诊疗意见认可度很高。在肺癌筛查模块和儿童早期矫正面部照片分析中表现出轻微优势。虽然其在特定专科的准确率并非总是最高,但综合多份研究,它在多场景下的稳定性和均衡性依然值得肯定。
Qwen-Max(通义千问):在北京友谊医院等机构联合开展的大规模评测中,年轻医生群体对Qwen-Max的诊断意见认可度显著更高。这可能与其回答风格的偏好性有关。如果用户是医学生或初级医师,用它来辅助学习或参考诊疗思路,可能会获得更贴合自身认知习惯的反馈。
豆包和Kimi:复旦大学中山医院的研究显示,在肺癌诊疗的准确性评估中,豆包和Kimi的评分显著低于DeepSeek-R1和GPT-4o。豆包在部分细分项上评分相近,而Kimi在准确性和情感支持方面均表现靠后。如果你追求医学问题的精准答案,这两款目前的优先级可能不如前几款。