ChatGPT-4.0与DeepSeek-V3两种人工智能语言模型在回答近视问题的基准分析比较
Comparison of benchmarking analysis of ChatGPT-4.0 and DeepSeek-V3 of two kinds of AI language models in response to questions about myopia
摘要目的:比较ChatGPT-4.0与DeepSeek-V3两种人工智能(AI)聊天机器人在应答近视问题的表现差异,为AI聊天机器人的应用提供参考.方法:2024年10月至2025年3月在新加坡国立大学医院(NUHS)和中国北京京煤集团总医院进行大型语言模型(LLM)ChatGPT-4.0与DeepSeek-V3两种AI聊天机器人对近视问题回答结果进行测试,经专家测评比较其准确性和全面性.近视问答内容为眼科临床中最常遇到的30道近视相关问题,包括近视的发病机制、临床表现、诊断、治疗、预防和预后6个主题,从准确性和全面性两方面对两种AI聊天机器人进行评分评价.结果:准确性评价方面,ChatGPT-4.0聊天机器人回答结果被测评为"良好"的11题(占36.7%),DeepSeek-V3聊天机器人为23题(占76.7%),其占比比较差异有统计学意义(x2=9.791,P<0.05).全面性评价方面,对准确性评价为"良好"的答案,ChatGPT-4.0聊天机器人回答问题全面性评分为(2.44±0.33)分,DeepSeek-V3聊天机器人为(2.63±0.17)分,差异无统计学意义(P>0.05).结论:AI聊天机器人可为用户的近视咨询提供有效帮助,DeepSeek-V3聊天机器人对近视问题应答的准确性较ChatGPT-4.0聊天机器人更高.
更多相关知识
- 浏览0
- 被引0
- 下载0

相似文献
- 中文期刊
- 外文期刊
- 学位论文
- 会议论文


换一批



