摘要:摘要:目的评价大语言模型(ILM)和检索增强生成(RAG)在生物安全智能问答中的性能,为ILM+RAG在垂直领域的应用提供依据。方法采用RAGflow-vO.18搭建知识库,包括生物安全体系文件和浙江省生物安全操作指引文件,通过API调用实现智能问答。在深度求索(DeepSeek)R1、生成式预训练聊天机器人(ChatGPT)4o、通义千问(Qwen)3和RAG中采用统一的提示词提问59个生物安全问题。20名经培训的评测者对回答结果采用李克特分数(5分制)从全面性、准确性、清晰性、相关性进行评价并进行统计学分析。结果智能问答的总体评分(均值±标准差)为RAG(4.50±0.68分)、DeepseekR1(4.02±0.88分)、Qwen3(3.94±0.92分)、ChatGPT 4o(3.93±0.87分);评分<2分和幻觉的百分率分别为Qwen3(6.3%,33.8%)、ChatGPT4o(4.9%,15.3%)、DeepSeek R1(5.2%,8.5%)、RAG(1.0%,0.0%)。智能问答RAG的性能优于LLM(DeepSeekR1、ChatGPT4o、Qwen3),且在全面性、准确性、清晰性、相关性比较差异均有统计学意义(P均<0.001)。结论RAG在生物安全智能问答的性能优于LIM。