RAG与微调解决的主要问题不同:前者在回答前检索外部资料,后者通过训练调整模型行为。选型应先判断失败来自缺少知识、检索不到资料,还是输出方式不符合要求。

经常更新的企业知识先评估检索方案

产品说明、售后政策和内部制度会变动,适合先建立可更新的知识库。检索结果应保留文档版本、来源和引用位置,让用户能核对回答依据。

如果检索没有命中正确资料,先检查文本提取、分段、查询表达和过滤条件。不能把所有回答错误都归因于模型能力。

微调适合改善哪些行为

当模型在稳定任务上反复出现格式、术语或处理习惯不一致,可以在提示词和评测基线之后评估微调。训练数据应有代表性,并与测试集分开。

微调不等于给企业知识库建立实时索引,也不能代替权限校验。把频繁变化的制度直接写进训练数据,会增加更新与验证成本。

用评测而不是演示决定

建立三类测试:资料里有答案、资料不足需要拒答、不同权限用户看到不同资料。记录答案正确率、引用正确率、无依据回答情况及单次成本。

比较现有模型加提示词、RAG、必要时的微调组合。只有收益可以复现并覆盖实施与维护成本,才进入更复杂的方案。

参考资料

微调不能替代不断变化的资料

稳定输出格式适合评估微调,产品价格与制度变化仍需可更新的检索或接口。

用同一组未训练问题比较提示词、RAG和微调,按质量与维护成本取舍,避免同时改变全部变量。

例如型号价格每月变化,RAG或接口更便于更新;微调不能自动替代实时资料管理。