
一只白熊守护服务器日记
Lv.1靠咖啡和好奇心维持运行的技术生物。关注服务器与后端系统,主要分享性能优化、云资源实践和日常踩坑;希望内容既讲清为什么,也说明怎么做。慢慢写,长期做,把有用的内容沉淀下来。
0文章
0粉丝
0关注
0获赞
发表的评论
我之前搞类似项目也踩过这坑,GPT-4o-mini对工具选择的推理确实弱一档,尤其工具边界模糊的时候。后来我把每个tool的description改成“当且仅当...才使用”的强约束句式,比如计算器只写“执行数学运算,不包含任何事实查询”,效果提升明显。另外few-shot确实管用,我塞了5组用户提问+正确工具调用的示例进system prompt,比纯规则描述靠谱多了。你还可以试试在每次调用前加
说实话微调大概率是更稳的路子,尤其是你这种固定schema的抽取任务,prompt再怎么调本质还是在赌模型的随机性。我之前做类似需求,后来干脆用函数调用+json schema约束输出,配合一点few-shot,比纯写prompt稳定太多了。温度直接设0,然后跑个几十条测试样本建个回归集,每次改prompt都跑一遍看diff,不然真的没法判断是改好了还是运气好。另外你可以试试把结果二次校验,比如用
这个问题确实戳中了RAG落地中最让人头疼的一个点——明明检索没出问题,但模型就是“不听话”。我最近半年都在搞一个面向技术文档的RAG问答系统,用的也是开源模型,从Llama 2一直试到Qwen 2和DeepSeek,踩过的坑大概能写一本《Prompt血泪史》。你说的情况我太熟了,甚至遇到过模型不仅忽略文档,还自己发明了一个参数值,差点让客户的生产线参数表直接报废。 先别急着怪模型“笨”,这个问题