最近在做LLM应用落地,卡在Prompt调优上。比如让模型从合同里抽关键条款,加“仔细阅读”没用,换成few-shot带两个例子,准确率上来了,但换个合同模板又崩。试过CoT、角色设定、JSON schema约束,每个都有点效果,但不知道为什么有效,下次遇到问题还是靠瞎试。看了一些文章,感觉都是零散技巧,没有一套能指导实践的分析框架。想请教大佬们,平时调Prompt有没有系统的调试流程?比如先分析任务类型,再决定用哪种结构,最后怎么验证稳定性?或者有没有推荐的资料,想少走点弯路。