最近在做一个基于大模型的客服问答系统,Prompt改了十几版,每次改完都感觉某几个case变好了,但另外几个又崩了。现在全靠人肉记笔记,把每次的Prompt和测试结果粘到飞书文档里,已经彻底乱了。想问问大家在实际项目里是怎么管理Prompt版本的?有没有类似单元测试的回归验证方案?还是说只能靠经验和玄学……求指点。