最近在做一个客服工单自动分类的小功能,用GPT-4o mini跑,大概20个类别。Prompt前后改了十几版,每次改完感觉某几个类别准了,另外几个又崩了,来回反复横跳。现在就是手动拿十几条测试用例跑一遍,看眼结果就上线了,心里特别没底。想问问大家:Prompt这种“代码”你们是怎么做版本管理的?有没有什么轻量的回归测试方案?还是说只能靠经验和玄学……求指点。