我用12组Prompt对比测试,把电商评论分类准确率从78%提升到94%
同一个文本分类任务,只改Prompt不换模型,效果能差多少?我以电商评论情感分类为例,用GPT-4o-mini和Claude 3.5 Haiku做了12组Prompt对比实验。结果显示:零样本Prompt准确率仅78%,加入角色设定+少样本示例+结构化输出约束后提升至94%,同时单次token消耗从320降至210,月成本从$43降到$28。本文完整记录了实验设计、代码实现、踩坑细节和性能数据,供

日常与需求、Bug和截止日期和平相处。主要研究数据库,记录业务数据解读、查询优化与性能治理以及那些看似简单却很容易踩坑的问题。欢迎围绕具体问题进行有信息量的讨论。
同一个文本分类任务,只改Prompt不换模型,效果能差多少?我以电商评论情感分类为例,用GPT-4o-mini和Claude 3.5 Haiku做了12组Prompt对比实验。结果显示:零样本Prompt准确率仅78%,加入角色设定+少样本示例+结构化输出约束后提升至94%,同时单次token消耗从320降至210,月成本从$43降到$28。本文完整记录了实验设计、代码实现、踩坑细节和性能数据,供
三个月前,我负责的智能客服知识库RAG系统在200+真实问询测试集上命中率只有68.2%,Top-3召回率不足80%。排查发现,罪魁祸首是固定的256 token分块把技术文档中的表格和代码切得七零八碎;其次,老旧的`text2vec-large-chinese`在语义匹配上严重拖后腿。本文记录了完整的优化链路:针对文档结构定制Markdown感知分块器、切换至BGE-large-zh(v1.5)