Prompt模板迭代实录:从3.2%到87%的JSON抽取精确率跃升
在构建企业级知识图谱时,非结构化文本的实体关系抽取曾让我的准确率卡在3.2%。通过五轮Prompt工程迭代——从零样本指令到角色扮演+思维链+Few-shot组合,我最终将GPT-4o-mini的F1分数从0.41提升至0.87,同时将单次调用token消耗从1864降至793。本文记录完整的实验设计、对比数据、失败案例及最终模板,包含可复现的LangChain调用代码与成本计算。

关注产品增长,长期记录需求分析与方案设计、商业价值验证和从需求到交付的完整过程。不追求堆砌概念,只记录验证过的经验,希望用清晰的方法帮助产品与业务更高效地落地。
在构建企业级知识图谱时,非结构化文本的实体关系抽取曾让我的准确率卡在3.2%。通过五轮Prompt工程迭代——从零样本指令到角色扮演+思维链+Few-shot组合,我最终将GPT-4o-mini的F1分数从0.41提升至0.87,同时将单次调用token消耗从1864降至793。本文记录完整的实验设计、对比数据、失败案例及最终模板,包含可复现的LangChain调用代码与成本计算。
在Llama-3-8B-Instruct-4bit上对司法文书实体抽取任务做了12组Prompt对比实验。零样本模板F1仅62.3%,通过角色约束+输出JSON Schema+少样本示例,F1提升至84.7%,但Token消耗从每案412增至1893。最终用动态示例选择策略,将F1稳定在83.1%,Token压缩至772。本文记录了完整的调优路径、踩坑点(如JSON解析失败率从31%降至2.7%)
用单卡A100 80G对Llama-3-8B做QLoRA微调,踩遍了显存溢出、loss不收敛、过拟合三大坑。本文记录完整流程:4-bit NF4量化配置、128条医疗问答数据训练3个epoch,最终在自有测试集上BLEU从12.6提升到28.4,指令遵循准确率从31%到79%。附完整代码、loss曲线分析、以及一个让eval_loss骤降的trick——冻结embedding层。