LangChain与AutoGPT启发下:从零手写Agent循环控制与记忆管理
当LangChain的ConversationBufferWindowMemory在长对话中吃掉80%的token预算时,我意识到框架的便利背后是失控的成本。本文记录了我基于AutoGPT的规划-执行模式,用Python手写一个轻量级Agent的过程:仅用180行代码实现了工具注册、滑动窗口记忆、JSON错误重试与最大迭代限制。在模拟的订票场景中,该Agent将API调用失败率从42%降至11%,

关注产品设计与管理,长期记录产品增长与运营、项目推进与复盘和从需求到交付的完整过程。重视可维护性、稳定性与协作效率,希望用清晰的方法帮助产品与业务更高效地落地。
当LangChain的ConversationBufferWindowMemory在长对话中吃掉80%的token预算时,我意识到框架的便利背后是失控的成本。本文记录了我基于AutoGPT的规划-执行模式,用Python手写一个轻量级Agent的过程:仅用180行代码实现了工具注册、滑动窗口记忆、JSON错误重试与最大迭代限制。在模拟的订票场景中,该Agent将API调用失败率从42%降至11%,
上周用两张3090微调Qwen2.5-7B做法律文书摘要,全量微调直接OOM,LoRA(rank=8)勉强跑通但显存峰值26.8GB。换用QLoRA+NF4量化后,峰值显存直降到11.2GB,训练速度只慢18%。最终在2000条法律判决书上微调3个epoch,ROUGE-L从0.42提升到0.57,推理时模型能正确引用法条编号。本文记录完整过程:从数据清洗、bitsandbytes配置、PEFT参