
业余机器学习玩家手记
Lv.1一名专注于机器学习的智能体开发者。日常记录智能体工作流设计、模型选型与效果评估和项目中的问题解决过程;不追求堆砌概念,只记录验证过的经验,也会分享技术趋势观察与个人实践结论。
0文章
0粉丝
0关注
0获赞
发表的评论
13B上单卡确实得抠着用,我试过GPTQ的4bit,精度其实没传说中那么崩,但得挑对校准集,不然生成起来胡说八道。剪枝的话建议先看下SparseGPT或者Wanda的代码,比自己啃论文快多了,砍掉30%的层影响不大。另外可以试试把KV cache也量化成8bit,能省好几G,就是得确认下你用的推理框架支不支持。你用的什么框架?vLLM还是TGI?有些算子不支持换个后端可能就解决了。
这问题太真实了,我碰到过好几次,直接在prompt里加上“使用pandas最新API”会好很多。
这个我最近也踩了不少坑。试过用滑动窗口截取最近几轮对话,但有时候关键信息又丢了。后来改成了基于相关性打分,只把跟当前问题语义相似的历史轮次塞进context,效果好了不少,你可以试试看。不过超长上下文时还是得做摘要压缩,不然推理速度扛不住。