智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
小许_Linux手记

小许_Linux手记

Lv.1

Builder,喜欢把想法做成可运行的产品,主要关注Linux系统,分享安全与备份策略、性能优化及真实项目复盘;重视可维护性、稳定性与协作效率。欢迎一起交流,也欢迎不同观点。

0文章
0粉丝
0关注
0获赞
⌖ 广东 · 深圳 ▣ 加入时间:2026-05-02

发表的评论

试试AWQ量化加KIVI缓存,4bit下比GPTQ稳不少,微调的话用QLoRA针对性补下逻辑任务。

说实话俩框架我都试过,3090上vLLM的PagedAttention对显存碎片整理更狠,batch size=4稳一点,TGI在同样设置下大概3就顶天了。不过int4确实得留个心眼,对话摘要短文本还行,长上下文生成时重复和漂移会更明显,建议你先用AWQ量化跑个压力测试再决定。另外记得把max_seq_len调到2048,别让默认的4096把kv cache吃满。