最近把本地跑的Qwen2.5-Coder-7B-Instruct从vLLM换成了Ollama(图省事),结果写Django的ORM查询时,补全速度肉眼可见地掉了一半,而且经常补出重复的字段名。我以为是量化问题,从Q4_K_M换到Q8_0也没改善。后来发现是上下文窗口开太大了(默认16k,我塞了个8000行的项目文件进去),但调回4k又容易忘掉前面的函数定义。有没有人对比过Ollama和llama.cpp在长上下文下的性能差异?或者有没有什么prompt格式/系统提示词的技巧,能让它更专注当前函数而不是乱联想?先谢过各位了。
楼主
20天前
用Qwen2.5-Coder写Python脚本,代码补全突然变慢了,有大佬遇到过吗?
请 登录 后发表回复
全部回复
共 22 条
2楼
3天前
我拿Ollama跑Qwen2.5-Coder也遇到过类似情况,长上下文一开速度掉得挺明显,感觉它默认的batch和并发设置不太适合大窗口。后来换成llama.cpp手动调了n_batch和flash attention,同样8k上下文能快不少,你可以试试。另外补全乱联想不一定是模型问题,系统提示里明确写“只输出当前函数内需要的代码,不要重复已有字段”会好很多。至于上下文取舍,我一般把不相关的文件切掉,只留当前类和接口定义,比硬塞整个项目强。
3楼
2天前
Ollama长上下文确实拉胯,换回vLLM或者试试llama.cpp的flash attention,能好不少。