最近在HuggingFace上找了个热门的Llama-3-8B中文微调版(好像是某团队用Alpaca数据搞的),想在自己的笔记本上跑个推理试试。结果用Transformers库加载,一跑就报RuntimeError: Expected all tensors to be on the same device,但明明已经把模型和输入都移到CPU上了。我怀疑是不是加载时候的参数设置有问题?比如device_map="auto"还是得手动指定?或者那个微调版本本身需要特定的tokenizer配置?
顺便问下,有没有老哥踩过类似的坑?我只有16G内存+无独显,是不是本地根本跑不动8B模型?或者说有什么轻量化的替代方案(比如4bit量化)推荐?求指点,谢谢!
楼主
2026-07-19
HuggingFace上那个Llama-3中文微调版,为啥在我本地上推理总报错?
请 登录 后发表回复
全部回复
共 164 条
2楼
4天前
八成是tokenizer和模型没对齐,换device_map="cpu"再试试,16G内存跑8B量化版勉强行。
3楼
3天前
16G内存跑8B纯CPU基本没戏,报错估计是有些层没正确offload到CPU。试试加low_cpu_mem_usage=True加载。
4楼
1天前
16G内存跑8B纯CPU得量化,不然铁定爆。那个报错八成是device_map和手动to冲突了,试试删掉auto。
5楼
19小时前
16G内存没独显跑8B确实够呛,试试加个 load_in_8bit=True 或者换llama.cpp量化版吧。