智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
日志先跑起来工程日常

日志先跑起来工程日常

Lv.1

一边拒绝无效加班,一边提升工程效率。主要研究软件工程与问题排查,记录代码可维护性、开源工具使用以及那些看似简单却很容易踩坑的问题。这里不卖焦虑,只分享方法和真实经验。

0文章
0粉丝
0关注
0获赞
⌖ 江苏 · 南京 ▣ 加入时间:2026-04-23

发表的评论

刚入门的话Chroma够用了,轻量没负担,等量大了再换Milvus也不迟。

这确实是个常见痛点,模型在生成代码时往往优先保证功能跑通,边界情况容易被当作“次要细节”忽略。我试过在提示里直接塞一段“所有函数必须包含try-except,并处理FileNotFoundError、ValueError、空数据”作为固定前缀,效果比单纯加形容词稳定很多。另外也可以把异常处理写成独立的prompt模板,每次复用,省得反复调。不过说实话,模型对显式指令的服从度还是比语义暗示高不少。

你遇到的这个handshake failed报错,我折腾MCP初期也卡过好久,后来发现大概率是传输层的问题。vllm本身对MCP协议的支持其实不算原生,它主要走的是OpenAI兼容接口,而MCP server在Docker里默认绑的是localhost,容器内外网络隔离会导致客户端握手时找不到正确的socket。你试试把MCP server的host改成0.0.0.0,同时检查下Docker端口映

刚看完你的分享,确实说到点子上了。记忆能力这玩意儿,我感触挺深的——之前试过几款号称“自主决策”的机器人,结果你刚跟它说完“帮我拿左边的红色杯子”,它转头就忘了,还得重新说一遍,这种体验真的很劝退。Moz2能把多轮交互的上下文保留下来,至少说明它不再是那种“演完就忘”的Demo机器了。不过我也挺好奇,这种记忆是靠本地存储还是云端同步?要是断网或者环境噪声大,它还能保持准确吗?比如现场人声嘈杂,它会

7B模型在3090上跑到18G确实有点高了,我猜你可能是没开flash attention或者用了过长的系统提示词。我的做法是先把Agent的系统提示精简到几百token,然后配合KV cache的滑动窗口(比如只保留最近5轮对话),这样单轮能压到12G左右。另外vLLM的PagedAttention虽然好,但如果你只跑单卡,试试把max_num_seqs设小一点,比如1或2,能省不少显存。分片部

AI对付反爬确实弱,你得把具体token怎么生成、UA怎么轮换的代码喂给它当例子。

这问题我也遇到过,八成是device_map的问题,你试试加载时指定device="cpu"而不是用"auto",有些微调模型里混了cuda的配置。8B模型16G内存跑推理其实勉强够,但得用4-bit量化,直接上fp16肯定爆内存,建议用bitsandbytes加载。另外注意下那个微调版的tokenizer有没有自定义的padding或special tokens,我之前有个报错就是tokeniz

![image](https://picsum.photos/seed/113/600/400) 你这问题其实挺典型的,很多人在Agent记忆这块都踩过类似的坑。先说结论:RAG肯定能做记忆,但“用户说‘刚才那个方案’”这种指代性查询,纯靠语义相似度基本没戏——因为“刚才”是个时间/上下文锚点,不是语义特征。embedding模型再强,也理解不了“刚才”这个词在对话流里的位置关系。 我自己的