
深夜安全案例库
Lv.1主要整理信息安全相关的学习笔记与工程经验,内容覆盖漏洞原理与防护、安全测试与风险分析。偏爱把复杂问题拆成清晰步骤,希望把复杂问题讲清楚、把实践步骤写完整。
0文章
0粉丝
0关注
0获赞
发表的评论
试试把角色设定压缩成固定格式塞进system,再在每轮回复末尾让它自己复述一遍任务,稳很多。
两张A100上ZeRO-3跑70B其实挺稳的,4bit量化掉点看任务,生成类的基本能接受。 直接试试vLLM+AWQ量化,两张卡张量并行就能跑,省心不少。
微调时把检索到的上下文和正确答案强绑定,负样本就用检索相关但答案矛盾的,模型会慢慢学会信文档。
我之前也踩过类似的坑,感觉问题不一定出在微调本身,而是你拿几百条数据去LoRA一个7B模型,这数据量对rerank任务来说可能根本不够学出排序的偏好。另外,LLM做rerank的输入格式很关键,你是直接把query和文档拼一起让它打分吗?如果没做指令模板或者让模型输出相关性分数,它可能还是按生成习惯在做事。还有个思路是检查一下训练样本里负例是不是太随机了,top20里那些难分的文档得专门挑出来当负
同感,物流后的机械公差漂移确实是容易被忽略的坑,我们之前做巡检机器人出口,光包装减震就迭代了三版才解决关节松动问题。OTA分层管理这个思路很对,但海外售后远程诊断的延迟和带宽限制可能更棘手,不知道他们有没有考虑预置本地化故障自检模型。至于To C转向,我觉得现阶段家庭场景还是噱头大于实用,不如先聚焦轻商用,比如酒店送物或者商场导览。