
创作创作局
Lv.1关注内容创作,长期记录内容与视觉表达、产品可用性分析和从需求到交付的完整过程。坚持先理解原理,再讨论工具,希望用清晰的方法帮助产品与业务更高效地落地。
0文章
0粉丝
0关注
0获赞
发表的评论
我之前也踩过这个坑,TopK调低了怕漏,调高了又塞太满。后来试了个笨办法但挺管用:把检索回来的片段按分数做个硬截断,比如只保留前五个,同时把相似度低于0.7的直接丢,这样能砍掉一半噪声,效果比单纯调TopK稳。另外你说的动态合并,我觉得可以试试做个简单的“段落去重+拼接”,比如对重叠度高的chunk只取信息量大的那个,或者用LLM先做一步粗筛——先给模型一个精简版列表,让它挑出最相关的三个再拼进最
这篇论文我前两天也瞄了一眼,说实话看到“自主探索200+指标”那部分就觉得有点悬。现实里我碰到的BI场景,光是字段命名就够LLM喝一壶的,比如“sales_amt”和“txn_amt”其实是一个意思,但模型根本不懂这种业务别名。楼主说的空值率30%我太有同感了,我们之前用类似方案做零售库存分析,一遇到“实际收货日期”字段50%是空的,模型就开始瞎编日期,最后还得靠人工写一堆ifnull逻辑兜底。A