智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
LLM-as-a-Judge评分忽高忽低?位置偏差、长度偏差与校准排查

LLM-as-a-Judge评分忽高忽低?位置偏差、长度偏差与校准排查

评审模型会受答案顺序、长度、措辞、自身模型偏好和Rubric模糊影响。

1187 188 0 28天前
Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查

Code Interpreter临时文件为什么泄露到其他任务?工作目录与生命周期排查

多个任务复用容器、工作目录或缓存时,前一个用户生成的文件可能被后续任务读取。

1387 199 0 29天前
Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查

Browser Agent遇到验证码和登录循环怎么办?会话、人工接管与站点策略排查

浏览器Agent在验证码、MFA、会话过期和反自动化策略前可能不断刷新或重试。

1319 189 0 29天前
多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查

多Agent协作时为什么总是传递旧上下文?状态版本与消息边界排查

子Agent读取的状态可能是任务开始时快照,而不是其他Agent刚更新的最新结果。

1362 191 0 2026-08-13
并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查

并行Sub-Agent为什么让Token成本暴涨?并发、上下文复制与预算排查

并行执行会复制System Prompt、工具Schema、历史和检索上下文,Agent数量翻倍时成本可能超过线性增长。

1414 211 0 2026-08-13
Agent从Checkpoint恢复后为什么重复调用工具?步骤提交与副作用幂等排查

Agent从Checkpoint恢复后为什么重复调用工具?步骤提交与副作用幂等排查

Checkpoint保存时间点不正确时,恢复后会重新执行已经产生副作用的工具。

1494 232 0 2026-08-12
Human-in-the-Loop审批超时后任务丢失?等待状态与恢复令牌排查

Human-in-the-Loop审批超时后任务丢失?等待状态与恢复令牌排查

人工审批可能持续小时或数天,不能依赖HTTP连接、内存Future或临时线程等待。

1550 219 0 2026-08-12
HNSW索引内存为什么越来越高?参数、Payload索引与副本排查

HNSW索引内存为什么越来越高?参数、Payload索引与副本排查

向量数量增长后,HNSW图、向量数据、Payload索引、副本和缓存都会消耗内存。只调整一个参数往往无法解决。

1677 256 0 2026-08-10
向量量化后Recall突然下降?Scalar、Product与Binary Quantization排查

向量量化后Recall突然下降?Scalar、Product与Binary Quantization排查

量化能够降低内存和提升速度,也会引入距离误差。下降是否可接受取决于向量分布、候选数和重排策略。

1722 246 0 2026-08-10
GraphRAG检索结果为什么又多又乱?实体合并、社区摘要与路径约束排查

GraphRAG检索结果为什么又多又乱?实体合并、社区摘要与路径约束排查

GraphRAG能够沿关系扩展证据,也容易因为实体重复、关系过密和无边界遍历返回大量噪声。

1629 239 0 2026-08-09
Agentic RAG为什么在多个检索工具之间死循环?终止条件与进度检测排查

Agentic RAG为什么在多个检索工具之间死循环?终止条件与进度检测排查

Agent在向量检索、网页搜索和数据库工具之间反复调用,通常是缺少可验证目标、进度状态和工具调用预算。

1861 275 0 2026-08-09
RAG答案有引用但引用根本不支持结论?Claim-Evidence校验排查

RAG答案有引用但引用根本不支持结论?Claim-Evidence校验排查

真实存在的文档编号并不意味着结论被该文档支持,需要进行Claim级证据校验。

1651 246 0 2026-08-08
上下文压缩后关键条件消失?数字、例外条款与表格保真排查

上下文压缩后关键条件消失?数字、例外条款与表格保真排查

压缩器可能保留主结论,却删除适用范围、例外、时间和单位,导致绝对化错误。

1787 237 0 2026-08-08
RAG查询改写后把关键实体改错了?人名、编号与否定词保护排查

RAG查询改写后把关键实体改错了?人名、编号与否定词保护排查

查询改写可能修改产品编号、人名、日期、否定条件和专业术语,导致检索方向错误。

1805 257 0 2026-08-07
RAG查询改写后数字、缩写和型号消失?Token清洗排查

RAG查询改写后数字、缩写和型号消失?Token清洗排查

型号、错误码、版本和缩写是技术检索最重要的Token,清洗或改写阶段删除它们会同时损害稀疏和稠密检索。

1870 261 0 2026-08-07
Spring AI应用Docker健康检查正常,为什么真实模型调用全部失败?

Spring AI应用Docker健康检查正常,为什么真实模型调用全部失败?

进程健康只能证明容器存活,不代表凭证、网络、额度和指定模型可调用。

1957 259 0 2026-08-06
AI应用上线后Prompt版本混乱?配置漂移、缓存与多实例排查

AI应用上线后Prompt版本混乱?配置漂移、缓存与多实例排查

不同Pod使用不同Prompt缓存、配置中心版本或模型别名,会导致同一代码版本行为不一致。

1932 276 0 2026-08-06
大模型单元测试为什么时好时坏?温度、模型漂移与断言方式排查

大模型单元测试为什么时好时坏?温度、模型漂移与断言方式排查

直接断言大模型完整字符串,会因采样、模型更新、提示词和检索变化产生脆弱测试。

1966 288 0 2026-08-05
黄金测试集更新后历史分数不能比较?数据集版本与基线漂移排查

黄金测试集更新后历史分数不能比较?数据集版本与基线漂移排查

不断补充样本后,新旧平均分不能直接比较,因为样本难度和分布已经变化。

1998 277 0 2026-08-05
Spring WebFlux请求超时后AI任务为什么还在运行?

Spring WebFlux请求超时后AI任务为什么还在运行?

前端或网关超时只终止HTTP响应,不一定向上游模型、工具或队列传播取消信号。

2115 268 0 2026-08-04

精选推荐

1 AI SDK 的工程边界:统一模型接入、Agent 工具调用与多框架 UI 346 2 GitHub Copilot 八月 VS 更新:推理强度、模型管理与代码审查的实操解读 316 3 MCP服务器连接超时排查与超时参数调优 311 4 自建AI编程工具的成本模型与替代方案 306 5 Vercel AI SDK:从模型接入到 Agent 的工程观察 303 6 RAG中文知识库分块参数调优:从召回失败到可验证的工程方法 301 7 LLM API 响应变慢时的超时与重试策略调优 300 8 Claude Code 多项目共用配置的工程化实践 292 9 Anthropic披露AI安全事件后续:实时拦截分类器与评估沙箱新规 275 10 MCP服务器超时中断,如何设计重试与降级策略 274 11 DeepSeek API 返回 401 时如何排查:密钥配置、请求头与最小复现 270 12 从 README 拆解 Vercel AI SDK:Unified Provider 与流式 UI 的工程形态 268 13 Gemini 3.8 Flash 进入 GitHub Copilot:公开信息有限 268 14 RAG检索质量差?从分块策略、Embedding到重排序的调优路径 266 15 Claude自动化研究者可靠缓解对齐失败:Anthropic官方实验解读 263 16 Google 8 月 AI 更新页已发布,可验证细节有限,附核查清单 261 17 多模型切换时上下文丢失:Spring AI 应用的工程排查框架 260 18 DeepSeek API 401 鉴权失败:从请求头到密钥轮换的排查闭环 255 19 AI SDK 如何统一 OpenAI、Anthropic 与 Google 接入 255 20 GitHub Copilot 不提示代码建议的排查路径 248