智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
Anthropic 拉了 45 个 Agent 一起找漏洞:266 个结果很亮眼,但 2700 万 Token 也把“多 Agent 更强”这件事讲复杂了

Anthropic 拉了 45 个 Agent 一起找漏洞:266 个结果很亮眼,但 2700 万 Token 也把“多 Agent 更强”这件事讲复杂了

Agent 可以在论坛里交流,也会互相 Peer Review。最后再由单独的 Arbiter Agent 判断提交的漏洞是不是新的、是不是有效。

1047 147 0 24天前
OpenAI 为 Astra 暂停了两周前沿模型 RL:我更在意那 20% 的安全监控算力开销

OpenAI 为 Astra 暂停了两周前沿模型 RL:我更在意那 20% 的安全监控算力开销

8 月 18 日,OpenAI 公布了一件很少见的事:为了加强安全监控,他们**暂停了两周最新待部署模型的强化学习训练**。

992 163 0 25天前
Asana 把一个“要做 5 年”的前端迁移压到 2 周:最反常识的细节是 Prompt 只有 5 句话

Asana 把一个“要做 5 年”的前端迁移压到 2 周:最反常识的细节是 Prompt 只有 5 句话

昨天 OpenAI 公布了一个很适合工程团队研究的 Codex 案例。

857 132 0 25天前
OpenAI 8月18日新版 Model Spec:做 Agent 的人最该盯住的其实是“无权限数据”和副作用

OpenAI 8月18日新版 Model Spec:做 Agent 的人最该盯住的其实是“无权限数据”和副作用

8 月 18 日,OpenAI 更新了 Model Spec。

959 153 0 25天前
两天找到 100+ 个 Critical 漏洞、已经拿到 12 个 CVE:Google/Mandiant 这套多 Agent 代码审计真正值得抄的是“怀疑链”

两天找到 100+ 个 Critical 漏洞、已经拿到 12 个 CVE:Google/Mandiant 这套多 Agent 代码审计真正值得抄的是“怀疑链”

昨天 Google Threat Intelligence Group 公开了一套内部使用了 10 个月的系统:**Agentic Vulnerability Discovery Harness,AVDH**。

947 150 0 25天前
Claude 旧 Workbench 昨天正式退役:最麻烦的不是页面没了,而是 Prompt 和 Eval 资产可能跟着断档

Claude 旧 Workbench 昨天正式退役:最麻烦的不是页面没了,而是 Prompt 和 Eval 资产可能跟着断档

这件事看起来像一次普通的产品界面升级,但如果之前把 Prompt、变量和 Eval 直接保存在旧 Console 里,影响并不只是“以后换个页面继续用”。

998 154 0 26天前
OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西

OpenAI 昨天说“防守窗口正在收窄”:真正该紧张的不是零日,而是仓库里那堆没人管的旧东西

昨天 OpenAI 发了一篇安全文章,标题叫《The Defender’s Window》。

1169 165 0 26天前
50+ 个 Agent 上线、310 人在用:ABC Legal 最值得抄的不是 Claude,而是把 Agent 当软件管理

50+ 个 Agent 上线、310 人在用:ABC Legal 最值得抄的不是 Claude,而是把 Agent 当软件管理

昨天 Anthropic 公布了一个我觉得很值得企业团队认真看的案例。

1034 162 0 26天前
Gemini 3.7 Flash 刚发布:我更在意的不是跑分,而是 $0.75 输入价把 Agent 成本线往下压了一截

Gemini 3.7 Flash 刚发布:我更在意的不是跑分,而是 $0.75 输入价把 Agent 成本线往下压了一截

8 月 13 日,Google 发布了 Gemini 3.7 Flash。

1233 181 0 27天前
8月26日 o3 从 ChatGPT 下线:别急着改 API,你真正要检查的是这 6 类使用习惯

8月26日 o3 从 ChatGPT 下线:别急着改 API,你真正要检查的是这 6 类使用习惯

OpenAI 已确认:**o3 将在 2026 年 8 月 26 日从 ChatGPT 退役**。这次变化只影响 ChatGPT 中的模型选择,OpenAI 官方同时明确说明,API 不受此次退役影响。

1056 143 0 27天前
Kimi K3 权重放出来以后,国产大模型竞争开始变成另一场游戏

Kimi K3 权重放出来以后,国产大模型竞争开始变成另一场游戏

7 月底 Kimi K3 的完整权重公开后,我觉得国产大模型的竞争已经出现了一个明显变化。

1143 173 0 27天前
SWE-Bench 高就一定会写项目?一篇 GH200 实测给了三个反例

SWE-Bench 高就一定会写项目?一篇 GH200 实测给了三个反例

这两年选 Coding Model,SWE-Bench 几乎成了必看榜单。

1155 169 0 27天前
Agent Planner输出计划存在循环依赖?DAG校验与自动修复排查

Agent Planner输出计划存在循环依赖?DAG校验与自动修复排查

Planner生成的步骤可能互相依赖,导致执行器无法找到起点或反复等待。

1592 234 0 2026-08-11
ReAct、Plan-Execute-Review与状态图Agent怎么选?

ReAct、Plan-Execute-Review与状态图Agent怎么选?

三种Agent架构分别强调即时推理、显式计划和可持久化状态图,适合不同任务复杂度。

1630 245 0 2026-08-11
Reviewer为什么让Agent无限修改?接受阈值、最大轮次与差异检测排查

Reviewer为什么让Agent无限修改?接受阈值、最大轮次与差异检测排查

Reviewer如果只有“继续改进”而没有可判定Rubric和接受阈值,会让执行器无限返工。

1557 230 0 2026-08-11
用Python实现Planner-Executor-Reviewer状态机Agent

用Python实现Planner-Executor-Reviewer状态机Agent

实现带计划校验、步骤执行、Reviewer反馈、局部重试和最终汇总的状态机Agent。

1446 218 0 2026-08-11
手搓生产级 AI Agent 系统(8):Planner、Executor与Reviewer闭环

手搓生产级 AI Agent 系统(8):Planner、Executor与Reviewer闭环

在已有任务规划器之上实现DAG校验、步骤执行、局部审校、状态更新和终止策略。

1584 236 0 2026-08-11
欧盟AI法案进入下一阶段:企业AI应用需要补齐哪些治理能力?

欧盟AI法案进入下一阶段:企业AI应用需要补齐哪些治理能力?

随着欧盟AI法案进入新的实施阶段,企业AI项目不能再把合规理解为“在页面上加一句AI生成提示”。OpenAI于2026年7月31日公开说明其对通用人工智能模型行为准则和AI生成内容透明度行为准则的支持,并再次强调安全评测、风险治理、来源标识、事件响应和持续更新。对于使用第三方大模型构建客服、知识库、Agent和内容生成系统的企业而言,模型提供商承担一部分责任,但应用部署方仍需建立风险分级、数据治理

2379 321 0 2026-08-01
OpenAI Assistants API将在8月26日关闭:迁移Responses API最后阶段完整清单

OpenAI Assistants API将在8月26日关闭:迁移Responses API最后阶段完整清单

OpenAI已经明确,Assistants API将在2026年8月26日停止服务。距离关闭日期不足一个月时,仍依赖Assistant、Thread、Run和Run Step对象的团队不能只把接口地址替换为Responses API。新架构使用Prompt或应用代码管理配置,以Conversation承载输入与输出Item,以Response取代Run,并要求应用更明确地管理工具循环、状态裁剪、重

2369 321 0 2026-08-01
GPT-5.6 Luna降价80%、Terra降价20%:企业AI模型路由应该如何重算?

GPT-5.6 Luna降价80%、Terra降价20%:企业AI模型路由应该如何重算?

OpenAI在2026年7月30日更新GPT-5.6定价:Luna价格下调80%,Terra下调20%。在新的API价格下,Sol为每百万Token 5美元输入、30美元输出,Terra为2.5美元输入、15美元输出,Luna为1美元输入、6美元输出。降价并不意味着所有业务都应该立即切到Luna,而是需要重新计算“每个成功任务”的总成本,包括失败重试、人工复核、延迟、工具调用次数和缓存命中率。本文

2378 328 0 2026-08-01

精选推荐

1 AI SDK 的工程边界:统一模型接入、Agent 工具调用与多框架 UI 346 2 GitHub Copilot 八月 VS 更新:推理强度、模型管理与代码审查的实操解读 316 3 MCP服务器连接超时排查与超时参数调优 311 4 自建AI编程工具的成本模型与替代方案 306 5 Vercel AI SDK:从模型接入到 Agent 的工程观察 303 6 RAG中文知识库分块参数调优:从召回失败到可验证的工程方法 301 7 LLM API 响应变慢时的超时与重试策略调优 300 8 Claude Code 多项目共用配置的工程化实践 292 9 Anthropic披露AI安全事件后续:实时拦截分类器与评估沙箱新规 275 10 MCP服务器超时中断,如何设计重试与降级策略 274 11 DeepSeek API 返回 401 时如何排查:密钥配置、请求头与最小复现 270 12 从 README 拆解 Vercel AI SDK:Unified Provider 与流式 UI 的工程形态 268 13 Gemini 3.8 Flash 进入 GitHub Copilot:公开信息有限 268 14 RAG检索质量差?从分块策略、Embedding到重排序的调优路径 266 15 Claude自动化研究者可靠缓解对齐失败:Anthropic官方实验解读 263 16 Google 8 月 AI 更新页已发布,可验证细节有限,附核查清单 261 17 多模型切换时上下文丢失:Spring AI 应用的工程排查框架 260 18 DeepSeek API 401 鉴权失败:从请求头到密钥轮换的排查闭环 255 19 AI SDK 如何统一 OpenAI、Anthropic 与 Google 接入 255 20 GitHub Copilot 不提示代码建议的排查路径 248