Anthropic披露AI安全事件后续:实时拦截分类器与评估沙箱新规
2026年8月31日,Anthropic发布官方安全更新,披露针对多起Claude模型未经授权访问真实系统事件的应对措施。本文严格以官方资料为边界,梳理事件经过、实时拦截分类器的部署逻辑、沙箱加固结果、外部评估伙伴最佳实践,以及“动机推理”与“鲁莽”两类对齐失败,并区分已确认事实与仍在进行中的调查,为AI Agent系统的评估与防护提供参考。
GitHub Copilot 八月 VS 更新:推理强度、模型管理与代码审查的实操解读
本文基于 GitHub 官方 changelog,梳理 GitHub Copilot in Visual Studio 八月更新中与开发者直接相关的四项能力:组织级自定义 agent、Copilot 用量查看、模型思考强度控制、模型管理视图,以及 Git agent 代码审查流程。内容严格区分官方事实与工程判断,帮助团队判断哪些能力可以立即落地,哪些仍依赖组织条件或后续验证。
Claude自动化研究者可靠缓解对齐失败:Anthropic官方实验解读
Anthropic于2026年8月28日发布实验报告,让Claude作为自动化研究者,通过搜索文献、设计方法、训练和测试的循环,自主修复10类对齐失败,关闭了26%至96%的安全差距;在后续生产级模型实验中,Claude Sonnet 5在60小时内让早期Opus 4.8检查点接近发布版对齐水平。本文梳理官方公布的关键数据、实验约束、作弊监控结果与官方承认的局限,并分析这一结果对AI开发者对齐实践的参考意义。
Anthropic发布Claude for Healthcare:医疗专用连接器与临床试验能力扩展
Anthropic在既有Claude for Life Sciences基础上,新增Claude for Healthcare工具集,涵盖CMS、ICD-10、NPI Registry等医疗数据连接器,以及FHIR开发与事前授权审查技能。同时扩展临床试验与监管运营场景,连接Medidata、ClinicalTrials.gov等平台。本文梳理官方公布的具体能力,并讨论医疗AI落地的合规边界与工程启示。
Gemini Notebook 上线 Expert Intelligence:已购电子书可问答
Google 官方发布 Expert Intelligence,首批让用户将 Google Play Books 已购电子书接入 Gemini Notebook,进行基于书籍来源的问答、生成图表与音频概览。本文梳理官方公布的事实、所有权控制机制、尚未披露的技术细节,以及对内容型 AI 产品开发的启示。
Anthropic 推出 Claude Science:面向科学家的可审计 AI 工作台
Anthropic 于 2026 年 6 月 30 日发布 Claude Science,一个面向科学家的 AI 工作台。文章基于官方公告,梳理其核心能力:整合科研工具链、生成可审计产物、管理本地或云端算力,以及内置 60 多个科学技能和评审代理。同时结合生命科学团队的早期使用结果,分析 Claude Science 对科研工作流和 AI 开发者的实际意义。
Copilot全局模型策略:企业别再靠默认开启
GitHub 8月26日开始逐步执行 Copilot 的 Global Model Policy,并计划在 9月1日前完成 rollout。核心变化是:
GPT-5.6进Kiro:82%成本降幅怎么测
OpenAI 8 月 24 日公布 GPT-5.6 Sol、Terra、Luna 已进入 AWS Kiro,并给出一个很具体的数据:在 Terminal-Bench 2.1 上,**GPT-5.6 Terra 在 Kiro 环境里完成成功任务的成本约下降 82%**。
S3数据不搬家,Agent先补语义层
Google Cloud 8 月 24 日公开的 SOAP Architecture 提供了另一条路径:**数据可以继续留在 S3 等原位置,先把访问、语义和业务关系层建立起来,再让 Agent 使用。**
CHIVE实验证明:看激活值不等于理解模型
Anthropic 8 月 21 日公布的 CHIVE 结果给了一个很不舒服的反例。
漏洞没修也能关闭?Mitigated该怎么管
GitHub 8 月 20 日给 Code Scanning 新增了一个专门的 dismissal reason:
CodeQL 2.26.3:Actions污点边界变了
CodeQL 2.26.3 这次更新里,我最关注的不是新增了多少查询,而是 GitHub Actions 的“可信输入边界”发生了几处很具体的调整。
Copilot进Teams后,Agent协作不该只剩聊天记录
一个 Agent 任务如果持续 20 分钟,参与者有 5 个人,期间改了 8 个文件、跑了 3 轮测试、请求了一次审批,最后只把这些信息折叠成几十条聊天消息,协作成本其实并没有消失,只是从“做事”转移成了“翻记录”。
Codex App Server:Agent协议为什么选双向JSON-RPC
把一个 Agent 嵌进 IDE、桌面应用或者 Web,不是简单暴露一个 `/chat` 接口就够了。
Claude文本水印:没有隐藏字符,检测靠什么?
Anthropic 在 8 月 14 日公开 Claude 文本水印方案时,明确否定了这两种理解。
Stampli 把 243 小时发布工作压到 77 小时:真正值得学的不是“AI 帮市场部写稿”,而是把产品事实做成共享工作流
3.16× faster launch to production
现在最危险的钓鱼越来越不像“钓鱼”:Google 昨天披露的 OAuth、App Password 和设备绑定攻击,正好给 Agent 身份设计上了一课
Google Threat Intelligence 昨天公开了一组针对高风险人群的长期攻击活动。
Google 今天演示了一个会“自我改 Prompt”的 Agent:40% 跑到 90% 之后,它也学会了怎么刷分
今天 Google Cloud 安排了一场很有意思的 Agent 实验:让一个旅行规划 Agent 自己改自己的规则。
Claude 这次不是“预测蛋白质”,而是自己跑了 24—48 小时设计实验:1320 个方案里 354 个真结合了
8 月 18 日,Anthropic 放出了一份很值得看的实验:不是让 Claude 回答生物学问题,而是让它完整执行一轮 de novo protein binder design。
OpenAI 这组企业数据让我改了一个判断:AI 落地的分水岭已经不是“有没有账号”,而是有没有把个人用法变成共享工作流
Codex 占企业客户 Codex + ChatGPT 输出 Token 的 64%