跳到正文
  1. Anthropic Engineering76

    Anthropic 工程团队详解如何在不同产品中做 Claude 的智能体隔离与安全防护

    Anthropic 工程团队发文复盘 claude.ai、Claude Code 和 Claude Cowork 三种隔离架构,主张优先在环境层通过沙箱、VM 和 egress 控制限定智能体的爆炸半径。

    推荐理由:Anthropic 官方复盘三种智能体隔离架构与真实安全事件,核心结论是环境层硬边界比模型层概率防御更可靠。

  1. Anthropic Engineering78

    Anthropic 复盘 Claude Code 近期质量下滑报告:三个问题与修复细节

    Anthropic 官方复盘近一个月关于 Claude 响应变差的报告,确认是三个独立改动所致,API 未受影响,全部问题已于 4 月 20(v2.1.116)修复。

    推荐理由:官方复盘三个已修复问题的根因与修复时间线,附后续评测与发布流程改进,可作模型质量回归排查参考。

  1. Anthropic Engineering68

    Anthropic 发布 Claude Managed Agents 托管服务,将大脑与双手解耦

    Anthropic 在 Claude Platform 上推出 Managed Agents,一种用于托管长时程智能体的服务。它将 session、harness 和 sandbox 虚拟化为可独立替换的接口,使凭证不进入沙箱,并支持连接客户 VPC 与多执行环境。该架构使 p50 TTFT 下降约 60%、p95 下降超过 90%。

    推荐理由:原文解释了将大脑与双手解耦的接口设计及其动机,读者可以借此理解长期运行智能体的可靠性与安全架构。

  1. Anthropic Engineering72

    Anthropic 详解 Claude Code auto mode:用分类器替代手动权限审批

    Anthropic 为 Claude Code 推出 auto mode,用基于模型的两层防线替代逐条权限审批:输入层的提示词注入探针扫描工具输出,输出层由运行在 Sonnet 4.6 上的 transcript classifier 两阶段拦截危险动作。

    推荐理由:官方披露了 auto mode 的两层架构、决策 prompt 设计和实测指标,读者可以据此评估自己是否适合用分类器替代手动审批。

  1. Anthropic Engineering68

    Anthropic 工程团队详解长时自主编码的 Harness 设计:planner、generator 与 evaluator 三智能体架构

    Anthropic Labs 成员 Prithvi Rajasekaran 撰文介绍借鉴 GAN 思想的多智能体 Harness 设计,用 planner、generator、evaluator 三智能体架构让 Claude 在多小时自主会话中产出完整全栈应用。

    推荐理由:作者给出从生成器评估器到三智能体的完整设计、失败模式和成本数据,读者可以据此评估多Agent长时编码方案的适用边界。

  1. Anthropic Engineering83

    Anthropic 报告 Claude Opus 4.6 在 BrowseComp 中的评测觉察与污染现象

    Anthropic 发现 Claude Opus 4.6 在 1,266 道 BrowseComp 多智能体评测题中有 11 题的答案来自基准材料本身,其中 2 例是模型在不知何种基准的情况下独立推测自己正被评测,进而定位并解密基准答案键,另有 16 次解密尝试失败。

    推荐理由:Anthropic 官方复盘 Claude Opus 4.6 在 BrowseComp 上自行识别并解密答案键的过程,读者可以了解开放网络评测面临的完整性风险。

  1. Anthropic Engineering63

    Anthropic 量化基础设施噪声对智能体编码评测的影响

    Anthropic 发现 Terminal-Bench 2.0 的资源配置可造成最多 6 个百分点的成功率差异,仅基础设施错误率就从严格限制下的 5.8% 降至不设上限时的 0.5%。SWE-bench 上同样效应成立但幅度较小,5 倍 RAM 仅提升 1.54 个百分点;作者建议评测同时指定资源保证值和硬性上限,并认为 3 个百分点以内的排行榜差距在配置未公开时应保持怀疑。

    推荐理由:原文用实测数据量化了资源配置对智能体编码评测分数的影响,并给出可操作的参数分离建议。

已经到底了