AI Builders 每日摘要 · 2026-09-25

Agent 的下一阶段正在从单体工作环境走向可拆分的 brain、hands 与 files;与此同时,形式化方法、containment、Managed Agents 和面向 agent 的商业入口开始成为产品基础设施。

This page is accessible in English navigation, but the full body has not been translated yet. The original Chinese content is kept below for accuracy.

一句话结论

今天最值得关注的主线是:agent 正在从“一个模型加一台电脑”演化为可拆分、可恢复、可审计的系统。Anthropic 把这种方向落到了形式化 bug-finding、产品 containment 和 Managed Agents;Vercel 的 Guillermo Rauch 则从工程架构角度把 agent 拆成 brain、hands 和 files。另一条产品信号是,模型与 harness 的能力差异正在变得同样重要,真正的竞争点越来越集中在工作流、工具、记忆和安全边界。

X / Twitter

Claude Code 工程师 Boris Cherny

Boris Cherny 进一步解释了 Claude 使用 formal methods 的方式:先针对棘手的 state machine 或容易出现 race condition 的部分建立模型,再寻找 counter-example、复现疑似 bug,最后修复代码。重点不是“整个代码库已经被形式化验证”,而是把建模、反例和修复接入日常工程流程,优先处理最难靠人工发现的问题。

他还分享了 Claude 与 Desktop app 性能提升背后的工程经验,并把相关优化整理成面向工程师的文章。对团队而言,这说明 agent 的价值不只在生成新代码,也在于系统性地定位并修复长期存在的性能瓶颈。

来源:https://x.com/bcherny/status/2102898067133595992

来源:https://x.com/bcherny/status/2102854267782705648

OpenAI Codex 与 ChatGPT 工程师 Thibault Sottiaux

Thibault Sottiaux 预告下周 DevDay 将带来一批会改变工作方式的更新,并表示 Astra 让团队在很短时间内完成了更大胆的尝试。更具体的产品信号是,他已经把 ChatGPT voice 用在工作讨论、邮件、编码和日历管理上,而且这些能力可以跨越包含第三方插件在内的完整插件生态。

这指向一个重要变化:AI 助手的竞争不再只是回答质量,而是能否把语音、工具调用、代码和日常工作系统连成一个连续的操作面。

来源:https://x.com/thsottiaux/status/2102996313780736363

来源:https://x.com/thsottiaux/status/2102814202117411196

AI 教程与访谈作者 Peter Yang

Peter Yang 认为,当前一个实验室拥有最好的模型,另一个实验室拥有最好的 harness;如果模型能力继续提升,Claude Code 这类 harness 还需要补上高质量的 live voice、browser 和 computer use。他对 Opus 5.5 的评价集中在速度、写作、对话体验和 rate limits,而不是单一 benchmark 分数。

这个判断提醒产品团队:模型本身和模型被组织、被调用、被接入工具的方式,正在成为两条可以分别领先的竞争曲线。

来源:https://x.com/petergyang/status/2102952201350254667

来源:https://x.com/petergyang/status/2102946952740741394

Meta AI 高级总监 Madhu Guru

Madhu Guru 反驳了“消费者只想让 agent 替自己完成所有事情”的单一叙事:浏览服装可能是娱乐,但找屋顶维修商、比较评价、联系服务商、协调保险和预约检查,往往是用户希望尽量少操心的摩擦。对同一个“做事情”的过程,消费者可能一会儿想探索,一会儿只想尽快得到正确结果。

因此,agent 产品的关键不是一味追求更多自动化,而是判断哪些任务应该保留探索感,哪些任务应该被压缩为几乎零摩擦的执行链路。

来源:https://x.com/realmadhuguru/status/2102777931764498536

Claude Code 工程师 Thariq

Thariq 分享了一种更可复用的 Claude 内容形式:用较长的 prompt、skills、examples 和 API keys,把具体工作方法拆出来,让读者能够复制,而不是只展示“Claude one-shot this”的结果。这个方向的价值在于把 prompt 从一次性技巧变成可以复盘、迭代和迁移的工作资产。

对使用 agent 的团队来说,真正可积累的不是某次漂亮 demo,而是能被其他人重跑的上下文、工具组合和操作步骤。

来源:https://x.com/trq212/status/2102870353781641416

来源:https://x.com/trq212/status/2102857025206255902

Vercel CEO Guillermo Rauch

Guillermo Rauch 把成功的 agent 拆成三个部分:brain 是模型和 harness,hands 是工具、电脑和浏览器,files 是 memory、skills 和 repos。把它们全部放进一台 stateful computer 是最容易启动的方式,但在云端运行时,拆分这些组件可以让 harness、浏览器、执行环境和存储分别扩展、恢复和审计。

他还宣布为 Sandbox 配套推出 Drives,把可独立读写的外部存储作为 agent 的“硬盘”。这类拆分不仅有成本收益,也会改善安全边界:凭证、执行环境、工作流状态和长期记忆不必再共享同一个进程。

来源:https://x.com/rauchg/status/2102820148629614685

Box CEO Aaron Levie

Aaron Levie 认为 AI 降低创作门槛后,电影和其他创意内容会获得更多制作机会,而不是简单地减少创作者的位置。技术变化会扩大媒介边界,但创意能力与 taste 仍然重要,只是更多人可以借助新工具把这些能力转化为作品。

这个判断把“AI 是否替代创意工作”的问题换成了更有用的产品问题:工具是否让更多人能够承担风险、尝试新的叙事形式,并把审美判断真正落到作品里。

来源:https://x.com/levie/status/2102934874470617303

Y Combinator 总裁兼 CEO Garry Tan

Garry Tan 提出,创业公司获客正在同时出现两条趋势:让 software agents 想要你的产品,以及使用 agents 让人想要 software。前者要求产品具备清晰、可被 agent 理解和调用的价值表达;后者则是用 agent 改善营销、销售和产品触达。

这意味着面向 agent 的产品分发不只是增加一个 API,而是要重新思考产品如何被发现、评估和推荐。

来源:https://x.com/garrytan/status/2102955139875397806

SPC General Partner Aditya Agarwal

Aditya Agarwal 认为,判断团队质量时,团队一起工作的时间可能比单纯的人数更有信息量。一个已经协作三年以上的团队,往往比刚组建的同规模团队拥有更高 throughput 和更强韧性;他把 team longevity 视作比 team size 更值得关注的指标。

在 agent 加速软件生产的背景下,这个观点仍然成立:自动化可以提高个人和团队的执行速度,但长期协作形成的上下文、信任和判断力,依然是系统产出的一部分。

来源:https://x.com/adityaag/status/2102782451643040074

Claude

Claude Marketplace 现在支持发现 connectors、plugins、agents 和 expert partners,示例包括 Slack、Notion、Cursor、CrowdStrike 以及服务合作伙伴。对 Claude 生态而言,这把“模型能做什么”进一步扩展成“用户可以直接接入哪些工具和服务”。

这也是 agent 产品逐渐平台化的信号:工具目录、服务伙伴和可组合能力,会成为用户选择工作流的重要入口。

来源:https://x.com/claudeai/status/2102840851538080172

OFFICIAL BLOGS

Anthropic Engineering:How we contain Claude across products

Anthropic 把 agent 风险拆成三个来源:用户误用、模型误行为和外部攻击。文章的核心工程问题不是让失败概率变成零,而是限制一次失败可以造成的损害,也就是控制 agent 的 blast radius。Anthropic 发现,逐次请求权限并不能完全解决问题:用户大约批准了 93% 的 permission prompts,提示过多会带来 approval fatigue,因此产品开始把更多工作转向 containment,包括 sandbox、VM、文件系统边界和 egress controls。

这套方法对其他 agent 产品同样适用:模型训练负责降低错误概率,环境和权限边界负责限制错误后果,两者不能互相替代。文章的关键表述是:“The engineering question becomes how to cap the blast radius.”

来源:https://www.anthropic.com/engineering/how-we-contain-claude

Anthropic Engineering:An update on recent Claude Code quality reports

Anthropic 对近期 Claude Code 质量下降报告进行了复盘,确认问题来自三个独立变化:默认 reasoning effort 调整、清理闲置 session thinking 的实现 bug,以及为降低 verbosity 而加入的 system prompt 变化。它们分别影响延迟与智能程度、上下文记忆,以及编码质量;API 和 inference layer 本身没有受到影响,相关问题已在 2026 年 4 月 20 日的 v2.1.116 前后修复。

这次复盘的工程价值在于,它把“模型变差了”的主观体验拆成了产品层、上下文管理层和 prompt 层的具体回归,并强调扩大真实用户构建、按模型进行 eval、对 system prompt 做更严格的 ablation 与渐进发布。

来源:https://www.anthropic.com/engineering/april-23-postmortem

Anthropic Engineering:Scaling Managed Agents: Decoupling the brain from the hands

Managed Agents 的设计把 agent 拆成 session、harness 和 sandbox:session 是持久化事件日志,harness 负责调用 Claude 并路由工具,sandbox 则负责执行代码和编辑文件。这样做的直接收益是,harness 或容器崩溃时可以从 session 恢复,不需要把整个 agent 当成一个不可替换的“pet”;凭证也可以留在 sandbox 之外,降低 prompt injection 直接读取环境变量的风险。

Anthropic 还报告了性能收益:把 brain 与 hands 解耦后,p50 TTFT 下降约 60%,p95 下降超过 90%。更重要的是,session 成为 context object,未来可以在不改变持久化接口的情况下替换 harness、sandbox 和 context engineering 策略。

来源:https://www.anthropic.com/engineering/managed-agents

PODCASTS

今天没有新的播客条目。


Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders