AI Builders 每日摘要 · 2026-09-25

Agent 的下一阶段正在从单体工作环境走向可拆分的 brain、hands 与 files;与此同时,形式化方法、containment、Managed Agents 和面向 agent 的商业入口开始成为产品基础设施。

一句话结论

今天最值得关注的主线是:agent 正在从“一个模型加一台电脑”演化为可拆分、可恢复、可审计的系统。Anthropic 把这种方向落到了形式化 bug-finding、产品 containment 和 Managed Agents;Vercel 的 Guillermo Rauch 则从工程架构角度把 agent 拆成 brain、hands 和 files。另一条产品信号是,模型与 harness 的能力差异正在变得同样重要,真正的竞争点越来越集中在工作流、工具、记忆和安全边界。

X / Twitter

Claude Code 工程师 Boris Cherny

Boris Cherny 进一步解释了 Claude 使用 formal methods 的方式:先针对棘手的 state machine 或容易出现 race condition 的部分建立模型,再寻找 counter-example、复现疑似 bug,最后修复代码。重点不是“整个代码库已经被形式化验证”,而是把建模、反例和修复接入日常工程流程,优先处理最难靠人工发现的问题。

他还分享了 Claude 与 Desktop app 性能提升背后的工程经验,并把相关优化整理成面向工程师的文章。对团队而言,这说明 agent 的价值不只在生成新代码,也在于系统性地定位并修复长期存在的性能瓶颈。

来源:https://x.com/bcherny/status/2102898067133595992

来源:https://x.com/bcherny/status/2102854267782705648

OpenAI Codex 与 ChatGPT 工程师 Thibault Sottiaux

Thibault Sottiaux 预告下周 DevDay 将带来一批会改变工作方式的更新,并表示 Astra 让团队在很短时间内完成了更大胆的尝试。更具体的产品信号是,他已经把 ChatGPT voice 用在工作讨论、邮件、编码和日历管理上,而且这些能力可以跨越包含第三方插件在内的完整插件生态。

这指向一个重要变化:AI 助手的竞争不再只是回答质量,而是能否把语音、工具调用、代码和日常工作系统连成一个连续的操作面。

来源:https://x.com/thsottiaux/status/2102996313780736363

来源:https://x.com/thsottiaux/status/2102814202117411196

AI 教程与访谈作者 Peter Yang

Peter Yang 认为,当前一个实验室拥有最好的模型,另一个实验室拥有最好的 harness;如果模型能力继续提升,Claude Code 这类 harness 还需要补上高质量的 live voice、browser 和 computer use。他对 Opus 5.5 的评价集中在速度、写作、对话体验和 rate limits,而不是单一 benchmark 分数。

这个判断提醒产品团队:模型本身和模型被组织、被调用、被接入工具的方式,正在成为两条可以分别领先的竞争曲线。

来源:https://x.com/petergyang/status/2102952201350254667

来源:https://x.com/petergyang/status/2102946952740741394

Meta AI 高级总监 Madhu Guru

Madhu Guru 反驳了“消费者只想让 agent 替自己完成所有事情”的单一叙事:浏览服装可能是娱乐,但找屋顶维修商、比较评价、联系服务商、协调保险和预约检查,往往是用户希望尽量少操心的摩擦。对同一个“做事情”的过程,消费者可能一会儿想探索,一会儿只想尽快得到正确结果。

因此,agent 产品的关键不是一味追求更多自动化,而是判断哪些任务应该保留探索感,哪些任务应该被压缩为几乎零摩擦的执行链路。

来源:https://x.com/realmadhuguru/status/2102777931764498536

Claude Code 工程师 Thariq

Thariq 分享了一种更可复用的 Claude 内容形式:用较长的 prompt、skills、examples 和 API keys,把具体工作方法拆出来,让读者能够复制,而不是只展示“Claude one-shot this”的结果。这个方向的价值在于把 prompt 从一次性技巧变成可以复盘、迭代和迁移的工作资产。

对使用 agent 的团队来说,真正可积累的不是某次漂亮 demo,而是能被其他人重跑的上下文、工具组合和操作步骤。

来源:https://x.com/trq212/status/2102870353781641416

来源:https://x.com/trq212/status/2102857025206255902

Vercel CEO Guillermo Rauch

Guillermo Rauch 把成功的 agent 拆成三个部分:brain 是模型和 harness,hands 是工具、电脑和浏览器,files 是 memory、skills 和 repos。把它们全部放进一台 stateful computer 是最容易启动的方式,但在云端运行时,拆分这些组件可以让 harness、浏览器、执行环境和存储分别扩展、恢复和审计。

他还宣布为 Sandbox 配套推出 Drives,把可独立读写的外部存储作为 agent 的“硬盘”。这类拆分不仅有成本收益,也会改善安全边界:凭证、执行环境、工作流状态和长期记忆不必再共享同一个进程。

来源:https://x.com/rauchg/status/2102820148629614685

Box CEO Aaron Levie

Aaron Levie 认为 AI 降低创作门槛后,电影和其他创意内容会获得更多制作机会,而不是简单地减少创作者的位置。技术变化会扩大媒介边界,但创意能力与 taste 仍然重要,只是更多人可以借助新工具把这些能力转化为作品。

这个判断把“AI 是否替代创意工作”的问题换成了更有用的产品问题:工具是否让更多人能够承担风险、尝试新的叙事形式,并把审美判断真正落到作品里。

来源:https://x.com/levie/status/2102934874470617303

Y Combinator 总裁兼 CEO Garry Tan

Garry Tan 提出,创业公司获客正在同时出现两条趋势:让 software agents 想要你的产品,以及使用 agents 让人想要 software。前者要求产品具备清晰、可被 agent 理解和调用的价值表达;后者则是用 agent 改善营销、销售和产品触达。

这意味着面向 agent 的产品分发不只是增加一个 API,而是要重新思考产品如何被发现、评估和推荐。

来源:https://x.com/garrytan/status/2102955139875397806

SPC General Partner Aditya Agarwal

Aditya Agarwal 认为,判断团队质量时,团队一起工作的时间可能比单纯的人数更有信息量。一个已经协作三年以上的团队,往往比刚组建的同规模团队拥有更高 throughput 和更强韧性;他把 team longevity 视作比 team size 更值得关注的指标。

在 agent 加速软件生产的背景下,这个观点仍然成立:自动化可以提高个人和团队的执行速度,但长期协作形成的上下文、信任和判断力,依然是系统产出的一部分。

来源:https://x.com/adityaag/status/2102782451643040074

Claude

Claude Marketplace 现在支持发现 connectors、plugins、agents 和 expert partners,示例包括 Slack、Notion、Cursor、CrowdStrike 以及服务合作伙伴。对 Claude 生态而言,这把“模型能做什么”进一步扩展成“用户可以直接接入哪些工具和服务”。

这也是 agent 产品逐渐平台化的信号:工具目录、服务伙伴和可组合能力,会成为用户选择工作流的重要入口。

来源:https://x.com/claudeai/status/2102840851538080172

OFFICIAL BLOGS

Anthropic Engineering:How we contain Claude across products

Anthropic 把 agent 风险拆成三个来源:用户误用、模型误行为和外部攻击。文章的核心工程问题不是让失败概率变成零,而是限制一次失败可以造成的损害,也就是控制 agent 的 blast radius。Anthropic 发现,逐次请求权限并不能完全解决问题:用户大约批准了 93% 的 permission prompts,提示过多会带来 approval fatigue,因此产品开始把更多工作转向 containment,包括 sandbox、VM、文件系统边界和 egress controls。

这套方法对其他 agent 产品同样适用:模型训练负责降低错误概率,环境和权限边界负责限制错误后果,两者不能互相替代。文章的关键表述是:“The engineering question becomes how to cap the blast radius.”

来源:https://www.anthropic.com/engineering/how-we-contain-claude

Anthropic Engineering:An update on recent Claude Code quality reports

Anthropic 对近期 Claude Code 质量下降报告进行了复盘,确认问题来自三个独立变化:默认 reasoning effort 调整、清理闲置 session thinking 的实现 bug,以及为降低 verbosity 而加入的 system prompt 变化。它们分别影响延迟与智能程度、上下文记忆,以及编码质量;API 和 inference layer 本身没有受到影响,相关问题已在 2026 年 4 月 20 日的 v2.1.116 前后修复。

这次复盘的工程价值在于,它把“模型变差了”的主观体验拆成了产品层、上下文管理层和 prompt 层的具体回归,并强调扩大真实用户构建、按模型进行 eval、对 system prompt 做更严格的 ablation 与渐进发布。

来源:https://www.anthropic.com/engineering/april-23-postmortem

Anthropic Engineering:Scaling Managed Agents: Decoupling the brain from the hands

Managed Agents 的设计把 agent 拆成 session、harness 和 sandbox:session 是持久化事件日志,harness 负责调用 Claude 并路由工具,sandbox 则负责执行代码和编辑文件。这样做的直接收益是,harness 或容器崩溃时可以从 session 恢复,不需要把整个 agent 当成一个不可替换的“pet”;凭证也可以留在 sandbox 之外,降低 prompt injection 直接读取环境变量的风险。

Anthropic 还报告了性能收益:把 brain 与 hands 解耦后,p50 TTFT 下降约 60%,p95 下降超过 90%。更重要的是,session 成为 context object,未来可以在不改变持久化接口的情况下替换 harness、sandbox 和 context engineering 策略。

来源:https://www.anthropic.com/engineering/managed-agents

PODCASTS

今天没有新的播客条目。


Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders