AI Builders 每日摘要 · 2026-09-13

跟踪 Agent 产品发布、企业 AI 落地、plugin evals、AI Gateway 基础设施与 Agentic Finance 的最新信号。

This page is accessible in English navigation, but the full body has not been translated yet. The original Chinese content is kept below for accuracy.

一句话结论

今天的主线是:AI builder 生态正在同时补齐产品能力和生产约束。OpenAI 与 Anthropic 的团队在推进 Agents、skills 和 plugin evals,企业 AI 的成败则越来越取决于是否把 builder 嵌入真实业务、建立可解释的评估体系;另一边,Cursor 的 long-lived agents、Box 的 agent sandbox 文件能力、Vercel 的 AI Gateway 和 Coinbase 讨论的 Agentic Finance,都在把 Agent 从一次性对话推进到持续运行的基础设施。

X / Twitter

Thibault Sottiaux · Codex & ChatGPT @ OpenAI

Thibault Sottiaux 列出了本周由 Astra 驱动的一组发布:Images 2.5、GPT-Live-1、Agents API、Data Agent 和 ChatGPT for Financial Services,说明产品线正在从单一模型更新扩展到多种可直接进入工作流的 Agent 能力。

他还回应了 Astra 用户反馈,说明团队修复了部分旧模型 skills 触发过度或阻止模型检查自身工作的问题,关闭了可能导致提前停止或读取旧消息的 context management 实验,并移除了造成长尾质量下降的 engine。这个更新的重点不只是“模型变好”,而是把 skills、上下文管理和执行引擎都纳入持续的质量治理。

来源:

Peter Yang · Practical AI 教程与访谈作者

Peter Yang 对 software factory 保持怀疑:除了 verification 和 testing,他认为当前 AI 还很难在没有人定义需求、检查结果的情况下,自主完成产品或新功能。如果 Agent 在长时间运行中做出一个错误假设,后续工作可能只是持续消耗 token;因此,端到端自动化的关键仍然是人类提供方向和验证。

来源:https://x.com/petergyang/status/2098565668241334366

Madhu Guru · Meta AI 高级总监,前 Google Gemini、Veo、Nano Banana 负责人

Madhu Guru 总结企业 AI 项目常见的失败原因:沿用传统的中央 AI 团队和渐进式产品流程、低估 evals 的重要性,以及从组织外部打造脱离真实工作流的工具。她建议由真正做过 AI 产品的人负责,优先建立一等公民级别的 evals,并把最强的 AI builder 嵌入 finance、sales、support 等要被改造的业务函数中。

来源:https://x.com/realmadhuguru/status/2098448235048378456

Thariq · Claude Code @ Anthropic

Thariq 宣布 Claude plugin evals 可用,开发者可以在 plugin 文件夹中运行 claude plugin eval init,检查 skills 是否仍能适配新的模型版本。另一条信息提醒,eval 的 pass/fail 分数本身已经很难直接解释:有些失败来自过于严格的 hidden tests,模型答案可能比预设结果更合理。对 Agent 工具链来说,eval 需要同时检验行为质量和测试本身的有效性。

来源:

Amjad Masad · Replit CEO

Amjad Masad 宣布 Replit 收购了一家完全构建在 Replit 上的企业,并预计这会成为第一批类似案例中的一个。这个信号值得关注:AI builder 平台不只是在降低软件生产成本,也可能开始孕育、承载并最终收购由自身工具创建出来的业务。

来源:https://x.com/amasad/status/2098548464452055437

Guillermo Rauch · Vercel CEO

Guillermo Rauch 表示,Tailscale 的 model router 使用 Vercel AI Gateway 作为底层基础设施,并将 AI Gateway 比作新的 CDN:应用可以直接连接模型 origin,但自己处理路由、故障和成本会变得脆弱且昂贵。这个类比反映出模型路由层正在从可选封装变成 Agent 应用的基础设施层。

来源:https://x.com/rauchg/status/2098531157230969062

Aaron Levie · Box CEO

Aaron Levie 分享了 Box 可挂载到 agent sandbox 的能力,让 Agent 更容易在自己的计算环境中读写文件。随着 Agent 开始执行关键企业工作流,它需要的不只是聊天窗口,也需要接近人类已有的文件、权限和工作环境 primitives;企业 Agent 的竞争因此会继续向上下文接入和可控执行环境延伸。

来源:https://x.com/levie/status/2098478938003841123

Ryo Lu · Cursor、Notion、Stripe 设计师

Ryo Lu 宣布 Cursor 支持面向大型想法的 long-lived agents。这个变化把 Agent 从一次请求一次响应的工具,推进到能够围绕较大目标持续运行的工作单元;相应地,状态管理、进度可见性和人类介入时机都会成为产品设计的核心。

来源:https://x.com/ryolu_/status/2098324260867772806

Peter Steinberger · OpenClaw + OpenAI

Peter Steinberger 分享了 Astra 在 OpenClaw cloud session 中通过 CUA 玩 Doom 的演示,也提到自己为 trycua 提交了 Linux 下 key 可靠性修复。前者展示 computer use 从网页操作扩展到云端交互环境,后者则提醒 builder:真正影响可用性的,往往是输入事件、系统兼容性等底层细节,而不是单次 demo 是否成功。

来源:

Dan Shipper · Every CEO

Dan Shipper 介绍了 Every 正在把对模型的“vibe checks”变得更量化:团队为每个人搭建基于真实日常工作的 personal benchmarks,不再只看通用 benchmark 分数。这个方向很实用,因为更高的模型分数并不必然意味着更适合团队的真实工作;对企业来说,围绕自己的任务建立可重复的评估集,可能比追逐单一排行榜更有价值。

来源:https://x.com/danshipper/status/2098481799047647715

Zara Zhang · Builder

Zara Zhang 认为,“one-person company”被高估了。AI 确实让个人能做更多事,但构建新东西仍然需要一起头脑风暴、共同承受压力和庆祝进展的人;这也提醒 Agent 产品设计者,效率提升并不自动解决动机、协作和长期坚持的问题。

来源:https://x.com/zarazhangrui/status/2098483800456179923

OFFICIAL BLOGS

本期没有新的官方博客条目。

PODCASTS

No Priors · Coinbase’s Everything Exchange: Agentic Finance, Stablecoins, and Tokenization with CEO Brian Armstrong

**一句话结论:**Brian Armstrong 的核心判断是,Agent 一旦开始真正购买数据、调用服务和执行交易,就需要独立的账户、支付能力和可治理的金融基础设施,而传统银行卡并不适合大量几美分级别的 Agent 交易。

Armstrong 是 Coinbase 联合创始人兼 CEO,也是 New Limit 联合创始人。他提到,Agent commerce 中约 76% 的交易低于 30 美分,信用卡通常有约 30 美分的固定费用,因此“we don't want the AIs to be unbanked”。Coinbase 的方向包括面向人的 AI financial advisor、可以隔离资金的 agentic account,以及让 Agent 使用 self-custodial wallet 和 crypto rails 进行支付。

这套思路的关键不只是给 Agent 一张卡,而是让 Agent 能作为非人类参与者拥有 spend account,并通过 X402 等协议购买信息、调用工具或支付 AWS 资源。Armstrong 还观察到,许多低价交易其实是 Agent 获取 paywall 数据、金融信息或其他专用 Agent 的结果,未来可能会出现大量在单一任务上胜过 frontier model 的 specialist agents。对 builder 来说,价值链因此会从“一个模型回答所有问题”转向“多个有专长、能相互付费的 Agent 组成市场”。

来源:https://www.youtube.com/watch?v=uLDK4l_-gUE


Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders