AI Builders 每日摘要 · 2026-09-12

跟踪 Agent 安全与代码质量、工作流级 eval、可扩展基础设施、企业流程落地,以及 AI 驱动科学发现的最新观点。

一句话结论

今天的信号是:AI Agent 的竞争正在从“能不能完成任务”转向“能否可靠地完成任务”。安全监控、代码质量、工作流级 eval、可扩展的 Agent 基础设施和企业流程改造成为落地的核心;与此同时,AI 用于科学发现的路径开始从模型预测延伸到模拟、机器人实验和递归改进。

X / Twitter

Boris Cherny · Claude Code @ Anthropic

Boris Cherny 提醒,随着模型能力增强,双重用途风险也在上升:能写好代码的模型可能被用于攻击关键基础设施,能辅助生物研究的模型也可能被滥用于制造新的流行病。对团队来说,重点不只是讨论抽象的风险,而是持续增加 safeguards 和 monitoring,让社会能够理解并应对快速升级的能力。

来源:https://x.com/bcherny/status/2098281805770309686

他还给出了 AI 编写代码时的质量分层:原型和低影响的 throw-away code 可以接受黑盒处理,但生产代码应达到比人工编写更高的标准。具体做法包括 lint、测试、Claude 驱动的端到端测试、fuzzer、自动代码审查和安全审查;如果质量不够,应提高模型、effort,或通过 CLAUDE.md 和 skills 补足代码库上下文。模型降低了做好这些工作的成本,但不会替团队取消质量责任。

来源:https://x.com/bcherny/status/2098217573276131577

Thibault Sottiaux · Codex & ChatGPT @ OpenAI

Thibault Sottiaux 分享了可按需扩展的 Agent 基础设施:这套能力支撑 ChatGPT Work,并被封装成可以在不到一分钟内开始使用的 API。它释放出的产品信号是,Agent 不再只是一次对话中的临时调用,而是需要由底层系统负责调度和扩容的工作单元。

来源:https://x.com/thsottiaux/status/2098238138334548260

由于 Astra 的 $200 Pro 订阅最消耗系统资源,团队决定暂停新订阅,以保障现有用户继续使用;其他套餐和 API 不受影响。这个决定说明,当 Agent 产品需求快速增长时,容量治理和服务质量会直接反映在商业策略上。

来源:https://x.com/thsottiaux/status/2098113585683808624

Madhu Guru · Meta AI 高级总监,前 Google Gemini、Veo、Nano Banana 负责人

Madhu Guru 认为,Agent eval 不能只看最后答案是否正确,还要检查完成答案的路径:一个 Agent 可能只搜索正确来源、检索正确文档、完成 4 次干净的工具调用;另一个 Agent 可能重复搜索 3 次、调用 17 次工具并从两次错误中恢复,最后得到同样的答案。实践上,应先定义完整 workflow 和每一步任务,再分别衡量中位任务与困难任务,查看结果时先研究步骤、再看最终结果。

来源:https://x.com/realmadhuguru/status/2098064969464217720

Thariq · Claude Code @ Anthropic,前 YC W20、SPC、Media Lab

Thariq 分享了一个让 Claude 更了解用户的做法:让 Claude 通过自由文本或 askuserquestion 深入采访用户,补齐尚未掌握的背景,并将相关信息保存到 memory。对 Agent 产品而言,这是一种把“个性化”从一次性 prompt 移向持续用户上下文的工作流设计。

来源:https://x.com/trq212/status/2098157600361861579

Amjad Masad · Replit CEO

Amjad Masad 区分了 AI 的现实风险与最极端的叙事:他确实担心 cybersecurity,但认为“extinction risk”并不是一个接近现实的判断。这个观点把注意力拉回更具体、可操作的安全问题,例如漏洞、权限和攻击面,而不是只围绕最宏大的结论争论。

来源:https://x.com/amasad/status/2098171265924116732

Guillermo Rauch · Vercel CEO

Guillermo Rauch 表示,Vercel 每天约有 1,000 万次部署,累计部署达到 23.5 亿次;其全球 metadata store 能在数百毫秒内同步回滚、配置和路由变化。团队将这一系统的 p99 性能提升了 91%,同时加快 build 到 deploy 的链路。Agent 化部署增长后,部署平台的关键竞争力不只是模型接入,还包括多租户路由、全球状态同步、容量和延迟治理。

来源:https://x.com/rauchg/status/2098091056302833837

Aaron Levie · Box CEO

Aaron Levie 总结了企业采用 Agent 时最常见的几组现实约束:企业担心 AI 带来的漏洞,往往同时部署多个 frontier models,开始面对 Agent identity 和权限管理问题;真正的 ROI 来自重构工作流,而不是在旧流程上简单叠加 Agent。与此同时,eval 仍处于早期,legacy systems 和碎片化数据继续拖慢落地。对企业团队来说,嵌入业务部门的 FDE、持续调整架构和清理旧系统,可能比单纯选择一个模型更重要。

来源:https://x.com/levie/status/2098218284139311615

他还宣布 Box 将与 OpenAI 更深度合作,让用户可以在 ChatGPT 中安全处理企业内容,并将这一方向概括为 software 走向 headless,Agent 将在不同位置处理数据并执行工作流。

来源:https://x.com/levie/status/2098135659714085281

Nikunj Kothari · FPV Ventures 合伙人,前 Meter、Opendoor、Atlassian 早期员工

Nikunj Kothari 描述了一种低摩擦的写作工作流:通勤时录 voice memo,白天继续补充,两个会议之间用 30 分钟快速写完,简单通读后发布。他指出,AI 工具若能把语音转录做得更可靠,个人从想法到发布的链路还会进一步缩短。这是一个具体的 Agent 机会:减少捕捉、整理和发布之间的切换成本,而不只是生成一篇看起来完整的文章。

来源:https://x.com/nikunj/status/2098255116751257663

他还用三个夸张的市场观察描述当前早期融资:人人都想融到 5,000 万美元 seed,人人都预计明年做到 3,000 万美元 ARR,热门的 tranched seed round 最后往往神奇地落在约 3 亿美元估值。即使带有讽刺意味,这条信息仍指向一个值得警惕的信号:融资叙事、增长预期和估值正在被快速抬高。

来源:https://x.com/nikunj/status/2098078391065018816

Peter Steinberger · OpenClaw + OpenAI

Peter Steinberger 认为,在 AI 辅助开发中,复制逻辑已经不再痛苦,但 abstractions 仍然困难。这个判断提示工程团队重新审视抽象的价值:当生成和重复实现变得便宜时,真正稀缺的可能是稳定的边界、清晰的模型和长期可维护性,而不是少写几行代码。

来源:https://x.com/steipete/status/2098089196800098798

Aditya Agarwal · SPC General Partner,Bevel Health 联合创始人,前 Dropbox CTO

Aditya Agarwal 提出了一个资源配置问题:如果有一台机器只能用于寻找最紧迫疾病的治疗方法,社会愿意把多少 GDP 投入其中?他的答案是“非常高”。这条观点的价值不在于给出具体比例,而在于指出,一旦 AI 能稳定推进疾病治疗,算力、数据和实验资源的分配将成为宏观层面的选择,而不只是单个公司的产品决策。

来源:https://x.com/adityaag/status/2098112281267843264

OFFICIAL BLOGS

本期没有新的官方博客条目。

PODCASTS

The MAD Podcast with Matt Turck · When AI Improves Itself | Richard Socher (Recursive)

**一句话结论:**Richard Socher 的核心判断是,AI 的下一个科学突破不只来自更大的语言模型,而来自把人类知识、测量数据、模拟和机器人实验连接成可以持续验证与改进的系统。

Socher 认为,科学已经从相对集中的知识体系变成了被 34,000 多种期刊和大量专业术语切碎的“知识迷宫”。AI 的价值,是像 calculus 帮助物理学一样,把生物学、化学、医学和其他领域中已经理解的局部重新组合起来。next-token prediction 看似只是预测序列中的下一个 token,但在足够大的领域数据上训练后,也可能学到地理、蛋白质结构或分子之间的关联;模型还可以通过生成此前不存在的蛋白质或研究假设,探索人类难以手工遍历的组合空间。

他给出的边界也很具体:凡是能被快速模拟或验证的领域,AI 都更容易通过大量试验获得超人能力。更复杂的自然科学则需要四根支柱:吸收人类知识的 LLM、持续增加的测量数据、能够运行反事实实验的 simulation,以及用机器人收集数据并验证结果的实验流程。最终,这些系统由 agent swarm 并行探索,再把不同路径上的发现重新组合。

Recursive 计划先用 AI 研究 AI,目标是自动化研究想法的提出、实现和验证,再逐步进入物理、化学和生物学。Socher 直言 compute 是最大约束,并提到公司筹集约 6.5 亿美元、其中约 4.1 亿美元承诺用于单一 compute deal。短期内,biology 仍缺少足够训练数据;更接近现实的路线是通过 organoid、gene perturbation 和机器人实验逐步构建有用的 virtual cell。他用一句话概括这条路线:“Anything you can simulate, AI will solve.”

来源:https://www.youtube.com/@DataDrivenNYC/videos


Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders