AI Builders 每日摘要 · 2026-09-28

从 Gemini 音频应用、Claude Code 视频创作到扩散式 LLM 的推理效率,今天的 builder signals 聚焦 AI 产品如何把并行计算、可控性和真实工作流结合起来。

一句话结论

今天的有效信号集中在 AI 产品的“可用性”上:Peter Yang 用 Gemini audio API 做对话式日语学习应用,Thariq 回看 Claude Code 制作视频时从反复打磨到更快迭代的变化;Guillermo Rauch 提醒,AI 生成内容如果削弱了人对原理的理解,生产力提升可能会变成认知负担。更底层的方向上,Inception CEO Stefano Ermon 认为 diffusion-based LLM 的并行推理可能带来更好的速度与经济性。

X / Twitter

AI 教程与访谈创作者 Peter Yang

Peter Yang 正在用 Gemini audio API 做一款对话式日语学习应用:分成 10 节课,每节包含 10 个短语。这个例子展示了 audio API 的一个直接产品化方向:把模型能力嵌入有明确课程结构的练习流程,而不是只做一次性的语音问答。

来源:https://x.com/petergyang/status/2104059554204188833

Claude Code 工程师 Thariq

Thariq 回看自己大约一年前用 Claude Code 制作视频的经历:每个视频都需要长时间迭代,并逐项指出模型做错的细节。这个对比不只是“模型变强了”的感叹,也说明视频创作的关键瓶颈曾经是持续校正与细节反馈,而工具进步正在缩短这类迭代链路。

来源:https://x.com/trq212/status/2103897226154328502

Vercel CEO Guillermo Rauch

Guillermo Rauch 警告,低质量且未经验证的 AI 文本会让人因为长期疲于阅读 “slop” 而逐渐放弃理解。他引用一个把性能提升错误归因于编译器改动的案例,指出真正的原因其实是算法和数据结构变化;对 builder 来说,AI 的价值应当服务于理解、人的认知与创造力,而不是让未经核验的解释取代阅读和判断。

来源:https://x.com/rauchg/status/2103939888513274147

Y Combinator 总裁兼 CEO Garry Tan

Garry Tan 分享了他现在用来修复 bug 的工作方式:在生产问题上结合 Capy AI 与 GStack 的 /autoplan,并使用 GPT-6 medium reasoning。这里的重点是把 agent 放进真实生产故障的规划环节,而不是只让它生成孤立的代码片段。

来源:https://x.com/garrytan/status/2103989902476259702

Every CEO Dan Shipper

Dan Shipper 展示了一个由 Opus 5.5 完成的创作流程:他先把 Plato 的《Protagoras》改写成小说,再让模型把它制作成短片,并发布了前两幕。这是一个具体的多步创作案例,模型承担的角色从文字改写延伸到了视频表达,而不是单纯生成一段独立文本。

来源:https://x.com/danshipper/status/2103850415930708437

来源:https://x.com/danshipper/status/2103894152316645620

PODCASTS

No Priors:Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon

核心结论:Stefano Ermon 认为,diffusion-based LLM 的关键竞争力不只是模型质量,而是它在推理阶段能并行处理更多 token,从而改善速度、硬件利用率和单位成本。

Stefano Ermon 是 Stanford 教授、生成模型研究者,也是 Inception 联合创始人兼 CEO。他回顾了 diffusion 从图像生成走向文本和代码的路径:团队在 GPT-2 规模的实验中让 diffusion model 达到与 autoregressive model 相当的 perplexity,同时生成速度约快 10 倍。由此,Inception 希望把这条研究路线扩展为商业规模的 diffusion language model。

他的核心判断是,autoregressive model 在推理时仍然必须从左到右逐 token 生成,工作负载偏 memory-bound,也不太适合 GPU 的并行计算;diffusion model 则通过逐步去噪,同时处理多个 token,更接近训练时的并行形态。这不仅可能降低普通推理的延迟,也可能加速 reasoning 和 RL post-training 中大量 rollout 的生成。Ermon 的概括是:“the more parallel solution is the one that is eventually going to win.”

这条路线仍有现实代价:Inception 需要自建 serving engine、训练和 post-training stack,生态还不成熟;但他们把 API 做成 OpenAI-compatible 的 text in、text out,并强调 diffusion model 具有更强的可控性潜力。Ermon 也提醒,当前已知的优势主要是速度,未来是否能带来数据效率或新的能力,还需要规模化验证。

本期 feed 只提供了播客频道 URL,因此这里保留 JSON 中的原始频道链接,未猜测具体视频地址。

来源:https://www.youtube.com/@NoPriorsPodcast


Generated through the Follow Builders skill: https://github.com/zarazhangrui/follow-builders