Daily AI News
AI News|2026-09-16
今日目录
- Rauch:verifier 和 skills 正在变成新的框架
- Levie:agent 生成的信息量会是人工的 100 倍
- Anthropic 复盘 Claude Code 质量波动
- Vercel 招来 Cloud Run 创造者,要重做 agent 的计算原语
- Claude Code 团队聊构建过程:跟不上模型能力,以及怀念从前的软件工程
- Anthropic 谈 managed agents:把大脑和手拆开
- Levie:agent 用系统比人高 100 倍,企业安全治理是最大挑战
- Google 用 power user group 测 Gemini 早期功能
今日判断
今天最让我在意的一条,是 Guillermo Rauch 说的 verifiers + skills 会成为新的框架。这不是一句口号,我自己写 agent 的时候也踩过:给模型再多上下文,如果没有 type system、linter、编译报错这类硬反馈,它就是在猜。shadcn/lint 让 agent 守设计系统的规则,本质是把人类工程师的约束喂回去。谁先把 verifier 层做厚,谁的 agent 才敢放到生产里跑长任务。
另一条是 Anthropic 关于 Claude Code 质量波动的复盘,以及他们把 managed agents 的 brain 和 hands 拆开。这两件事连起来看,说明 coding agent 现在拼的不是模型分数,是 harness 和运维。模型能力在涨,但用户感知到的质量取决于容器、工具调度、上下文管理这些脏活。能做失败分析并公开的团队,通常离可用更近。
Aaron Levie 提的 agent 信息量是人工 100 倍,我认同方向,但真正的瓶颈不在 agent 能跑多少任务,而在安全治理和验证成本能不能跟上。如果不给 agent 做权限粒度和审计,企业根本不敢放它出去。所以今天的判断很简单:接下来一年,agent 产品的护城河会在 verifier 和治理层,不在 prompt。
快讯
1. Rauch:verifier 和 skills 正在变成新的框架
查看原文 · 来源:Guillermo Rauch (@rauchg)
Rauch 说 agent 的上限取决于你给它多少 proof-checker、编译器、类型系统和 linter,并举了 shadcn/lint 帮 agent 遵守设计系统规则的例子。他把 verifier 加 skills 称为新的框架。这条重要在于它把 agent 质量从模型能力问题重新定义成反馈回路问题:模型再强,缺少可执行的约束和验证,长任务就会漂移。我的判断是,接下来做 agent 的人会把相当多精力花在构建确定性检查层上,而不是继续堆 prompt。谁能把 verifier 做成可复用组件,谁就能让 agent 在真实代码库里稳定跑下去。
2. Levie:agent 生成的信息量会是人工的 100 倍
查看原文 · 来源:Aaron Levie (@levie)
Levie 认为 agent swarm、computer use、新一代 API 和 MCP,加上 Muse、Instinct 这类新形态,会让 agent 被扔向远超最初想象的任务量。他举例:24/7 帮你招募人才、监控客户业务信号决定何时推销、处理每一份 transcript 提取产品洞察。这条的价值在于它来自一个正在把 agent 接进企业数据层的产品负责人,不是空泛预测。我的判断是信息量 100 倍这个说法本身不重要,重要的是当 agent 并发跑在后台时,权限、审计和结果验证会变成新的瓶颈,这也是 Box 这类公司的机会。
3. Anthropic 复盘 Claude Code 质量波动
查看原文 · 来源:Anthropic Engineering
Anthropic 工程团队发布关于近期 Claude Code 质量反馈的复盘。具体细节从标题看指向一次线上问题,但价值不在事故本身,而在他们愿意公开讨论一个 coding agent 在真实使用中如何出现质量波动。做 agent 产品的人都知道,用户感知的质量往往不取决于模型跑分,而取决于容器、工具调用、上下文截断、重试策略这些工程细节。我的判断是,能让用户持续信任的 coding agent,背后一定有一套可观测、可回滚、能定位单次会话退化的运维体系。这份复盘可以当工作面材料读。
4. Vercel 招来 Cloud Run 创造者,要重做 agent 的计算原语
查看原文 · 来源:Guillermo Rauch (@rauchg)
Rauch 宣布 Cloud Run 创造者 Steren 加入 Vercel,领导 Functions、Containers、Sandbox、Builds 组成的 Fluid 计算产品家族。他给出的判断是 serverless 代表云计算的上一章,而 agent 是下一章,需要为它们重新设计计算原语。这条重要的地方在于它把 agent 从应用层拉回到 infra 层:长时任务、沙箱执行、并发调度、状态恢复,这些不是现有 serverless 模型天然能覆盖的。我的判断是,agent 真正大规模部署后,会催生一批专门为它设计的运行时和隔离层,Vercel 现在是在抢这个位置。
5. Claude Code 团队聊构建过程:跟不上模型能力,以及怀念从前的软件工程
查看原文 · 来源:Thariq (@trq212)
Thariq 说他和 Sid、Robert 聊了构建 Claude Code 的过程,包括变化有多大、跟上模型能力有多难,以及他们怀念 AI 之前的软件工程哪些部分。这条没有给出完整技术细节,但价值在于它来自 Claude Code 团队内部视角:一个 coding agent 产品的迭代节奏正在被模型能力推着走。我的判断是,做 coding tool 的人现在普遍面临同一个问题,就是底层模型每几周就变一次,产品设计和工程架构很难稳定下来。这种怀念其实反映的是控制感在流失,值得留意他们后续会不会公开更多架构取舍。
6. Anthropic 谈 managed agents:把大脑和手拆开
查看原文 · 来源:Anthropic Engineering
Anthropic 工程博客讨论如何扩展 managed agents,核心是把 brain 和 hands 解耦。也就是说推理决策层和执行工具层分开,各自独立扩展和替换。这个思路对正在做 agent infra 的人很实用:如果模型和执行环境耦合在一起,换模型、加工具、隔离故障都会变难。我的判断是,未来 agent 框架的竞争会集中在解耦粒度和调度效率上,谁能把大脑做薄、把手做稳,谁的系统就更可运维。这篇值得当作架构参考读。
7. Levie:agent 用系统比人高 100 倍,企业安全治理是最大挑战
查看原文 · 来源:Aaron Levie (@levie)
Levie 说在 agent 使用系统频率是人的 100 倍的世界里,保护企业数据会是本世纪最复杂的安全治理挑战之一。他指出安全性和生产力在 AI 时代是绑定的:给 agent 过度访问权就难以控制数据,全部锁死又拿不到生产力。Box 的做法是在 Box Shield 里加入对 agent 使用信息的细粒度控制。这条重要的地方在于它把 agent 落地的真实阻力讲清楚了,不是模型不行,是权限和审计没跟上。我的判断是,谁能把 agent 权限做到接近 IAM 的精细度,谁就能拿下企业单子。
8. Google 用 power user group 测 Gemini 早期功能
查看原文 · 来源:Josh Woodward (@joshwoodward)
Google 的 Josh Woodward 说两个月前启动了 Gemini power user group 来测试 app 早期功能,已经测了 20 多个功能,新一批用户会提前拿到 Daily Brief 和 Personal Intelligence 的访问权。这条的价值不在功能列表,而在于它透露 Google 在用高密度用户反馈来压缩功能迭代周期。我的判断是,模型厂商的竞争正在从发布能力转向产品反馈速度,谁能把早期用户拉进 loop 更快调产品,谁就更可能在日常使用场景里留住人。对做 AI 产品的人来说,这种 beta group 机制本身值得抄。
Daily AI News
Subscribe to AI News
Daily AI signal for builders: tools, agents, models, infra, product shifts, and the links behind each event.
No spam. Every issue links back to the original sources.
