Daily AI News
AI News|2026-09-12
今日目录
- Boris Cherny:Claude 写的生产代码,标准要高于人类写的
- OpenAI 把 ChatGPT Work 底下的按需 agent 基础设施开放成 API
- Vercel:每天千万次部署,agent 流量逼着他们把元数据同步做快 91%
- Madhu Guru:评测 agent 要看步骤,不只看答案
- Aaron Levie:跑了一圈企业,看到 agent 落地的真实温差
- Boris Cherny:双用途能力与安全,越强的模型越需要监控
- Richard Socher:能模拟的东西都会被 AI 解决
今日判断
今天最值得看的不是模型又强了多少,而是几个一线 builder 在回答同一个问题:当 agent 开始大量产出代码和部署时,工程底线该放在哪。Boris Cherny 把 Anthropic 内部的做法摊开了,一次性代码可以当黑盒扔,但生产代码的标准要高于人类写的,靠 lint、测试、Claude 驱动的端到端测试、fuzzer、自动 code review 和安全审查来兜。这对我有直接帮助,因为它把’信任 agent’拆成了可执行的动作,而不是态度问题。
另一个信号是 agent 的规模化本身变成了基础设施问题。Thibault 把 ChatGPT Work 底下那套按需伸缩的 agent 基础设施直接包成 API,一小时内能跑起来;Guillermo 那边则说 Vercel 每天约一千万次部署里有越来越多来自 agent,他们为此把全局元数据同步做快了 91%,p99 也压下来。两条放一起看,结论很清楚:agent 的瓶颈正在从模型能力挪到调度、部署和元数据一致性这些传统 infra 活上。
我自己接下来更关注 evals 的做法。Madhu Guru 说别只看最终答案,要看步骤,同样的 42 可能来自 4 次干净的工具调用,也可能来自 17 次、重复搜索三次、踩两个坑才凑出来。这个区分会直接改变我怎么写评测和怎么读评测。企业侧的观察来自 Aaron Levie,他跑了一圈银行、保险、媒体和咨询,看到的是多模型并存、安全焦虑、以及把 agent 接进真实工作流的谨慎尝试,这跟硅谷内部的兴奋感有明显温差,值得记下来。
快讯
1. Boris Cherny:Claude 写的生产代码,标准要高于人类写的
查看原文 · 来源:Boris Cherny (@bcherny)
Boris 回应了一个具体疑问:Claude 写的代码该不该和人类写的区别对待。他的答案是分两种情况。原型和用完即弃的代码可以当完全黑盒,反正要扔、炸了影响也小,不需要完美。但生产代码里,Claude 写的东西标准应该比人类写的更高。Anthropic 内部为此堆了大量护栏:很多 lint 规则、大量测试、Claude 驱动的端到端测试、每天跑的 Claude fuzzer、自动 code review 和安全审查、自动重构等。没有这些,后期会变成难维护的烂摊子。他的判断是好消息在于模型让这些事变容易了,跑几个每日例行、用 Claude Code Review 就能维持,而工程师的职责就是守住代码质量这条线。这条对正在把 coding agent 放进生产流程的团队有直接参考价值。
2. OpenAI 把 ChatGPT Work 底下的按需 agent 基础设施开放成 API
查看原文 · 来源:Thibault Sottiaux (@thsottiaux)
Thibault 说他们把按需伸缩的 agent 能力做成了 API,基本上就是 ChatGPT Work 在底层跑的那套基础设施,包好后声称一小时内能上手。这条的信息量在于,agent 的规模化运行正在被当成一种可采购的基础设施,而不是每个团队自己拼调度、沙箱、并发和资源管理。对 builder 来说,这意味着不用从零搭 agent 运行时,可以把精力放在任务定义、工具接口和评测上。我的判断是,这类 API 会加速 agent 产品的同质化,真正的差异会往后挪到工作流设计和数据接入上。
3. Vercel:每天千万次部署,agent 流量逼着他们把元数据同步做快 91%
查看原文 · 来源:Guillermo Rauch (@rauchg)
Guillermo 给了一组具体数字:Vercel 每天约一千万次部署,累计 23.5 亿次,是世界上最重的多租户系统之一,数十亿应用在任何时刻都可在 CDN 上路由。支撑它的是一个全球元数据存储,回滚、改配置、加路由这类操作要在全球几百毫秒内同步。他们把 p99 性能提升了 91%,顺带加快了 build 到 deploy 的流水线,而且整个过程是在 agentic 部署增长带来的巨大压力下做的。他指出压力来自 agent 驱动的部署增长,并附了 CDN 工程团队的内部细节文章。这是把 agent 兴起落到具体 infra 数字上的例子。
4. Madhu Guru:评测 agent 要看步骤,不只看答案
查看原文 · 来源:Madhu Guru (@realmadhuguru)
Madhu 的评测系列第十篇讲一个很实际的问题:只看最终结果不够。他打了个比方,高中数学里光答案对不行,步骤同样关键。两条 agent 轨迹可能都得出 42,但一条搜对了来源、取对了文档、只做 4 次干净的工具调用就算出来,另一条做了 17 次调用、同一个东西搜了三遍、从两个错误里恢复才勉强到终点。哪个更好一目了然。他的做法是:先把整个工作流定义清楚,再定义每一步的任务,然后想清楚每一步怎么测,是独立评测还是大评测里的一个切片,最后定义中位难度和困难任务并反映进评测集。看结果时,先看步骤,再看最终答案。
5. Aaron Levie:跑了一圈企业,看到 agent 落地的真实温差
查看原文 · 来源:Aaron Levie (@levie)
Levie 说这周见了银行、媒体、信息服务、保险和咨询行业的几十位技术负责人,聊企业里的 agent。几个大趋势:安全是头号焦虑,AI 带来的漏洞增长让所有人紧张,OpenAI 与 Hugging Face 那起事件的后续影响也在讨论中,企业的态度不像硅谷那样存在主义,但非常务实,关心在自己的环境里怎么操作。模型之争继续,多数公司同时部署多个前沿模型,很难标准化,因为团队和用例偏好不同,但预算仍在集中。他还提到 AI 带来的新发现很多,企业很难跟上需要执行的所有变化。这条的价值在于它给出了 agent 落地时企业侧的真实约束,而不是实验室里的乐观。
6. Boris Cherny:双用途能力与安全,越强的模型越需要监控
查看原文 · 来源:Boris Cherny (@bcherny)
Boris 推荐了最新的威胁情报报告,说读起来非常吓人也非常重要。他指出模型越智能,如果没有正确的防护和监控就越危险。很多能力是双用途的:会写代码的模型也能被用来攻击关键基础设施,能帮生物研究的模型也可能被用来制造下一场大流行。他强调这些问题复杂、棘手,而且越来越需要让所有人都理解,好让世界能参与进来,回应快速升级的风险。这条对做 agent 和工具链的人是一个具体提醒:能力开放和监控要同步设计,不能等出事再补。
7. Richard Socher:能模拟的东西都会被 AI 解决
查看原文 · 来源:The MAD Podcast with Matt Turck
Matt Turck 与 Richard Socher 聊递归自我改进,Socher 刚为 Recursive 融了 6.5 亿美元,并出了新书 The Eureka Machine。他在对话里给出一个具体命题:任何你能模拟的东西,AI 都会解决,进而进入递归自我改进循环,他认为这会是一个巨大的解锁。他还讨论了科学进步为何放缓、人类知识的迷宫、LLM 如何学生物和蛋白质、把下一 token 预测当作世界模型、模拟与验证器如何通向超人 AI,以及幻觉为什么反而可能驱动发现。对做 agent 和工具的人来说,值得关注的是他关于验证器和模拟环境的部分,因为它们正是当前 agent 能力提升的实际抓手。
Daily AI News
Subscribe to AI News
Daily AI signal for builders: tools, agents, models, infra, product shifts, and the links behind each event.
No spam. Every issue links back to the original sources.
