Daily AI News
AI News|2026-07-26
今日目录
- Opus 5 把提示词注入风险压到接近 0
- Claude Code 把系统提示词砍掉约 80%
- Every 测到 Opus 5 先断兼容,再在重写技能后变好
- Box 用真实企业文档任务测到 Opus 5 的明显提升
- DoorDash 复盘 agentic commerce:语音没成,自然语言对话先跑通
今日判断
我今天更关注的不是又一个更强模型,而是 builder 开始公开讲清楚:模型一旦变了,原来那套 prompt、skill、插件和防线会一起失效。Claude Opus 5 这波里,最有用的信息不是发布页,而是几位一线使用者和产品负责人都在说同一件事:系统提示词可以大幅变短,旧工作流会断兼容,安全性开始从外围规则转向模型本身。这对做 agent 和 coding tool 的人很实际,意味着你不能再把 prompt 当配置文件长期固化,得把它当版本化接口,跟模型一起回归测试。
我看下来,另一个更重要的信号是 eval 正在回到真实任务。Box 讲的是尽调、生命科学、复杂文档处理;DoorDash 讲的是从语音预判转到自然语言购物对话;这些都不是抽象 AGI 讨论,而是具体工作流哪里通、哪里不通。我的判断是,接下来两三个月最值钱的团队,不是喊全自动的人,而是能把真实流程拆成可测环节,快速重写技能层、记忆层和安全层的人。模型还会继续变,但真正形成壁垒的,是谁能把这种变化吞进去,而不是被它打断。
快讯
1. Opus 5 把提示词注入风险压到接近 0
查看原文 · 来源:Boris Cherny (@bcherny)
Boris 透露,Opus 5 在提示词注入上的抵抗力明显增强,而且不是单点优化:模型对齐、注入探针和 Claude Code 的 Auto Mode 叠加后,攻击成功率可以降到接近 0。这个信息比常规能力榜单更重要,因为很多 agent 真正卡住的不是会不会写代码,而是能不能在读文件、跑工具、接外部上下文时不被带偏。我的判断是,这说明前沿模型开始把安全性做进模型行为本身,做企业 agent 的团队可以少堆一些脆弱外层规则,但前提是要重新验证自己的工具调用链和沙箱边界。
2. Claude Code 把系统提示词砍掉约 80%
查看原文 · 来源:Thariq (@trq212)
Thariq 说,针对最新模型,Claude Code 直接删掉了大约 80% 的系统提示词,并开始重新理解 system prompts、skills 和 Claude.md 该怎么写。这里真正的新信息不是删了多少字,而是模型能力上来后,原来依赖长系统提示词维持行为的一整套做法正在失效。对做 coding agent 的人,这意味着 prompt 不再只是往上堆约束,而要把更多意图移到更稳定的技能接口、文件约定和环境反馈里。我的判断是,未来好用的 agent 会更像薄控制层加强环境设计,而不是厚 prompt 编排。
3. Every 测到 Opus 5 先断兼容,再在重写技能后变好
查看原文 · 来源:Dan Shipper (@danshipper)
Dan Shipper 分享了 Every 团队一周内对 Opus 5 的实测:它一开始会顶嘴、提前停、和现有 skills 与插件不兼容,尤其会破坏之前为老模型调出来的工作流;但他们把旧技能删掉重做后,表现又明显改善。这个反馈很有价值,因为它说明模型升级不是单纯替换 API 名字,而是会改变 agent 的行为协议。我的判断是,接下来做 AI 产品的人要像维护数据库迁移一样维护 prompt 和 skill 迁移,凡是绑定旧模型习性的 workflow,都得做版本隔离和回归测试。
4. Box 用真实企业文档任务测到 Opus 5 的明显提升
查看原文 · 来源:Aaron Levie (@levie)
Aaron Levie 说,Box 用自家的 Complex Work Eval 测试 Opus 5,在尽调、生命科学目标识别等复杂企业文档任务上都有明显提升,比如尽调任务提升 17%,生命科学任务提升 30%。这类数据比通用 benchmark 更值得看,因为它反映的是模型在长流程、多文档、非结构化数据里的稳定度,而这正是企业 agent 真正要交付的部分。我的判断是,模型进步已经开始穿透到高价值垂直流程里,但前提仍然是你手上有自己的任务集和评测方法,不能只看公开榜单。
5. DoorDash 复盘 agentic commerce:语音没成,自然语言对话先跑通
查看原文 · 来源:No Priors
DoorDash 两位联合创始人在访谈里回顾了他们做 agentic commerce 的路径:一开始押注语音,但没有真正跑起来,后来转向自然语言对话式搜索和购物体验,用户反而更容易把模糊需求转成可执行操作,尤其在餐厅发现和杂货任务上效果更明显。这个复盘有价值,因为它不是讲愿景,而是讲一个大平台如何根据用户行为修正交互层。我的判断是,消费级 agent 现在最该做的不是追求全模态炫技,而是先找到用户愿意连续使用、并能稳定完成交易的输入方式。
Daily AI News
Subscribe to AI News
Daily AI signal for builders: tools, agents, models, infra, product shifts, and the links behind each event.
No spam. Every issue links back to the original sources.
