1610 字
8 分钟

每日简报|2026-07-25

同步自 ChatGPT Project「每日晨读」历史归档。

今天的主线是:Claude Opus 5 发布后,模型竞争进一步转向“完成复杂任务的综合成本”;同时,长任务 Agent 的运行时、工具权限和商业落地方式正在逐渐成熟。

1. Anthropic 发布 Claude Opus 5,并进入 GitHub Copilot#

Anthropic 于 7 月 24 日发布 Claude Opus 5,API 型号为 claude-opus-5,价格维持在每百万输入 Token 5 美元、输出 Token 25 美元。它强化了多步骤编码、调试、代码审查和执行后自我验证;另有约 2.5 倍速度、2 倍价格的 Fast 模式。相关性能数据来自厂商评测,仍需用真实项目验证。Anthropic 官方介绍

GitHub 同日开始向 Copilot Pro+、Max、Business 和 Enterprise 用户逐步开放 Opus 5,覆盖 IDE、CLI、云端 Agent 和 GitHub 网页。GitHub 官方公告

为什么重要: 高端模型正在从“偶尔处理难题”变成可以日常使用的工程模型,评价指标也应从单次 Token 价格转向“完成一个任务需要多少次返工”。

建议: 从真实仓库挑三个任务对比 Opus 5、Gemini Flash 和现有模型:

  • 跨文件重构
  • 线上 Bug 根因分析
  • UI 修改并验证回归

记录首次测试通过率、人工修改时间和最终费用。Fast 模式只用于交互式调试,后台任务优先使用普通模式。

2. Opus 5 支持运行过程中动态调整工具#

Opus 5 API 新增 Beta 能力:长对话中可以修改可用工具而不使 Prompt 缓存失效;安全分类器拦截请求时,也可以配置自动回退模型。Anthropic 开发者说明

为什么重要: Agent 不再需要从开始到结束都持有全部权限。工具可以按任务阶段开放,既减少上下文与缓存成本,也降低误操作风险。

实际影响: 可以把编码 Agent 分为:

读取与分析 -> 修改代码 -> 执行测试 -> 创建提交 -> 请求部署

前三个阶段不需要部署权限,分析阶段甚至不需要写权限。

建议: 工具权限按阶段动态授予;部署、删除和外部写入始终保留人工审批。发生模型回退时必须记录实际使用的模型,避免质量变化无法追踪。

3. Vercel 将长任务单步骤上限提高到 30 分钟#

Vercel Workflow 的 Pro 和 Enterprise 任务单步骤现可运行最长 30 分钟,原上限为 800 秒;Hobby 计划仍为 5 分钟。该能力目前处于 Beta,需要启用 Fluid Compute 并重新部署。Vercel 官方更新

为什么重要: 报告生成、仓库分析、音视频处理和多轮 Agent 等任务,更容易直接部署在 Serverless 环境,不必立即维护独立任务服务器。

实际影响: 运行时间延长也会放大超时重试、重复扣费和重复写入问题。

建议:

  • 每个步骤设计幂等键。
  • 长任务定期保存检查点。
  • 外部写入前判断是否已经执行。
  • 设置最大 Token、运行时间和重试次数。
  • 30 分钟以上的任务仍拆成队列和多个步骤,不要只调高超时。

4. Cars24 案例显示:Agent 的价值可能首先来自“追回流失收入”#

OpenAI 近期发布的 Cars24 案例称,其 AI Agent 每月处理超过 100 万分钟对话,客服解决率提高 50%、处理时间减少 80%,并通过重新联系流失卖家追回约 12% 的线索。以上属于厂商客户案例,不代表普遍效果。OpenAI Cars24 案例

为什么重要: 独立开发者容易把 AI 产品理解成聊天机器人,但更容易证明价值的场景其实是:

  • 未完成咨询的跟进
  • 弃购或流失线索识别
  • 售后问题分流
  • 订单异常提醒
  • 人工客服接管前的信息整理

建议: 在电商或小程序项目中,先选一个明确漏斗节点,记录“进入人数 - 流失人数 - 重新触达 - 成功转化”。先做辅助人工的版本,并遵守用户授权和平台消息规则,避免无差别自动营销。

5. Deutsche Telekom:AI 落地瓶颈是流程,而不是账号数量#

OpenAI 公布的 Deutsche Telekom 案例称,该公司已有超过 5 万名月活跃 AI 用户,2026 年以来使用量增长 546%,应用覆盖客服翻译、通话辅助、摘要和网络优化。其核心经验是逐个重构业务流程,而不是简单给旧流程增加聊天入口;数据同样来自厂商案例。Deutsche Telekom 案例

为什么重要: “团队都装了 AI 工具”不等于产生了收益。如果审批、测试和交付流程没有改变,AI 通常只是让代码和文档产量增加。

建议: 你的团队可以先选一个流程,例如线上故障分析,记录改造前后的:

平均定位时间、参与人数、误判次数、修复后复发率、AI 成本

只有指标稳定改善,再复制到需求拆解、测试和发布流程。

6. Cloudflare 发现互联网路由属性被大量中途修改#

Cloudflare 7 月 24 日公布的实验发现,在其观察的路径中,约 70% 的 BGP 路由 ORIGIN 属性可能被中间网络修改,尽管该属性按协议原本不应改变。不同运营商可能借此影响路径选择。Cloudflare 技术分析

为什么重要: 服务端、DNS 和监控都显示正常时,部分地区或运营商用户仍可能因为网络路由差异无法访问。单一机房的健康检查发现不了这类问题。

建议:

  • 从电信、联通、移动等不同网络做合成监控。
  • 分别记录 DNS、TCP、TLS 和 TTFB 耗时。
  • 关键外部 API 设置备用供应商和超时降级。
  • 上传业务使用可续传、幂等和失败节点切换。

今日判断: 新模型固然值得测试,但更有长期价值的是把 Agent 做成一套受控系统:按阶段开放工具、按检查点恢复任务、按业务指标衡量收益,并对网络与模型故障预留降级路径。