每日简报|2026-07-26
同步自 ChatGPT Project「每日晨读」历史归档。
过去 24 小时官方发布较少,今天重点补充几项近期发布、此前晨读尚未系统讲过的重要变化。主线是:OpenAI 将模型拆成不同成本档位,并把多 Agent、电脑操作和完整工作交付整合进统一产品。
1. GPT-5.6 已全面开放,分为 Sol、Terra、Luna 三档
OpenAI 于 7 月 9 日将 GPT-5.6 从有限预览转为正式可用:
- Sol:旗舰模型,API 价格为输入 5 美元、输出 30 美元/百万 Token。
- Terra:均衡档,输入 2.5 美元、输出 15 美元。
- Luna:低成本档,输入 1 美元、输出 6 美元。
三档均已进入 ChatGPT、Codex 和 API。官方称 Sol 在编码、长任务和工具使用方面显著提升,但性能数字主要来自官方及合作伙伴评测,仍需真实验证。OpenAI GPT-5.6 发布说明
为什么重要: 模型选择不再只是“旗舰或旧模型”,而是同代能力下按任务价值分层。
建议:
- Luna:分类、摘要、日志预处理。
- Terra:日常编码、文档和普通 Agent。
- Sol:架构调整、复杂故障、跨仓库任务。
- 不要把所有请求默认路由到 Sol;先记录一周各类任务的成功率和返工成本。
2. GPT-5.6 支持“程序化工具调用”
Responses API 新增 Programmatic Tool Calling:模型可以在内存中编写轻量程序,协调多个工具、过滤中间结果,再把真正有价值的信息送回上下文,而不是每次工具调用都经过一轮完整模型对话。OpenAI GPT-5.6 技术说明
为什么重要: 查询大量日志、数据库或接口时,Token 往往浪费在中间数据上。现在可以先用程序过滤,再让模型分析。
对你最直接的应用: ClickHouse 故障分析 Agent 可以先查询上万条埋点,由程序完成:
时间排序 -> 按用户聚合 -> 排除正常请求 -> 提取异常链路 -> 交给模型判断
建议: 不要把原始日志全部塞进 Prompt。先让代码完成确定性计算,模型只负责模式识别、原因推断和报告生成。
3. Multi-Agent 进入 Responses API Beta
GPT-5.6 的 ultra 模式默认协调四个 Agent 并行工作;开发者也可以通过 Responses API 的 Multi-agent Beta 构建类似流程。OpenAI 官方说明
为什么重要: 多 Agent 适合可以真正并行的任务,例如:
- 一个分析前端代码。
- 一个查询日志。
- 一个检查最近提交。
- 一个整理测试和复现路径。
但把同一任务机械拆给多个 Agent,可能只会增加成本和冲突。
建议: 只有满足以下条件才并行:
- 子任务数据依赖较少。
- 每个子任务有明确输出格式。
- 最后有单一 Agent 负责合并和消除冲突。
- 设置全局 Token、时间和并发上限。
你的任务 Markdown 可以增加“可并行子任务”和“最终汇总责任”两个字段。
4. GPT-5.6 强化前端设计和渲染后自检
OpenAI 重点强调了 GPT-5.6 的界面设计、电脑操作和视觉检查能力:模型不仅生成页面代码,还可以查看渲染结果,发现布局、交互和响应式问题后继续修改。合作伙伴的内部测试也显示其前端任务表现提升,但这些结果仍属于早期评测。OpenAI GPT-5.6 前端能力介绍
为什么重要: AI 前端开发正在从“生成 JSX”升级为:
生成代码 -> 启动项目 -> 打开页面 -> 操作页面 -> 截图检查 -> 修改 -> 回归验证
建议: 给 AI 的前端任务固定加入:
- 桌面端和移动端截图。
- 加载、空数据、错误和超长文本状态。
- 核心按钮的实际点击验证。
- 控制台错误和网络失败检查。
- 修改前后视觉对比。
这比单纯要求“页面好看一点”稳定得多。
5. Codex 已并入新版 ChatGPT 桌面应用
OpenAI 正在把 Codex 桌面应用合并进新版 ChatGPT 桌面端;原 ChatGPT 应用被命名为 ChatGPT Classic。新版统一提供 Chat、Work 和 Codex,并增加多仓库项目、Diff 内联编辑、侧边栏 PR Review 和电脑操作。OpenAI ChatGPT Work 说明
为什么重要: 这也解释了你本地为什么会看到“ChatGPT”和“ChatGPT Classic”两个软件:新版正在成为统一工作入口,Classic 是原来的聊天客户端。
建议: 开发工作优先使用新版 ChatGPT/Codex;Classic 暂时保留用于普通聊天即可。确认项目和历史对话正常迁移后,再考虑卸载旧版,不必同时维护两套开发配置。
6. GPT-Red 显示:网页、邮件和代码仓库都可能攻击 Agent
OpenAI 披露了自动红队模型 GPT-Red。它通过自博弈生成 Prompt Injection,曾成功诱导真实测试 Agent 修改商品价格、取消他人订单,也在模拟环境中尝试从 Codex Agent 窃取敏感数据。OpenAI 用这些攻击训练 GPT-5.6,提高其抵抗能力。OpenAI GPT-Red 研究
为什么重要: Agent 读取到的网页、README、Issue、邮件和工具返回值都属于不可信输入,其中可能隐藏“上传密钥”“忽略原任务”等指令。
建议:
- 外部内容永远不能提升 Agent 权限。
- 浏览器数据与系统指令分区处理。
- 工具输出中的命令只作为数据,不直接执行。
- 上传文件、发送请求、修改订单必须独立审批。
- 即使模型宣称更安全,也不能取消应用层权限控制。
7. Vercel Blob 可以直接接入 WAF
Vercel 于 7 月 24 日推出 Blob WAF Beta,可对文件访问执行拒绝、浏览器验证、限速和地域限制,无需更改 Blob URL 或代码;被拒绝的请求不会产生数据传输费用。Vercel 官方公告
为什么重要: 独立开发产品开放图片、视频或报告下载后,很容易遭遇爬虫和流量盗刷,最终承担存储与流量费用。
建议:
- 公开图片按 IP 限速。
- 私有报告使用短期签名链接。
- 大文件下载记录用户和来源。
- 服务端请求不要使用浏览器 Challenge,否则正常程序也会被拦截。
- 注意目前一套规则会作用于所有受保护的 Blob Store,配置前先检查是否误伤其他项目。
今日行动: 先把你准备交给 AI 的下一个开发任务补充“验收截图、异常状态和实际点击验证”;如果要做 ClickHouse 日志 Agent,第一版就采用“程序过滤日志、模型负责判断”的结构。