要点速览
- Grok 4.5 在多项基准中领先,成本仅为 Opus 4.8 的一半,已在多个平台可用。
- Sam Altman 称 GPT-5.6 Sol 为世界最好模型,医生发现其回复缺陷更少。
- OpenAI 重置 ChatGPT Work 和 Codex 使用限制,计划下周大幅改进。
- Perplexity Computer 支持多种顶级模型,Grok 4.5 已对企业启用。
- 多位业内人士预测模型成本将快速下降,12 个月内可能出现本地运行的强大模型。
一、AI 模型与基础设施
- Grok 4.5 发布并取得多项基准领先:在 WANDR 评估中得分最高,成本约为 Opus 4.8 的一半;在 APEX-SWE 排名第二(Pass@1 51.2%),一年内提升 30.2 个百分点;在 SWE-Atlas-QnA 上与 Codex GPT-5.6 并列第一。该模型可通过 Grok Build CLI 和 Perplexity Computer 免费或低价使用。— 来源:1 2 3 4 5 6
- GPT-5.6 Sol 被称为世界最好模型:Sam Altman 称 GPT-5.6 Sol 是目前世界上最好的模型,并指出团队在使用 Sol 和 Fable 模型时 30% 的成本来自 Fable。医生发现 GPT-5.6 的回复缺陷比医生自己写的回复更少。— 来源:1 2 3
- OpenAI 更新 ChatGPT Work 和 Codex:重置使用限制,修复了默认设置过高、桌面应用重组导致不便、Codex 被误认为要消失等问题,并计划下周进行更大改进。OpenAI Build Week 活动从 7 月 13 日开始,鼓励用 Codex 构建项目。— 来源:1 2
- Perplexity Computer 支持多模型并预测成本下降:现支持 Fable、Sol、Opus、Grok、GLM、Sonnet 和 GPT 5.5 等多种编排模型,Grok 4.5 已对 Perplexity Enterprise 启用。Aravind Srinivas 预测 6 个月内可能出现 Fable 5 质量但便宜 3-4 倍的模型,12 个月内可能出现能在本地运行的 Opus 4.8 级别模型。— 来源:1 2 3 4
二、应用与生态
- AI agent 交互与开发新范式:Amjad Masad 发现 Claude 和 Replit agent 可以互相连接并讨论 bug,用户感到跟不上 AI 的辩论;他认为 AI 行业应从“token-maxxing”转向“outcome-maxxing”,并探讨了语音对话交互的可能性。使用 Replit 构建了类似 Notion 的应用,成本不到 100 美元。— 来源:1 2 3 4
- VibeOps 开发方式与 FSD 呼吁:@levelsio 介绍了直接在生产服务器上用 Claude Code 编辑代码的 VibeOps 方式,12 个月内仅两次短暂故障。同时向葡萄牙政府公开信,呼吁批准特斯拉 FSD(Supervised),援引荷兰数据:使用 FSD 的车辆事故率比手动驾驶低 3.5 倍。— 来源:1 2
