要点速览
- GPT-5.6 Sol 发布,在 ARC-AGI-3 上取得 7.8% SOTA,Terminal-Bench 2.1 达 88.8%,成为 Microsoft 365 Copilot 首选模型。
- Grok 4.5 在多个基准测试中超越对手,上下文将扩展至 1M tokens,2T 参数新模型本月完成训练。
- Meta Muse Spark 1.1 展示强大 agentic 能力,1M token 上下文,子代理并行执行,已上线 AI Gateway。
- GLM 5.2 作为低成本编排器受到关注,适合快速任务。
- SpaceX 实现 Starlink 10Gbps 峰值速度,Super Heavy 准备飞行 13,AI 卫星 AI1 公布规格。
- 单人创业者 年收入超 100 万美元的比例在 2021-2025 年间增长超三倍。
一、前沿模型竞争白热化
- GPT-5.6 Sol 被 OpenAI 称为迄今最好的模型,在多项企业级任务上相比 GPT-5.5 显著提升,尤其在金融、医疗等领域的数据推理与分析。其 Agent 模式、Ultra 模式、Sites 和 Artifact 模板等功能同步推出。— 来源:1 2 3 4 5
- Grok 4.5 在 AutomationBench-AA、Terminal-Bench v2、Harvey Legal、SWE Marathon 等基准上领先,并展示了强大的代理与编码能力(如一小时创建 FPS 游戏、在 UE5.8 中构建 3D 场景)。Grok Build 持续改进,新增 dashboard、imagine 生图生视频、X 搜索工具。未来计划包括 1M token 上下文窗口、2T 参数新模型本月完成训练、下月上线。— 来源:1 2 3 4 5
- Meta Muse Spark 1.1 在 agentic 性能、工具使用、计算机使用方面表现优异,具有 1M token 上下文窗口和子代理并行执行能力,已通过 AI Gateway 提供服务。— 来源:1 2 3
- GLM 5.2 被提及作为编排器模型,更便宜更快,适合作为工具链中的顾问模型。— 来源:1
二、AI Agent 与基础设施工具
- FrontierFinance 开放基准 发布,用于评估 AI agent 在完整投资工作流中的表现,包含 220 个示例和专家评分标准。Samaya 的 AI 系统以 50.8% 准确率领先,且成本低于其他模型。— 来源:1
- Codex 是 ChatGPT Work 的核心,能跨应用和文件操作、长时间跟随项目,Sam Altman 强调其不会消失。GPT-5.6 已成为 Microsoft 365 Copilot 首选模型。— 来源:1 2
- Perplexity Computer 新增 Analytics 功能追踪模型支出,并支持 Sol、Terra、Claude Opus 4.8 Fast Mode 等多种模型作为编排器。— 来源:1 2
- Vercel 宣布可零配置导入 Lovable 应用,基于 Nitro 运行时,支持从 Lovable 起步、在 Vercel 上发展的无上限 AI 开发。— 来源:1
三、硬件与太空进展
- SpaceX Starlink 在阿拉斯加 Utqiagvik 实现 10Gbps 对称峰值速度;Cape Gigabay 安装 420 吨起重机为 Starship 做准备;Super Heavy 助推器移至 Starbase 发射台准备飞行 13。— 来源:1 2 3
- AI 卫星 AI1 公布详细规格:150 kW 计算载荷、70 米翼展,展示在轨 AI 计算能力。— 来源:1
