要点速览
- GPT-5.6 Sol Ultra 使用64个子代理在一小时内证明存在50年的Cycle Double Cover猜想,标志AI推理能力重大突破。
- Grok 4.5在WANDR评估中得分最高,成本仅为Opus 4.8的一半,性价比突出。
- GPT-5.6 Luna以25倍更低成本超越GPT-5.5最高推理设置,推动高性能模型成本下降。
- OpenAI更新ChatGPT Work和Codex,重置使用限制并承诺下周更大改进。
- Meta发布Muse Spark 1.1模型,在agentic和编码方面表现强劲且价格较低。
- 行业观点:模型本身不再是产品,系统编排、工具和成本性能才是关键。
一、AI模型与突破
- GPT-5.6 Sol Ultra 用64个子代理在一小时内证明了已存在50年的Cycle Double Cover猜想,展示了AI在数学推理上的惊人潜力。同时,GPT-5.6 Luna 以25倍更低的成本超越GPT-5.5最高推理设置,性能大幅提升。— 来源:1 2 3 4
- Grok 4.5 在WANDR评估中得分最高,且成本约为Claude Opus 4.8的一半。该模型已通过Perplexity Computer和Grok Build CLI免费或低价使用,并在APEX-SWE排名第二(Pass@1 51.2%),一年内提升30.2个百分点。— 来源:1 2
- Meta Muse Spark 1.1 发布,在agentic和编码方面表现强劲,价格远低于OpenAI和Anthropi,显示Meta在AI竞赛中的进展。— 来源:1
- 对比测试显示,Fable XHigh 在生成视频任务上成功,而GPT-5.6 Sol Ultra 失败,表明不同模型在具体任务上存在差异。— 来源:1
二、产品更新与生态
- OpenAI宣布 ChatGPT Work和Codex 更新:重置使用限制、修复默认设置过高、桌面应用重组问题,并澄清Codex不会消失;计划下周进行更大改进。— 来源:1 2 3
- OpenAI将 Bio Bug Bounty 转为持续私人项目,奖励翻倍至5万美元,邀请AI红队和安全研究人员参与。— 来源:1
- Yann LeCun与Kyutai Labs合作推出 Audio-to-MIDI模型,能从完整混音中识别各乐器并输出分离MIDI轨道;后续发布 MuScriptor,为目前最好的多乐器转录开源模型。— 来源:1 2
- NVIDIA提出AI工厂可作能源供应商,基于Vera Rubin DSX参考设计的Emerald AI平台支持灵活连接。— 来源:1
三、行业洞察与观点
- Aravind Srinivas 指出模型本身不再是产品,真正的产品是围绕它的系统:编排、工具、企业上下文和成本性能。他预测6个月内可能出现Fable 5质量但便宜3-4倍的模型,12个月内本地运行Opus 4.8级别模型概率超50%。— 来源:1
- Hamel Husain 强调数据是差异化优势:当工具能自动修复所有问题时,产品失去差异化;AI时代价值来自不对称性,要关注数据。— 来源:1
- Ethan Mollick 发现Google NotebookLM回答时更注重过程,而ChatGPT Work更强;GPT-5.6 Sol在Codex中控制电脑5小时赢得Slay the Spire 2每日挑战,展示复杂决策能力。— 来源:1 2
