Key Takeaways
- GPT-Live语音模型正式在ChatGPT上线,全双工实时语音交互,体验接近科幻,计划扩展到API和Codex。
- Grok 4.5宣布发布,在多项基准测试中排名第一,成本效率高,但缺少模型卡引发透明性质疑。
- OpenAI承认SWE-Bench Pro 30%任务已损坏,撤回推荐,业界对AI基准可靠性关注上升。
- GPT-5.6 Sol即将发布,Sam Altman确认团队偏好此版本;Perplexity推出新orchestrator模型,成本仅为Opus的0.344倍。
- Hugging Face开源机器人框架和ASR模型;Anthropic提出可移除能力的GRAM训练方法;Cognition完成1.3亿美元A轮融资。
1. Major Product Launches: GPT-Live and Grok 4.5
- GPT-Live: OpenAI正式推出新一代语音模型GPT-Live,实现全双工实时语音对话,响应自然流畅。即日起向ChatGPT Go/Plus/Pro用户推送,免费用户逐步覆盖。OpenAI计划将该模型引入API和Codex,并公开招募API设计合作伙伴。 — via 1 2 3
- Grok 4.5: Elon Musk宣布Grok 4.5正式发布,在SWE Marathon、τ³-Banking、AutomationBench-AA等基准测试中排名第一或前列。模型成本效率极高,速度是Opus级模型的数倍,未来将升级至1M上下文窗口,并计划通过C/C++推理软件提速翻倍以上。 — via 1 2 3
- Benchmark Transparency Concerns: Ethan Mollick批评OpenAI和xAI未充分公开模型基准结果:OpenAI花费重金开发自主模型能力基准GDPval,但未对GPT-5.6报告;Grok 4.5也未发布模型卡。同时,OpenAI自己审计发现业界常用编码基准SWE-Bench Pro中30%的任务已损坏,不再推荐,引发对AI评估可靠性的广泛讨论。 — via 1 2 3
2. Model Updates and Industry Developments
- GPT-5.6 Sol: Sam Altman表示团队在无偏见比较中一致认定GPT-5.6 Sol优于Fable模型,并澄清自己此前想念的实为5.6 Sol。综合信息和语音体验,Deedy预测GPT-5.6 Sol及Sol Ultra将于明日发布。 — via 1 2 3
- Perplexity Orchestrator: Perplexity Computer发布新orchestrator模型,基于GLM 5.2后训练,搭配advisor时达到Opus 4.8级性能,成本仅为Opus的0.344倍,现以research preview形式可用。 — via 1
- Hugging Face Open-Source: Hugging Face与NVIDIA合作将GR00T 1.7和Isaac Teleop集成到LeRobot中,扩展开源机器人能力;同时开源MOSS-Transcribe-Diarize-0.9B ASR模型,支持128k长上下文转录和多说话人识别。 — via 1 2
- Anthropic Safety Research: Anthropic与AE Studio合作提出GRAM训练方法,可将双用途能力放入可移除模块以平衡风险;同时任命前美联储主席本·伯南克为长期利益信托成员。 — via 1 2
- Cognition Funding: swyx宣布Cognition完成1.3亿美元A轮融资,估值10亿美元,旨在构建开放超级智能堆栈,已服务6000+客户。 — via 1
