要点速览
- OpenAI正式推出GPT-Live全双工语音模型,在ChatGPT中向付费用户推送,被视为人机交互方式的重要变革。
- xAI发布Grok 4.5,宣称在多个基准测试中达到前沿水平,且成本效率极高,未来将升级1M上下文窗口。
- OpenAI审计发现常用编码基准SWE-Bench Pro中30%任务已损坏,撤回推荐,引发模型评估标准讨论。
- Perplexity发布orchestrator模型,性能接近Opus 4.8但成本仅为0.344倍,以research preview形式可用。
- Hugging Face开源MOSS-Transcribe-Diarize-0.9B ASR模型,并扩展与NVIDIA合作的机器人开源生态。
一、语音与交互新纪元:GPT-Live正式上线
- OpenAI推出GPT-Live新一代语音模型,实现全双工自然对话,已在ChatGPT中向Go、Plus、Pro用户全面推送,免费用户逐步覆盖。该模型被Sam Altman和Greg Brockman盛赞为“神奇真实的体验”,认为语音模态将最终起飞,并与API和Codex的集成计划同步推进。— 来源:1 2 3
- Ethan Mollick体验后认为GPT新语音体验非常接近科幻中与AI对话的感觉,并暗示Claude Tag等新的AI合作模式正在出现。— 来源:1
二、前沿模型竞赛:Grok 4.5发布与模型评估基准争议
- xAI正式发布Grok 4.5,Elon Musk称其在SWE Marathon、τ³-Banking、AutomationBench-AA等基准测试中排名第一或前列,且速度快、成本效率极高。未来将升级1M上下文窗口,并计划通过软件优化使速度翻倍以上。— 来源:1 2
- OpenAI审计发现业界常用编码基准SWE-Bench Pro中30%的任务已损坏,不再可靠衡量前沿编码能力,因此撤回推荐,建议业界不再使用。同时Ethan Mollick批评Grok 4.5未发布模型卡,呼吁前沿公司公开基准和模型卡。— 来源:1 2
- 多个来源报道GPT-5.6 Sol和Sol Ultra即将发布(Deedy称明天发布),早期评价积极。Sam Altman在比较中明确表态更喜欢GPT-5.6 Sol而非Fable。— 来源:1 2
三、开源生态与工具进展:Hugging Face、Perplexity等
- Perplexity发布orchestrator模型,基于GLM 5.2后训练,搭配advisor时达到Opus 4.8级性能,但成本仅为Opus的0.344倍,现以research preview形式可用。— 来源:1
- Hugging Face开源MOSS-Transcribe-Diarize-0.9B ASR模型(Apache 2.0许可),支持128k长上下文转录、说话人标签、多说话人识别和热词定制,在RTX 4090上约100 token/s。同时与NVIDIA合作将GR00T 1.7和Isaac Teleop集成到LeRobot中,拓展开源机器人生态。— 来源:1 2
- Hugging Face还与SkyPilot合作推出可在任意云上运行AI工作负载的方案,数据存储在Hub,无出口费用。— 来源:1
- Anthropic发布GRAM训练方法,可将双用途能力放入可移除模块以平衡风险;同时任命本·伯南克为长期利益信托新成员。— 来源:1 2
