要点速览
- GPT-5.6 Sol价格减半、token效率翻倍,已在Amazon Bedrock全面可用,提供三个智能层级。
- Grok 4.5在Long-Horizon Terminal-Bench排名第一,速度优势明显。
- Codex和ChatGPT Work活跃用户达700万,agentic产品周使用量增长2.5倍。
- Google Gemini Omni Flash在视频生成排行榜上夺得第一。
- AI生产基础设施核心指标转向每token成本,每瓦特性能成为关键度量。
- 年底预计有多款前沿LLM发布,包括GPT 6、Fable 5.5、Gemini 3.5 Pro、Grok 5等。
一、模型与产品动态
- GPT-5.6 Sol 价格减半、token效率约翻倍,实现四分之一成本完成同样任务;已在Amazon Bedrock全面可用,提供Sol、Terra、Luna三个智能层级。— 来源:1 2
- Grok 4.5 在Long-Horizon Terminal-Bench排名第一,最大优势是速度,能保持心流状态,已成为首选模型。— 来源:1
- Google Gemini Omni Flash 在Artificial Analysis视频生成排行榜上夺得第一,领先于字节跳动的Seedance 2.0,支持文本、图像、视频输入并生成带原生音频的片段,支持对话式编辑。— 来源:1
- Codex和ChatGPT Work 已有700万活跃用户,上周agentic产品使用量增长2.5倍。— 来源:1
- GPT-Live语音模型 体验大幅提升,反馈速度快且不打断用户;ChatGPT Sites 进入公测,可将提示、文件或想法转化为轻量级应用并共享。— 来源:1 2
二、基础设施与关键指标
- AI生产基础设施核心指标已从峰值芯片规格变为每token成本,即每美元、每瓦特和延迟约束下能交付多少有用token;NVIDIA全栈推理软件可不断优化硬件性能。— 来源:1
- NVIDIA Vera Rubin NVL72架构采用NVLink 6和MGX设计,带来10倍每瓦性能提升。— 来源:1
- 数据中心推理功耗瓶颈的两条可行路径:本地模型编排大部分token流,以及太空太阳能数据中心。— 来源:1
- Hugging Face ZeroGPU已向所有用户开放,可创建GPU加速演示或应用;Hugging Face Transformers模型可在vLLM中原生运行,性能匹配或超越手工实现。— 来源:1 2
三、开源与平台生态
- Hugging Face 发布开源实时视觉语言模型MOSS-VL-Realtime(11B参数,256K上下文),支持边观看视频流边生成回答;还发布Hy3 298B模型的2-bit FPX量化版本,在128GB单系统上可达17-25 tok/s。— 来源:1 2
- Anthropic 研究发现Claude表达超过3000种价值观;投入1000万加元与加拿大机构合作资助AI研究;推出Claude for Teachers,为美国K-12教师免费提供高级Claude能力。— 来源:1 2 3
- NVIDIA AI 编码代理自主搭建训练环境,将Qwen3-VL-2B准确率从25%提升至96.9%;Cosmos 3 Nano后训练后交通信号检测零样本准确率从54.41%提升至87.14%,进一步用AutoML达93.35%。— 来源:1 2
- swyx 预测年底前多款LLM发布,包括GPT 6、Fable 5.5、Gemini 3.5 Pro、Grok 5等,前沿格局空前多极,对agent实验室和编排层有利。— 来源:1
