要点速览
- Grok 4.5内测性能接近Opus,基于1.5T V9模型,SpaceX将每月发布全新模型;xAI模型在OpenRouter上支持零数据保留。
- Bytedance Seedance 2.5即将发布,中国视频生成持续领先美国;GLM-5.2在Mac Studio运行医疗agent。
- 开源AI监管争议:LeCun主张监管API而非开源,Mollick区分开源运动与开放权重前沿模型。
- 开放模型成本效率优于闭源API:swyx建议用美元推理成本报告,Hugging Face看好开源多模型。
- 企业AI飞轮与自主代理:每家企业将拥有模型飞轮,NVIDIA黑客马拉松推动自主代理;评估方法方面,binary judges更实用,模型路由器低估非数学任务。
一、AI模型与基础设施进展
- Grok 4.5内测性能接近Opus,基于1.5T V9基础模型并加入Cursor数据补充训练,RL持续显著改进;SpaceX将每月发布全新从头训练的模型。— 来源:1
- xAI模型在OpenRouter上支持零数据保留(ZDR),包括Grok 4.3、Grok 4.20和Grok Build 0.1,适用于隐私敏感和企业工作负载。— 来源:1
- Grok Imagine Video在Vercel AI Gateway中占领先地位,占开发者生成视频的约50%。— 来源:1
- Bytedance即将发布Seedance 2.5视频生成模型,Deedy指出中国在视频生成领域持续领先美国。— 来源:1
- GLM-5.2在Mac Studio上通过llama.cpp运行,用于医疗agent工作流,强调AI应该被拥有而非租用。— 来源:1
二、开源与开放AI争议
- Yann LeCun转发关于监管前沿API模型而非开源AI的论述,认为监管API相对低风险,而监管开源性价比较低、伤害面更广。— 来源:1
- Ethan Mollick指出讨论AI开放性需区分不同含义:推动技术前沿的开源运动 vs 完全依赖少数中国公司善意的开放权重前沿模型。— 来源:1
- swyx引用观点认为开放模型在推理中的每美元token里程优于闭源API,建议用美元推理成本而非token数报告思考水平。— 来源:1
- Hugging Face认同AI的未来是多模型,其中大部分为开源模型。— 来源:1
三、企业AI应用与评估方法
- Aravind Srinivas预测每家企业将拥有自己的模型-验证-沙箱-评估飞轮,围绕每瓦令牌值进行优化,公司独有的领域和客户隐性知识及信任使其成为未来方向。— 来源:1
- NVIDIA与Stripe、NousResearch举办Hermes Agent加速商业黑客马拉松,鼓励构建能自主赚钱、花钱和运营业务的AI代理;奖品包括1万美元现金、DGX Spark及5000美元Stripe credits,提交截止6月30日。— 来源:1
- Hamel Husain推荐将LLM-as-judge评估分解为原子化的是/否问题(binary judges),认为比Likert评分更实用且可解释,并分享了相关资源。— 来源:1
- Ethan Mollick观察到模型路由器低估非数学/编码任务难度,分配过少智能,而创新、营销等非可验证任务从更智能的AI中受益最多。— 来源:1
- Ethan Mollick利用开源评估框架重新测试AI医疗图像解读,GPT-5.5 Pro得分从69/100提升到79/100,但仍未达到可靠医疗使用标准,呼吁研究论文开源实验框架。— 来源:1
