OpenAI 推出基于 GPT-6 Luna 的 Decisions API 公测版
OpenAI 推出 Decisions API 公测版,可直接返回条件概率、选项选择或等级评分,官方称基于 GPT-6 Luna 的调用速度最高比 Responses API 快 10 倍,输入价格从每百万 token 0.10 美元起且不收输出费用。将分类、路由和判断从文本生成中拆出,为高频 Agent 决策提供了更便宜且便于程序处理的接口。
Google 发布开放式多模态嵌入模型 EmbeddingGemma 2
Google 发布基于 Gemma 4 的 EmbeddingGemma 2,以统一向量空间处理文本、代码、图像、视频和音频,提供 740M 全模态模型及更小的模态组合版本,并采用 Apache 2.0 许可。它为端侧多模态检索和 RAG 提供了可本地部署的统一表示层。
Anthropic 为 Claude Managed Agents 开放动态多 Agent 工作流公测
Anthropic 为 Claude Managed Agents 开放动态工作流公测,主 Agent 可先制定分阶段计划,再将任务分发给单次运行中最多 1,000 个 Agent 并合并结果。大规模并行编排进入托管服务,但官方提醒开发者先限定任务范围以控制 token 消耗。
Reflection AI 发布 501B 参数稀疏模型 Beam
Reflection AI 发布面向编程、Agent 和科学任务的文本模型 Beam,总参数 501B、激活参数 23B,并计划本月以 Apache 2.0 许可开放完整权重。它为高能力开放模型增加了一个新的美国训练方,但开放权重的实际部署表现仍待发布后检验。
Hugging Face 在 TRL 1.15 中默认启用融合语言模型输出头
TRL 1.15 默认启用融合语言模型输出头,避免在训练中完整构建 logits 张量;在 Gemma 3 1B 测试中,GRPO 可用序列长度从 28K 提升至 114K,8K 长度下峰值内存下降 52% 至 82%。这让同等显存预算可以容纳更长的强化学习轨迹与偏好训练样本。
vLLM 发布 0.31.0,加入 DeepSeek-V4.1-Flash 与推测解码支持
vLLM 0.31.0 加入 DeepSeek-V4.1-Flash 的 NVFP4 KV 缓存支持、快速重启预加载,以及 Model Runner V2 中基于草稿模型的推测解码。新版本同时扩展分布式通信和强化学习权重传输能力,覆盖服务启动、推理延迟与训练联动等部署环节。
Vals AI 测试多 Agent 团队在编程任务中的收益与成本
Vals AI 在 Vibe Code Bench 上比较 GPT-6 Sol 和 Claude Opus 5.5 的单 Agent 与团队模式,发现团队成本增加 1.8 至 5.1 倍,只有中等推理强度的 Sol 团队取得显著提升,幅度为 7.3 分。结果提示开发者评估并行 Agent 时,应把任务完成率与总成本一起衡量。
Arena 发布基于九万余次 Agent 会话的 Alignment Index
Arena 发布 Alignment Index,以超过 9 万次真实 Agent 会话评估 27 个模型的越权操作、错误归因与虚假完成等行为,其中 GPT-6.1 Sol 得分 87.9。将执行中的对齐行为单独量化,为选择可操作工具的 Agent 模型提供了能力榜单之外的比较维度。
Anthropic 启动 Cyber Mission 并提供开源项目漏洞扫描
Anthropic 启动 Cyber Mission,其中 OSS Scanner 面向主动加入的开源项目提供免费定期漏洞扫描,并附带概念验证和修复建议。把模型能力接入持续扫描流程,可能降低维护者发现与处理安全问题的门槛。
阿里通义开放 Qwen-Image-2.1-Turbo 模型权重
阿里通义开放 7B 参数的 Qwen-Image-2.1-Turbo 权重,支持 8 步生成 2K 图像与自然语言编辑,并可通过 Diffusers 管线加载。加速版权重使开发者能够自行部署图像生成与编辑能力,减少对托管接口的依赖。