AI Hotlist

2026 | 10.04 - 10.10 Vol. 43

AI一周资讯 精华

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。
OpenAI Developers 2026-10-07

OpenAI 推出基于 GPT-6 Luna 的 Decisions API 公测版

OpenAI 推出 Decisions API 公测版,可直接返回条件概率、选项选择或等级评分,官方称基于 GPT-6 Luna 的调用速度最高比 Responses API 快 10 倍,输入价格从每百万 token 0.10 美元起且不收输出费用。将分类、路由和判断从文本生成中拆出,为高频 Agent 决策提供了更便宜且便于程序处理的接口。

Read Source
Google DeepMind 2026-10-07

Google 发布开放式多模态嵌入模型 EmbeddingGemma 2

Google 发布基于 Gemma 4 的 EmbeddingGemma 2,以统一向量空间处理文本、代码、图像、视频和音频,提供 740M 全模态模型及更小的模态组合版本,并采用 Apache 2.0 许可。它为端侧多模态检索和 RAG 提供了可本地部署的统一表示层。

Read Source
Claude Developers 2026-10-10

Anthropic 为 Claude Managed Agents 开放动态多 Agent 工作流公测

Anthropic 为 Claude Managed Agents 开放动态工作流公测,主 Agent 可先制定分阶段计划,再将任务分发给单次运行中最多 1,000 个 Agent 并合并结果。大规模并行编排进入托管服务,但官方提醒开发者先限定任务范围以控制 token 消耗。

Read Source
Reflection AI 2026-10-06

Reflection AI 发布 501B 参数稀疏模型 Beam

Reflection AI 发布面向编程、Agent 和科学任务的文本模型 Beam,总参数 501B、激活参数 23B,并计划本月以 Apache 2.0 许可开放完整权重。它为高能力开放模型增加了一个新的美国训练方,但开放权重的实际部署表现仍待发布后检验。

Read Source
Hugging Face 2026-10-10

Hugging Face 在 TRL 1.15 中默认启用融合语言模型输出头

TRL 1.15 默认启用融合语言模型输出头,避免在训练中完整构建 logits 张量;在 Gemma 3 1B 测试中,GRPO 可用序列长度从 28K 提升至 114K,8K 长度下峰值内存下降 52% 至 82%。这让同等显存预算可以容纳更长的强化学习轨迹与偏好训练样本。

Read Source
vLLM 2026-10-08

vLLM 发布 0.31.0,加入 DeepSeek-V4.1-Flash 与推测解码支持

vLLM 0.31.0 加入 DeepSeek-V4.1-Flash 的 NVFP4 KV 缓存支持、快速重启预加载,以及 Model Runner V2 中基于草稿模型的推测解码。新版本同时扩展分布式通信和强化学习权重传输能力,覆盖服务启动、推理延迟与训练联动等部署环节。

Read Source
Vals AI 2026-10-10

Vals AI 测试多 Agent 团队在编程任务中的收益与成本

Vals AI 在 Vibe Code Bench 上比较 GPT-6 Sol 和 Claude Opus 5.5 的单 Agent 与团队模式,发现团队成本增加 1.8 至 5.1 倍,只有中等推理强度的 Sol 团队取得显著提升,幅度为 7.3 分。结果提示开发者评估并行 Agent 时,应把任务完成率与总成本一起衡量。

Read Source
Arena 2026-10-08

Arena 发布基于九万余次 Agent 会话的 Alignment Index

Arena 发布 Alignment Index,以超过 9 万次真实 Agent 会话评估 27 个模型的越权操作、错误归因与虚假完成等行为,其中 GPT-6.1 Sol 得分 87.9。将执行中的对齐行为单独量化,为选择可操作工具的 Agent 模型提供了能力榜单之外的比较维度。

Read Source
Anthropic 2026-10-08

Anthropic 启动 Cyber Mission 并提供开源项目漏洞扫描

Anthropic 启动 Cyber Mission,其中 OSS Scanner 面向主动加入的开源项目提供免费定期漏洞扫描,并附带概念验证和修复建议。把模型能力接入持续扫描流程,可能降低维护者发现与处理安全问题的门槛。

Read Source
阿里通义千问 2026-10-10

阿里通义开放 Qwen-Image-2.1-Turbo 模型权重

阿里通义开放 7B 参数的 Qwen-Image-2.1-Turbo 权重,支持 8 步生成 2K 图像与自然语言编辑,并可通过 Diffusers 管线加载。加速版权重使开发者能够自行部署图像生成与编辑能力,减少对托管接口的依赖。

Read Source

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

OpenAI 推出基于 GPT-6 Luna 的 Decisions API 公测版

OpenAI 推出 Decisions API 公测版,可直接返回条件概率、选项选择或等级评分,官方称基于 GPT-6 Luna 的调用速度最高比 Responses API 快 10 倍,输入价格从每百万 token 0.10 美元起且不收输出费用。将分类、路由和判断从文本生成中拆出,为高频 Agent 决策提供了更便宜且便于程序处理的接口。

01

Google 发布开放式多模态嵌入模型 EmbeddingGemma 2

Google 发布基于 Gemma 4 的 EmbeddingGemma 2,以统一向量空间处理文本、代码、图像、视频和音频,提供 740M 全模态模型及更小的模态组合版本,并采用 Apache 2.0 许可。它为端侧多模态检索和 RAG 提供了可本地部署的统一表示层。

02

Anthropic 为 Claude Managed Agents 开放动态多 Agent 工作流公测

Anthropic 为 Claude Managed Agents 开放动态工作流公测,主 Agent 可先制定分阶段计划,再将任务分发给单次运行中最多 1,000 个 Agent 并合并结果。大规模并行编排进入托管服务,但官方提醒开发者先限定任务范围以控制 token 消耗。

03

Reflection AI 发布 501B 参数稀疏模型 Beam

Reflection AI 发布面向编程、Agent 和科学任务的文本模型 Beam,总参数 501B、激活参数 23B,并计划本月以 Apache 2.0 许可开放完整权重。它为高能力开放模型增加了一个新的美国训练方,但开放权重的实际部署表现仍待发布后检验。

04

Hugging Face 在 TRL 1.15 中默认启用融合语言模型输出头

TRL 1.15 默认启用融合语言模型输出头,避免在训练中完整构建 logits 张量;在 Gemma 3 1B 测试中,GRPO 可用序列长度从 28K 提升至 114K,8K 长度下峰值内存下降 52% 至 82%。这让同等显存预算可以容纳更长的强化学习轨迹与偏好训练样本。

05

vLLM 发布 0.31.0,加入 DeepSeek-V4.1-Flash 与推测解码支持

vLLM 0.31.0 加入 DeepSeek-V4.1-Flash 的 NVFP4 KV 缓存支持、快速重启预加载,以及 Model Runner V2 中基于草稿模型的推测解码。新版本同时扩展分布式通信和强化学习权重传输能力,覆盖服务启动、推理延迟与训练联动等部署环节。

06

Vals AI 测试多 Agent 团队在编程任务中的收益与成本

Vals AI 在 Vibe Code Bench 上比较 GPT-6 Sol 和 Claude Opus 5.5 的单 Agent 与团队模式,发现团队成本增加 1.8 至 5.1 倍,只有中等推理强度的 Sol 团队取得显著提升,幅度为 7.3 分。结果提示开发者评估并行 Agent 时,应把任务完成率与总成本一起衡量。

07

Arena 发布基于九万余次 Agent 会话的 Alignment Index

Arena 发布 Alignment Index,以超过 9 万次真实 Agent 会话评估 27 个模型的越权操作、错误归因与虚假完成等行为,其中 GPT-6.1 Sol 得分 87.9。将执行中的对齐行为单独量化,为选择可操作工具的 Agent 模型提供了能力榜单之外的比较维度。

08

Anthropic 启动 Cyber Mission 并提供开源项目漏洞扫描

Anthropic 启动 Cyber Mission,其中 OSS Scanner 面向主动加入的开源项目提供免费定期漏洞扫描,并附带概念验证和修复建议。把模型能力接入持续扫描流程,可能降低维护者发现与处理安全问题的门槛。

09

阿里通义开放 Qwen-Image-2.1-Turbo 模型权重

阿里通义开放 7B 参数的 Qwen-Image-2.1-Turbo 权重,支持 8 步生成 2K 图像与自然语言编辑,并可通过 Diffusers 管线加载。加速版权重使开发者能够自行部署图像生成与编辑能力,减少对托管接口的依赖。

10

End of Brief

See you next week