AI Hotlist

2026 | 08.16 - 08.22 Vol. 36

AI一周资讯 精华

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。
OpenAI 2026-08-22

OpenAI 下调 GPT-5.6 Sol API 与积分产品价格

OpenAI 宣布未来三个月将 GPT-5.6 Sol 在 API 和积分制产品中的价格下调 20% 以上,叠加 Code 等产品促销后,部分开发场景的实际成本进一步下降。前沿模型竞争已经明显转向推理成本和 Agent 性价比,模型选型会更直接受价格弹性影响。

Read Source
DeepSeek 2026-08-22

DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp

DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp,为 V4-Flash 系列加入多模态能力,并提供按 Flash 价格计费的图文 API 与 Files API 复用上传文件。低价高吞吐模型开始直接覆盖视觉 Agent 场景,这会推动多模态自动化从演示走向更可控的生产使用。

Read Source
千问大模型 2026-08-21

阿里通义发布 GUI 智能体基座模型 Qwen-UI-Agent

阿里通义发布 Qwen-UI-Agent,面向手机、电脑、网页和深度搜索场景,并表示模型基于 100 多台真机、150 多个应用训练,在 MobileWorld、OSWorld 和 WebArena 等基准上超过多家旗舰模型。GUI Agent 竞争正在从单点工具调用转向跨设备操作与安全确认机制,实际可交付的自动化边界被继续推高。

Read Source
智谱 2026-08-19

智谱上线 GLM-5.3 API

智谱宣布 GLM-5.3 API 正式上线,主打复杂编码、网络安全和长程任务,并保持与上一代相同定价,模型权重计划随后开源。当前前沿 Agent 能力提升越来越多来自后训练、环境和推理系统而非单纯扩参数,这类高性价比模型会继续改写开发者默认选择。

Read Source
NVIDIA 2026-08-19

NVIDIA 发布 TensorRT Model Connect 公测版

NVIDIA 将 TensorRT Model Connect 以 public preview 形式开放,主打把受支持的 Hugging Face 模型以更少步骤直接转换为端到端 TensorRT 推理部署。模型优化链路被持续缩短后,企业把开源模型接入生产环境的门槛会下降,推理工程效率会比单纯 benchmark 更重要。

Read Source
机器之心 2026-08-20

DeepSeek Harness更新,增强多模态

推出 v0.1.0-rc.8 版本,重点增强多模态能力,支持原生图片请求与图文混合输入,可将 、 作为子代理按需调用。同时优化工具并发查询与 Windows 终端体验,修复多项稳定性问题,进一步巩固其作为 Agent 统一调度层的定位。

Read Source
vLLM 2026-08-22

vLLM 发布 IsoExec 以降低 RL 训练与回放的 logprob 偏差

vLLM 发布 IsoExec,针对并行布局变化带来的浮点非结合误差,强调可在训练与 rollout 之间保持更接近逐位一致的 logprob。RL 驱动的大模型后训练越来越依赖可重复的系统行为,这类底层一致性改进会直接影响训练稳定性和评测可信度。

Read Source
商汤科技SenseTime 2026-08-21

商汤开源原生统一多模态模型 SenseNova U1.5 Lite

商汤开源 SenseNova U1.5 Lite,聚焦真实视觉创作流程,强调长指令遵循、4K 原生输出、图像编辑和精细视觉控制能力。原生多模态模型开始把生成、编辑和布局控制合并到一个轻量开源底座里,视觉内容产品的定制空间会继续增大。

Read Source
阿里云 2026-08-18

阿里千问办公开源上下文基础设施项目 MyContext

阿里千问办公开源 MyContext,以本地化方式把 IM、文档、会议等多源工作数据沉淀为可溯源的 Agent 上下文档案,并提供冲突处理机制。企业级 Agent 正在从调用外部工具转向构建长期记忆底座,谁能更好组织私有上下文,谁就更接近真实工作流入口。

Read Source
千问AI平台 2026-08-17

阿里发布 Qwen-Audio-3.0 系列语音模型

阿里在千问 AI 平台上线 Qwen-Audio-3.0 系列,覆盖语音识别、语音合成和实时语音交互对话,并向开发者开放 API 与 Token Plan 调用。语音能力正在回到统一模型平台交付,开发者会更容易把实时语音交互接入通用 Agent 和应用流程。

Read Source
Cursor 2026-08-17

Cursor 推出 AI 原生代码托管产品 Origin

Cursor 发布 Origin,把代码托管能力进一步纳入自身 IDE 与 Agent 协作体系,并强调与现有 GitHub 流程保持兼容。编码产品竞争正在从编辑器体验扩展到仓库、评审和自动化闭环,AI IDE 平台化趋势变得更加明确。

Read Source

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

vLLM 发布 IsoExec 以降低 RL 训练与回放的 logprob 偏差

vLLM 发布 IsoExec,针对并行布局变化带来的浮点非结合误差,强调可在训练与 rollout 之间保持更接近逐位一致的 logprob。RL 驱动的大模型后训练越来越依赖可重复的系统行为,这类底层一致性改进会直接…

商汤开源原生统一多模态模型 SenseNova U1.5 Lite

商汤开源 SenseNova U1.5 Lite,聚焦真实视觉创作流程,强调长指令遵循、4K 原生输出、图像编辑和精细视觉控制能力。原生多模态模型开始把生成、编辑和布局控制合并到一个轻量开源底座里,视觉内容产品的定制空间…

阿里千问办公开源上下文基础设施项目 MyContext

阿里千问办公开源 MyContext,以本地化方式把 IM、文档、会议等多源工作数据沉淀为可溯源的 Agent 上下文档案,并提供冲突处理机制。企业级 Agent 正在从调用外部工具转向构建长期记忆底座,谁能更好组织私有…

阿里发布 Qwen-Audio-3.0 系列语音模型

阿里在千问 AI 平台上线 Qwen-Audio-3.0 系列,覆盖语音识别、语音合成和实时语音交互对话,并向开发者开放 API 与 Token Plan 调用。语音能力正在回到统一模型平台交付,开发者会更容易把实时语音…

Cursor 推出 AI 原生代码托管产品 Origin

Cursor 发布 Origin,把代码托管能力进一步纳入自身 IDE 与 Agent 协作体系,并强调与现有 GitHub 流程保持兼容。编码产品竞争正在从编辑器体验扩展到仓库、评审和自动化闭环,AI IDE 平台化趋…

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

OpenAI 下调 GPT-5.6 Sol API 与积分产品价格

OpenAI 宣布未来三个月将 GPT-5.6 Sol 在 API 和积分制产品中的价格下调 20% 以上,叠加 Code 等产品促销后,部分开发场景的实际成本进一步下降。前沿模型竞争已经明显转向推理成本和 Agent 性价比,模型选型会更直接受价格弹性影响。

01

DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp

DeepSeek 发布 DeepSeek-V4-Flash-Vision-Exp,为 V4-Flash 系列加入多模态能力,并提供按 Flash 价格计费的图文 API 与 Files API 复用上传文件。低价高吞吐模型开始直接覆盖视觉 Agent 场景,这会推动多模态自动化从演示走向更可控的生产使用。

02

阿里通义发布 GUI 智能体基座模型 Qwen-UI-Agent

阿里通义发布 Qwen-UI-Agent,面向手机、电脑、网页和深度搜索场景,并表示模型基于 100 多台真机、150 多个应用训练,在 MobileWorld、OSWorld 和 WebArena 等基准上超过多家旗舰模型。GUI Agent 竞争正在从单点工具调用转向跨设备操作与安全确认机制,实际可交付的自动化边界被继续推高。

03

智谱上线 GLM-5.3 API

智谱宣布 GLM-5.3 API 正式上线,主打复杂编码、网络安全和长程任务,并保持与上一代相同定价,模型权重计划随后开源。当前前沿 Agent 能力提升越来越多来自后训练、环境和推理系统而非单纯扩参数,这类高性价比模型会继续改写开发者默认选择。

04

NVIDIA 发布 TensorRT Model Connect 公测版

NVIDIA 将 TensorRT Model Connect 以 public preview 形式开放,主打把受支持的 Hugging Face 模型以更少步骤直接转换为端到端 TensorRT 推理部署。模型优化链路被持续缩短后,企业把开源模型接入生产环境的门槛会下降,推理工程效率会比单纯 benchmark 更重要。

05

DeepSeek Harness更新,增强多模态

推出 v0.1.0-rc.8 版本,重点增强多模态能力,支持原生图片请求与图文混合输入,可将 、 作为子代理按需调用。同时优化工具并发查询与 Windows 终端体验,修复多项稳定性问题,进一步巩固其作为 Agent 统一调度层的定位。

06

vLLM 发布 IsoExec 以降低 RL 训练与回放的 logprob 偏差

vLLM 发布 IsoExec,针对并行布局变化带来的浮点非结合误差,强调可在训练与 rollout 之间保持更接近逐位一致的 logprob。RL 驱动的大模型后训练越来越依赖可重复的系统行为,这类底层一致性改进会直接影响训练稳定性和评测可信度。

07

商汤开源原生统一多模态模型 SenseNova U1.5 Lite

商汤开源 SenseNova U1.5 Lite,聚焦真实视觉创作流程,强调长指令遵循、4K 原生输出、图像编辑和精细视觉控制能力。原生多模态模型开始把生成、编辑和布局控制合并到一个轻量开源底座里,视觉内容产品的定制空间会继续增大。

08

阿里千问办公开源上下文基础设施项目 MyContext

阿里千问办公开源 MyContext,以本地化方式把 IM、文档、会议等多源工作数据沉淀为可溯源的 Agent 上下文档案,并提供冲突处理机制。企业级 Agent 正在从调用外部工具转向构建长期记忆底座,谁能更好组织私有上下文,谁就更接近真实工作流入口。

09

阿里发布 Qwen-Audio-3.0 系列语音模型

阿里在千问 AI 平台上线 Qwen-Audio-3.0 系列,覆盖语音识别、语音合成和实时语音交互对话,并向开发者开放 API 与 Token Plan 调用。语音能力正在回到统一模型平台交付,开发者会更容易把实时语音交互接入通用 Agent 和应用流程。

10

Cursor 推出 AI 原生代码托管产品 Origin

Cursor 发布 Origin,把代码托管能力进一步纳入自身 IDE 与 Agent 协作体系,并强调与现有 GitHub 流程保持兼容。编码产品竞争正在从编辑器体验扩展到仓库、评审和自动化闭环,AI IDE 平台化趋势变得更加明确。

11

End of Brief

See you next week