AI Hotlist

2026 | 09.13 - 09.19 Vol. 40

AI一周资讯 精华

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。
OpenAI 2026-09-18

OpenAI 推出法律领域产品 Astra for Law

OpenAI 推出 Astra for Law,首批提供 26 个合作伙伴插件和 47 个社区插件,并通过 ChatGPT 与 Codex 的 Trusted Access 开放,API 接入将随后推出。该产品将模型、工具、配置和安全默认项打包为垂直方案,显示前沿模型厂商正从通用能力交付转向领域化工作流。

Read Source
千问大模型 2026-09-18

阿里千问发布 Qwen3.8-Omni-Flash 原生全模态模型

阿里千问发布 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M 长上下文,官方称 30 项评测较上代平均提升超过 26%,API 音频输入价格下降超过 98%。模型可端到端执行视频剪辑、翻译、解说和会议纪要等长程任务,把全模态能力与 Agent 工作流的成本优化结合起来。

Read Source
Anthropic 2026-09-18

Anthropic 公布三项 AI 研发自动化内部指标

Anthropic 公布用于跟踪 AI 发展的三项内部指标,分别衡量 AI 完成研发工作的比例、Agent 受监督程度和算力分配方式,并称 Claude 主导的模型研发任务占比约半年内由 1% 升至 26%。这些数据为观察 AI 实验室内部自动化规模提供了少见的量化依据,也让 Agent 监督和算力治理成为可测量的问题。

Read Source
Google DeepMind 2026-09-16

Google DeepMind 发布 Gemini 3.8 Live 与 Extended Thinking 实时语音模型

Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,支持 97 种语言、说话时异步调用工具,并可在不中断对话的情况下执行后台任务。模型通过 Gemini API 与 AI Studio 开放,并接入 LiveKit、Pipecat、LangChain 和 Vercel,为实时语音 Agent 提供了更完整的开发链路。

Read Source
Google DeepMind 2026-09-18

Google DeepMind 发布多智能体数学研究框架 Stellar Colosseum

Google DeepMind 发布模型无关的多智能体框架 Stellar Colosseum,将策略、任务拆解、子问题求解和验证分离,报告 Codeforces 4263 分及 TCS-Bench 71.0% 的结果。显式角色分工与可复现评测,使多 Agent 研究从笼统的群体协作转向可检查的记忆、分解和验证结构。

Read Source
智谱 2026-09-18

智谱发布最高 200 tokens/s 的 GLM-5.3-FlashX

智谱发布 GLM-5.3-FlashX,最高推理速度达到 200 tokens/s,并称其推理服务建立在 10 万张国产芯片的算力基础上。更高生成速度与国产推理基础设施的组合,直接影响高并发 Agent 和交互式应用的响应体验及单位调用成本。

Read Source
蚂蚁灵波科技 2026-09-14

蚂蚁灵波开源 LingBot-World 2.0 三款实时交互世界模型

蚂蚁灵波开源 LingBot-World 2.0 的 Small、Bidirectional 和 Causal Pretrain 三款模型,其中 1.3B Small 可在消费级单卡 GPU 上本地实时生成交互世界。双向教师模型、蒸馏路径和因果预训练底座一并开放,为低成本实时世界模型的训练与本地部署提供了分层方案。

Read Source
腾讯云 2026-09-17

腾讯云开源自托管多智能体助手 Octop 1.0 GA

腾讯云发布 Octop 1.0 GA,面向个人、家庭和小团队提供知识沉淀、多端触达、权限管理与安全加固,并同步上线 Lighthouse 和 CVM 官方镜像。可一键自托管的多智能体协作中枢,为重视数据控制的小型组织提供了比公有云助手更直接的部署选择。

Read Source
Vals AI 2026-09-19

Vals AI 发布实时计算机操作评测 CUA-Bench

Vals AI 发布 CUA-Bench,通过 6 款游戏中的实时键鼠操作测试计算机使用模型,并将其中 3 款游戏保留为私有测试集;首轮结果显示前沿模型得分均低于 20%。该评测把视频感知、连续控制和实时适应纳入同一任务,揭示当前计算机操作 Agent 与人类熟练度之间仍有明显差距。

Read Source
科大讯飞 2026-09-17

科大讯飞发布国产语音基座模型 Spark-Audio-1.0-Preview

科大讯飞发布 Spark-Audio-1.0-Preview,采用 0.65B 音频编码器与 30B-A3B MoE 语言模型,以 1300 万小时音频训练,支持 99 种语言和 202 种方言识别。覆盖语义、情绪与场景的直接语音理解,为复杂环境下的多语种语音 Agent 提供了国产模型与算力底座。

Read Source

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

OpenAI 推出法律领域产品 Astra for Law

OpenAI 推出 Astra for Law,首批提供 26 个合作伙伴插件和 47 个社区插件,并通过 ChatGPT 与 Codex 的 Trusted Access 开放,API 接入将随后推出。该产品将模型、工具、配置和安全默认项打包为垂直方案,显示前沿模型厂商正从通用能力交付转向领域化工作流。

01

阿里千问发布 Qwen3.8-Omni-Flash 原生全模态模型

阿里千问发布 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M 长上下文,官方称 30 项评测较上代平均提升超过 26%,API 音频输入价格下降超过 98%。模型可端到端执行视频剪辑、翻译、解说和会议纪要等长程任务,把全模态能力与 Agent 工作流的成本优化结合起来。

02

Anthropic 公布三项 AI 研发自动化内部指标

Anthropic 公布用于跟踪 AI 发展的三项内部指标,分别衡量 AI 完成研发工作的比例、Agent 受监督程度和算力分配方式,并称 Claude 主导的模型研发任务占比约半年内由 1% 升至 26%。这些数据为观察 AI 实验室内部自动化规模提供了少见的量化依据,也让 Agent 监督和算力治理成为可测量的问题。

03

Google DeepMind 发布 Gemini 3.8 Live 与 Extended Thinking 实时语音模型

Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,支持 97 种语言、说话时异步调用工具,并可在不中断对话的情况下执行后台任务。模型通过 Gemini API 与 AI Studio 开放,并接入 LiveKit、Pipecat、LangChain 和 Vercel,为实时语音 Agent 提供了更完整的开发链路。

04

Google DeepMind 发布多智能体数学研究框架 Stellar Colosseum

Google DeepMind 发布模型无关的多智能体框架 Stellar Colosseum,将策略、任务拆解、子问题求解和验证分离,报告 Codeforces 4263 分及 TCS-Bench 71.0% 的结果。显式角色分工与可复现评测,使多 Agent 研究从笼统的群体协作转向可检查的记忆、分解和验证结构。

05

智谱发布最高 200 tokens/s 的 GLM-5.3-FlashX

智谱发布 GLM-5.3-FlashX,最高推理速度达到 200 tokens/s,并称其推理服务建立在 10 万张国产芯片的算力基础上。更高生成速度与国产推理基础设施的组合,直接影响高并发 Agent 和交互式应用的响应体验及单位调用成本。

06

蚂蚁灵波开源 LingBot-World 2.0 三款实时交互世界模型

蚂蚁灵波开源 LingBot-World 2.0 的 Small、Bidirectional 和 Causal Pretrain 三款模型,其中 1.3B Small 可在消费级单卡 GPU 上本地实时生成交互世界。双向教师模型、蒸馏路径和因果预训练底座一并开放,为低成本实时世界模型的训练与本地部署提供了分层方案。

07

腾讯云开源自托管多智能体助手 Octop 1.0 GA

腾讯云发布 Octop 1.0 GA,面向个人、家庭和小团队提供知识沉淀、多端触达、权限管理与安全加固,并同步上线 Lighthouse 和 CVM 官方镜像。可一键自托管的多智能体协作中枢,为重视数据控制的小型组织提供了比公有云助手更直接的部署选择。

08

Vals AI 发布实时计算机操作评测 CUA-Bench

Vals AI 发布 CUA-Bench,通过 6 款游戏中的实时键鼠操作测试计算机使用模型,并将其中 3 款游戏保留为私有测试集;首轮结果显示前沿模型得分均低于 20%。该评测把视频感知、连续控制和实时适应纳入同一任务,揭示当前计算机操作 Agent 与人类熟练度之间仍有明显差距。

09

科大讯飞发布国产语音基座模型 Spark-Audio-1.0-Preview

科大讯飞发布 Spark-Audio-1.0-Preview,采用 0.65B 音频编码器与 30B-A3B MoE 语言模型,以 1300 万小时音频训练,支持 99 种语言和 202 种方言识别。覆盖语义、情绪与场景的直接语音理解,为复杂环境下的多语种语音 Agent 提供了国产模型与算力底座。

10

End of Brief

See you next week