OpenAI 推出法律领域产品 Astra for Law
OpenAI 推出 Astra for Law,首批提供 26 个合作伙伴插件和 47 个社区插件,并通过 ChatGPT 与 Codex 的 Trusted Access 开放,API 接入将随后推出。该产品将模型、工具、配置和安全默认项打包为垂直方案,显示前沿模型厂商正从通用能力交付转向领域化工作流。
阿里千问发布 Qwen3.8-Omni-Flash 原生全模态模型
阿里千问发布 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M 长上下文,官方称 30 项评测较上代平均提升超过 26%,API 音频输入价格下降超过 98%。模型可端到端执行视频剪辑、翻译、解说和会议纪要等长程任务,把全模态能力与 Agent 工作流的成本优化结合起来。
Anthropic 公布三项 AI 研发自动化内部指标
Anthropic 公布用于跟踪 AI 发展的三项内部指标,分别衡量 AI 完成研发工作的比例、Agent 受监督程度和算力分配方式,并称 Claude 主导的模型研发任务占比约半年内由 1% 升至 26%。这些数据为观察 AI 实验室内部自动化规模提供了少见的量化依据,也让 Agent 监督和算力治理成为可测量的问题。
Google DeepMind 发布 Gemini 3.8 Live 与 Extended Thinking 实时语音模型
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,支持 97 种语言、说话时异步调用工具,并可在不中断对话的情况下执行后台任务。模型通过 Gemini API 与 AI Studio 开放,并接入 LiveKit、Pipecat、LangChain 和 Vercel,为实时语音 Agent 提供了更完整的开发链路。
Google DeepMind 发布多智能体数学研究框架 Stellar Colosseum
Google DeepMind 发布模型无关的多智能体框架 Stellar Colosseum,将策略、任务拆解、子问题求解和验证分离,报告 Codeforces 4263 分及 TCS-Bench 71.0% 的结果。显式角色分工与可复现评测,使多 Agent 研究从笼统的群体协作转向可检查的记忆、分解和验证结构。
智谱发布最高 200 tokens/s 的 GLM-5.3-FlashX
智谱发布 GLM-5.3-FlashX,最高推理速度达到 200 tokens/s,并称其推理服务建立在 10 万张国产芯片的算力基础上。更高生成速度与国产推理基础设施的组合,直接影响高并发 Agent 和交互式应用的响应体验及单位调用成本。
蚂蚁灵波开源 LingBot-World 2.0 三款实时交互世界模型
蚂蚁灵波开源 LingBot-World 2.0 的 Small、Bidirectional 和 Causal Pretrain 三款模型,其中 1.3B Small 可在消费级单卡 GPU 上本地实时生成交互世界。双向教师模型、蒸馏路径和因果预训练底座一并开放,为低成本实时世界模型的训练与本地部署提供了分层方案。
腾讯云开源自托管多智能体助手 Octop 1.0 GA
腾讯云发布 Octop 1.0 GA,面向个人、家庭和小团队提供知识沉淀、多端触达、权限管理与安全加固,并同步上线 Lighthouse 和 CVM 官方镜像。可一键自托管的多智能体协作中枢,为重视数据控制的小型组织提供了比公有云助手更直接的部署选择。
Vals AI 发布实时计算机操作评测 CUA-Bench
Vals AI 发布 CUA-Bench,通过 6 款游戏中的实时键鼠操作测试计算机使用模型,并将其中 3 款游戏保留为私有测试集;首轮结果显示前沿模型得分均低于 20%。该评测把视频感知、连续控制和实时适应纳入同一任务,揭示当前计算机操作 Agent 与人类熟练度之间仍有明显差距。
科大讯飞发布国产语音基座模型 Spark-Audio-1.0-Preview
科大讯飞发布 Spark-Audio-1.0-Preview,采用 0.65B 音频编码器与 30B-A3B MoE 语言模型,以 1300 万小时音频训练,支持 99 种语言和 202 种方言识别。覆盖语义、情绪与场景的直接语音理解,为复杂环境下的多语种语音 Agent 提供了国产模型与算力底座。