智谱发布 GLM-5.2 并推到 1M 上下文,开源编码模型第一次被广泛视作接近前沿闭源体验
GLM-5.2 以 1M 上下文、开源许可和更强编码表现成为本周最集中的开源模型话题,多位开发者直接把它评价为首个足以日常替代部分前沿闭源模型的开放权重选择。它的重要性不只在单次榜单,而在于国产开源模型开始同时拿下代码能力、长上下文和工程可部署性,和闭源 coding agent 的距离被明显缩短。
微软全球上线 Copilot Cowork,多模型长任务智能体开始正式进入企业工作流
微软宣布 Copilot Cowork 全球可用,并明确支持多模型路线,把长周期任务代理进一步推向企业协作场景。相比一次性的聊天升级,这更值得关注,因为它说明大厂正在把 Agent 从演示功能变成面向真实组织流程的持续执行层,企业办公套件将越来越像智能体运行平台。
OpenAI 推出 Codex Record & Replay,Agent 自动化开始从“写提示词”转向“录一次流程复用多次”
OpenAI Devs 发布 Codex Record & Replay,让用户把一次人工操作直接沉淀成可检查、可复用的技能,同时本周 Cursor 也上线 /automate,强化自然语言配置触发器与工具链。它的意义在于,自动化门槛正在继续下降,Agent 产品开始把工作流抽象成更接近普通用户也能维护的资产,而不只是工程师专属脚本。
阿里放出 Qwen-Robot Suite,基础模型竞争开始直接延伸到机器人导航、操作与世界预测
Qwen-Robot Suite 同时覆盖 RobotNav、RobotManip 和 RobotWorld,把语言优先接口继续向物理动作和世界建模打通。这个发布值得注意的地方在于,头部模型公司已经不满足于做屏幕内智能,而是在把机器人能力拆成可复用的基础模型组件,试图提前占住通往具身智能的平台层入口。
Artificial Analysis 发布 AA-Briefcase,Agent 评测开始逼近多周知识工作交付
AA-Briefcase 把任务拉长到多周项目,输入扩展到邮件、Slack、文档与表格,输出则要求完成财务模型、汇报材料等真实交付物,并同时比较质量与任务成本。它的价值不在于又一个排行榜,而在于行业终于开始用更接近现实知识劳动的方式衡量 Agent,长链路交付能力和单位任务经济性正在变成新的核心指标。
MiniMax 开源 M3,开放多模态模型继续把长上下文、视频理解和工程可接入性一起往前推
MiniMax M3 以 428B 总参数、23B 激活参数和原生多模态训练路线发布,并把文本、图像、视频与长上下文能力放到同一套开源体系里推进。真正重要的是,开源阵营已经不再只补纯文本短板,而是在多模态理解和实际接入能力上同步抬高上限,开放生态的竞争半径正在继续扩大。
豆包实时语音模型 3.0 上线 API,实时语音 Agent 开始真正具备边听边说边调用工具的产品形态
火山引擎开放豆包实时语音模型 3.0 API,强调全双工端到端语音交互、动态判停和实时工具调用,并给出更低延迟和更少抢话的数据改进。它的重要性在于,语音模型竞争正在从“能不能说”转向“能不能稳定完成任务”,实时语音 Agent 距离成为一类独立产品形态又近了一步。