OpenAI 预览 GPT-5.6 Sol,并以受信合作伙伴限量方式把前沿 Agent 能力推向更高门槛
OpenAI 本周发布 GPT-5.6 系列中的 Sol、Terra、Luna,并明确 Sol 仅向受信合作伙伴开放预览,重点强调其在编码代理与网络安全长任务上的能力提升。它值得关注,不只是因为性能继续上探,而是前沿模型的发布方式开始更像受控部署而非面向所有开发者同步开放,能力竞争与准入机制正在被一起重写。
Google 将 Interactions API 升级为 Gemini 默认接口,Agent 平台能力开始从模型端点走向一体化运行层
Google 宣布 Interactions API 正式 GA,并成为 Gemini 模型与 Agent 的主接口,支持异步后台执行、更多工具接入、多模态生成、托管 Agent 和隔离远程 Linux 沙箱。它的意义在于,Google 不再只卖模型能力,而是在补齐一整套一方 Agent 运行基础设施,直接争夺开发者的长期工作流入口。
Anthropic 推出 Claude Tag,让 Claude 以 Slack 团队成员身份异步接入真实协作线程
Anthropic 发布 Claude Tag,允许 Claude 作为团队成员加入 Slack,对指定频道、工具、数据和代码库进行异步协作,并在需要时被直接 @ 进工作线程。相比单人 coding agent,这一步更像把智能体从个人助手扩展为组织协作层,企业内部的沟通工具正逐步演变成多 Agent 编排界面。
GLM-5.2 被普遍视作首个接近前沿闭源阵营的开源 Agent 模型,开放权重重新回到主舞台中央
Artificial Analysis 本周将 GLM-5.2 评价为首个在代理型工作上被广泛视作“前沿相邻”的开放权重模型,其在整体排名与成本性能前沿上都进入第一梯队。这个信号很关键,因为它说明开源模型竞争不再停留在可用替代,而开始逼近真实生产知识工作与长任务场景中的闭源体验上限。
阿里开源 Qwen-AgentWorld,把 MCP、搜索、终端与操作系统环境一起装进语言世界模型
阿里 Qwen 发布 Qwen-AgentWorld 和 AgentWorldBench,提出用语言世界模型统一模拟 MCP、Search、Terminal、SWE、Web、OS 与 Android 等七类环境,并开源 35B MoE 模型与评测基准。它的重要性在于,Agent 训练的重心正从单纯提升工具调用能力,转向先构建可大规模预训练和复用的环境模拟层。
Sakana 推出 Fugu,用单一 API 学会路由、委派、验证与汇总,多模型编排被包装成新产品形态
Sakana AI 发布 Fugu,将多前沿模型的选择、委派、校验和综合封装成单一接口,并用自动研究、金融分析、盲棋和 CAD 等案例展示 test-time orchestration 的收益。它值得跟踪,因为“发布一个模型”正在逐步让位于“发布一套学会如何调度模型的系统”,编排层本身开始成为新的产品与研究对象。
NVIDIA 发布 GLM-5.2 NVFP4 检查点并接入 vLLM,开源强模型开始快速获得生产级部署支撑
NVIDIA 为 Blackwell 平台发布官方 GLM-5.2 NVFP4 检查点,vLLM 也同步增加支持,强调更低显存占用下保持推理、代码和长上下文表现。开放权重模型一旦进入官方硬件优化和主流推理框架支持阶段,竞争就不再只看榜单,而是看能否迅速进入真实生产环境。
Epoch 与 METR 推出 MirrorCode,把 SWE Agent 评测拉长到以“天”为单位的真实工程任务
MirrorCode 引入持续数天的长周期软件工程任务,并开源其中 25 个项目里的 22 个,试图衡量模型完成接近真实开发工作的能力边界。相比短时 benchmark,这类评测更接近开发团队真正关心的交付结果,也会迫使模型厂商把长期记忆、验证和任务管理做得更扎实。
腾讯混元开源 PhoneBuddy,用 4B 手机 Agent 模型把真机操作训练推向更轻量的可复用路线
腾讯混元开源 4B 参数手机 Agent 模型 PhoneBuddy,并一并公布 PhoneWorld、PhoneHarness 等论文与配套体系,强调 Real+Mock 混合强化学习训练。这个方向值得关注,因为移动端 Agent 如果能在更小参数规模下具备稳定操作能力,落地门槛会明显下降。
百度开源 Unlimited-OCR,把长文档端到端解析能力继续往更长上下文和更稳速度推进
百度开源 Unlimited-OCR,主打一轮解析数十页长文档,并通过参考滑动窗口注意力机制在文档变长时保持更稳定的推理速度。长文档 OCR 是企业知识处理和多模态 RAG 的关键入口,这类模型的成熟会直接影响后续检索、抽取和自动化流程的质量。
字节发布 Seed2.1,继续把通用 Agent、代码交付和多模态能力绑定成统一生产力模型路线
字节跳动推出 Seed2.1 系列模型,强调其面向真实生产力场景的通用 Agent、代码端到端交付和多模态理解能力,并在多项公开基准中给出领先表现。它说明头部厂商正在把“会聊天”的模型重新打包成“会做事”的生产力底座,Agent 能力正成为新一代主模型的默认要求。
字节推出 Seedance 2.5,视频生成开始向更长时长、更强参考控制和 3D 资产衔接升级
Seedance 2.5 在火山引擎大会上亮相,强调单段原生 30 秒视频、50 个全模态参考输入和局部可控编辑能力,同时支持承接专业 3D 资产工作流。视频生成竞争正在从“能生成”转向“能否稳定进入专业制作链条”,控制力和资产兼容性会变得比单帧美观更重要。
豆包专业版正式上线,桌面操作、浏览器和 Office 任务被打包成面向个人与团队的付费 Agent 套餐
豆包推出专业版订阅,强调本地电脑操作、浏览器执行、Skills 调用、定时任务和 Office 内置能力,并给出多档价格。它的重要性在于,通用模型厂商开始更明确地把 Agent 能力商品化为可持续订阅服务,而不只是免费聊天入口的附加功能。
微信开始小范围测试原生 AI 助手“小微”,超级 App 正在把 Agent 深嵌进高频入口
微信启动原生 AI 助手“小微”小范围内测,支持在应用内通过文字或语音直接调起消息、设置、小程序和图像生成等能力。它值得关注的地方不在某个模型指标,而在于中国最高频应用之一开始尝试把 Agent 做成系统级入口,这会重新定义 AI 的分发位置。