多家中国厂商围绕 OpenClaw 推出一键部署、本地版与云托管版本,Agent 操作系统生态进入平台化扩散期
本周包括讯飞、阶跃、百度、智谱、腾讯、火山等多家厂商围绕 OpenClaw / Claw 生态推出本地或云端方案。它值得关注,因为这说明 Agent 操作系统级产品正在快速平台化、国产化与场景化,竞争焦点将很快转向安全、技能生态与企业接入能力。
Anthropic 将 Opus 4.6 的 100 万上下文扩展为 Max/Team/Enterprise 默认能力,长上下文开始从“展示能力”走向“产品默认配置”
Anthropic 本周把 Opus 4.6 的 1M context 推进到更广泛企业用户,并取消部分长上下文额外门槛。值得关注的不只是上下文本身,而是长上下文正从高端特性变成默认供给,直接影响文档分析、代码库理解、长链路 Agent 与企业知识处理的产品设计。
NVIDIA 发布 Nemotron 3 Super:120B 开源权重模型瞄准 Agent 场景,重点不只是参数规模而是推理经济性
Nemotron 3 Super 以约 120B 参数、约 12B 激活、100 万上下文和 LatentMoE / 混合架构切入开放模型赛道。它的价值在于把“更适合 Agent、长上下文、Blackwell 部署、更高吞吐”放在同一代产品里,说明开源模型竞争已经从 benchmark 转向吞吐、缓存、部署成本与系统适配。
Google 发布 Gemini Embedding 2:首个原生多模态嵌入模型,把文本、图像、音频、视频与 PDF 拉进同一向量空间
Gemini Embedding 2 支持文本、图片、音频、视频和 PDF 的统一嵌入,并支持可变维度表示。它值得关注,因为多模态检索正从“先 OCR / 先拆模态”转向原生统一索引,这会直接改变 RAG、企业知识库、内容搜索与多模态语义理解系统的底层架构。
Perplexity Computer 持续扩张到 iOS 与跨设备同步,Agent 正在从“聊天框”演化为持续在线的个人计算入口
Perplexity Computer 本周进一步推进跨设备控制、远程任务管理与多模型编排能力。它值得关注,因为这代表 Agent 产品形态正在从单轮问答,升级为长期运行、跨终端同步、可远程接管任务的“持续会话计算机”。
OpenAI 收购 Promptfoo:评测与安全测试被正式纳入 Agent 开发主链路,Eval 不再是附属环节
OpenAI 宣布收购开源评测与安全测试工具 Promptfoo。值得关注的是,随着 Agent 与自动化系统复杂度提升,评测、安全红队和回归测试开始前移到开发流程中,成为产品上线与企业采购的核心门槛。
Claude 现在可直接生成交互式图表与图解,生成式 UI 从概念走向主流产品能力
Anthropic 为 Claude 增加交互式图表与图解生成能力。值得关注的是,模型输出正在从纯文本升级为可操作界面,这意味着未来聊天产品的竞争不只是回答质量,更是能否直接生成可交互的信息载体与任务界面。
Claude Code 推出多 Agent PR Review:代码生成之后,评审与验证正在成为新的价值高地
Anthropic 推出多 Agent 并行代码审查能力,强调问题发现、验证与严重级别排序。它值得关注,因为在 Coding Agent 普及后,真正稀缺的已不是“写代码”,而是“验证代码、治理风险、提升合入质量”。
Cursor 发布 CursorBench:编码模型评估开始从单点基准转向“正确率 + Token 效率 + 真实请求表现”
Cursor 本周发布新的 CursorBench 方法论,强调离线基准与线上真实请求结合。它值得关注,因为编码模型评估正在摆脱只看 benchmark 排名的阶段,开始纳入效率、行为模式、交互成本与真实开发任务适配度。
Agent Memory 成为本周最强技术母题:IBM 与多方研究把“长期记忆”推到 Agent 差异化中心
围绕 Agent 轨迹学习、长期记忆、多 Agent 内存层级与技能沉淀的讨论本周显著升温。它值得关注,因为 Agent 产品真正的护城河,正在从模型调用能力转移到“是否能积累经验、跨任务复用能力、长期贴合用户与场景”。
MIT 方向 RandOpt / Neural Thickets 引发热议:随机高斯搜索可能接近甚至挑战 RL 微调效果
一组 MIT 相关作者提出,通过对预训练模型参数注入高斯噪声并做组合搜索,可能在推理、编码、写作和化学等任务上逼近甚至超过传统 RL 后训练。它值得关注,因为这挑战了后训练必须依赖复杂优化过程的默认共识。
Open Deep Research v2 开源:自主研究 Agent 正从概念 Demo 进入可复现工具链阶段
Together AI 推出 Open Deep Research v2,并开放应用、代码、评测集与博客。它值得关注,因为“自动做研究”不再只是概念炒作,而是在逐步形成可复现、可评测、可迭代的工程体系。
Google Maps 以 Gemini 为交互层进行十余年来最大升级,地图产品开始从“看图导航”转向“对话式地理智能”
Google 正将 Gemini 深度嵌入 Maps,包括 Ask Maps 与更强的沉浸式导航。它值得关注,因为地图类产品的未来界面可能不再以地图本身为中心,而是以 LLM 驱动的地理知识交互为中心。
WAXAL 开源非洲多语音数据集:低资源语言语音 AI 的数据基础设施迎来重要补强
WAXAL 提供覆盖多种非洲语言的 TTS / ASR 数据资源。它值得关注,因为语音 AI 的全球化瓶颈很大程度上卡在数据供给,而非模型结构,社区级多语音数据集会直接影响后续应用覆盖与公平性。
IndexCache 提出跨层复用稀疏注意力索引,超长上下文优化还远没到头
IndexCache 通过跨层复用 DeepSeek Sparse Attention 的索引信息,在超长上下文推理中获得显著加速。它值得关注,因为在长上下文落地阶段,真正决定产品成本与体验的,往往不是模型新增能力,而是缓存、索引与 serving 侧工程优化。
小红书发布 FireRed-Image-Edit v1.1:图像编辑开始强化人物一致性、多元素融合与参考风格控制
FireRed-Image-Edit v1.1 在 ID 一致性编辑、多元素组合、美妆风格与老照片修复等方面增强。它值得关注,因为图像编辑赛道的竞争正在从“能不能改”转向“人物是否稳定、元素是否可控、风格是否能被持续复用”。