DeepSeek 发布 DeepSeek Harness 开发者预览
DeepSeek 上线 DeepSeek Harness developer preview,将 coding agent 与 runtime environment 组织为可插拔体系,官方页面将其概括为“Everything is a plugin”。这说明 Agent 竞争正在进一步从模型 API 下沉到 harness、runtime 和插件编排层,后续差异会越来越多地体现在执行系统而不是模型本体。
xAI 发布 Grok 4.6
xAI 发布 Grok 4.6,并表示其在与 Grok 4.5 相同价格下提升了长任务、视觉交互和 Agent 场景表现,官方训练说明提到模型规模为 1.5T。前沿模型正在把定价竞争与 Agent 长时执行能力绑定,编码和自动化产品的默认模型选择可能继续下探到更低成本区间。
OpenAI 推出受限访问的 GPT-5.6-Cyber
OpenAI 宣布 GPT-5.6-Cyber 与 Daybreak 网络安全计划扩展,模型仅向经过审批的防御方开放,并配套更严格的监控与使用控制。高风险安全能力开始以专门模型和准入机制交付,说明前沿实验室正在把防御场景产品化而不是继续走通用模型开放路线。
GitHub 发布 Agent Plugins 1.0
GitHub 宣布 Agent Plugins 1.0,把 skills、MCP servers 和 AI extensions 打包为统一插件形态,并同步更新会话管理与界面体验。Agent 工具接入正在从零散集成走向可分发的标准包,开发团队会更容易复用能力并建立跨平台工作流。
微软在 Foundry 上线推理模型 MAI-Thinking-1
Mustafa Suleyman 宣布 MAI-Thinking-1 已在 Azure AI Foundry 可用,并将其描述为微软首个从零训练的推理模型。微软开始把自研推理模型直接接入开发平台,云厂商在模型层与应用层一体化竞争会进一步加剧。
NVIDIA 发布 Nemotron 3.5 Lightning
NVIDIA 发布 Nemotron 3.5 Lightning,将 30B 级 MoE 模型定位为常开型 Agent 工作负载,强调 1M 上下文、开放权重与更高吞吐。面向持续运行 Agent 的模型开始按速度、上下文和可定制性交付,企业部署会更重视推理效率而不只是单点榜单成绩。
Cohere 开源小型视觉语言模型 North Micro Vision
Cohere 发布 Apache-2.0 许可的 North Micro Vision,主打文档理解,并称其在多项视觉基准上超过同量级 Gemma 和 Ministral 模型。小型开源 VLM 已开始覆盖企业文档场景,低成本本地多模态能力会更容易进入实际产品。
Google DeepMind 发布手语转文本系统 SL2T
Google DeepMind 公布 SL2T,用于 Android 和 Pixel 11 的美式手语输入,官方说明其姿态跟踪在端侧完成而翻译在服务端执行。多模态输入正在从图像和语音扩展到更复杂的人体表达,辅助交互与设备级 AI 能力边界被继续推高。
Anthropic 称研究版 Claude 改进黎曼猜想相关下界结果
Anthropic 表示一款未发布研究版 Claude 在探索黎曼猜想相关问题时,将临界线上零点比例的下界从 41.6% 提高到 67.2%,但并未解决该猜想本身。这表明大模型在高难度数学搜索中的价值正在从答案生成转向大规模试探、筛选与证明辅助。