OpenAI 发布 GPT-5.5:面向真实工作流与 Agent 的旗舰模型继续拉高上限
GPT-5.5 本周成为最受关注的模型发布之一,覆盖 ChatGPT、Codex 等产品面,并在长上下文、代码与知识工作场景继续强化。它的重要性不只是分数提升,而是 OpenAI 正在把旗舰模型进一步对准“真实工作流里的可用性”和长期 Agent 运行能力。
DeepSeek-V4 Pro 与 Flash 同步开源:1M 上下文和极致定价把开源阵营推到新高度
DeepSeek 在 GPT-5.5 发布后迅速给出 V4 系列预览版,包含 Pro 与 Flash 两档模型,均支持 1M 超长上下文,并打出极具冲击力的价格与 MIT 许可。这个发布值得排在前列,因为它同时改变了开源模型能力边界、商用成本预期和国产大模型的话语权。
OpenAI 推出 GPT-Image-2:图像生成从“好看”转向高可控生产力工具
GPT-Image-2 正式进入 API 与 ChatGPT,被认为在文字渲染、版式控制、编辑一致性和多语言支持上有明显提升。它值得关注,因为图像模型竞争正在从视觉风格转向可直接用于广告、海报、界面和文档资产生产的稳定能力。
Google 同时推进 TPU v8 与 Gemini Enterprise Agent Platform:算力和企业 Agent 平台开始一体化下注
Google 在 Cloud Next 一边发布第八代 TPU 训练与推理系统,一边把 Vertex AI 演进成更明确的企业 Agent 平台。这个组合动作的关键不是单点新品,而是谷歌正在把模型、基础设施和企业治理能力打包成更完整的商业闭环。
月之暗面开源 Kimi K2.6:长程编码与多 Agent 集群能力继续刷新开源上限
Kimi K2.6 以长时间自主编码、超长任务执行和多 Agent 协作能力成为本周最强开源模型之一,并快速获得多平台接入支持。它值得重点关注,因为开源模型正在更快补齐从单轮问答到复杂任务执行的关键差距。
Gemini Deep Research 升级为更可编排的 API:研究型 Agent 正在成为可调用基础能力
Google 将 Deep Research 和 Deep Research Max 进一步开放为 API 级能力,支持协作式规划、MCP 接入和多模态输入。这个方向的意义在于,复杂研究流程不再只是聊天产品的高级功能,而开始成为开发者可复用的工作流模块。
Hugging Face 推出 ml-intern:开源 Agent 开始尝试自动化“后训练研究循环”
ml-intern 把读论文、追踪引用、整理数据集和构建实验环路整合进一个开放 Agent 系统,代表了更接近研究助理的自动化路线。它值得关注,因为开源社区开始把 Agent 从“帮你写一段代码”推进到“替你推进一个研究过程”。
DeepMind 发布 Decoupled DiLoCo:跨数据中心预训练的韧性与低通信成本成为新焦点
Decoupled DiLoCo 关注的是全球分布式训练在异构硬件和不稳定网络下如何继续高效运行,这类工作属于长期被低估的模型基础设施创新。它值得入选,因为未来顶级模型竞争不只看算法和数据,也取决于谁能更稳定地组织全球算力。
腾讯混元推出 Hy3 Preview:快慢思考融合的 MoE 架构继续押注高难推理与 Agent 编码
Hy3 Preview 被定位为腾讯重建训练、强化学习和基础设施体系后的关键成果,强调快慢思考融合、长上下文和小程序级代码生成能力。它值得关注,因为国内头部模型厂商正在重新投入“底层能力重做”而不是表层功能追赶。
字节发布 Seed3D 2.0:3D 生成从演示可看迈向生产可用
Seed3D 2.0 在几何、纹理和下游可编辑能力上继续推进,并加入部件拆分、关节建模和场景组合等更接近生产流程的能力。它的重要性在于,3D 生成正在从单次效果展示转向真正可进入工业和内容工作流的资产生产。
百灵 Ling-2.6-Flash 揭晓:高效长上下文与低 Token 成本开始成为新卖点
Ling-2.6-Flash 用 MLA 与线性注意力混合结构,把推理速度、长上下文和 Token 成本做成了同一套产品叙事。对于市场来说,这类模型的价值在于把“够强”与“够省”放到同一张桌子上重新排序。
StepAudio 2.5 ASR 发布:语音识别进入“大模型加速 + 长音频转写”新阶段
StepAudio 2.5 ASR 把大模型推理加速方法引入 ASR,在速度、时延和成本上同时给出大幅改善,并支持更长音频一次性转写。它值得进入本期榜单,因为语音赛道正在从模型效果竞争走向真正可规模部署的系统能力竞争。