Anthropic 发布 Claude Opus 5.5
Anthropic 发布 Claude 5.5 系列首款模型 Opus 5.5,官方数据显示其 Terminal-Bench 4.0 得分达 66.4%,运行成本较 Opus 5 降低 40%、速度提升 30%。模型在编程、计算机操作与知识工作上的同步升级,将直接影响高复杂度 Agent 的能力上限和部署成本。
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna
OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,两款模型的 API 价格较 GPT-5.6 系列降低 50%,其中 Luna 以更低成本提供接近高阶模型的能力。新品把前沿模型竞争进一步推向价格与推理效率,对大规模 Agent 调用和模型路由的成本结构影响尤其直接。
小米开源全模态模型 MiMo-V2.6 Pro 与 Flash
小米发布 MiMo-V2.6 Pro 和 Flash,开放模型权重、技术报告、强化学习环境与训练代码;Pro 采用 1.02T 总参数、42B 激活参数,在 Artificial Analysis 智能指数中取得 46 分。MIT 许可与完整 RL 资产同时开放,为开发者复现全模态后训练和低成本部署提供了少见的完整样本。
阿里推出 AI 手机全栈方案 Qwen Intelligence
Qwen Intelligence 向手机厂商提供场景优化模型、定制平台及 Mobile Planner、Mobile-Use、Mobile Creative 三类 Agent,其中 Mobile-Use 采用 API 优先、GUI 兜底策略,端到端成功率为 90%。这套不绑定自有硬件的方案把规划、设备操作和内容生成打包交付,为手机厂商接入系统级 Agent 提供了更短路径。
阶跃星辰开源终端编程智能体 Step Code
阶跃星辰以 MIT License 开源 Step Code,可在终端中完成编码、调试、执行与交付,官方报告其 Terminal-Bench 2.1 通过率为 80.9%。开源 Agent Harness 加上长程任务评测结果,为开发者检查工具调用、上下文管理和成本效率提供了可复用基线。
阿里通义发布 Qwen-Audio-3.1 五款语音模型
Qwen-Audio-3.1 系列覆盖语音识别、理解、合成、声音创作与实时交互,其中 ASR 支持 30 种语言和 16 种方言,Realtime 支持全双工对话、语种切换及 Agent 工具调用。统一的语音模型组合把转写、生成和行动链路连在一起,有助于硬件与客服等场景减少多模型拼接成本。
蚂蚁开源 Ming-Image-0.1-Design 与 Layer 图像模型
蚂蚁 inclusionAI 开源两款 6B 参数模型,Design 可生成 UI 和海报等完整设计,Layer 可把设计图拆成 2 至 9 个透明可编辑图层。模型把视觉生成从成品图片推进到结构化设计资产,并以较小参数规模降低专业设计工作流的推理门槛。
Black Forest Labs 开源 7B 世界动作模型 FLUX 3 Action
Black Forest Labs 发布开放权重的 FLUX 3 Action,模型参数量为 7B,官方称其 RoboLab 得分较此前最佳开源模型高 6.1 分,参数减少 56%、运行速度最高提升 3.95 倍。更小的世界动作模型有利于机器人团队在有限算力下验证感知到行动的闭环。
Harness-Zero 将 Agent Harness 行为蒸馏进模型
Harness-Zero 通过把优化后的 Agent Harness 蒸馏进模型,使部署时不携带 Harness 的宏观任务成功率由 23.3% 提升至 44.3%,并恢复 82.3% 的 Harness 诱导行为。研究表明部分编排能力可以转化为模型内部能力,为减少线上工具链复杂度和推理开销提供了新方向。
阿里通义开源 7B 图像模型 Qwen-Image-2.1
Qwen-Image-2.1 将文生图与图像编辑合并在 7B 视觉生成模型中,原生支持透明图像、透明图层、抠图和最多 10 张参考图输入。较小模型与结构化编辑能力的组合,更适合电商素材和设计工具集成,也降低了多参考图工作流的部署成本。