OpenAI 将 Codex 扩展为通用工作助手:从写代码走向处理文档、表格与研究任务
OpenAI 发布重大更新,将 Codex 从编程工具升级为可处理各类电脑任务的通用工作助手,并加入角色化 onboarding、应用连接和工作流能力。更新后浏览器与电脑操作速度明显提升,显示出 OpenAI 正把 AI 从模型接口转向完整生产力应用。
Google 发布 TPU 8t 与 TPU 8i:训练成本性能最高提升约 180%
Google 公布新一代 TPU 8t 和 TPU 8i 芯片,在训练与推理成本效率和能耗方面实现显著提升,其中训练成本性能提升约 170%–180%。同时数据中心网络带宽提高 300%,为大规模模型训练和推理提供更高效基础设施。
GPT‑5.5 在网络攻击模拟中完成端到端任务,AI 安全评估进入新阶段
英国 AI Security Institute 报告称 GPT‑5.5 已能在多步骤网络攻击模拟中完成完整攻击链,表现接近 Claude Mythos。该结果表明前沿模型在复杂长期任务中的能力持续增强,也凸显 AI 在网络安全领域的潜在风险与应用价值。
NVIDIA 发布 Nemotron 3 Nano Omni:30B 多模态开源模型覆盖语音、视频与文档
NVIDIA 推出 Nemotron 3 Nano Omni,这是一个 30B 参数的多模态 MoE 模型,支持文本、图像、视频、音频和文档输入。模型在多个推理平台同步上线,标志着面向智能体工作负载的多模态基础模型生态进一步扩展。
Qwen3.6 27B 成为 150B 以下最强开源模型之一
Artificial Analysis 评测显示 Qwen3.6 27B 在 Intelligence Index 上达到 46 分,成为 150B 参数以下能力最强的开源模型之一。该模型支持 262K 上下文并具备多模态输入,体现出开源模型在能力和规模效率上的快速进步。
xAI Grok 4.3 发布:性能提升同时推理价格最高下降 60%
Artificial Analysis 指出 Grok 4.3 在 Intelligence Index 上提升至 53 分,并在部分代理任务基准中显著进步。与此同时其 API 价格大幅下降,输入和输出成本分别降低约 40% 与 60%,显示模型竞争正快速转向成本效率。
SenseNova‑U1 发布:单模型实现原生多模态生成与理解
SenseNova‑U1 在一个模型中同时实现多模态生成与理解能力,并绕开传统扩散或 VAE 架构。该模型能够在图像中直接生成文字、信息图和复杂视觉结构,并支持带推理能力的图像编辑。
Poolside 开源 Laguna XS.2:单 GPU 可运行的 MoE 编程模型
Poolside 发布开源编码模型 Laguna XS.2,采用 33B 参数、3B 激活的 MoE 架构,并可在单 GPU 上运行。该模型采用 Apache 2.0 许可,强调从数据到训练与推理全部自研的完整技术栈。
科大讯飞发布星火 X2-Flash:30B MoE 模型押注低成本长上下文与 Agent 能力
科大讯飞正式推出并开放星火 X2-Flash API,模型采用 30B 参数的 MoE 架构,支持 256K 超长上下文,并基于华为昇腾 910B 国产算力集群训练。它值得纳入本期,因为这代表国内厂商正把长上下文、代码与智能体能力,以及更低推理成本,打包成一条更明确的商业化模型路线。
阿里发布 Qwen‑Scope:面向 Qwen 模型的可解释性工具套件
阿里 Qwen 团队推出 Qwen‑Scope,这是一个基于稀疏自编码器的模型可解释性工具集。工具支持特征分析、模型调试和数据生成,显示大型模型生态开始重视可解释性与调控能力。