Anthropic 因美国出口管制临时下线 Claude Fable 5 与 Mythos 5,前沿模型供给风险第一次被集中暴露
Anthropic 表示在美国政府指令下,必须暂停部分用户对 Claude Fable 5 和 Mythos 5 的访问,并一度波及下游产品与榜单。这条新闻最值得关注的不是单次下线,而是前沿模型已经明确进入地缘与合规约束区间,依赖单一闭源供应商的产品和研究团队都开始面临真实的连续性风险。
Moonshot 开源 Kimi-K2.7-Code,把千亿级 MoE 编码模型继续推向高性能与低 token 成本
Kimi-K2.7-Code 延续 Moonshot 在开源编码模型上的进攻节奏,官方给出多项基准提升,并强调推理 token 消耗进一步下降。它的价值不只在分数,而在于国产开源编码模型正在同时追求更强代码能力、更长上下文和更低部署成本,和闭源 coding agent 的竞争开始更直接。
MiniMax 开源多模态 M3,428B 参数配 1M 上下文,开放大模型继续向原生视频与长上下文推进
MiniMax M3 以原生多模态 MoE 形态发布,覆盖文本、图像与视频输入,同时给出 1M token 上下文和稀疏注意力设计。真正重要的点在于,开源阵营不再只补齐纯文本能力,而是在多模态理解、长上下文和工程可接入性上同步发力,开放生态的上限正在继续抬高。
OpenAI 向全部个人用户开放 ChatGPT 锁定模式,把高风险联网能力做成一键收紧的安全开关
OpenAI 在 ChatGPT 个人版全量开放锁定模式,启用后会关闭实时联网、深度研究、Agent 模式、图片检索和文件下载等高风险能力,仅保留更受控的使用路径。这个动作说明面向大众的 AI 产品正在把“默认可用”之外的安全分级做得更细,能力治理开始成为产品层面的基础设施。
Artificial Analysis 推出 AA-AgentPerf,开始用“每兆瓦可跑多少 Agent”衡量推理基础设施
AA-AgentPerf 把长链路 coding agent 轨迹、KV cache 复用和推测解码等生产优化一起纳入评测,并用 Agents per Megawatt 作为核心指标。相比传统吞吐榜单,这更接近真实部署关心的问题:不是模型单次能跑多快,而是单位功耗下能稳定支撑多少可交付的智能体任务。
Agents’ Last Exam、SciConBench 与 PostTrainBench 同周升温,Agent 评测全面转向长任务与真实劳动场景
本周多个新评测同时强调更长链路、更高专业门槛和更接近现实工作的任务设计,包括跨 55 种职业的 Agents’ Last Exam、面向科学证据综合的 SciConBench,以及关注模型递归改进能力的 PostTrainBench。这个趋势说明行业已经不再满足于短题式跑分,而是开始追问 Agent 在真实知识工作里究竟能不能持续交付。