Anthropic 发布 Claude Sonnet 4.6:百万上下文与代码库级重构能力强化 Agent 与编程场景
Anthropic 推出 Claude Sonnet 4.6,在编程、Agent 规划与计算机操作能力上显著提升,性能接近甚至超越 Opus 4.6,并提供 100 万 token 上下文窗口,可单次调用处理完整代码库,价格保持不变并已上线 Claude 与 AWS,进一步强化企业生产力场景竞争。
Context Arena测试显示Gemini 3.1 Pro Preview多针检索能力接近GPT-5.2
Context Arena更新MRCR(多针上下文检索)测试结果,显示Google的Gemini 3.1 Pro Preview在简单检索任务(2针AUC 99.6%对99.8%)上接近GPT-5.2(thinking:xhigh),在更具挑战性的多针检索任务(8针AUC)上表现明显更强。
阿里通义千问发布 Qwen3.5:原生多模态 + 稀疏 MoE,大幅提升推理效率直指顶级模型竞争
阿里通义千问发布新一代 Qwen3.5 系列,旗舰 Qwen3.5-397B-A17B 采用混合注意力与稀疏 MoE 架构,实现数倍推理效率提升,并在指令遵循、视觉语言、空间智能与视频理解等多项基准中对标 GPT-5.2、Claude 4.5 与 Gemini 3 Pro,显示出全面竞争力,标志国内大模型在多模态与效率层面的重要进展。
OpenAI 招募 OpenClaw 创始人并支持其进入开源基金会:押注“个人 AI Agent 平台”生态
OpenAI 并未收购 OpenClaw,而是吸纳其创始人加入公司开发下一代个人 AI Agent。OpenClaw 项目将进入基金会并保持开源,由 OpenAI 提供支持。这一举动被视为从聊天模型竞争转向代理执行能力竞争的重要信号,意味着未来 AI 产品形态将更偏向可操作的软件代理生态。
Anthropic发布AI代理自主性研究并登陆Arena搜索模态排行榜
Arena平台将Opus和Sonnet 4.6添加到搜索模态排行榜。同期,Anthropic发布《实践中测量AI代理自主性》研究报告,基于数百万次工具使用交互分析发现,约73%的工具调用表面看似由人类发起,实际可能涉及自动化代理行为。
智谱AI发布GLM-5技术报告提出异步代理强化学习架构
GLM-5技术报告正式发布,提出从vibe-coding向代理工程转变的技术路线,特色包括解耦生成与训练的异步代理强化学习机制,并引入新架构组件以支持更复杂的异步代理行为与工程化应用。