Anthropic推出Claude Mythos,性能碾压Opus 4.6
Anthropic发布最强模型Claude Mythos,能发现数千高危漏洞,仅向大型企业开放,用于安全加固,展示前沿AI在安全领域的极端能力。
智谱开源旗舰模型GLM-5.1,全球第三、国产第一
GLM-5.1突破长时间自主工程任务能力,连续8小时完成复杂任务,超越GPT-5.4与Claude Opus 4.6,SWE-Bench Pro全球第三。
Meta发布原生多模态大模型Muse Spark,AI股价大涨10%
Meta推出Muse Spark,多模态推理架构支持视觉思维链、多Agent编排和沉思模式,在CharXiv和HealthBench表现突出,引发股价上涨。
Claude推出企业级托管Agent服务,10倍开发效率提升
Claude Managed Agents为企业提供多Agent协调、长时会话和安全沙箱,实现快速部署和开发效率提升,Notion、Rakuten等已采用。
字节跳动推出全双工语音大模型Seeduplex,实现规模化落地
Seeduplex基于边听边说框架,降低误回复率50%、抢话比例40%,提升对话流畅度和用户满意度,首次实现大规模落地全双工语音。
腾讯发布浏览器AI Agent“龙虾”QBotClaw,实现零门槛远程控制
QBotClaw集成在QQ浏览器,可通过一句话指令完成资料搜集、写文案、监控热点、购物比价等复杂任务,具备上下文记忆与高精度网页识别能力。
MiniMax发布MMX-CLI,全模态命令行工具助力Agent自动化
支持Claude Code、OpenClaw等环境原生调用AI模型,覆盖编程、视频、语音、音乐等多模态任务,实现完整自动化工作流。
Akshay Pachaar:Advisor模式成为AI Agent新设计范式
“cheap executor + expensive advisor”模式获得开源实践验证,显著提升任务效率和多模型协作,未来Agent趋势倾向快速Worker模型辅以智能Advisor。
NousResearch展示Hermes Agent生态优势,Agent技能持续进化
Hermes Agent通过持久记忆、自生成技能和自我改进循环获得关注,Manim技能实现技术动画输出,成为开源Agent参考样例。
Memory设计正转向保存问题解决路径而非单纯事实
MIA框架强调管理者/规划者/执行者循环,保留完整任务轨迹,Databricks展示未人工干预的用户日志即可优于手工指令。
Gemma 4引领本地部署热潮,移动设备也可高速运行
Gemma 4 E2B在iPhone 17 Pro上可达约40 tok/s,强调本地-first部署和易用性,成为边缘推理参考点。
Karpathy发布自运行个人知识库LLM Wiki
基于Agent自动构建个人知识库,数据摄取、查询、质量检查闭环,实现知识持续积累与自我增强,适用于研究和企业管理。
阿里通义发布VimRAG RAG框架,实现跨模态精准检索
采用动态DAG和视觉能量分配策略,Qwen3-VL-8B模型上准确率50.1%,优于传统线性拼接方案,实现文本、图像、视频跨模态关联推理。