Google推出Gemma 4:全球开放模型性能最强,支持多模态与长上下文
Google发布Gemma 4系列开放模型,含E2B、E4B、26B MoE和31B Dense版本,专为高级推理和智能体工作流设计,支持140+语言、多模态及长上下文,Apache 2.0开源许可,31B/26B在Arena排行榜上分别位列全球开放模型第3和第6。
阿里通义Qwen3.5-Omni:全模态大模型实现音视频任务SOTA
阿里通义推出Qwen3.5-Omni,全模态支持文本/图像/音频/视频输入,新增实时音色克隆、语义打断和语音控制功能,支持256K上下文和113种语言识别,在215项音视频任务中超越Gemini 3.1 Pro。
Z.ai发布GLM-5V-Turbo:多模态Coding基座模型,支持设计稿直接生成代码
智谱推出GLM-5V-Turbo,多模态融合视觉与文本能力,支持从设计稿、截图生成可运行代码,上下文窗口达200k,在多模态Coding和GUI Agent基准中领先,适配Claude Code与AutoClaw等框架。
阿里通义Qwen3.6-Plus:编码智能体能力全面跃升
通义实验室发布Qwen3.6-Plus,聚焦编码智能体能力跃升,支持百炼API调用,默认100万上下文窗口,多模态感知与推理同步增强,在前端开发和复杂文档理解任务表现突出。
Nous Hermes Agent:开源多智能体架构引领本地Agent潮流
Nous发布Hermes Agent更新,推动用户从OpenClaw迁移,增强内存/技能/历史隔离能力,支持快速部署多智能体,形成可复用Agent OS抽象,显著改善本地AI工作流体验。
ZINC本地推理引擎:跳过ROCm在AMD GPU上实现4倍加速
ZINC通过Vulkan直接调用AMD GPU,无需ROCm,实现AMD Radeon AI PRO R9700上4倍推理加速,支持Qwen3.5-35B-A3B和Qwen3.5-2B模型,开源且兼容OpenAI API并支持并行请求批处理。
AI Agent安全关注:AI Agent Traps研究警示网页与文档攻击面
DeepMind论文表明网页和文档内容可成为AI Agent攻击面,隐藏prompt注入成功率高达86%,潜在记忆污染攻击成功率80%+,对浏览/检索型Agent产品安全至关重要。
Local LLM替代Claude Code:128GB MacBook Pro实测
用户探索用128GB MacBook Pro运行本地LLM替代Claude Code,测试qwen3.5 122B ud q4 xl模型256k上下文,轻量任务表现可用,但重度编码仍不及Claude;共享内存架构被认为是优势。
Flash-MoE优化Apple Silicon:Qwen3.5-397B可在48GB MacBook Pro推理
Flash-MoE引擎可在48GB MacBook Pro上用纯C+Metal运行Qwen3.5-397B,推理4.4 tok/s,仅用~5.5GB RAM,优化路径仅加载活跃专家,提升本地MoE模型可用性。
多智能体协作研究:DAIR显示自组织角色优于手工分工
DAIR研究覆盖25,000任务、256智能体,自组织角色比传统planner/coder/reviewer层级提升14%,开放模型达封闭模型95%性能,证明工具/环境分工优化比迭代次数更有效。
阿里通义Wan2.7-Video:AI视频生成大模型上线
Wan2.7-Video支持全模态输入和指令式视频编辑,可精确增删改视频元素、台词动作及机位,支持故事板分镜和多主体特征一致性控制,实现智能剧情设计和40+表情演绎。
B站AI创作工具updream内测:灵感生成、智能剪辑与项目管理
B站推出updream AI创作工具,采用定向邀请制,提供灵感生成、内容构思、智能剪辑及个性化技能库管理,面向UP主轻量化创作场景。
腾讯WorkBuddy小程序上线:云端+本机双模式移动办公
腾讯推出WorkBuddy小程序,支持云端与本地电脑远程执行AI任务,可语音、拍照、传文件派活,多模型切换与定时任务实现移动办公。
Xiaomi MiMo Token Plan发布:统一Credit点数计费,取消token限额
小米MiMo Token Plan订阅方案上线,Lite/Standard/Pro/Max四档,适配Claude Code、OpenClaw等AI开发工具,用户按需选择套餐,无5小时token使用上限。
OpenAI完成史上最大融资1220亿美元,加速AI基础设施商业化
OpenAI获得1220亿美元融资,投后估值达8520亿美元,战略聚焦文本模型、代码生成和企业服务,为IPO铺路,并关闭视频生成产品Sora,标志从Demo转向稳定商业化。