OpenAI 发布 GPT-5.2-Codex:面向复杂软件工程的最强代码模型,直接重塑 AI 编程生产力
OpenAI 推出 GPT-5.2-Codex,在 SWE-Bench Pro 等基准中达到当前最先进水平,显著提升复杂代码库理解、重构与迁移能力,标志着 AI Agent 编码进入工程级可用阶段。
Google 发布 Gemini 3 Flash:以极低成本逼近前沿模型性能,重塑大模型性价比曲线
Google 推出 Gemini 3 Flash,高速、低成本且具备前沿推理与多模态能力,在部分指标上接近 Gemini 3 Pro 与 GPT-5.2,为大规模商业部署提供更优解。
英伟达开源 Nemotron 3:专为多智能体系统打造,吞吐量提升 4 倍
英伟达发布并开源 Nemotron 3 模型系列,支持 100 万 token 上下文,采用混合专家架构,大幅降低多 Agent 系统中的通信与推理成本。
苹果开源 SHARP:1 秒内将单张照片转为高质量 3D 场景
苹果开源 SHARP 模型,基于 3D 高斯泼溅技术,实现单张 2D 图像到 3D 场景的近实时转换,为 AR / XR 与空间计算提供关键基础能力。
腾讯发布混元世界模型 1.5:国内首个开放实时交互的 3D 世界模型
腾讯混元世界模型 1.5 支持实时生成并交互探索 3D 世界,具备空间记忆与几何一致性,面向游戏、虚拟世界与数字孪生等高价值场景。
阿里发布 Wan 2.6:国内首个支持角色扮演的视频生成模型
通义万相 Wan 2.6 支持音画同步、多镜头叙事与角色扮演,用户可通过参考视频复刻角色外观与音色,直出 15 秒 1080P 高清视频,显著降低视频内容生产门槛。
字节发布通用 Agent 模型 Seed 1.8:GUI Agent 进入可规模化阶段
字节跳动发布 Seed 1.8 通用 Agent 模型,集成搜索、代码生成与 GUI 操作能力,在 OSWorld 等基准中领先,推动 Agent 从实验走向真实业务场景。
字节发布 Seedance 1.5 Pro:实现高质量音视频联合生成
Seedance 1.5 Pro 支持文本与图像驱动的音视频联合生成,在音画同步、方言口型匹配和电影级运镜方面取得突破,面向专业内容创作场景。
小米开源 MiMo-V2-Flash:编程能力刷新开源模型上限
小米开源 MiMo-V2-Flash 大模型,在 SWE-bench 中取得 73.4% 的解决率,超越所有开源模型,展示了高性价比 MoE 架构在工程任务中的潜力。
商汤发布 Seko 2.0:AI 短剧生成将制作周期压缩 80% 以上
商汤 Seko 2.0 通过角色一致性与多人对口型技术,将 50 集短剧制作周期从 3 个月压缩至原来的 10%-20%,并支持消费级显卡与国产芯片。
商汤发布小浣熊 3.0:AI 办公智能体可一键交付专业级 PPT
小浣熊 3.0 实现从内容生成到可直接交付 PPT 的完整流程,支持百万级数据分析,面向企业办公与知识工作场景。
阿里云开源语音双子星:3 秒音频即可实现跨语言音色克隆
通义百聆开源 Fun-CosyVoice3 与 Fun-ASR,显著降低语音生成与识别门槛,在多语言、多方言与低延迟场景下具备实际商业价值。
蚂蚁启用 AI 健康助手中文名“蚂蚁阿福”,加速医疗 AI 落地
蚂蚁集团为 AI 健康助手 AQ 启用中文名“蚂蚁阿福”,并强化健康咨询、影像解读与家庭健康管理,推动 AI 在医疗服务中的规模化应用。