OpenAI 将 Codex 接入 ChatGPT 手机 App,编程 Agent 从桌面走向随身工作流
Codex 开始在 iOS 和 Android 版 ChatGPT 中预览,用户可在手机上启动任务、查看线程、审批命令和继续引导本地或远程环境中的执行;同时远程 SSH、程序化访问令牌、Hooks 和 HIPAA 合规支持进一步强化团队自动化场景。
GitHub Copilot App 技术预览发布,IDE 生态转向并行 Agent 工作台
GitHub 发布 Copilot App 技术预览,定位为支持并行工作流、仓库和 PR 生命周期管理、模型灵活切换的桌面环境;VS Code 同步推进 Agents window,说明开发工具竞争正在从单一聊天侧栏升级为多任务 Agent 控制台。
Thinking Machines 预告原生交互模型,实时多模态不再只是语音和工具的拼接
Thinking Machines 展示面向实时交互从头训练的模型方向,重点在全双工、多模态、视觉主动感知和连续控制,而不是把语音、转写、工具调用叠在回合式 LLM 之上。这显示下一代助手竞争将从聊天窗口转向交互协议本身。
Artificial Analysis 推出 Coding Agent Index,评测对象从模型扩展到模型加工具链组合
Artificial Analysis 发布 Coding Agent Index,覆盖 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,比较的是模型与 Codex、Claude Code、Cursor CLI 等 harness 的组合表现。编程能力评测正在承认上下文装配、工具执行和交互循环本身就是产品能力。
OpenBMB 开源 MiniCPM-V 4.6,端侧多模态模型继续压低本地运行门槛
MiniCPM-V 4.6 以约 1.6GB 体积和 1.3B LLM 参数面向 iOS、Android、HarmonyOS NEXT 纯本地部署,覆盖图像理解、OCR 和视频理解。端侧模型的价值正在从演示转向隐私、离线和低成本多模态应用。
Cactus Compute 发布 Needle,26M 工具调用模型显示小模型可承担窄任务执行
Needle 是一个 MIT 许可的 26M 参数单次工具调用模型,由 Gemini 合成数据蒸馏而来,宣称可在消费级设备上高速运行,并开放权重、代码和文档。它强化了一个趋势:Agent 系统不一定所有步骤都要交给大模型完成。
Nous Research 提出 Token Superposition Training,预训练效率继续成为模型竞争焦点
Nous Research 的 Token Superposition Training 在预训练早期让模型读取和预测连续 token bag,随后回到标准 next-token 训练,并报告在匹配 FLOPs 下获得 2 到 3 倍墙钟速度提升且不增加推理成本。模型进步正在更多来自训练制度和数据组织,而不只是扩大规模。
Zyphra 发布扩散语言模型预览,非自回归生成重新进入实用视野
Zyphra 的 ZAYA1-8B-Diffusion-Preview 宣称相较自回归生成获得 4.6 到 7.7 倍解码速度提升且质量损失有限。若扩散语言模型能稳定落地,它可能改变推理成本、长文本生成和 rollout 采样的经济性。