AI Hotlist

2026 | 05.10 - 05.16 Vol. 22

AI一周资讯 精华

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。
OpenAI 2026-05-15

OpenAI 将 Codex 接入 ChatGPT 手机 App,编程 Agent 从桌面走向随身工作流

Codex 开始在 iOS 和 Android 版 ChatGPT 中预览,用户可在手机上启动任务、查看线程、审批命令和继续引导本地或远程环境中的执行;同时远程 SSH、程序化访问令牌、Hooks 和 HIPAA 合规支持进一步强化团队自动化场景。

Read Source
github 2026-05-15

GitHub Copilot App 技术预览发布,IDE 生态转向并行 Agent 工作台

GitHub 发布 Copilot App 技术预览,定位为支持并行工作流、仓库和 PR 生命周期管理、模型灵活切换的桌面环境;VS Code 同步推进 Agents window,说明开发工具竞争正在从单一聊天侧栏升级为多任务 Agent 控制台。

Read Source
miramurati 2026-05-12

Thinking Machines 预告原生交互模型,实时多模态不再只是语音和工具的拼接

Thinking Machines 展示面向实时交互从头训练的模型方向,重点在全双工、多模态、视觉主动感知和连续控制,而不是把语音、转写、工具调用叠在回合式 LLM 之上。这显示下一代助手竞争将从聊天窗口转向交互协议本身。

Read Source
ArtificialAnlys 2026-05-12

Artificial Analysis 推出 Coding Agent Index,评测对象从模型扩展到模型加工具链组合

Artificial Analysis 发布 Coding Agent Index,覆盖 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,比较的是模型与 Codex、Claude Code、Cursor CLI 等 harness 的组合表现。编程能力评测正在承认上下文装配、工具执行和交互循环本身就是产品能力。

Read Source
AI工具集 2026-05-12

OpenBMB 开源 MiniCPM-V 4.6,端侧多模态模型继续压低本地运行门槛

MiniCPM-V 4.6 以约 1.6GB 体积和 1.3B LLM 参数面向 iOS、Android、HarmonyOS NEXT 纯本地部署,覆盖图像理解、OCR 和视频理解。端侧模型的价值正在从演示转向隐私、离线和低成本多模态应用。

Read Source
GitHub 2026-05-13

Cactus Compute 发布 Needle,26M 工具调用模型显示小模型可承担窄任务执行

Needle 是一个 MIT 许可的 26M 参数单次工具调用模型,由 Gemini 合成数据蒸馏而来,宣称可在消费级设备上高速运行,并开放权重、代码和文档。它强化了一个趋势:Agent 系统不一定所有步骤都要交给大模型完成。

Read Source
NousResearch 2026-05-14

Nous Research 提出 Token Superposition Training,预训练效率继续成为模型竞争焦点

Nous Research 的 Token Superposition Training 在预训练早期让模型读取和预测连续 token bag,随后回到标准 next-token 训练,并报告在匹配 FLOPs 下获得 2 到 3 倍墙钟速度提升且不增加推理成本。模型进步正在更多来自训练制度和数据组织,而不只是扩大规模。

Read Source
ZyphraAI 2026-05-15

Zyphra 发布扩散语言模型预览,非自回归生成重新进入实用视野

Zyphra 的 ZAYA1-8B-Diffusion-Preview 宣称相较自回归生成获得 4.6 到 7.7 倍解码速度提升且质量损失有限。若扩散语言模型能稳定落地,它可能改变推理成本、长文本生成和 rollout 采样的经济性。

Read Source

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态,提供一份连续阅读的周度观察。

OpenAI 将 Codex 接入 ChatGPT 手机 App,编程 Agent 从桌面走向随身工作流

Codex 开始在 iOS 和 Android 版 ChatGPT 中预览,用户可在手机上启动任务、查看线程、审批命令和继续引导本地或远程环境中的执行;同时远程 SSH、程序化访问令牌、Hooks 和 HIPAA 合规支持进一步强化团队自动化场景。

01

GitHub Copilot App 技术预览发布,IDE 生态转向并行 Agent 工作台

GitHub 发布 Copilot App 技术预览,定位为支持并行工作流、仓库和 PR 生命周期管理、模型灵活切换的桌面环境;VS Code 同步推进 Agents window,说明开发工具竞争正在从单一聊天侧栏升级为多任务 Agent 控制台。

02

Thinking Machines 预告原生交互模型,实时多模态不再只是语音和工具的拼接

Thinking Machines 展示面向实时交互从头训练的模型方向,重点在全双工、多模态、视觉主动感知和连续控制,而不是把语音、转写、工具调用叠在回合式 LLM 之上。这显示下一代助手竞争将从聊天窗口转向交互协议本身。

03

Artificial Analysis 推出 Coding Agent Index,评测对象从模型扩展到模型加工具链组合

Artificial Analysis 发布 Coding Agent Index,覆盖 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,比较的是模型与 Codex、Claude Code、Cursor CLI 等 harness 的组合表现。编程能力评测正在承认上下文装配、工具执行和交互循环本身就是产品能力。

04

OpenBMB 开源 MiniCPM-V 4.6,端侧多模态模型继续压低本地运行门槛

MiniCPM-V 4.6 以约 1.6GB 体积和 1.3B LLM 参数面向 iOS、Android、HarmonyOS NEXT 纯本地部署,覆盖图像理解、OCR 和视频理解。端侧模型的价值正在从演示转向隐私、离线和低成本多模态应用。

05

Cactus Compute 发布 Needle,26M 工具调用模型显示小模型可承担窄任务执行

Needle 是一个 MIT 许可的 26M 参数单次工具调用模型,由 Gemini 合成数据蒸馏而来,宣称可在消费级设备上高速运行,并开放权重、代码和文档。它强化了一个趋势:Agent 系统不一定所有步骤都要交给大模型完成。

06

Nous Research 提出 Token Superposition Training,预训练效率继续成为模型竞争焦点

Nous Research 的 Token Superposition Training 在预训练早期让模型读取和预测连续 token bag,随后回到标准 next-token 训练,并报告在匹配 FLOPs 下获得 2 到 3 倍墙钟速度提升且不增加推理成本。模型进步正在更多来自训练制度和数据组织,而不只是扩大规模。

07

Zyphra 发布扩散语言模型预览,非自回归生成重新进入实用视野

Zyphra 的 ZAYA1-8B-Diffusion-Preview 宣称相较自回归生成获得 4.6 到 7.7 倍解码速度提升且质量损失有限。若扩散语言模型能稳定落地,它可能改变推理成本、长文本生成和 rollout 采样的经济性。

08

End of Brief

See you next week