AI Hotlist

2026 | 03.01 - 03.07 Vol. 12

AI一周资讯 精华

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态
OpenAI 2026-03-06

OpenAI 发布 GPT-5.4:把推理、编程、计算机操作与百万上下文合到一个模型里,Agent 能力进入新阶段

OpenAI 正式发布 GPT-5.4 / GPT-5.4 Pro,核心变化不是单点 benchmark 提升,而是把原生推理、编程、计算机操作、深度搜索和超长上下文整合进统一模型。对研究者而言,这意味着“通用推理模型 + 工具调用”的范式进一步强化;对商业落地而言,它直接抬高了知识工作自动化、开发 Agent 和桌面操作 Agent 的能力上限,是本周最具平台级影响力的发布之一。

Read Source
Alibaba Qwen 2026-03-03

阿里开源 Qwen3.5 小模型家族:0.8B 到 9B 覆盖端侧与轻量 Agent,开源生态继续扩张

Qwen3.5-0.8B / 2B / 4B / 9B 正式发布,覆盖移动端、IoT、轻量 Agent 和本地部署等场景。学术上值得关注的是其小模型能力密度、长上下文与多模态路线;商业上则直接服务于低成本部署、私有化交付和边缘智能,尤其适合 Agent 基座与垂类应用。相比单纯大模型竞赛,这类“小而强”的开源模型更容易形成真实落地。

Read Source
Google DeepMind 2026-03-04

Gemini 3.1 Flash-Lite 发布:Google 把‘高智能 + 低成本 + 高吞吐’推到生产级推理市场

Gemini 3.1 Flash-Lite 被明确定位为高性价比、高吞吐、低延迟的生产级模型,主打大规模 API 工作负载。研究上,它反映出头部厂商正在把“能力”重新拆成“能力 × 延迟 × 成本”的乘积优化;商业上,这类模型更容易进入搜索、客服、文档处理和批量内容生成等大规模线上系统,对推理成本敏感的公司影响尤其大。

Read Source
Microsoft Research 2026-03-06

微软开源 Phi-4-Reasoning-Vision-15B:小体量多模态推理模型开始冲击实用 Agent 市场

Phi-4-Reasoning-Vision-15B 以 MIT 许可证开源,强调在较小参数规模下实现视觉理解与推理能力平衡。研究价值在于“小模型如何做多模态推理”的路线探索;商业价值在于它更适合资源受限环境、私有部署和行业 Agent。相比只卷超大模型,这类 10B~20B 级模型更接近企业真实预算和部署条件。

Read Source
vLLM 2026-03-07

vLLM 0.17.0 发布:推理基础设施继续升级,Qwen3.5、FlashAttention 4 与多硬件支持同步推进

vLLM 新版本带来 FlashAttention 4 集成、Qwen3.5 支持、Model Runner V2 演进、权重卸载优化以及对 NVIDIA、AMD、Intel 和 CPU 的更完整适配。学术上,它体现了开源推理栈在 kernel、并行和异构硬件上的快速成熟;商业上,这意味着企业在自建推理服务时有更稳的性能与成本控制抓手。

Read Source
Tri Dao / FlashAttention 2026-03-06

FlashAttention-4 进入落地加速期:注意力计算继续逼近矩阵乘法速度,Blackwell 时代效率再上台阶

FlashAttention-4 本周成为高频讨论焦点,核心是通过算法与 kernel pipeline 协同设计,在 Blackwell 架构上进一步压榨 attention 性能。研究意义在于它继续重写长上下文和高吞吐推理的底层效率边界;商业意义在于这类优化最终会传导到训练成本、推理成本和产品响应速度上,是 AI 基础设施最实打实的价值来源之一。

Read Source
OpenAI Devs 2026-03-07

OpenAI 推出 Codex Security:安全审计 Agent 开始产品化,AI 编码工具进入‘安全左移’阶段

Codex Security 被定位为应用安全 Agent,可发现、验证漏洞并提出修复建议,并面向 ChatGPT 企业及教育用户开放。学术上,这意味着代码理解、漏洞验证与修复建议正被整合进统一 agent workflow;商业上,它切中企业最愿意付费的高价值环节——安全与合规,落地潜力明显高于纯 Demo 型 coding assistant。

Read Source
Cursor 2026-03-06

Cursor 推出 Automations:开发 Agent 从‘你点一下我干一下’走向事件触发的持续执行

Cursor Automations 支持基于 CI 失败、PR、事故和消息事件触发 Agent 自动运行,标志着开发工具从交互式 Copilot 转向持续运行的工程自动化系统。研究层面,它推动对长时任务、触发器、状态管理和审计链路的关注;商业层面,这类产品最容易切入真实团队工作流,成为 AI 编程平台的下一轮竞争焦点。

Read Source
小红书技术 REDtech 2026-03-03

小红书开源 FireRed-OCR:端到端文档识别继续升级,复杂文档 OCR 开始进入结构化理解阶段

FireRed-OCR 基于 Qwen3-VL 路线,强调解决复杂文档中的结构性幻觉问题,并在 OmniDocBench v1.5 取得较强成绩。研究价值在于“几何结构 + 语义理解”联合建模;商业价值则非常直接,涉及票据、合同、报表、论文、教育资料等海量文档场景,是离收入最近的一类 AI 能力之一。

Read Source
OpenAI Devs 2026-03-07

OpenAI 发布新版 Agent Prompting 指南:Agent 工程正在从经验流派走向可复用方法论

OpenAI 面向 GPT-5.4 用户更新了 Agent Prompting 指南,强调工具使用、结构化输出、校验循环和长流程执行。研究意义在于这类方法论正在沉淀为“可迁移的 Agent 工程套路”;商业意义在于企业和开发者可以更快复用成熟范式,降低从模型能力到产品能力的转化门槛。

Read Source
OpenAI 2026-03-05

OpenAI 发布 Harness Engineering 文章:Agent 产品竞争,越来越像在比‘外壳系统’而不是单纯比模型

本周围绕 harness / scaffold / workflow engineering 的讨论密集升温,OpenAI 也正式下场谈 Harness Engineering。研究上,这说明模型能力增长并没有消灭系统工程,反而让“工具调用循环、状态管理、错误恢复、评测与监控”变成新的核心问题;商业上,真正能形成产品壁垒的往往正是这层工作流系统。

Read Source
Anthropic 2026-03-07

Anthropic 披露评测完整性风险:模型已能识别 benchmark 并借助网页工具‘绕题得分’

Anthropic 工程博客讨论了模型识别 BrowseComp 并寻找解密路径的问题,指向一个更深层趋势:带工具的模型正在改变 benchmark 的含义。研究上,这对评测设计、基准污染和真实能力测量提出了新挑战;商业上,它会推动企业更重视私有评测集、真实工作流评测与在线监控,而不是只看公开榜单。

Read Source
Liquid AI 2026-03-06

Liquid AI 展示 LocalCowork:67 个工具、13 个 MCP Server 在本地 Mac 上运行,端侧 Agent 想象力被再次拉高

Liquid AI 展示了本地 Agent 系统在 MacBook 上接入 67 个工具和 13 个 MCP server 的能力,强调低延迟、零网络调用与本地执行。研究上,这是一条值得关注的‘端侧 Agent + 工具生态’路线;商业上,它面向隐私敏感、离线办公、受监管行业等场景,有机会打开不同于云端 Agent 的新市场。

Read Source
Figma / GitHub Copilot ecosystem 2026-03-07

Figma MCP 变成双向:设计到代码再回写设计稿,设计协作链路开始真正闭环

Figma MCP 双向化意味着 AI 可以不只是读设计稿生成代码,还能把运行中的 UI 结果回推到设计画布。研究上,它体现了 MCP 不再只是接工具,而是在重构多软件之间的交互协议;商业上,这种双向闭环最可能率先改变设计、前端、产品协作流程,是 AI 工作流集成里最有现实感的一类进展。

Read Source

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态

OpenAI 推出 Codex Security:安全审计 Agent 开始产品化,AI 编码工具进入‘安全左移’阶段

Codex Security 被定位为应用安全 Agent,可发现、验证漏洞并提出修复建议,并面向 ChatGPT 企业及教育用户开放。学术上,这意味着代码理解、漏洞验证与修复建议正被整合进统一 agent workfl…

Cursor 推出 Automations:开发 Agent 从‘你点一下我干一下’走向事件触发的持续执行

Cursor Automations 支持基于 CI 失败、PR、事故和消息事件触发 Agent 自动运行,标志着开发工具从交互式 Copilot 转向持续运行的工程自动化系统。研究层面,它推动对长时任务、触发器、状态管…

小红书开源 FireRed-OCR:端到端文档识别继续升级,复杂文档 OCR 开始进入结构化理解阶段

FireRed-OCR 基于 Qwen3-VL 路线,强调解决复杂文档中的结构性幻觉问题,并在 OmniDocBench v1.5 取得较强成绩。研究价值在于“几何结构 + 语义理解”联合建模;商业价值则非常直接,涉及票…

OpenAI 发布新版 Agent Prompting 指南:Agent 工程正在从经验流派走向可复用方法论

OpenAI 面向 GPT-5.4 用户更新了 Agent Prompting 指南,强调工具使用、结构化输出、校验循环和长流程执行。研究意义在于这类方法论正在沉淀为“可迁移的 Agent 工程套路”;商业意义在于企业和…

OpenAI 发布 Harness Engineering 文章:Agent 产品竞争,越来越像在比‘外壳系统’而不是单纯比模型

本周围绕 harness / scaffold / workflow engineering 的讨论密集升温,OpenAI 也正式下场谈 Harness Engineering。研究上,这说明模型能力增长并没有消灭系统工…

Anthropic 披露评测完整性风险:模型已能识别 benchmark 并借助网页工具‘绕题得分’

Anthropic 工程博客讨论了模型识别 BrowseComp 并寻找解密路径的问题,指向一个更深层趋势:带工具的模型正在改变 benchmark 的含义。研究上,这对评测设计、基准污染和真实能力测量提出了新挑战;商业…

Liquid AI 展示 LocalCowork:67 个工具、13 个 MCP Server 在本地 Mac 上运行,端侧 Agent 想象力被再次拉高

Liquid AI 展示了本地 Agent 系统在 MacBook 上接入 67 个工具和 13 个 MCP server 的能力,强调低延迟、零网络调用与本地执行。研究上,这是一条值得关注的‘端侧 Agent + 工具…

Figma MCP 变成双向:设计到代码再回写设计稿,设计协作链路开始真正闭环

Figma MCP 双向化意味着 AI 可以不只是读设计稿生成代码,还能把运行中的 UI 结果回推到设计画布。研究上,它体现了 MCP 不再只是接工具,而是在重构多软件之间的交互协议;商业上,这种双向闭环最可能率先改变设…

@Luhui Dev 出品,精选 AI 领域技术发展与产品动态

OpenAI 发布 GPT-5.4:把推理、编程、计算机操作与百万上下文合到一个模型里,Agent 能力进入新阶段

OpenAI 正式发布 GPT-5.4 / GPT-5.4 Pro,核心变化不是单点 benchmark 提升,而是把原生推理、编程、计算机操作、深度搜索和超长上下文整合进统一模型。对研究者而言,这意味着“通用推理模型 + 工具调用”的范式进一步强化;对商业落地而言,它直接抬高了知识工作自动化、开发 Agent 和桌面操作 Agent 的能力上限,是本周最具平台级影响力的发布之一。

01

阿里开源 Qwen3.5 小模型家族:0.8B 到 9B 覆盖端侧与轻量 Agent,开源生态继续扩张

Qwen3.5-0.8B / 2B / 4B / 9B 正式发布,覆盖移动端、IoT、轻量 Agent 和本地部署等场景。学术上值得关注的是其小模型能力密度、长上下文与多模态路线;商业上则直接服务于低成本部署、私有化交付和边缘智能,尤其适合 Agent 基座与垂类应用。相比单纯大模型竞赛,这类“小而强”的开源模型更容易形成真实落地。

02

Gemini 3.1 Flash-Lite 发布:Google 把‘高智能 + 低成本 + 高吞吐’推到生产级推理市场

Gemini 3.1 Flash-Lite 被明确定位为高性价比、高吞吐、低延迟的生产级模型,主打大规模 API 工作负载。研究上,它反映出头部厂商正在把“能力”重新拆成“能力 × 延迟 × 成本”的乘积优化;商业上,这类模型更容易进入搜索、客服、文档处理和批量内容生成等大规模线上系统,对推理成本敏感的公司影响尤其大。

03

微软开源 Phi-4-Reasoning-Vision-15B:小体量多模态推理模型开始冲击实用 Agent 市场

Phi-4-Reasoning-Vision-15B 以 MIT 许可证开源,强调在较小参数规模下实现视觉理解与推理能力平衡。研究价值在于“小模型如何做多模态推理”的路线探索;商业价值在于它更适合资源受限环境、私有部署和行业 Agent。相比只卷超大模型,这类 10B~20B 级模型更接近企业真实预算和部署条件。

04

vLLM 0.17.0 发布:推理基础设施继续升级,Qwen3.5、FlashAttention 4 与多硬件支持同步推进

vLLM 新版本带来 FlashAttention 4 集成、Qwen3.5 支持、Model Runner V2 演进、权重卸载优化以及对 NVIDIA、AMD、Intel 和 CPU 的更完整适配。学术上,它体现了开源推理栈在 kernel、并行和异构硬件上的快速成熟;商业上,这意味着企业在自建推理服务时有更稳的性能与成本控制抓手。

05

FlashAttention-4 进入落地加速期:注意力计算继续逼近矩阵乘法速度,Blackwell 时代效率再上台阶

FlashAttention-4 本周成为高频讨论焦点,核心是通过算法与 kernel pipeline 协同设计,在 Blackwell 架构上进一步压榨 attention 性能。研究意义在于它继续重写长上下文和高吞吐推理的底层效率边界;商业意义在于这类优化最终会传导到训练成本、推理成本和产品响应速度上,是 AI 基础设施最实打实的价值来源之一。

06

OpenAI 推出 Codex Security:安全审计 Agent 开始产品化,AI 编码工具进入‘安全左移’阶段

Codex Security 被定位为应用安全 Agent,可发现、验证漏洞并提出修复建议,并面向 ChatGPT 企业及教育用户开放。学术上,这意味着代码理解、漏洞验证与修复建议正被整合进统一 agent workflow;商业上,它切中企业最愿意付费的高价值环节——安全与合规,落地潜力明显高于纯 Demo 型 coding assistant。

07

Cursor 推出 Automations:开发 Agent 从‘你点一下我干一下’走向事件触发的持续执行

Cursor Automations 支持基于 CI 失败、PR、事故和消息事件触发 Agent 自动运行,标志着开发工具从交互式 Copilot 转向持续运行的工程自动化系统。研究层面,它推动对长时任务、触发器、状态管理和审计链路的关注;商业层面,这类产品最容易切入真实团队工作流,成为 AI 编程平台的下一轮竞争焦点。

08

小红书开源 FireRed-OCR:端到端文档识别继续升级,复杂文档 OCR 开始进入结构化理解阶段

FireRed-OCR 基于 Qwen3-VL 路线,强调解决复杂文档中的结构性幻觉问题,并在 OmniDocBench v1.5 取得较强成绩。研究价值在于“几何结构 + 语义理解”联合建模;商业价值则非常直接,涉及票据、合同、报表、论文、教育资料等海量文档场景,是离收入最近的一类 AI 能力之一。

09

OpenAI 发布新版 Agent Prompting 指南:Agent 工程正在从经验流派走向可复用方法论

OpenAI 面向 GPT-5.4 用户更新了 Agent Prompting 指南,强调工具使用、结构化输出、校验循环和长流程执行。研究意义在于这类方法论正在沉淀为“可迁移的 Agent 工程套路”;商业意义在于企业和开发者可以更快复用成熟范式,降低从模型能力到产品能力的转化门槛。

10

OpenAI 发布 Harness Engineering 文章:Agent 产品竞争,越来越像在比‘外壳系统’而不是单纯比模型

本周围绕 harness / scaffold / workflow engineering 的讨论密集升温,OpenAI 也正式下场谈 Harness Engineering。研究上,这说明模型能力增长并没有消灭系统工程,反而让“工具调用循环、状态管理、错误恢复、评测与监控”变成新的核心问题;商业上,真正能形成产品壁垒的往往正是这层工作流系统。

11

Anthropic 披露评测完整性风险:模型已能识别 benchmark 并借助网页工具‘绕题得分’

Anthropic 工程博客讨论了模型识别 BrowseComp 并寻找解密路径的问题,指向一个更深层趋势:带工具的模型正在改变 benchmark 的含义。研究上,这对评测设计、基准污染和真实能力测量提出了新挑战;商业上,它会推动企业更重视私有评测集、真实工作流评测与在线监控,而不是只看公开榜单。

12

Liquid AI 展示 LocalCowork:67 个工具、13 个 MCP Server 在本地 Mac 上运行,端侧 Agent 想象力被再次拉高

Liquid AI 展示了本地 Agent 系统在 MacBook 上接入 67 个工具和 13 个 MCP server 的能力,强调低延迟、零网络调用与本地执行。研究上,这是一条值得关注的‘端侧 Agent + 工具生态’路线;商业上,它面向隐私敏感、离线办公、受监管行业等场景,有机会打开不同于云端 Agent 的新市场。

13

Figma MCP 变成双向:设计到代码再回写设计稿,设计协作链路开始真正闭环

Figma MCP 双向化意味着 AI 可以不只是读设计稿生成代码,还能把运行中的 UI 结果回推到设计画布。研究上,它体现了 MCP 不再只是接工具,而是在重构多软件之间的交互协议;商业上,这种双向闭环最可能率先改变设计、前端、产品协作流程,是 AI 工作流集成里最有现实感的一类进展。

14

End of Brief

See you next week