跳到正文

微软发布 Phi-4-reasoning-vision-15B,并披露多模态推理模型训练经验

微软研究院发布 150 亿参数开放权重模型 Phi-4-reasoning-vision-15B,主打更低算力成本下的多模态推理、数学科学任务和屏幕理解能力。

功思 AI 编辑部

约 3 分钟读完

微软发布 Phi-4-reasoning-vision-15B,并披露多模态推理模型训练经验

导语

微软研究院宣布推出 Phi-4-reasoning-vision-15B。这是一款 150 亿参数、开放权重的多模态推理模型,已经可通过 Microsoft Foundry、Hugging Face 和 GitHub 获取。按照微软的介绍,该模型既能处理图像描述、图像问答、文档与票据读取等通用视觉语言任务,也特别强调在数学、科学推理以及计算机和移动端屏幕理解方面的能力。

这次发布的一个核心卖点,是它试图在性能与计算成本之间做出更有竞争力的平衡。微软表示,当前不少视觉语言模型一方面参数规模越来越大,另一方面在推理时消耗的 token 数量也持续增加,这会明显推高训练成本、推理延迟和部署门槛。Phi-4-reasoning-vision-15B 的目标正好相反:在保持结构化推理能力的同时,把模型做得足够轻量,以适应资源受限或需要交互式响应的场景。

微软在文章中强调,这个模型延续了 Phi 系列“小而强”的路线。团队称,它以 SigLIP-2 视觉编码器和 Phi-4-Reasoning 语言骨干为基础,采用的是中融合架构,也就是先用预训练视觉编码器把图像转成视觉 token,再映射到语言模型的嵌入空间。相比把图像和文本完全放进同一个大一统 Transformer 中的早融合方案,中融合在计算、内存和数据成本上更可控,因此更适合在有限资源下打造高性能模型。

核心信息

微软还披露了一个重要的训练思路:与其依赖极端庞大的多模态训练数据,不如更重视数据质量、任务结构和针对性实验。文章给出的对比显示,Phi-4-reasoning-vision-15B 使用了约 2000 亿 token 的多模态数据,并结合此前 Phi-4-Reasoning 的 160 亿 token 训练积累;而一些同量级或相近级别的开源多模态模型训练规模则超过 1 万亿 token。微软认为,这说明通过更谨慎的设计和数据整理,可以在更低训练成本下获得有竞争力的结果。

为提升模型的视觉感知与高分辨率理解能力,团队比较了多种方案,包括 Dynamic S2、多裁切策略以及动态分辨率编码方法。微软称,实验结果显示,动态分辨率视觉编码器在高分辨率数据上整体表现最好,尤其在屏幕理解类基准上优势明显,因此最终选择了 SigLIP-2 的 Naflex 变体作为视觉编码器。这一选择也直接服务于模型在 computer use 场景中的定位。

在数据策略上,微软同样给出了大量细节。团队表示,最终训练集主要由三类数据构成:经过严格清洗和改造的开源数据、高质量内部数据,以及定向获取的高质量专项数据。很多开源数据并不是直接拿来训练,而是先由研究人员人工抽样审阅,再通过程序修复格式问题、剔除低质量样本,甚至在必要时用 GPT-4o 和 o4-mini 重新生成更可靠的答案或描述。对于图片本身质量不错、但问答质量较差的样本,团队还会把原图当作“种子”,重新合成新的文字数据。

更多细节

微软特别提到,模型的目标并不只是做通用视觉语言助手,而是要在通用任务、数学科学推理和计算机操作这几个方向之间取得平衡。为此,团队通过一个 50 亿参数代理模型反复试验不同数据配比,观察数学与科学数据、computer-use 数据以及一般图文数据之间的相互影响。实验结果显示,增加 computer-use 数据并没有明显损害数学和科学表现,反过来增加数学数据还可能同时改善数学、科学以及 computer-use 基准。

此外,微软把合成数据视为一个关键增强项,特别是在图表、文档、示意图和渲染数学表达式等“文本密集型视觉场景”中。团队认为,程序化生成并和视觉结构严格对齐的数据,能够减少真实抓取数据中常见的标注错误、歧义和分布偏差,从而让模型在视觉感知和多步推理之间建立更稳定的对应关系。微软的结论是,合成数据不是高质量真实数据的替代品,但对于紧凑型多模态模型而言,它是强化感知与推理能力的有效补充。

从行业角度看,这篇文章最值得注意的,不只是微软又发布了一个开源模型,而是它公开展示了一条更节制的路线:不靠无限堆参数和 token,也尝试把多模态推理模型做得足够实用、可部署、并在关键任务上具备竞争力。如果这条路线持续奏效,未来多模态模型的竞争焦点,可能会进一步从“谁更大”转向“谁在成本、速度和能力之间做得更均衡”。

参与讨论

正在确认登录状态…