微軟推出 Phi-4:與 DeepSeek R1 競爭的超級推理 AI 模型

抽象的:

  • 微軟推出了 Phi-4 推理 AI 模型,分別使用 14 億和 3.8 億個參數進行訓練。
  • 儘管 Phi-4 推理模型體積小巧,但其性能足以媲美 DeepSeek R1 和 o3-mini 等體積更大的模型。
  • 微軟表示,由於 Phi-4 推理模型體積小,因此可以在 Windows Copilot+ 電腦上執行。

微軟發布了三款全新的推理人工智慧模型:Phi-4-reasoning、Phi-4-reasoning-plus 和 Phi-4-mini-reasoning。這些小型語言模型專為 Windows PC 和行動裝置等周邊設備而設計。其中,Phi-4-reasoning 人工智慧模型已使用 14 億個參數進行訓練,能夠執行複雜的推理任務。

微軟發布 Phi 4 推理 AI 模型

Phi-4-reasoning-plus 模型採用相同的基本模型,但增加了「Plus」推理時間計算——其詞元數量約為 Phi-4-reasoning 的 1.5 倍——從而實現了更高的準確率。儘管 Phi-4-reasoning 模型體積小巧,但它足以與DeepSeek R1 671B 和 o3-mini 等大型模型相媲美。

在 GPQA 基準測試中,Phi-4-reasoning-plus-14B 模型得分 69.3%,而o3-mini模型得分 77.7%。隨後,在 AIME 2025 測試中,Phi-4-reasoning-plus-14B 模型得分 78%,o3-mini 模型得分 82.5%。這顯示微軟的迷你模型正在逼近規模遠大於它的主要推理模型。

phi 4 mini 推理基準測試效能

微軟表示,Phi-4推理模型是透過監督式微調訓練的,訓練所用資料集「來自OpenAI o3-mini的精心挑選的推理資料集」。此外,微軟還寫道:“該模型表明,精心的數據格式化和高品質的合成數據集可以讓較小的模型與較大的模型相媲美。”

除此之外,僅使用 3.8 億個參數訓練的小型 Phi-4-mini-reasoning 模型,其性能優於許多 7 億和 8 億參數的模型。在 AIME 24、MATH 500 和 GPQA Diamond 等基準測試中,Phi-4-mini-reasoning-3.8B 模型取得了具有競爭力的結果,接近 o1-mini 模型的效能。 Phi -4-mini 模型使用 Deepseek-R1 模型產生的合成資料進行了精細調優

微軟的 Phi 模型已原生應用於 Windows Copilot+ 電腦,並利用了其整合的神經處理單元。 Phi-4 推理模型將如何提升機器的 AI 效能,值得我們拭目以待。

評論被關閉。