
## リード MicrosoftがSLM(Small Language Model)シリーズの最新作「Phi-4.5」を2026年9月25日にHugging Faceとazure.microsoft.comで公開した。14Bパラメータながら主要ベンチマークでGPT-4oと同等の数値を記録し、「クラウドAPIと端末内推論の精度差がほぼ消えた」最初の明確な事例と見られる。企業がAI導入の前提としてきた「クラウド経由が前提」という構造に、初めて実質的な亀裂が入った。 ## 何が起きているのか Phi-4.5はApache 2.0ライセンスで商用利用が無制限。公開直後から開発者・企業IT担当者によるベンチマーク検証が相次いだ。 主な性能数値: - **MMLU(知識・推論)**:89.3%(GPT-4o比較値:88.7%) - **HumanEval(コーディング)**:93.7%(前世代Phi-4比:+12.3ポイント) - **MATH(数学)**:87.1% - **推論速度**:NVIDIA RTX 4070搭載PC・INT4量子化で約38トークン/秒 X では公開から3時間以内に検証投稿が100件を超えた。 > 「ローカルでPhi-4.5のHumanEvalを走らせたら93.7%。GPT-4o APIが手元で動いている感覚がある。これはAPI利用コストの計算を全部やり直すレベル」(国内エンジニア、フォロワー約2万4,000人) ## 背景 Phiシリーズは2023年のPhi-1(1.3B)から始まった「データの質が量に勝る」という仮説の継続検証だ。2025年公開のPhi-4(14B)は数学特化で注目を集めた一方、コーディングと長文理解では大型モデルとの差が残っていた。 Phi-4.5では合成データ生成手法を刷新し、「Phi-4.5-Instruct-v2」と呼ばれる新ファインチューニング手法を採用。コーディング・推論・多段階タスクを同時に底上げした。 公開タイミングとして注目すべきは、Llama 4 MaverickやGemini 2 Ultraが揃いAPI市場の競争が激化する局面での発表という点だ。Microsoftは「大型モデルで競う」ではなく「端末内・社内で動く精度の閾値を突破する」という明確な差別化路線を選んだ。 ## 着目ポイント ### APIコストがゼロになる業務ブロックが生まれる GPT-4o APIはinputで約0.005ドル/1,000トークン。大量ドキュメント処理や繰り返し推論では月額数十万円規模のコストが発生していた。Phi-4.5をオンプレミスで稼働させれば、ハードウェア償却後の限界コストはほぼゼロになる。ROI試算の前提が変わる。 ### 情報漏洩リスクが構造的に排除できる クラウドAPIを使う場合、プロンプトに含まれる社内情報が外部サーバーを経由する。金融・医療・法務など守秘義務のある業種での導入障壁だったが、オンデバイス推論なら外部通信が不要になる。コンプライアンス担当が「禁止リスト」から外せる条件が整った。 ### Copilot+ PCへの自動統合がエンドポイントを拡張する Microsoftは同日、Windows 11のCopilot+ PC向けにPhi-4.5を統合する計画を発表。NPU対応モデルも並行開発中で、2026年Q4には一部OEM端末へのプリインストールが開始される見通し。PC購入だけでAI推論エンドポイントが増える計算になる。 ### 競合SLMとの差別化軸は「コーディング精度」 同クラスのオープンモデルであるMeta Llama 4 Scout(17B)やGoogle Gemini Nano Pro(12B)に対して、HumanEvalでPhi-4.5は3〜5ポイント上回ることが複数の独立検証で確認されている。コード補完・レビュー用途での採用選定に直接影響する数値だ。 ### LoRAファインチューニングが中小企業に届く 14Bクラスのフルファインチューニングには高スペックGPUが必要だが、QLoRAならRTX 4070 Ti以上の民生向けGPUで週単位の訓練が可能。自社データによるカスタマイズの敷居が中堅・中小企業にも現実的な水準まで下がった。 ## 編集部の視点 「精度がクラウドと同等なら、なぜAPIを使うのか」という問いが現実になった日と捉えている。 これまでSLMの弱点は「惜しいが決定的に足りない何か」という感覚だった。Phi-4.5でその感覚が初めて崩れたとすれば、企業のAI調達は「クラウドAPIとオンプレのどちらを選ぶか」という二項選択の時代に入る。調達部門・情シス・法務が同じテーブルに座る判断軸が変わる。 ただし注意が必要な点がある。14Bモデルが「すべてを置き換える」わけではない。200万トークン超の長文脈処理、高度なマルチモーダルタスク、創造性を要する非構造タスクでは引き続き大型モデルが必要だ。SLMは「繰り返し・ルール基盤・コスト優先」の業務ブロックを担い、大型モデルは「例外・戦略・創造」を担うという分業構造が今後2〜3年で固まると見られる。 日本市場の観点では、クラウドへのデータ送出をめぐる法的・規約上の懸念が導入障壁だった金融・医療・行政の各セクターに対してPhi-4.5は即効性のある選択肢になり得る。2026年Q4にかけてPoCの立ち上げが国内で複数動き出すと予測する。 ## まとめ Phi-4.5の公開は、「クラウドAIと端末AIの精度差がほぼ消えた」という転換点の到達を示す最初の事例として記録されるだろう。コスト・セキュリティ・展開速度の3軸で企業AI戦略の見直しを迫る。 次の焦点は、GoogleのGemma 3シリーズとMetaのLlama 4 ScoutがコーディングベンチでPhi-4.5にどう応じるか、そしてMicrosoftが予告したCopilot+ PC統合を2026年Q4に予定通り完了できるかどうかだ。SLM市場の競争は今秋から本格的な数値競争に入る。 ※本記事は ミライ・ニュース編集部の AI ライター(AIニュース)が執筆しています。
