「軽くて速い」SLMが企業AI選定の本命になりつつある理由と限界
リード 「とりあえずGPT-4クラスを使う」時代が静かに終わりつつある。2026年に入り、MicrosoftのPhi-4-miniやGoogleのGemma 3など、パラメータ数が7〜14Bクラスの小型言語モデル(SLM:Small Language Model)が、特定ドメインで大型モデルと肩を並べる結果を出し始めた。企業の調達担当者がコストと性能のトレードオフを真剣に計算し始めている。 何が起...
リード 「とりあえずGPT-4クラスを使う」時代が静かに終わりつつある。2026年に入り、MicrosoftのPhi-4-miniやGoogleのGemma 3など、パラメータ数が7〜14Bクラスの小型言語モデル(SLM:Small Language Model)が、特定ドメインで大型モデルと肩を並べる結果を出し始めた。企業の調達担当者がコストと性能のトレードオフを真剣に計算し始めている。 何が起...
リード xAIが2026年7月18日、次世代LLM「Grok 4」を正式公開した。最大の差別化点はX(旧Twitter)のリアルタイムデータとの深いネイティブ統合で、ライブ情報を前提とするエージェントシステムの構築コストを大幅に下げると見られる。コンテキスト長は100万トークン、APIのスループットはGrok 3比40%向上、料金は据え置きと発表された。 何が起きているのか xAIは日本時間202...
リード Metaが2026年7月17日、LLMシリーズ「Llama 4」の最大モデル「Behemoth」(405Bパラメータ)をApache 2.0ライセンスのもと一般公開した。内部評価で数学・推論・コーディングの主要ベンチマークにおいてGPT-4oを上回るとし、クローズドAPIに依存しない自社推論インフラ構築の選択肢が現実的になった。 何が起きているのか MetaはHugging Faceおよび...
リード Mistral AIが2026年7月16日(UTC)、フラッグシップモデル「Mistral Large 3」を正式公開した。コンテキスト長は256Kトークンに拡張、推論チェーン(Chain-of-Thought)を内部実行する強化推論エンジンを標準搭載する。API単価はGPT-4o比で入力トークンあたり約38%安と発表されており、EU圏でのデータ主権要件とコスト圧力を同時に満たせる選択肢と...
リード 「推論モデル、もう使ってない人いるの?」——そんなポストがX(旧Twitter)のエンジニア界隈に流れるようになったのは、ここ2〜3ヶ月の話だ。Stack Overflowが2026年6月に公開した開発者調査によると、推論型LLM(長時間思考して回答を生成するモデル)を業務利用しているエンジニアの割合は、2025年12月比で約3.1倍に拡大。「触ってみないとわからない」の段階は終わり、現場...
リード OpenAIは2026年7月16日、推論特化モデル「o4-mini High」をTier1以上の全APIユーザーへ開放した。入力コストは$0.30/1Mトークン(o3比▲70%)、出力は$1.20/1Mトークン。AIME 2025正答率92.3%、SWE-bench Verified 68.1%を維持しつつ単価を大幅に圧縮した。「推論は高価」という前提が、今日から変わる。 何が起きているの...

この記事でわかること 自己愛が強い人ほど生成AIに依存しやすいという最新研究の結果 AIの過度な使用がもたらす認知機能への影響 日本での生成AI利用状況と問題点 AI依存の兆候と健全な付き合い方 研究の概要:ナルシシズムとAI依存の関係 トルコのデュズジェ大学のカアン・クルカブルン助教授が、BMC Psychology誌(英国の科学雑誌)に興味深い研究を発表しました。 この研究では、生成AIを日常...
リード NVIDIAのBlackwell Ultraアーキテクチャ最上位GPU「B300」が2026年7月14日から本格的な量産出荷フェーズに入った。前世代H100比でAI推論スループットが3.5倍、電力効率が2.1倍を達成。これを受けてAWS・Azure・Google Cloudの3社が、AI推論APIの料金改定を今後90日以内に実施すると相次いで予告しており、LLMコスト構造の分岐点になるとみ...
リード Appleが2026年7月13日(現地時間)、秋公開予定の「iOS 20」に搭載するApple Intelligence新モデルの技術仕様を開発者向けドキュメントとして公開した。パラメータ規模は非開示だが、ベンチマーク上は「前世代比で推論精度31%向上」「日本語テキスト要約の応答速度が1.4秒→0.6秒に短縮」と記載されている。クラウドへの通信を必要としないオンデバイス処理が、ようやく実用...
リード Amazon Web Services(AWS)は2026年7月13日、最上位マルチモーダルモデル「Nova Premier」をAmazon Bedrock経由で一般提供(GA)開始した。200万トークンのコンテキストウィンドウ、動画・画像・音声・テキストの統合推論、そして1Mトークンあたり$8.00というAPI単価が同時に開示され、GPT-4oおよびClaude Opus 4と直接競合す...
リード xAIが2026年7月12日(現地時間)、大規模言語モデル「Grok 3.5」を正式公開した。最大100万トークンのコンテキストウィンドウと、段階的な自己検証を行う「Deep Reasoning Mode」を搭載。単なるスペック競争ではなく、長文書類の一括処理と多段階推論を同一APIで完結させる設計が、法務・金融・研究の実務フローを直撃する構図だ。 何が起きているのか xAIは7月12日2...
リード スマートフォンのチップ上で動くオンデバイスAIが、OpenAIの「GPT-4o mini」と同等のベンチマーク精度を達成したと、複数のエンジニアから検証報告が相次いでいる。クラウドへの送信がゼロ——通信なし、プライバシーリスクなしでここまで到達したのは、正直驚きだった。 何が起きているのか 2026年7月初旬、QualcommのNPU(Neural Processing Unit=スマート...
リード Metaが日本時間2026年7月12日未明、「Llama 4 Maverick」のフル精度オープンウェイトをHugging Faceで一般公開した。パラメータ数は400B(MoEアーキテクチャ、アクティブ17B)、画像・動画・テキストを単一モデルで処理するマルチモーダル設計で、主要ベンチマーク複数でGPT-4oと同等以上のスコアを記録している。商用利用が許諾された事実は、LLM調達の選択肢...
リード GoogleのDeepMindチームが2026年7月11日(現地時間)、Gemini 2.5 Flash 2を正式公開した。前世代のGemini 2.5 Flashと比較して推論スループットが約2倍、API入力単価が40%削減。1Mトークンのコンテキストウィンドウを維持しながら応答レイテンシ中央値を320msまで圧縮した。音声・動画リアルタイム処理との組み合わせでエージェント実装の採算ライ...

この記事でわかること SpaceXが謎のAI端末を投資家に披露したとWSJが報じた内容 イーロン・マスク氏が即座に否定し、市場がどう反応したか AI端末市場が直面している厳しい現実 SpaceXとxAI合併の背景と今後の可能性 WSJが報じた「謎のAI端末」の正体 2026年7月1日、アメリカの有力経済紙ウォール・ストリート・ジャーナル(WSJ)が驚きのニュースを報じました。 SpaceX(スペー...
"計算が全部狂った"——コスト急落が現場を揺らしている これ、地味だけど効くやつだと思って追いかけていたら、想定より早く臨界点を超えた。2024年初頭に「高価な選択肢」だったGPT-4クラスのLLM推論コストが、2026年7月時点では入力100万トークンあたり約0.10〜0.15ドル前後まで下がっている。2年前の単価(約30ドル)と比べると、ざっくり200分の1だ。「ユーザーあたりのAIコスト試算...
リード Microsoftが14Bパラメータの小型言語モデル(SLM)「Phi-4 Ultra」を2026年7月11日に公式公開した。HumanEvalおよびMATH-500ベンチマークで、それぞれ92.4%・88.7%を記録——GPT-4o(91.8%・87.2%)を上回る数値だ。クラウドAPIが前提だったLLM競争に、「ローカル推論で足りる」という新たな軸が加わった。 何が起きているのか Mi...
リード OpenAIは2026年7月10日(米国時間)、推論特化モデル「o4」のAPIを全ユーザー向けに正式一般公開した。前世代「o3」比で数学・コーディング・法律文書解析の精度が平均40%向上し、入力コストは1Mトークンあたり$2.50と従来の約60%水準に引き下げられた。「推論モデルは高コストゆえ試験用途止まり」という構造が、ここで初めて崩れる分岐点に入った。 何が起きているのか OpenAI...
リード Mistral AIが2026年7月9日(現地時間)、最新フラッグシップモデル「Mistral Large 3」をHugging Faceおよび自社APIで同時公開した。コンテキストウィンドウを前作比2倍の128Kトークンに拡張し、日本語・韓国語・アラビア語精度を大幅強化。APIコストはGPT-4o比約52%安に設定され、「欧州発・オープンウェイト路線」が多言語競争の主戦場に踏み込んだ局面...
リード クラウドAPIに課金し続けることなく、手元のPCでLLMを動かす時代が「実験」から「実用」に変わりつつある。ローカルLLM実行ツール「Ollama」の累計ダウンロード数が2026年7月時点で1億件を突破。個人開発者だけでなく、セキュリティ要件の厳しい金融・医療領域の企業にも導入が広がっている。 何が起きているのか Ollamaの公式GitHubリポジトリのスター数は2026年7月1日時点で...
リード AlibabaのQwen Teamが2026年7月8日、オープンウェイトシリーズ最大モデル「Qwen 3-235B-A22B」をHugging Faceで一般公開した。Mixture-of-Experts(MoE)構造により推論時の実効パラメータは22Bに絞りながら、数学推論ベンチ「MATH-500」で92.4点、コーディング評価「LiveCodeBench」で63.7点を記録——いずれも...
リード Appleが「iOS 20 / macOS 16」で、Apple IntelligenceのオンデバイスLLMを従来の約3Bパラメータから7Bパラメータモデルへ刷新したことが、7月7日の開発者向けベータ配信で明らかになった。Neural Engine最適化により推論速度は旧比2.8倍を維持しつつ、主要ベンチマーク(MMLU・HumanEval)でOpenAIのGPT-4o miniと同等水...
リード OpenAIは2026年7月7日(現地時間)、動画生成モデル「Sora 2」を正式公開した。最大解像度1080p、フレームレート60fps、出力尺は最長10分に対応し、初代Soraから生成品質・長尺性能ともに大幅に向上。APIはChatGPT ProおよびEnterprise向けに即日提供、月額$200の「Sora Pro」プランも同時発表された。動画生成AIが「試験的ツール」から「制作ラ...
リード NVIDIAが2026年7月7日(現地時間)、次世代GPU「Blackwell Ultra B300」の量産出荷開始をアナウンスした。LLM推論スループットは前世代H200比で最大3倍——この数字が意味するのは、クラウド事業者のコスト構造が再び大きく書き換わるという事実だ。 何が起きているのか NVIDIA公式ブログおよびInvestor Day資料によると、B300はHBM3e 192G...

この記事でわかること AIの進化が「モデル性能競争」から「評価重視」へ転換した理由 ベンチマーク飽和とは何か、なぜ90%正解でも不十分なのか 評価が「次の巨大モデルを作るより難しい」と言われる背景 新しい評価手法と企業が今すぐできる対応策 AIの進化が新しいフェーズに入った 2026年7月、AI業界の最前線で大きな方向転換が起きています。Databricks(データブリックス)のチーフサイエンティ...
リード xAIが2026年7月5日(米国時間)、大規模言語モデル「Grok 4」を正式公開した。最大512Kトークンのコンテキストウィンドウ、X(旧Twitter)投稿データをリアルタイム参照できる検索機能、コーディング特化の「Grok 4 Code」モードを標準装備。API価格はGPT-4o比約40%安に設定されており、価格とデータ優位性でエンタープライズ市場への食い込みを図る。 何が起きている...
リード GoogleがGemini 2.5 UltraをGoogle AI Studio・Vertex AI経由で一般公開した。動画/音声/画像/テキストをネイティブに統合処理する点が前世代から構造的に変わっており、主要推論ベンチマーク5項目中4項目でGPT-4oおよびClaude Opus 4を上回ると公式ブログで公表している。API単価は入力100万トークンあたり$7.00で、競合比で最大40...
リード MetaがオープンウェイトLLM「Llama 4.1」を2026年7月5日に公式公開した。主要ベンチマークでGPT-4oを上回ると主張し、同時に商用利用条件を緩和。「オープンは追いかける側」という構図が、少なくとも数値上は終わりを告げた格好だ。 何が起きているのか MetaはHugging FaceおよびMeta AI公式サイトを通じてLlama 4.1の重みを公開した。パラメータ規模は4...
リード OpenAIは2026年7月4日(米国時間)、推論特化モデル「o4」をAPIおよびChatGPT Plusで正式公開した。コーディングベンチマーク「SWE-bench Verified」の正解率はo3比18.5ポイント増の92.3%、数学オリンピック予選相当の「AIME 2026」では30問中30問正解を記録。「推論AIが人間の専門家水準を超える」がベンチマーク上の話でなく、実作業で問われ...