オンデバイスAIが「本番水準」へ——14BモデルがGPT-4oとの性能差を5%以内に縮めた
リード 9月第1週、Microsoftが「Phi-4-mini」の正式版を公開した。14Bパラメータ、INT4量子化でわずか8GB。それでいてGPT-4oとの性能差は主要ベンチマーク上で5%以内に収まる。「SLM(小型言語モデル)は妥協の産物」という認識が、静かに書き換えられている。 何が起きているのか 2026年9月5日、MicrosoftはPhi-4-miniをHugging Faceで一般公...
リード 9月第1週、Microsoftが「Phi-4-mini」の正式版を公開した。14Bパラメータ、INT4量子化でわずか8GB。それでいてGPT-4oとの性能差は主要ベンチマーク上で5%以内に収まる。「SLM(小型言語モデル)は妥協の産物」という認識が、静かに書き換えられている。 何が起きているのか 2026年9月5日、MicrosoftはPhi-4-miniをHugging Faceで一般公...
リード AIコーディングエージェントが「補助ツール」から「実装担当者」への転換を示す数字が、2026年9月第1週に出揃った。GitHub・Cognition(Devin)・JetBrainsが同週に公開したデータでは、自律エージェントが要件定義からPR作成・テスト・本番マージまでを人間介入なしで完結させる割合が、対象リポジトリ平均で32%に達している。 何が起きているのか 3社が公開した数字は以下...
リード 2026年9月、Apple・Samsung・Qualcommの3社が「端末内でどこまで高度なAI推論ができるか」を巡る直接対決を迎えた。iPhone 18のA20チップは前世代比2.4倍のNPU性能を持ち、Snapdragon 8 Gen 5搭載のAndroid各社もリアルタイム翻訳・画像生成を端末単体で処理する段階に到達している。クラウドAPIへの依存が「補助」に格下げされる分岐点だ。 ...
AIの「補助輪」が外れた2026年の開発現場 コード補完から、自律的なタスク実行へ——AIコーディングエージェントの役割が2026年に入って明確に変わった。Stack Overflowが9月5日に公開した「Developer Survey 2026 Mid-Year Update」によると、週1回以上AIエージェントを使う開発者は全体の61%に達し、1年前の21%から約3倍に増加している。 何が起...
リード Alibaba Cloudが9月7日(日本時間)、大規模言語モデル「Qwen 3.5」を正式公開した。数学推論ベンチマーク「MATH-500」で92.4点、コーディング評価「LiveCodeBench v4」で78.1点を記録し、GPT-4o(88.3点・74.9点)およびGemini 2 Pro(89.1点・75.6点)をいずれも上回る。720BパラメータのオープンウェイトをApache...
リード EU AI法(AI Act)の高リスクAIシステム条項(第6〜7条)が2026年8月2日に全面施行され、9月第1週より欧州AI弁公室(EU AI Office)が初の正式情報提供要請を複数企業へ送付したと発表した。最大€35M(約57億円)または全世界年間売上高の7%という制裁金が現実の脅威となり、AIを業務に組み込む企業の開発・調達・法務体制が根本から問い直されている。 何が起きているの...
リード GPT-4クラスの推論コストが1年で約90%下がった。1,000トークンあたり$0.03だったものが今や$0.003以下——単なる値下げ競争ではなく、技術的ブレークスルーが重なった結果だ。これが何を変えつつあるのか、現場の数字から整理する。 何が起きているのか 2026年に入り、主要LLMプロバイダーが相次いで推論料金を引き下げている。OpenAIのGPT-4o系モデルは出力1Mトークンあ...
リード OpenAIは2026年9月6日(現地時間)、推論特化モデル「o4」をAPIおよびChatGPT Proプランで正式公開した。数学・科学・コーディングの複合推論で前世代「o3」を大幅に上回るスコアを叩き出し、API価格は同時に40%引き下げられた。エージェント設計の前提コストが再び書き換えられる局面に入った。 何が起きているのか OpenAIの公式テクニカルレポートによると、o4はAIME...
リード xAIは2026年9月5日(現地時間)、次世代大規模言語モデル「Grok 4」を正式公開した。最大100万トークンの文脈長、Xプラットフォームとのリアルタイムデータ統合、強化推論モード「Think Deep」の3点が主軸。GPT-5・Claude 5・Gemini 2 Ultraと正面衝突するのではなく、「情報の鮮度」を差別化軸に据えた点が今回の構造的変化だ。 何が起きているのか xAIは...
リード 2026年9月、ローカルで動くLLMが「実験用」から「実務用」に変わりつつある。7Bパラメータのモデルが70Bモデルのベンチマークスコアの80%超を達成したという報告がコミュニティで相次ぎ、X上でも「ついにクラウドなしでいける」という声が広がっている。触ってみないとわからない、を確かめるために手元の環境でも動かしてみた。 何が起きているのか コミュニティで広く引用されているのは、Mistr...
リード Google DeepMindは2026年9月5日(現地時間)、「Gemini 2 Ultra」をGoogle AI StudioおよびVertex AI経由で一般公開した。文脈長200万トークン・リアルタイム映像解析・入力$15/MTokという三点セットは、マルチモーダルAPIの設計水準を一段引き上げる。コスト競争では不利だが、「文脈量×映像理解」の組み合わせは他モデルが現時点で持たない...
リード Anthropicは2026年9月4日、「Claude 5 Sonnet」を正式公開した。Claude 5 Haikuで確立した低価格路線を維持しながら、精度とコンテキスト長を大幅に引き上げた「中核モデル」の位置づけ。APIは公開初日から全ティアに解放されており、o3-pro・Gemini 2.5 Ultraが鎬を削るエンタープライズ市場への直接的な挑戦状となった。 何が起きているのか A...
リード AIエージェントの企業導入が、静かに、しかし確実に加速している。2026年8月に公開されたMcKinsey Global Instituteの調査では、従業員500人以上の企業におけるAIエージェント活用率が35%に達し、2025年同期の11%から3倍超に跳ね上がったことが示された。「PoCで終わらなかった」と言い切れる数字が、ようやく揃ってきた。 何が起きているのか AIエージェントとは...
リード Mistral AIが2026年9月3日、フラッグシップモデル「Mistral Large 3」を正式公開した。コーディング・数学・多段階推論の主要ベンチマークでGPT-5比97%前後のスコアを出しながら、入力単価は$1.8/Mトークンと主要競合の半値以下。欧州発モデルが「性能で妥協する選択肢」から「コスト効率で選ぶ最前線」へ地位を塗り替えた。 何が起きているのか Mistral AIは日...
リード Perplexity AIが2026年9月2日、年間経常収益(ARR)が10億ドルを突破したと公式Xアカウントで発表した。同週、GoogleもAI Modeの月間アクティブユーザー(MAU)が5億人を超えたと開示している。2つの発表が重なり、AI検索市場が実験段階を終え「収益化フェーズ」へ移行したことが明確になった。 何が起きているのか Perplexityは2026年Q2時点で有料プラン...
リード 生成AIの「推論コスト」——モデルがテキストを1トークン生成するたびにかかる費用——が、過去2年間で劇的に下落している。2024年初頭に比べてGPT-4クラスの処理コストは約100分の1まで圧縮されたという試算が出ており、エンタープライズ側のAI投資判断を根本から変えつつある。 何が起きているのか Sequoia Capitalが2026年8月に公開したレポートによれば、GPT-4相当の1...
リード MetaがLlama 4シリーズの最新版「Llama 4 Maverick 2」を2026年9月3日に公開した。従来モデルで設けていた月間アクティブユーザー7億人超の事業者向け商用ライセンス条件を完全撤廃。HuggingFaceで即日ダウンロード可能となり、公開後3時間で10万件を超えるダウンロードが記録されたと見られる。「APIを買う」から「モデルを持つ」への移行が、本格的に射程に入った...
リード Anthropicが2026年9月2日23時過ぎ(日本時間)、「Claude 5 Haiku」を予告なく公開した。入力$0.75・出力$3.75/Mトークンと、Claude 4 Sonnet比で75%の値下げ——にもかかわらず、コーディング・数学推論のベンチマークでは前世代のSonnetを上回る数値を記録した。「安い=性能が落ちる」という設計前提が崩れた日だ。 何が起きているのか Anth...
リード 2026年9月、AIコーディングツールの競争が新局面に入った。Cursorが月間アクティブユーザー(MAU)500万人を突破し、GitHub CopilotはMicrosoft 365との深い統合を武器に法人シェア60%超を固めた。単なる「コード補完ツール」だった頃とは、もう別のゲームが始まっている。 何が起きているのか 2026年8月、Cursor社(旧Anysphere)は月間アクティ...
リード GitHubが2026年9月2日、「Copilot Agent」のエンタープライズ向け正式提供(GA)を発表した。バックログに積まれたIssueを受け取り、コードの設計・実装・テスト・PR作成まで自律的に完了する。月額39ドルの新プランが追加され、大規模組織での本番導入が現実的な選択肢になった。 何が起きているのか GitHub公式ブログの発表によると、Copilot Agentは以下の工...
リード Runwayが2026年9月1日、AI動画生成モデル「Gen-4 Ultra」を一般公開した。最長120秒・4K解像度(3840×2160)での動画生成に対応し、生成コストは従来の「Gen-3 Alpha」比で約60%削減される。30秒CMクラスの映像が単独出力できる長さに初めて到達したことで、広告制作・映像外注市場が実質的な転換点に入る可能性がある。 何が起きているのか Runwayは日...
「70Bが動いた」より「何トークン/秒か」を問う時代へ もはや「ローカルで70Bが動いた」では話題にならない。問われるのは「どれだけ速いか」だ。 2026年8月後半、llama.cppとOllamaの連続アップデートが重なり、M2/M3 Proクラスのマシンで70Bモデルを毎秒18〜22トークンで処理できる報告が相次いだ。触ってみないとわからない——そう思って手元の環境で動かしてみたら、本当に変わ...
リード 2026年8月28日〜9月1日の5日間で、OpenAI・Anthropic・Googleの3社が主要LLM APIを50〜73%値下げした。単なる価格競争ではない——推論インフラのコモディティ化が本格化し、AIサービス設計の経済的前提そのものが変わるタイミングが来た。 何が起きているのか 各社の改定内容は以下のとおり。 OpenAI:GPT-5(標準版)の入力コストを $3.00/M to...
リード OpenAIは日本時間2026年8月31日23時、推論特化モデル「o3-pro」のREST APIを一般開発者向けに正式公開した。月額$200のChatGPT Pro加入者だけが使えた能力が開発者エコシステムへ開放されたことで、長文法律文書の自動審査・科学論文の仮説生成・複雑な金融モデリングといった「専門職の中核業務」へのAI浸透速度が変わると見られる。 何が起きているのか OpenAI公...
リード 「1つのモデルに全部やらせる」設計の限界が、現場で静かに意識され始めている。2026年夏、複数のAIエージェントが役割を分担して動く「マルチエージェント・オーケストレーション」構成が、国内外の企業の本番環境に入り始めた。タスク完了率・コスト・信頼性——それぞれの数字が見えてきた今、設計の勘所を整理したい。 何が起きているのか Anthropic・OpenAI・Googleが相次いで「エージ...
リード xAIは2026年8月31日、大規模言語モデル「Grok 4」を正式公開した。拡張思考プロセス「Deep Think」モードと、X(旧Twitter)投稿データをミリ秒単位で参照する「Live Grounding」を同時実装している。STEM推論の精度と情報鮮度という2軸で、OpenAI・Anthropicとの明確な差別化を図る設計だ。 何が起きているのか xAIは日本時間31日22時、公...
リード Google DeepMindは日本時間8月30日22時、「Gemini 2.5 Ultra」を正式公開した。コンテキスト長2,097,152トークン超、MATH-500で92.3%・HumanEvalで89.7%を記録し、「GPT-5比較で主要9指標中6指標を上回る」と発表。API価格は入力$3.50/1Mトークンで即日提供開始。長文脈単一モデル処理が「試験的」から「選択肢」に変わった日...
「高すぎて試せない」が消えた夏 推論特化型LLM(Chain-of-Thoughtを自動展開して複雑な問題を解くモデル)のAPI単価が、2025年比でおよそ70%下落した。2026年8月時点で複数のプロバイダーが新料金を発表しており、かつて「月数百万円かかる」と敬遠されていた用途が、月額10万円前後から検討できる水準になってきた。触ってみないとわからない、と言い続けてきたが、ようやく「触れる価格」...
リード DeepSeekが2026年8月29日、推論特化モデル「R3」を正式公開した。AMATH(高度数学推論)ベンチマークでOpenAI「o3」を0.8ポイント上回り、SWE-bench Verifiedでも72.4%という新記録を更新。MITライセンスでモデルウェイトを同時公開しており、API単価はo3比で約8分の1とされる。「オープン・安価・ベンチ首位」の三条件が重なったのは初めてで、企業の...
リード Mistral AIは2026年8月29日、最新フラッグシップモデル「Mistral Large 3」を正式公開した。コンテキスト長128Kトークン、対応言語32言語の多言語推論強化が最大の変更点だ。ベンチマーク上ではGPT-5 TurboやClaude Sonnet 4系と競合する水準に到達したと同社は主張しており、EU AI法完全施行後の欧州企業にとって、データ主権を担保できる選択肢が...