「コスト」の検索結果: ユーザー 0件・記事 30件
リード 2026年8月、EU AI法(AI Act)の中核条項である「高リスクAIシステム」への包括的義務が施行される。残り約60日。欧州委員会の公式試算では1社あたりの適合コストは最大300万ユーロ(約5億円)に達するとされ、医療・採用・信用審査領域にAIを展開するグローバル企業の対応判断が正念場を迎えた。 何が起きているのか EU AI法は2024年8月に発効し、段階的な施行スケジュールを取っ...
リード Google DeepMindは2026年5月10日(現地時間)、推論特化モデル「Gemini 2.5 Ultra」をGoogle AI StudioおよびVertex AI経由で一般公開した。MMLU-Proで92.3%、コード生成ベンチマークSWE-bench Verifiedで63.1%を記録しながら、推論トークン単価を前世代「Gemini 2.5 Pro」比で約67%削減。「性能を...
リード Microsoftが2026年5月28日(現地時間)に公開したCopilot Studio v3.0は、マルチエージェント間のタスク委譲をノーコードで設定できる「Agent Orchestration」機能を正式搭載した。同社の試算では、同等機能をゼロから構築した場合と比較してTCO(総保有コスト)が最大67%削減できるとされ、これまでAIエージェント導入を見送ってきた従業員数100〜50...
リード NVIDIAが2026年7月7日(現地時間)、次世代GPU「Blackwell Ultra B300」の量産出荷開始をアナウンスした。LLM推論スループットは前世代H200比で最大3倍——この数字が意味するのは、クラウド事業者のコスト構造が再び大きく書き換わるという事実だ。 何が起きているのか NVIDIA公式ブログおよびInvestor Day資料によると、B300はHBM3e 192G...
リード OpenAIは2026年7月16日、推論特化モデル「o4-mini High」をTier1以上の全APIユーザーへ開放した。入力コストは$0.30/1Mトークン(o3比▲70%)、出力は$1.20/1Mトークン。AIME 2025正答率92.3%、SWE-bench Verified 68.1%を維持しつつ単価を大幅に圧縮した。「推論は高価」という前提が、今日から変わる。 何が起きているの...
リード Microsoftは2026年7月18日、軽量言語モデル「Phi-4-mini Instruct」(38億パラメータ)をAzure IoT Edge環境に全面統合すると発表した。クラウドAPIへの往復レイテンシが不要になり、産業現場での推論コストが従来比で最大85%削減できるとしている。エッジAI実装を阻んできた「コスト・遅延・ネットワーク依存」の三重障壁が同時に崩れる局面と見られる。 何...
リード ソフトバンクが生成AIを使い、宣材動画を約10分で制作するサービスを開始したと日本経済新聞が2026年5月17日付で報じた。撮影・編集・ナレーション収録を含めると平均2〜5営業日を要してきた工程が1桁分の時間に圧縮される。単なる効率化ではなく、映像制作の「誰が・何日で・いくらで作るか」という問い自体が書き換えられる段階に入った。 何が起きているのか 日本経済新聞の報道によると、ソフトバンク...
リード Anthropic と OpenAI が 2026年8月18日、Model Context Protocol(MCP)バージョン 2.0 の仕様草案を GitHub 上で共同公開した。ツール呼び出し定義の統一フォーマットと非同期ストリーミング対応が核心。異なるベンダーのAIエージェントが共通プロトコルで直接連携できるようになれば、マルチエージェント構成の「接続コスト」が構造的に下がる分岐点...
リード Metaは2026年8月13日、「Llama 4 Scout」の商用API(Llama API)提供を正式スタートした。入力1Mトークンあたり$0.11——GPT-4oの約30%の価格水準——かつ最大512kトークンのコンテキストウィンドウとマルチモーダル入力を備えたモデルが有償APIで使えるようになったことで、OSSモデルが「性能で劣るが安い」という旧来の定式を崩しつつある。 何が起きて...
リード NVIDIAのBlackwell Ultraアーキテクチャ最上位GPU「B300」が2026年7月14日から本格的な量産出荷フェーズに入った。前世代H100比でAI推論スループットが3.5倍、電力効率が2.1倍を達成。これを受けてAWS・Azure・Google Cloudの3社が、AI推論APIの料金改定を今後90日以内に実施すると相次いで予告しており、LLMコスト構造の分岐点になるとみ...
リード OpenAIが2026年8月10日、推論特化モデル「o4-mini」を正式公開した。前世代o3-miniと比較して入力1Mトークンあたりのコストを約65%削減しながら、AMC/AIME 2025数学競技で正答率89.4%を達成。「安いと精度が落ちる」というトレードオフが崩れつつあり、API経由でビジネス展開するスタートアップの設計判断に即座に影響する。 何が起きているのか OpenAIは日...
リード OpenAIが6月27日23時(日本時間)、推論特化モデル「o4-mini」をAPIおよびChatGPTへ予告なし展開した。前世代「o3-mini」比でトークン単価を約70%圧縮しながら、数学ベンチマークAIME 2025で93.4%、コーディング評価SWE-bench Verifiedで68.7%を記録。"高精度か低コストか"の二択が崩れ、エージェントを数千〜数万並列で走らせる設計が現実...
リード DeepSeekが「V4」を2026年8月15日に正式公開した。総671Bながら推論時の活性化パラメータを67Bに絞るMixture-of-Experts(MoE)設計を採用し、MMLU・HumanEvalでGPT-4oと同等水準のスコアを記録しながらAPIコストをV3比約70%削減している。MoEアーキテクチャがMITライセンスで公開されたのは実質初となり、オープンソースLLM競争の軸が...
リード DeepSeekが推論特化モデル「R2」を2026年8月9日22:00(UTC+8)に正式公開した。入力トークン単価$0.014/Mは現行GPT-4o比で約89%安く、同時に主要ベンチマーク(AIME 2025: 92.3%、SWE-bench Verified: 61.8%)でGPT-5水準に並ぶと発表している。オープンウェイト配布・商用利用解放の組み合わせは、2025年1月のR1公開時...
リード GPT-4クラスの大規模言語モデルを動かすコストが、2023年から2年余りで約100分の1まで圧縮された。単価が限界費用に近づいたことで、企業の問いは「使うかどうか」から「何を任せるか」に移行した。AIが特別プロジェクトからインフラに変わる転換点が、静かに通過しつつある。 何が起きているのか 2023年3月のGPT-4リリース時点で、入力1Mトークンの処理コストはOpenAI公式レートで約...
リード AnthropicがClaude Sonnet 5を2026年6月30日に正式公開した。「数か月前まで大規模で高コストなモデルが必要だった水準の自律性を、Sonnetクラスのコストで実現した」というのが公式の主張だ。標準API価格は入力$3・出力$15/百万トークン(9月1日以降)。エージェントをプロダクション規模で動かす際のコスト計算が根本から書き換わる可能性がある。 何が起きているのか...
リード LLM推論コストの崩落が「使えるが高い」から「使わない理由がない」へとラインを越えた。GPT-4クラスの能力を持つモデルの入力コストは2024年初頭の約$30/1Mトークンから、2026年前半時点では$0.15〜0.30/1M トークン台まで低下。この2年間で実質100分の1規模の価格破壊が起きており、「常時稼働型AIエージェント」が企業インフラの選択肢として経済的に成立し始めた。 何が起...
リード 「ローカルで動かすには精度が足りない」——その前提が、2026年前半に静かに書き換えられた。7〜30Bパラメータ規模の小型言語モデル(SLM)が、特定タスクにおいてGPT-4o相当の精度に到達しつつあり、X上では「APIを捨てた」「オンプレに戻した」という投稿が増え始めている。触ってみないとわからない、とずっと言ってきたが、今回ばかりは数字が先に語りかけてくる。 何が起きているのか 202...
リード 「GPT-4クラスが月1万円以内で使い放題になる日が来た」——そんな投稿が今日のXで拡散された。2025年末比でLLM主力モデルのAPI単価が最大90%超下落した2026年上半期、数字は確かに劇的だ。ただ触ってみないとわからない部分も多い。背景と実装上の現実を一次データで整理する。 何が起きているのか 2026年6月時点、OpenAI・Anthropic・Googleが相次いでAPIプラン...
リード Mistral AIが2026年6月21日(UTC)、新モデル「Mistral Medium 3」をApache 2.0ライセンスのもと完全公開した。商用利用・改変・再配布に制限がなく、自社サーバーへのホスティングも無条件で可能。同社が公表したベンチマークでは、MMLU 85.2点・HumanEval 82.7点を記録し、「同推論コスト帯においてGPT-4o miniを上回る」と明示してい...
リード 「昨日も同じ説明をしたのに、また最初から話さないといけない」——AIエージェントを使い続ける人が必ず感じる壁に、ようやく本格的な解が揃いつつある。2026年夏、セッションをまたいだ「永続メモリ」を実装するフレームワークが複数成熟し、エンタープライズ導入の議論が一気に前進した。触ってみないとわからない、と思い立って手元で3種類の実装を動かしてみた。 何が起きているのか 永続メモリ(Persi...
リード 「1年前の10分の1で動く」──2026年夏、LLM推論APIの価格破壊が静かに、しかし確実に加速している。OpenAI、Anthropic、Googleが2026年上半期だけで複数回の値下げを実施。入力トークン単価が軒並み0.1ドル/Mトークンを割り込む水準に達し、「コストが高くて本番に載せられない」という声が変わり始めた。 何が起きているのか 2026年6月末時点で、主要プロバイダの代...