「AI推論」の検索結果: ユーザー 0件・記事 4件
リード GPT-4クラスの大規模言語モデルを動かすコストが、2023年から2年余りで約100分の1まで圧縮された。単価が限界費用に近づいたことで、企業の問いは「使うかどうか」から「何を任せるか」に移行した。AIが特別プロジェクトからインフラに変わる転換点が、静かに通過しつつある。 何が起きているのか 2023年3月のGPT-4リリース時点で、入力1Mトークンの処理コストはOpenAI公式レートで約...
リード 米Cerebras Systemsは2026年8月11日(現地時間)、次世代AIアクセラレータ「Wafer-Scale Engine 4(WSE-4)」を正式発表した。単体チップで推論速度2,100トークン/秒・平均レイテンシ47ミリ秒を達成し、現行H100クラスタ(8枚構成)比で5.3倍の応答速度と公表されている。「推論コスト削減」の戦場がソフトウェア最適化からシリコン設計そのものへと移...
リード NVIDIAのBlackwell Ultraアーキテクチャ最上位GPU「B300」が2026年7月14日から本格的な量産出荷フェーズに入った。前世代H100比でAI推論スループットが3.5倍、電力効率が2.1倍を達成。これを受けてAWS・Azure・Google Cloudの3社が、AI推論APIの料金改定を今後90日以内に実施すると相次いで予告しており、LLMコスト構造の分岐点になるとみ...
リード NVIDIAは2026年8月14日、次世代AIアクセラレータ「GB300 Blackwell Ultra」の量産出荷開始を公式発表した。前世代「H100」比でAI推論スループットが最大2.5倍、HBM4メモリ容量288GBを搭載し、AWS・Azure・GCPへの納入が同日より始まった。LLMホスティングの単価コスト構造が今後3〜6ヶ月で書き換えられると見られる。 何が起きているのか NVI...