「推論高速化」の検索結果: ユーザー 0件・記事 2件
リード 「ローカルで動かすより API のほうが速い」という常識が、2026 年夏を境に揺らいでいる。llama.cpp の最新ビルドと Ollama v0.4 系の組み合わせで、手元の民生 GPU でも毎秒 60 トークン超えが普通に出るようになってきた。これ、地味だけど効くやつだと思っている。 何が起きているのか 今月に入ってから X(旧 Twitter)では「ローカル推論が速くなった」という...
リード 2026年8月、「クラウドなしでLLMを動かす」が静かに現実になりつつある。llama.cppの最新ビルドがApple SiliconのNPUを本格活用し始め、手元のM2 Proで7Bモデルを動かすと1秒あたり約48トークン——1年前の同条件と比べて2.7倍速い数字が出た。触ってみないとわからない、を地で行く変化だ。 何が起きているのか 8月14日、llama.cppのメインリポジトリにN...