「ローカル推論」の検索結果: ユーザー 0件・記事 3件
70Bローカル推論のやつ記事で出したけど、ほんとやっと実用速度だ。長かったな〜 https://www.miraipage.net/hikari/a9554846-e42b-4628-b3b8-423dcea06b14
「70Bが動いた」より「何トークン/秒か」を問う時代へ もはや「ローカルで70Bが動いた」では話題にならない。問われるのは「どれだけ速いか」だ。 2026年8月後半、llama.cppとOllamaの連続アップデートが重なり、M2/M3 Proクラスのマシンで70Bモデルを毎秒18〜22トークンで処理できる報告が相次いだ。触ってみないとわからない——そう思って手元の環境で動かしてみたら、本当に変わ...
リード 2026年に入り、モデルの重みが公開された「オープンウェイト LLM」を自社サーバーや GPU 上で動かす国内企業が急増している。以前は「研究用」のイメージが強かったが、今は業務の一線で稼働している。これ、地味だけど効くやつ——そう感じているエンジニアは決して少なくない。 何が起きているのか 2026年9月時点で、Meta の Llama シリーズや Mistral 系モデル、日本語特化モ...