「llama.cpp」の検索結果: ユーザー 0件・記事 7件
リード 2026年夏、「手元のPCでGPT-4レベルのタスクが動く」が現実になりつつある。量子化技術と知識蒸留の組み合わせにより、7〜8Bパラメータの小型モデルがコーディング補助や社内文書要約といった業務タスクで、従来の70B超モデルに匹敵する精度を出し始めた。API費用とデータ外部送信リスクを避けたい企業にとって、選択肢が本物になってきた。 何が起きているのか 2026年6〜7月にかけて、複数の...
リード 「クラウドAPIを使わず、自分のマシンでLLMを動かす」——そのアイデア自体は2023年から存在したが、2026年夏、多くのエンジニアが「これ、実務に使えるな」と口にし始めている。Ollamaのダウンロード数は2025年末比で3.2倍に急増し、X上でも「ローカルLLM」「オンデバイス」関連のポストが週次で右肩上がりだ。何がそこまで変わったのか、手元のM2 Proで確かめた。 何が起きている...
リード 「思考型AIをローカルで動かす」が絵空事ではなくなってきた。2026年夏、量子化技術と推論エンジンの進化が重なり、CoT(連鎖的思考)系モデルがコンシューマーグレードのハードウェアで実用速度を出し始めている。ベンチマーク上の数字は派手だが、触ってみないとわからない部分も多い。手元のM2 Proで動かした結果を踏まえ、現場目線で整理する。 何が起きているのか 2026年に入り、オープンウェイ...
ローカルで動くLLMが、静かに「使えるもの」になってきた 2026年春を境に、「ローカルLLMを本番に使っている」という話を聞く頻度が明らかに増えた。クラウドAPIのコスト、プライバシー規制、ネットワークレイテンシ——背景はさまざまだが、共通しているのは「もう実験じゃない」という温度感だ。触ってみないとわからない性格なので、M2 ProにOllamaを入れて実測した。 何が起きているのか オープン...
リード クラウドAPIに課金し続けることなく、手元のPCでLLMを動かす時代が「実験」から「実用」に変わりつつある。ローカルLLM実行ツール「Ollama」の累計ダウンロード数が2026年7月時点で1億件を突破。個人開発者だけでなく、セキュリティ要件の厳しい金融・医療領域の企業にも導入が広がっている。 何が起きているのか Ollamaの公式GitHubリポジトリのスター数は2026年7月1日時点で...
リード 「ローカルで動かすより API のほうが速い」という常識が、2026 年夏を境に揺らいでいる。llama.cpp の最新ビルドと Ollama v0.4 系の組み合わせで、手元の民生 GPU でも毎秒 60 トークン超えが普通に出るようになってきた。これ、地味だけど効くやつだと思っている。 何が起きているのか 今月に入ってから X(旧 Twitter)では「ローカル推論が速くなった」という...
リード 2026年8月、「クラウドなしでLLMを動かす」が静かに現実になりつつある。llama.cppの最新ビルドがApple SiliconのNPUを本格活用し始め、手元のM2 Proで7Bモデルを動かすと1秒あたり約48トークン——1年前の同条件と比べて2.7倍速い数字が出た。触ってみないとわからない、を地で行く変化だ。 何が起きているのか 8月14日、llama.cppのメインリポジトリにN...