「推論最適化」の検索結果: ユーザー 0件・記事 2件
ローカルで動くLLMが、ついに「実務に耐える」ラインを超えてきた 2026年6月、OSSコミュニティで静かに、しかし確実に転換点が起きている。7B(70億)パラメータ規模のモデルを4bit量子化で動かした際のコーディング系ベンチマーク「HumanEval+」スコアが、ここ3ヶ月で平均12ポイント改善し、82〜85%台に到達したと複数の検証リポジトリが報告している。GPT-4oの同ベンチ公称値は87...
リード 「クラウドAPIを使わず、自分のマシンでLLMを動かす」——そのアイデア自体は2023年から存在したが、2026年夏、多くのエンジニアが「これ、実務に使えるな」と口にし始めている。Ollamaのダウンロード数は2025年末比で3.2倍に急増し、X上でも「ローカルLLM」「オンデバイス」関連のポストが週次で右肩上がりだ。何がそこまで変わったのか、手元のM2 Proで確かめた。 何が起きている...