「SWE-bench」の検索結果: ユーザー 0件・記事 9件
リード Mistral AIは2026年8月22日、コード専用モデル「Codestral 2.5」を正式公開した。SWE-bench Verifiedスコアは62.4%で、32Bパラメータクラスのオープンウェイトモデルとしては現時点での最高水準とされる。APIとオープンウェイトの両形式で提供され、データセンター内クローズド環境での運用も可能なため、プロプライエタリ一択だった企業の調達構造に揺さぶり...
リード AIコーディングエージェントが、実際のオープンソースリポジトリに存在するバグ修正・機能追加タスクを自律的に解決し、Pull Requestとして提出する精度が急伸している。2026年6月時点で複数のエージェント実装がSWE-bench Verifiedで70〜76%の解決率を記録。1年前の同指標が約30%だった事実と照らすと、この18か月間の進展は「精度の改善」ではなく「実用閾値の突破」と...
リード AIがGitHubの実在するissueを自律修正する能力を測る「SWE-bench Verified」で、2026年5月末時点で複数の最新エージェントが正答率50%超を記録した。2023年末時点でのトップスコアが約4%だったことを踏まえると、18カ月で10倍以上の跳躍となる。この数字は「使えるかもしれない補助」から「任せられる主体」への質的転換を意味すると見られる。 何が起きているのか S...
リード OpenAIは2026年8月16日(米国時間)、推論特化モデル「o4」をAPI・ChatGPT Proで同時公開した。コードベンチマーク「SWE-bench Verified」で71.3%を達成——前世代o3の53.1%から18ポイント超の跳躍だ。数学オリンピック相当問題(AIME 2026)の正答率は92.0%に達し、「AIエージェントに任せられる上限」の感覚的ラインが、今日を境に大きく...
リード OpenAIは2026年7月4日(米国時間)、推論特化モデル「o4」をAPIおよびChatGPT Plusで正式公開した。コーディングベンチマーク「SWE-bench Verified」の正解率はo3比18.5ポイント増の92.3%、数学オリンピック予選相当の「AIME 2026」では30問中30問正解を記録。「推論AIが人間の専門家水準を超える」がベンチマーク上の話でなく、実作業で問われ...
リード AIコーディングエージェントが「ファイル1枚」を超え始めた。2026年8月、複数の主要ツールがリポジトリ全体を文脈として参照しながらコードを書き、レビューし、バグを修正する能力を本格的に備えてきた。ベンチマーク数字が現場感覚に近づきつつある今、これは「地味だけど効くやつ」の典型かもしれない。 何が起きているのか SWE-bench(実際のGitHub Issueを解かせる評価セット)の最新...
リード コード生成にとどまらず、レビューへの返答・修正コミット・テスト通過まで自律的にこなす「自律PR」機能が 2026年8月、主要3社から相次いで正式リリースされた。SWE-bench Verified で78%を記録した実装も登場。触ってみないとわからないので、手元で動かしてきた。 何が起きているのか 2026年8月11日、GitHub が「Copilot Workspace v2」の一般提供...
リード AIコーディングエージェントが、ソフトウェアエンジニアリングの標準ベンチマーク「SWE-bench Verified」で94%超のスコアを複数モデルが達成したと報告された。2024年初頭に同ベンチマークのトップスコアが20%台だったことを考えると、18カ月で約4.5倍の跳躍だ。単発のコード補完ではなく「Issue起票→修正→テスト→PR作成」を一気通貫で実行できる水準に達しており、開発チー...
リード 2026年の夏、「AIに任せたら終わってた」という感想が開発者のタイムラインに増えている。自律型AIコーディングエージェントが、補完候補を出すだけのツールから、ファイルを読み、テストを走らせ、バグを直すところまで一気通貫でこなす存在になった。とはいえ、ベンチマーク上の数字と現場の感覚には依然としてギャップがある。触ってみないとわからない——その前提は、2026年も健在だ。 何が起きているの...