「コーディングAI」の検索結果: ユーザー 0件・記事 18件
リード DeepSeekが2026年8月29日、推論特化モデル「R3」を正式公開した。AMATH(高度数学推論)ベンチマークでOpenAI「o3」を0.8ポイント上回り、SWE-bench Verifiedでも72.4%という新記録を更新。MITライセンスでモデルウェイトを同時公開しており、API単価はo3比で約8分の1とされる。「オープン・安価・ベンチ首位」の三条件が重なったのは初めてで、企業の...
リード Cursor AI(Anysphere社)が「Background Agent」機能を全プランユーザーへ正式展開した。エンジニアが別の作業をしている間にAIが自律的にコードを書き、テストを走らせ、プルリクエストまで準備する非同期フローが標準装備になる。「AIが補助する開発」から「AIが並走する開発」へ——作業単位の前提が変わる分岐点だ。 何が起きているのか 2026年8月7日、Cursor...
リード AIコーディングエージェントが、実際のオープンソースリポジトリに存在するバグ修正・機能追加タスクを自律的に解決し、Pull Requestとして提出する精度が急伸している。2026年6月時点で複数のエージェント実装がSWE-bench Verifiedで70〜76%の解決率を記録。1年前の同指標が約30%だった事実と照らすと、この18か月間の進展は「精度の改善」ではなく「実用閾値の突破」と...
リード AIがGitHubの実在するissueを自律修正する能力を測る「SWE-bench Verified」で、2026年5月末時点で複数の最新エージェントが正答率50%超を記録した。2023年末時点でのトップスコアが約4%だったことを踏まえると、18カ月で10倍以上の跳躍となる。この数字は「使えるかもしれない補助」から「任せられる主体」への質的転換を意味すると見られる。 何が起きているのか S...
リード OpenAIは2026年7月2日(現地時間)、次世代コーディングエージェント「Codex 2」のGitHub正式統合を発表した。Issueを読み取り、ブランチを切り、実装し、PRを起票してレビューコメントに応答するまでを単一エージェントが自律処理する。内部ベータ参加チームの平均で週5.2時間のコードレビュー工数削減が報告されており、開発組織の「人が書く仕事の範囲」を再定義する節目とみられる...
リード xAIが2026年7月5日(米国時間)、大規模言語モデル「Grok 4」を正式公開した。最大512Kトークンのコンテキストウィンドウ、X(旧Twitter)投稿データをリアルタイム参照できる検索機能、コーディング特化の「Grok 4 Code」モードを標準装備。API価格はGPT-4o比約40%安に設定されており、価格とデータ優位性でエンタープライズ市場への食い込みを図る。 何が起きている...
リード Mistral AIが2026年8月3日、最上位モデル「Mistral Large 3」をAPIおよびMistral Platformで正式公開した。数学推論ベンチマーク(MATH)89.3%、コーディング評価(HumanEval)92.1%を記録し、主要3指標でGPT-4oを上回る。欧州発LLMがグローバルランキングのトップ3に入るのはこれが初となる。 何が起きているのか 発表は日本時間...
リード AIエージェントが「試験導入」から「本番前提」へ移行しつつある。2026年に入り、GitHub Copilot WorkspaceやClaude Codeを実業務のCI/CDパイプラインに組み込む事例が国内でも増え始め、X上では「エージェントに丸投げしてみた結果」報告が連日流れている。触ってみないとわからない、を書き続けてきた立場として、今の現場の温度をまとめておきたい。 何が起きているの...
リード 「Copilotに直してもらった」から「エージェントが勝手にPR出してた」へ——この1文がエンジニアのSlackに流れる頻度が、2026年に入って明らかに増えた。AIコーディングツールが「提案」から「実行」へと役割を拡張しつつある今、現場で何が起きているかを整理する。 何が起きているのか 2026年6月時点で、AnthropicのClaude、GitHubのCopilot Workspac...
リード 「コードを書いてくれる AI」から、「コードを直してくれる AI」へ。2026年夏、AIコーディングエージェントはテスト実行・エラー解析・パッチ生成のループを自分で回せるようになってきた。ただし「何でもできる」は言いすぎで、実装上の制約は今もはっきりある。 何が起きているのか 今年6月〜7月にかけて、開発者コミュニティで「エージェントに全部任せたら朝には動いてた」という投稿が急増した。 「...
リード Hugging Faceが2026年8月27日、「SmolLM3-1.7B」を正式公開した。パラメータ数はわずか1.7Bだが、コーディングベンチマーク(HumanEval)でスコア72.3%を記録し、Llama 3.1 8Bの69.1%を3.2ポイント上回る。「大きいモデルほど賢い」という前提が、また一つ崩れた。 何が起きているのか 2026年8月27日 22:00(UTC)、Huggin...
リード AIコーディングエージェントが、ソフトウェアエンジニアリングの標準ベンチマーク「SWE-bench Verified」で94%超のスコアを複数モデルが達成したと報告された。2024年初頭に同ベンチマークのトップスコアが20%台だったことを考えると、18カ月で約4.5倍の跳躍だ。単発のコード補完ではなく「Issue起票→修正→テスト→PR作成」を一気通貫で実行できる水準に達しており、開発チー...
リード 「コパイロット(副操縦士)」だったはずのAIが、気づけば「機長」になっていた——。2026年夏、国内外のエンジニアコミュニティで「AIエージェントが1スプリントをほぼ完走した」という報告が相次いでいる。単なるコード補完から、要件定義→実装→テスト→PR作成まで一気通貫で走るエージェント型ワークフローへの移行が、静かに、しかし確実に進んでいる。 何が起きているのか 2026年上半期、AIコー...
リード コードを「補完」するAIから、コードを「考えて動かす」AIへ——この転換が静かに、しかし確実に進んでいる。2026年夏、開発現場でAIコーディングエージェントは単なる補助ツールを超え、複数ステップにわたるタスクの自律実行を担い始めた。ベンチマーク上の話ではなく、本番リポジトリで起きている話だ。 何が起きているのか 2026年上半期、主要なAIコーディングツールが相次いで「エージェントモード...
リード 補助ツールだったAIコーディングエージェントが、担当者に格上げされる。GitHub・Google・Amazonが2026年6月20〜21日にかけて相次ぎ、自律型AIエージェントを「本番コードの一次担当」として展開するロードマップを公表した。人間エンジニアの役割は「実装」から「仕様策定・レビュー・判断」へと移行する段階が、Q3中に始まるとみられる。 何が起きているのか GitHubは6月20...
「補完」から「委任」へ——転換点はもう過ぎていた これ、地味だけど効くやつだと思っていたら、いつの間にか効きすぎていた。2026年上半期、AIコーディングツールをめぐる空気が静かに変わった。「コードを提案してもらう」から「タスクを渡して待つ」への移行が、エンジニアの日常に浸透し始めている。 何が起きているのか Stack Overflowが2026年5月に発表した開発者調査(回答数約65,000人...
ローカルで動くLLMが、ついに「実務に耐える」ラインを超えてきた 2026年6月、OSSコミュニティで静かに、しかし確実に転換点が起きている。7B(70億)パラメータ規模のモデルを4bit量子化で動かした際のコーディング系ベンチマーク「HumanEval+」スコアが、ここ3ヶ月で平均12ポイント改善し、82〜85%台に到達したと複数の検証リポジトリが報告している。GPT-4oの同ベンチ公称値は87...