Mistral AI「Codestral 2.5」공개——SWE-bench 62.4%로 코드 자율 수정의 선택지가 바뀐다
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
Mistral AI는 2026년 8월 22일, 코드 전용 모델 「Codestral 2.5」를 정식 공개했다. SWE-bench Verified 스코어는 62.4%로, 32B 파라미터 클래스의 오픈 웨이트 모델로서는 현시점 최고 수준으로 평가된다. API와 오픈 웨이트 양쪽 형식으로 제공되며, 데이터센터 내 클로즈드 환경에서의 운용도 가능하기 때문에, 프로프라이어터리 일변도였던 기업의 조달 구조에 변화가 생기고 있다.
Mistral AI는 현지 시간 8월 22일 오후, 공식 X 계정 및 블로그를 통해 발표를 진행했다. 주요 스펙은 다음과 같다.
「Codestral 2.5를 CI/CD 파이프라인에 통합하는 데 3시간. 버그 검출률이 체감상 달라졌다. 오픈 웨이트로 사내 네트워크 안에서 완결할 수 있다는 점이 결정적이었다」
——모 SaaS 기업 엔지니어 (X 게시물에서)
HumanEval은 기존 방식의 단일 함수 완성을 측정하는 벤치마크로, 실무에 가까운 리포지토리 규모의 문제를 다루는 SWE-bench와는 난이도가 다르다. 62.4%라는 SWE-bench 스코어는 동일 크기대의 오픈 모델인 Qwen 2.5 Coder의 59.1%를 상회하며, 프로프라이어터리인 GPT-4o(57.8%)도 뛰어넘는다는 점이 주목된다.
Mistral은 2024년 6월 Codestral 초판을 공개한 이래 코드 특화 노선을 유지해 왔다. 그동안 Anthropic의 o4나 OpenAI의 Claude 계열이 에이전트 추론에서 앞서 나가는 한편, Mistral은 「실행 환경을 가리지 않는 오픈 웨이트」를 차별화 축으로 삼아왔다.
이번 2.5는 MCP v2.0이 표준화한 에이전트 간 통신 사양에 대한 대응이 가장 큰 설계 변경으로 꼽힌다. 도구 호출 정확도 향상과 롱 컨텍스트 처리의 안정화가 동시에 달성됨으로써, 단순한 코드 보완 도구에서 「자율 수정 에이전트의 기반」으로 용도가 확장되었다.
EU 규제 관점에서도, 유럽 역내에서 데이터를 외부로 전송하지 않는 형태로 운용할 수 있는 오픈 웨이트 모델에 대한 수요는 EU AI Act 시행 이후 급증하고 있다. Mistral이 유럽 기업에게 기본 선택지가 되어가고 있는 구조적 요인 중 하나다.
SWE-bench Verified에서 60% 초과는, 에이전트가 「혼자서는 감당하기 어려운 기존 버그를 일정 비율로 자율 수정할 수 있는」 수준을 나타낸다고 연구자들 사이에서 인식되고 있다. 개발자의 공수를 보완하는 보조 도구에서, 풀 리퀘스트를 자율적으로 생성하는 에이전트로의 전환이 현실화되는 임계점에 가까워지고 있다.
MCP v2.0 준거 오케스트레이터 위에서 Codestral 2.5를 로컬 노드로 구동하는 구성이, 공개 직후부터 여러 개발자에 의해 시도되고 있다. 폐쇄망 내에서 에이전트를 완결시킬 수 있다는 점은 금융·의료·공공기관 계열 유스케이스에서 특히 높은 평가를 받을 가능성이 있다.
입력 $0.28 / 100만 토큰은 GPT-4o의 입력 단가(현시점 $0.47 전후)와 비교해 약 40% 낮다. 코드 생성은 토큰 소비량이 많아 월간 비용이 쌓이기 쉽기 때문에, 대규모 CI/CD 통합 선정에서는 단가가 실질적인 선택 기준이 된다.
Mistral 공식 블로그에는 한국어 대응에 관한 명시적인 기술이 없으며, 한국어가 혼재된 코드베이스에서의 품질은 검증 대기 상태다. 국내 기업의 도입 판단에 있어서는 이 부분이 실측값을 필요로 하는 분기점이 될 것으로 보인다.
GitHub Copilot Agent Mode의 GA와 Anthropic Claude Agent SDK β 직후에 이번 릴리스가 나온 점은 우연이 아니라고 본다. 코딩 에이전트 시장에서 「API + 클라우드 의존」 대 「오픈 웨이트 + 온프레미스」라는 축이 명확하게 나뉘기 시작했다.
프로프라이어터리 진영은 스코어에서 앞서 나가고, 오픈 진영은 데이터 주권과 단가로 뒤를 쫓는——이 구도 자체는 작년부터 이어져 왔지만, SWE-bench의 60%대 도달로 그 차이가 「체감의 차이」로서 기업 담당자에게 가시화되는 단계에 접어들었다. 비용·보안·정확도의 트레이드오프가 명확해질수록, 사내 AI 코딩 기반 선정 회의에서 「어느 쪽에 록인할 것인가」라는 질문은 피할 수 없게 된다.
국내 SI업체·소프트하우스에게는, 오픈 웨이트를 활용한 차별화 서비스를 구성할 수 있느냐 여부가 내년의 수주 구조에 직결되는 논점이다.
Codestral 2.5는 벤치마크 단독의 이야기가 아니라, 「어떤 레이어에서 자율 코딩을 구성할 것인가」라는 설계 판단에 영향을 미치는 구현 수준의 사건이다. MCP v2.0 표준이 보급되는 가운데, 에이전트 기반으로 어떤 모델을 선택할 것인지는 앞으로 수개월 안에 수렴해 갈 가능성이 있다. 다음 초점은 Meta Llama 계열과 Qwen 계열이 이 스코어대에 따라잡는 속도와, Mistral이 상업용 라이선스 체계를 어떻게 정비하느냐에 있다.
※ 본 기사는 미라이 뉴스 편집부의 AI 라이터(AI 뉴스)가 작성했습니다.