Alibaba 「Qwen 3.5」——중국산 LLM이 1위 달성, 오픈 웨이트로 산업 현장 도입 가속
機械翻訳 / Machine-translated
Alibaba Cloud가 9월 7일(일본 시간), 대규모 언어 모델 「Qwen 3.5」를 공식 출시했다. 수학 추론 벤치마크 「MATH-500」에서 92.4점, 코딩 평가 「LiveCodeBench v4」에서 78.1점을 기록하며, GPT-4o(88.3점·74.9점) 및 Gemini 2 Pro(89.1점·75.6점)를 모두 앞질렀다. 720B 파라미터의 오픈 웨이트를 Apache 2.0 라이선스로 당일 공개. API 의존에서 벗어나려 해온 기업들에게 명확한 선택지가 생겼다.
Alibaba는 일본 시간 14:00, 공식 블로그와 X 공식 계정을 통해 Qwen 3.5의 세부 사항을 발표했다. 모델은 3가지 크기로 제공된다.
릴리즈 노트에는 「72개 언어 지원, 일본어 평가 점수는 전 세대 대비 31% 향상」이라고 기재되어 있다. X에서는 일본어 엔지니어 커뮤니티에서도 속보가 잇따랐다.
「Qwen 3.5-72B를 사내 데이터로 파인튜닝했다. GPT-4o에서 갈아탈 수 있는 수준. 비용이 1/5 이하로 줄었다」(엔지니어 계정, 좋아요 2.1만)
Qwen 시리즈는 2023년 초판 공개 이후 약 3년간 빠르게 성장했다. 2025년 초 Qwen 2.5 시점에서 이미 일본어·코딩 분야에서 최상위권 평가를 받았으며, 오픈 웨이트 버전의 충실한 지원이 생태계 확장을 이끌어왔다.
Alibaba Cloud는 2026년 3월 「AI와 클라우드에 3년간 누적 5,000억 위안(약 96조 원) 투자」를 발표했다. 모델 개발팀을 두 배로 늘렸으며, 이번 720B 모델은 그 최대 규모의 산출물로 여겨진다.
미·중 반도체 규제가 이어지는 가운데 Aliyun의 GPU 조달이 제약을 받고 있다는 관측이 있었지만, 이번 벤치마크 결과는 「제약 속에서도 성능 경쟁에서 살아남을 수 있음」을 보여주는 형태가 됐다.
API 단가 $0.18/M 입력 토큰은 Claude 5 Haiku($0.30)를 크게 밑돈다. 동등한 성능대에서 비용 차이가 명확해지면, 비용 민감도가 높은 스타트업과 중견 기업에서의 채택이 가속될 것으로 보인다.
Apache 2.0 라이선스로 720B를 공개한 것은, 벤더 종속을 피하고 싶은 대기업·정부 기관에 직접적으로 와닿는다. 자사 클라우드에 배포할 수 있게 되므로, 데이터 주권 규제가 엄격한 일본·EU 시장에서의 도입이 현실적으로 가능해진다.
전 세대 대비 31% 향상이라고 하지만, 평가 데이터셋의 상세 내역은 미공개다. JSQuAD나 JEMHopQA 등 표준 벤치마크에서의 독립적인 검증 결과가 나올 때까지는 수치를 액면 그대로 받아들여서는 안 된다. 사내 데이터를 통한 실측이 우선이다.
72B급 오픈 웨이트 모델을 API보다 낮은 비용으로 사용할 수 있게 되면, 업종 특화 모델의 사내 개발이 가속된다. 제조·금융·의료 등, 고유 지식이 경쟁 우위에 직결되는 분야에서의 움직임이 나타날 것으로 전망된다.
API 모드에서는, 프롬프트와 응답이 Alibaba Cloud 인프라를 경유한다는 점을 확인할 것. 오픈 웨이트를 온프레미스로 운용하는 경우 이 제약은 피할 수 있지만, 학습 데이터의 투명성은 아직 제한적이다. 중요한 유스케이스에서는 제3자에 의한 모델 감사 결과가 나올 때까지 본격 적용을 보류하는 판단도 합리적이다.
수치만 보면 「또 중국 업체가 1위」라는 헤드라인이 되겠지만, 이번의 의미는 벤치마크 순위보다 오픈 웨이트 720B의 존재 자체에 있다.
GPT-4o급 성능을 Apache 2.0으로 자유롭게 사용할 수 있는 모델이 등장한 시점에서, API 종량제 의존이었던 AI 도입 비용의 전제가 무너진다. 지금까지 「성능 vs 비용」만으로 보아왔던 기업들의 벤더 선정에, 「오픈 웨이트 자체 운용 vs API 풀 매니지드」라는 세 번째 축이 더해진다.
일본어 성능 31% 향상이 실제 유스케이스에서 체감할 수 있는지 여부는, 향후 2~3주 내에 독립적인 벤치마크 평가가 나올 것이다. 확인해야 할 3가지 항목은, 장문 요약 정확도, 경어·문체 제어, 전문 용어(의료·법률·제조) 변환 정확도다. 이것이 갖춰지면 「국산 모델을 기다릴 것인가, Qwen 3.5로 갈아탈 것인가」라는 실무적 판단이 요구되는 국면이 찾아온다.
「성능도 가용성도 서방에 뒤진다」는 전제가, 이번 공개로 더 이상 성립하지 않게 됐다. AI 조달의 비교 기준에 중국산 오픈 웨이트 LLM을 추가할 시점이 왔다——당신의 조직의 판단 기준은, 아직 2025년 이전에 머물러 있지는 않은가.
Qwen 3.5는 성능·비용·라이선스 세 가지 측면에서 명확한 경쟁력을 갖는다. 다음으로 움직이는 것은 독립 벤치마크 진영과, 일본어 파인튜닝을 시도하는 엔지니어 커뮤니티다. 2~3주 이내에 실측 데이터가 모이고, 채택 판단의 기반이 다져질 것으로 전망된다.
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(AI 뉴스)가 작성했습니다.