Qwen3.6-27B의 충격|RTX4090으로 Claude급 AI
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
"Claude Opus는 쓰고 싶지만 월정액 부담이 크다" "ChatGPT에 회사 코드를 넘기는 건 불안하다"——그런 고민을 단번에 날려버릴 무료 AI가 등장했습니다.
2026년 4월 22일에 공개된 Alibaba의 『Qwen3.6-27B』는, 가정용 게이밍 PC에서 동작하면서도 일부 벤치마크에서 Claude Opus 4.5와 어깨를 나란히 하는 충격적인 오픈소스 AI입니다.
무엇이 어떻게 대단한지, 쉽게 설명해 드립니다.
우선 『Qwen3.6-27B는 누가 만든 AI인가』라는 기본부터 확인해 봅시다.
Alibaba(중국의 Amazon 같은 존재)의 Qwen팀이 2026년 4월 22일, 최신 AI 『Qwen3.6-27B』를 Hugging Face와 ModelScope에 공개했습니다. Apache 2.0 라이선스라는 『상업적 이용도 OK, 개조해도 OK, 누구나 자유롭게 사용할 수 있다』는 느슨한 조건부입니다.
『카페가 레시피를 무료로 공개한 데다 변형도 OK』라고 선언한 것 같은 임팩트로, 전 세계 엔지니어들이 당일부터 다운로드를 시작했습니다.
파라미터 수는 270억(27B). 사실 Alibaba는 이전 버전인 『Qwen3.5』에서 3,970억(397B)의 MoE형 초대형 모델을 출시한 바 있습니다.
『대형 트럭보다 경차가 더 빠르다』는 있을 수 없는 결과가, 이번 27B에서 일어난 것입니다. 작은데도 강한 이유는 뒤에서 설명할 새로운 아키텍처에 있지만, 『AI는 크기로 결정된다』는 상식이 흔들린 역사적 순간으로 일컬어지고 있습니다.
성능을 나타내는 가장 중요한 지표가 벤치마크(AI끼리의 공통 테스트)입니다. Qwen3.6-27B는 코딩 분야에서 충격적인 점수를 기록했습니다.
SWE-bench Verified는 『실제 GitHub 이슈를 AI가 수정할 수 있는가』를 측정하는 테스트로, Qwen3.6-27B는 77.2%를 기록했습니다.
Claude Opus 4.6의 80.8%까지 불과 3.6포인트 차이로 접근했습니다.
Terminal-Bench 2.0(터미널 조작 숙련도)에서는 59.3%로 Claude Opus 4.5와 완전히 일치했습니다.
『세계 최강급 유료 AI와 대등해지는 무료 AI가 등장했다』는 사실이 업계에 큰 충격을 주고 있습니다.
새로운 기능인 『Thinking Preservation(사고 유지)』도 큰 차별화 포인트입니다.
기존 AI는 대화가 길어지면 『이전에 생각했던 것을 잊고 처음부터 다시 생각하는』 낭비가 발생했습니다.
Qwen3.6-27B는 추론 과정을 대화 이력에 저장하고, 다음 턴에서도 그대로 활용할 수 있는 구조를 갖추고 있습니다.
『요리 밑준비를 매번 다시 하던 것이, 냉장고에 보관해서 재활용할 수 있게 된』 이미지입니다. 에이전트(자동으로 작업하는 AI)의 정확도가 극적으로 향상됩니다.
『왜 작은데도 강한가』의 답이 바로 하이브리드 어텐션이라는 새로운 설계입니다.
Qwen3.6-27B는 총 64개의 트랜스포머 레이어로 구성되어 있으며, 『3회의 Gated DeltaNet(선형 어텐션)+ 1회의 일반 어텐션』의 4개 레이어 세트를 16번 반복하는 구조입니다.
『3명의 빠른 파트타임 직원에, 1명의 베테랑 직원이 감독으로 들어가는』 이미지입니다. 빠르면서도 지능을 떨어뜨리지 않는——계산량을 대폭 줄이면서 정확도를 유지하는 절묘한 균형이 만들어졌습니다.
한 번의 대화에 담을 수 있는 정보량의 기준이 컨텍스트 윈도우입니다. Qwen3.6-27B는 네이티브로 262,144 토큰, YaRN 기술로 약 1,010,000 토큰까지 확장 가능합니다.
『문고판 책 10권 분량을 한꺼번에 읽혀 요약시키는』 수준입니다. 방대한 Git 리포지토리 전체를 AI에게 통째로 읽혀 리팩터링을 시키는 등, 지금까지는 꿈같은 이야기였던 활용법이 현실이 됩니다.
오픈소스 AI에서 가장 중요한 것이 『자신의 PC에서 동작하는가』입니다. 여기서도 Qwen3.6-27B는 충격적입니다.
풀 BF16 가중치는 55.6GB로 크지만, Q4_K_M 양자화(품질을 유지하면서 크기를 압축하는 방법)라면 약 16.8GB까지 줄어듭니다.
RTX 4090(24GB VRAM 탑재 소비자용 최상위 GPU, 2026년 현재 약 30만 엔)한 장으로 쾌적하게 동작합니다.
Q5는 19.5GB, Q6는 22.5GB이므로, 게이밍 PC를 그대로 활용할 수 있습니다.
『작년까지 수백만 엔짜리 업무용 서버가 필요했던 AI가, 월 전기요금 3,000엔으로 동작하는』 시대의 도래입니다.
기업용으로는 Qwen/Qwen3.6-27B-FP8이라는 FP8(8비트 부동소수점)버전도 동시에 공개되었습니다. 블록 사이즈 128의 세밀한 양자화로, SGLang(0.5.10 이상)・vLLM(0.19.0 이상)・KTransformers・Hugging Face Transformers 등 주요 추론 런타임을 지원합니다.
『소규모 팀은 RTX 4090, 대기업은 H100/H200으로 대량 병렬 처리』와 같이, 규모에 맞게 구분해서 사용할 수 있는 설계가 호평을 받고 있습니다.
2026년 4월 시점의 주요 AI와 비교해 봅시다.
주목할 점은 『가성비(비용 대 성능)』입니다.
Claude로 월 수십만 엔이 드는 개발 현장에서도, Qwen3.6-27B라면 초기 투자인 GPU 비용만으로 해결됩니다.
Qwen 3.6 Plus 프리뷰는 Claude Opus 4.6의 2~3배 출력 속도라는 보고도 있어, 코딩 용도에서는 충분한 대체 후보가 되었습니다.
일본의 엔지니어・스타트업・중소기업에게 있어 Qwen3.6-27B는 게임 체인저가 될 수 있습니다.
일본 기업, 특히 금융・의료・제조업에서는 『사내 코드를 외부 AI에 제공하는 것은 NG』라는 규정이 일반적입니다.
Claude나 ChatGPT를 업무에서 사용할 수 없는 현장이 많은 것이 현실입니다.
Qwen3.6-27B는 자사 서버에서 완결되므로, 『사외비 코드를 집의 RTX 4090에 입력해 리팩터링 제안을 받는』 것이 합법적이고 안전하게 가능합니다.
『AI 활용에서 뒤처져 있던 업계가 한꺼번에 따라잡을 수 있는 인프라』가 갖춰졌습니다.
Qwen 시리즈는 예전부터 일본어 성능이 높은 것으로 유명합니다. Qwen3.6-27B도 일본어 프롬프트・일본어 출력・일본어 코드 코멘트에 충분히 대응하고 있습니다.
『국산 LLM을 기다리지 않아도, 중국발 고품질 모델을 무료로 사용할 수 있는』 상황에서, 로컬 LLM 시장(자사 호스팅형 언어 모델 시장)의 세력 지도가 빠르게 바뀌고 있습니다. AI 스타트업에게는 API 이용료가 급감하는 혜택이 막대합니다.
웹 앱 외주 개발로 월수입 80만 엔인 다무라 씨.
지금까지는 Claude Pro와 GitHub Copilot으로 월 1만 5천 엔을 지불해 왔습니다.
Qwen3.6-27B를 집의 RTX 4090에서 구동하고, Cline(VS Code용 AI 에이전트)에 연결해 갈아탔습니다.
『3개월에 18만 엔 절약, 게다가 오프라인으로 작업하는 신칸센 안에서도 동작한다』며 만족스러워했습니다. 클라이언트의 사외비 코드도 로컬 처리로 OK라는 안심감이 결정타였습니다.
직원 50명의 기계 부품 제조업체 IT 담당자, 다카하시 씨.
『고객 데이터를 외부 AI에 넘기지 말라』는 사장의 엄명 속에서, Qwen3.6-27B를 사내 서버에 설치했습니다. 청구서 OCR→기간 시스템 자동 입력→주간 리포트 자동 생성까지의 에이전트를 내부 개발했습니다.
『월 2,000장의 전표 처리가 3명→1명으로 돌아가게 됐다』는 성과를 사장에게 보고해, 사내 최초의 『AI 담당 임원(CAIO)』으로 승진했습니다.
재료공학의 기무라 교수.
『미발표 실험 데이터를 ChatGPT에 넣어 분석하는 것은 연구 윤리 위반』이라며 고민하고 있었습니다. Qwen3.6-27B를 연구실 워크스테이션에 도입하고, 실험 데이터의 패턴 분석・영어 논문 초안 작성・심사 코멘트 답변 초안까지 내부 제작화했습니다.
『국제 논문 투고 수가 연 3편→8편으로 늘었다』며 학회에서 화제가 되었습니다.
『무료 AI가 기초 연구의 생산성을 바꿨다』는 상징적인 사례입니다.
A. 모델 자체는 Apache 2.0으로 완전 무료입니다.
초기 투자는 RTX 4090(약 30만 엔)또는 중고 RTX 3090(약 10만 엔)입니다.
24시간 가동해도 월 전기요금은 약 3,000~5,000엔입니다.
『Claude Opus에 월 3만 엔 내는 것보다 반년이면 본전이 된다는 계산』으로, 개인이든 기업이든 투자 회수는 빠릅니다. 중고 3090이라면 더욱 3개월 만에 회수할 수 있습니다.
A. 오픈소스이므로 제3자가 가중치를 검증할 수 있으며, Apache 2.0 라이선스로 『어떻게 사용해도 된다』는 조건이기 때문에, 모델이 데이터를 외부로 전송하는 것은 기술적으로 불가능합니다(로컬 실행의 경우).
『중국 기업이 만들었지만, 동작하는 것은 당신의 PC 안뿐』이라는 구도입니다. 정부 기관 등에서는 도입 심사가 필요하지만, 민간 이용에서는 전 세계적으로 이미 일반화되어 있습니다.
A. CPU만 + DDR5 메모리 64GB 이상이라면 Q4 양자화 버전으로 동작은 가능하지만, 응답 속도가 1토큰/초 정도로 실용적이지 않습니다. Mac에서는 Apple Silicon(M3 Max 이상, 유니파이드 메모리 64GB 권장)으로 어느 정도 동작합니다.
『스트레스 없이 사용하려면 NVIDIA GPU 24GB 이상』이 2026년 4월 시점의 현실적인 답입니다. 주의:CUDA 13.2에는 버그가 있어 문자가 깨지므로, CUDA 13.1 또는 12.x 계열을 사용하십시오.
A. Apache 2.0은 『저작권 표시와 면책 조항을 포함하면 거의 무엇이든 OK』라는 느슨한 라이선스입니다.
자사 서비스에 탑재해 판매, SaaS 제공, 사내 업무 이용, 모두 가능합니다.
재배포 시에는 원본 라이선스 표기를 남길 필요가 있지만, 출력 결과에 대해서는 자유로운 권리를 주장할 수 있는 것이 특징입니다.
『AI가 생성한 코드를 자사 제품으로 판매해도 문제없습니다』.
A. 이미 Qwen 3.6 Plus Preview(1M 컨텍스트 지원)가 OpenRouter에서 선행 공개 중이며, 일반 버전도 플래그십으로서 크기가 다른 버전이 출시될 가능성이 높습니다. Qwen팀은 2025년부터 『분기마다 대형 업데이트』를 이어가고 있으며, 2026년 Q3에는 차세대 버전의 등장이 예상됩니다.
『구입한 GPU가 1년 만에 구식이 될 수 있다는 우려』는 있지만, AI 발전 속도를 생각하면 표준적인 리스크입니다.
『AI는 클수록 강하다』는 2024년까지의 상식은, Qwen3.6-27B에 의해 완전히 과거의 것이 되었습니다. 가정용 게이밍 PC에서, 세계 최첨단 상용 AI와 어깨를 나란히 하는 모델을 무료로 구동할 수 있는 시대——이 변화를 손 놓고 바라보는가, 지금 당장 직접 써보고 자신의 무기로 삼는가에 따라, 1년 후 엔지니어로서의 가치가 크게 달라집니다.
『무료로 최강의 AI를 아군으로 만든 사람이 이긴다』는 2026년 하반기의 도래, 먼저 30분간의 다운로드부터 시작해 보시는 건 어떨까요.
이 기사는 AI Friends 에서의 크로스포스트입니다.