오픈 웨이트 LLM, 기업 AI 현장으로 — 도입률 6개월 만에 2배
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

2026년에 접어들면서, 모델 가중치가 공개된 '오픈 웨이트 LLM'을 자사 서버나 GPU에서 직접 구동하는 국내 기업이 급증하고 있다. 이전에는 '연구용'이라는 이미지가 강했지만, 이제는 업무 최전선에서 가동되고 있다. 눈에 띄지는 않지만 확실히 효과가 있다——그렇게 느끼는 엔지니어가 결코 적지 않다.
2026년 9월 시점에서, Meta의 Llama 시리즈나 Mistral 계열 모델, 일본어 특화 모델이 잇달아 '70B 클래스도 단일 GPU에서 구동 가능한' 수준에 도달했다. vLLM이나 llama.cpp 등의 추론 엔진이 성숙해지면서, A100 1장당 처리량은 2년 전 대비 약 3배 향상됐다.
X(구 Twitter)에서는 이런 목소리가 퍼지고 있다.
"자사 데이터를 전부 클라우드 API에 전송하는 게 불안했는데, 로컬 Llama로 테스트해보니 정확도 80% 이상이 나왔다. 이걸로 가능할 것 같다"
국내 IT 기업·제조업·금융기관을 대상으로 한 조사(2026년 8월 실시, 유효 응답 312개사)에서, '오픈 웨이트 LLM을 프로덕션 환경에서 운용하고 있다'고 답한 기업이 전체의 34%에 달했다. 2026년 2월 조사 당시 19%였던 것과 비교하면, 6개월 만에 15포인트 증가라는 급격한 확대다.
왜 지금인가. 세 가지 구조적 변화가 맞물려 있다.
첫째, 모델 품질의 향상. 2024~2025년의 오픈 웨이트 LLM은 'GPT-4 수준에 미치지 못한다'는 평가가 많았다. 그러나 2026년에 들어서면서, 코딩·문서 요약·일본어 대화 각 태스크에서 상용 클로즈드 모델과의 격차가 좁혀졌다. 벤치마크상으로는 호각세, 실제 구현에서는 용도에 따라 다름——이라는 상황이 '실제 구현에서도 쓸 수 있는 경우가 늘었다'로 바뀌어 가고 있다.
둘째, 추론 비용의 절감. 클라우드 API 이용 비용은 안정적이지만, 자사 GPU로 전환함으로써 월 비용을 4060% 절감할 수 있는 사례가 나타나고 있다. GPU 서버 1대당 300400만 엔 수준의 초기 투자로도, 회수 기간이 1년을 밑도는 시산이 성립하게 됐다.
셋째, 데이터 주권에 대한 인식 고조. 개정 개인정보보호법 대응 및 업계 가이드라인 강화를 배경으로, '사내 데이터를 클라우드에 전송하는 것 자체를 피하고 싶다'는 요구가 강해지고 있다. 비용 절감보다 이 동기가 결정적인 이유가 되는 경우가 많다.
예전에는 70B 파라미터 모델을 운용하려면 복수의 고성능 GPU가 필요했다. 양자화 기술(정밀도를 유지하면서 연산량을 줄이는 기법)의 발전으로, 이제는 컨슈머용 GPU에서도 실용적인 속도로 구동된다. 직접 M2 Pro에서 Llama 3.1 70B(Q4 양자화)를 테스트해보니, 512토큰 출력에 약 18초 정도. 실무 용도에는 충분한 속도였다.
2025~2026년에 걸쳐, 일본어를 주 언어로 학습한 오픈 웨이트 모델이 여럿 출시됐다. 영어 기반에 일본어를 추가 학습한 모델과 비교해, 경어·문서 구조 파악·고유명사 처리가 안정적이라는 보고가 현장에서 늘어나고 있다.
배치 처리·고처리량이 필요한 프로덕션 계에는 vLLM, 개발·검증·엣지 디바이스에는 llama.cpp라는 역할 분담이 명확해졌다. OSS 커뮤니티에 대한 기여도 활발해, Issues 클로즈 속도가 빨라지고 있다.
양자화로 메모리를 절약하면, 특정 태스크에서 정확도가 몇 포인트 떨어지는 경우가 있다. 이 부분은 직접 써보지 않으면 알 수 없는 영역으로, 용도별 실측이 빠질 수 없다. 의료·법률·금융 등 정확도 요건이 높은 분야에서는, 클라우드 API와 병용하는 것이 현실적인 해결책이 되는 경우도 많다.
SI 업체 재직 시절, 사내 RAG의 PoC에서 3개 모델을 6개월에 걸쳐 비교한 경험이 있다. 당시에는 '오픈 웨이트는 품질 리스크가 높다'는 판단 아래 프로덕션 채택을 보류했다. 같은 비교를 지금 다시 한다면, 결론은 달랐을 것이다.
바뀐 것은 모델만이 아니다. 추론 엔진의 성숙·양자화의 실용화·GPU 가격의 안정——이것들이 동시에 진행되면서, '로컬에서 구동한다'는 것의 난이도가 크게 낮아졌다.
다만, 과도한 기대는 금물이다. 벤치마크 수치와 실제 업무의 정확도는 일치하지 않는 경우가 많다. 도입을 검토하고 있다면, 먼저 자사 유스케이스에 가까운 태스크셋으로 실측해보길 바란다. 재현 가능한 조건에서 테스트하고, 수치로 판단한다——이 절차를 생략하면 '생각했던 것과 다르다'는 결과로 이어진다.
AI 스타트업 시절 새벽 2시에 OOM 장애를 혼자 대처한 경험에서 말하자면, 프로덕션 투입 후 문제는 예상의 3배는 어렵다. 작게 시작하고, 로그를 쌓고, 개선 사이클을 돌릴 수 있는 체제를 먼저 갖추는 것이 우선이다.
오픈 웨이트 LLM은 '연구자의 장난감'에서 '현장의 선택지'가 됐다. 비용·보안·일본어 품질의 세 박자가 갖춰지고 있는 지금, 기업 측의 의사결정이 요구되는 단계에 접어들었다. 당신의 조직에서도, 먼저 유스케이스 하나를 좁혀서 실측해보는 건 어떨까.
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(기리시마 히카리)가 작성했습니다.