온디바이스 AI가 '프로덕션 수준'으로——14B 모델이 GPT-4o와의 성능 격차를 5% 이내로 좁혔다
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

9월 첫째 주, Microsoft가 'Phi-4-mini' 정식 버전을 공개했다. 14B 파라미터, INT4 양자화로 불과 8GB. 그럼에도 GPT-4o와의 성능 격차는 주요 벤치마크 기준으로 5% 이내에 머문다. 'SLM(소형 언어 모델)은 타협의 산물'이라는 인식이 조용히 바뀌고 있다.
2026년 9월 5일, Microsoft는 Phi-4-mini를 Hugging Face에서 일반 공개했다. 14B 파라미터라는 얼핏 작은 규모임에도 불구하고, 지식 벤치마크 'MMLU'에서 87.4%, 코딩 벤치마크 'HumanEval'에서 89.1%를 기록했다. GPT-4o의 각각 91.2%·92.4%와 비교하면, 격차는 3~5포인트로 줄었다.
INT4 양자화(모델의 가중치를 4비트 정수로 표현해 사이즈를 압축하는 기술)를 적용한 배포 파일은 8GB. 소비자용 GPU 한 장으로도 구동되며, M2 Pro 같은 최신 노트북에서도 40토큰/초를 안정적으로 낸다.
X에서는 다음과 같은 게시글이 좋아요 2.7만 개, 리포스트 6,400개를 모았다.
"사내 RAG를 GPT-4o API에서 Phi-4-mini 로컬 추론으로 전환했다. 월 API 비용이 97% 줄었다. 정확도 차이는 프로덕트 오너가 구별하지 못했다"
SLM의 성능 향상은 하루아침에 이루어진 것이 아니다. Microsoft는 Phi 시리즈를 2023년 말부터 차곡차곡 쌓아 올리며 '적은 파라미터로 높은 추론 정확도'를 추구해 왔다. 이번 도약을 뒷받침한 기술은 크게 두 가지다.
지식 증류가 주전장이 됐다. GPT-4o급 대규모 모델이 생성한 데이터를 교사 데이터로 활용해, 소형 모델에 '사고 패턴'을 전이하는 방식이다. 2025년 이후, 증류 데이터의 품질 관리와 다양성 설계가 정확도 향상의 핵심이 되었다.
양자화로 인한 정확도 저하가 거의 해소됐다. INT4 양자화는 한때 정확도 저하의 대명사였지만, AWQ(Activation-aware Weight Quantization)의 보급과 개선으로 실용상의 저하를 무시할 수 있는 수준까지 억제되었다.
이 두 가지가 맞물려 '14B로도 현장에서 쓸 수 있다'는 임계점을 넘었다. 벤치마크 수치가 증명하는 것보다, 현장 엔지니어들이 비용 계산을 시작했다는 사실이 보급의 진짜 신호라고 생각한다.
GPT-4o를 월 100만 토큰 사용하면, 현행 $15/MTok 기준으로 월 1,500달러. 로컬 추론으로 전환하면, 전기료와 초기 설비 비용을 제외하면 추가 비용은 거의 고정된다. 사용자 수가 늘수록 클라우드 비용은 선형으로 쌓이는 반면, 로컬은 규모가 커져도 한계비용이 거의 제로라는 구조다.
의료·법무·금융에서는 입력 데이터를 클라우드로 전송하는 것 자체가 컴플라이언스상 리스크가 되는 경우가 있다. 로컬 추론이 '프로덕션 수준'에 도달함으로써, 이러한 업계에서 본격 도입에 나설 수 있는 조건이 갖춰지기 시작했다.
이거, 눈에 안 띄지만 꽤 중요한 부분인데——범용적인 지식 문답이나 정형 태스크에서는 GPT-4o와의 격차가 줄더라도, 장문의 복잡한 추론이나 고난도 멀티스텝 문제에서는 여전히 차이가 나기 쉽다. '전부 로컬로 옮긴다'는 발상보다, '어떤 태스크를 어디서 실행할 것인가'라는 아키텍처 설계가 요구되는 국면에 접어들었다.
직접 가지고 있는 M2 Pro에서 llama.cpp를 사용해 Phi-4-mini의 INT4 버전을 실제로 구동해 봤다. 시작부터 첫 토큰 생성까지 3.2초, 이후 40토큰/초는 거의 공칭값 그대로였다. 한국어 문장 생성 품질은, 1년 전의 동급 모델과는 명확히 다른 수준이라는 인상을 받았다.
SI 업계에 있을 때 RAG 기반 사내 검색을 만들면서, '로컬 모델은 타협의 연속이었다'는 기억이 있다. 프롬프트를 다듬기 전에 모델의 한계에 부딪혔었다. 그것이 지금, 8GB 파일 하나로 여기까지 오게 될 줄은 솔직히 예상하지 못했다.
직접 써봐야 알 수 있다——하지만 써보면 '프로덕션 투입을 검토할 이유'는 확실히 늘어나고 있다. 단, 벤치마크 수치만으로 판단하는 것은 섣부르다. 도메인 특화 태스크에서의 검증, 프롬프트 설계의 여지, 그리고 운영 비용(모니터링·버전 관리·업데이트) 시산까지 포함해서 비로소 판단할 수 있다. 벤치마크상 5% 차이라도, 구현상으로는 설계에 따라 크게 달라진다는 것이 지금의 견해다.
기업이 다음에 고민할 것은 '어떤 태스크를 로컬로 옮기고, 어떤 태스크를 클라우드에 남길 것인가'라는 하이브리드 설계가 될 것이다. 그 베스트 프랙티스가 앞으로 반 년 안에 빠르게 정리되어 갈 것이다.
SLM의 '프로덕션 수준' 도달은, 클라우드 AI와 엣지 AI의 역할 분담을 다시 묻는 사건이다. 비용·프라이버시·레이턴시라는 세 박자에서, 로컬 추론이 우위를 점하는 유스케이스는 확실히 늘어나고 있다. 당신의 현장에 있는 태스크는 클라우드와 로컬, 어느 쪽에 적합한가——한 번, 태스크 단위로 정리해 볼 가치는 충분히 있다.
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(기리시마 히카리)가 작성했습니다.