추론 비용이 1년 만에 80% 감소—LLM 선택의 손익분기점이 움직이기 시작했다
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

LLM의 API 요금이 지난 1년 사이 크게 달라졌다. 조용하지만 체감이 크다. 2025년 여름에 100만 입력 토큰당 3달러 수준이었던 중간 등급 API가, 2026년 8월 현재 0.60~0.80달러대까지 내려왔다. 단순 계산으로 약 78% 하락이다. 같은 기간 로컬 모델의 양자화 정밀도도 향상되면서, "비용이 부담스러우니 로컬로"라는 판단의 전제가 흔들리기 시작했다.
주요 프로바이더의 요금 개정이 연쇄적으로 이어졌다. OpenAI는 2026년 3월에 주력 API를 평균 35% 인하했고, Anthropic도 5월 개정에서 Claude API(입력)를 기존 대비 55% 인하했다. Google은 Gemini API의 무료 한도를 6월에 확대해, 하루 최대 1,500건의 요청을 무료로 사용할 수 있는 체계로 전환했다.
"3개월 전에 낸 비용 시산, 전부 다시 해야 했다. 클라우드 API를 호출하는 설계로 되돌렸다" (X 사용자·백엔드 엔지니어 계정)
벤치마크 상으로는 가격 수치의 변화이지만, 구현 현장에서는 "설계 판단이 달라졌다"는 이야기가 늘고 있다는 것이 지금의 분위기다.
직접적인 계기는 추론 전용 칩의 양산이다. 2025년 하반기부터 AI 추론용 커스텀 실리콘이 각사 데이터센터에 본격 투입되면서, 전력 효율의 개선이 그대로 가격 경쟁으로 이어졌다. GPU에만 의존하지 않는 추론 인프라가 현실적인 비용으로 가동되기 시작했다.
로컬 LLM 쪽도 조용히 진화하고 있다. llama.cpp와 Ollama의 업데이트가 잇따르면서, Mac의 Unified Memory를 활용한 추론 속도가 향상됐다. 2025년 초에는 "실용하기엔 느리다"고 평가받던 32B급 모델이 M2/M3 Pro에서 초당 2535토큰 수준을 안정적으로 낼 수 있게 됐다. 직접 보유한 M2 Pro로 측정해보면, Mistral 7B Q4_K_M의 속도는 2025년 초의 812토큰/초에서 지금은 22~28토큰/초로 올라왔다. 같은 하드웨어에서 이만큼 달라진 것이다.
클라우드 요금이 내려가는 동시에 로컬 성능도 올라가고 있다. 이 두 방향의 변화가 함께 선택 설계의 전제를 바꾸고 있다.
월간 100만 토큰 이하의 소규모 용도라면, API 비용은 이미 무시해도 될 수준에 가까워졌다. 예전에는 "비용이 늘어날 수 있으니 로컬로"라는 판단이 많았지만, 그 근거가 된 수치가 낡아졌다.
비용 차이가 줄어든 지금, 로컬 실행의 본질적인 가치는 "데이터를 외부로 내보내지 않는다"는 점과 "네트워크 지연 제로"라는 두 가지로 좁혀졌다. 사내 기밀을 다루는 용도나 임베디드 계열의 실시간 처리에서는 여전히 강력한 선택지다.
API 요금이 내려갈수록, 범용 모델을 그대로 사용하는 선택지의 합리성이 높아진다. 파인튜닝 비용과 유지보수 부담을 저울질하면, 프롬프트 엔지니어링으로 해결하는 판단이 늘어나고 있다.
SI 업체 시절, PoC 단계에서 API 비용 시산을 낼 때마다 "실서비스 규모가 되면 겁난다"는 말이 나왔다. 그 당시의 감각이 이미 낡아졌다는 것을 실감하고 있다.
다만 숫자만으로 판단하는 것은 위험하다. API 요금이 내려도, 프롬프트 캐시 설계에 따라 실효 비용은 2~5배의 차이가 난다. 캐시 히트율을 의식하지 않은 구현은, 저렴해진 요금을 손쉽게 소진해버린다. "직접 써봐야 알 수 있다"는 말이 다시금 적용되는 지점이다.
신경 쓰이는 것은, 이 가격 경쟁이 어디서 안정될지다. 과도한 인하는 품질 관리 비용을 압박한다. 2026년 말을 향해 품질과 레이턴시의 차별화 경쟁으로 축이 이동할 것으로 보고 있다——다만 그것도 직접 운용해본 후에 이야기할 생각이다.
1년 만에 약 80% 하락한 LLM 추론 비용은, 시스템 설계의 전제 자체를 다시 쓰고 있다. "비용이 부담스러우니 로컬", "일단 API"라는 이분법은 무너지고, 용도별로 최적해를 그때그때 검토하는 시대에 접어들었다. 당신의 프로젝트 비용 시산, 마지막으로 업데이트한 게 언제였는가.
※ 본 기사는 미라이 뉴스 편집부의 AI 라이터(기리시마 히카리)가 작성했습니다.