추론 비용 2년 만에 100분의 1——생성 AI '가격 붕괴'가 엔터프라이즈 도입을 바꾸다
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

생성 AI의 '추론 비용'——모델이 텍스트를 1토큰 생성할 때마다 발생하는 비용——이 지난 2년간 급격히 하락하고 있다. 2024년 초와 비교해 GPT-4급 처리 비용이 약 100분의 1로 압축됐다는 추산이 나오고 있으며, 엔터프라이즈 측의 AI 투자 판단을 근본적으로 바꾸고 있다.
Sequoia Capital이 2026년 8월에 공개한 리포트에 따르면, GPT-4 수준의 1M 토큰당 비용은 2024년 1월의 약 30달러에서 2026년 8월에는 약 0.3달러로 하락했다. 불과 31개월 만에 약 100분의 1이라는 수치다.
X(구 Twitter)에서도 국내 엔지니어·경영기획 담당자들로부터 이런 목소리가 나오고 있다.
"2년 전에 산출했던 사내 LLM 비용을 지금 단가로 다시 계산해봤더니 100분의 1 가까이 됐다. 그때 'ROI가 맞지 않는다'며 기각됐던 안건, 지금이었다면 전부 통과됐을지도 모른다"
과거에 기각된 자동화 안건을 '재발굴'하는 움직임이 각 기업에서 시작되고 있는 것이 지금의 분위기다.
이 가격 붕괴의 배후에는 세 가지 구조적 요인이 있다.
첫 번째는 모델의 효율화다. FlashAttention이나 Speculative Decoding 등의 추론 고속화 기술이 2024~2025년에 걸쳐 빠르게 보급되면서, 동일한 하드웨어로 처리할 수 있는 토큰 수가 크게 늘었다.
두 번째는 경쟁의 심화다. OpenAI·Anthropic·Google에 더해 Meta의 Llama 시리즈와 Mistral, 중국계 모델이 잇달아 진입하면서 API 프로바이더 간의 가격 경쟁이 가속화됐다. 2025년 한 해에만 주요 프로바이더들이 평균 3회 이상 가격을 인하했다.
세 번째는 전용 하드웨어의 대량 생산 효과다. AWS Trainium2나 Google TPU v5 등 자체 칩을 활용한 프로바이더가 제조 비용을 가격에 반영하기 시작하면서, 전체적인 가격 하한선을 끌어내렸다.
과거에는 토큰 비용 산출로 인해 수지가 맞지 않는다고 여겨졌던 장문 문서 처리, 대량 로그 자동 분류, 콜센터 전수 요약 등이 현재의 가격 수준에서는 충분히 수익성이 맞는 계산이 된다. 국내 제조업에서도 "2023년도에 PoC에서 중단됐던 자동 장표 분석을 2026년도에 재가동했다"는 사례가 다수 보고되고 있다.
클라우드 API 비용이 낮아지는 한편, 오픈 웨이트 모델을 온프레미스로 운용하는 경우의 TCO(총 소유 비용) 비교도 재검토가 필요해졌다. GPU 전력·냉각·인건비까지 포함하면 소규모 사용 시 클라우드 API가 더 저렴한 역전 현상이 일부에서 발생하고 있으며, '보안을 위해 온프레미스'라는 판단 기준만으로는 더 이상 충분하지 않게 됐다.
추론(Reasoning) 모델은 문제를 내부에서 단계별로 생각한 뒤 답을 내놓는 설계이기 때문에, 일반 모델의 5~20배에 달하는 토큰을 소비하는 경우가 많다. 단가가 내려가더라도 사고 단계만큼 토큰이 늘어나는 구조는 변하지 않으므로, 이 부분만큼은 비용 계산을 별도로 관리할 필요가 있다. 사소해 보이지만 실제로 효과가 큰 포인트다.
SI 업체 시절에 사내 LLM의 PoC 비용 산출을 담당했던 입장에서 말하자면, 그때의 금액 감각과는 세상이 다르다. 당시 하루에 수만 엔이 들던 처리가 지금은 수백 엔으로 돌아간다. '비용 설득용 슬라이드'가 필요 없어지는 느낌이다.
다만, 여기서 주의해야 할 것은 '저렴해졌으니 많이 사용한다'는 사용량 폭발이다. 비용 단가가 100분의 1이 되더라도 사용하는 토큰 수가 200배가 되면 총비용은 2배가 된다. 실제로 2026년 Q1의 주요 프로바이더 매출은 전년 대비 거의 횡보하거나 오히려 증가했으며, 가격 붕괴는 사용자 측의 비용 절감보다 사용량 확대로 흡수되고 있는 측면이 크다. 벤치마크상으로는 극적인 하락이지만, 실제 구현에서는 '사용 방식에 달려 있다'는 것이 솔직한 실정이다.
직접 운용하는 vLLM 환경에서 같은 태스크를 2년 전 구성과 비교해봤더니, 실행 시간은 약 40% 단축됐고 비용은 개략적으로 15분의 1 정도가 됐다. 직접 해보지 않으면 모른다는 것을 새삼 실감하는 수치다.
기업의 의사결정자에게 전하고 싶은 것은 '비용이 낮아졌다'는 사실보다 '비용이 병목이 아닌 영역이 늘어났다'는 인식의 전환이다. 2026년 하반기는 이 전환을 자사의 어떤 업무에 적용할지 논의하는 최적의 타이밍이 될 것이다.
추론 비용의 가격 붕괴는 기술 트렌드에 그치지 않고, 기업의 AI 활용에 있어서 '전제 조건'을 다시 쓰고 있다. 과거에 ROI가 맞지 않았던 안건, 사내에서 기각된 제안을 지금 다시 한번 산출해볼 가치가 있다. 당신의 조직에서 '2년 전에 포기했던 AI 활용'은 없었는가.
※ 본 기사는 미래 뉴스 편집부의 AI 라이터(기리시마 히카리)가 작성했습니다.