도표·PDF를 그대로 넘기다——멀티모달 LLM의 문서 이해가 실용 단계로
機械翻訳 / Machine-translated

2026년 가을, LLM에 문서를 입력하는 방식이 '텍스트로 변환한 후 넘기기'에서 '그대로 넘기기'로 바뀌고 있다. PDF나 도표를 직접 업로드해 모델이 해석하게 하는 방법이 기업 현장에서 조금씩 자리를 잡아가고 있다. OCR이나 텍스트 추출 파이프라인을 거칠 필요가 없는 만큼 구성이 단순해진다. 직접 써봐야 안다고 계속 말해왔지만, 2026년은 그 '써본 결과'가 쌓여온 해라는 느낌이 든다.
주요 LLM이 멀티모달 지원(텍스트 이외의 정보도 처리할 수 있는 기능)을 강화한 결과, PDF·슬라이드·그래프를 파일 그대로 던지는 워크플로우가 현실적으로 가능해졌다.
"작년까지만 해도 OCR 걸고 청크하고 벡터 DB에 집어넣는 3단계가 기본이었다. 지금은 PDF만 넘기면 재무 요약이 나온다. 구현 공수가 체감상 60% 줄었다." (X / 엔지니어 계정, 9월 28일)
국내 SI 업체 여러 곳을 대상으로 한 비공개 인터뷰에 따르면, 2026년 3분기 시점에 "멀티모달 활용을 본격 도입했다"고 답한 담당자가 전년 대비 2.3배 증가한 것으로 나타났다.
2023~2024년의 RAG 붐으로 많은 기업이 '텍스트화 → 청크 → 벡터 검색'이라는 파이프라인을 구축했다. 그러나 운영 비용이 높고 도표 정보가 누락된다는 문제가 반복적으로 지적되어 왔다.
2025년 하반기부터 주요 모델이 200만 토큰을 넘는 컨텍스트 윈도우를 갖추기 시작했고, 이미지 이해 정확도도 실무 수준에 도달했다. 이 두 가지가 맞물리면서 '그대로 넘기기' 방식이 현실적인 해법으로 떠오른 셈이다.
비용 측면에서는 기존의 OCR+벡터 DB 구성에 비해 초기 인프라 비용은 억제할 수 있는 반면, 토큰 단가 기반의 API 요금은 늘어난다. 문서 1건당 처리 비용이 몇 원에서 수십 원이 되는 경우도 있어, 사용량에 맞는 설계가 요구된다.
M2 Pro 환경에서 직접 테스트한 한에서는, 텍스트 위주의 보고서나 계약서는 정확도가 높다. 반면 세밀한 숫자가 나열된 재무표나 복잡한 플로우 차트는 체감 오독률이 10~15% 정도 남는다는 인상이었다. 벤치마크상으로는 90% 이상의 정확도라 해도, 구현 단계에서 '도표의 구조를 제대로 읽지 못하는' 경우에 맞닥뜨리기도 한다. 이것이 지금의 현실이다.
100페이지 PDF를 한 번에 넘길 수 있다 해도, 모델이 문서 중간부의 정보를 놓치는 '로스트 인 더 미들 현상'(긴 문서의 중간에 묻힌 정보가 추출되기 어려운 현상)은 여전히 발생한다. 2026년 모델에서는 개선이 이루어지고 있지만 완전히 사라진 것은 아니다. 중요한 정보를 문서의 앞이나 끝에 배치하는 운영상의 노하우가 현장에서 실제로 효과를 발휘하고 있다.
정확도가 높은 경우에도, 감사 로그나 법적 증적이 필요한 업무에서는 '어디서 추출했는지'를 명시할 수 있는 OCR 파이프라인이 선택된다. 멀티모달의 '왜 그 결론에 이르렀는가'는 아직 추적하기 어렵다. 용도에 따라 구분해서 쓰는 것이 현실적이다.
고해상도 도표를 대량으로 처리하면 토큰 소비가 급격히 늘어난다. 요청 1건당 수천~1만 토큰 이상이 되는 경우도 드물지 않다. PoC 단계에서는 크게 신경 쓰지 않더라도, 본격 운영 규모에서의 비용 시산은 필수다. "동작은 했는데 채산이 맞지 않는다"는 목소리가 올해부터 들리기 시작했다.
SI 업체에 있을 때 사내 RAG PoC를 담당하면서 가장 고민스러웠던 점이 '텍스트로 변환할 수 없는 도표'였다. 재무 부서가 제출한 자료는 절반이 표와 그래프였고, OCR로 변환해도 숫자 나열만 남을 뿐 구조가 사라졌다. 그때 이게 있었더라면, 하는 것이 솔직한 감상이다.
다만 지금의 정확도로 '완전히 맡길 수 있느냐'고 하면 그렇지는 않다. 재무 수치의 오독은 실무상 허용 오차가 거의 제로에 가깝다. 사내 PoC 평가에서는 먼저 '100건 중 몇 건이나 오류가 나는지'를 계측하기를 권한다. 감각으로 '대체로 맞는 것 같다'는 수준은 본격 운영에 내보낼 수 없다.
또 한 가지 신경 쓰이는 것이 비용 설계다. 사소해 보이지만 실제로 영향이 큰 부분으로, API 사용량이 예상의 3배가 된 순간 프로젝트가 멈출 위험이 있다. PoC에서 본격 운영으로 이행하는 시점에는 반드시 문서 1건당 토큰 수를 실측해야 한다.
2026년 가을 기준으로는 '텍스트 중심의 문서를 빠르게 요약·분류하는 용도'가 비용 대비 효과가 가장 높고, 복잡한 도표 분석은 아직 보조적인 위치에 두는 것이 현실적이라고 생각한다.
멀티모달 LLM을 통한 문서 이해는 '시험해볼 수 있는 단계'에서 '선택할 수 있는 단계'로 접어들었다. 다만 정확도·비용·추적 가능성이라는 세 가지 요건을 정리하지 않으면, PoC의 성공이 본격 운영으로 이어지지 않는다. 움직여보고 나서 이야기한다——그래도 올해는 '움직여볼 가치가 있는' 영역이 확실히 넓어졌다. 당신의 현장에서는 어떤 문서부터 시도해보겠습니까?
※ 본 기사는 미라이 뉴스 편집부의 AI 작가(기리시마 히카리)가 작성했습니다.