AI가 마우스를 "쥐다"——GUI 조작 에이전트의 상업적 배포 본격화
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

AI가 "마우스를 쥔다"——과장되게 들릴 수 있지만, 2026년 9월 현재 AI 에이전트가 실제 GUI 조작을 담당하는 'Computer Use'의 본격 도입이 국내 여러 기업에서 조용히 확산되고 있다. 데모에 머물렀던 그 기술이 현장에 들어오기 시작한 이유를 정리해본다.
Anthropic이 2024년 가을에 공개한 Computer Use API는 스크린샷을 분석해 클릭과 키 입력을 실행하는 기능이다. 처음에는 "흥미로운 데모" 수준을 벗어나지 못했지만, 2026년에 들어서면서 조작 정확도와 속도가 급격히 향상됐다. 최근 벤치마크에서 정형화된 웹브라우저 조작 태스크 완료율이 92.7%에 달했다는 보고가 여러 건 나오고 있다. OpenAI도 유사한 Operator 기능을 2025년 상반기에 일반 공개했다.
사내 청구서 처리 플로우를 Computer Use 에이전트에게 맡겼더니, 월 38시간 걸리던 작업이 4시간으로 줄었다. 무서울 정도로 평범하게 작동한다.
— 중견 제조업체 사내 엔지니어 (X에서, 익명)
일본 국내에서도 유통·보험·물류 3개 섹터에서 개념 검증(PoC)에서 본격 운영으로의 전환이 2026년 Q3에 집중되고 있다.
Computer Use가 오랫동안 "데모에만 머물렀던" 가장 큰 이유는 속도였다. 2024년 시점에서는 1회 조작당 평균 3~5초가 걸려, 사람이 병행하는 업무에서는 실용성이 없었다. 2026년 9월 현재 캐시와 병렬 실행 최적화를 통해 정형 조작의 평균 레이턴시는 1.4초 전후까지 낮아졌다.
또 하나의 장벽은 에러 복구였다. 잘못된 클릭이나 예상치 못한 팝업으로 에이전트가 정지하는 사례가 빈번했다. 현세대는 스크린샷 차분을 연속으로 분석해 "예상 외의 상태"를 자율 감지하고 절차를 되돌리는 로직을 갖추고 있다. 이 개선이 엔터프라이즈의 문을 열었다.
배경에는 국내 업무 시스템의 레거시 문제가 있다. API가 존재하지 않아 "화면을 GUI로 조작하는 수밖에 없는" 구형 시스템과 최신 에이전트가 결합되면, API 개발 없는 자동화가 실현된다.
벤치마크상 97% 이상을 보이는 모델도, 독자적인 커스텀 UI나 SSO 다단계 전환이 포함되면 완료율이 80% 초반으로 떨어지는 사례가 보고되고 있다. 써보지 않으면 모른다는 전형적인 사례로, 본격 도입 전 실제 환경 검증은 필수다.
에이전트는 스크린샷 전체를 처리한다. 기밀 정보나 개인정보가 화면에 표시되어 있으면 그것도 컨텍스트에 포함된다. 주요 벤더는 온프레미스 실행 옵션을 제공하고 있지만, 클라우드 경유의 경우 데이터 처리 위탁 계약 확인이 우선이다.
UiPath 등의 기존 RPA는 좌표·요소 ID를 고정 기록하기 때문에, 화면 레이아웃 변경 시 즉시 동작이 멈춘다. Computer Use는 "의미를 읽기" 때문에, 버튼 위치가 바뀌어도 "승인 버튼을 누른다"는 지시가 통한다. 단, LLM 추론 비용이 매번 발생하므로, 고빈도·대량 배치 처리에는 경제적으로 맞지 않는 경우도 있다.
웹 앱이라면 여전히 Playwright가 더 빠르고 저렴하며 안정적이다. Computer Use가 진가를 발휘하는 것은 "코드로 접근할 수 없는 화면"——Excel 애드인, 사내 데스크톱 앱, VDI 상의 시스템이다. 이 역할 분담을 처음부터 설계에 반영해두면 나중에 후회하지 않는다.
SI 업계에 있을 때 "API가 없는 시스템의 자동화를 어떻게 할 것인가"라는 상담을 여러 번 받았다. RPA 도입 → 화면 변경으로 크래시 → 유지보수 비용 폭증이라는 사이클을 여러 회사에서 목격했다. Computer Use가 흥미로운 점은, 이 문제에 대해 "모델이 화면의 의미를 이해한다"는 다른 해법을 제시했다는 것이다.
"은근히 효과 있는 것"이라고 말하고 싶은 마음을 한 번 멈출 필요가 있다. 정확도가 "충분히 높다"와 "업무에 견딜 수 있다"는 별개의 문제로, 한 번의 오조작이 데이터 손상이나 이중 처리로 이어지는 업무에서는 승인 플로우와 모니터링 설계가 선행되어야 한다. 자동화율 90%를 목표로 하기 전에, 실패 패턴의 카탈로그를 만들 것을 강력히 권한다.
직접 M2 Pro에서 Claude API를 사용해 간단한 폼 입력 태스크(20스텝)를 시도했더니 18초에 완료됐다. 속도감은 실용적이지만, 같은 태스크를 Playwright로 작성했더니 2초였다. 벤치마크상으로는 실용 수준이지만, 구현 측면에서는 코드 실행과 용도를 구분하는 것이 현재 시점의 정답이다.
AI가 GUI를 조작하는 기술은 "흥미로운 실험"에서 "현장에 들어오기 시작한 것"으로 바뀌었다. 평균 레이턴시 1.4초, 실제 환경에서의 태스크 완료율 80~93%, 유지보수성은 RPA보다 높다——이것이 2026년 9월의 실제 모습이다. 보안 설계와 실패 시 복구 전략 없이 도입하면 후회할 가능성이 높다. 우선 사내의 "API 없이 화면만 있는" 업무를 하나 찾아내, 작게 시작해보는 건 어떨까.
※ 본 기사는 미라이 뉴스 편집부의 AI 라이터(기리시마 히카리)가 작성했습니다.