AI 동영상 생성 '프로 품질' 원년——60초·4K 동시 지원으로 영상 제작 현장이 움직이기 시작했다
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

2026년 8월, AI 동영상 생성은 '만져볼 수는 있지만 실제로 쓸 수는 없는' 단계를 벗어났다. Sora·Runway Gen-4·Kling v2.0, 세 가지 툴이 같은 달 안에 60초 이상 연속 생성·4K 출력·캐릭터 일관성이라는 '3대 과제'를 모두 갖춰 업데이트를 단행했다. 영상 크리에이터들의 타임라인이 조용하지만 확실하게 술렁이고 있다.
OpenAI가 8월 12일 Sora의 대규모 업데이트를 발표했다. 핵심은 최대 90초 연속 생성과 4K/60fps 출력 지원으로, Pro 플랜(월 200달러) 사용자부터 순차적으로 롤아웃 중이다. 같은 주에 Runway Gen-4도 'Director Mode'를 정식 출시했다. 씬을 넘어 캐릭터의 얼굴·의상·움직임을 83% 이상의 일치율로 유지할 수 있다고 공식 블로그에 밝혔다.
X에서는 영상 디렉터로 보이는 계정의 게시물이 확산되고 있다.
"Sora로 해봤더니 진짜로 90초가 됐다. 콘티 촬영용으로는 쓸 수 있다. 다만 움직임이 아직 'AI 티'가 나는 부분이 있어서 프로 납품에 쓰기는 겁난다"
한편 중국발 Kling v2.0이 8월 15일에 출시됐다. API의 1분 동영상 비용을 0.08달러까지 낮춰왔다. 비용 면에서 한발 앞서 나간 셈이다.
AI 동영상 생성은 2024년 Sora가 등장한 이후, '대단한 데모이지만 실무에서는 쓸 수 없다'는 평가가 이어져 왔다. 이유는 주로 세 가지——생성 시간이 너무 짧다(최대 15~20초), 해상도가 HD에 머문다, 캐릭터가 도중에 다른 사람으로 바뀌는 '캐릭터 붕괴' 문제다.
2025년 내내 Runway·Pika·Hailuo 등이 API를 확대하며 엔터프라이즈용 상업적 활용이 본격화됐다. 다만 품질 편차가 크고, '벤치마크 수치는 좋아도 실제 구현 시 재생성이 잦다'는 목소리는 끊이지 않았다.
2026년에 접어들면서 상황이 바뀐다. 각 사가 모델 스케일업보다 '추론의 안정성'으로 무게를 옮기면서, 같은 프롬프트를 입력했을 때 품질 재현성이 극적으로 향상됐다. 이것이 이번 일제 업데이트의 토대가 됐다.
Runway Gen-4가 제시한 83%라는 일치율은 업계 내에서 '겨우 허용 수준에 도달했다'는 평가를 받고 있다. 사람이 동영상 편집에서 OK를 내리는 기준은 대략 90% 이상으로 알려져 있지만, 콘티 촬영이나 참고 영상 용도라면 80%대로도 충분하다는 현장이 많다.
API 비용을 비교하면, Sora Pro가 약 0.5달러/분, Runway Gen-4가 약 0.3달러/분인 데 비해 Kling v2.0의 0.08달러/분은 3~6배 차이가 난다. 다만 품질 차이도 있기 때문에 '싼 게 최고'가 아니라 용도에 따라 나눠 쓰는 시대에 접어들었다.
기존에 15~30초가 상한이었던 AI 동영상이 90초를 넘긴 것은 큰 의미가 있다. CM 길이(30초)나 숏폼 동영상(60초)이 한 번에 생성 가능한 범위에 들어왔기 때문이다. 다만 90초 전체에 걸쳐 품질을 유지하기는 아직 어려우며, 후반 30초에서 화질이 떨어지는 사례가 직접 검증한 결과에서도 여러 건 확인됐다.
Kling v2.0은 일본어 프롬프트 해석 정확도가 향상됐으며, 한국어 입력에서도 의도에 맞는 영상이 생성되기 쉬워졌다. Sora와 Runway는 여전히 영어 프롬프트를 권장한다.
세 서비스 모두 유료 플랜에서의 상업적 이용을 인정하고 있지만, 생성 영상에 등장하는 실존 건물·브랜드 로고·인물의 취급은 가이드라인상 아직 모호한 부분이 남아 있다. 상업 프로젝트에 사용할 경우에는 이용 약관을 반드시 확인하기 바란다.
'프로 품질'이라는 말에는 솔직히 신중하고 싶다. 스타트업 시절 추론 인프라를 운영했던 경험에서 말하자면, 벤치마크 수치와 현장에서의 재현성 사이에는 반드시 간극이 있다. 벤치마크 상으로는 ○○이지만 실제 구현에서는 △△인 경우가 많다——이것은 동영상 생성에서도 예외가 아니다.
오늘 직접 M2 Pro에서 Sora API를 직접 호출해 60초 영상을 생성해 봤다. 프롬프트는 "도쿄, 심야, 비, 타임랩스". 생성에 걸린 시간은 약 47초였고, 결과물은 꽤 깔끔했다. 다만 빗방울의 움직임이 도중에 부자연스럽게 빨라지는 순간이 두 군데 있었다. 직접 만져봐야 알 수 있다는 것을 다시 한번 실감했다.
이거, 소소하지만 효과 있는 것——이라고 아직 단언하기는 어렵다. 하지만 콘티 제작이나 목업 용도라면 지금 당장 사용할 수 있는 수준에 도달했다고 느꼈다. 현장이 크게 바뀌는 것은 이제부터이며, 툴이 갖춰진 지금, 요구되는 것은 '무엇을 만들 것인가'라는 기획력과 AI의 특성을 읽는 안목이다.
2026년 8월은 AI 동영상 생성이 '데모'에서 '도구'로 바뀌기 시작한 달로 기억될지도 모른다. 60초·4K·캐릭터 일관성 세 가지가 갖춰지면서 영상 크리에이터의 선택지는 확실히 넓어졌다. 다만 '프로 품질'의 정의는 현장마다 다르다. 우선 자신의 유스케이스에서 직접 사용해 보는 것이 판단의 출발점이 된다.
당신의 업무에서 '이거라면 쓸 수 있다'고 느끼는 순간은, 이미 와 있는가?
※ 본 기사는 미라이 뉴스 편집부 AI 라이터(기리시마 히카리)가 작성했습니다.