Reka(레카)란? 멀티모달 AI로 이미지·동영상·음성을 이해하는 사용법과 할 수 있는 것들【2026년 최신】
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
이 글에서 알 수 있는 것
Reka(레카)는 텍스트·이미지·동영상·음성을 동시에 이해할 수 있는 '멀티모달 AI'를 개발하는 스타트업 기업입니다. 멀티모달이란 '여러 종류의 데이터를 한 번에 다룰 수 있다'는 의미로, Reka의 AI는 문장뿐만 아니라 사진이나 동영상의 내용을 읽어 질문에 답할 수 있습니다. 2026년 6월에는 동영상 생성 AI인 Moonvalley와 합병하여, 더욱 고도화된 물리 세계 이해 AI(Physical AI) 개발을 진행하고 있습니다. 전 DeepMind 및 Google 연구자들이 설립한 기업으로, 최첨단 기술력이 주목받고 있습니다.
Reka에는 용도에 맞는 4가지 모델이 있습니다. 경량 모델인 Spark(10억 파라미터)부터 최고 성능의 Core(670억 파라미터)까지 선택할 수 있습니다. Edge 모델은 로봇이나 카메라에 내장해 사용할 수 있을 만큼 가볍고, Flash 모델은 GPT-3.5나 Gemini Pro와 비슷한 성능을 갖추면서도 빠르게 동작합니다. Core 모델은 GPT-4V나 Claude-3 Opus와 경쟁할 수 있는 최상위 모델로, 동영상 내용을 깊이 이해하는 능력이 뛰어납니다. 이미지나 동영상에서 정보를 추출하거나, 음성과 텍스트를 결합한 질문에 답하는 등 복잡한 작업을 처리할 수 있습니다.
Reka는 API(프로그램에서 이용하는 방식)를 통해 사용합니다. 공식 사이트에서 계정을 만들고 API 키(접속용 비밀번호 같은 것)를 발급받으면 바로 이용을 시작할 수 있습니다. 요금은 사용한 만큼 지불하는 종량제로, 초기 비용은 들지 않습니다. 입력 데이터의 양(토큰 수)에 따라 과금되며, Core 모델은 100만 토큰당 약 3달러, 경량 모델은 더 저렴하게 이용할 수 있습니다. 동영상 분석이 가능한 Vision API에는 3시간(180분)의 무료 트라이얼이 있어, 먼저 체험해보고 본격적인 도입을 검토할 수 있습니다. 클라우드·온프레미스·VPC 등 도입 환경도 유연하게 선택할 수 있습니다.
장점은 텍스트·이미지·동영상·음성을 처음부터 함께 학습하기 때문에, 데이터 간의 연관성을 정확하게 이해할 수 있다는 점입니다. 모델 크기가 4종류이므로 스마트폰이나 로봇에 내장하는 가벼운 용도부터 기업의 복잡한 분석까지 폭넓게 대응할 수 있습니다. 2026년 3월에 발표된 새로운 Edge 모델은 물리적인 기기에 내장해 실시간으로 구동할 수 있다는 점도 강점입니다. 단점은 한국어(및 일본어) 정보가 아직 적고, 주로 영어로 이용하는 것이 중심이 된다는 점입니다. 또한 GPT-4나 Claude와 같은 일반 사용자용 채팅 서비스는 제공되지 않아, API를 사용하기 위한 기술적인 지식이 필요합니다.
Reka는 이미지나 동영상의 내용을 자동으로 분석하고 싶은 기업이나 개발자에게 특히 추천합니다. 예를 들어, 보안 카메라 영상을 AI로 모니터링하거나, 로봇이 주변 상황을 판단해 움직이는 용도에 적합합니다. 실제로 2026년 Smart City Asia 이벤트에서는 Reka의 물리 보안 시스템이 소개되었습니다. 또한 여러 종류의 데이터를 동시에 다루는 앱을 만들고 싶은 엔지니어나, 기존 AI로는 대응하기 어려운 고도의 멀티모달 태스크에 도전하는 연구자에게도 적합합니다. 종량제로 소규모로 시작할 수 있어, 스타트업 기업이 새로운 서비스를 시험해볼 때도 사용하기 쉬울 것입니다.
이 글은 AI Friends 에서의 크로스포스트입니다.