ChatGPT, 음성 파일 지원 | 텍스트 변환 및 요약 기능 추가
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
회의 녹음을 다시 들으며 회의록으로 정리하는 작업에 몇 시간씩 소요한 경험이 있지 않으신가요? ChatGPT에 음성 파일을 전달하는 것만으로 텍스트 변환과 요약이 가능해졌습니다. 이 글에서는 새로운 기능의 내용과 활용처, 주의 사항을 순서대로 살펴봅니다.
미국 OpenAI는 2026년 10월 6일 릴리스 노트에서 음성 파일 업로드 기능을 발표했습니다. ITmedia AI+도 10월 9일에 이를 보도했습니다.
할 수 있는 것은 크게 세 가지입니다. 녹음을 텍스트로 변환하는 것(말한 내용을 문장으로 만드는 것), 내용을 요약하는 것, 내용에 대해 질문하는 것입니다.
기존에 ChatGPT는 음성을 직접 읽어 들이는 기능이 제한적이었습니다. 외부 텍스트 변환 도구로 텍스트로 만든 다음 붙여넣는 번거로운 과정이 필요했습니다. 이번 지원으로 그 한 단계가 불필요해집니다.
참고로, 기존에 있던 'Record(녹음)' 기능과는 별개입니다. Record는 Mac 앱에서 현장 음성을 녹음하는 기능이고, 이번 새 기능은 이미 존재하는 파일을 전달하는 기능입니다.
유료 플랜이 대상입니다. 해설 기사에 따르면, 공식 도움말에는 "유료 ChatGPT 구독과 워크스페이스에서 사용 가능"이라고 적혀 있습니다. 무료 플랜은 현재 대상 외입니다.
또한, 지역이나 앱 버전, 선택한 모델에 따라 사용 가능 여부가 달라질 수 있다고도 설명되어 있습니다.
지원 형식은 WAV, MP3, OGG, PCM, FLAC, AAC, M4A입니다. 음성만 담긴 WebM과 MP4도 사용할 수 있습니다.
파일 1개당 512MB가 상한입니다. 재생 시간 상한은 명시되어 있지 않습니다. 다만, 긴 녹음은 분할 처리되거나 타임아웃(처리가 시간 초과로 중단되는 것)이 발생하는 경우가 있습니다.
동영상으로 판정되는 WebM이나 MP4는 받지 않습니다. 동영상 파일에서 텍스트 변환을 하고 싶을 때는 먼저 음성만 추출해야 합니다.
일부 보도에서는 사용 가능한 형식이나 삭제 처리에 대해 여기서 소개한 내용과 다른 설명이 나오기도 합니다. 세부 사양은 OpenAI 도움말에서 최신 정보를 확인해 주세요.
방법은 간단합니다. 새 채팅을 열고 음성 파일을 첨부합니다. 다음으로, 원하는 결과물을 구체적으로 적어 전송합니다.
"요약해줘"만으로는 대략적인 답변이 나오기 쉽습니다. 예를 들어 다음과 같이 요청하면 활용 가능한 결과물이 반환됩니다.
해설 기사에서는 "이름이나 숫자를 추측으로 채우지 말아줘"라고 한마디 덧붙이는 것도 권장하고 있습니다. 잘 들리지 않은 부분을 추측으로 채우지 않도록 하기 위한 한마디입니다.
같은 채팅 안에서 이어서 질문하는 것도 가능합니다. "방금 결정 사항에서 확인 이메일 초안을 만들어줘"라고 요청하면 그대로 문장이 됩니다.
중소기업의 영업 담당자를 예로 들어봅시다. 일주일에 3건의 상담이 있고, 그때마다 스마트폰으로 녹음하고 있습니다. 저녁에 녹음을 다시 들으며 메모를 작성하는 데만 매일 1시간씩 소요되었습니다.
이 기능을 활용하면 녹음을 업로드하고 "고객의 요구 사항과 다음 액션을 목록으로 만들어줘"라고 요청하기만 하면 됩니다. 확인은 필요하지만, 다시 듣는 수고는 상당히 줄일 수 있습니다.
대학생의 경우는 어떨까요. 90분 강의를 녹음해두고 시험 전에 요점만 복습하고 싶은 경우가 있습니다. 녹음을 전달하고 "중요해 보이는 용어를 설명과 함께 10개 나열해줘"라고 요청하면 복습용 노트를 만들 수 있습니다.
프리랜서 작가나 유튜버라면 인터뷰 음원 정리에 활용할 수 있습니다. 누가 무엇을 말했는지 대략적으로 파악하면 기사에 사용할 발언을 찾는 시간도 줄어들 것입니다. 단, 인용할 발언은 반드시 원본 음성으로 확인해 주세요.
음성 파일을 다룰 수 있는 AI는 ChatGPT만이 아닙니다. Google의 Gemini는 2025년 9월 보도에 따르면 MP3·M4A·WAV 음성 파일을 받아들인다고 합니다. 동시에 최대 10개 파일까지, 총 10분이 상한으로 되어 있었습니다. 텍스트 변환, 요약, 행동 항목 추출 외에 화자 구분도 가능하다고 합니다.
이 상한은 당시 기준으로, 이후 변경되었을 가능성이 있습니다. 사용 전에 Gemini 공식 도움말에서 확인해 주세요.
ChatGPT의 강점은 파일 1개당 512MB까지 받는다는 점입니다. 긴 회의 녹음을 한 번에 전달할 수 있는 가능성이 있습니다.
한편, Notta나 Otter 같은 전용 텍스트 변환 앱은 회의 녹음에 특화된 앱입니다. 화자 구분이나 타임스탬프가 포함된 텍스트 변환 등 회의용 기능이 갖춰져 있는 것이 일반적입니다. 축어록(한 마디 한 마디의 기록)이 필요한 경우에는 전용 앱이 더 안심할 수 있습니다.
예를 들어, 내용을 대략 파악해 다음 작업으로 이어가고 싶다면 ChatGPT, 정확한 기록을 남기고 싶다면 전용 앱이라는 식의 구분 사용이 현실적입니다.
한국 독자들에게 신경 쓰이는 것은 한국어 정확도일 것입니다. ITmedia AI+ 기사에는 한국에서의 제공 현황이나 한국어 정확도에 대한 구체적인 기재가 없습니다.
OpenAI는 음성 이해 및 텍스트 변환의 정확도는 언어에 따라 달라질 수 있다고 설명하고 있습니다. 화자 식별도 오류가 발생할 수 있다고 합니다.
다른 보도에서는 영어에서 가장 사용하기 편하다고 하고 있습니다. 소음이나 억양, 겹치는 말소리가 있으면 정확도가 떨어진다는 지적도 있습니다. 한국어 회의에서는 빠른 말투나 전문 용어, 여러 명의 동시 발언이 발생하기 쉬우므로 반드시 직접 귀로 확인하세요.
프라이버시에도 주의를 기울여야 합니다. 해설 기사에 따르면, 업로드한 음성이 처리 후 삭제된다는 기재는 보이지 않는다고 합니다. 보존 기간은 파일의 저장 위치와 워크스페이스의 보존 규칙에 따라 결정됩니다.
학습 활용 여부는 개인용 플랜의 경우 데이터 설정에 따라 달라집니다. 비즈니스용 플랜은 고객 데이터를 학습에 사용하지 않는 처리 방식입니다.
고객과의 상담이나 사내 기밀 회의를 녹음하여 전달할 때는 회사 규정을 먼저 확인해 주세요. 참가자에게 녹음과 AI 활용을 알리고 동의를 받아두는 것도 중요합니다.
현재로서는 사용할 수 없습니다. 유료 플랜과 해당 워크스페이스가 대상입니다.
재생 시간 상한은 명시되어 있지 않습니다. 파일 크기는 1개당 512MB까지입니다. 매우 긴 녹음은 분할 처리되거나 타임아웃이 발생하는 경우가 있습니다.
동영상으로 판정되는 파일은 받지 않습니다. 음성만 추출하여 MP3 등으로 변환한 후 전달해 주세요.
권장하지 않습니다. 오류나 화자 혼동이 포함될 수 있습니다. 숫자, 날짜, 고유명사는 원본 녹음으로 확인해 주세요.
참가자에게 녹음과 AI를 이용한 메모 작성을 알리고 사전에 동의를 받는 것이 권장됩니다. 국가나 회사에 따라 규정도 다르므로 확인해 두세요.
우선 손에 있는 짧은 녹음 1개를 업로드해서 요약 결과를 시험해 보세요.
이 글은 AI Friends의 크로스포스트입니다.