OpenAI "Realtime API" 영구 메모리 기능 공식 출시——대화를 넘나드는 문맥 유지로 고객 응대 AI 설계가 바뀐다
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
OpenAI는 2026년 8월 26일, 음성·텍스트 양방향 처리를 지원하는 Realtime API에 "Persistent Memory(영구 메모리)" 기능을 추가하여 법인 대상으로 공식 출시했다. 지금까지 세션 단위로 초기화되던 대화 컨텍스트가 고객 ID와 연동되어 세션을 넘어 유지될 수 있게 되었으며, 콜센터와 고객 지원 업무 설계의 구조가 변화를 맞이하게 됐다.
공식 문서에 따르면, Persistent Memory는 고객 식별자를 키로 하여 최대 100,000토큰 분량의 컨텍스트를 OpenAI 측의 벡터 스토어에 저장한다. 세션이 종료되어도 다음 날·다음 주의 대화에서 자동으로 참조되어, "지난주에 문의하셨던 건인데요"와 같은 연속적인 대화가 추가 구현 없이도 실현된다.
"Realtime API에 메모리가 생겼다. 이제 RAG 전처리 비용을 자체적으로 부담하지 않아도 되는 구성이 현실화됐다. 설계가 너무 단순해져서 오히려 당황스러울 정도다"
(SaaS 엔지니어, 팔로워 약 1만 2천 명의 X 게시물에서)
요금 체계는 저장 용량 1GB당 월 $12. 기존 Realtime API 구독(기본 요금 $50/월~)에 대한 애드온 형태로 제공된다.
Realtime API는 2024년 10월 GPT-4o 기반으로 처음 공개되었으며, 2025년에 들어 스트리밍 정확도와 지연 시간이 대폭 개선되었다. 한편 기업 사용자들로부터는 "세션을 넘나드는 고객 인식이 불가능하다"는 지적이 반복되었으며, LangChain이나 LlamaIndex를 조합한 독자적인 메모리 레이어 구축이 일반적인 방법으로 자리 잡아 왔다. 그 외부 스택 전체가 이번 발표로 대체 후보가 되었다.
일본 시장에서는 2026년 4월 시행된 개정 개인정보보호법에 따른 데이터 국경 간 이전 규제가 쟁점이 되고 있으며, 고객 정보를 OpenAI 서버로 전송하는 것에 대한 법무 확인이 새롭게 필요해지는 경우도 생겨나고 있다.
기존에는 "IVR→에스컬레이션→상담원 인계" 과정에서 대화 이력을 CRM에 수동으로 옮기는 흐름이 주류였다. Persistent Memory를 통해, AI가 이전 클레임 내용이나 구매 경위를 즉시 참조할 수 있는 구성이 최소한의 코드로 실현된다. "매번 처음부터 다시 설명해야 한다"는 고객 경험의 근본적인 문제에 대해, 구현 비용 없이 대응할 수 있는 최초의 공식 수단이 된다.
자체 벡터 DB(Pinecone, Weaviate 등)를 활용한 외부 RAG 설계는, 레이턴시 관리·버전 관리·비용 최적화의 세 가지 측면에서 복잡성을 안고 있었다. $12/GB의 애드온이 그 스택 전체와 경쟁할 수 있는지가, 향후 3~6개월간 설계 판단의 분기점이 될 것이다. 특히 스타트업과 중규모 SaaS 기업은 기존 구성의 재검토를 강요받을 것으로 보인다.
Google Gemini Live API와 Anthropic Claude Voice API도 음성 대화 시장에 진입했지만, 2026년 8월 시점에서 세션을 넘나드는 영구 메모리를 공식 API로 제공하고 있는 것은 OpenAI뿐이다. 이 선행 우위는 약 6개월 정도 지속될 것으로 예상된다.
금융·의료·행정 대상 시스템에서는 고객 정보를 OpenAI 인프라에 맡기는 구조에 법규제상의 장벽이 존재한다. Persistent Memory 기능이 일본 국내 스토리지를 지원하는지는 현 시점에서 확인되지 않았으며, 엔터프라이즈 도입 가부를 좌우하는 요인이 된다.
API 변경은 최소한으로, 기존 세션 시작 시 memory_id 파라미터를 추가하는 것만으로 활성화할 수 있다. 마이그레이션 비용은 낮지만, 메모리의 TTL 설정과 개인정보 삭제 요청(망각 설계)에 대한 대응은 개발 측이 별도로 구현해야 한다.
콜센터 업계는 오랫동안 "AI는 일회용" 설계로 운영되어 왔다. 매 통화마다 백지 상태에서 시작하고, 고객이 매번 같은 정보를 반복하는 구조가 정착해 있었다. 그것을 바꾸려면 CRM 연동·벡터 DB·RAG 파이프라인이라는 3개 레이어 이상의 구현이 필요했다. 이번에 그 장벽이 낮아졌다. 다만 "낮아진" 것이지 "사라진" 것은 아니다.
콜센터 SaaS 스타트업에게는 비즈니스 모델을 재검토해야 하는 국면이기도 하다. "독자적인 메모리 레이어 구축 지원"을 부가가치로 삼아 온 기업은 차별화를 재정의해야 할 필요가 생겼다.
다음 초점은 Gemini와 Claude가 동일한 기능을 언제 추가하느냐다. Google I/O 2026에서 발표가 없었던 이상, 연내에 따라잡을 가능성은 낮다고 보인다. OpenAI가 선행하는 3~6개월 사이에 어느 업종에서 어느 규모의 실증 사례가 나오느냐가 업계의 향방을 결정짓게 될 것이다.
OpenAI Realtime API의 영구 메모리 기능은, 고객 응대 AI의 "매번 처음부터 시작하는" 제약을 없애는 최초의 공식 수단이 되었다. $12/GB라는 요금 설정은 비용 산출이 용이하여, 중소 규모 기업도 도입 판단을 세우기 쉽다. 한편으로 데이터 국경 간 이전·망각 설계·법규제 대응이라는 새로운 과제도 동시에 생겨났다.
"누가 그 메모리를 관리하고, 어떻게 삭제할 것인가"——AI 도입의 다음 질문은 바로 그 지점으로 옮겨가고 있다.
※ 이 기사는 미라이 뉴스 편집부의 AI 작가(AI 뉴스)가 작성했습니다.