OpenAI「Realtime API」永久记忆功能正式发布——跨会话上下文保留重塑客服AI设计范式
機械翻訳 / Machine-translated
機械翻訳 / Machine-translated
OpenAI于2026年8月26日,为支持语音与文本双向处理的Realtime API新增了「Persistent Memory(永久记忆)」功能,并面向企业用户正式发布。此前每次会话结束后即被重置的对话上下文,现在可以与客户ID绑定并跨会话持久保存,这将从根本上改变呼叫中心和客户支持业务的设计结构。
根据官方文档,Persistent Memory以客户标识符为键,将最多相当于100,000个token的上下文存储在OpenAI的向量存储中。即使会话结束,次日或次周的对话也能自动引用这些上下文,无需额外开发,即可实现「关于您上周咨询的那件事……」这样的连续对话体验。
「Realtime API 终于支持 memory 了。这意味着不需要自己承担 RAG 前处理成本的架构方案成为了现实。设计变得太简洁了,反而有点不知所措。」
(SaaS工程师,来自拥有约1.2万粉丝的X平台帖子)
定价方案为每GB存储空间每月$12,以附加服务的形式叠加在现有Realtime API订阅(基础费用$50/月起)之上提供。
Realtime API于2024年10月基于GPT-4o首次发布,进入2025年后,流式传输精度和延迟均得到大幅改善。然而,企业用户持续反映「无法实现跨会话的客户识别」,借助LangChain或LlamaIndex自建专属记忆层已成为通行做法。此次发布的功能,使得上述整套外挂技术栈有了可被替代的选项。
在日本市场,随着2026年4月施行的修订版《个人信息保护法》带来的数据跨境监管要求,将客户信息发送至OpenAI服务器在某些情况下需要额外进行法律合规审查,这一问题已成为新的讨论焦点。
此前,主流做法是在「IVR→升级→转接人工」的流程中,将对话历史人工录入CRM。借助Persistent Memory,AI可以用极少的代码量立即调取客户上次投诉的内容或购买背景,从而构建出相应的系统。这是首个可以在无需额外实施成本的情况下,正面应对「每次都要从头解释」这一客户体验根本痛点的官方解决方案。
基于自建向量数据库(Pinecone、Weaviate等)的外挂RAG架构,在延迟管理、版本管理和成本优化三个维度上都存在较高的复杂性。$12/GB的附加服务能否与整套技术栈形成竞争,将成为未来3至6个月架构决策的关键分水岭。尤其是初创企业和中型SaaS厂商,预计将面临对现有架构进行重新审视的压力。
Google Gemini Live API和Anthropic Claude Voice API也已进入语音对话市场,但截至2026年8月,以正式API形式提供跨会话永久记忆的,目前仅有OpenAI。这一先发优势预计将持续约半年。
在面向金融、医疗、政务领域的系统中,将客户信息托管于OpenAI基础设施在法规层面存在较高门槛。Persistent Memory功能是否支持日本境内存储,目前尚未得到确认,这将直接影响企业级用户的采用决策。
API变更幅度极小,仅需在现有会话启动时添加memory_id参数即可启用。迁移成本较低,但记忆的TTL设置以及对个人信息删除请求(遗忘设计)的处理,仍需开发方单独实现。
呼叫中心行业长期以来依赖「AI一次性使用」的设计理念运营——每通电话从零开始,客户每次都要重复提供相同信息,这一模式早已根深蒂固。要打破这一局面,此前需要CRM集成、向量数据库、RAG管道等三层以上的实施工作。此次发布降低了这道门槛——但只是「降低」,而非「消除」。
对于呼叫中心SaaS领域的初创企业而言,这也是一个不得不重新审视商业模式的时刻。那些将「协助构建专属记忆层」作为附加价值的企业,将需要重新定义自身的差异化竞争力。
下一个焦点在于Gemini和Claude何时跟进相同功能。鉴于Google I/O 2026上并未宣布相关内容,年内追平的可能性预计较低。在OpenAI领先的3至6个月窗口期内,哪些行业、哪种规模的实证案例将率先涌现,将决定整个行业的竞争走向。
OpenAI Realtime API的永久记忆功能,成为首个消除客服AI「每次从头开始」限制的官方解决方案。$12/GB的定价直观易算,中小规模企业也能较为清晰地做出导入决策。与此同时,数据跨境、遗忘设计、法规合规等新挑战也随之而来。
「由谁来管理那段记忆,又该如何删除它」——AI落地的下一个追问,已然指向这里。
※本文由未来新闻编辑部AI撰稿人(AI新闻)撰写。