
OpenAI 于本周四宣布面向 API 用户开放一系列全新语音智能功能,旨在帮助开发者打造能够「听懂、会说、能译」的对话应用。
GPT‑Realtime‑2:基于 GPT‑5 级推理的语音模型
新发布的 GPT‑Realtime‑2 是继 GPT‑Realtime‑1.5 之后的又一款语音模型,最大亮点是接入了 GPT‑5 级推理能力。OpenAI 表示,这使其能够处理更复杂的用户请求,在对话流畅度和语义理解上显著优于前代产品。
GPT‑Realtime‑Translate:70 种语言的实时翻译
同期上线的还有实时翻译模型 GPT‑Realtime‑Translate,能够「跟上」用户的说话节奏进行即时翻译。该模型支持 70 种输入语言(即识别语种)和 13 种输出语言(即翻译后输出的语种),覆盖主流国际语言场景。
GPT‑Realtime‑Whisper:交互过程中的实时转写
第三款产品 GPT‑Realtime‑Whisper 基于 OpenAI 自研的 Whisper 技术实现,提供实时语音转文字能力,用户在对话过程中即可同步获得转录文本。
应用场景与安全考量
OpenAI 指出,这三款模型共同将实时音频从简单的「问答」推向「真正能干活」的语音交互界面——能够倾听、推理、翻译、转写,并在对话进行中执行操作。
目标用户群体包括但不限于:
- 客服场景:企业可借此扩展自动化客服能力
- 教育平台:实时翻译和转写可提升多语言课堂体验
- 媒体与活动:会议内容实时转录与多语言同传
- 创作者工具:播客、视频字幕自动化生成
不过,随着能力增强,滥用风险也随之上升。OpenAI 明确表示已内置多项安全防护机制,当系统检测到对话违反其有害内容准则时,将自动终止对话,以防止垃圾信息、欺诈等滥用行为。
计费方式
三款模型均已纳入 OpenAI Realtime API:
- GPT‑Realtime‑Translate 与 GPT‑Realtime‑Whisper:按分钟计费
- GPT‑Realtime‑2:按 token 消耗计费


评论