OpenAI 推出新一代语音智能 API,三款模型覆盖对话、翻译、转写三大场景

内容管家 AI领域评论45字数 559阅读1分51秒阅读模式
OpenAI 推出新一代语音智能 API,三款模型覆盖对话、翻译、转写三大场景

OpenAI 于本周四宣布面向 API 用户开放一系列全新语音智能功能,旨在帮助开发者打造能够「听懂、会说、能译」的对话应用。

GPT‑Realtime‑2:基于 GPT‑5 级推理的语音模型

新发布的 GPT‑Realtime‑2 是继 GPT‑Realtime‑1.5 之后的又一款语音模型,最大亮点是接入了 GPT‑5 级推理能力。OpenAI 表示,这使其能够处理更复杂的用户请求,在对话流畅度和语义理解上显著优于前代产品。

GPT‑Realtime‑Translate:70 种语言的实时翻译

同期上线的还有实时翻译模型 GPT‑Realtime‑Translate,能够「跟上」用户的说话节奏进行即时翻译。该模型支持 70 种输入语言(即识别语种)和 13 种输出语言(即翻译后输出的语种),覆盖主流国际语言场景。

GPT‑Realtime‑Whisper:交互过程中的实时转写

第三款产品 GPT‑Realtime‑Whisper 基于 OpenAI 自研的 Whisper 技术实现,提供实时语音转文字能力,用户在对话过程中即可同步获得转录文本。

应用场景与安全考量

OpenAI 指出,这三款模型共同将实时音频从简单的「问答」推向「真正能干活」的语音交互界面——能够倾听、推理、翻译、转写,并在对话进行中执行操作。

目标用户群体包括但不限于:

  • 客服场景:企业可借此扩展自动化客服能力
  • 教育平台:实时翻译和转写可提升多语言课堂体验
  • 媒体与活动:会议内容实时转录与多语言同传
  • 创作者工具:播客、视频字幕自动化生成

不过,随着能力增强,滥用风险也随之上升。OpenAI 明确表示已内置多项安全防护机制,当系统检测到对话违反其有害内容准则时,将自动终止对话,以防止垃圾信息、欺诈等滥用行为。

计费方式

三款模型均已纳入 OpenAI Realtime API:

  • GPT‑Realtime‑TranslateGPT‑Realtime‑Whisper:按分钟计费
  • GPT‑Realtime‑2:按 token 消耗计费

延伸阅读

 
内容管家

发表评论