
OpenAI 推出 GPT-Live 系列语音模型:能听能说、还能实时翻译
OpenAI 正式发布了新一代对话式语音模型 GPT-Live-1 和 GPT-Live-1 mini,主打更自然的发音和更流畅的对话节奏管理。两款模型均为全双工(full-duplex)架构,支持同时听与说,用户可随时打断,实时翻译功能也由此成为可能。
默认替换 Advanced Voice Mode,免费用户也能用
OpenAI 宣布,ChatGPT 现有的 Advanced Voice Mode 将默认替换为 GPT-Live-1 mini。付费用户可使用参数规模更大的 GPT-Live-1 模型。
此前 ChatGPT 的语音模式采用串联架构:语音转文字 → 大语言模型生成回复 → 文字转语音,三环节依次进行。新架构将这一流程彻底重构,从底层解决了"用户说话时被打断"和"模型回复不够智能"两大痛点。
接入 GPT-5.5,支持视觉输出和超长对话
GPT-Live-1 系列在处理用户 query 时,会将请求发送至 GPT-5.5 等最新文本模型,获得搜索、推理和 Agent 能力,同时保持语音对话不中断。模型还具备长时间静默聆听能力,直至被唤醒时才回应。
此外,由于接入的是最新版 GPT,GPT-Live-1 还能以视觉形式呈现信息——例如在对话中展示图表、列表等内容。此前获得 DST 和 Lux Capital 4000 万美元种子轮融资的初创公司 Monogram,也在探索类似的视觉化交互方向。
ChatGPT Voice 产品负责人 Atty Eleti 在演示中透露,他本人曾用该功能完成过单次 30~40 分钟的散步对话。
向语音优先交互演进,隐私与安全并行
OpenAI 明确表示,语音有望成为复杂 Agent 工作的主要交互界面。公司表示目前已有超过 1.5 亿用户使用 ChatGPT 的语音和听写功能。
尽管目标指向更长的自由对话,OpenAI 仍强调这不是在打造「AI 伴侣」。新一代模型内置安全机制:对青少年提供适龄回应,若对话涉及自残等话题则主动推送帮助资源。
目前该功能仍有优化空间。演示环节展示了英语到印地语的实时翻译,但助手带有明显的美式口音,印地语表达生硬、用词偏书面化。OpenAI 坦言新模式针对"大多数常用语言"进行了优化,但具体支持语言列表尚未公布。
竞争对手方面,苹果和亚马逊也在推进各自助手的对话能力和上下文理解;由 Oculus 联合创始人 Brendan Iribe 创立的 Sesame 公司同样推出了具备自然对话能力的 AI 助手。


评论