
OpenAI 于周四(7月24日)宣布,已为 ChatGPT 桌面应用推送更新,新增 ChatGPT Voice 语音交互能力。用户可通过语音直接控制 AI 助手完成电脑上的各类操作任务。
新模型与功能亮点
此次桌面端语音功能基于 OpenAI 本月早些时候推出的 ChatGPT Advanced Voice 系列语音模型。与此前智能手机端的语音模式相比,桌面版本实现了更流畅的对话体验,并支持更完善的中断处理能力。
核心功能包括:
- 支持 ChatGPT Work 和 Codex 两大产品线
- 可调用 computer use 技能,查找网站和应用信息
- macOS 用户可通过 Appshots 功能读取屏幕内容,包括图片 alt 文本
从语音到操作:桌面端的跨越
智能手机端的语音模式虽然交互更自然,但不具备操作执行能力。桌面端则不同——用户现在可以直接口述复杂的多步骤指令,例如「创建新线程、发起 Pull Request、定位 Bug 根因」,由 ChatGPT 自动拆解并执行。
演示视频中,开发者通过一句话完成了上述全部操作。
此外,用户也可通过 iOS 版 ChatGPT 应用远程访问 Codex 中的语音功能。
竞争对手动态
Anthropic 同期更新了 Claude 的语音模式,新版支持 Opus、Sonnet、Haiku 三种模型,可直接在 Gmail、日历、Slack、Notion、Canva 等应用中执行任务。


评论