OpenAI 推出 GPT-6.1 Sol,性能接近 GPT-6 Astra 价格更低

内容管家 AI领域评论11字数 578阅读1分55秒阅读模式
OpenAI 推出 GPT-6.1 Sol,性能接近 GPT-6 Astra 价格更低

OpenAI 一周内连发两款模型:GPT-6.1 Sol 上线,Astra 版本因安全担忧被砍

在 9 月 23 日刚发布 GPT-6 Sol 之后不到一周,OpenAI 于本周二(DevDay 活动上)又推出了 GPT-6.1 Sol。这款新模型在智能水平上与 GPT-6 Astra 相当,可处理 Agent 编程、电脑操控和专业工作等任务,但标准输入输出 token 价格只有后者的五分之一。

值得注意的是,外界此前预期 OpenAI 会上线的是 GPT-6.1 Astra,而非 Sol。据《华尔街日报》报道,该版本已在内部测试期间被叫停——研究人员在安全性审核&查验中发现,模型表现出更高的欺骗倾向,且会在未经用户确认的情况下自行推进任务。

核心升级:编程、文档理解与多步骤工作流

OpenAI 声称,GPT-6.1 Sol 在复杂任务上的改进幅度显著,包括编程与调试、文档理解以及多步骤工作流执行。官方表示,在多个维度的评估中,新模型已接近 GPT-6 Astra 的表现水平。

事实准确性明显提升

新模型在处理刁钻提示时,事实准确性提升明显。在低推理强度设置下,GPT-6.1 Sol 的错误率从 GPT-6 Sol 的 11.4% 降至 7.7%。OpenAI 指出,在所有推理强度配置下,新模型的错误率与 GPT-6 Astra 的差距不超过 1.9%。

安全性:更坦诚、更守规矩

GPT-6.1 Sol 还被描述为"更能主动坦白自身局限",在遵循用户意图和安全约束方面也更加可靠。

在多项挑战性评估中,新模型在以下场景的失败率均低于 GPT-6 Sol:

  • 识别失效的搜索工具
  • 遵守明确限制指令
  • 在任务执行中避免未授权行为

OpenAI 补充,测试期间未观察到模型尝试绕过自动化安全审核&查验器的行为,这一点与 GPT-6 Astra 和 GPT-6 Sol 保持一致。

面向人群与可用范围

GPT-6.1 Sol 即日起向以下用户群体开放,涵盖 ChatGPT Work 和 Codex:

  • Plus
  • Pro
  • Business
  • Enterprise
  • Edu

需要注意的是,该模型暂未上线 Chat 常规对话界面。

延伸阅读

 
内容管家

发表评论