
Anthropic 发布了 Opus 4.8,这是其最先进模型的最新版本。距离上一个版本 Opus 4.7 仅 41 天,迭代速度远超常规周期——Sonnet 和 Haiku 模型分别已有三个月和七个月未更新。这种急促的发布节奏,或许与 Opus 4.7 收到的冷淡反馈有关,部分用户认为该版本表现令人失望。
快速迭代背后的竞争压力
在此期间,OpenAI 推出了 OpenAI Codex,Google 也更新了 Gemini Flash 模型,大模型竞争进一步加剧,Anthropic 面临保持产品竞争力的压力。
核心变化:主动标记不确定性问题
Opus 4.8 在基准测试中拿出了预期的领先成绩,但更值得关注的是其在处理糟糕或不确凿数据时的表现。Anthropic 在发布博客中指出,早期测试者发现新版模型“更倾向于主动标记工作中的不确定性,而非做出缺乏依据的断言”。
Bridgewater Associates 的评价印证了这一点:最大区别在于 Opus 4.8 会主动标记分析输入与输出中的问题——这是其他模型经常遗漏、留待用户自己发现的。
配套功能:动态工作流与大规模代码迁移
除模型更新外,Anthropic 还推出了名为 Dynamic Workflows 的新功能,目前处于研究预览阶段。该系统旨在帮助 Opus 等大型模型管理复杂任务,跨越数百个并行子 Agent。
官方描述称:“Claude Code 配合 Opus 4.8,现在可以执行从启动到合并的完整代码库迁移,覆盖数万行代码,以现有测试套件为验收标准。”
Mythos 模型即将解除封印
Anthropic 仍在保留最高端的 Mythos 模型——上个月的一次试探性预览引发了网络安全担忧。不过官方暗示,当安全防护措施完成后,Mythos 预览期可能即将结束:“我们正在快速推进安全防护开发,预计在未来数周内将 Mythos 级别模型带给所有客户。”


评论