OpenClaw 24h 更新快报(2026-09-19):大型集群启动、凭证恢复与 Cron 调度

内容管家 AI领域评论0字数 1348阅读4分29秒阅读模式
OpenClaw 24h 更新快报(2026-09-19):大型集群启动、凭证恢复与 Cron 调度

OpenClaw 24h 更新快报(2026-09-18):大型集群启动、凭证恢复与 Cron 调度

过去 24 小时,OpenClaw 合并了大量高优先级修复,主要集中在三个领域:大型集群 Gateway 启动稳定性、敏感凭证的容错恢复,以及 Cron 定时任务的调度逻辑。具体包括:大型集群启动时重复 preparation 导致的超时与 stall(Cron、P0 安全凭证修复、插件热替换边界);extended-stable 安装路径缺失 AI 运行时的问题;以及暂停状态下的"一次性"定时任务在手动触发后被误删的逻辑缺陷。

Gateway 与集群稳定性

PR #151805 解决了大型集群(数百个 agent)启动时反复失败或 HTTP bind 超时的问题。以 632 个 agent/workspace 的隔离集群为例,启动维护阶段从 278 秒降至 144 秒(冷启动),Ready 时间从无法绑定降至 379 秒;热启动 preparation 从 35 秒降至 19 秒。根本原因是每个 preflight 调用都会重新扫描整个集群、重复检查 schema header 和插件状态。新方案将 preparation 结果复用一次,后续消费者直接引用已缓存的事实,不再重复触发。

PR #151273 修复了插件热替换(reload)过程中的 stall 场景:当替换触发时,OpenClaw 会在停止旧插件前等待其 admitted work 最多 60 秒,但此前遇到超时就直接放弃,导致新旧两代插件同时处于半可用状态(400+ PluginInstanceUnavailableError,model-runtime 失效)。修复后在 stop 前增加了 call-only drain 等待,超时后回滚并报告明确的 PluginAdmittedWorkTimeoutError,让运维人员可以等 work 结束后重试。线上事故中该问题影响了 team.openclaw.ai,约 26 个 in-flight 读者受影响。

PR #151468(P0)修复了一个影响 Gateway 重启的凭证锁定问题:当 session.store 相关的写操作触发配置去重(redacted save)时,如果目标路径已被其他写入覆盖,会导致存储的 owner 引用丢失,进而使 Gateway 无法正常重启。修复后写操作使用共享比对逻辑,对未变化的默认/模板存储保留原有 owner,不触发无意义的清除通知,受影响用户运行 openclaw doctor --fix 即可恢复。

安全与凭证恢复

PR #151250(P0,security)修复了 Gateway token 被"已编辑显示值"污染后无法启动的严重问题。OpenClaw 在凭证被篡改时使用占位符替代原值,但这会导致 token 无法通过验证且没有明确报错,新版现在在这种情况下保留可用凭证、提供明确诊断,并允许 Doctor 工具进行恢复。同时修复了 trusted-proxy 场景下内联或环境密码被编辑后的降级逻辑:拒绝无效的本地密码 fallback 并给出诊断提示,而非静默失败。

PR #151696(P0,security)修复了 extended-stable 分支 [email protected] 安装后缺少 @openclaw/ai 运行时的问题——根本原因是 shrinkwrap 生成器错误地过滤掉了 workspace 依赖,导致 npm 安装成功但实际产物不完整。修复后生成器正确解析 workspace 依赖到发布版本,并在发布前通过容器级别的只读安装验证确保依赖树完整。已经发布的 7.33 产物不受影响,未来产物已包含此修复。

Cron 调度

PR #152126(P1,Diamond Lobster)修复了一个 Cron 定时任务的边缘情况:当一个"暂停中的未来一次性任务"被手动触发(Run now)且启用了"运行后删除"选项时,任务在手动执行成功后被错误删除,尽管其预设的未来执行时间尚未到达。修复使用了已有的 forcePreservedNextRunAtMs 标记来保留作者设定的一次性时间,并在手动预约时记录该标记的来源,使重新启用后能正确恢复原有时间。现有已保存的任务无需配置变更即可自动受益。

Agent 与任务系统

PR #151879(P1)修复了 provider 重试时子任务无法正确唤醒父任务的问题。当 provider retry 将已接受的子任务拆分到不同 attempt 时,旧方案可能出现 receipt 不完整导致子结果无法回到父任务。新方案在 spawn producer 处记录精确操作 run 实例,并在分类前将 retained receipts 送入 fallback 决策,修复后父任务在 provider 重试或 CLI fallback 场景下均能正确恢复。

PR #151949(P1)修复了 subagent 启动被 late completion delivery 阻塞的问题:某些情况下 subagent 已完成但完成通知晚到,导致父任务一直等待无法退出。

PR #152165 修复了定时报告在成功投递后仍被标记为失败的问题——减少了误报。

构建与发布工具链

PR #151366(P1)大幅降低了 Doctor 工具在大规模集群上的准备时间。以 480 个 agent 的升级场景为例,Doctor 执行时间从 290 秒降至 208 秒(但尚未完全成功,仍有后续跟进工作)。主要改进:schema header 只需检查一次;迁移和 transcript 阶段共享已发现的 inventory,避免重复扫描。

本次更新整体偏向底层基础设施稳定性与安全修复,建议所有运行大型集群或使用 extended-stable 版本的用户优先升级。

常用链接

 
内容管家

发表评论