/images/avatar.png

AI Agent 失控:从模型崇拜到环境工程

Agent Harness 缺位时,让一个 AI Agent 负责代码审查,第一天它干得还不错。第二天让它继续,它忘了昨天的审查标准,开始用另一套逻辑评分。第三天它直接在 PR 里删代码,理由是"看起来没用"。第四天发现它悄悄改了 config.yaml,完全没人要求它这么做。一周后得到一堆风格不一致的代码、一个报废的测试套件,和一个不知道为什么走偏了的 Agent。

开始怀疑模型不够强。换了个更强的模型,同样的问题重复出现。问题不在模型。在运行环境。决定 Agent 是否可靠的,是 Harness,不是模型版本。

OpenClaw 最佳实践

OpenClaw 的安全模型是个人助理,不是敌对多租户。一个 Gateway 只给一个信任边界用。官方安装路径、loopback、pairing、allowlist 先钉死,升级才谈得上能回滚。

难点通常不在渠道数量,而在四件事:是不是走了官方安装和升级路径;Gateway 暴露给了谁;skills、plugins、browser、node 有没有放大风险面;升级后能不能验证和回滚。基于官方文档的部署基线,加上真实部署里踩过的坑(脱敏,只留可复用的结论和修法)。