用 Codex 远程定位并修复服务器 Bug
约 760 字大约 3 分钟
用 Codex 远程定位并修复服务器 Bug
这案例干啥的
就是线上服务器报错了,你不用 SSH 上去一个个翻日志,直接让 Codex 连上去看日志、定位问题、甚至改代码重启。
相当于给 AI 装了个"远程运维"的手。
啥时候用
- 半夜报警,懒得自己爬起来看日志
- 排查问题卡壳了,想让 AI 帮忙分析日志
- 重复性高的 bug 修复(比如配置错了、依赖版本不对)
- 多台机器要批量检查同一个问题
准备工作
- Codex 配好远程执行能力(SSH、或者某种 agent)
- 有目标服务器的访问权限
- 知道大概哪儿出问题(应用名、日志路径)
- 重要操作前先备份的意识!
怎么搞
第一步:告诉 Codex 咋连
跟 Codex 说服务器信息:
帮我连一下服务器(user@1.2.3.4,密钥在 ~/.ssh/id_rsa),看下 /var/log/myapp/error.log 最近的报错。
第二步:让 AI 看日志
AI 连上去,拉日志,分析:
看,日志里 2026-08-12 22:00 这段有 NPE,堆栈在 UserService.java:45。我帮你看看代码。
第三步:定位根因
AI 会去看相关代码:
我去仓库里看了 UserService.java:45,发现是 user 对象可能为 null,没判空就直接 getName 了。这就是根因。
第四步:让 AI 改
确认改法:
帮我加个判空,改完提交个 commit。别部署,我自己来。
或者:
改完帮我重启服务,改之前先备份原文件。
第五步:验证
让 AI 看重启后的日志:
重启完了,观察 5 分钟看还有没有同样的报错。
第六步:留记录
让 AI 把这次排查过程写个 incident 报告,存到 wiki 或者 incident 系统。
验证结果
- AI 能连上服务器(SSH 通)
- 日志读取正确,没乱码
- 定位的问题跟你手动排查的一致(或者 AI 找到了你没注意的点)
- 修复后问题确实消失了(日志不再报同样错)
注意事项
提示
让 AI 做"只读"操作(看日志、看代码、分析)很安全。涉及"写"(改代码、重启服务、删文件)时,务必让它先跟你确认再做。
注意
千万别让 AI 直接在生产环境跑 rm -rf、DROP TABLE 这种命令。重要数据一定先备份。AI 不懂"这个操作后果多严重",你得把关。
我的经验
我固定让 AI 干"日志分析"这步,但"修复"这步我一般自己来。让 AI 把"问题原因""建议改法""影响范围"整理成报告,我看一眼心里有数,再决定怎么改。
还有,让 AI 操作前,我先给它"只读权限"的账号,确保它就算发疯也搞不坏东西。
下一步
- 配合 GitHub Actions 做 CI 失败自动修复
- 试试 安卓远程操控,手机上盯着
- 整理一份"常见 bug → 修复步骤"的 runbook 给 AI 参考