AGENTS.md 不再只指导 coding——现在还能指导审查。把团队隐性知识编码为可引用、可 scope 的 review 指令。
Coding agent 带来了更多代码产出。OpenAI 内部周 PR 量自 Q4 翻倍,客户中也看到同样趋势。但更多 PR = 更多人等审查。
关键痛点:有些问题从 diff 看不出来。重命名一个 response field 像是例行清理,但可能破坏仍在使用旧契约的客户端。有经验的审查者记得为什么不能改;新 contributor 或首次在此工作的 agent 不会知道。
Codex Code Review 的新功能:在 AGENTS.md 中写入简洁、限定范围的审查指导。审查时 Codex 自动应用相关规则,在 finding 中引用对应规则——而不是每次 PR 重复解释。
Codex app-server 发出 rawResponseItem/completed 通知。标记为 experimental,但 Codex Cloud 已在消费它。
-RawResponseItemCompleted => "rawResponseItem/completed"
+RawResponseItemCompleted => "rawResponseItem/done"
代码编译通过。但监听旧通知名的客户端会静默断连。
对应的 AGENTS.md 规则非常简洁:
## Code Review Rules
### Breaking changes
Search for breaking changes in external integration surfaces:
- raw response item events (`rawResponseItem/*`), even while experimental
Codex 的 finding 自动引用这条规则:
Keep the existingrawResponseItem/completednotification. Codex Cloud consumers listen for this wire name, so renaming it will break them even though the event is experimental. Keep the existing name or add a backward-compatible event, as described inAGENTS.md.
OpenAI 用包含已知违规和安全反例的 eval suite 测试:
Eval 还围绕四个维度展开:
| 维度 | 问题 |
|---|---|
| Coverage | diff 很忙、规则竞争注意力时,能 surface 预期违规吗? |
| Restraint | 干净修改和有效例外能否避免不必要 finding? |
| Retention | 规则之外仍能捕获普通 bug 吗? |
| Actionability | 每个 finding 是否标明指导、位置、优先级? |
Codex 能发现并引用默认 review 可能遗漏的本地指导,但宽泛的指令容易制造噪音。小范围、带明确安全路径的规则集效果最好。
Repository rules 不是替代 CI 和 tests,而是填补 reviewer 需要反复口述的判断空白。
| 工具 | 适用场景 | 例子 |
|---|---|---|
| Tests / linters | 确定性检查 | 格式、类型、测试覆盖 |
| Repository rules | 难以编码的判断 | 兼容性要求、数据边界、隐性约定 |
| Branch protections | 硬性门禁 | required approvals、status checks |
AGENTS.md 加 2-3 条规则@codex review 触发来源:Custom Code Review rules for Codex — Hari Srikanth, OpenAI Developers Blog, 2026-07-22