코드 리뷰 병목 현상(Code Review Bottleneck) 심화로 인해 반복되는 중요한 검증 항목을 자동화할 필요성이 대두됨
OpenAI는 Codex Code Review에 AGENTS.md 파일 기반의 사용자 정의 규칙(Custom Repository Rules) 기능을 도입하여 이를 해결함
새로운 규칙 시스템은 98%의 규칙 위반 사항을 성공적으로 탐지하며, 개발 생산성 향상에 기여함
개발 속도 증가로 PR(Pull Request) 볼륨이 두 배 이상 증가하면서, 경험 많은 리뷰어의 맥락 파악(Context Grasping) 능력에 의존하는 기존 코드 리뷰 방식은 한계에 봉착함.
Codex Code Review는 AGENTS.md 파일에 정의된 사용자 정의 규칙(Custom Rules)을 활용하여, API 계약 유지(API Contract Preservation), 로그 데이터 민감 정보 제외(Sensitive Data Exclusion) 등 반복적이고 맥락 의존적인 검증을 자동화함.
이를 통해 리뷰어는 핵심적인 비즈니스 로직 검토에 집중하고, 개발 생산성(Developer Productivity) 향상을 도모할 수 있음.
AGENTS.md 파일은 기존에 코딩 작업 지침을 제공하는 데 사용되었으나, 이제 코드 리뷰 가이드라인(Code Review Guideline)을 포함하는 데에도 활용됨.
규칙 범위(Rule Scoping): 저장소 루트(Repository Root)에는 전역 규칙을, 하위 디렉토리에는 서비스별 규칙을 배치하여 관련성 높은 지침만 적용하도록 함.
명확한 지침 제공: **'rawResponseItem/*'와 같은 특정 이벤트 명칭 보존과 같이, 실험적이더라도 호환성(Compatibility)을 위해 유지해야 하는 대상을 명시하고, 위반 시 관련 가이드라인과 우선순위**를 함께 제시함.
결과: 규칙 기반 검증은 98%의 필수 사용자 지정 항목을 성공적으로 복구하여, 기존 58.3%의 기본 제어 그룹 대비 탐지 정확도(Detection Accuracy)를 크게 향상시킴.
효과적인 규칙 작성을 위해 OpenAI는 작고 범위가 명확한(Small, Scoped) 규칙 세트와 명시적인 안전 경로(Explicit Safe Path) 제공을 강조함.
중요하고 명백하지 않은 불변성(Consequential, Non-obvious Invariant)으로 시작: 반복적으로 설명해야 하는 호환성 요구사항이나 데이터 경계와 같은 규칙을 우선적으로 인코딩함.
코드 기반 범위 지정: 규칙을 해당 코드가 관리하는 범위에 맞게 조정하여, 관련 없는 지침이 주의를 분산시키지 않도록 함.
내구성 및 최신성 유지: 함수 이름보다는 결과(Outcomes)를 설명하고, 규칙 업데이트를 통해 노이즈를 유발하는 지침은 제거하거나 수정함.
CI/CD 활용: 포맷팅이나 기계적 검사는 CI/CD 파이프라인에서 처리하고, 리뷰어가 반복적으로 질문해야 하는 복잡한 판단은 저장소 규칙으로 관리함.
평가 결과, 규칙 기반 코드 리뷰는 바쁜 디프(Busy Diffs) 상황에서도 의도된 위반 사항을 성공적으로 식별했으며, 깨끗한 변경 사항이나 유효한 예외에 대해서는 불필요한 플래그를 생성하지 않음.
커버리지(Coverage): 규칙이 적용된 변형은 98%의 필수 사용자 지정 항목을 복구하여, 규칙이 없는 경우(58.3%)보다 훨씬 높은 정확도를 보임.
억제(Restraint): 안전한 변경이나 유효한 예외 처리 시 불필요한 알림을 생성하지 않아, 리뷰어의 피로도를 줄임.
유지(Retention): 저장소 규칙 외의 일반적인 버그도 지속적으로 탐지하여 코드 품질을 유지함.
실행 가능성(Actionability): 각 결과는 관련 지침, 위치, 우선순위를 명확히 하여 개발자가 신속하게 조치할 수 있도록 지원함.