AI 코딩 에이전트의 '다크 팩토리' 접근 방식은 코드 품질 유지보수(Maintainability) 측면에서 한계가 명확함
AI는 벤치마크 통과에는 능숙하나, 코드의 설계 및 아키텍처 개선에는 인간의 개입이 필수적임
제품 검토(Product Review), 시스템 아키텍처(System Architecture) 등 인간의 '의도(Intent)'와 '취향(Taste)'이 중요한 단계는 여전히 필요함
AI의 한계를 인정하고 인간과 AI의 협업을 통해 생산성과 코드 품질을 동시에 확보하는 전략이 중요함
커뮤니티에서는 '다크 팩토리(Dark Factory)' 또는 '라이트 오프 팩토리(Lights-off Factory)' 접근 방식이 코드 품질 유지보수(Maintainability) 측면에서 실패할 수 있다는 점에 공감합니다. AI 모델이 벤치마크 테스트를 통과하는 데는 뛰어나지만, 코드베이스의 복잡성이 증가함에 따라 발생하는 샷건 수술(Shotgun Surgery)과 같은 문제를 해결하거나 장기적인 코드 품질을 유지하는 데는 인간의 개입이 필수적이라는 의견이 지배적입니다. 이는 AI가 '의도(Intent)'나 '취향(Taste)'과 같은 주관적이고 복잡한 개념을 이해하고 반영하는 데 어려움이 있기 때문입니다.
논의에서는 AI 모델의 강화학습(Reinforcement Learning, RL)이 코드 품질을 개선하는 데 한계가 있음을 지적합니다. 현재의 기반 보상 시스템은 코드의 설계나 아키텍처 품질 저하에 대한 페널티를 부과하지 못합니다. 즉, 테스트는 통과하더라도 을 해치는 코드가 생성될 수 있으며, 이에 대한 객관적이고 빠른 평가 지표(Oracle)가 부재하다는 점이 근본적인 문제로 제기됩니다. 이는 AI가 생성한 코드의 품질을 신뢰하기 어려운 이유 중 하나입니다.
댓글에서는 AI가 코드를 '구현(Implement)'하는 데는 능숙하지만, 소프트웨어의 '의도(Intent)'를 파악하고 시스템 아키텍처(System Architecture)와 일관성을 유지하는 데는 인간의 역할이 중요하다고 강조합니다. 특히 제품 검토(Product Review), 프로그램 설계(Program Design), 수직적 슬라이스(Vertical Slices)와 같은 단계에서는 인간의 경험과 판단, 즉 '취향(Taste)'이 요구됩니다. 이러한 단계는 AI가 자동화하기 어렵고, 코드 리뷰 과정에서 발생하는 지적 및 감정적 부담을 줄이기 위해서도 필수적입니다.
AI 코딩 에이전트의 한계를 인정하면서도, 이를 극복하기 위한 인간-AI 협업 모델이 제시됩니다. 글쓴이는 제품 요구사항 정의(Product Requirements)부터 수직적 슬라이스(Vertical Slices)까지 이어지는 명확한 계획 단계를 거치고, AI를 각 단계에서 보조 도구로 활용하는 방식을 제안합니다. 이는 '다크 팩토리'처럼 모든 것을 AI에 맡기는 대신, 인간의 개입이 필요한 영역을 명확히 하고 AI의 강점을 활용하여 2~3배의 생산성 향상을 안전하게 달성하는 것을 목표로 합니다.
일부 댓글에서는 최근 AI 모델(예: Fable, GPT-5.6)의 발전으로 인해 과거 경험이 현재 시점에서는 덜 관련 있을 수 있다는 의견을 제시합니다. 또한, RFC 기반 규범적 명세(RFC-based Normative Specifications)를 활용하여 AI의 구현 및 검증을 자동화하려는 시도도 언급됩니다. 장기적으로는 AI가 코드 품질을 유지보수하는 능력이 향상될 가능성도 있지만, 현재로서는 인간의 감독과 협업이 필수적이라는 것이 중론입니다. AI가 생성한 코드의 '단위'를 '엉망진창 덩어리(Bunch of Shit)'로 부르는 등, AI 중심 개발에 대한 비판적 시각도 존재합니다.