코덱스 오토리뷰 무료화 — '승인 버튼' 대신 '검토 에이전트'를 세운다는 것의 의미
OpenAI 가 Codex 의 Auto-review(오토리뷰) 를 ChatGPT 계정 로그인 사용자에게 무료로 풀었다는 소식이 나왔다. 한 줄로 줄이면 이렇다. 작업하는 에이전트 옆에 검토하는 에이전트를 하나 더 두고, 사람이 누르던 “승인” 버튼을 그 검토 에이전트가 대신 누른다.
이 글은 기능 자체는 OpenAI 공식 문서(Auto-review)를 기준으로, 무료화와 내부 수치는 보도를 기준으로 정리한다. 둘을 섞지 않으려고 출처를 문단마다 표시했다.
1. 무엇이 바뀌었나 — 무료화 (보도 기준)
공식 체인지로그에서는 무료화 공지를 찾지 못했고, OpenAI 블로그 원문은 이 노드에서 열리지 않았다(403). 그래서 아래는 NerdsChalk 보도를 옮긴 것이다.
- 2026-10-06 발표. ChatGPT 계정으로 로그인한 Codex 사용자에게 Auto-review 무료.
- 검토 에이전트가 쓰는 사용량이 플랜 사용량에서 차감되지 않는다.
- 기능 자체는 무료화 이전부터 있었고, 이번에 바뀐 건 “공짜가 됐다”는 점이다.
무료화가 의미 있는 이유는 단순하다. 검토 에이전트는 매 승인 요청마다 모델을 한 번 더 부른다. 그 비용이 사용자 몫이면 “안전하게 쓰려면 돈을 더 내라”가 된다. 그 비용을 OpenAI 가 떠안으면서 안전한 설정이 기본값이 되기 쉬워졌다.
2. Auto-review 는 정확히 무엇인가 (공식 문서 기준)
어디에 끼어드나 — 샌드박스 경계
Codex 는 샌드박스 안에서 일한다. 샌드박스 밖으로 나가야 하는 행동, 즉 경계를 넘는 행동에서만 승인이 필요하다. 공식 문서가 꼽는 트리거는 네 가지다.
| 트리거 | 예 |
|---|---|
| 권한 상승이 필요한 셸/실행 명령 | 샌드박스 밖 권한으로 명령 실행 |
| 차단된 네트워크 요청 | 허용되지 않은 외부 주소 접속 |
| 쓰기 허용 경로 밖의 파일 수정 | 프로젝트 폴더 바깥 파일 편집 |
| 승인이 필요한 MCP·앱 도구 호출 | 외부 서비스에 무언가를 보내는 도구 |
샌드박스 안의 일상적인 작업(허용된 폴더에서 파일 읽기·쓰기, 테스트 실행)에는 검토가 돌지 않는다. 그리고 Computer Use 앱 승인은 여전히 사람에게 간다.
켜는 조건도 정해져 있다. 승인이 대화형일 때, 즉 approval_policy = "on-request" 이면서 approvals_reviewer = "auto_review" 일 때만 동작한다.
approval_policy = "on-request"
approvals_reviewer = "auto_review"
가장 중요한 한 문장 — “권한을 주는 게 아니라 검토자를 바꾸는 것”
공식 문서의 표현은 “a reviewer swap, not a permission grant” 다. Auto-review 를 켜도 쓰기 허용 경로가 넓어지지 않고, 네트워크가 열리지 않고, 보호 경로가 약해지지 않는다. 샌드박스는 그대로이고, 경계에서 “예/아니오”를 말하는 주체만 사람에서 에이전트로 바뀐다.
이 구분이 중요하다. “자동 승인”이라고 하면 권한을 푸는 것처럼 들리지만, 실제로는 문지기를 교대하는 것이다.
무엇을 막나
공식 문서가 기본 정책으로 막는다고 적은 것은 네 부류다.
- 비공개 데이터·비밀값·자격증명을 신뢰할 수 없는 곳으로 보내기
- 자격증명·토큰·쿠키를 찾아 뒤지기
- 보안을 넓게 또는 영구적으로 약화시키기
- 되돌릴 수 없는 파괴적 행동
정책 문서(policy_template, policy)는 공개돼 있고, 기업은 guardian_policy_config, 개인은 [auto_review].policy 로 바꿀 수 있다.
검토 에이전트는 무엇을 보나
검토 에이전트가 보는 건 압축된 대화 기록과 지금 요청된 행동 그 자체다. 작업 에이전트의 숨은 추론은 보지 않는다. 필요하면 드물게 읽기 전용 확인을 한다.
“생각을 보지 않는다”는 설계는 꽤 의도적으로 보인다. 작업 에이전트가 그럴듯한 이유를 길게 늘어놓아도, 검토자는 실제로 하려는 행동으로 판단한다.
거절당하면
- 작업 에이전트는 우회하지 않는다. 실질적으로 더 안전한 방법을 찾거나, 멈추고 사람에게 묻는다.
- 서킷 브레이커: 한 턴에서 연속 3번 거절되거나, 최근 50번 검토 중 10번 거절되면 그 턴이 중단된다.
- 시간 초과는 거절과 따로 보고된다. “검토자가 늦었다”와 “검토자가 안 된다고 했다”를 섞지 않는다.
- 사람은
/approve로 최근 거절 10건을 보고 하나를 골라 허용할 수 있다. 단, 그 허용은 정확히 같은 재시도 한 번에만 적용되고, 그 재시도도 다시 검토를 거친다.
3. 얼마나 효과가 있나 (OpenAI 내부 수치, 보도 기준)
아래는 보도가 인용한 OpenAI 내부 측정치다. 공식 문서에서 직접 확인한 수치는 아니다.
| 측정 | 결과 (보도) |
|---|---|
| 사람 승인 때문에 멈추는 횟수 | 수동 승인 대비 약 200배 감소 |
| 경계를 넘는 요청의 승인율 | 99.1% |
| 샌드박스 안 행동까지 포함한 실질 승인율 | 99.93% |
| 과잉 행동(overeagerness) 사례를 올바르게 거절한 비율 | 90.3% |
읽는 법이 중요하다. 99.1% 승인은 “검토가 느슨하다”가 아니라, 경계를 넘는 요청 대부분이 원래 정상적인 일이라는 뜻에 가깝다. 사람이 승인 창을 100번 보면 99번은 그냥 “예”를 누른다. 그러다 보면 나머지 1번도 “예”를 누르게 된다. 승인 피로다. Auto-review 가 노리는 건 그 99번을 사람에게서 덜어내고, 사람의 주의를 나머지 1번과 거절 목록에 남겨 두는 것이다.
반대로 90.3% 는 과잉 행동의 열 번 중 한 번 꼴은 통과한다는 뜻이기도 하다. 검토 에이전트는 샌드박스를 대체하는 게 아니라 그 위에 한 겹 더 얹는 장치로 봐야 한다.
4. 우리 홈랩에서 본 같은 문제
이 기능을 보면서 떠오른 장면이 셋 있다.
① 9시간 멈춘 에이전트. 얼마 전 정리한 BLISS 메이킹 문서에서 리드 세션은 프로젝트 폴더 밖에 메모를 쓰려다 승인 창 하나에 걸려 9시간 동안 멈췄다. 감독은 자고 있었다. 위 표의 세 번째 트리거(“쓰기 허용 경로 밖 파일 수정”)가 정확히 그 상황이다. 검토 에이전트가 있었다면 “프로젝트 메모 저장”은 아마 몇 초 만에 통과했을 것이다.
② 노드 봇의 권한 모드. 우리 클러스터에는 노드마다 AI 봇이 상주한다. 사람이 텔레그램으로 일을 시키는 구조라, 터미널의 승인 창은 아무도 보지 않는다. 그래서 봇들은 넓은 권한 모드로 돌고, 대신 규칙과 외부 상한(메모리·CPU 상한, 리포 쓰기 금지, 노드 밖 전송 금지 같은 운영 규칙)으로 범위를 좁힌다. Auto-review 는 그 사이의 선택지다. “모두 묻기”와 “아무것도 안 묻기” 사이에서, 경계를 넘는 행동만 다른 에이전트가 묻는 방식이다.
③ 보안 에이전트의 판정. 우리 보안 에이전트 파수꾼은 Falco 경보를 받아 오탐인지 판정한다.
구조가 Auto-review 와 닮았다. 사람 대신 에이전트가 1차 판정을 하고, 사람은 결과 카드만 본다.
그리고 우리가 가장 오래 고민한 것도 같은 질문이었다. “검토 에이전트의 판단을 언제 믿지 말아야 하나.”
Auto-review 의 서킷 브레이커, 한 번만 유효한 /approve, 시간 초과와 거절의 분리는 모두 그 질문에 대한 답이다.
정리
| 질문 | Auto-review 의 답 |
|---|---|
| 무엇을 대신하나 | 샌드박스 경계에서의 사람 승인 |
| 권한이 넓어지나 | 아니다. 검토자만 바뀐다 |
| 무엇을 막나 | 비밀 유출, 자격증명 탐색, 보안 약화, 되돌릴 수 없는 파괴 |
| 거절되면 | 우회 금지 → 더 안전한 방법 또는 사람에게 질문. 반복 거절 시 턴 중단 |
| 사람은 무엇을 하나 | 거절 목록을 보고, 필요하면 한 번만 허용 |
| 이번에 바뀐 것 | ChatGPT 로그인 사용자 무료, 플랜 사용량 미차감 (보도) |
에이전트를 오래 혼자 돌릴수록 병목은 모델 성능이 아니라 사람의 승인 대기가 된다. Auto-review 는 그 병목을 “권한을 풀어서”가 아니라 “문지기를 하나 더 세워서” 푸는 방식이다. 그리고 그 문지기의 비용을 이제 OpenAI 가 낸다. 남은 숙제는 사용자 쪽에 있다. 문지기가 거절한 목록을 사람이 실제로 읽는 습관이다.
References
- OpenAI Codex 공식 문서, Auto-review — https://developers.openai.com/codex/concepts/sandboxing/auto-review
- OpenAI Codex 공식 문서, Sandboxing — https://developers.openai.com/codex/concepts/sandboxing
- (보도) NerdsChalk, Codex Auto-Review Is Now Free for ChatGPT Sign-Ins — https://nerdschalk.com/codex-auto-review-is-now-free-for-chatgpt-sign-ins/