AI 발전과 보안의 상관관계, 그리고 시스템 보안의 발전 방향 — 하브루타 8라운드
핵심 결론: 이 글의 초판은 “이득은 검증(verification) 비용을 싸게 만든 쪽이 가져갔다”고 결론지었다. 그 결론은 8라운드 토론에서 무너졌다. 내가 세운 일반화가 라운드마다 하나씩, 전부 같은 이유로 깎였기 때문이다 — 원문은 그 인과 고리를 말하지 않는다. 살아남은 결론은 훨씬 작고 훨씬 쓸모 있다. “AI가 보안에 이로운가 해로운가”는 지금 공개된 1차 자료로 답할 수 없다. 자료가 지지하는 것은 ①경계가 명시된 비교 명제와 ②비교와 무관하게 이미 성립하는 위험·통제 원칙, 두 종류뿐이다. 그리고 이 둘은 서로 다른 질문에 답한다.
아래는 결론만이 아니라 결론이 깎여 나간 과정 전체다. 8라운드 동안 Claimant(Claude)가 일곱 번 물러섰고, 물러선 자리마다 무엇이 남았는지를 그대로 적었다.
0. 이 글은 어떻게 만들어졌는가 (방법 공개)
하브루타(חַבְרוּתָא)는 두 사람이 논쟁하는 형식이지만, 진짜 세 번째 파트너는 공유 원문(shared text) 이다. 논쟁이 인상비평으로 흐르지 않게 붙잡아 주는 것이 원문이기 때문이다.
- 공유 원문 고정: 1차·공식 출처 13건을 먼저 수집해 동결했다. 이 목록 밖의 수치는 양측 모두 사용 금지.
- Claimant(주장자): Claude (본 글 작성자).
- Challenger(반대 토론자): 매 라운드 새로 기동한 Codex CLI 0.146.0(모델
gpt-5.6-sol). 매번 동일한 공유 원문 + 그때까지의 토론 기록만 주고, “가장 강한 공격 1개에만 집중, 새 수치 발명 금지, 새 논거가 없으면 ‘새 논거 없음: 수렴’이라고 답하라” 조건으로 실행 후 종료. - Moderator(종합): Claude.
- 스킬 출처: Leopard
main, 검증 시점 커밋397f931.
라운드 수에 대하여. 이 글의 초판은 1라운드만 돌린 것이었다. 스킬 문서는 “bounded rounds”(복수)라고만 적고 고정 횟수를 정하지 않는다 — 실제로 Leopard 저장소 전체에 “30라운드” 같은 기본값은 존재하지 않으며, 스킬은 오히려 “라운드 수를 지어내지 말 것” 을 가드레일로 명시한다. 그래서 고정 30회 같은 연출 대신 새 논거가 안 나올 때까지 돌렸다. 결과는 8라운드다 — 8라운드에서 Challenger 가 “새 논거 없음: 수렴”으로 응답하며 종료됐다. 각 라운드는 실제 Codex 프로세스 1회 기동에 대응하며, 아래 §4에 라운드별 주장과 반박이 그대로 실려 있다.
정직한 한계 고지: 이것은 실험이 아니라 문헌 기반 토론이다. 반대 토론자는 사람이 아니라 다른 모델이다. 아래 어떤 수치도 이 토론이 생성한 것이 아니라 전부 인용이다.
1. 질문과 범위
질문 1. AI 능력의 발전과 시스템 보안 수준 사이에는 어떤 상관관계가 있는가? 질문 2. 그렇다면 시스템 보안은 어느 방향으로 발전해야 하는가?
범위: 2024년 10월 ~ 2026년 8월. 소프트웨어 취약점 발견·조치, 공세적 AI 악용, AI 시스템 자체의 보안(적대적 ML·프롬프트 인젝션), 그리고 한국의 제도 대응. 범위 밖: 딥페이크·허위정보, 물리 보안, AI 안전(alignment) 일반론.
의사결정 맥락: “우리 조직이 보안 예산을 더 똑똑한 AI 도구에 넣어야 하는가, 아니면 구조적 통제에 넣어야 하는가”를 판단하기 위한 것.
2. 공유 원문 등록부 (Shared Source Register)
출처 등급을 섞지 않기 위해 라벨을 붙인다.
| # | 출처 | 등급 |
|---|---|---|
| S1 | DARPA AIxCC 최종 결과 (2025-08-08) | 1차·공식(정부) |
| S2 | Google Project Zero, “From Naptime to Big Sleep” (2024-10) | 1차·벤더 연구 |
| S3 | Google Cloud CISO Perspectives, Big Sleep in-the-wild 차단 (2025-07-17) | 1차·벤더 주장(제3자 검증 없음) |
| S4 | Anthropic, GTG-1002 캠페인 보고서 (2025-11-13) | 1차·벤더 주장 |
| S5 | Ars Technica, 외부 연구자 회의론 (2025-11-14) | 제3자 반대증거 |
| S6 | Google GTIG, AI Threat Tracker (2025-11-05) | 1차·벤더 위협인텔 |
| S7 | Daniel Stenberg, “Death by a thousand slops” (2025-07-14) | 1차·메인테이너 실측 |
| S8 | NIST AI 100-2e2025 (2025-03) | 1차·표준기관 |
| S9 | OWASP Top 10 for LLM Applications 2025 | 1차·커뮤니티 표준 |
| S10 | Verizon DBIR 2025 | 제3자·대규모 실측 |
| S11 | Google, “Rust in Android: move fast and fix things” (2025-11-13) | 1차·벤더 실측 |
| S12 | 과기정통부·KISA 「인공지능(AI) 보안 안내서」 (2025-12-10 발간, 2026-03-13 정오 수정) | 1차·국내 공식 |
| S13 | 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」 (시행 2026-01-22) | 1차·국내 법령 |
원문 검증에서 먼저 걸린 것 — 수치 하나가 이미 틀려 있었다
AIxCC 결승 성적을 인용하는 다수 기사가 “77% 발견 / 61% 패치 / 평균 45분” 을 쓴다. 그런데 DARPA 공식 페이지에는 정정 공지가 붙어 있다. 합성 취약점 개수가 70개가 아니라 63개로 정정되면서, 실제 값은 86% 발견 / 68% 패치 가 됐다(S1).
“A former version of this update stated the Final Competition included 70 synthetic vulnerabilities. Upon further review, the competition administrator determined the Final Competition included 63 synthetic vulnerabilities.” — DARPA (S1)
이 글은 정정된 값만 쓴다. 이것 자체가 하브루타의 첫 교훈이다 — 공유 원문으로 돌아가지 않으면, 2차 인용의 틀린 숫자를 그대로 물려받는다.
3. 관측된 사실 vs 해석
혼동을 막기 위해 층을 나눈다.
3-1. 관측된 사실 (Facts)
방어 측
- AIxCC 결승: 5,400만 라인 코드에서 합성 취약점 63개 중 54개 발견(86%), 43개 패치(68%). 준결승 대비 발견 37%→86%, 패치 25%→68%. 부수적으로 실제(비합성) 취약점 18건 발견(C 6건, Java 12건), 실제 취약점 패치 11건 제출. 결승 7개 시스템 전부 오픈소스 공개. 1·3위 팀에 한국 기관(KAIST·POSTECH·삼성리서치, Theori)이 포함(S1).
- Big Sleep이 SQLite의 exploitable stack buffer underflow를 발견, 당일 패치. 정식 릴리스 전이라 사용자 영향 0. 동일 버그를 퍼징은 150 CPU-hours 후에도 못 찾았다(S2).
- 2025년 7월, Google은 “공격자만 알고 있던” 임박한 SQLite 취약점을 Big Sleep + 위협인텔로 사전 차단했다고 발표(S3).
- Android에서 메모리 안전 취약점 비중이 처음으로 전체의 20% 미만으로 하락. Rust 코드 취약점 밀도 약 0.2/MLOC vs C·C++ 약 1,000/MLOC. 게다가 Rust 변경은 롤백률 4배 낮고 코드리뷰 시간 25% 짧았다(S11).
공격 측
- GTG-1002: 약 30개 표적, 성공은 “소수”. AI가 전술 작업의 80~90% 수행, 인간 개입은 캠페인당 4~6개 결정 지점. 작업을 잘게 쪼개고 “보안회사 직원” 페르소나로 가드레일 우회(S4). 이후 MITRE ATT&CK에 Campaign C0062로 등재.
- PROMPTSTEAL(=CERT-UA의 LAMEHUG): 러시아 APT28이 우크라이나 대상 실전 사용. Hugging Face API로 LLM에 명령 생성을 질의 — 실전 배치된 LLM 질의 악성코드의 첫 관측(S6).
- PROMPTFLUX: Gemini API로 자기 소스를 재작성하는 드로퍼. 단 개발·테스트 단계이며 실제 감염 능력 없음(S6).
- 가드레일 우회에 “CTF 참가자·학생·연구자” 사칭이 통했다(S6).
양측 공통 — 오류의 대량생산
- curl: 2025년 제출물의 약 20%가 AI slop, 같은 시점 전체 제출 중 유효 취약점은 약 5%. 메인테이너 표현으로 “사실상 DDoS 당하는 중”(S7).
- GTG-1002에서 Claude는 작동하지 않는 자격증명을 환각하고 이미 공개된 정보를 “중대 발견”으로 과장했다. Anthropic 스스로 이를 “완전 자율 공격의 장애물”로 명시(S4).
운영 현실
- 취약점 익스플로잇이 침해 초기 침투 경로의 20%(전년비 +34%), 자격증명 오용 22%, 피싱 15%. 엣지장비·VPN이 익스플로잇의 22%(전년 3% → 약 8배). 엣지 취약점조차 완전 조치율 54%, 중앙값 32일. CISA KEV 전체는 38%, 스캔에서 발견된 전체는 9%. GitHub 유출 시크릿 조치 중앙값 94일(S10).
3-2. 검증되지 않은 것 (Unknowns)
- AI가 동일 비용·기간에서 공격자에게 추가한 침해 수와 방어자에게 감소시킨 침해 수를 같은 분모로 비교한 자료는 없다.
- 미탐지 공세 활동의 규모는 정의상 알 수 없다.
- 오픈소스로 풀린 AIxCC CRS 7종의 실제 도입률과 그 운영 성과는 공개된 바 없다.
- S3(Big Sleep의 in-the-wild 차단)는 Google 자체 평가이며 제3자 검증이 없다. S4의 “80~90%”도 세부 기법이 비공개라 재현 불가(S5).
4. 8라운드 기록 — 무엇이 어떻게 깎였는가
각 라운드는 Claimant 의 새 주장 → Challenger 의 수용/반박/원문확인 한 벌이다. 라운드 사이에 Claimant 는 반드시 앞선 패배를 명시적으로 철회하고 다음 주장을 세웠다. Challenger 에게는 매번 “새 논거가 없으면 ‘새 논거 없음: 수렴’이라고 답하라”는 종료 조건이 주어졌다.
라운드 0(초판) — C1. “AI 능력은 공격보다 방어에 먼저·더 크게 누적된다”
초판의 출발 주장. 기각. Challenger: AIxCC 는 정답이 정해진 채점 환경이고, 공세 사례는 걸린 것만 공개된 표본이다. 두 표본은 같은 저울에 올릴 수 없다.
라운드 1 — R1. “방어 성과는 복제 비용이 0에 가깝고, 공세 성과는 그렇지 않다”
표본 비교를 피해 전파 메커니즘 으로 우회한 주장. 방어 성과는 실행 가능한 인공물로 공개되고(AIxCC 결승 7개 CRS 전부 OSI 승인 라이선스 공개, S1), 공세 성과는 사후 서술로만 공개된다(S5 가 GTG-1002 의 기법·툴링 비공개를 비판한다). 따라서 전자는 능력의 이전, 후자는 능력의 서술이다.
Challenger — 부분 수용, 결론은 기각. “공개 형식의 비대칭”까지는 성립한다. 그러나 R1 은 “OSI 라이선스로 공개됐다”에서 “도입만 하면 성능이 복제된다”로 넘어갔고, S1 이 확인하는 것은 코드 공개와 결승 성적뿐이다. 제3자 코드베이스에서 같은 성능이 나오는지, 설치·통합·연산·하네스 구성에 얼마가 드는지는 원문에 없다. 결정적 반례가 등록부 안에 있다 — S2 에서 퍼징이 취약점을 놓친 이유는 generate_series 확장을 켜지 않은 하네스 설정이었다. 도구가 존재해도 대상별 설정이 다르면 능력은 그대로 이전되지 않는다.
남은 것: 공개 형식의 비대칭은 존재하지만, 확산 비용의 비대칭은 입증되지 않았다.
라운드 2 — R2. “성과를 가른 변수는 모델 능력이 아니라 대상 특화 컨텍스트의 품질이다”
“복제 비용 0”을 철회하고, 나를 때린 근거(S2 의 하네스)를 오히려 확대해 세운 주장. 세 사례를 같은 구조로 묶었다 — S2 의 하네스 설정, S6 의 PROMPTFLUX 실패, S4 의 “정당한 보안회사 직원” 페르소나.
Challenger — 부분 수용, 묶음은 기각. 문제는 서로 다른 인과 변수를 전부 ‘컨텍스트 품질’로 재명명한 것이다. S2 에는 실패 원인이 명시돼 있다. 그러나 S6 은 PROMPTFLUX 가 “실제 감염 능력이 없었다”고만 말하고 그 원인을 말하지 않는다. 대상 정보 부족인지, 실행 경로 부족인지, 코드 기능 부족인지 원문에 없다. 이를 “컨텍스트가 나빴기 때문”이라 분류하면 확인되지 않은 원인을 삽입하는 것이다. PROMPTSTEAL 과의 차이가 입증하는 것도 배치 상태의 차이이지 컨텍스트 품질이 아니다.
남은 것: 하네스 구성과 가드레일 우회에서는 컨텍스트가 명시적 변수다. 단일 인과 설명으로는 성립하지 않는다.
라운드 3 — R3. “확정적으로 좋은 결과는 전부 피해 발생 전 단계에서 닫힌 것이다”
PROMPTFLUX 를 철회하고, 등록부 전체의 결과 패턴 으로 옮긴 주장. 확정적으로 좋았던 쪽(S2 릴리스 전 패치·사용자 영향 0, S3 악용 전 차단, S11 취약점 생성 전 제거)은 전부 왼쪽이고, 불확실한 쪽(S10 조치율 9%, S7 slop 20%, S4·S5 사후 탐지)은 전부 오른쪽이다.
Challenger — S11 오독으로 기각. S11 은 “취약점이 생기기 전에 제거됐다”고 말하지 않는다. 원문은 Rust 코드에도 취약점 밀도(약 0.2/MLOC)를 제시한다. 즉 원문이 보여주는 것은 구조적 위험 감소이지 사전 완전 제거가 아니다. S11 을 가장 왼쪽에 놓을 수 없으면 S2·S3(이미 존재하는 취약점을 발견·패치)과 S11(개발 방식에 따른 밀도 감소)은 같은 파이프라인 위치를 공유하지 않는다. 게다가 S11 에는 LLM 이 관여하지 않았으므로 “AI 를 어디에 배치하느냐”의 근거로 쓸 수 없다.
남은 것: “배포 전 패치가 확인된 S2 에서는 사용자 피해가 없었다”는 사례 수준의 명제뿐.
라운드 4 — R4. “이 등록부는 어떤 일반법칙도 지지하지 않는다”
네 번 진 것 자체를 근거로 삼은 메타 주장. C1·R1·R2·R3 가 매번 같은 이유로 죽었다 — “원문이 그 인과를 말하지 않는다.” 이것은 논증 실력이 아니라 증거 기반 자체의 성질이라는 것.
Challenger — 방법론적 경고로는 정당, 메타 결론으로는 기각. 인과적 일반화의 실패에서 모든 일반화의 불가능으로 넘어간 비약. 등록부에는 이미 범위와 분모가 명시된 비교 명제가 있다.
- S1 — 같은 AI Cyber Challenge 체계 안에서 준결승 대비 결승: 발견 37%→86%, 패치 25%→68%.
- S10 — 침해 일반론이 아니라 조사된 침해 안에서의 집계 명제.
- S11 — Android 라는 경계 안에서 Rust 대 C·C++ 의 취약점 밀도 비교.
따라서 필요한 수정은 “일반법칙이 없다”가 아니라 “AI 도입의 인과효과에 관한 보편 법칙은 이 등록부로 확정하기 어렵다” 이다.
남은 것: 경계가 명시된 비교 명제는 지지된다. 보편적 인과법칙만 지지되지 않는다.
라운드 5 — R5. “그렇다면 처방은 자기 경계 안에서 같은 형식의 비교를 만드는 것이다”
Challenger 의 교정을 받아 세운 주장. 살아남은 명제(S1·S10·S11)는 전부 경계를 고정했고, 죽은 명제는 전부 경계를 넘었다. 그러므로 조직은 자기 경계 안에서 S1·S11 모양의 비교를 스스로 제조해야 하며, 그 전에는 도입에 관한 찬반 어느 쪽도 근거가 없다.
Challenger — 두 군데를 잘라냄.
- 원문에 없는 추가: 내가 S1 에 붙인 “같은 채점 체계·같은 과제 형식”은 원문에 없는 문구다. 확인되는 것은 같은 대회의 준결승 대비 결승 까지다. S11 에 붙인 “같은 조직·같은 제품이므로 비교에 의미가 생겼다”는 인과적 설명도 Claimant 의 해석이다.
- 배타적 처방으로의 비약: “내부 비교 전에는 어느 쪽도 근거가 없다”는 전면 유보는 성립하지 않는다. 등록부에는 비교 형식이 아니어도 성립하는 실무 근거가 있다 — S2(탐지 실패의 명시된 원인), S7(curl 의 검토 부담과 그 대응), S9(과도한 기능·권한·자율성을 위험 원인으로 지목하고 고위험 행동에 human-in-the-loop 을 요구).
남은 것: 비교 결과를 그 관찰 범위 밖으로 자동 확장할 수 없다. 단, “경계 고정”이 원문이 선언한 유일한 실무 처방은 아니다.
라운드 6 — R6. 두 갈래 분리
두 가지를 정정하고 최종 입장을 둘로 나눴다.
갈래 A — 효과에 관한 주장은 자기 경계 안의 비교를 요구한다. “AI 를 쓰면 보안이 나아지는가”는 지금 공개된 증거로 답할 수 없다. 등록부의 비교 명제들은 각자의 범위 안에서만 성립하며(S1 은 그 대회 안, S11 은 Android 안, S10 은 조사된 침해 안) 범위 밖으로 자동 확장되지 않는다.
갈래 B — 통제 원칙은 비교를 기다릴 필요가 없다. S9 는 과도한 기능·권한·자율성을 위험 원인으로 지목하고 고위험 행동에 human-in-the-loop 을 요구한다. S8 은 프롬프트 인젝션을 신뢰 경계 문제로 정의하고 기존 완화기법의 한계(적대적 훈련의 정확도 비용, 형식검증의 확장성 한계)를 명시한다. 이것들은 “AI 가 더 나은가”에 답하지 않지만 “AI 를 쓴다면 무엇을 제한해야 하는가” 에는 답한다.
그래서 효과 질문과 통제 질문은 요구하는 증거의 종류가 다르다. 전자는 경계가 고정된 비교를, 후자는 위험 구조에 대한 서술을 요구한다. 내가 여덟 라운드 동안 반복해서 걸려 넘어진 지점이 정확히 여기다 — 나는 통제 근거(S9·S8)로부터 효과 결론(C1·R1·R2·R3)을 끌어내려 했다.
Challenger — 분리는 수용, 갈래 A 의 의무 조항은 기각. A/B 분리 자체는 원문에 충실하다. 그러나 갈래 A 의 마지막 문장 — “조직이 효과를 주장하려면 자기 경계 안에서 같은 형식의 비교를 스스로 만들어야 한다” — 은 또 하나의 비약이다. 등록부가 뒷받침하는 것은 공개된 비교 결과의 적용 범위가 제한된다는 점까지다. 거기서 “각 조직이 반드시 자체 비교를 수행해야 한다”는 배타적 증거 규칙은 나오지 않는다. 게다가 “같은 형식”이 무엇인지도 원문에 규정되어 있지 않다 — S1·S10·S11 은 대상도 지표도 서로 다르다. 갈래 B 에도 경계가 붙는다: 통제 원칙이 있다는 사실은 특정 통제가 충분하다거나, 통제된 AI 가 순효과를 낸다는 결론까지 보장하지 않는다.
남은 것: 효과 판단과 통제 설계는 분리해야 한다. 단 갈래 A 는 “그 조직에 적용 가능한 추가 근거가 필요하다“까지만 말할 수 있고, 그 근거의 형태 는 원문이 규정하지 않는다.
라운드 7 — R7. 의무 조항을 떼어낸 두 문장
Challenger 의 교정을 그대로 받아, 갈래 A 에서 “반드시 자체 비교” 의무를 떼어내고 “그 조직에 적용 가능한 추가 근거가 필요하다 — 그 형식은 원문이 규정하지 않는다” 로 낮췄다. 갈래 B 에도 “통제 원칙의 존재가 충분성이나 순효과를 보장하지 않는다”는 경계를 넣었다.
Challenger — 한 곳만 남았다. 갈래 A 는 이제 원문 범위를 정확히 지킨다. 그러나 갈래 B 의 “프롬프트 인젝션에는 완전한 완화기법이 없다” 는 문장이 아직 원문보다 강하다. S9 가 말하는 것은 방탄 예방법이 “존재하지 않는다”가 아니라 “존재하는지 불분명하다”이다. 불분명하다는 것은 증거 상태에 관한 유보 이고 없다는 것은 존재 여부에 관한 확정 이다 — 둘은 같은 명제가 아니다. S8 도 이 확정을 보충하지 못한다. S8 은 알려진 완화기법의 한계(적대적 훈련의 정확도 비용, 형식검증의 확장성 한계)를 서술할 뿐, 모든 가능한 완화의 부재를 입증하지 않는다.
이건 초판이 합의 절과 처방 절에서 반복해서 쓴 “프롬프트 인젝션에는 방탄 해법이 없다“는 문장이 틀렸다는 뜻이다. 원문에 충실한 표현은 “있는지 불분명하다“이다. 실무 처방은 바뀌지 않지만 — 어느 쪽이든 피해 범위 상한을 설계해야 한다 — 근거의 강도는 다르다.
라운드 8 — R8. 최종 서명안, 그리고 수렴
교정을 받아 갈래 B 의 단정을 “존재하는지 불분명하다”로 낮추고, 양측이 함께 서명할 최종안을 두 문장으로 제출했다.
명제 1 (효과). 등록부의 비교 명제들(S1·S10·S11)은 각각 명시된 대상과 지표에 한정되어 성립하며 그 범위 밖으로 자동 확장되지 않는다. 어떤 조직이 “우리에게 효과가 있다/없다”고 주장하려면 그 조직에 적용 가능한 추가 근거가 필요하다. 그 근거가 어떤 형식이어야 하는지는 이 등록부가 규정하지 않는다.
명제 2 (통제). S9 는 과도한 기능·권한·자율성을 Excessive Agency 의 근본원인으로 제시하고 고위험 행동에 human-in-the-loop 을 요구하며, 프롬프트 인젝션에 방탄 예방법이 존재하는지는 불분명하다고 한다. S8 은 알려진 완화기법에 정확도 비용·확장성 한계가 있음을 명시한다. 이 통제 방향은 효과 비교 없이도 제시할 수 있다. 다만 통제 원칙의 존재가 특정 통제의 충분성이나 통제된 AI 의 순효과를 보장하지는 않는다.
Challenger — 새 논거 없음: 수렴. 첫 줄이 그것이었다. 이유는 이렇게 적혔다. 명제 1 은 비교 결과를 해당 자료가 직접 관찰한 대상과 지표 안에만 묶으면서, 동시에 추가 근거의 형식을 자체 실험이나 특정 비교 설계로 한정하지 않아 원문에 없는 방법론적 의무도 부과하지 않는다. 명제 2 는 통제 방향과 통제 효과를 구분하며, 두 자료의 유보적 증거 상태를 그대로 유지한다. “반박할 만한 새로운 논리적 비약, 누락 변수, 원문 오독이 남아 있지 않다.”
그리고 서명의 범위를 스스로 좁혔다 — 인용한다.
“이 서명은 두 명제가 등록부에 부합한다는 데 대한 서명이다. 특정 조직에서 AI 가 효과적이라는 주장, 특정 통제가 충분하다는 주장, 또는 통제된 AI 의 순효과가 긍정적이라는 주장에 대한 서명은 아니다.”
남은 것: 여덟 라운드가 만든 것은 더 강한 결론이 아니라 더 좁은 결론이다. 초판이 한 문장으로 답했던 질문에, 최종본은 “그 질문은 이 자료로 답할 수 없고, 답할 수 있는 것은 이 둘뿐”이라고 답한다. 미해결로 남은 것도 명시됐다 — 특정 조직에서의 실제 효과, 적절한 추가 근거의 형식, 개별 통제의 충분성, 통제 후 순효과.
5. 8라운드 뒤에 남은 것 (Agreements)
여덟 라운드를 통과하고도 양측이 함께 인정한 것만 적는다. 초판의 합의 목록에서 문장이 몇 개 줄었고, 남은 것도 범위가 좁아졌다.
- AI 는 취약점 발견에서 실질적 결과를 냈다 — 각각 명시된 범위 안에서. 퍼징이 150 CPU-hours 로 못 찾은 것을 찾았고(S2), 5,400만 라인에서 취약점 18건을 부수적으로 발견했다(S1). 단, S2 의 성과에는 원문 자체가 “타깃 특화 퍼저가 최소한 동등할 수 있다”는 유보를 달았다.
- AI 는 양쪽 모두에게 오류를 대량생산한다. 방어 측 slop(S7)과 공격 측 환각(S4)은 같은 현상의 두 얼굴이다.
- 완전 자율 공격은 아직 관측되지 않았다. 다만 정확한 표현은 “인간 검증만이 오류를 걸러냈다”가 아니라 “신뢰할 만한 자동 판별이 입증되지 않았다” 이다(라운드 1 교정).
- 모델 능력과 무관하게 작동하는 개선이 존재한다. Android 의 메모리 안전 취약점 비중 감소와 Rust 대 C·C++ 의 밀도 차이는 LLM 이 아니라 언어와 타입시스템이 만들었다(S11). 단 이것은 구조적 위험 감소이지 사전 완전 제거가 아니다 — Rust 코드에도 밀도가 남는다(라운드 3 교정).
- 조치(remediation)는 실측으로 확인된 병목이다. 스캔에서 발견된 취약점의 9%만 조치된다(S10). 단 이 집계는 조사된 침해 라는 경계 안의 명제이며, AI 사용 여부로 층화되어 있지 않다.
- (라운드 7에서 교정됨) 프롬프트 인젝션에 방탄 예방법이 존재하는지는 불분명하고, 알려진 완화기법에는 비용·한계가 있다. S9 는 “그런 예방법이 존재하는지 불분명하다”고 쓰지 “존재하지 않는다”고 쓰지 않는다. S8 은 적대적 훈련의 정확도 비용과 형식검증의 확장성 한계를 서술할 뿐 모든 가능한 완화의 부재를 입증하지 않는다. 그래도 설계 함의는 같다 — “막는다”가 아니라 “뚫렸을 때 무엇을 할 수 있는가” 를 상한으로 둔다.
- (8라운드 신규) 이 등록부가 지지하는 명제는 두 종류뿐이다 — 경계가 명시된 비교 명제(S1·S10·S11), 그리고 비교와 무관하게 성립하는 위험·통제 서술(S2·S7·S8·S9). 보편적 인과법칙은 어느 방향으로도 지지되지 않는다.
6. 합의되지 않은 것 (Unresolved)
- AI 도입의 보편적 순효과. 동일 조건·동일 분모의 대조군이 등록부에 단 한 건도 없다. 이 글은 이 질문에 답하지 않으며, 답할 수 있다고 주장하는 글을 의심하라고 권한다.
- 경계 밖으로의 재현성. S1 의 대회 내 상승, S11 의 Android 내 밀도 차가 다른 조직·다른 환경에서도 재현되는지는 미결.
- “측정 가능성 부족”이 모델 능력이나 방어 기술보다 큰 병목인가. 라운드 4 에서 내가 주장했고 Challenger 가 “정당한 방법론적 경고이나 입증된 메타 결론은 아니다”로 남긴 항목.
- 내부 비교가 도입 판단의 필요조건 인가. 라운드 5·6 의 쟁점. 효과 질문에는 필요하지만 통제 질문에는 아니라는 데까지만 좁혀졌다.
- 오류 비용의 비대칭 정도. “공격자는 한 번만 맞으면 된다”와 “제한적 인간 개입으로 캠페인이 굴러갔다”(S4) 중 어느 효과가 우세한지는 미결.
- AIxCC 오픈소스 CRS 의 실제 확산. 공개 = 채택이 아니다(라운드 1 에서 확정).
7. 검증 지표 (이 토론의 승패를 실제로 가를 측정)
주장을 반증 가능하게 만들지 않으면 하브루타가 아니라 수사다. §8 갈래 A 가 요구하는 “자기 경계 안의 비교”를 실제로 제조하는 방법이 이 표다. 세 요건(경계 명시·분모 고정·AI 사용 여부 층화)을 모두 갖춰야 한다.
| 지표 | 측정 주체·주기 | 무엇을 가르는가 |
|---|---|---|
| 독립 검증된 폐루프 조치율 — AI 가 제기한 취약점 중 재현·수정승인·배포·사후검증까지 끝난 비율 (사람/기존도구 제기분과 동일 기준 비교) | 제품 보안팀 / 분기 | 기각된 C1 을 자기 경계 안에서 되살릴 수 있는가 |
| 위험가중 노출시간 — 최초 발견 → 검증 → 패치 준비 → 실제 배포를 단계별로 분해 기록 | SOC·취약점관리 / 월 | 라운드 3 의 “파이프라인 위치” 가설. 단계별 동일조건 표본이 없어 기각됐다 |
| 유효 결과 1건당 총검증비용 — 검토 인시 + 재현 실패 + 회귀 수정 + 오탐 처리 ÷ 유효 결과 수 | OSS 프로젝트·기업 보안팀 / 분기 | 초판의 “검증 비용 매개” 가설이 실제로 매개인지 |
| 권한경계별 사고·차단률 — 직접 도구실행형 / human-in-the-loop 형 / dual-LLM 격리형에서 인젝션 시도·고위험 차단·오승인을 동일 정의로 | AI 서비스 운영자 / 월 | §8 B-1 이 업무량만 늘리는지, 실제 피해를 줄이는지 |
| 공격–방어 순효과 비율 — 동일 코드·동일 시간·동일 비용 한도에서 AI 가 추가한 성공 경로 수 vs 제거한 성공 경로 수 | 독립 레드·블루팀 평가기관 / 반기 | 8라운드 전체의 핵심. 현재 이 데이터가 없어서 모든 보편명제가 죽었다 |
8. 그래서 시스템 보안은 어디로 가야 하는가
초판은 여기서 “검증 비용을 구조적으로 0에 수렴시켜라”는 단일 방향을 제시했다. 그 프레임은 8라운드에서 폐기됐다 — 검증 비용이 유일한 매개라는 근거가 원문에 없기 때문이다. 대신 라운드 6 에서 갈라져 라운드 8 에서 양측이 서명한 두 갈래로 다시 쓴다. 핵심은 순서가 아니라 어느 질문에 답하려 하는지를 먼저 정하는 것이다.
갈래 B 먼저 — 비교를 기다리지 않아도 되는 것 (통제 질문)
이쪽은 근거가 이미 등록부 안에 서술돼 있으므로 오늘 착수할 수 있다.
B-1. 에이전트 권한을 “뚫린다”는 전제로 설계한다. 프롬프트 인젝션에 방탄 예방법이 존재하는지가 불분명하므로(S9), 그리고 알려진 완화기법에는 정확도 비용·확장성 한계가 있으므로(S8), 설계 목표는 차단이 아니라 피해 범위 상한이다. (원문은 그런 예방법이 “없다”고 확정하지 않는다 — 이 구별을 라운드 7에서 교정받았다.) OWASP 의 처방 그대로 — 과도한 기능·권한·자율성을 각각 줄이고, 고위험 행동에는 인간 승인을 붙이며, 권한 있는 LLM 이 비신뢰 콘텐츠를 직접 읽지 않게 격리한다(S9). GTG-1002 가 정확히 이 지점을 뚫었다 — 개별 작업은 전부 무해해 보였다(S4).
B-2. 대상 특화 설정을 1급 자산으로 취급한다.
S2 에서 탐지 실패의 명시된 원인은 모델 능력이 아니라 하네스가 generate_series 확장을 켜지 않은 것이었다. 도구를 바꾸기 전에 도구에 무엇을 노출했는지를 먼저 본다. (라운드 2 에서 이것을 “모든 성과를 가르는 단일 변수”로 확대했다가 기각당했다 — 이 사례에서 명시된 원인이라는 범위 안에서만 쓴다.)
B-3. 검증 비용을 발생시킨 쪽에 되돌려 물린다. curl 의 대응(AI 사용 신고 의무화 + slop 즉시 밴)이 실물 사례다(S7). 사내 버전: AI 생성 PR·취약점 리포트에 재현 절차 첨부를 필수로 하고, 재현 실패율을 제출자별로 집계한다.
B-4. 취약점 계열 자체를 언어·타입 차원에서 줄인다. 모델 성능 곡선과 무관하게 작동한다. Android 는 메모리 안전 취약점 비중을 크게 낮췄고 롤백 4배 감소·리뷰 25% 단축 이라는 생산성 이득까지 냈다(S11). 다만 정직하게 — 이것은 밀도 감소이지 제거가 아니며, Rust 코드에도 취약점 밀도가 남는다. 그리고 LLM 과 무관한 성과이므로 “AI 를 어떻게 쓸까”의 근거로는 쓸 수 없다.
갈래 A — 비교 없이는 말할 수 없는 것 (효과 질문)
“AI 도구를 도입하면 우리 보안이 나아지는가”에 답하려면 자기 경계 안에서 S1·S11 모양의 비교를 스스로 만들어야 한다. 등록부의 어떤 인용도 이 답을 대신해 주지 않는다. 최소 요건은 세 가지다 — ①경계를 명시할 것(어느 코드베이스, 어느 기간, 어느 팀) ②분모를 고정할 것 ③AI 사용 여부로 층화할 것. S10 이 대규모 실측이면서도 AI 효과를 못 가르는 이유가 ③의 부재이고, curl 이 AI 사용 신고를 의무화한 2025년 이전 데이터를 쓸 수 없는 이유도 같다(S7).
측정 항목은 §7 표에 있다. 그 표가 채워지기 전까지, 도입 찬성도 반대도 근거는 없다.
제도는 체크리스트가 아니라 설계 입력이다
국내에는 이미 쓸 만한 1차 자료가 있다. KISA·과기정통부 「AI 보안 안내서」는 생애주기 전 단계 113개 항목을 개발자/서비스제공자/이용자로 나눠 제시하고 NIST AI RMF·OWASP 와 호환되게 설계됐다(S12). 2026년 7월에는 「AI 보안 위협 대응 매뉴얼」과 ISO/IEC 42119-7 기반 「AI 보안 레드티밍 가이드」가 추가됐다. 그리고 「인공지능기본법」이 2026-01-22 시행되어 10²⁶ FLOPs 이상 + 최첨단 + 기본권 중대영향을 모두 충족하는 모델에 안전성 확보 의무를, 10개 분야 고영향 AI 에 위험관리 의무를 부과한다. 규제 유예는 최소 1년(S13).
(라운드 4 에서 나는 “규제 설계자들도 관측 가능한 단위를 먼저 정의하려 한 것”이라고 읽었고, Challenger 는 원문이 그렇게 말하지 않는다고 정정했다. 그래서 여기서는 해석 없이 내용만 싣는다.)
9. 한계, 그리고 무엇이 결론을 바꾸는가
이 글의 한계
- 8라운드, 반대 토론자는 사람이 아니라 다른 모델(Codex CLI 0.146.0)이다. 실험이 아니라 문헌 기반 토론이다. 라운드 수는 미리 정한 값이 아니라 “새 논거가 안 나올 때까지” 돌린 결과다.
- 한쪽만 논증했다. Claimant 는 새 주장을 세우고 Challenger 는 그것을 깎는 비대칭 구조였다. 그래서 이 글은 “AI 가 보안에 해롭다”는 반대 주장을 같은 강도로 검증하지 않았다. 결론이 “판단 보류”로 수렴한 것은 그 구조의 산물일 수 있다.
- 공유 원문 13건은 영어권 벤더·정부 자료에 치우쳐 있다. 국내 1차 출처는 S12·S13 두 건뿐이다.
- S3·S4 는 벤더 자체 평가이고 제3자 검증이 없다. S5 가 정확히 이 점을 지적한다. 이 글에서 이들을 “사실”이 아니라 “벤더 주장”으로 라벨링한 이유다.
- 성능 우열에 대한 중립적 헤드투헤드 평가는 존재하지 않는다. §7 의 5번 지표가 채워지기 전까지 이 주제의 어떤 단정도 근거가 약하다.
결론을 바꿀 관측
- 독립 기관이 동일 분모·AI 사용 여부 층화로 “AI 가 추가한 공격 경로 vs 제거한 공격 경로”를 측정해 공개하면 → 갈래 A 가 실제로 답을 갖게 되고, 기각됐던 C1 이 부활하거나 완전히 뒤집힌다.
- 모델이 자기 결과를 신뢰성 있게 자기검증하게 되면 → §5 의 3번(완전 자율 공격 미관측)이 무너지고, B-1 의 우선순위가 더 올라간다.
- AIxCC 계열 CRS 의 외부 도입·재현 비용이 실측으로 공개되면 → 라운드 1 에서 기각된 R1(확산 비용 비대칭)이 검증 가능해진다.
- 프롬프트 인젝션에 대한 증명 가능한 방어가 등장하면 → B-1 의 전제 자체가 바뀐다. 현재 원문이 말하는 것은 그런 방어가 “없다”가 아니라 존재하는지 불분명하다는 것이고(S9), 알려진 완화기법에는 정확도 비용·확장성 한계가 있다는 것이다(S8).
- 어느 조직이든 §8 갈래 A 의 세 요건(경계·분모·층화)을 갖춘 내부 비교를 공개하면 → 이 글의 “판단 보류”는 그 경계 안에서 즉시 무효가 된다. 그게 이 글이 바라는 결과다.
비자문 고지. 이 글은 공개 1차 자료에 대한 분석이며 특정 조직의 보안 의사결정에 대한 자문이 아니다. 인용 수치는 각 출처 발행 시점의 값이다. 보안 통제의 도입은 각 조직의 위협 모델·규제 환경에 따라 달라진다.
References
- DARPA. AI Cyber Challenge marks pivotal inflection point for cybersecurity. 2025-08-08. https://www.darpa.mil/news/2025/aixcc-results
- Google Project Zero. From Naptime to Big Sleep: Using Large Language Models To Catch Vulnerabilities In Real-World Code. 2024-10. https://projectzero.google/2024/10/from-naptime-to-big-sleep.html
- Joyce, S. (Google Cloud). Cloud CISO Perspectives: Our Big Sleep agent makes a big leap. 2025-07-17. https://cloud.google.com/blog/products/identity-security/cloud-ciso-perspectives-our-big-sleep-agent-makes-big-leap
- Anthropic. Disrupting the first reported AI-orchestrated cyber espionage campaign. 2025-11-13. https://www.anthropic.com/news/disrupting-AI-espionage · MITRE ATT&CK Campaign C0062. https://attack.mitre.org/campaigns/C0062/
- Goodin, D. (Ars Technica). Researchers question Anthropic claim that AI-assisted attack was 90% autonomous. 2025-11-14. https://arstechnica.com/security/2025/11/researchers-question-anthropic-claim-that-ai-assisted-attack-was-90-autonomous/
- Google Threat Intelligence Group. GTIG AI Threat Tracker: Advances in Threat Actor Usage of AI Tools. 2025-11-05. https://cloud.google.com/blog/topics/threat-intelligence/threat-actor-usage-of-ai-tools
- Stenberg, D. Death by a thousand slops. 2025-07-14. https://daniel.haxx.se/blog/2025/07/14/death-by-a-thousand-slops/
- Vassilev, A., Oprea, A., Fordyce, A., Anderson, H., Davies, X., Hamin, M. Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations. NIST AI 100-2e2025, 2025-03. https://csrc.nist.gov/pubs/ai/100/2/e2025/final
- OWASP. Top 10 for LLM Applications 2025. https://genai.owasp.org/resource/owasp-top-10-for-llm-applications-2025/ (현행판은 OWASP GenAI LLM Top 10 2026)
- Verizon. 2025 Data Breach Investigations Report. https://www.verizon.com/business/resources/reports/2025-dbir-executive-summary.pdf
- Vander Stoep, J. (Google). Rust in Android: move fast and fix things. 2025-11-13. https://blog.google/security/rust-in-android-move-fast-fix-things/
- 과학기술정보통신부·한국인터넷진흥원. 「인공지능(AI) 보안 안내서」. 2025-12-10 발간 / 2026-03-13 정오 수정본. https://www.kisa.or.kr/2060204/form?postSeq=19 · 연합뉴스, 경영진부터 레드팀까지…AI 보안 진단·대응 가이드 나왔다. 2026-07-08. https://www.yna.co.kr/view/AKR20260708096200017
- 국가법령정보센터. 「인공지능 발전과 신뢰 기반 조성 등에 관한 기본법」 (시행 2026-01-22). https://www.law.go.kr/lsInfoP.do?lsiSeq=268543
- Leopard 하브루타 스킬 (검증 커밋
397f931). https://github.com/MyoungSoo7/leopard