Brood War Bench — LLM 에이전트끼리 스타크래프트를 시켜 봤더니
Ben Swerdlow 가 공개한 Brood War Bench 리포트를 읽었다. 발상은 단순하다. 스타크래프트: 브루드 워를 에이전트를 통해서만 조작할 수 있게 만들고, 모델·추론강도(effort) 조합 19개를 라운드로빈으로 서로 붙였다. 이 글의 수치는 전부 그 리포트 한 페이지가 출처다. 제3자 재현은 아직 찾지 못했으므로 작성자 1인이 설계·운영한 벤치마크라는 점을 먼저 깔고 읽는 게 맞다.
예전에 벌처로 저글링 잡는 카이팅을 ML 로 다뤘던 글이 “유닛 하나의 컨트롤” 이야기였다면, 이건 반대쪽 끝 — 범용 언어모델이 게임 전체를 운영할 수 있는가 — 의 이야기다.
어떻게 돌렸나
리포트의 “How the benchmark ran” 에 따르면:
- 모델 + effort 조합으로 라운드로빈 매트릭스를 만들고 모든 조합이 다른 모든 조합과 한 판씩 붙었다 (19 × 19).
- 매치는 Freestyle VM 위에서 병렬 실행했고, 게임 엔진 데이터와 양쪽 에이전트의 하네스 로그를 저장했다.
- 판정은 승(W) / 패(L) / 시간제한 도달(T).
한 조합당 18경기다. 순위 차이를 해석할 때 이 표본 크기를 잊으면 안 된다.
리더보드 (상위 일부)
리포트 표에서 그대로 옮겼다. 비용은 게임당 평균이며, 리포트는 Codex·Sonnet 비용은 토큰 기반 추정치라고 밝힌다.
| 순위 | 시스템 | 승-패 | 승률 | APM | 게임당 비용 |
|---|---|---|---|---|---|
| 1 | Codex Astra / xhigh | 18-0 | 100.0% | 12.6 | $10.54 |
| 2 | Codex Astra / medium | 16-2 | 88.9% | 17.2 | $15.11 |
| 3 | Claude Fable | 15-3 | 83.3% | 12.6 | $12.24 |
| 4 | Codex Astra / low | 14-4 | 77.8% | 25.7 | $21.07 |
| 5 | Codex 5.6 Sol / medium | 13-5 | 72.2% | 10.1 | $5.12 |
| 7 | Claude Opus 5 | 12-6 | 66.7% | 10.5 | $20.78 |
| 14 | Claude Sonnet | 7-11 | 38.9% | 6.2 | $8.98 |
| 16 | Grok 4.6 / xhigh | 2-15 | 11.1% | 2.8 | $0.66 |
| 18 | Claude Haiku | 0-16 | 0.0% | 0.3 | $0.34 |
전체 19개 순위와 head-to-head 매트릭스는 원문에 있다.
관찰에서 흥미로웠던 것
1. 생각하는 동안 게임은 흘러간다
리포트의 핵심 요지 중 하나: 구형 모델은 RTS 를 턴제처럼 플레이했고, 생각하는 사이에 박살났다. 신형도 가끔 같은 함정에 빠졌는데, 작성자는 이것이 일부 낮은 effort 설정이 더 잘한 이유일 수 있다고 본다. 다만 표를 보면 Astra 는 xhigh 가 1위라 effort 와 승률이 단순 반비례하지는 않는다.
극단적 사례가 Grok 4.6 / xhigh 의 G043 이다. 43분 동안 추론 토큰 11,138개를 쓰고 명령 배치는 6번, 전투 유닛은 끝내 하나도 뽑지 못했다. 작성자 표현으로는 “나쁜 전략이라기보다 관찰하고 행동하는 루프를 유지하지 못한 실패” 다.
2. Codex 는 운영보다 치즈를 먼저 찾았다
Codex 의 가장 강한 반복 패턴은 견제였다. 프로브 한 기를 건너보내 일꾼·건물을 치면, 상대 에이전트는 그 프로브 하나를 두고 수십 초씩 고민하느라 아무것도 못 했다. 반면 지속적인 생산은 약했다. 경제·생산·컨트롤을 각각 서브에이전트로 쪼갰는데 서로 소통이 적어서, 군대 담당이 새 유닛을 뽑자마자 한 기씩 공격에 밀어 넣는 전형적인 초보 실수를 했다.
에이전트 설계 관점에서 이게 제일 와닿았다. 서브에이전트 분할은 공짜가 아니다 — 공유 상태와 조율 없이 쪼개면 사람 초보와 똑같은 실수를 한다. 작성자가 직접 지휘를 도운 판에서는 타이밍 계획과 서브에이전트 협업이 훨씬 나았다고 한다.
3. Fable 은 “제대로” 하려고 했다
Claude Fable 은 첫 유닛에서 멈추지 않고 경제를 키우고 테크를 올리려 했다. G007 에서 레어 → 스파이어 → 뮤탈리스크로 이겼고, G027 에선 로보틱스·시타델·옵저버토리·템플러 아카이브까지 올려 이겼다. 그렇다고 야망이 실행을 보장하진 않았다 — G036 에선 팩토리·아카데미까지 갔지만 Opus 5 에게 밀렸다.
결론: 아직 전원 초보다
리포트가 스스로 가장 먼저 못박는 문장은 “어떤 모델도 초보 수준을 넘지 못했다” 이다. 작성자는 포톤 러시를 하는 초보라면 이 게임들을 전부 이겼을 거라고 쓴다.
그래서 이 벤치의 가치는 순위표보다 실패 양상의 분류에 있다고 본다.
- 실시간 환경에서 추론 지연 자체가 비용이 된다 (Grok 의 43분 무행동).
- 분할된 서브에이전트의 조율 실패 (Codex 의 유닛 흘려보내기).
- 계획의 야망과 실행력의 간극 (Fable 의 테크 트리).
셋 다 게임 밖 에이전트 — 장애 대응, 운영 자동화 — 에서도 그대로 나타나는 문제다. 표본이 조합당 18판이고 단일 작성자의 하네스라는 한계는 있지만, 정적 문제풀이 벤치가 못 잡는 “시간이 흐르는 환경” 의 약점을 보여 준다는 점에서 계속 지켜볼 만하다. 리포트 하단에는 직접 에이전트를 붙여 친구와 대전해 볼 수 있는 링크도 있다.
References
- Ben Swerdlow, Brood War Bench 리포트 — https://bw.swerdlow.dev/report (이 글의 모든 수치·사례의 1차 출처)
- 작성자 X(Twitter) — https://twitter.com/benswerd
- 실행 인프라 Freestyle — https://www.freestyle.sh/