Ben Swerdlow 가 공개한 Brood War Bench 리포트를 읽었다. 발상은 단순하다. 스타크래프트: 브루드 워를 에이전트를 통해서만 조작할 수 있게 만들고, 모델·추론강도(effort) 조합 19개를 라운드로빈으로 서로 붙였다. 이 글의 수치는 전부 그 리포트 한 페이지가 출처다. 제3자 재현은 아직 찾지 못했으므로 작성자 1인이 설계·운영한 벤치마크라는 점을 먼저 깔고 읽는 게 맞다.

예전에 벌처로 저글링 잡는 카이팅을 ML 로 다뤘던 글이 “유닛 하나의 컨트롤” 이야기였다면, 이건 반대쪽 끝 — 범용 언어모델이 게임 전체를 운영할 수 있는가 — 의 이야기다.

어떻게 돌렸나

리포트의 “How the benchmark ran” 에 따르면:

  • 모델 + effort 조합으로 라운드로빈 매트릭스를 만들고 모든 조합이 다른 모든 조합과 한 판씩 붙었다 (19 × 19).
  • 매치는 Freestyle VM 위에서 병렬 실행했고, 게임 엔진 데이터와 양쪽 에이전트의 하네스 로그를 저장했다.
  • 판정은 승(W) / 패(L) / 시간제한 도달(T).

한 조합당 18경기다. 순위 차이를 해석할 때 이 표본 크기를 잊으면 안 된다.

리더보드 (상위 일부)

리포트 표에서 그대로 옮겼다. 비용은 게임당 평균이며, 리포트는 Codex·Sonnet 비용은 토큰 기반 추정치라고 밝힌다.

순위 시스템 승-패 승률 APM 게임당 비용
1 Codex Astra / xhigh 18-0 100.0% 12.6 $10.54
2 Codex Astra / medium 16-2 88.9% 17.2 $15.11
3 Claude Fable 15-3 83.3% 12.6 $12.24
4 Codex Astra / low 14-4 77.8% 25.7 $21.07
5 Codex 5.6 Sol / medium 13-5 72.2% 10.1 $5.12
7 Claude Opus 5 12-6 66.7% 10.5 $20.78
14 Claude Sonnet 7-11 38.9% 6.2 $8.98
16 Grok 4.6 / xhigh 2-15 11.1% 2.8 $0.66
18 Claude Haiku 0-16 0.0% 0.3 $0.34

전체 19개 순위와 head-to-head 매트릭스는 원문에 있다.

관찰에서 흥미로웠던 것

1. 생각하는 동안 게임은 흘러간다

리포트의 핵심 요지 중 하나: 구형 모델은 RTS 를 턴제처럼 플레이했고, 생각하는 사이에 박살났다. 신형도 가끔 같은 함정에 빠졌는데, 작성자는 이것이 일부 낮은 effort 설정이 더 잘한 이유일 수 있다고 본다. 다만 표를 보면 Astra 는 xhigh 가 1위라 effort 와 승률이 단순 반비례하지는 않는다.

극단적 사례가 Grok 4.6 / xhigh 의 G043 이다. 43분 동안 추론 토큰 11,138개를 쓰고 명령 배치는 6번, 전투 유닛은 끝내 하나도 뽑지 못했다. 작성자 표현으로는 “나쁜 전략이라기보다 관찰하고 행동하는 루프를 유지하지 못한 실패” 다.

2. Codex 는 운영보다 치즈를 먼저 찾았다

Codex 의 가장 강한 반복 패턴은 견제였다. 프로브 한 기를 건너보내 일꾼·건물을 치면, 상대 에이전트는 그 프로브 하나를 두고 수십 초씩 고민하느라 아무것도 못 했다. 반면 지속적인 생산은 약했다. 경제·생산·컨트롤을 각각 서브에이전트로 쪼갰는데 서로 소통이 적어서, 군대 담당이 새 유닛을 뽑자마자 한 기씩 공격에 밀어 넣는 전형적인 초보 실수를 했다.

에이전트 설계 관점에서 이게 제일 와닿았다. 서브에이전트 분할은 공짜가 아니다 — 공유 상태와 조율 없이 쪼개면 사람 초보와 똑같은 실수를 한다. 작성자가 직접 지휘를 도운 판에서는 타이밍 계획과 서브에이전트 협업이 훨씬 나았다고 한다.

3. Fable 은 “제대로” 하려고 했다

Claude Fable 은 첫 유닛에서 멈추지 않고 경제를 키우고 테크를 올리려 했다. G007 에서 레어 → 스파이어 → 뮤탈리스크로 이겼고, G027 에선 로보틱스·시타델·옵저버토리·템플러 아카이브까지 올려 이겼다. 그렇다고 야망이 실행을 보장하진 않았다 — G036 에선 팩토리·아카데미까지 갔지만 Opus 5 에게 밀렸다.

결론: 아직 전원 초보다

리포트가 스스로 가장 먼저 못박는 문장은 “어떤 모델도 초보 수준을 넘지 못했다” 이다. 작성자는 포톤 러시를 하는 초보라면 이 게임들을 전부 이겼을 거라고 쓴다.

그래서 이 벤치의 가치는 순위표보다 실패 양상의 분류에 있다고 본다.

  • 실시간 환경에서 추론 지연 자체가 비용이 된다 (Grok 의 43분 무행동).
  • 분할된 서브에이전트의 조율 실패 (Codex 의 유닛 흘려보내기).
  • 계획의 야망과 실행력의 간극 (Fable 의 테크 트리).

셋 다 게임 밖 에이전트 — 장애 대응, 운영 자동화 — 에서도 그대로 나타나는 문제다. 표본이 조합당 18판이고 단일 작성자의 하네스라는 한계는 있지만, 정적 문제풀이 벤치가 못 잡는 “시간이 흐르는 환경” 의 약점을 보여 준다는 점에서 계속 지켜볼 만하다. 리포트 하단에는 직접 에이전트를 붙여 친구와 대전해 볼 수 있는 링크도 있다.

References