AI기반 턴제 게임에서 대규모 멀티 에이전트 협력을 통한 집단지능 확인
개요
1대1 턴제 게임 Lux-AI에서 우리는 대규모 agent를 제어하기 위해 중앙집중식 협력 전략을 구현하였다. 이 접근법을 통해, 이러한 agent들이 한정된 자원을 두고 경쟁하고, 도시 발전을 추구하며, 도전에 맞서는 과정에서 복잡한 거시적(macro-level) 전술이 발생(emergence)하는 것을 관찰하였다. 이 중앙집중식 협력 전략의 구현에는 분산 강화학습(distributed Reinforcement Learning) 알고리즘과 Pixel-to-Pixel 모델링을 활용하였다. 학습 과정에서 AI의 행동 진화는 주로 다음 단계에 걸쳐 진행되었다.
| 기본 기술의 습득
AI는 자원을 수집하고, 자원 노드 근처에 도시를 건설하며, 도시 간에 에너지를 전송하고, 연구 점수(research point)를 향상시켜 더 높은 등급의 자원에 접근하는 법을 학습하였다.

| 지속 가능한 공존의 발전
AI는 자원 관리를 최적화하고 도시 확장과 자원 배분 사이의 균형을 맞추도록 진화하였다. 야간 자원 부족으로 인해 대규모 도시 붕괴를 초래하곤 했던 빠르지만 지속 불가능한 도시 성장 대신, AI는 적대적인 AI 간에 상호 불가침과 지속 가능한 발전이라는 상태를 달성하였다.

| 공격적 전략의 발생
AI는 자원을 효율적으로 독점하고 상대의 생존 공간을 제약하기 위해 게임 메커니즘(예: 맵의 대칭적 배치)을 이용하기 시작하였다. 초반(early-game) 전술로는 상대의 수집을 막기 위해 핵심 자원 근처에 방어적으로 배치하는 한편, 부대를 파견하여 상대 도시의 연결성을 교란하는 것이 포함되었다.

| 복잡한 거시적 전략
AI는 점차 더 정교한 협력 방안을 발견하였고, 이는 예상치 못한 거시 전략으로 이어졌다. 예를 들어, 그림에서 보이는 것처럼, 파란색 AI는 자신의 유닛들을 오목(Gomoku)과 유사한 대각선 진형으로 배치하는 법을 학습하였다. 이는 최소한의 유닛으로 공간적 통제를 극대화하는 매우 효율적인 패턴이다.

거시 전략과 미시 전략이 서로 얽혀야 하는 Lux-AI 환경에서, 우리는 Pixel-to-Pixel 모델링, 분산 강화학습 프레임워크, 그리고 커리큘럼 학습(curriculum learning)을 결합하면 명시적인 협력 메커니즘 없이도 정교한 팀 전략이 발생할 수 있음을 발견하였다. 이 접근법은 대규모 agent들 사이의 자발적 협력과 거시적 전략의 발생을 촉진한다. 더 나아가, 우리의 솔루션은 현재의 SOTA 접근법(Kaggle의 Lux-AI 대회 우승 모델)을 90%의 승률로 능가한다.
자세한 내용은 다음을 참조하라: [학술 논문] [오픈소스 코드] [LUX 환경]
환경 소개
Lux-AI는 두 팀이 AI를 사용하여 유닛과 도시를 제어하는 1대1 턴제 실시간 전략 게임이다. 유닛은 자원을 수집하여 도시를 건설하고, 도시와 유닛 모두 밤을 견디기 위해 자원을 필요로 한다. 최종 목표는 게임이 끝날 때까지 가능한 한 많은 도시를 유지하는 것이다. 각 팀은 잠식해 오는 어둠과 맞서 싸우는 동시에 자원 수집과 도시 발전의 균형을 맞추어야 한다. 낮 동안에는 다가오는 밤에 대비하기 위해 적극적으로 자원을 수집하는 한편, 도시를 확장해야 한다. 그러나 AI는 또한 신중하게 계획을 세워야 한다. 과도한 확장은 자원 고갈의 위험을 초래하여, 밤이 오면 도시가 붕괴하게 만든다.
대규모 Multi-Agent 환경
Lux-AI 환경의 핵심 과제는 개체 수가 동적으로 변하는 대규모 agent(최대 1,000개)를 제어하는 데 있다. agent의 수는 유닛이 도시를 건설하고 도시가 새로운 유닛을 생성하는 순환을 통해 증가하며, 동시에 에너지 부족으로 인해 급격히 감소할 수도 있다. 이러한 설정은 강화학습에서의 몇 가지 도전적인 연구 문제를 제기한다.
| agent 협력: agent 간의 협력은 게임과 강화학습 모두에서 중요한 문제이다. 현재의 솔루션들은 수작업으로 설계한 기여도 할당(credit assignment) 전략에 의존하는 경우가 많지만, 그 복잡도는 agent의 수에 따라 지수적으로 증가한다.
| 폭발적인 joint action space : agent의 수가 증가함에 따라, joint action space는 지수적으로 확장된다.
| 희소 보상(sparse rewards) : 희소 보상 문제는 학습 중 탐험(exploration)을 매우 어렵게 만든다.
RTS 게임의 추상화
Lux-AI는 StarCraft II와 같은 전통적인 실시간 전략(Real-Time Strategy, RTS) 게임의 단순화된 버전으로 볼 수 있으나, 한 가지 핵심적인 차이가 있다. 그것은 인간 플레이어가 아니라 AI agent 제어를 위해 설계되었다는 점이다.
한편으로, RTS 게임은 일반적으로 승리를 달성하기 위해 플레이어가 미시적(micro-level) 행동(예: 채집, 건설, 전투)을 수행할 것을 요구한다. 그러나 진정한 과제는 언제, 어디서, 어떻게 이러한 행동을 수행하는가, 즉 본질적으로 플레이어의 거시적 계획 능력에 있다. 이러한 의미에서 Lux-AI는 간소화된 RTS 환경의 역할을 한다.
다른 한편으로, Lux-AI와 전통적 RTS게임의 핵심적인 차이점은 전통적인 RTS 게임이 계층적 실행 프레임워크를 사용한다는 것에 있다. 즉, 인간 플레이어가 유닛 그룹에 고수준의 명령을 내리면, 유닛들은 내장된 게임 로직에 기반하여 하위 작업을 자율적으로 수행한다. 이와 대조적으로, Lux-AI는 이러한 계층적 구조와 저수준 실행 로직을 갖추고 있지 않아, 인간 플레이어에게는 비현실적이지만 AI 연구에는 이상적이다.
방법론
우리는 self-play 학습 전략과 PPO 알고리즘[3]을 사용하며, 이점 함수(advantage function) 추정을 위해 GAE(Generalized Advantage Estimator) [4]를 결합한다. 이 알고리즘은 우리의 분산 강화학습 프레임워크를 기반으로 구현되며, ResNet [5]과 유사한 '심층 합성곱 신경망'(deep convolutional network)을 통해 전역 정보 공유와 협력을 가능하게 하는 Pixel-to-Pixel 정책 신경망(policy network) [1,2]을 사용한다. 입력부는 맵 크기의 이미지 특징(image features)으로 구성되며, 출력부는 각 픽셀에 대한 행동(action)을 나타낸다. 희소 보상과 탐험의 과제를 해결하기 위해, 우리는 3단계 커리큘럼 학습 방안을 설계하였다.
Pixel-to-Pixel 모델링 방안
Pixel-to-Pixel 모델링 방안에서, 우리는 대규모 agent를 조율하기 위해 중앙집중식 학습(centralized training) 접근법을 사용한다. 구체적으로, 모델은 다이어그램에 묘사된 바와 같이 전체 맵의 이미지를 입력으로 받아 각 픽셀에 대한 행동을 출력한다. 입력 이미지는 (C × H × W) 차원을 가지며, 여기서 C는 플레이어 팀, 상대 팀, 그리고 전역 상태에 관한 정보를 인코딩하는 채널의 수를 나타낸다. H와 W는 맵의 높이와 너비를 나타낸다. 예를 들어, 한 채널은 자원 정보를 나타내며, 여기서 (a번째, b번째) 픽셀은 해당 위치의 목재(wood) 자원을 나타낸다. 출력 이미지의 전용 채널은 각 픽셀에 대한 행동의 확률 분포를 나타낸다. 동시에, 현재 게임 상태에 기반하여 행동 마스크(action mask)가 계산된다. 예컨대, 존재하는 유닛의 수를 고려하여 특정 픽셀에서 어떤 행동 유형의 정합성을 판정함으로써, 보다 효율적인 탐험을 촉진한다. 정책 신경망은 ResNet 합성곱 백본(backbone)을 기반으로 구축되며, 8개의 잔차 유닛(residual unit)으로 구성되고, 각 유닛은 128개 채널과 커널 크기 5를 갖는 2개의 합성곱 층을 포함한다. 총 파라미터 수는 약 2,380만 개인 반면, Toad Brigade [1]의 정책 신경망은 24개의 잔차 유닛을 사용한다. 정책 출력 외에도, 우리는 actor-critic 프레임워크에서 가치 함수(value function)를 추정하기 위해 완전 연결 신경망(fully connected network)을 포함한다.

중앙집중식 학습의 이점
현재의 multi-agent 강화학습(MARL)에서는 효율성과 확장성 덕분에 분산 모델링(distributed modeling)이 주된 접근법이다. 그러나 Lux-AI에서는 방대한 수의 유닛과 게임의 본질적으로 동적인 특성이 기여도 할당에 상당한 어려움을 야기했다. 이것이 우리가 중앙집중식 접근법을 채택한 이유이며, 이는 인간 플레이어가 RTS 게임에서 각 도시와 유닛에 명령을 내리는 방식과 유사하다. 그럼에도 불구하고, Lux-AI에서 중앙집중식 agent는 모든 유닛에 대한 행동을 동시에 결정해야 하는데, 이는 전통적인 RTS 환경보다 훨씬 더 복잡하다. 이 복잡성은 거대한 결합 행동 공간과 변동하는 유닛 수에서 비롯된다. 이러한 과제를 해결하기 위해, 우리는 Pixel-to-Pixel 아키텍처 내에서 로컬 파라미터 공유(local parameter sharing)를 위해 합성곱 층을 활용하며, 이는 학습 효율성과 행동 공간에서의 탐험을 크게 향상시킨다. 또한, 여러 합성곱 층을 쌓으면 수용 영역(receptive field)이 확장되어, 모든 픽셀 간의 효과적인 정보 공유가 가능해지고 '조정된 의사결정'(coordinated decision-making)이 촉진된다.
Pixel-to-Pixel 모델링의 이점
직관적으로, Pixel-to-Pixel 아키텍처는 중앙집중식 정책 신경망을 나타내지만, 중앙집중식 접근법과 분산식 접근법 양쪽의 이점을 모두 활용한다. 즉, 학습 효율성을 유지하면서 효과적인 협력을 가능하게 한다.
한편으로, 각 픽셀에서 유닛과 건물을 제어하기 위해 별도의 완전 연결 층을 사용하는 대신, 우리는 합성곱 파라미터 공유를 활용한다. 이 접근법은 공유 정책 신경망을 사용하여 모든 agent를 조율함으로써 분산 학습을 모사한다.
다른 한편으로, 우리는 관측(observation)을 행동으로 직접 매핑하는 단일 신경망을 구현하여, 시스템이 협력 행동을 암묵적으로 학습하도록 하고, 이로써 명시적인 기여도 할당 문제를 회피한다. 충분히 깊은 합성곱 층을 쌓음으로써, 정보는 모든 픽셀 간에 공유될 수 있으며, 각 픽셀은 상태에 대한 전역적 이해에 기반하여 정보에 입각한 결정을 내릴 수 있다.
커리큘럼 학습
커리큘럼 학습 과정은 세 단계로 나뉘며, agent의 학습을 단순한 작업에서 복잡한 작업으로 유도한다.
| 1단계: 수작업으로 설계한 '밀집 보상'(Dense Rewards)
초기에는, agent들이 자원 주변에 도시 건물을 건설하는 등의 기본 기술을 학습하도록 장려한다. 네 가지 행동과 그에 상응하는 보상은 표에 제시되어 있다.
표 1: 팀 내 유닛과 도시 건물의 네 가지 행동에 대한 보상 가중치
| 2단계: 학습 신호(Learning Signals)를 동반한 희소 보상
1단계 이후, 우리는 최종 경기 결과에만 기반하여 보상을 제공하는 등의 희소 보상 방안을 구현하여, agent들이 승리로 이어질 수 있는 예상치 못한 행동을 탐험하도록 장려하였다. 그러나 승패 결과에 기반하여 ±1 보상을 직접 할당하는 것은 효과적인 탐험을 촉진하지 못한다. 이를 해결하기 위해, 우리는 학습 신호를 다음과 같이 개선하였다.

여기서 Nself는 게임 종료 시 자신의 최종 도시 건물 수를 나타내고, Nop은 상대의 최종 도시 건물 수를 나타낸다.
| 3단계: 희소 보상(Sparse Rewards)
agent의 성능 상한을 끌어올리기 위해, 우리는 2단계의 수작업으로 설계한 학습 신호를 제거하고 승패와 관련된 희소 보상만을 구현하였다. 우리는 학습 스텝 수가 증가함에 따라 agent의 전략이 그에 맞추어 진화하는 것을 관찰하였다.
AI의 진화
agent 전략의 진화를 설명하기 위해, 우리는 앞서 언급한 네 단계 각각의 경기 영상에서 발췌한 장면을 제시한다. 이 기록들에서, 우리의 agent들은 자기 자신 또는 이전 SOTA 모델인 Toad Brigade(TB)[1]와 대결한다.
1단계: 초보 채집자(Novice Gatherers)
백지 상태에서 시작하여, 우리의 agent들은 자원 수집과 도시 건설을 빠르게 숙달하였다. 그러나 이 단계에서는 자원 활용을 효과적으로 계획하는 법을 아직 학습하지 못하였고, 도시들은 자원 부족으로 인해 생존에 어려움을 겪는 경우가 많아 경기에서 패배로 이어졌다.
| 우리 vs TB
우리의 agent(노란색 팀)는 초반에 도시를 빠르게 확장하였으나, 그 대가로 맵 절반에 있는 모든 목재 자원을 고갈시켰다. 이와 대조적으로, 상대(파란색 팀)는 보다 지속 가능하게 발전하였고, 자원을 얻기 위해 유닛을 파견하여 우리 영토를 침공하였다. 그 결과, 우리의 agent가 게임 초반에는 우세하였지만, 우리의 에너지 공급이 점차 줄어들면서 도시 확장이 제한되었다. 하지만 풍부한 에너지 비축량에 의존한 TB팀은 후반 단계에서 따라잡았다.
self-play
self-play 시나리오에서는 과도한 확장 문제가 더욱 두드러지고 격렬해졌으며, 심지어 지배적 전략으로 부상하기까지 하였다. 우리의 두 agent 모두 처음부터 공격적으로 확장하여 빠른 자원 고갈로 이어졌다. 자원 비축량이 도시 유지에 충분하지 않게 되자, 대규모 도시 군집이 사라지곤 하였다. 비록 파란색 팀이 결정적으로 승리하였지만, 이는 확률의 문제였으며, 같은 일이 그들에게도 일어날 수 있었다. 모든 탐욕은 결국 파멸로 이어진다.
32x32 맵에서는, 풍부한 자원 덕분에 연료 고갈로 인해 도시가 붕괴하지는 않았으나, agent들은 에너지 소비를 줄이기 위해 도시를 서로 연결하지 않은 채, 자원 주변에 도시를 건설하는 기본 기술만을 학습하였다.
2단계: 평화 애호가(Peace Lovers)
학습이 진행됨에 따라, 우리의 agent들은 점차 도시 건설을 최적화하고 합리적인 자원 활용을 달성하는 법을 학습하였다. 또한, agent들은 때때로 상대의 약탈로부터 자신의 자원을 보호하기 시작하였다. 이 단계에서 agent들은 여러 가지 고급 전략을 학습하였지만, 여전히 자기 발전에 집중하였으며, 아직 상대 영토를 교란하는 방법은 학습하지 못하였다.
| 우리 vs TB
| self-play
지속 가능한 발전: 우리의 agent들은 벌목을 제한하고 숲이 재생되도록 허용하여 지속 가능성을 보장하는 법을 학습하였다. 더 나아가, 37라운드에서 상대가 우리의 자원을 훔치기 위해 유닛을 보냈을 때, 인근의 일꾼(worker)들이 즉시 그들의 길을 막아, 네 라운드 동안 지속된 대치 상황으로 이어졌다. 그러나 상대는 결국 우리 영토를 침공하여 우리의 자원을 훔치는 데 성공하였다. 우리의 agent들이 자기 자신의 발전에 집중한 반면, 상대는 타인으로부터 자원을 탈취하는 등 경쟁적으로 더 나은 성과를 보였다.
불가침: 평화를 사랑하는 agent들은 self-play에서 상호 이익(win-win)의 결과를 달성하였다. 그들은 나무를 보호하고 도시를 합리적으로 확장하여 인상적인 도시화 능력을 보여주었다. 이 경기에서 그들은 거의 맵 전체에 도시를 건설하였다! 그러나 이것은 단 한 명의 승자만이 존재할 수 있는 잔혹한 제로섬 게임이다. 상대와의 상호 이익을 추구하는 것은 패배로 이어질 뿐이다. 더 공격적인 agent들과 맞닥뜨릴 때, 평화 애호가들은 승리하기 위해 싸우는 법을 학습해야 한다.
3단계: 통찰력 있는 기획자(Visionary Planners)
이 단계에서, 우리의 agent들은 정찰병을 파견하여 상대의 자원을 약탈하는 등의 공격적 전략을 보여주었다. 동시에, 그들은 적의 침공을 막기 위해 도시를 일직선으로 건설하는 등 더 나은 방어 전략도 발견하였다.
| 우리 vs TB
"만리장성"의 건설: 초기에 양측은 영토와 자원을 분할하느라 분주하였다. 우리의 agent(노란색)와 상대(파란색)는 유사한 전략을 채택하였는데, 적의 진입을 막기 위해 도시 타일을 일직선으로 배치하여 고대 중국의 "만리장성"을 연상시키는 전략을 전개했다.

자원 수집과 소비의 균형: 그러나 우리의 agent들은 자원 수집과 소비의 균형을 맞추는 데 탁월하여, 연료 부족으로 인한 갑작스러운 도시 손실을 결코 겪지 않았다.
기회 포착: 상대가 실수를 저지르자, 우리의 agent는 신속하게 그 기회를 포착하였다. 71라운드에서 파란색 팀의 도시들이 무너진 후, 우리의 agent들은 여러 정찰병을 파란색 팀 영토 깊숙이 보내 상대의 자원을 탈취하였으며, 157라운드와 170라운드에서와 같이 우리의 최종 승리에 기여하였다.

자원 축적: 비록 양 팀의 도시 수가 초기에는 근소한 차이만 있었으나, 우리 팀은 연료 면에서 상당한 우위를 유지하였다. 이는 후반 단계에서 빠른 도시 성장과 궁극적인 승리로 이어졌다.
자원 경쟁: 연료가 풍부함에도 불구하고, 우리의 유닛들은 상대의 수집을 막기 위해 계속해서 자원을 두고 경쟁하였다.
| self-play
이 경기에서 우리는 양 팀에서 앞서 언급한 모든 전략을 관찰하였다. 두 agent가 거의 동일한 전략을 사용하였기 때문에, 어느 쪽이 더 나은지 판단하기 어려웠다. 그러나 노란색 팀이 더 공격적인 모습을 보여, 47라운드부터 파란색 팀의 맵을 침공하여 그 결과 더 많은 자원을 획득하였다. 결국 파란색 팀은 자기 진영의 절반에 갇힌 반면, 노란색 팀은 파란색 팀 영토에 도시를 건설할 수 있었다. 이 단계에서 게임은 더욱 체스와 유사해져, 전역적 전략과 국소적 의사결정이 똑같이 중요해졌다.
4단계: 현명한 의사결정자(Wise Decision-Makers)
궁극적으로, 우리의 agent들은 예상치 못한 능력을 보여주었다. 관찰된 전략은 예상보다 더 복잡하고 다양하였다. 일부 전략은 인간 플레이어조차 이해하거나 설명하기 어려울 정도였다. 마지막 절에서는 우리의 agent들이 사용한 전략을 자세히 기술할 것이다.
| 우리 vs TB
| self-play
거시 전략 분석
우리의 agent들이 계속 학습하고 발전함에 따라, 그들의 행동 이면에 있는 추론은 설명하기가 더 어려워졌다. 그러나 플레이어의 관점에서 게임플레이를 분석함으로써, 우리는 몇 가지 뛰어난 전략을 식별하였다. 더 나아가, agent들의 경기 이력을 비교했을 때, 이러한 전략은 명확한 반복적 진화를 보여주었다.
| 유닛과 도시 건물의 배치
학습 초기 단계에서, 도시의 위치는 무작위적이고 계획되지 않았다. 도시들은 자원 근처에 건설되었으나 서로 연결되어 있지 않아, 연료를 공유할 수 없었다. 이 단계에서 agent들은 일반적으로 상대의 공성에 아무런 대응을 보이지 않았다.
이후, agent들은 점차 도시를 행(row), 열(column), 또는 심지어 블록(block) 형태로 건설하는 법을 학습하였다. 이러한 도시 건설 군집은 이전 단계에 비해 더 높은 생존율을 보였다. 도시를 연결함으로써, 그들은 연료를 절약하고 자원 노드를 둘러싸 상대의 교란을 막을 수 있었다.
흥미로운 세부 사항이 나타났다: agent들은 도시와 맵 경계 사이에 1~2행의 공간을 남겨두고, 그곳에 일꾼들을 배치하였다. 이를 통해 agent들은 이동에 사용할 수 있는 더 많은 유닛을 확보하여, 공격, 방어, 그리고 다양한 기동을 더 빠르게 수행할 수 있었다.
결국, agent들은 서로 다른 상황에 따라 서로 다른 도시 배치를 사용하는 법을 학습하였다. 공격 시, 특히 초반 단계에서, agent들은 가장 적은 건물로 맵의 가장 넓은 영역을 점유하기 위해 도시를 대각선을 따라 건설하는 경향을 보였다.
또한, agent들은 여러 일꾼을 활용하여 상대의 이동을 제한하는 데 능숙해졌다. 한 인상적인 경기에서, 우리의 agent들은 일단 우위를 점하자 십여 명의 일꾼으로 상대의 도시를 포위하고, 다른 일꾼들을 사용하여 이 일꾼들을 살려두기 위한 연료를 전달하였다. 이는 상대의 도시 발전을 완전히 봉쇄하였다. 이것은 믿을 수 없을 만큼 유연하고 치밀한 전략이었다.
| 점유, 채집, 그리고 나무 보존
학습 초기 단계에서, 우리의 agent들은 나무가 재생 가능한 자원이라는 것을 인식하지 못하였다. 그들은 단순히 나무를 전형적인 자원으로 취급하여 최대한 빠르게 채집하였다. 이후, '희소 보상'의 유도 하에 이 행동은 변화하였다. 세 가지 구체적인 세부 사항이 우리에게 두드러졌다.
첫째, agent들은 나무를 보존할 필요성을 인식하게 되었다. 그들은 나무 주변에 도시로 원을 둘러쌓아, 나무가 안전하게 자라고 상대의 공격으로부터 보호받을 수 있도록 하였다.
둘째, agent들은 상대가 쉽게 접근할 수 있는 맵 중앙의 나무를 통제하는 것을 우선시하였다. 효과적인 통제가 불가능할 경우, agent들은 상대의 발전을 제한하기 위해 신속히 그것을 채집하였다.
마지막으로, 게임이 종반에 가까워지자, agent들은 남아 있는 모든 나무 자원을 수집하고 그 지역에 도시를 건설하여 점수를 극대화하였다.
| 정밀한 연료 계산
2단계(평화 애호가)에서의 놀라운 발견은, 우리의 agent들이 경기 종료 시 남은 연료가 수백 단위, 심지어 수십 단위에 불과할 정도로 매우 적었다는 점이다. 이는 agent들이 건설, 점유, 운송을 비롯한 여러 작업을 위해 자신이 가용한 거의 모든 자원을 완전히 활용하였음을 의미한다. 동시에, 모든 일꾼과 도시의 생존을 보장하기 위해, agent들은 탐욕이나 계산 착오로 인해 여분의 유닛이나 도시 건물을 추가로 건설하는 것을 자제하였다. 이 과정은 매우 어려운데, 모든 항목이 소비하는 자원을 실시간으로 계산하고 그것들의 잠재적 행동을 추정하는 것을 포함하기 때문이다. 어느 정도, 인간 플레이어는 라운드 사이의 한정된 시간 내에 이처럼 복잡하고 정확한 계산을 수행하기 어려울 것이다.
3단계와 4단계의 평가에서는, 학습이 계속됨에 따라 위의 특성들이 덜 두드러지게 되었다. 나는 이 현상에 대한 정확한 설명을 가지고 있지 않다. 그럼에도 불구하고, 나는 agent들이 재생 가능한 나무 자원을 활용하는 능력과 보다 자신감 있는 공격 행동이 이러한 변화에 크게 기여했다고 믿는다. 그것들이 자원 부족의 딜레마를 완화하는 데 도움을 주었기 때문이다.
더 나아가, 평가 과정에서, 우리는 보다 합리적인 신경망 구조를 설계하고 활용하는 것에 더하여, 커리큘럼 학습의 각 단계에서의 추가적인 연산 자원과 더 긴 학습 시간이 우리가 TB에 대해 가졌던 또 다른 이점일 수 있음을 깨달았다.
주목할 만한 현상은, 주로 첫 번째 학습 단계에서 학습한 TB의 agent들과 비교했을 때, 우리의 agent들이 초반 단계에서 더 큰 도시 군집을 건설하는 경향을 보였다는 점이다.
| 처음에 우리는 이 전략의 해로운 영향만을 관찰할 수 있었다. 즉, 그것은 게임 초반에 재생 가능한 나무를 포함한 인근 자원을 고갈시키고, 획득한 자원 대부분을 도시 건설에 사용한다는 것이다. 게임이 후반부에 접어들면서, 맵의 자원은 소비되거나 상대에게 통제되었고, 한편 이미 건설된 도시들은 생존을 유지하기 위해 상당한 연료를 필요로 하였다. 그 결과, 우리의 도시 구조물들은 종종 어둠 속에서 대규모로 사라지곤 하였다.
| 그러나 다양한 학습 단계를 완료한 후, 우리는 놀랍게도 다음과 같은 사실을 발견하였다. 우리의 agent들이 전체 게임 시간과 맵 공간에 대한 더 나은 이해와 계획을 갖추게 됨에 따라, 원래 실수라고 생각했던 초반의 대규모 도시 건설 행동이 실제로는 우리 agent들에게 이점이 되었다는 점이다.
| 구체적으로, 초반의 더 많은 도시 구조물은 우리의 agent들이 배치 가능한 유닛과 가용한 연구 점수를 더 많이 보유함을 의미하였다. 추가적인 유닛은 agent들이 맵 전역에 걸쳐 더 많은 자원, 특히 석탄(coal)과 우라늄(uranium)과 같은 고가치 자원은 물론 더 많은 맵 영토를 통제할 수 있게 하여, 후반의 도시 확장에 충분한 공간을 제공하였다. 더 많은 연구 점수는 agent들이 석탄과 우라늄 같은 고급 자원을 수집하고 활용하는 능력을 더 일찍 획득할 수 있도록 보장하여, 그것들을 수집하도록 배정된 유닛의 생존을 보장하였다. 초반의 더 많은 도시 타일이 제공하는 자원과 공간에 대한 통제는 우리 agent들의 강력한 성능에 결정적인 요인이었다.
실제로, 우리의 agent들과 TB의 agent들 모두 '집중적인 보상'에 의해 유도되는 학습 단계를 거쳤다. 그럼에도 불구하고, 위의 분석은 추가적인 학습 자원에 대한 우리의 투자가 궁극적으로 우월한 도시 건설 성능으로 전환되었음을 시사한다. 많은 세부 사항들이 '보다 철저한 학습이 agent 능력에 미치는 긍정적 영향'을 보여주었다. 게임에서, 우리의 agent들과 TB의 agent들이 유사한 전략을 가졌을 수 있지만, 우리의 agent들이 생존을 유지하면서도 더 공격적이고, 세부 사항을 더 잘 처리하며, 궁극적으로 게임에서 승리한다는 점은 명백하다.
참고문헌
[1] Solution of Toad Brigade, No.1 of Lux AI Competition - Season 1.
[2] Grid-Wise Control for Multi-Agent Reinforcement Learning in Video Game AI. ICML 2019. Lei Han, Peng Sun, Yali Du, Jiechao Xiong, Qing Wang, Xinghai Sun, Han Liu, Tong Zhang.
[3] Proximal Policy Optimization Algorithms. John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, Oleg Klimov.
[4] High-Dimensional Continuous Control Using Generalized Advantage Estimation. ICLR 2016. John Schulman, Philipp Moritz, Sergey Levine, Michael I. Jordan, and Pieter Abbeel.
[5] Deep Residual Learning for Image Recognition. CVPR 2015. Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun.