패스잇
AI / 데이터 · 심화

강화 학습 에이전트를 실제 서비스에 적용할 때, 초기 단계에서의 탐험(Exploration)과 이후 단계에서의 활용(Exploitation) 균형을 어떻게 효과적으로 조절할 수 있을까요? 특히, 고차원 상태 공간과 희소한 보상(sparse rewards) 환경에서 탐험 전략을 개선하기 위한 고급 기법들과 그 적용 시 유의사항을 설명해주세요.

힌트 · Epsilon-greedy 변형 (annealing), UCB (Upper Confidence Bound), 엔트로피 보너스, Curiosity-driven exploration, Intrinsic Motivation 등의 기법을 다루세요.

ε-greedyUCBThompson SamplingIntrinsic MotivationCuriosity-driven Exploration

모범답안

강화 학습 에이전트를 실제 서비스에 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 초기에는 충분한 탐험을 통해 다양한 경험을 쌓아야 하지만, 어느 정도 학습이 진행된 후에는 최적의 정책을 활용하여 성능을 극대화해야 합니다.

고차원 상태 공간과 희소한 보상 환경에서는 단순히 ε-greedy 방식을 사용하는 것만으로는 효과적인 탐험이 어렵습니다. 따라서 다음과 같은 고급 기법들을 고려할 수 있습니다.

  • ε-greedy 변형 (Annealing): 시간이 지남에 따라 ε 값을 점진적으로 감소시켜 초기에는 탐험을 장려하고, 후반에는 활용에 집중하도록 합니다.
  • UCB (Upper Confidence Bound): 각 행동의 가치에 대한 불확실성을 고려하여, 아직 충분히 탐색되지 않은 행동을 우선적으로 선택합니다.
  • Intrinsic Motivation (Curiosity-driven Exploration): 외부 보상이 희소한 경우, 에이전트 스스로 새로운 경험을 추구하도록 내재적 보상을 부여합니다. 예를 들어, 예측 오류가 큰 상태를 방문하는 것에 대한 보상을 줄 수 있습니다.

이러한 기법들을 적용할 때에는 다음과 같은 점에 유의해야 합니다.

  • 하이퍼파라미터 튜닝: 각 기법들은 다양한 하이퍼파라미터를 가지고 있으며, 환경에 따라 최적의 값을 찾아야 합니다.
  • 안전성: 실제 서비스에 적용하기 전에 충분한 시뮬레이션을 통해 안전성을 확보해야 합니다. 특히, 탐험 과정에서 예상치 못한 위험한 상황이 발생할 수 있으므로, 이에 대한 대비가 필요합니다.
  • 성능 모니터링: 지속적인 성능 모니터링을 통해 에이전트가 올바르게 학습하고 있는지 확인하고, 필요에 따라 정책을 수정해야 합니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 데이터 사이언스 면접 질문

← 데이터 사이언스 면접 질문 전체 보기