패스잇
AI / 데이터 · 심화

실제 서비스에 강화 학습(Reinforcement Learning) 에이전트를 적용할 때, 탐험(exploration)과 활용(exploitation)의 균형을 효과적으로 조절하기 위한 고급 전략에는 어떤 것들이 있으며, 특히 오프라인 RL(Offline RL) 기법이 이러한 문제 해결에 어떻게 기여할 수 있는지 설명해 주십시오.

힌트 · Epsilon-greedy, UCB, Thompson Sampling 등의 전략과 함께, 오프라인 RL은 기존 데이터를 활용하여 안전하게 정책을 학습하여 탐험 위험을 줄일 수 있습니다.

ε-greedyUCBThompson SamplingBehavior CloningConservative Policy Optimization

모범답안

실제 서비스에 강화 학습 에이전트를 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 단순히 ε-greedy처럼 확률적으로 탐험하는 것 외에, UCB(Upper Confidence Bound)나 Thompson Sampling 같은 베이지안 기반 전략을 활용하여 불확실성이 높은 행동에 더 많은 탐험 기회를 부여하는 고급 기법들이 있습니다.

특히 오프라인 RL은 이러한 탐험 위험을 크게 줄여줍니다. 기존에 수집된 데이터를 활용하여 정책을 학습하기 때문에, 실제 환경에서 위험한 탐험을 수행할 필요가 없습니다. Behavior Cloning과 같이 기존 행동을 모방하는 것부터 시작하여, Conservative Policy Optimization 기법을 통해 학습된 정책이 기존 데이터 분포에서 벗어나지 않도록 제약함으로써 안전성을 확보할 수 있습니다. 이를 통해 실제 서비스에 적용 시 발생할 수 있는 예기치 못한 부정적 영향을 최소화하면서 효과적인 정책 학습이 가능합니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 AI / 머신러닝 면접 질문

← AI / 머신러닝 면접 질문 전체 보기