AI / 데이터 · 심화
강화 학습 에이전트를 실제 서비스에 적용할 때, 초기 단계에서의 탐험(Exploration)과 이후 단계에서의 활용(Exploitation) 균형을 어떻게 효과적으로 조절할 수 있을까요? 특히, 고차원 상태 공간과 희소한 보상(sparse rewards) 환경에서 탐험 전략을 개선하기 위한 고급 기법들과 그 적용 시 유의사항을 설명해주세요.
힌트 · Epsilon-greedy 변형 (annealing), UCB (Upper Confidence Bound), 엔트로피 보너스, Curiosity-driven exploration, Intrinsic Motivation 등의 기법을 다루세요.
ε-greedyUCBThompson SamplingIntrinsic MotivationCuriosity-driven Exploration
모범답안
강화 학습 에이전트를 실제 서비스에 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 초기에는 충분한 탐험을 통해 다양한 경험을 쌓아야 하지만, 어느 정도 학습이 진행된 후에는 최적의 정책을 활용하여 성능을 극대화해야 합니다.
고차원 상태 공간과 희소한 보상 환경에서는 단순히 ε-greedy 방식을 사용하는 것만으로는 효과적인 탐험이 어렵습니다. 따라서 다음과 같은 고급 기법들을 고려할 수 있습니다.
- ε-greedy 변형 (Annealing): 시간이 지남에 따라 ε 값을 점진적으로 감소시켜 초기에는 탐험을 장려하고, 후반에는 활용에 집중하도록 합니다.
- UCB (Upper Confidence Bound): 각 행동의 가치에 대한 불확실성을 고려하여, 아직 충분히 탐색되지 않은 행동을 우선적으로 선택합니다.
- Intrinsic Motivation (Curiosity-driven Exploration): 외부 보상이 희소한 경우, 에이전트 스스로 새로운 경험을 추구하도록 내재적 보상을 부여합니다. 예를 들어, 예측 오류가 큰 상태를 방문하는 것에 대한 보상을 줄 수 있습니다.
이러한 기법들을 적용할 때에는 다음과 같은 점에 유의해야 합니다.
- 하이퍼파라미터 튜닝: 각 기법들은 다양한 하이퍼파라미터를 가지고 있으며, 환경에 따라 최적의 값을 찾아야 합니다.
- 안전성: 실제 서비스에 적용하기 전에 충분한 시뮬레이션을 통해 안전성을 확보해야 합니다. 특히, 탐험 과정에서 예상치 못한 위험한 상황이 발생할 수 있으므로, 이에 대한 대비가 필요합니다.
- 성능 모니터링: 지속적인 성능 모니터링을 통해 에이전트가 올바르게 학습하고 있는지 확인하고, 필요에 따라 정책을 수정해야 합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 데이터 사이언스 면접 질문
- 실제 데이터에서 결측치(Missing Data)가 발생하는 원인과 이를 처리하기 위한 다양한 전략(예: 제거, 대체)을 설명하고, 각 전략의 장단점 및 데이터 특성에 따른 적절한 처리 방법을 논의해 보세요.
- 서비스 개선을 위해 A/B 테스트를 설계했습니다. 하지만 테스트 결과가 예상과 달리 명확한 인과 관계를 보여주지 못하고 혼란 변수(confounding variables)의 영향이 의심되는 상황입니다. 이러한 상황에서 A/B 테스트의 한계를 극복하고 신뢰할 수 있는 인과 관계를 추론하기 위한 고급 통계적 또는 머신러닝 기반 접근 방식은 무엇이 있으며, 각 방법의 가정과 적용 시 고려사항을 설명해주세요.
- 프로덕션 환경에 배포된 머신러닝 모델이 시간이 지남에 따라 성능이 저하되는 현상(Model Drift)을 경험하고 있습니다. 데이터 드리프트와 컨셉트 드리프트의 차이점을 설명하고, 각 유형의 드리프트를 효과적으로 감지하고 자동으로 대응하기 위한 모니터링 시스템 설계 방안과 구체적인 지표들을 제시해주세요.
- 복수의 시계열 데이터가 존재하고, 이들 간의 인과 관계를 파악하여 특정 시계열에 대한 외부 개입(intervention)의 효과를 측정하고자 합니다. 예를 들어, 특정 마케팅 캠페인이 제품 판매량 시계열에 미친 영향을 분석해야 할 때, 단순 상관 분석을 넘어선 인과적 효과를 추정하기 위한 고급 시계열 분석 기법과 그 한계를 설명해주세요.
- 대규모 복합 시스템에서 발생하는 비정상적인 로그 패턴이나 센서 데이터를 실시간으로 탐지해야 합니다. 정상 데이터는 풍부하지만 비정상 데이터는 매우 희귀하고 그 유형도 다양하여 레이블링이 어렵습니다. 이러한 환경에서 효과적인 비지도(Unsupervised) 또는 준지도(Semi-supervised) 기반의 이상 탐지 시스템을 설계하고 구축하기 위한 접근 방식과 최신 기술들을 설명해주세요.
- 금융 대출 심사 모델이 특정 소수 그룹에 대해 편향된 결과를 도출하고 있음을 발견했습니다. 이러한 편향이 발생할 수 있는 원인들을 설명하고, 모델 개발 파이프라인의 각 단계(데이터 수집, 전처리, 모델 학습, 평가)에서 편향을 감지하고 효과적으로 완화하기 위한 기술적 전략들을 구체적인 지표와 함께 제시해주세요.