AI / 데이터 · 심화
실제 서비스에 강화 학습(Reinforcement Learning) 에이전트를 적용할 때, 탐험(exploration)과 활용(exploitation)의 균형을 효과적으로 조절하기 위한 고급 전략에는 어떤 것들이 있으며, 특히 오프라인 RL(Offline RL) 기법이 이러한 문제 해결에 어떻게 기여할 수 있는지 설명해 주십시오.
힌트 · Epsilon-greedy, UCB, Thompson Sampling 등의 전략과 함께, 오프라인 RL은 기존 데이터를 활용하여 안전하게 정책을 학습하여 탐험 위험을 줄일 수 있습니다.
ε-greedyUCBThompson SamplingBehavior CloningConservative Policy Optimization
모범답안
실제 서비스에 강화 학습 에이전트를 적용할 때 탐험과 활용의 균형은 매우 중요합니다. 단순히 ε-greedy처럼 확률적으로 탐험하는 것 외에, UCB(Upper Confidence Bound)나 Thompson Sampling 같은 베이지안 기반 전략을 활용하여 불확실성이 높은 행동에 더 많은 탐험 기회를 부여하는 고급 기법들이 있습니다.
특히 오프라인 RL은 이러한 탐험 위험을 크게 줄여줍니다. 기존에 수집된 데이터를 활용하여 정책을 학습하기 때문에, 실제 환경에서 위험한 탐험을 수행할 필요가 없습니다. Behavior Cloning과 같이 기존 행동을 모방하는 것부터 시작하여, Conservative Policy Optimization 기법을 통해 학습된 정책이 기존 데이터 분포에서 벗어나지 않도록 제약함으로써 안전성을 확보할 수 있습니다. 이를 통해 실제 서비스에 적용 시 발생할 수 있는 예기치 못한 부정적 영향을 최소화하면서 효과적인 정책 학습이 가능합니다.
읽었다면, 이제 직접 답해볼 차례예요
패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.
함께 보는 AI / 머신러닝 면접 질문
- 경사 하강법(Gradient Descent)의 기본적인 원리를 설명하고, SGD(Stochastic Gradient Descent), Adam, RMSprop과 같은 다양한 최적화(Optimizer) 알고리즘들이 어떻게 경사 하강법을 개선하는지 각각의 특징과 장단점을 비교하여 설명해 주세요.
- 분류(Classification) 모델의 성능을 평가할 때 사용되는 지표인 Precision, Recall, F1-score, 그리고 ROC-AUC의 개념을 각각 설명하고, 특정 상황(예: 암 진단, 스팸 메일 분류)에서 어떤 지표가 더 중요하게 고려될 수 있는지 구체적인 예시를 들어 설명해 주세요.
- 대규모 언어 모델(LLM)을 프로덕션 환경에 배포할 때, 서비스 지연 시간(latency)을 최소화하고 처리량(throughput)을 극대화하기 위한 아키텍처 설계 전략과 최적화 기법에 대해 설명하고, 특히 KV Cache, quantization, distillation의 적용 방안을 구체적인 예시와 함께 제시해 주십시오.
- 프로덕션 환경에서 운영 중인 머신러닝 모델의 성능이 점진적으로 저하될 때, 데이터 드리프트(Data Drift)와 모델 드리프트(Model Drift)를 효과적으로 감지하고 진단하기 위한 모니터링 시스템 설계 방안과, 이에 대한 자동화된 대응 전략에 대해 설명해 주십시오.
- GAN(Generative Adversarial Network) 또는 Diffusion Model과 같은 생성 모델 학습 시 발생하는 모드 붕괴(Mode Collapse) 현상이 무엇인지 설명하고, 이를 완화하거나 해결하기 위한 고급 기법들(예: WGAN, VAE, Conditioning, Loss Function 개선 등)을 비교 분석하여 설명해 주십시오.
- 의료 진단이나 금융 신용 평가와 같이 높은 투명성과 신뢰성이 요구되는 도메인에서, 블랙박스 AI 모델의 의사결정을 설명하기 위한 XAI(Explainable AI) 기법들을 비교하고, 특히 LIME, SHAP, 그리고 인과관계(Causal Inference) 기반 설명 기법의 장단점 및 실제 적용 시 고려사항을 논해 주십시오.