패스잇
AI / 데이터 · 기초

강화 학습(Reinforcement Learning)의 기본적인 개념과 주요 구성 요소(에이전트, 환경, 보상)에 대해 설명해주세요.

힌트 · 에이전트가 환경과 상호작용하며 보상을 최대화하는 방향으로 학습하는 방식입니다.

에이전트환경보상정책가치 함수

모범답안

강화 학습은 에이전트가 환경과 상호작용하면서 보상을 최대화하는 방향으로 학습하는 머신러닝 방법입니다.

강화 학습의 주요 구성 요소는 다음과 같습니다.

  • 에이전트(Agent): 환경을 인지하고 행동을 수행하는 주체입니다. 예를 들어, 게임을 하는 AI 플레이어라고 생각할 수 있습니다.

  • 환경(Environment): 에이전트가 상호작용하는 대상입니다. 에이전트에게 상태를 제공하고, 에이전트의 행동에 따라 다음 상태와 보상을 결정합니다.

  • 보상(Reward): 에이전트의 행동에 대한 피드백입니다. 긍정적인 보상은 행동을 강화하고, 부정적인 보상은 행동을 억제합니다. 에이전트는 누적 보상을 최대화하는 방향으로 학습합니다.

에이전트는 환경으로부터 상태를 관찰하고, 그 상태에 기반하여 행동을 선택합니다. 그리고 환경은 에이전트의 행동에 따라 다음 상태와 보상을 에이전트에게 제공합니다. 이러한 상호작용을 통해 에이전트는 최적의 정책(어떤 상태에서 어떤 행동을 해야 하는지)을 학습하게 됩니다. 가치 함수는 특정 상태 또는 행동이 얼마나 좋은지를 나타내는 지표로, 정책을 평가하고 개선하는 데 사용됩니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 AI / 머신러닝 면접 질문

← AI / 머신러닝 면접 질문 전체 보기