패스잇
인프라 & 클라우드 · 심화

클라우드 기반의 대규모 데이터 레이크하우스(Data Lakehouse) 아키텍처를 구축하고 운영할 때 발생할 수 있는 주요 도전 과제(예: 데이터 거버넌스, 스키마 진화, 성능 최적화, 비용 관리)와 이를 해결하기 위한 구체적인 전략에 대해 설명해 주십시오.

힌트 · Delta Lake, Apache Iceberg, Apache Hudi와 같은 오픈 소스 포맷의 역할, 메타데이터 관리, 컴퓨팅-스토리지 분리, 데이터 티어링 전략을 포함합니다.

데이터 거버넌스스키마 레지스트리파티셔닝비용 최적화쿼리 최적화

모범답안

클라우드 기반 대규모 데이터 레이크하우스를 구축하고 운영할 때 여러 도전 과제가 있습니다.

데이터 거버넌스 측면에서는 데이터 품질, 보안, 접근 제어를 확보해야 합니다. 이를 위해 데이터 카탈로그를 구축하고, 데이터 리니지를 추적하며, 데이터 마스킹 및 암호화를 적용합니다.

스키마 진화는 데이터 변경에 따라 발생하는데, 스키마 레지스트리를 사용하여 스키마 변경 이력을 관리하고, Delta Lake, Iceberg, Hudi와 같은 포맷을 활용하여 스키마 진화를 지원합니다.

성능 최적화를 위해서는 적절한 파티셔닝 전략을 수립하고, 컴퓨팅-스토리지 분리 아키텍처를 활용하여 필요에 따라 컴퓨팅 자원을 확장합니다. 또한, 쿼리 최적화를 위해 데이터 통계 정보를 활용하고, 자주 사용되는 데이터는 캐싱합니다.

비용 관리는 클라우드 환경에서 중요한 문제입니다. 데이터 티어링 전략을 통해 자주 사용되는 데이터는 고성능 스토리지를 사용하고, 오래된 데이터는 저렴한 스토리지를 사용하는 방식으로 비용을 절감할 수 있습니다. 또한, 사용하지 않는 컴퓨팅 자원은 자동으로 종료하도록 설정합니다.

읽었다면, 이제 직접 답해볼 차례예요

패스잇 앱에서 이 질문에 말로 답하면 AI가 꼬리질문까지 이어가며 1:1 코칭합니다.

함께 보는 AWS / 클라우드 면접 질문

← AWS / 클라우드 면접 질문 전체 보기