
ETL / ELT / ETLT 패턴
ETL vs ELT vs ETLT, batch vs micro-batch vs streaming, 멱등성, 에러 처리, dead letter queue, 데이터 품질, lineage
1ETL과 ELT의 주요 차이점은 무엇입니까?
ETL과 ELT의 주요 차이점은 무엇입니까?
답변
ETL(Extract-Transform-Load)에서는 데이터가 대상에 로드되기 전에 중간 서버에서 변환됩니다. ELT(Extract-Load-Transform)에서는 원시 데이터가 먼저 대상(일반적으로 클라우드 데이터 웨어하우스)에 로드된 후 컴퓨팅 파워를 사용하여 그 안에서 직접 변환됩니다. ELT는 탄력적인 컴퓨팅 파워를 제공하는 BigQuery, Snowflake 또는 Redshift와 같은 클라우드 데이터 웨어하우스와 함께 인기를 얻었습니다.
2전통적인 ETL과 비교했을 때 ELT 접근 방식의 주요 이점은 무엇입니까?
전통적인 ETL과 비교했을 때 ELT 접근 방식의 주요 이점은 무엇입니까?
답변
ELT 접근 방식은 최신 클라우드 데이터 웨어하우스(BigQuery, Snowflake, Redshift)의 탄력적인 컴퓨팅 파워를 활용합니다. 병목 현상이 될 수 있는 별도의 변환 인프라를 유지하는 대신, 변환은 데이터 웨어하우스의 스케일링 기능을 직접 사용합니다. 이는 운영 복잡성을 줄이고 수동 리소스 프로비저닝 없이 훨씬 더 많은 데이터 볼륨을 처리할 수 있게 합니다.
3ETLT 패턴이란 무엇이며 언제 관련이 있습니까?
ETLT 패턴이란 무엇이며 언제 관련이 있습니까?
답변
ETLT는 두 가지 접근 방식을 결합합니다: 추출 중에 첫 번째 가벼운 변환(정제, 필터링, 익명화)이 수행된 다음, 데이터가 로드되고 데이터 웨어하우스에서 더 복잡한 변환이 적용됩니다. 이 패턴은 컴플라이언스 이유(로드 전 민감한 데이터 마스킹), 볼륨 감소(조기 필터링) 또는 이기종 소스 형식 정규화를 위해 특정 변환을 업스트림에서 수행해야 할 때 유용합니다.
데이터 파이프라인의 맥락에서 멱등성이란 무엇입니까?
테이블에 데이터를 로드할 때 멱등성을 어떻게 구현합니까?
+17 면접 질문