데이터 파이프라인 표준
확장 가능하고 신뢰할 수 있는 데이터 흐름
버전 1.0.0 | 데이터 카테고리
데이터는 현대 사회의 원유입니다.
하지만 원유만으로는 아무것도 할 수 없습니다.
정제하고, 변환하고, 전달해야 합니다.
데이터 파이프라인은 바로 그 정제소입니다.
WIA-DATA-004는 현대 데이터 인프라의 핵심인 데이터 파이프라인을 표준화합니다. 데이터를 수집(Extract)하고, 변환(Transform)하며, 적재(Load)하는 전체 과정을 체계적으로 정의합니다.
다양한 소스에서 데이터를 수집합니다. API, 데이터베이스, 파일, 스트림 등
데이터를 정제하고, 정규화하고, 보강하고, 집계합니다
변환된 데이터를 목적지에 저장합니다. 데이터 웨어하우스, 레이크, 마트 등
워크플로우를 관리하고 스케줄링합니다. Airflow, Prefect, Dagster 등
| 특성 | ETL | ELT |
|---|---|---|
| 순서 | Extract → Transform → Load | Extract → Load → Transform |
| 변환 위치 | 별도 처리 엔진 | 데이터 웨어하우스 내부 |
| 적합한 경우 | 레거시 시스템, 제한된 저장소 | 클라우드 환경, 빅데이터 |
| 장점 | 데이터 프라이버시, 네트워크 효율 | 빠른 로딩, 유연한 변환 |
| 도구 | Talend, Informatica | dbt, Snowflake, BigQuery |
| 특성 | Batch | Stream |
|---|---|---|
| 처리 시점 | 주기적 (시간, 일, 주) | 실시간 (밀리초 ~ 초) |
| 데이터 크기 | 대량 (GB ~ TB) | 소량 연속 (KB ~ MB) |
| 지연시간 | 분 ~ 시간 | 밀리초 ~ 초 |
| 사용 사례 | 리포트, 분석, 백업 | 알림, 모니터링, 실시간 대시보드 |
| 도구 | Spark Batch, Airflow | Kafka, Flink, Spark Streaming |
데이터 파이프라인은 단순한 기술이 아닙니다. 데이터를 통해 인류에게 가치를 전달하는 통로입니다. 올바른 데이터를 올바른 시간에 올바른 장소에 전달함으로써, 우리는 더 나은 의사결정을 내리고, 더 나은 제품을 만들며, 궁극적으로 인류를 이롭게 할 수 있습니다.