6.1 데이터 분류란?
Data Classification(데이터 분류)는 데이터를 보안 수준, 규제 요구사항, 비즈니스 중요도에 따라 범주화하는 프로세스입니다.
- 보안: 민감한 데이터에 적절한 보호 조치 적용
- 규제 준수: GDPR, CCPA 등 법적 요구사항 충족
- 리스크 관리: 데이터 유출 시 영향도 평가
- 접근 제어: 누가 어떤 데이터에 접근할 수 있는지 결정
6.2 데이터 분류 체계
| 분류 | 설명 | 예시 | 보안 수준 |
|---|---|---|---|
| PUBLIC | 공개 데이터 | 회사 소개, 공개 API 문서 | 낮음 |
| INTERNAL | 내부 사용 데이터 | 조직도, 내부 위키 | 중간 |
| CONFIDENTIAL | 기밀 데이터 | 매출 데이터, 전략 계획 | 높음 |
| RESTRICTED | 제한 데이터 | 개인정보, 금융 정보 | 매우 높음 |
6.3 주요 데이터 분류 유형
1) PII (Personally Identifiable Information)
개인을 식별할 수 있는 정보
- 직접 식별자: 이름, 주민등록번호, 여권번호
- 준식별자: 생년월일, 우편번호, 성별
- 연락처: 이메일, 전화번호, 주소
2) Financial Data
금융 관련 민감 정보
- 신용카드 번호, 계좌번호
- 거래 내역, 결제 정보
- 급여, 재무 제표
3) PHI (Protected Health Information)
건강 관련 보호 정보 (HIPAA 규제)
- 의료 기록, 진단 결과
- 처방전, 보험 정보
4) Business Critical
비즈니스 핵심 정보
- 영업 비밀, 특허
- 고객 계약서
- 전략 계획, 인수합병 정보
6.4 자동 분류 (Auto-Classification)
분류 규칙 기반
{
"classification": "PII",
"rules": [
{
"rule_type": "COLUMN_NAME_PATTERN",
"patterns": ["email", "phone", "ssn", "address", "name", "birth"],
"confidence": 0.8
},
{
"rule_type": "DATA_PATTERN",
"pattern": "\\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\\.[A-Z|a-z]{2,}\\b",
"description": "Email pattern",
"confidence": 0.95
},
{
"rule_type": "DATA_PATTERN",
"pattern": "\\d{3}-\\d{4}-\\d{4}",
"description": "Korean phone number",
"confidence": 0.9
}
]
}
ML 기반 분류
머신러닝 모델을 사용하여 데이터 내용을 분석하고 자동으로 분류합니다.
- 데이터 프로파일링: 샘플 데이터 수집 및 분석
- 패턴 학습: 이미 분류된 데이터로 모델 학습
- 자동 추론: 새 데이터에 대해 분류 예측
- 신뢰도 평가: 분류 정확도 점수 제공
- 규칙 기반: 명확한 패턴 (이메일, 전화번호)
- ML 기반: 애매한 경우 (자유 텍스트, 복잡한 패턴)
- 사람 검증: 신뢰도 낮은 경우 리뷰 요청
6.5 태깅 전략
태그는 데이터를 유연하게 분류하고 조직하는 방법입니다.
태그 카테고리
| 카테고리 | 목적 | 예시 |
|---|---|---|
| Domain | 비즈니스 도메인 | customer, product, sales, marketing |
| Team | 소유 팀 | data-team, analytics-team, eng-team |
| Quality | 데이터 품질 | gold, silver, bronze |
| Compliance | 규제 준수 | gdpr, ccpa, pci-dss, hipaa |
| Environment | 환경 | prod, staging, dev |
| Usage | 사용 목적 | analytics, reporting, ml-training |
태그 명명 규칙
✅ 좋은 예:
- customer-domain
- data-team
- gdpr-compliant
- high-quality
❌ 나쁜 예:
- Customer Domain (공백 포함)
- DataTeam (CamelCase)
- GDPR_COMPLIANT (언더스코어, 대문자)
- high quality (공백)
6.6 PII 자동 탐지
Python 예시 코드
import re
from typing import List, Dict
def detect_pii(column_name: str, sample_values: List[str]) -> Dict:
"""
컬럼명과 샘플 데이터를 분석하여 PII를 탐지합니다.
"""
pii_patterns = {
'email': r'\b[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+\.[A-Z|a-z]{2,}\b',
'phone': r'\d{3}-\d{4}-\d{4}',
'ssn': r'\d{6}-\d{7}',
'credit_card': r'\d{4}-\d{4}-\d{4}-\d{4}'
}
# 컬럼명 체크
pii_keywords = ['email', 'phone', 'ssn', 'address', 'name', 'birth']
column_match = any(keyword in column_name.lower() for keyword in pii_keywords)
# 데이터 패턴 체크
pattern_matches = {}
for pii_type, pattern in pii_patterns.items():
matches = sum(1 for value in sample_values if re.search(pattern, str(value)))
if matches > 0:
pattern_matches[pii_type] = matches / len(sample_values)
is_pii = column_match or len(pattern_matches) > 0
return {
'is_pii': is_pii,
'column_match': column_match,
'pattern_matches': pattern_matches,
'confidence': calculate_confidence(column_match, pattern_matches)
}
# 사용 예시
result = detect_pii(
'customer_email',
['john@example.com', 'jane@company.com', 'alice@domain.com']
)
print(result)
# {'is_pii': True, 'column_match': True,
# 'pattern_matches': {'email': 1.0}, 'confidence': 0.95}
6.7 보안 정책 적용
분류별 자동 조치
| 분류 | 자동 조치 |
|---|---|
| PII | - 암호화 필수 - 접근 로그 활성화 - 마스킹 적용 (비프로덕션) |
| FINANCIAL | - 감사 추적 활성화 - 제한된 접근 권한 - 데이터 보존 정책 적용 |
| PUBLIC | - 제한 없음 |
- 자동 분류의 정확도는 100%가 아닙니다
- 민감한 데이터는 반드시 사람이 검증해야 합니다
- 과도한 분류는 업무 효율을 저해할 수 있습니다
- 정기적인 분류 재검토가 필요합니다
6.8 규제 준수
GDPR 준수
- 모든 PII 데이터 위치 추적
- 데이터 처리 목적 문서화
- 개인정보 삭제 요청 처리 (Right to be Forgotten)
- 데이터 포터빌리티 지원
CCPA (California Consumer Privacy Act)
- 수집되는 개인정보 유형 공개
- 개인정보 판매 중단 요청 처리
- 개인정보 접근 권한 제공
6.9 실전 구현
1. 스캔 단계
- 새 테이블/컬럼 감지
- 샘플 데이터 수집 (상위 1000행)
2. 분석 단계
- 컬럼명 패턴 매칭
- 데이터 패턴 분석
- ML 모델 추론
3. 분류 단계
- 신뢰도 >= 90%: 자동 분류
- 신뢰도 70-89%: 리뷰 큐에 추가
- 신뢰도 < 70%: 수동 분류 요청
4. 적용 단계
- 분류 태그 부여
- 보안 정책 적용
- 알림 발송
5. 모니터링
- 분류 정확도 추적
- 피드백 수집
- 모델 재학습
6.10 다음 장 예고
다음 장에서는 플랫폼별 활용법을 다룹니다. Apache Atlas, DataHub, Collibra 등 주요 데이터 카탈로그 플랫폼의 특징과 활용법을 비교합니다.