ECC/Machine Learning Team 5 (2024-2)

[7] 군집화

SpruceMoon 2024. 11. 30. 21:53

1. K-평균 알고리즘 이해

- https://github.com/CinnaPie/ECC_1/blob/main/Chapter7/ECC_7_KMeans.ipynb

 

2. 군집 평가(Cluster Evaluation)

 - 실루엣 분석 : 각 군집 간의 거리가 얼마나 효율적으로 분리되어 있는지 나타내는 것.

 - 실루엣 계수 : 개별 데이터가 가지는 군집화 지표 (같은 군집 내 데이터와의 가까움과 다른 군집 데이터와 얼마나 멀리 분리되어 있는지를 나타냄)

   - 값 : -1 ~ 1사이

     - 1에 가까울수록 근처 군집과 더 멀리 떨어져 있음

     - 0에 가까울수록 근처 군집과 가까움

     - 음수 : 아예 다른 군집에 데이터 포인트가 할당됨

실루엣 계수 식

 - 좋은 군집화 조건

   1) 전체 실루엣 계수의 평균 값이 0~1 사이의 값을 가지며, 1에 가까울수록 좋음

   2) 전체 실루엣 계수의 평균과 더불어 개별 군집의 평균값의 편차가 크지 않아야 함. 즉, 개별 군집의 실루엣 계수 평균값이 전체 실루엣 계수의 평균값에서 크게 벗어나지 않는 것이 중요

 - https://github.com/CinnaPie/ECC_1/blob/main/Chapter7/ECC_7_ClusterEvaluation.ipynb

 

3. 평균 이동

가우시안 커널 / KDE 식

 - K : 커널 함수, x : 확률 변수값, xi : 관측값, h : 대역폭 (meanshift에서 bandwidth와 같음)
    - 대역폭 h : KDE 형태를 부드러운 형태로 평활화하는데 적용. 이 h를 어떻게 설정하느냐에 따라 확률 밀도 추정 성능을 크게 좌우할 수 있음.
    - 작은 h값은 변동성이 큰 방식으로 확률 밀도 함수를 추정하기에 과적합하기 쉬움.
    - 큰 h값인 경우는 지나치게 단순화된 방식으로 확률 밀도 함수를 추정하며 과소적합하기 쉬움
    - 적절한 h를 구하는 것은 KDE 기반의 평균 이동 군집화에서 매우 중요

 - https://github.com/CinnaPie/ECC_1/blob/main/Chapter7/ECC_7_MeanShift.ipynb

 

4. GMM(Gaussian Mixture Model)

 - https://github.com/CinnaPie/ECC_1/blob/main/Chapter7/ECC_7_GMM.ipynb

 

5. DBSCAN

 - https://github.com/CinnaPie/ECC_1/blob/main/Chapter7/ECC_7_DBSCAN.ipynb

 

6. 군집화 실습 - 고객 세그먼테이션

 - https://github.com/CinnaPie/ECC_1/blob/main/Chapter7/ECC_7_CustomerSegmentation.ipynb

 

[사용 교재]

'ECC > Machine Learning Team 5 (2024-2)' 카테고리의 다른 글

[8] 텍스트 분석  (0) 2024.12.28
[6] 차원 축소  (0) 2024.11.23
[5] 회귀  (0) 2024.11.16
[4] 분류  (0) 2024.11.02
[3] 평가  (0) 2024.10.12