ECC 9

(2024.01.22.) 서면 회의

1. 주제 : ShoppingAppReview 캐글 데이터셋https://www.kaggle.com/datasets/jocelyndumlao/shoppingappreviews-dataset/data ShoppingAppReviews DatasetAnalyzing Customer Insights: The ShoppingAppReviews Dataset 2024www.kaggle.com 2. 데이터 칼럼 구성 - 12개 온라인 쇼핑 앱에 대한 751,500개의 영어 앱 리뷰로 구성된 데이터 세트 - Alibaba, Aliexpress, Amazon, Daraz, eBay, Flipcart, Lazada, Meesho, Myntra, Shein, Snapdeal 및 Walmart 등 가장 인기 있는 12개 온..

[8] 텍스트 분석

6. 토픽 모델링 - 토픽 모델링(Topic modeling) : 숨은 중요 주제를 효과적으로 찾아낼 수 있는 모델을 만드는 과정 ㄴ LSA (Latent Sematic Analysis) ㄴ LDA (Latent Dirichlet Allocation) - https://github.com/CinnaPie/ECC_1/blob/85b0a9f929ed7c424268d857ac9373135553088c/Chapter8/ECC_8_Topic%20Modeling.ipynb 7. 문서 군집화 소개와 실습 - 문서 군집화(Document Clustering) : 비슷한 텍스트 구성의 문서를 군집화하는 방법 ㄴ 비지도학습 기반 동작 (학습 데이터 불필요) - https://github.com/Cinn..

[7] 군집화

1. K-평균 알고리즘 이해- https://github.com/CinnaPie/ECC_1/blob/main/Chapter7/ECC_7_KMeans.ipynb 2. 군집 평가(Cluster Evaluation) - 실루엣 분석 : 각 군집 간의 거리가 얼마나 효율적으로 분리되어 있는지 나타내는 것. - 실루엣 계수 : 개별 데이터가 가지는 군집화 지표 (같은 군집 내 데이터와의 가까움과 다른 군집 데이터와 얼마나 멀리 분리되어 있는지를 나타냄)   - 값 : -1 ~ 1사이     - 1에 가까울수록 근처 군집과 더 멀리 떨어져 있음     - 0에 가까울수록 근처 군집과 가까움     - 음수 : 아예 다른 군집에 데이터 포인트가 할당됨 - 좋은 군집화 조건   1) 전체 실루엣 계수의 평균 값이 0~..

[6] 차원 축소

1. 차원 축소(Dimension Reduction) 개요 - 차원 축소 : 다차원 데이터셋(피처가 매우 많음)의 차원을 축소해 새로운 차원의 데이터셋을 생성하는 것.    ㄴ 차원 축소 하는 이유? : 차원이 증가할수록 데이터 포인트 사이 거리가 기하급수적으로 멀어져 희소한 구조가 됨                                                      -> 예측 신뢰도의 저하 (다중 공간성 문제)    ㄴ 차원 축소를 통해 더 직관적인 데이터 이해가 가능. - 피처 선택 (feature selection) : 특성 선택. 특정 피처에 종속성이 강한 불필요 피처 제거, 주요 피처만 선택 - 피처 추출 : 기존 피처를 저차원의 다른 공간으로 매핑해 함축적으로 더 잘 설명할 수 있..

[5] 회귀

1. 회귀 소개 - 회귀 : 여러 개의 독립변수와 한 개의 종속변수 간의 상관관계를 모델링하는 기법을 통칭 - (중요!) 회귀 계수 : 독립변수의 값에 영향을 미침. - 지도학습 : 분류(이산형 클래스 값) & 회귀(연속형 숫자 값) - 선형 회귀 : 실제값과 예측값의 차이를 최소화하는 직선형 회귀선을 최적화하는 방식.    ㄴ 규제(일반적인 선형 회귀의 과적합 문제를 해결하기 위해 회귀 계수에 페널티 값을 적용하는 것을 말함.)에 따라 유형 나뉨. - 대표적인 선형 회귀 모델    ㄴ 일반 선형 회귀 : 예측값과 실제값의 RSS를 최소화할 수 있도록 회귀 계수를 최적화하며, 규제를 적용하지 않은 모델.   ㄴ Ridge : 선형 회귀에 L2규제를 추가한 회귀 모델    ㄴ Lasso : 선형 회귀에 L..

[4] 분류

1. 분류(Classification)의 개요 - 지도학습 : 레이블(Label), 정답이 있는 데이터가 주어진 상태에서 학습하는 머신러닝 방식      ㄴ분류 : 학습 데이터로 주어진 데이터의 피처와 레이블값을 학습, 모델 생성. -> 미지의 레이블 값 예측 2. 결정 트리 - 결정 트리(Decision Tree) : 데이터 규칙을 학습을 통해 자동으로 찾아내 트리 기반의 분류 규칙을 만드는 것.- 규칙 노드 : 규칙 조건 표시- 리프 노드 : 결정된 클래스 값 +) 새로운 규칙 조건마다 서브 트리가 생성됨 - 트리의 depth가 깊어질수록 예측 성능 저하 (과적합) => 트리의 분할을 효과적으로 해야 함.- 정보 이득 : 엔트로피 기반 / 정보 이득  = (1 - (엔트로피 지수)) / 정보 이득이 ..

[3] 평가

0. 개요- 분류의 성능 평가 지표  1) 정확도 (Accuracy)  2) 오차행렬 (Confusion Matrix)  3) 정밀도 (Precision)  4) 재현율 (Recall)  5) F1 스코어  6) ROC AUC 1. 정확도(Accuracy)2. 오차 행렬3. 정밀도와 재현율4. F1 스코어5. ROC 곡선과 AUC - https://github.com/CinnaPie/ECC_1/blob/main/Chapter3/ECC_3_Accuracy~ROCcurve.ipynb ECC_1/Chapter3/ECC_3_Accuracy~ROCcurve.ipynb at main · CinnaPie/ECC_1Ewha Computer Club _ Machine Learning. Contribute to Cinna..

[2] 사이킷런으로 시작하는 머신러닝

1. 사이킷런 소개와 특징 - 사이킷런 : 파이썬 기반 머신러닝을 위한 가장 쉽고 효율적인 개발 라이브러리를 제공.  - 설치 방법 : pip install scikit-learn - 사용법 : import sklearn 2. 첫 번째 머신러닝 만들어 보기 - 붓꽃 품종 예측하기 - 꽃잎 길이, 너비 / 꽃받침 길이, 너비 데이터로 꽃의 품종 예측하는 데이터셋 - "분류(Classification)" : 학습을 위한 다양한 피처와 레이블 데이터로 모델 학습 후 별도의 테스트 데이터 세트에서 미지의 레이블을 예측하는 방식 (지도학습 방법 중 하나) - https://github.com/CinnaPie/ECC_1/blob/main/Chapter2/ECC_2_Flower.ipynb 3. 사이킷런의 기반 프레임..

[1] 파이썬 기반의 머신러닝과 생태계 이해

1. 머신러닝의 개념머신러닝(Machine Learning)? ㄴ 데이터를 기반으로 패턴 학습, 결과 예측하는 알고리즘 기법의 통칭 ㄴ 데이터에 매우 의존적 2. 파이썬 머신러닝 생태계를 구성하는 주요 패키지 - Scikit-Learn : 데이터 마이닝 기반 머신러닝 패키지 - Numpy / SciPy : 행렬/선형대수/통계 패키지 - Pandas (+ Matplotlib / Seaborn) : 데이터 핸들링 + 시각화 3. Numpyhttps://github.com/CinnaPie/ECC_1/blob/main/Chapter1/ECC_1_Numpy.ipynb 4. Pandashttps://github.com/CinnaPie/ECC_1/blob/main/Chapter1/ECC_1_Pandas.ipynb  ..