1. 주제 : ShoppingAppReview 캐글 데이터셋
https://www.kaggle.com/datasets/jocelyndumlao/shoppingappreviews-dataset/data
ShoppingAppReviews Dataset
Analyzing Customer Insights: The ShoppingAppReviews Dataset 2024
www.kaggle.com
2. 데이터 칼럼 구성

- 12개 온라인 쇼핑 앱에 대한 751,500개의 영어 앱 리뷰로 구성된 데이터 세트
- Alibaba, Aliexpress, Amazon, Daraz, eBay, Flipcart, Lazada, Meesho, Myntra, Shein, Snapdeal 및 Walmart 등 가장 인기 있는 12개 온라인 쇼핑 안드로이드 앱에 대한 앱 리뷰 포함
- 칼럼 구성 :
| reviewId | content | score | thumbsUpCount | at | replyContent | repliedAt | appName |
- reviewId: 리뷰의 고유 ID
- content: 리뷰 내용
- score: 리뷰에서 주어진 점수 (정수형)
- thumbsUpCount: 리뷰에 대한 공감 수 (정수형)
- at: 리뷰 작성 시간 (타임스탬프 형식)
- replyContent: 앱의 답변 내용 (거의 비어 있음)
- repliedAt: 답변 작성 시간 (거의 비어 있음)
- appName: 애플리케이션 이름 (Amazon Shopping으로 고정)
3. 분석 목표
1) 각 앱별 고객 만족도 분석 (텍스트 분석 및 별점 기반)
2) 상품 추천 알고리즘 구현
3) 각 앱의 응답 속도 및 답장 만족도 평가
4. 데이터 전처리
1) 결측치 처리
- Null 값으로 처리 후 적절히 제거 또는 대체
- 평균값 대체 또는 예측 모델 활용 가능
2) 이상치 처리
- 표준 점수 (Z-Score) / 사분위 범위 (IQR)
3) 데이터 분포 변환 :: 정규 분포로 변환
4) 데이터 인코딩
- 상품명을 숫자 레이블로 변환
- 원핫 인코딩 :: 가중치 배제 위해 사용
5) 피처 스케일링
- 표준화 (StandardScaler): 가우시안 정규 분포
- 정규화 (MinMaxScaler): 피처 크기 통일
+)
- 별점 분포 시각화 (ex. Aliexpress.csv)

- 답변 유무에 따른 만족도 분석
- 공감 수와 만족도의 관계 분석
- 공감 수 통계 :: 총 리뷰 수 99,000개 // 평균 공감 수 6.08 // 최대 공감 수 5,657
5. 텍스트 분석 기법
1) 텍스트 분류
- 만족/불만족 카테고리 분류
- 상품 특성 (모양, 크기, 재질 등)에 따른 만족도 분류
2) 감성 분석 :: 텍스트의 주관적 요소 분석, 긍정/부정 평가
3) 텍스트 요약 :: 리뷰의 핵심 주제를 추출하여 요약
4) 텍스트 군집화 및 유사도 측정 :: 비슷한 상품을 군집화해 복잡도 최소화
6. 텍스트 전처리
1) 클렌징 :: 대소문자 변경, 특수문자 삭제
2) 토큰화 :: (문장 토큰화: 마침표 기준 분리 // 단어 토큰화: 공백, 콤마 기준 분리)
3) 불용어 제거 :: 의미 없는 단어 (조사 등) 제거
4) 어근 추출 및 Lemmatization :: 단어의 의미를 유지하며 변환
7. 피처 벡터화
1) Bag of Words (BOW)
- 단어 빈도 기반 벡터화
- 희소 행렬 문제 해결 (COO, CSR 방식)
2) TF-IDF
- 자주 나타나는 단어에 패널티 부여
- CountVectorizer 및 TfidfVectorizer 사용
+) 자주 나타나는 단어 : delivery, service, product, app 등
* 그래프 by ChatGPT