검색 데이터와 해외 결제 데이터의 통합 분석을 통한�고객 유형 분류 및 예측
데이터사이언스대학원 데이터사이언스학과 김재윤, 이민선
1. 연구 배경
2. 연구 주제
3. 방법론
4. 연구 결과
5. 기대효과
목차
연구배경
Consulting experience in establishing marketing analysis and strategies
Experience working on a platform that provides cross-border use of digital assets
Data analysis skills IT-related technical skills
1.
해외 결제 앱 서비스와 마케팅 컨설팅 업계의 현업 경험을 바탕으로, 데이터 활용 어려움과 문제점을 해결하기 위한 캡스톤 프로젝트를 진행
연구배경
1. 고객군 타겟팅의 어려움
1.
2. 비즈니스 전략 수립의 어려움
- 다양한 트렌드를 정확히 파악하려면 다양한 소스에서 수집된 데이터가 필요. 하지만 데이터를 효과적으로 수집하고 분석하는데 어려움이 있음
- 여행 트렌드는 신속하게 변하기 때문에, 데이터를 실시간으로 수집하고 분석하여 신속하게 대응하는 것이 중요. 하지만 기술 및 인프라 부족으로 인해 효과적인 실시간 대응이 어려움
1. 이용자 동기 파악의 어려움
- 고객 행동 동기를 이해하려면 다각도의 완전한 데이터가 필요. 마케팅 분야에서의 고객의 반응(광고 노출, 주문, 결제)데이터로는 고객의
행동 동기를 포함한 전체를 파악하기 어려움
2. 실시간 대응의 어려움
- 마케팅 데이터와 분석 트렌드는 빠르게 변화하고 발전하고 있어, 기존의 데이터로만 의존하기보다는 최신 데이터와 분석 기술을 적극적으로 적용해야 하는 어려움
1. 실무 활용의 어려움
- 실제 업무 환경과의 간극 및 업무 적용의 복잡성으로 대학원에서 얻은 이론을 실무에 적용하는 데 어려움
2. 업무 환경에 따른 적용의 어려움
- 데이터의 복잡성과 호환성 문제로 빠른 결과 생산이 필요한 현업에서는 이론을 적용하는 과정이 적응과 속도 측면에서 어려움
캡스톤 프로젝트를 통해 트렌드 반영을 통한 고객 행동 이해, , 이론 실무 적용 등 다양한 측면에서의 데이터 활용에 대한 해결책 모색하여 연구 주제 선정
연구 주제
2.
검색 데이터와 결제 데이터를 접목하여 여행 트렌드 키워드 및 고객에 하여 맞춤 마케팅 전략 수립을 돕는 모니터링 대시보드 구축
잠재 고객
검색
검색 데이터
여행
결제
결제 데이터
고객 유형화
real-time
모니터링
<선행 지표>
<후행 지표>
방법론
3.
검색 데이터 수집과 트렌드 키워드 발굴을 통해 데이터 통합하고, 이를 기반으로 고객을 유형별로 분류하고 예측하여 모니터링 대시보드를 구축
1.검색 데이터 수집
2. LDA 토픽 모델링을 통해 트렌드 키워드 발굴
3. 데이터 통합
4. K-means Clustering 알고리즘
고객 유형 분류
5. RandomForest Classifier 모델
고객 유형 예측
6. 모니터링 대시보드 구현
방법론 - 검색 데이터 수집
3.1
여행의 기본 속성 키워드
- 여행,맛집, 숙소, 쇼핑 문서 수집
- 총427개의 문서 수집
크롤링 코드
네이버 "태국여행", "태국맛집", "태국숙소", "태국쇼핑" 검색 시 최신 View 문서 30페이지의
문서 크롤링
방법론 - LDA 토픽 모델링을 통해 트렌드 키워드 발굴
3.2
"태국여행", "태국맛집", "태국숙소", "태국쇼핑“
view 문서
해외 결제 앱 서비스
고객 데이터
- 최대 단어 1000개 중 적어도 2개의 문서에서 95% 이하의
문서에만 나타날 경우에만 단어를 고려하여 4개의 토픽 추출
LDA 분석 방법
LDA 분석 코드
네이버 View 문서 집합에서 토픽을 추출하고 각 토픽에 해당하는 키워드를 식별하여 트렌드 키워드를 도출
방법론 - 데이터 통합: 고객 데이터 전처리
3.3
데이터 전처리
회원코드 | 성별 | 나이 | 체류기간 | 가입일시 | 결제일시 | 결제장소 | 결제금액 |
A | 10 | 56 | 4 | 2023-05-17 | 2023-05-17 | 30 | 66518 |
A | 10 | 56 | 4 | 2023-05-17 | 2023-05-17 | 30 | 23774 |
B | 20 | 30 | 2 | 2023-05-19 | 2023-05-19 | 99 | 47957 |
C | 20 | 44 | 15 | 2023-06-22 | 2023-06-22 | 30 | 5507 |
C | 20 | 44 | 15 | 2023-06-22 | 2023-06-22 | 10 | 54066 |
C | 20 | 44 | 15 | 2023-06-22 | 2023-06-22 | 99 | 35375 |
D | 10 | 29 | 12 | 2023-08-08 | 2023-08-08 | 40 | 47204 |
- 성별, 카드사,기기 등 범주형 데이터를 수치형 데이터로 변환
- 결제 장소 데이터를 여행의 기본 속성 키워드로 분류: 맛집, 숙소, 쇼핑
범주형 데이터를 수치형으로 변환하고, 결제 장소 데이터를 여행의 기본 속성 키워드로 분류하여
데이터 전처리
방법론 - 데이터 통합: 검색량 데이터와 고객 데이터
3.3
여행 | 맛집 | 쇼핑 | 숙소 |
43.162 | 3.78719 | 44.4244 | 3.48662 |
43.162 | 3.78719 | 44.4244 | 3.48662 |
41.23835 | 2.55485 | 39.04418 | 3.09588 |
37.57138 | 2.76525 | 41.77938 | 3.12593 |
37.57138 | 2.76525 | 41.77938 | 3.12593 |
37.57138 | 2.76525 | 41.77938 | 3.12593 |
네이버 검색량 추출 코드
검색량 데이터
회원코드 | 성별 | 나이 | … | 결제 금액 |
A | 10 | 56 | … | 23774 |
B | 20 | 30 | … | 47957 |
C | 20 | 44 | … | 5507 |
C | 20 | 44 | … | 54066 |
C | 20 | 44 | … | 35375 |
D | 10 | 29 | … | 47204 |
고객 데이터
고객의 관심도를 알 수 있는 트렌드 키워드(여행, 맛집, 쇼핑, 숙소)의 네이버 API 검색량 데이터 추출하여
고객의 행동을 알 수 있는 결제 데이터 통합
방법론 - K-means Clustering 알고리즘 고객 유형 분류
3.4
1
2
0
K-means Clustering
최적의 클러스터 개수 확인
클러스터 별 데이터 개수로
분포 확인
데이터 스케일 표준화
주요 변수 확인
from sklearn.cluster import KMeans
import matplotlib.pyplot as plt
import seaborn as sns
from sklearn.decomposition import PCA
# 'cluster'가 클러스터 레이블을 나타내는 열이라고 가정합니다.
# 그렇지 않다면 실제 열 이름으로 'cluster'를 대체하세요.
X_selected = merged_df[['Age', 'Stay_Date', 'Sign_Date', '여행', 'Mobile_os', '맛집','숙소','쇼핑','Auth_AMT_KRW']]
X_pca_selected = PCA(n_components=2).fit_transform(X_selected)
# K-means 클러스터링 (원하는 클러스터 개수로 설정)
kmeans_selected = KMeans(n_clusters=3, random_state=42)
merged_df['kmeans_cluster_selected'] = kmeans_selected.fit_predict(X_selected)
분석코드
MinMaxScaling으로 데이터 정규화 후 클러스터 별 데이터 개수 분포를 통한 최적의 클러스터 개수를
확인하여 K-means Clustering 분석
방법론 - 예측 모델링 고객 유형 예측
3.5
예측 모델링
회원코드 | 나이 | 기기 | … | 결제 금액 | 여행 | 맛집 | 쇼핑 | 숙소 | 그룹 |
A | 56 | 10 | … | 23774 | 43.162 | 3.78719 | 44.4244 | 3.48662 | 1 |
B | 30 | 10 | … | 47957 | 43.162 | 3.78719 | 44.4244 | 3.48662 | 1 |
C | 44 | 20 | … | 5507 | 41.23835 | 2.55485 | 39.04418 | 3.09588 | 2 |
C | 44 | 20 | … | 54066 | 37.57138 | 2.76525 | 41.77938 | 3.12593 | 2 |
C | 44 | 20 | … | 35375 | 37.57138 | 2.76525 | 41.77938 | 3.12593 | 2 |
D | 29 | 10 | … | 47204 | 37.57138 | 2.76525 | 41.77938 | 3.12593 | 3 |
predictors
Target
1
2
3
RandomForestClassifier
Decision Tree
Logistic Regression Classifier
나이, 체류일, 회원가입일, 기기유형, 결제금액, 트렌드 키워드 검색량 데이터를 독립변수, 클러스터 그룹을 종속변수로 예측 모델링 수행
분석코드
모니터링 대시보드
3.6
분석 목적에 따라 기존・신규 회원을 분류하고 회원 대시보드와 결제 금액에 대해 연령대, 성별 등 다각도로 나누어 시각화한 결제 대시보드로 나누어 구성
모니터링 대시보드
3.6
분석 목적에 따라 기존・신규 회원을 분류하고 회원 대시보드와 결제 금액에 대해 연령대, 성별 등 다각도로 나누어 시각화한 결제 대시보드로 나누어 구성
연구 결과
4.
| 회원 분류는 비지도 학습법인 K-means Clustering 기법을 통해 3개의 군집으로 분류 수행함
연구 결과
4.
|기획 의도대로 목적별 두 종류의 대시보드로 구성
기대효과
5.
| 결제 대시보드 기대 효과 : 회원 타겟 마케팅을 통한 결제 금액 확대
해외 출장을 자주가는
직장인 대상 타겟 마케팅
여름 성수기에 호캉스를 즐기는 고객 대상 타겟 마케팅
유형1
유형2
유형3
기대효과
| 회원 대시보드 기대 효과 : 트렌드 기반의 프로모션으로 효율적 예산 집행
5.1
유형1
유형2
유형3
Q&A
감사합니다