MY ANIME LIST �DATA SET 시각화
25K
15K
1M
1M
731K
1M
"Scored By“ col은 해당 애니의 평점을 준 사용자 수임
-> Scored By = 0이라서 Score가 0인 것과 진짜 Score가 0인 것을 구분하여 행 drop
문제1 : Novel과 Manga의 세부적으로 나뉨
-> 문자열 비교 후 분류
문제2: 음악, 라디오, 게임과 같은 모호한 자료
-> 버리기
데이터 프레임 col을 소설원작 / 만화원작으로 분류
만화원작DF
소설원작DF
평균치 비교를 위해 세 데이터프레임을 합치기
Mean()
Mean()
anime_filter["Genres"].str.split(", ", expand = True)
-> Comma기준으로 분해 후 저장 / 결측치는 0으로 채우기
user_details.사용자ID + user_score.사용자ID -> merge
user_score.애니ID + anime_filter.애니ID -> merge
-> user_score가 가진 공통 col을 기준으로 mergeDF데이터 프레임 생성
Male_dict = dict()
Female_dict = dict()
장르별로 같은 색깔
-> 남녀 선호 장르가 유사하다는 것을 알 수 있음
빨간색은 서로에게 없는 장르
-> 남성은 학원물, 여성은 일상물이 TOP10에 들어감
1번 가설에 사용한 col으로 anime DataFrame의 만화 원작과 소설 원작을 분류해줌
만화 원작 DF
소설 원작 DF
만화.corr()
소설.corr()
- 상부와 하부에 음의 상관관계가 보임
- 중간 Score에 적층된 형식
iloc을 이용하여 데이터 쪼개기
Score 9~10 : 랭크 0~255
Score 8~9 : 랭크 0~255
Score 7~8 : 랭크 0~255
.
.
.
Score 0~1 : 0~255
-> 상관관계 분석을 위해 층분리 필요
만화원작의 Rank / Score 상관계수 분석
소설원작의 Rank / Score 상관계수 분석
SampleData.py 에서 만든 변수를
각자의 .ipynb 파일에 import 해와서
d."변수명” 으로 사용하는 방식!
Sampledata.py (전처리 파일, 외부 변수) 소개
위의 4개 변수는 전처리된 csv파일을 담은 변수
Aired(방영 시작일), Premiered(상영일)
Aired(방영 시작일), Premiered(상영일)
Aired, Premiered 열 삭제 후 새로운 열 추가
Start_date(상영 시작일), End_date(상영 종료일), Aired_Duration(상영 총일)
Air 컬럼의 “to”로 split -> 각각 Start_date, End_date에 넣음
결측값을 제외한 Object타입인 날짜를 datetime으로 바꾸면서 열 생성
d.anime.info()
날짜별 계산이 용이하도록 전처리
셀 값이 여러 개인 열 -> explode 사용
고유값 확인 변수 생성
불필요한 열 삭제 & 컬럼별 데이터 타입 변경
1-1.제작사 당 담당한 애니 장르별 정리
(누가 제일 많은 애니를 제작했는지, 액션 장르를 제일 많이 만든 제작사가 누구인지)
전처리한 데이터(SampleData.py) 를 가져와 딕셔너리 생성
결측값 삭제(“ UNKNOWN “) 후 딕셔너리 생성
쪼개진 데이터 -> 딕셔너리 완성
1-1.제작사 당 담당한 애니 장르별 정리
(누가 제일 많은 애니를 제작했는지, 액션 장르를 제일 많이 만든 제작사가 누구인지)
“Result” DataFrame 생성 후 본격적인 분석 시작
Sum과 장르 한국어 번역 딕셔너리 사용
-> 애니메이션 장르별 분포 분석
1917년부터 데이터를 모았음
Plot을 사용한 데이터 시각화
코미디,액션,판타지 -> 압도적 많음
스포츠 이후 -> 비주류
가장 많은 애니메이션을 제작한 제작사 : Aniplex
Aniplex 제작 장르 비율 시각화
Aniplex 제작 장르 비율 시각화
Aniplex 가 다룬 영화에는 Hentai, Erotica 장르가 없다
Pink Pineapple이 제일 많이 만들었다
그것도 압도적 비중…
Pink Pineappple 제작 장르 비율 시각화
한 애니메이션에 장르가 여러 개인 것도 있으므로,,
어쩌면 헨타이 애니만 만든 회사인가…?
오타쿠 1세대 : 1974~1979
오타쿠 2세대 : 1980~1988 -> 9년
오타쿠 3세대 : 1989~1999 -> 11년 (저도 3세대)
오타쿠 4세대 : 2000~2010 -> 11년
오타쿠 5세대 : 2011~2019 -> 10년
오타쿠 6세대 : 2020~현재 -> 4년
출처 : https://note.com/hogehoge_aichi/n/n4e1ca9d536ec
Timestamp 객체 리스트 사용
Plot.bar 으로 시각화
d.Anime -> Sedai 열 생성
세대 별 애니메이션 장르 분포 dict 생성
세대 별 애니메이션 장르 분포 DataFrame 생성
Users-details의 Birthday 열 사용
-> 플랫폼 이용자의 나이 계산
나잇대 구간 형성 및 value_counts적용
Bar 를 사용한 시각화(1살 당 가입자 수)
18세 이상이 압도적으로 많다
0~6세 가입자도 있다
(추측 : 아동용 애니)
필살기 : users-detail-2023.csv
users-score-2023.csv
anime-dataset-2023.csv 모두 사용
Users-details-2023.csv 파일을 읽어들인 result 변수 인덱스 정리
User-score-2023.csv 파일에서 Xinel이 본 목록 필터링
알고리즘 구현 -> 딕셔너리 생성
2000명의 데이터 수집
그 중 한 명의 결과 ->
액션 장르를 제일 많이 보는사람의 비율 : 57.7%
헨타이 장르를 제일 많이 보는 사람의 비율 : 1.1% x 22% = 0.24%
-> 2000*0.24=2000명 중에 5명 정도가 헨타이를 제일 많이 본다…!
1
호프스테드의 문화 차원 이론
게르트 호프스테드에 의해 개발된 이 이론은 사회 구성원의 가치와 행동이 그 문화에 반영된다고 제안합니다. 호프스테드는 여섯 가지 문화 차원(권력 거리, 개인주의 대 집단주의, 남성성 대 여성성, 불확실성 회피, 장기 지향 대 단기 지향, 쾌락주의 대 절제)을 식별하여, 서로 다른 문화를 가진 사람들이 다른 기호와 취향을 보이는 이유를 설명합니다.
2
부르디외의 구별 짓기 이론
피에르 부르디외의 구별 짓기 이론은 사람들의 문화적 상품(예: 예술, 음악, 음식 등)에 대한 선호가 그들의 사회적 위치와 가지고 있는 문화 자본에 의해 형성된다고 제안합니다. 문화 자본에는 교육, 양육, 사회적 네트워크 등이 포함되며, 이 모든 것이 개인의 취향과 선호에 기여합니다.
3
사회 정체성 이론 (Social Identity Theory)
앙리가. 앙리 타즈펠과 존 터너에 의해 개발된 이 이론은 개인의 자아 개념이 그들의 그룹 멤버십에 기반한다고 주장합니다. 이 이론은 문화 그룹 멤버십(예: 국적, 민족성, 지역적 소속 등)이 그룹의 규범과 취향에 맞춰 순응함으로써 선호에 영향을 줄 수 있다고 제안합니다.
4
소비자 민족중심주의 이론 (Consumer Ethnocentrism Theory)
테렌스 심프와 수바시 샤르마에 의해 개발된 이 이론은 소비자의 선호가 그들의 민족중심주의 수준에 의해 영향을 받는다고 제안합니다. 즉, 사람들은 외국 제품을 구매하는 것이 비애국적이거나 지역 경제에 해를 끼친다는 신념에 기반하여 자국 및 자국 문화의 상품을 선호할 수 있습니다.
일본의 콘텐츠 관리를 위한 애니메이션 산업
일본 애니메이션 플랫폼 기업들은 비즈니스 모델, 콘텐츠 관리, 관객 참여 전략(2차 창작물 등) 등을 시장 상황에 따라 변화시켜 왔습니다.
일본과 해외의 미디어 문화
일본 스튜디오와 다른 국가의 국내 프로듀서 간의 초기 공동 제작이 외국 관객에게 애니메이션을 소개하고 글로벌 인식을 형성하는 데 중요한 역할을 했다는 것을 다룹니다.
1
국가별 애니 시청자 수와 오타쿠 수는
일본 교역량 순위와 정비례 관계일 것이다.
user-details_2023.csv에서 Location 컬럼 이용
결측치 제외 및 이상값 제외
오타쿠
500편 이상의 애니를 완결까지 본 사람
애니 시청자
해외 최대 아니메 플랫폼 기업 My Anime List 이용자
1) user_details_2023.csv
source: my Anime List
2) Japan_exports_by_country.xlsx
source: United Nations COMTRADE
3) Japan_imports_by_country.xlsx
source: United Nations COMTRADE
4) World_cities
source: simple maps
5) World_population.xlsx
source: Worldometer
전체 애니 시청자 국가별 분포도 시각화
단순 시청자 수와 인구 대비 시청자 수 표시
오타쿠 국가별 분포도 시각화
단순 오타쿠 수와 인구 대비 오타쿠 표시
수출국 순위와 인구 대비 전체 애니 시청자 수 오타쿠 수 상관관계 분석
수출국 순위와 단순 애니 시청자 수, 오타쿠 수 상관관계 분석
각 국가별 애니의 인기와 일본과 무역량의 상관관계는
0.63이라는 미약한 수치이지만 유의미한 상관관계를 보이고 있다.
허나 두 변수 사이에 상관관계가 있다고 해서 하나가 다른 하나를 원인으로 가정해서는 안 된다.
데이터 전처리 과정에서 수많은 변수가 있었기에 신뢰도는 다소 떨어진다.
분석의 한계(실력의 한계) : 라틴 문자 외의 다른 문자(한글, 히라가나, 가타카나, 한문, 해석 가능한 특수문자자 등)들은 제외했기에 아시아 국가들을 비롯하여 라틴문자 비사용국가들의 통계가 현저하게 적은 결과가 나왔다. 또한 My anime list는 영미권 대상 애니 플래폼 기업이기에 아시안 데이터가 비교적 적다.
가설의 한계 : 모든 문화는 초월적 차원을 다루는 언어를 가지고 있고 그것들은 많은 공동지대를 가지고 있다. 즉 고도로 일반화된 문화적 차원을 배제하고 경제 교역량만을 따지는 것으로는 일본 애니메이션이 각 국가에 인기있는 원인을 모두 설명하는 것은 아니다. 구체적 현실에서는 문화와 경제의 구분도 사실상 어렵다.
그러나 일본의 국가별 수출입 수치와 애니메이션 팬의 세계 분포와 그 수치 비교 시각화는 아직 충분히 시도되지 않았기에 이 분석의 의의가 있다.
The Anime Industry, Networks of Participation, and Environments for the Management of Content in Japan - Álvaro David Hernández Hernández. MDPI. 2018
Japanese Media Cultures in Japan and Abroad: Transnational Consumption of Manga, Anime, and Media-Mixes Manuel Hernández-Pérez. MDPI. 2019