1 of 136

MY ANIME LIST �DATA SET 시각화

2 of 136

25K

15K

1M

1M

731K

1M

3 of 136

4 of 136

5 of 136

6 of 136

7 of 136

8 of 136

9 of 136

10 of 136

11 of 136

12 of 136

13 of 136

14 of 136

15 of 136

16 of 136

17 of 136

18 of 136

19 of 136

20 of 136

21 of 136

22 of 136

23 of 136

24 of 136

25 of 136

26 of 136

27 of 136

28 of 136

29 of 136

30 of 136

31 of 136

32 of 136

33 of 136

34 of 136

35 of 136

36 of 136

37 of 136

38 of 136

39 of 136

40 of 136

"Scored By“ col은 해당 애니의 평점을 준 사용자 수임

-> Scored By = 0이라서 Score가 0인 것과 진짜 Score가 0인 것을 구분하여 행 drop

41 of 136

문제1 : Novel과 Manga의 세부적으로 나뉨

-> 문자열 비교 후 분류

​

문제2: 음악, 라디오, 게임과 같은 모호한 자료

-> 버리기

42 of 136

데이터 프레임 col을 소설원작 / 만화원작으로 분류

만화원작DF

소설원작DF

43 of 136

평균치 비교를 위해 세 데이터프레임을 합치기

Mean()

Mean()

44 of 136

45 of 136

46 of 136

47 of 136

48 of 136

anime_filter["Genres"].str.split(", ", expand = True)

-> Comma기준으로 분해 후 저장 / 결측치는 0으로 채우기

49 of 136

user_details.사용자ID + user_score.사용자ID -> merge

user_score.애니ID + anime_filter.애니ID -> merge

​

-> user_score가 가진 공통 col을 기준으로 mergeDF데이터 프레임 생성

50 of 136

Male_dict = dict()

Female_dict = dict()

51 of 136

장르별로 같은 색깔

-> 남녀 선호 장르가 유사하다는 것을 알 수 있음

​

빨간색은 서로에게 없는 장르

-> 남성은 학원물, 여성은 일상물이 TOP10에 들어감

52 of 136

53 of 136

1번 가설에 사용한 col으로 anime DataFrame의 만화 원작과 소설 원작을 분류해줌

만화 원작 DF

소설 원작 DF

54 of 136

55 of 136

만화.corr()

소설.corr()

- 상부와 하부에 음의 상관관계가 보임

- 중간 Score에 적층된 형식

iloc을 이용하여 데이터 쪼개기

56 of 136

57 of 136

Score 9~10 : 랭크 0~255

​

Score 8~9 : 랭크 0~255

​

Score 7~8 : 랭크 0~255

​

.

.

.

​

Score 0~1 : 0~255

-> 상관관계 분석을 위해 층분리 필요

58 of 136

만화원작의 Rank / Score 상관계수 분석

소설원작의 Rank / Score 상관계수 분석

59 of 136

60 of 136

SampleData.py 에서 만든 변수를

각자의 .ipynb 파일에 import 해와서

d."변수명” 으로 사용하는 방식!

Sampledata.py (전처리 파일, 외부 변수) 소개

위의 4개 변수는 전처리된 csv파일을 담은 변수

61 of 136

Aired(방영 시작일), Premiered(상영일)

Aired(방영 시작일), Premiered(상영일)

Aired, Premiered 열 삭제 후 새로운 열 추가

Start_date(상영 시작일), End_date(상영 종료일), Aired_Duration(상영 총일)

62 of 136

Air 컬럼의 “to”로 split -> 각각 Start_date, End_date에 넣음

결측값을 제외한 Object타입인 날짜를 datetime으로 바꾸면서 열 생성

63 of 136

d.anime.info()

날짜별 계산이 용이하도록 전처리

64 of 136

셀 값이 여러 개인 열 -> explode 사용

고유값 확인 변수 생성

65 of 136

불필요한 열 삭제 & 컬럼별 데이터 타입 변경

66 of 136

67 of 136

68 of 136

1-1.제작사 당 담당한 애니 장르별 정리

(누가 제일 많은 애니를 제작했는지, 액션 장르를 제일 많이 만든 제작사가 누구인지)

​

전처리한 데이터(SampleData.py) 를 가져와 딕셔너리 생성

69 of 136

결측값 삭제(“ UNKNOWN “) 후 딕셔너리 생성

쪼개진 데이터 -> 딕셔너리 완성

1-1.제작사 당 담당한 애니 장르별 정리

(누가 제일 많은 애니를 제작했는지, 액션 장르를 제일 많이 만든 제작사가 누구인지)

​

70 of 136

71 of 136

“Result” DataFrame 생성 후 본격적인 분석 시작

72 of 136

Sum과 장르 한국어 번역 딕셔너리 사용

-> 애니메이션 장르별 분포 분석

1917년부터 데이터를 모았음

73 of 136

Plot을 사용한 데이터 시각화

코미디,액션,판타지 -> 압도적 많음

스포츠 이후 -> 비주류

74 of 136

가장 많은 애니메이션을 제작한 제작사 : Aniplex

Aniplex 제작 장르 비율 시각화

75 of 136

Aniplex 제작 장르 비율 시각화

76 of 136

Aniplex 가 다룬 영화에는 Hentai, Erotica 장르가 없다

​

  • (쓸데없는 호기심)
  • Hentai장르 관련 애니를 제일 많이 만든 회사는?

77 of 136

Pink Pineapple이 제일 많이 만들었다

그것도 압도적 비중…

78 of 136

Pink Pineappple 제작 장르 비율 시각화

​

한 애니메이션에 장르가 여러 개인 것도 있으므로,,

어쩌면 헨타이 애니만 만든 회사인가…?

79 of 136

80 of 136

오타쿠 1세대 : 1974~1979

  • 장로 세대. 아직 오타쿠라는 말이 존재하지 않는 시대에 이미 오타쿠

​

오타쿠 2세대 : 1980~1988 -> 9년

  • 오타쿠가 젊은이의 문화였던 세대

​

오타쿠 3세대 : 1989~1999 -> 11년 (저도 3세대)

  • 일본 버블 경제 붕괴 시대 오타쿠, 오타쿠 평론가의 시대

​

오타쿠 4세대 : 2000~2010 -> 11년

  • 오타쿠 폭발 세대, 남녀노소 할 것 없이 폭발적 증가
  • 모에 문화의 폭발적 증가

​

오타쿠 5세대 : 2011~2019 -> 10년

  • 아이돌 붐 발생, “누군가를 응원하기 때문에 오타쿠다”

오타쿠 6세대 : 2020~현재 -> 4년

  • 오타쿠라는 개념이 소멸해 가고 있는 세대
  • 오타쿠는 보통 사람, 그것에 불과하다

​

출처 : https://note.com/hogehoge_aichi/n/n4e1ca9d536ec

81 of 136

Timestamp 객체 리스트 사용

​

Plot.bar 으로 시각화

82 of 136

d.Anime -> Sedai 열 생성

83 of 136

세대 별 애니메이션 장르 분포 dict 생성

84 of 136

세대 별 애니메이션 장르 분포 DataFrame 생성

85 of 136

86 of 136

87 of 136

88 of 136

89 of 136

90 of 136

91 of 136

92 of 136

Users-details의 Birthday 열 사용

​

-> 플랫폼 이용자의 나이 계산

93 of 136

나잇대 구간 형성 및 value_counts적용

94 of 136

Bar 를 사용한 시각화(1살 당 가입자 수)

18세 이상이 압도적으로 많다

0~6세 가입자도 있다

(추측 : 아동용 애니)

95 of 136

96 of 136

필살기 : users-detail-2023.csv

users-score-2023.csv

anime-dataset-2023.csv 모두 사용

  1. Users-detail-2023.csv 에서 유저 닉네임 외래키로 사용
  2. Users-score-2023.csv 에서 유저 닉네임을 참조하여 시청한 애니메이션 아이디 갖고옴
  3. Anime-dataset-2023.csv 에서 애니메이션 아이디에 해당하는 장르 시각화
  • 한 유저당 어떤 장르의 애니메이션을 봤는지 통계분석 가능

​

97 of 136

  1. Users-detail-2023.csv 에서 유저 닉네임 외래키로 사용
  2. Users-score-2023.csv 에서 유저 닉네임을 참조하여 시청한 애니메이션 아이디 갖고옴
  3. Anime-dataset-2023.csv 에서 애니메이션 아이디에 해당하는 장르 시각화

98 of 136

Users-details-2023.csv 파일을 읽어들인 result 변수 인덱스 정리

User-score-2023.csv 파일에서 Xinel이 본 목록 필터링

99 of 136

알고리즘 구현 -> 딕셔너리 생성

2000명의 데이터 수집

그 중 한 명의 결과 ->

100 of 136

101 of 136

액션 장르를 제일 많이 보는사람의 비율 : 57.7%

헨타이 장르를 제일 많이 보는 사람의 비율 : 1.1% x 22% = 0.24%

-> 2000*0.24=2000명 중에 5명 정도가 헨타이를 제일 많이 본다…!

102 of 136

103 of 136

1

호프스테드의 문화 차원 이론

게르트 호프스테드에 의해 개발된 이 이론은 사회 구성원의 가치와 행동이 그 문화에 반영된다고 제안합니다. 호프스테드는 여섯 가지 문화 차원(권력 거리, 개인주의 대 집단주의, 남성성 대 여성성, 불확실성 회피, 장기 지향 대 단기 지향, 쾌락주의 대 절제)을 식별하여, 서로 다른 문화를 가진 사람들이 다른 기호와 취향을 보이는 이유를 설명합니다.

2

부르디외의 구별 짓기 이론

피에르 부르디외의 구별 짓기 이론은 사람들의 문화적 상품(예: 예술, 음악, 음식 등)에 대한 선호가 그들의 사회적 위치와 가지고 있는 문화 자본에 의해 형성된다고 제안합니다. 문화 자본에는 교육, 양육, 사회적 네트워크 등이 포함되며, 이 모든 것이 개인의 취향과 선호에 기여합니다.

104 of 136

3

사회 정체성 이론 (Social Identity Theory)

앙리가. 앙리 타즈펠과 존 터너에 의해 개발된 이 이론은 개인의 자아 개념이 그들의 그룹 멤버십에 기반한다고 주장합니다. 이 이론은 문화 그룹 멤버십(예: 국적, 민족성, 지역적 소속 등)이 그룹의 규범과 취향에 맞춰 순응함으로써 선호에 영향을 줄 수 있다고 제안합니다.

4

소비자 민족중심주의 이론 (Consumer Ethnocentrism Theory)

테렌스 심프와 수바시 샤르마에 의해 개발된 이 이론은 소비자의 선호가 그들의 민족중심주의 수준에 의해 영향을 받는다고 제안합니다. 즉, 사람들은 외국 제품을 구매하는 것이 비애국적이거나 지역 경제에 해를 끼친다는 신념에 기반하여 자국 및 자국 문화의 상품을 선호할 수 있습니다.

105 of 136

일본의 콘텐츠 관리를 위한 애니메이션 산업

일본 애니메이션 플랫폼 기업들은 비즈니스 모델, 콘텐츠 관리, 관객 참여 전략(2차 창작물 등) 등을 시장 상황에 따라 변화시켜 왔습니다.

일본과 해외의 미디어 문화

일본 스튜디오와 다른 국가의 국내 프로듀서 간의 초기 공동 제작이 외국 관객에게 애니메이션을 소개하고 글로벌 인식을 형성하는 데 중요한 역할을 했다는 것을 다룹니다.

106 of 136

1

국가별 애니 시청자 수와 오타쿠 수는

일본 교역량 순위와 정비례 관계일 것이다.

107 of 136

user-details_2023.csv에서 Location 컬럼 이용

결측치 제외 및 이상값 제외

108 of 136

오타쿠

500편 이상의 애니를 완결까지 본 사람

애니 시청자

해외 최대 아니메 플랫폼 기업 My Anime List 이용자

109 of 136

1) user_details_2023.csv

source: my Anime List

2) Japan_exports_by_country.xlsx

source: United Nations COMTRADE

3) Japan_imports_by_country.xlsx

source: United Nations COMTRADE

4) World_cities

source: simple maps

5) World_population.xlsx

source: Worldometer

110 of 136

전체 애니 시청자 국가별 분포도 시각화

단순 시청자 수와 인구 대비 시청자 수 표시

오타쿠 국가별 분포도 시각화

단순 오타쿠 수와 인구 대비 오타쿠 표시

수출국 순위와 인구 대비 전체 애니 시청자 수 오타쿠 수 상관관계 분석

수출국 순위와 단순 애니 시청자 수, 오타쿠 수 상관관계 분석

111 of 136

112 of 136

113 of 136

114 of 136

115 of 136

116 of 136

117 of 136

118 of 136

119 of 136

120 of 136

121 of 136

122 of 136

123 of 136

124 of 136

125 of 136

126 of 136

127 of 136

128 of 136

129 of 136

130 of 136

131 of 136

132 of 136

133 of 136

134 of 136

각 국가별 애니의 인기와 일본과 무역량의 상관관계는

​

0.63이라는 미약한 수치이지만 유의미한 상관관계를 보이고 있다.

​

허나 두 변수 사이에 상관관계가 있다고 해서 하나가 다른 하나를 원인으로 가정해서는 안 된다.

​

데이터 전처리 과정에서 수많은 변수가 있었기에 신뢰도는 다소 떨어진다.

135 of 136

분석의 한계(실력의 한계) : 라틴 문자 외의 다른 문자(한글, 히라가나, 가타카나, 한문, 해석 가능한 특수문자자 등)들은 제외했기에 아시아 국가들을 비롯하여 라틴문자 비사용국가들의 통계가 현저하게 적은 결과가 나왔다. 또한 My anime list는 영미권 대상 애니 플래폼 기업이기에 아시안 데이터가 비교적 적다.

가설의 한계 : 모든 문화는 초월적 차원을 다루는 언어를 가지고 있고 그것들은 많은 공동지대를 가지고 있다. 즉 고도로 일반화된 문화적 차원을 배제하고 경제 교역량만을 따지는 것으로는 일본 애니메이션이 각 국가에 인기있는 원인을 모두 설명하는 것은 아니다. 구체적 현실에서는 문화와 경제의 구분도 사실상 어렵다.

​

​

그러나 일본의 국가별 수출입 수치와 애니메이션 팬의 세계 분포와 그 수치 비교 시각화는 아직 충분히 시도되지 않았기에 이 분석의 의의가 있다.

136 of 136

The Anime Industry, Networks of Participation, and Environments for the Management of Content in Japan - Álvaro David Hernández Hernández. MDPI. 2018

Japanese Media Cultures in Japan and Abroad: Transnational Consumption of Manga, Anime, and Media-Mixes Manuel Hernández-Pérez. MDPI. 2019