1 of 24

EDA: Exploratory Data Analysis

2 of 24

Что такое EDA?

Разведочный анализ данных (англ. exploratory data analysis, EDA) анализ основных свойств данных, нахождение в них общих закономерностей, распределений и аномалий, построение начальных моделей, зачастую с использованием инструментов визуализации.

Понятие введено математиком Джоном Тьюки, который сформулировал цели такого анализа следующим образом:

  • максимальное «проникновение» в данные,
  • выявление основных структур,
  • выбор наиболее важных переменных,
  • обнаружение отклонений и аномалий,
  • проверка основных гипотез,
  • разработка начальных моделей.

Статья из Википедии

3 of 24

Что такое EDA?

EDA часто включает в себя следующие этапы (не обязательно все):

  • Начальное исследование данных
  • Валидация данных: правильно ли установлены типы данных в признаках, какой они имеют диапазон значений
  • Обобщение данных
  • Очистка данных
  • Работа с выбросами
  • Работа с пропущенными значениями
  • Обогащение данных: создание новых признаков
  • Поиск трендов и зависимостей (линейный временные графики, точечные графики, корреляция, регрессия и многое другое)
  • Формулировка и проверка основных гипотез

4 of 24

Выброс - Outlier

Выброс (outlier— в статистике результат измерения, выделяющийся из общей выборки.

5 of 24

СТАТИСТИЧЕСКИЕ ПОКАЗАТЕЛИ

Меры центральной тенденции

Меры центральной тенденции (меры среднего уровня) дают усредненную характеристику совокупности объектов по определенному признаку. К мерам среднего уровня относятся:

  • среднее значение
  • мода
  • медиана

Меры изменчивости

Меры изменчивости (разброса, рассеяния) показывают, насколько хорошо данные значения представляют данную совокупность. К таким мерам относятся:

  • Размах
  • Дисперсия случайной величины
  • Стандартное (среднеквадратическое) отклонение
  • Интерквантильный размах и др.

6 of 24

Медиана - median

Медиана — число, характеризующее выборку (например, набор чисел). Если все элементы выборки различны, то медиана — это такое число, что половина из элементов выборки больше него, а другая половина меньше. В более общем случае медиану можно найти, упорядочив элементы выборки по возрастанию или убыванию и взяв средний элемент.

Мода - mode

Мода — значение во множестве наблюдений, которое встречается наиболее часто. (Мода = типичность.) Иногда в совокупности встречается более чем одна мода (например: 6, 2, 6, 6, 8, 9, 9, 9, 0; мода — 6 и 9). Если не одно число не повторяется, то у множества нет моды.

7 of 24

Среднее значение - mean

Среднее арифметическое значение представляет собой среднее число для группы чисел и вычисляется путем суммирования всех чисел и деления на количество этих чисел. Среднее арифметическое также обычно называют просто средним значением.

8 of 24

Меры изменчивости

Меры изменчивости (разброса, рассеяния) показывают, насколько хорошо данные значения представляют данную совокупность. К таким мерам относятся:

  • Размах
  • Дисперсия случайной величины
  • Стандартное (среднеквадратическое) отклонение
  • Интерквантильный размах и др.

9 of 24

Размах: Minimum, maximum and range

Минимум — это наименьшее возможное количество чего-либо в данном контексте. В математическом анализе минимум — один из видов экстремума, наименьшее значение функции на заданном интервале.

Максимум - наибольшее возможное количество чего-либо в данном контексте. в математическом анализе максимум — один из видов экстремума, наибольшее значение функции на заданном множестве.

Интервал (размах)  - это разность между максимальным и минимальным значениям выборки. Крайне чувствителен к выбросам.

10 of 24

Дисперсия случайной величины Variance

 

Другими словами, дисперсия - это средний квадрат отклонений индивидуальных значений признака от их средней величины.

11 of 24

Среднеквадратическое отклонение

Standard Deviation - STD

 

12 of 24

Нормальное распределение

13 of 24

Нормальное распределение�Normal Distribution

Нормальное распределение, также называемое распределением Гаусса или Гаусса — Лапласа — распределение вероятностей, которое в одномерном случае задаётся функцией плотности вероятности, совпадающей с функцией Гаусса:

14 of 24

Нормальное распределение�Normal Distribution

  • Унимодально, т.е. имеет одну моду

  • Симметрично

  • Отклонения наблюдений от среднего подчиняются определенному вероятностному закону

15 of 24

Квантиль – quantile �Процентиль – percentile

Квантиль в математической статистике — значение, которое заданная случайная величина не превышает с фиксированной вероятностью. Если вероятность задана в процентах, то квантиль называется процентилем или перцентилем.

Например, фраза «90-й процентиль массы тела у новорожденных мальчиков составляет 4 кг» означает, что 90 % мальчиков рождаются с весом, меньшим либо равным 4 кг, а 10 % мальчиков рождаются с весом, большим 4 кг.

16 of 24

Медиана и квартили

  • 0,25-квантиль называется первым (или нижним) квартилем (от лат. quarta — четверть)
  • 0,5-квантиль называется медианой (от лат. mediāna — середина) или вторым квартилем
  • 0,75-квантиль называется третьим (или верхним) квартилем.

Интерквартильным размахом (англ. Interquartile range, IQR) называется разность между третьим и первым квартилями. Интерквартильный размах является характеристикой разброса распределения величины и является робастным аналогом дисперсии

17 of 24

Квартили

Квартили - это три такие значения признака, которые делят упорядоченные данные на четыре равные части

Первый квартиль - 167

Второй квартиль (медиана) - 170.5

Третий квартиль - 173

18 of 24

Поиск выбросов по интерквартильному размаху

Квартили и квартильный размах (interquartile range (IQR)) используют, чтобы оценить наличие выбросов.

IQR = Q3 – Q1 = 173 - 167 = 6

upper fence (верхний лимит) = Q3 + (1.5 * IQR) = 173 + (1.5 * 6) = 182

lower fence (нижний лимит) = Q1 – (1.5 * IQR) = 167 - (1.5 * 6) = 158

If data point < lower fence OR data point > upper fence –> point is an outlier?

19 of 24

Boxplot - Ящик с усами

Ящик с усамидиаграмма размаха (англ. box-and-whiskers diagram or plot, box plot) — график, использующийся в описательной статистике, компактно изображающий одномерное распределение вероятностей.

Такой вид диаграммы в удобной форме показывает медиану, нижний и верхний квартили, минимальное и максимальное значение выборки и выбросы.

20 of 24

Boxplot - Ящик с усами

21 of 24

Коэффициент корреляции Пирсона

 

 

R принимает значения [-1, 1], где знак коэффициента корреляции показывает направление связи.

Коэффициент корреляции Пирсона (r-Пирсона) применяется для исследования взаимосвязи двух переменных, измеренных в метрических шкалах на одной и той же выборке. Он характеризует существование линейной связи между двумя величинами, и позволяет определить, насколько пропорциональная изменчивость двух переменных.

Если связь криволинейная то он не будет работать.

22 of 24

Коэффициент корреляции Пирсона

Чтобы приступать к расчетам коэффициента корреляции r-Пирсона необходимо выполнение следующих условий:

  • Исследуемые переменные X и Y должны быть распределены нормально.
  • Исследуемые переменные X и Y должны быть измерены в интервальной шкале или шкале отношений.
  • Количество значений в исследуемых переменных X и Y должно быть одинаковым.

Слабая сторона Pearson’s r - неустойчивость к выбросам.

С помощью коэффициента корреляции Пирсона можно определить только силу линейной взаимосвязи между переменными, другие виды взаимосвязей выявляются методами регрессионного анализа.

23 of 24

Коэффициент корреляции Пирсона R

24 of 24

Примеры нелинейной связи