1 of 17

1

Московский государственный университет информационных технологий, радиотехники и электроники

Дипломная работа

Алгоритм выявления “выбросов” в статистических данных

(на примере данных о миграциях)

Выполнила: Бучнева М.А. КМБ-1-11

Научный руководитель: Яшунский А.Д.

2 of 17

2

Постановка задачи

Требуется описать алгоритм, который будет выявлять наблюдения, являющиеся аномалиями относительно рассматриваемого набора данных

Исследуемые наблюдения представлены в виде набора данных, по которым построена математическая модель, устанавливающая зависимости между её параметрами. Параметры модели - наборы числовых данных в табличной форме.��Предполагаемый результат: разработать алгоритм, с его применением найти и показать наблюдения, выделяющиеся из общего набора.

3 of 17

3

Описание математической модели

Параметрами модели являются различные числовые данные, полученные из социальных сетей такие как: �FROM — населенный пункт, из которого выходит поток миграций (пункт отправления),

TO — населенный пункт, в который приходит поток миграций (пункт назначения),

MIGR — мощность потока миграции (количество мигрантов)

M2PRICE — средняя цена в рублях за кв. метр нового жилья в регионе пункта назначения

TO_POP — численность населения пункта назначения

SAME_REG — признак того, что пункты отправления и назначения находятся в одном регионе

ADM2, ADM1 — признак того, что пункт назначения является административным центром или столицей

Выбросы ( англ. Outliers) - аномальные наблюдения, элементы совокупности (выборки), значительно отличающиеся от остальных по изучаемому признаку.

4 of 17

4

Описание математической модели

Выходные данные (прогнозируемые) модель строит с помощью модели линейной регрессии

� Простейшая гравитационная модель миграций: �

Расширенная гравитационная модель: Mij = f1(i,j)a1f2(i,j)a2…. fn(i,j)an

Для определения значений a1,...,an это соотношение логарифмируют:

(3) y = (y1 , y2 , …, yn) - зависимая переменная (предиктор)

(3’) x = (x1 , x2 , … , xn) - независимая переменная (регрессор, фактор)

5 of 17

5

Краткая теоретическая часть

Линейная регрессия (англ. Linear regression) — регрессионная модель зависимости одной переменной (предиктора) y от другой(-их) независимых переменных (регрессоров) x с линейной функцией зависимости.��

  • регрессионная модель, ε - аддитивная случайная величина, b - коэффициенты регрессии.

Коэффициенты линейной регрессии показывают скорость изменения зависимой переменной по данному фактору, при фиксированных остальных факторах (в линейной модели эта скорость постоянна).

�N регрессоров - множественная регрессия.

6 of 17

6

IQR - тест

  • Определяются пять основных характеристик (минимальное, максимальное, медианное значение признака и первое, третье межквартильные значения).
  • Рассчитывается межквартильное расстояние

IQR = (x0,75- x0,25).

  • Определяются верхние и нижние границы совокупности (доверительный интервал)

[Q1 – 1.5×IQR; Q3 + 1.5×IQR].

Строится диаграмма и определяются наблюдения, являющиеся в данный момент выбросами.�

IQR - тест. Если значение из выборки не попадает в доверительный интервал, то это значение - выброс.

Алгоритмы выявления “выбросов”

7 of 17

7

Результаты расчетов

Результаты IQR-теста

8 of 17

8

Алгоритмы выявления “выбросов”

Метод трёх сигм

Данный метод базируется на свойстве среднеквадратического отклонения как наиболее распространенного показателя разброса значений случайной величины относительно её математического ожидания.

Практически все значения нормально распределённой случайной величины лежат в интервале ��

Метод 3 сигм: Если значение выборки не лежит в этом интервале, то это значение - выброс

9 of 17

9

Алгоритмы выявления “выбросов”

Метод трёх сигм

10 of 17

10

Алгоритмы выявления “выбросов”

Простейший метод

Квантиль — значение, которое заданная случайная величина не превышает с фиксированной вероятностью.

  • 0,25-квантиль называется первым (нижним) квартилем
  • 0,5-квантиль называется медианой (вторым) квартилем;
  • 0,75-квантиль называется третьим (верхним)

Интерквартильным размахом называется разность между третьим и первым квартилями, т.е. x0,75- x0,25

Метод № 0. Если значение из выборки не попадает в интерквартильный размах, то это значение - выброс.

11 of 17

11

Результаты расчетов

Простейший метод

2 араметра

3 параметра

12 of 17

12

Алгоритмы выявления “выбросов”

  • Берется выборка X = x1, x2, … ,xn , где xk - выброс
  • Упорядочивается X = x(1), x(2), … ,x(n) .
  • Рассчитывается тестовая статистика:

gap = x(k+1) - x(k) , range = max(X) - min(X)

Тест Диксона (Dixon’s test)

Этот тест за один проход находит один выброс! �Работает только с малыми выборками (<30)

Warnings!

Тест Диксона. Если Q > Qtable , то точка x(k) - выброс.

13 of 17

13

Результаты расчетов

Сравнение теста Диксона для 5 и 3 регрессоров

Real igation

14 of 17

14

Алгоритмы выявления “выбросов”

Стебель и листья

  • Берется выборка X = x1, x2, … ,xn , где xk - выброс
  • Упорядочивается X = x(1), x(2), … ,x(n)
  • для все элементов выделяется целая и дробная части. Целые части - это “стебель” - повторяются у нескольких единиц, дробные части - “листья”
  • рассчитывается количество “листьев” для каждого “стебля
  • в полученном массиве листьев L находится максимальное значение lmax, по нему устанавливается smax- целые части выборки

Все остатки, соответствующие smax- есть нормальные значения для этой выборки. Остальные значения остатков - выбросы.

15 of 17

15

Алгоритмы выявления “выбросов”

Стебель и листья

16 of 17

16

Итоги

  • Простейший алгоритм, основанный на интерквартильном размахе, прост в использовании, но дает избыточные результаты�
  • IQR - точнее всех находит “выбросы” в выборке вне зависимости от распределения.

  • Текст Диксона пригоден только для малых выборок, но выдает точные результаты�
  • Метод трёх сигм на представленных данных не эффективен
  • Метод “стебель и листья” подходит для представленных данных, но может маркировать всплесками нормальные элементы выборки.

17 of 17

17

Итоги

Конец.�Спасибо за внимание!