1 of 7

Data Science - вступ

2 of 7

Василь

Нестеренко

КОНТАКТНІ ДАНІ

Telegram:

https://t.me/Br_HeCToR

v.nesterenko@chnu.edu.ua

+380502830718

    • Доцент кафедри математичного аналізу
    • Data engineer at “Nimbus Web Inc”

3 of 7

Data Science – наука про дані

Data science – мультидисциплінарна область, в якій використовуються наукові методи, процеси, алгоритми та системи для отримання знань із структурованих та неструктурованих даних.

Data science – наука про пошук та експлуатацію стійких статистичних закономірностей у даних.

4 of 7

Закономірність: чим вищий рівень доходу, тим вища платоспроможність і, відповідно, вища ймовірність повернення кредиту. Автоматична система прийняття рішення щодо видачі коштів має віддавати перевагу кандидатам з вищим рівнем доходу.

Експлуатація: автоматизована система ухвалення рішень на основі заповненої анкети позичальника.

Стійкість: виключенням із правила можуть бути кризові періоди, однак у середньому тенденція збережеться.

2

1

3

Приклади: кредитний скорінг

5 of 7

Закономірність: середня яскравість пікселів на ділянці знімка із кровотечею вище. Різні типи кровотечі розташовані у різних ділянках знімку

Експлуатація: автоматизація системи діагностики (підтримка ухвалення рішення)

Стійкість: закономірність збережеться за умови застосування того ж обладнання у процесі дослідження

2

1

3

Приклади: пошук внутрішньочерепних кровотеч

6 of 7

18 століття – розподіл випадкової величини, запровадження поняття середнього значення, основи теорії помилок, винахід гістограми та кругової діаграми.

19 століття - поняття стандартного відхилення, виведення нормального розподілу ймовірностей, метод найменших квадратів та регресія; перші успішні програми статистики в астрономії та соціальних науках.

Кінець 19 – початок 20 століття – становлення статистики як формальної математичної дисципліни, розширення методів тестування гіпотез, поява байєсівської статистики.

1930-і – 1960-і – probit/logit моделі; KNN, CART, алгоритми SVM, перші нейронні мережі.

1970-і – 1980-і – поширення ЕОМ для статистичних розрахунків, перша статистична мова програмування (S – 1976г), винахід CNN.

1990-і – винахід LSTM, AdaBoost, RandomForest алгоритмів; поява Python та R.

2

1

3

4

5

6

Коротка історія

7

2000-і – GradientBoosting алгоритм, стабільна версія R, Python 2, SkLearn, перша імплементація нейронних мереж на GPU.

8

2010-і – поява Kaggle, вихід Tensorflow, Keras, PyTorch.

7 of 7

Data science складники