1 of 34

Adatbányászat alapjai

Adatbányászat

​

Prof. Dr. Kovács László diái alapján

Kunné Dr. Tamás Judit�2025/26/2

2 of 34

Motiváció

Adatrobbanás zajlik: terabájtokról (1012) áttérünk a petabájtokra (1015)

    • Nagy adatgyűjtemények keletkeznek és érhetők el
      • Automatikus adatgyűjtő mérőeszközök, adatbázisrendszerek, Web, közösségi hálók, számítógépes ügyfélszolgálatok
    • Nagy mennyiségű nyers adat keletkezik a következő területeken
      • Üzleti élet: Web, e-kereskedelem, pénzügyi tranzakciók, tőzsde
      • Tudomány: távérzékelő berendezések, bioinformatika, tudományos szimulációk
      • Közösségi és mindennapos élet: Facebook, hírek, digitális kamerák, YouTube

Ellep bennünket a rengeteg adat, bár mi valójában inkább tudásra vágyunk!

    • A nem nyilvánvaló információ gyakran rejtve van az adatokban

A szükség szüli az új technológiát: Az adatbányászat a nagy mennyiségű adatok félautomatikus elemzése

​

3 of 34

Adatbányászat

Különböző definíciók

    • Implicit (rejtett), korábban nem ismert és potenciálisan hasznos információ nem-triviális eszközökkel való feltárása.
    • Nagytömegű adatok feltárása és elemzése félig automatikus módon azért, hogy értelmes (nem triviális, implicit, eddig nem ismert és potenciálisan hasznos) mintázatokat fedezzünk fel.
    • A KDD (Knowledge Discovery from Databases) folyamat része

​

4 of 34

KDD folyamat

5 of 34

Adatbányászat

Az adatbányászat alapvető lépései:

  • cél és forrás meghatározása
  • adatgyűjtés
  • adattisztítás
  • adatcsökkentés
  • módszer kiválasztása
  • paraméter kiválasztása
  • modellezés, képzés
  • előrejelzés
  • értékelés
  • alkalmazás
  • finomító hurkok

6 of 34

Adatbányászat megközelítések

Hagyományos:

  • Szabály alapú döntések
  • A szabályokat emberi szakértők hozzák létre
  • IF .. THEN .. szabályok

​

Gépi tanulás:

  • Implicit szabályok
  • Szabály indukció a tanító halmaz alapján
  • Releváns szabályok meghatározása statisztikai következtetési módszerekkel

7 of 34

Adatbányszati feladatok

8 of 34

Használt módszerek

  • Statisztika
  • vektor algebra
  • mátrix algebra
  • Optimalizálás
  • Adatbázis
  • Tudásbázis
  • logika
  • Megjelenítés
  • domain tudás
  • IT architektúrák
  • Big data

9 of 34

Adat reprezentáció

Jellemző vektor:

  • Vektor tér
  • Attribútumok, dimenziók
  • Vektor műveletek
  • Univerzális reprezentáció
  • Bővíthető
  • Nominális érték indexelése

10 of 34

Adat reprezentáció

Információ tábla:

  • Objektumok
  • Attribútumok, dimenziók
  • Mátrix alak
  • Bináris/Egész/Lebegőpontos
  • Bővíthető

​

11 of 34

Adat reprezentáció

Általános metrikus tér:

  • Objektumok
  • Nincsenek pozíciók
  • Csak távolságok
  • Hasonlóság
  • Nem bővíthető
  • Limitált műveletek

​

12 of 34

Adattisztítás

Felmérjük a hibákat

    • ellenőrizzük az adatfájl szerkezeti épségét
    • felmérjük a hiányzó értékeket
    • felmérjük az adatközlési és adatbeviteli hibákat
      • megvizsgáljuk az egyes változók eloszlását
        • az eloszlások szélein elhelyezkedő extrém értékeket ellenőrizzük
        • felmérjük, hogy az eloszlások megfelelnek-e az előzetes elvárásainknak, vannak-e nem várt sűrűsödések, ritkulások egyes értéktartományokban (például durva kerekítés vagy eltérő mértékegység használata az adatszolgáltatók egy részénél)
      • megvizsgáljuk, hogy a változók közötti triviális összefüggések teljesülnek-e (például vizsgálat dátuma ≥ születés dátuma)

a hibásnak tűnő adatokat felülvizsgáljuk, javítjuk.

​

13 of 34

Hiányos adatok

Fajtái:

  • teljesen véletlenszerű adathiányról (missing completely at random, röviden: MCAR) akkor beszélhetünk, amikor az adathiány nem függ az adatok értékétől vagy más, különösen a megfigyelt változó értékeitől. A kihagyásuk nem torzítja a becslésünket a homogenitásuk miatt
    • Például: Ez olyankor fordulhat elő, ha az internetkapcsolat megszakadása miatt a válaszadó, mondjuk, nem tudja elküldeni az utolsó oldalon levő kérdésekre a választ.
  • véletlenszerű adathiány (missing at random, röviden: MAR) esetén a hiányzás attól a változótól független amely adatsorában felmerül, de valamilyen mechanizmust feltételezhetünk a hiányzás mögött. Kihagyásuk károsíthatja az olyan időbeli struktúrákat, mint az autokorreláció, trendek vagy szezonalitás
    • Például, ha egy kérdőíves felmérés során a résztvevők egy része nem adja meg a jövedelmét, a hiányzó jövedelmek a fiatalabb korosztályban nagyobb arányban fordulnak elő.

​

14 of 34

  • nem véletlenszerű adathiány (missing no at random, röviden: MNAR) akkor következik be, ha a hiány nem független az azt tartalmazó változótól, de amikor lehetséges, akkor torzítatlan becslést illeszthetünk a hiányzó adatokra
    • Példa lehet a nem véletlenszerű adathiányra, ha az elfogyasztott alkohol mennyiségére kérdezünk rá önbevallásos alapon. A rendszeresen és nagy mennyiségben alkoholt fogyasztók nagyobb eséllyel nem válaszolnak a kérdésre. A hiányzó adat ebben az esetben nem becsülhető meg egy másik megfigyelt változó alapján.

​

Nincs univerzálisan alkalmazható megoldás a hiányzó adatok kezelésére

​

15 of 34

Hiányzó adatok kezelése

  • Eset törlése
  • Változó törlése
  • Helyettesítés
  • Idősoros adatok esetén az utolsó meglévő adat továbbvitele

​

16 of 34

Adatközlési és adatbeviteli hibák

Van érték megadva, de az nem illik bele az adatainkba

    • Célszerű vizsgálni az egyes tulajdonságok eloszlásait
      • Szélsőséges értékek ellenőrzése
        • Nem mindig ténylegesen hibás adatok
        • Előzetes ismeret lehet szükséges az azonosításra
    • Ellentmondások ellenőrzése
      • Egyértelmű megszorítások (születési dátum < most)
      • Domainspecifikus megkötések
    • Jelölésrendszerbeli eltérések
      • igaz, hamis <-> true, false

17 of 34

Adat csökkentés: Dimenzió redukció

Célja: Alacsonyabb dimenzió számú adat reprezentáció keresése, úgy, hogy a reprezentáció információ érteke a lehető legtöbb maradjon

​

Előnyei:

  • Csökkentett betanítási idő
  • Csökkentett tárolási igény
  • Könnyebb vizualizáció
  • Javított értelmezés
  • Dimenzionalitás átkának kerülése

​

Fajtái:

  • Jellemző kiválasztás
  • Jellemző projekció

​

18 of 34

Jellemző kiválasztás

Célja: Jellemzők optimális részhalmazának kiválasztása

Oka: Az eredeti jellemzőhalmaz tartalmazhat irreleváns jellemzőket, néhány jellemző redundáns lehet egy másik jellemző szereplésekor.

Az optimális részhalmaz megállapításához egy kiértékelési mérték megadása szükséges, amelyek értékelik a különböző részhalmazokat.

​

19 of 34

Jellemző kiválasztás fajtái

  1. Szűrő stratégia
    • Statisztikai értéket rendel minden jellemzőhöz
    • A jellemzőket rangsorolja
    • Minden jellemzőt függetlenként kezel
    • Nincs tanulás benne, így elsődlegesen az egyszerűsége miatt használják
    • Gyakori mértékek: korreláció, információ szerzés, kölcsönös információ

​

20 of 34

  1. Wrapper stratégia
  2. A jellemzők egy részhalmazával betanít egy modellt, és ennek a modellnek a teljesítménye alapján döntünk
    1. Kimerítő keresés (Brute Force keresés):
      • Az összes jellemzőkombinációt végig próbálja
      • A legjobb kombináció lesz kiválasztva
      • Hosszú idő a kiértékelése
    2. Előrefelé kiválasztás:
      • Iteratív módszer, üres jellemzőhalmaztól indulunk
      • Minden iterációban beleveszünk a legjobb jellemzőt a teljesítményhez hozzáadott értéke alapján
      • Ez addig folytatódik, amíg egyik jellemző sem tudja javítani a teljesítményt
      • Mohó algoritmus, a lokális legjobbat adja mindig hozzá

​

21 of 34

      • Hátrafelé eliminálás
        • Iteratív módszer, a teljes jellemzőhalmazból indulunk, tehát minden jellemző jelen van
        • Minden iterációban azt a jellemzőt hagyjuk el, amely a legkisebb mértékben javította a teljesítményt
        • Ez addig folytatódik, amíg nincs javulás vagy jellemző
      • Random keresés
        • A b. és c. variánsai
        • Nem a teljes, vagy az üres jellemzőhalmazból indulunk ki, hanem egy random módon generált jellemző halmazból.
        • Elkerülhető vele lokális optimumba ragadás
  1. Beágyazott stratégia
    • A jellemző kiválasztás a adatbányászati módszer része
    • Például: A döntési fa osztó jellemzőjének kiválasztása a generált részhalmazok alapján történik

22 of 34

Jellemző projekció

Célja: A jellemzők transzformációja, összevonása

Oka: Felismerni azokat a jellemzőket, amelyek ugyan külön-külön nem relevánsak, de más jellemzőkkel összefüggésben lehet, illetve azokat, amelyek külön-külön relevánsak, viszont redundánsak lehetnek.

23 of 34

1. Lineáris diszkriminanciaanalízis (LDA)

  • Független jellemzők olyan lineáris kombinációját képes megtalálni, amely a függő jellemző alapján kialakított csoportokat a lehető legjobban megkülönbözteti (diszkriminálja).
  • Osztályozási feladatok előtt lehet használni
  •  A függő változó lehetséges kimeneteleinek száma -1 és a jellemzők száma közül a kisebbet lesz a diszkrimináló függvények darabszáma.
  • A függvény akkor optimális, ha a függő változó által meghatározott csoportok közötti külső négyzetösszeg és a csoportokon belüli négyzetösszeg hányadosa maximális.
  • A további függvényeknél plusz követelmény, hogy az előző függvényekkel ne korreláljon
  • Minden függvényhez kiszámítják valamilyen módon a jóságot, például a csoporton belüli átlagos négyzetes eltérés és a teljes átlagos eltérés aránya. -> Ezt minimalizálni szeretnénk

​

24 of 34

25 of 34

2. Főkomponens-analízis (PCA)

Az eredetileg megfigyelt változókat korrelációjuk alapján kevesebb számú főkomponens változóvá vonja össze.

A főkomponens a lehető legtöbb információt (varianciát) őrzi meg az eredeti jellemzőkből.

26 of 34

27 of 34

3. Szinguláris érték felbontás (SVD)

Egy mátrixfelbontási eljárás, mely egy tetszőleges, akár nem négyzet alakú mátrixot felbont három alapvető részmátrix szorzatára.

Ezek a részmátrixok tartalmazzák a mátrix szinguláris értékeit (singular values), amelyek segítenek leírni a mátrix struktúráját, és reprezentálják az eredeti adatok fontos jellemzőit.

Csak a legfontosabb szinguláris értékek és vektorok megtartásával lehet csökkenteni a dimenziót

​

​

28 of 34

29 of 34

Adat csökkentés: Mintaszám csökkentés

Az eredeti adathalmazt egy kevesebb mintát tartalmazóval helyettesítjük

Fontos, hogy tisztában legyünk az adatok mérete és pontossága közötti kompromisszumokkal, és gondosan felmérjük a kockázatokat és az előnyöket a bevezetés előtt.

Fajtái:

  • Paraméterezett
  • Nem paraméterezett

30 of 34

Paraméterezett módszerek

Az adat valamilyen modellel van reprezentálva

A modell az adatok becslésére szolgál, így a tényleges adatok helyett csak az adatok paramétereit kell tárolni.

  1. Regresszió
    • Lehet lineáris vagy többszörös lineáris regresszió
    • A lineáris regresszió során az adatokat egy illeszkedő egyenesre modellezzük
    • Többszörös lineáris regresszióban y két vagy több prediktor (független) változó lineáris függvényeként lesz modellezve
  2. Log-lineáris modell
    • Megbecsülhető az egyes adatpontok valószínűsége egy többdimenziós térben diszkretizált attribútumok halmazára, a dimenziókombinációk kisebb részhalmaza alapján.
    • Ez lehetővé teszi egy magasabb dimenziós adattér felépítését alacsonyabb dimenziós attribútumokból.

​

31 of 34

Nem paraméterezett módszerek

  1. Hisztogram: Gyakoriság alapú reprezentáció
  2. Klaszterezés: Klaszter reprezentáló adat helyettesíti a klaszterbe tartozó adatokat, a kiugró értékeket lehet vele detektálni
  3. Mintavételezés:
    • Visszatevéses/visszatevés nélküli véletlen választás
    • Klaszter mintavételezés: Az adatokat klaszterekre bontjuk, és véletlenszerűen választunk klasztereket, amik a mintát fogják adni
    • Rétegzett mintavételezés: Az adatokat rétegekbe soroljuk meghatározott jellemzők alapján. Minden adat pontosan egy rétegbe tartozik. Ezeket az előző két mintavételezési eljárással mintavételezzük. Így biztosított, hogy diverz legyen az adathalmaz, és minden karakterisztika megfelelően reprezentált (például osztályozási tanító halmaz választása)
  4. Adatkocka aggregáció

32 of 34

Adathalmaz használata�

Néhány tanító eljárás két állomást igényel

Különböző tanító sémákat szeretnénk összehasonlítani

Így beszélhetünk:

    • Tanító halmazról – osztályozók felépítése
    • Validáló halmazról – paraméteroptimalizálás vagy egy osztályozó kiválasztása
    • Teszt halmazról – a végső, optimalizált módszer hibaarányának meghatározására

Ezek a halmazok egymástól függetlenek kell, legyenek!

A hibaarány kiszámítása után megtehetjük, hogy a teszt halmazt és a tanító halmazt újra egybeolvasztjuk egy új osztályozó felépítéséhez – ezt fogjuk ténylegesen használni

A paraméteroptimalizálás után a validáló halmaz is visszaolvasztható

33 of 34

Kiértékelés

Kevés az adat, „holdout” módszer – ált. az adat egyharmadát tesztelésre, a maradékot tanításra használjuk

Ha nincs szerencsénk, a tanításra használt minta nem reprezentatív – ált. nem megállapítható

„Stratification” és „stratified holdout” – osztályok arányos reprezentálása

„Repeated holdout” – átlagos hibaarányt számolunk

Keresztvalidáció

    • Fix számú partíciót használ
    • Pl. „stratified 10‐fold cross‐validation” – � standard módszer
    • Sem a rétegzésnek, sem a 10 részre való � felosztásnak nem kell pontosnak lennie!
    • Többszöri kereszt‐kiértékelés

34 of 34

Leave­-one-­out kereszt­kiértékelés

Annyi partícióra osztjuk fel a bemeneti halmazt, amennyi annak számossága (n)

Pro

    • A lehető legtöbb adatot használjuk tanításra
    • Determinisztikus – nincs véletlen mintavételezés
    • Ismételni nem szükséges – ugyanazt kapjuk

Kontra

    • n-szer történik végrehajtás
    • A teszt halmazban garantálja a nem rétegzett mintát („nonstratified sample”)
    • Pl. teljesen véletlen bemeneti adathalmazban kétfajta osztály egyenlő  mértékben reprezentált