Adatbányászat alapjai
Adatbányászat
Prof. Dr. Kovács László diái alapján
Kunné Dr. Tamás Judit�2025/26/2
Motiváció
Adatrobbanás zajlik: terabájtokról (1012) áttérünk a petabájtokra (1015)
Ellep bennünket a rengeteg adat, bár mi valójában inkább tudásra vágyunk!
A szükség szüli az új technológiát: Az adatbányászat a nagy mennyiségű adatok félautomatikus elemzése
Adatbányászat
Különböző definíciók
KDD folyamat
Adatbányászat
Az adatbányászat alapvető lépései:
Adatbányászat megközelítések
Hagyományos:
Gépi tanulás:
Adatbányszati feladatok
Használt módszerek
Adat reprezentáció
Jellemző vektor:
Adat reprezentáció
Információ tábla:
Adat reprezentáció
Általános metrikus tér:
Adattisztítás
Felmérjük a hibákat
a hibásnak tűnő adatokat felülvizsgáljuk, javítjuk.
Hiányos adatok
Fajtái:
Nincs univerzálisan alkalmazható megoldás a hiányzó adatok kezelésére
Hiányzó adatok kezelése
Adatközlési és adatbeviteli hibák
Van érték megadva, de az nem illik bele az adatainkba
Adat csökkentés: Dimenzió redukció
Célja: Alacsonyabb dimenzió számú adat reprezentáció keresése, úgy, hogy a reprezentáció információ érteke a lehető legtöbb maradjon
Előnyei:
Fajtái:
Jellemző kiválasztás
Célja: Jellemzők optimális részhalmazának kiválasztása
Oka: Az eredeti jellemzőhalmaz tartalmazhat irreleváns jellemzőket, néhány jellemző redundáns lehet egy másik jellemző szereplésekor.
Az optimális részhalmaz megállapításához egy kiértékelési mérték megadása szükséges, amelyek értékelik a különböző részhalmazokat.
Jellemző kiválasztás fajtái
Jellemző projekció
Célja: A jellemzők transzformációja, összevonása
Oka: Felismerni azokat a jellemzőket, amelyek ugyan külön-külön nem relevánsak, de más jellemzőkkel összefüggésben lehet, illetve azokat, amelyek külön-külön relevánsak, viszont redundánsak lehetnek.
1. Lineáris diszkriminanciaanalízis (LDA)
2. Főkomponens-analízis (PCA)
Az eredetileg megfigyelt változókat korrelációjuk alapján kevesebb számú főkomponens változóvá vonja össze.
A főkomponens a lehető legtöbb információt (varianciát) őrzi meg az eredeti jellemzőkből.
3. Szinguláris érték felbontás (SVD)
Egy mátrixfelbontási eljárás, mely egy tetszőleges, akár nem négyzet alakú mátrixot felbont három alapvető részmátrix szorzatára.
Ezek a részmátrixok tartalmazzák a mátrix szinguláris értékeit (singular values), amelyek segítenek leírni a mátrix struktúráját, és reprezentálják az eredeti adatok fontos jellemzőit.
Csak a legfontosabb szinguláris értékek és vektorok megtartásával lehet csökkenteni a dimenziót
Adat csökkentés: Mintaszám csökkentés
Az eredeti adathalmazt egy kevesebb mintát tartalmazóval helyettesítjük
Fontos, hogy tisztában legyünk az adatok mérete és pontossága közötti kompromisszumokkal, és gondosan felmérjük a kockázatokat és az előnyöket a bevezetés előtt.
Fajtái:
Paraméterezett módszerek
Az adat valamilyen modellel van reprezentálva
A modell az adatok becslésére szolgál, így a tényleges adatok helyett csak az adatok paramétereit kell tárolni.
Nem paraméterezett módszerek
Adathalmaz használata�
Néhány tanító eljárás két állomást igényel
Különböző tanító sémákat szeretnénk összehasonlítani
Így beszélhetünk:
Ezek a halmazok egymástól függetlenek kell, legyenek!
A hibaarány kiszámítása után megtehetjük, hogy a teszt halmazt és a tanító halmazt újra egybeolvasztjuk egy új osztályozó felépítéséhez – ezt fogjuk ténylegesen használni
A paraméteroptimalizálás után a validáló halmaz is visszaolvasztható
Kiértékelés
Kevés az adat, „holdout” módszer – ált. az adat egyharmadát tesztelésre, a maradékot tanításra használjuk
Ha nincs szerencsénk, a tanításra használt minta nem reprezentatív – ált. nem megállapítható
„Stratification” és „stratified holdout” – osztályok arányos reprezentálása
„Repeated holdout” – átlagos hibaarányt számolunk
Keresztvalidáció
Leave-one-out keresztkiértékelés
Annyi partícióra osztjuk fel a bemeneti halmazt, amennyi annak számossága (n)
Pro
Kontra