data mining process models
Ta vadnica o postopku pridobivanja podatkov zajema modele, korake in izzive za pridobivanje podatkov, vključene v postopek pridobivanja podatkov:
Tehnike rudarjenja podatkov so bile podrobno razložene v naši prejšnji vadnici v tem Opravite usposabljanje za rudarjenje podatkov za vse . Podatkovno rudarjenje je obetavno področje v svetu znanosti in tehnologije.
Podatkovno rudarjenje, ki je znano tudi kot Odkrivanje znanja v zbirkah podatkov, je postopek odkrivanja koristnih informacij iz velikih količin podatkov, shranjenih v podatkovnih bazah in podatkovnih skladiščih. Ta analiza je narejena za procese odločanja v podjetjih.
Podatkovno rudarjenje se izvaja z različnimi tehnikami, kot so združevanje v skupine, združevanje in zaporedna analiza vzorcev in drevo odločitev.
Kaj se boste naučili:
- Kaj je rudarjenje podatkov?
- Izvleček podatkov kot postopek
- Modeli podatkovnega rudarjenja
- Koraki v procesu pridobivanja podatkov
- Proces rudarjenja podatkov v Oracle DBMS
- Proces rudarjenja podatkov v zbirki podatkov
- Kakšne so aplikacije za pridobivanje podatkov?
- Izzivi rudarjenja podatkov
- Zaključek
- Priporočeno branje
Kaj je rudarjenje podatkov?
Podatkovno rudarjenje je postopek odkrivanja zanimivih vzorcev in znanja iz velikih količin podatkov. Viri podatkov lahko vključujejo baze podatkov, podatkovna skladišča, splet in druge repozitorije informacij ali podatke, ki se dinamično pretakajo v sistem.
Zakaj podjetja potrebujejo pridobivanje podatkov?
S prihodom velikih podatkov je pridobivanje podatkov postalo bolj razširjeno. Veliki podatki so izredno veliki nabori podatkov, ki jih računalniki lahko analizirajo, da razkrijejo določene vzorce, povezave in trende, ki jih lahko razumemo ljudje. Veliki podatki vsebujejo obsežne informacije o različnih vrstah in raznoliki vsebini.
Tako pri tej količini podatkov preprosta statistika z ročnim posegom ne bi delovala. To potrebo izpolnjuje postopek podatkovnega rudarjenja. To vodi do spremembe od preprostih statistik podatkov do zapletenih algoritmov za rudarjenje podatkov.
Postopek rudarjenja podatkov bo iz surovih podatkov izvlekel ustrezne informacije, kot so transakcije, fotografije, videoposnetki, ploščate datoteke, in samodejno obdelal informacije, da bi ustvaril poročila, ki bodo koristna za ukrepanje podjetij.
Tako je postopek rudarjenja podatkov za podjetja ključnega pomena pri sprejemanju boljših odločitev z odkrivanjem vzorcev in trendov v podatkih, povzetkom podatkov in pridobivanjem ustreznih informacij.
Izvleček podatkov kot postopek
Vsak poslovni problem bo preučil neobdelane podatke, da bi zgradil model, ki bo opisal informacije in predstavil poročila, ki jih bo podjetje uporabljalo. Izdelava modela iz podatkovnih virov in podatkovnih formatov je ponavljajoč se postopek, saj so neobdelani podatki na voljo v številnih različnih virih in številnih oblikah.
Podatki se iz dneva v dan povečujejo, zato lahko, ko se najde nov vir podatkov, lahko spremeni rezultate.
Spodaj je oris postopka.

(slika vir )
Modeli podatkovnega rudarjenja
Številne panoge, kot so proizvodnja, trženje, kemična in vesoljska industrija, izkoriščajo prednosti rudarjenja podatkov. Tako se drastično poveča povpraševanje po standardnih in zanesljivih procesih rudarjenja podatkov.
Pomembni modeli podatkovnega rudarjenja vključujejo:
# 1) Medpanožni standardni postopek za pridobivanje podatkov (CRISP-DM)
CRISP-DM je zanesljiv model rudarjenja podatkov, sestavljen iz šestih faz. To je ciklični postopek, ki zagotavlja strukturiran pristop k procesu rudarjenja podatkov. Šest faz je mogoče izvesti v poljubnem vrstnem redu, včasih pa bi bilo treba vrniti prejšnje korake in ponoviti dejanja.
kaj je funkcionalno testiranje s primeri
Šest faz CRISP-DM vključuje:
# 1) Razumevanje poslovanja: V tem koraku so postavljeni cilji podjetij in odkriti pomembni dejavniki, ki bodo pomagali pri doseganju cilja.
# 2) Razumevanje podatkov: Ta korak bo zbral celotne podatke in jih v orodje vnesel (če uporabljate katero koli orodje). Podatki so navedeni z njihovim virom podatkov, lokacijo, načinom pridobivanja in morebitnimi težavami. Podatki se vizualizirajo in poizvedujejo, da se preveri njihova popolnost.
# 3) Priprava podatkov: Ta korak vključuje izbiro ustreznih podatkov, čiščenje, konstruiranje atributov iz podatkov, integracijo podatkov iz več baz podatkov.
# 4) Modeliranje: V tem koraku je treba izbrati tehniko podatkovnega rudarjenja, kot je drevo odločitev, ustvariti zasnovo testa za oceno izbranega modela, graditi modele iz nabora podatkov in oceniti vgrajeni model s strokovnjaki, da bi razpravljali o rezultatih.
# 5) Vrednotenje: Ta korak bo določil, v kolikšni meri dobljeni model izpolnjuje poslovne zahteve. Vrednotenje lahko izvedemo s testiranjem modela na resničnih aplikacijah. Model se pregleda zaradi morebitnih napak ali korakov, ki jih je treba ponoviti.
# 6) Uvajanje: V tem koraku je izdelan načrt uvajanja, oblikovana je strategija za spremljanje in vzdrževanje rezultatov modela podatkovnega rudarjenja, da se preveri njegova uporabnost, izdelana so končna poročila in pregled celotnega postopka, da se preveri kakršna koli napaka in se ponovi, ali se kateri koli korak ponovi .

(slika vir )
# 2) SEMMA (vzorec, raziskovanje, spreminjanje, modeliranje, ocenjevanje)
SEMMA je še ena metodologija podatkovnega rudarjenja, ki jo je razvil SAS Institute. Kratica SEMMA pomeni vzorec, raziskovanje, spreminjanje, modeliranje, ocenjevanje.
rabim lažni e-poštni naslov
SEMMA omogoča enostavno uporabo raziskovalnih statističnih in vizualizacijskih tehnik, izbiro in preoblikovanje pomembnih napovedanih spremenljivk, ustvarjanje modela s pomočjo spremenljivk, ki prikaže rezultat, in preverjanje njegove natančnosti. SEMMA poganja tudi zelo ponavljajoč se cikel.

Koraki v SEMMA
- Vzorec: V tem koraku se izvleče velik nabor podatkov in vzame vzorec, ki predstavlja celotne podatke. Vzorčenje bo zmanjšalo računske stroške in čas obdelave.
- Raziščite: Podatki se raziščejo za morebitne drugačne primere in nepravilnosti za boljše razumevanje podatkov. Podatki se vizualno preverijo, da se ugotovijo trendi in skupine.
- Spremeni: V tem koraku se manipulacija s podatki, kot je razvrščanje v skupine in podskupine, izvede tako, da se v ospredju ohrani model, ki ga je treba zgraditi.
- Model: Na podlagi raziskav in sprememb so izdelani modeli, ki pojasnjujejo vzorce v podatkih.
- Ocenite: V tem koraku se oceni uporabnost in zanesljivost zgrajenega modela. Tu se opravi testiranje modela glede na resnične podatke.
Tako pristop SEMMA kot CRISP delujeta za postopek odkrivanja znanja. Ko so modeli izdelani, se uporabijo za podjetja in raziskovalno delo.
Koraki v procesu pridobivanja podatkov
Postopek rudarjenja podatkov je razdeljen na dva dela, tj. Obdelavo podatkov in obdelavo podatkov. Predobdelava podatkov vključuje čiščenje podatkov, njihovo integracijo, zmanjšanje in preoblikovanje podatkov. Del podatkovnega rudarjenja izvaja podatkovno rudarjenje, vrednotenje vzorcev in predstavitev znanja.


(slika vir )
Zakaj podatke obdelamo vnaprej?
Številni dejavniki, ki določajo uporabnost podatkov, so natančnost, popolnost, doslednost, pravočasnost. Podatki morajo biti kakovostni, če ustrezajo predvidenemu namenu. Zato je predobdelava ključnega pomena v procesu rudarjenja podatkov. Glavni koraki pri predhodni obdelavi podatkov so pojasnjeni spodaj.
# 1) Čiščenje podatkov
Čiščenje podatkov je prvi korak v podatkovnem rudarjenju. Pomembno je, saj lahko umazani podatki, če se uporabljajo neposredno v rudarstvu, povzročijo zmedo v postopkih in povzročijo netočne rezultate.
V bistvu ta korak vključuje odstranjevanje hrupnih ali nepopolnih podatkov iz zbirke. Na voljo je veliko metod, ki na splošno čistijo podatke same, vendar niso zanesljive.
Ta korak izvaja redno čiščenje tako, da:
(i) Izpolnite manjkajoče podatke:
Manjkajoče podatke lahko zapolnimo z metodami, kot so:
- Ne upoštevanje korice.
- Manjkajočo vrednost izpolnite ročno.
- Uporabite mero centralne tendence, mediano oz
- Izpolnitev najverjetnejše vrednosti.
(ii) Odstranite hrupne podatke: Naključna napaka se imenuje hrupni podatki.
Metode za odstranjevanje hrupa so:
Binning: Metode združevanja se uporabljajo z razvrščanjem vrednosti v vedra ali koše. Glajenje se izvede s pomočjo sosednjih vrednosti.
Kopiranje se opravi z glajenjem s košem, tj. Vsak koš se nadomesti s srednjo vrednostjo koša. Izravnavanje z mediano, kjer je vsaka vrednost bina nadomeščena z mediano bin. Izravnavanje z mejami bina, tj. Najmanjša in največja vrednost v binu sta meji bina in vsaka vrednost bina se nadomesti z najbližjo mejno vrednostjo.
- Prepoznavanje izstopajočih
- Odpravljanje nedoslednosti
# 2) Integracija podatkov
Ko je za analizo kombiniranih več heterogenih podatkovnih virov, kot so zbirke podatkov, kocke podatkov ali datoteke, se ta postopek imenuje integracija podatkov. To lahko pomaga izboljšati natančnost in hitrost procesa rudarjenja podatkov.
Različne zbirke podatkov imajo različne konvencije poimenovanja spremenljivk, saj povzročajo presežke v bazah podatkov. Dodatno čiščenje podatkov lahko izvedete tako, da odstranite presežke in nedoslednosti pri integraciji podatkov, ne da bi to vplivalo na zanesljivost podatkov.
Integracijo podatkov je mogoče izvesti z orodji za selitev podatkov, kot sta Oracle Data Service Integrator in Microsoft SQL itd.
kateri je najboljši računalniški operacijski sistem
# 3) Zmanjšanje podatkov
Ta tehnika se uporablja za pridobivanje ustreznih podatkov za analizo iz zbirke podatkov. Velikost predstavitve je veliko manjša po obsegu, hkrati pa ohranja integriteto. Zmanjšanje podatkov se izvaja z metodami, kot so Naive Bayes, Odločitvena drevesa, Nevronska mreža itd.
Nekatere strategije zmanjševanja podatkov so:
- Zmanjšanje dimenzij: Zmanjšanje števila atributov v naboru podatkov.
- Zmanjšanje števila: Zamenjava prvotnega obsega podatkov z manjšimi oblikami predstavitve podatkov.
- Stiskanje podatkov: Stisnjena predstavitev izvirnih podatkov.
# 4) Preoblikovanje podatkov
V tem postopku se podatki pretvorijo v obliko, primerno za postopek rudarjenja podatkov. Podatki so konsolidirani, tako da je postopek rudarjenja učinkovitejši in vzorce lažje razumljivi. Preoblikovanje podatkov vključuje preslikavo podatkov in postopek ustvarjanja kode.
Strategije za preoblikovanje podatkov so:
- Glajenje: Odstranjevanje šuma iz podatkov z uporabo grozdenja, regresijskih tehnik itd.
- Združevanje: Povzetki se uporabljajo za podatke.
- Normalizacija: Skaliranje podatkov spada v manjši obseg.
- Diskrecija: Neobdelane vrednosti numeričnih podatkov se nadomestijo z intervali. Na primer, Starost.
# 5) Pridobivanje podatkov
Podatkovno rudarjenje je postopek za ugotavljanje zanimivih vzorcev in znanja iz velike količine podatkov. V teh korakih se za pridobivanje podatkovnih vzorcev uporabijo inteligentni vzorci. Podatki so predstavljeni v obliki vzorcev, modeli pa so strukturirani z uporabo tehnik razvrščanja in združevanja.
# 6) Vzorčna ocena
Ta korak vključuje prepoznavanje zanimivih vzorcev, ki predstavljajo znanje na podlagi meril zanimivosti. Metode povzetka in vizualizacije podatkov se uporabljajo, da so podatki uporabniku razumljivi.
# 7) Predstavitev znanja
Predstavitev znanja je korak, kjer se za predstavitev pridobljenih podatkov uporabljajo orodja za vizualizacijo podatkov in predstavitev znanja. Podatki so prikazani v obliki poročil, tabel itd.
Proces rudarjenja podatkov v Oracle DBMS
RDBMS predstavlja podatke v obliki tabel z vrsticami in stolpci. Do podatkov je mogoče dostopati s pisanjem poizvedb v zbirki podatkov.
Relacijski sistemi za upravljanje baz podatkov, kot je Oracle, podpirajo pridobivanje podatkov s pomočjo CRISP-DM. Oprema baze podatkov Oracle je koristna pri pripravi in razumevanju podatkov. Oracle podpira podatkovno rudarjenje prek vmesnika java, vmesnika PL / SQL, avtomatiziranega rudarjenja podatkov, funkcij SQL in grafičnih uporabniških vmesnikov.
Proces rudarjenja podatkov v zbirki podatkov
Podatkovno skladišče je oblikovano za večdimenzionalno podatkovno strukturo, imenovano podatkovna kocka. Vsaka celica v podatkovni kocki shrani vrednost nekaterih skupnih mer.
Podatkovno rudarjenje v večdimenzionalnem prostoru poteka v slogu OLAP (spletna analitična obdelava), kjer omogoča raziskovanje več kombinacij dimenzij na različnih stopnjah razdrobljenosti.
Kakšne so aplikacije za pridobivanje podatkov?
Seznam področij, kjer se rudarjenje podatkov pogosto uporablja, vključuje:
# 1) Analiza finančnih podatkov: Podatkovno rudarjenje se pogosto uporablja v bančništvu, naložbah, kreditnih storitvah, hipotekarnih posojilih, avtomobilskih posojilih in zavarovalniških in investicijskih storitvah. Podatki, zbrani iz teh virov, so popolni, zanesljivi in kakovostni. To olajša sistematično analizo in rudarjenje podatkov.
# 2) Maloprodajna in telekomunikacijska industrija: Trgovina na drobno zbira ogromne količine podatkov o prodaji, nakupovalni zgodovini strank, prevozu blaga, porabi in storitvah. Trgovanje podatkov na drobno pomaga prepoznati vedenja kupcev, njihove vzorce nakupovanja in trende, izboljšati kakovost storitev za stranke, boljše zadrževanje strank in zadovoljstvo.
# 3) Znanost in inženirstvo: Računalništvo in inženiring za podatkovno rudarjenje lahko pomagata spremljati stanje sistema, izboljšati delovanje sistema, izolirati napake v programski opremi, odkriti plagiat programske opreme in prepoznati sistemske okvare.
# 4) Odkrivanje in preprečevanje vdorov: Vdor je opredeljen kot vse vrste dejanj, ki ogrožajo integriteto, zaupnost ali razpoložljivost omrežnih virov. Načini rudarjenja podatkov lahko pomagajo sistemu za odkrivanje in preprečevanje vdorov izboljšati njegovo delovanje.
# 5) Sistemi priporočil: Sistemi priporočil pomagajo potrošnikom tako, da dajejo priporočila za izdelke, ki zanimajo uporabnike.
Izzivi rudarjenja podatkov
Spodaj so navedeni različni izzivi, ki jih vključuje rudarjenje podatkov.
- Data Mining potrebuje velike zbirke podatkov in zbiranje podatkov, ki jih je težko upravljati.
- Za postopek rudarjenja podatkov so potrebni strokovnjaki za domene, ki jih je spet težko najti.
- Integracija iz heterogenih baz podatkov je zapleten postopek.
- Treba je spremeniti prakse na organizacijski ravni, da se bodo uporabili rezultati podatkovnega rudarjenja. Prestrukturiranje postopka zahteva trud in stroške.
Zaključek
Podatkovno rudarjenje je ponavljajoč se postopek, pri katerem je postopek izkopavanja mogoče izpopolniti, nove podatke pa je mogoče integrirati za doseganje učinkovitejših rezultatov. Data Mining izpolnjuje zahteve po učinkoviti, razširljivi in prilagodljivi analizi podatkov.
Lahko ga obravnavamo kot naravno vrednotenje informacijske tehnologije. Kot postopek odkrivanja znanja naloge priprave in rudarjenja podatkov zaključijo postopek rudarjenja podatkov.
Procesi podatkovnega rudarjenja se lahko izvajajo na vseh vrstah podatkov, kot so podatki iz baz podatkov in napredne zbirke podatkov, kot so časovne vrste itd. Postopek rudarjenja podatkov ima tudi svoje izzive.
Spremljajte našo prihajajočo vadnico, če želite izvedeti več o primerih rudarjenja podatkov !!
PREV Vadnica | NASLEDNJA Vadnica
Priporočeno branje
- Podatkovno rudarjenje: postopek, tehnike in glavna vprašanja pri analizi podatkov
- Tehnike rudarjenja podatkov: algoritem, metode in najboljša orodja za rudarjenje podatkov
- 10 najboljših orodij za preslikavo podatkov, uporabnih v postopku ETL (2021 LIST)
- 10 najboljših orodij za načrtovanje zbirk podatkov za izdelavo kompleksnih podatkovnih modelov
- Data Mining Vs Machine Learning Vs Umetna inteligenca Vs Poglobljeno učenje
- 15 najboljših brezplačnih orodij za pridobivanje podatkov: Najobsežnejši seznam
- Preskusite koncept, postopek in strategijo upravljanja podatkov
- Parametrizacija podatkov JMeter z uporabniško določenimi spremenljivkami