0% au considerat acest document util (0 voturi)
6 vizualizări20 pagini

Studiu

Lucrarea explorează conceptul de data mining distribuit, o metodă inovatoare pentru analiza volumelor mari de date dispersate geografic, utilizând algoritmi avansați pentru extragerea de informații relevante. Aceasta abordează provocările gestionării datelor din diverse domenii, cum ar fi sănătatea și economia, și analizează avantajele și limitările metodei. Studiile comparative incluse oferă o perspectivă asupra performanțelor algoritmilor utilizați în funcție de tipul de date și contextul aplicării.

Încărcat de

Georgiana
Drepturi de autor
© All Rights Reserved
Respectăm cu strictețe drepturile privind conținutul. Dacă suspectați că acesta este conținutul dumneavoastră, reclamați-l aici.
Formate disponibile
Descărcați ca PDF, TXT sau citiți online pe Scribd
0% au considerat acest document util (0 voturi)
6 vizualizări20 pagini

Studiu

Lucrarea explorează conceptul de data mining distribuit, o metodă inovatoare pentru analiza volumelor mari de date dispersate geografic, utilizând algoritmi avansați pentru extragerea de informații relevante. Aceasta abordează provocările gestionării datelor din diverse domenii, cum ar fi sănătatea și economia, și analizează avantajele și limitările metodei. Studiile comparative incluse oferă o perspectivă asupra performanțelor algoritmilor utilizați în funcție de tipul de date și contextul aplicării.

Încărcat de

Georgiana
Drepturi de autor
© All Rights Reserved
Respectăm cu strictețe drepturile privind conținutul. Dacă suspectați că acesta este conținutul dumneavoastră, reclamați-l aici.
Formate disponibile
Descărcați ca PDF, TXT sau citiți online pe Scribd

UNIVERSITATEA POLITEHNICA BUCUREȘTI

FACULTATEA DE AUTOMATICĂ ȘI CALCULATOARE


DEPARTAMENTUL CALCULATOARE

RAPORT DE CERCETARE

Data Mining Distribuit

Săvulescu Andrei

Coordonator științific:
Prof. dr. ing. Florin Rădulescu

BUCUREŞTI

2025
Cuprins

Sinopsis 3
Abstract 4
1. Introducere 6
1.1 Context 6
1.2 Obiective 6
1.3 Structura lucrării 6
2. Concepte fundamentale 7
2.1 Tehnologia de asociere a datelor 9
2.2 Tehnologia de clasificare a datelor 11
2.3 Tehnologia de clusterizare a datelor (Data Clustering Technology) 13
3. Studii comparative 14
4. Stadiul actual 17
Concluzii 19
BIBLIOGRAFIE 20
Lista Figurilor
Figura 1. Tehnologiile de data mining ................................................................................. 9

Figură 2. Clase de activități de data mining ....................................................................... 11


Sinopsis

Data mining-ul distribuit reprezintă o direcție inovatoare de cercetare care abordează


provocările procesării și analizei volumelor mari de date dispersate geografic. Această
abordare implică utilizarea algoritmilor avansați pentru extragerea informațiilor relevante din
surse multiple, păstrând în același timp confidențialitatea și integritatea datelor. Prin
combinarea datelor din locații distribuite, această tehnologie facilitează descoperirea de
tipare complexe și generarea de rapoarte detaliate. Aplicațiile includ optimizarea proceselor
organizaționale, îmbunătățirea sistemelor de recomandare și predicții în domenii precum
sănătate, economie și securitate cibernetică.
Abstract

Data mining-ul distribuit reprezintă o abordare modernă în procesarea și analiza


datelor, care permite extragerea informațiilor din surse multiple, păstrând caracterul
descentralizat al acestora. Această metodologie devine din ce în ce mai relevantă în contextul
volumelor mari de date generate de diverse domenii, precum financiar, medical sau
industrial. Prin utilizarea algoritmilor avansați, data mining-ul distribuit facilitează
identificarea tiparelor complexe, realizarea de predicții precise și sprijinirea deciziilor
strategice în organizații.

Lucrarea de față explorează conceptele fundamentale ale data mining-ului distribuit,


analizează cei mai utilizați algoritmi, precum și aplicațiile acestora în scenarii practice. De
asemenea, sunt discutate avantajele și limitările acestei metode, evidențiindu-se rolul său
esențial în gestionarea datelor din medii distribuite. Studiile comparative prezentate
subliniază performanțele diferiților algoritmi în funcție de tipul datelor și de contextul
aplicării, oferind astfel o perspectivă amplă asupra acestui domeniu inovator. Concluziile
lucrării propun direcții viitoare de cercetare și dezvoltare în data mining-ul distribuit.
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

1. Introducere
1.1 Context
În contextul dezvoltării accelerate a domeniilor precum economic, financiar, medical și
tehnologic, gestionarea și analiza volumelor mari de date reprezintă o provocare majoră. În
multe cazuri, aceste date sunt distribuite în multiple locații geografice sau organizaționale,
ceea ce impune utilizarea unor metode avansate de analiză. Data mining-ul distribuit a apărut
ca o soluție modernă pentru a analiza și interpreta aceste date, păstrând caracterul
descentralizat al surselor.
Conceptul de data mining a evoluat semnificativ odată cu creșterea cantităților de date
generate în era digitală. Prin distribuirea procesării datelor, se pot obține informații complexe
din surse multiple fără a transfera toate datele într-o locație centralizată, ceea ce reduce
costurile și timpul de procesare, păstrând totodată confidențialitatea datelor sensibile.
Data mining-ul distribuit utilizează algoritmi avansați care pot extrage tipare și corelații
complexe, sprijinind luarea deciziilor informate în diverse domenii, cum ar fi: analiza pieței
financiare, predicția tendințelor economice, diagnosticarea medicală bazată pe date istorice
și chiar detecția de anomalii în securitatea cibernetică.
Prezenta lucrare își propune să exploreze metodele și algoritmii specifici data mining-
ului distribuit, să evidențieze beneficiile acestora și să analizeze limitările pe care le întâmpină
în practică.

1.2 Obiective
Obiectivul principal al acestei lucrări este să ofere o analiză detaliată a data mining-ului
distribuit și a aplicațiilor acestuia în domenii diverse. Printre obiectivele specifice se numără:
⮚ Identificarea avantajelor și provocărilor data mining-ului distribuit;
⮚ Analiza celor mai utilizați algoritmi de data mining distribuit;
⮚ Compararea performanțelor diferiților algoritmi în contexte practice;
⮚ Explorarea aplicațiilor acestora în scenarii reale, cum ar fi analiza datelor financiare,
medicale sau industriale.

1.3 Structura lucrării


Această lucrare este organizată în cinci secțiuni, fiecare abordând aspecte
fundamentale legate de data mining-ul distribuit:
⮚ Prima secțiune introduce tema, motivația lucrării, obiectivele și structura acesteia.
⮚ Secțiunea a doua prezintă conceptele fundamentale, inclusiv definiția data mining-
ului, principiile de funcționare și tehnologiile folosite.

6
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

⮚ Secțiunea a treia detaliază stadiul actual al cercetării în acest domeniu și exemple


relevante de aplicare în viața reală.
⮚ În ultima secțiune, sunt expuse concluzii legate de beneficiile și limitările data mining-
ului, împreună cu direcții posibile de dezvoltare viitoare.

2. Concepte fundamentale

În toate domeniile, industrial, social, afaceri, agricultură, etc., există o cantitate impresionantă
de date provenite din studii, experimente, prelucrări diverse. Pentru a deveni cu adevărat
utile, aceste date trebuie stocate în baze de date, sistematizate și clasificate în funcție de
obiectivele fiecărei etape din activitatea companiei care utilizează aceste date.
Exploatarea datelor a fost propusă pentru prima dată la cea de a 11a Conferință
comună internațională privind inteligența artificială în 1989. Conceptul de data mining a
apărut din învățarea automată, sistemele de baze de date, recunoașterea modelelor și
statistici.
Data mining este procesul de extragere a informațiilor și cunoștințelor utile din
volume mari de date. Prin statistici, învățare automată, recunoaștere a modelelor și alte
tehnologii, datele sunt analizate și procesate pentru a descoperi potențiale modele și legi de
distribuție a acestora.
Apariția bazelor de date la scară foarte mare (big data) face necesară dezvoltarea unor
metode automate de colectare a datelor pentru a face față cantității mari de date.
Progresele rapide în tehnologia calculatoarelor, inclusiv o prelucrare mai rapidă și
mai puternică, precum și apariția și dezvoltarea arhitecturii paralele, pun o bază solidă pentru
tehnologia data mining. În plus, realizarea accesului la date de mare viteză și aplicarea
aprofundată a metodelor statistice în domeniul prelucrării datelor promovează și mai mult
cercetarea tehnologiei data mining. Apariția tehnologiei data mining este rezultatul cererii
de prelucrare a informațiilor în era big data. Era big data generează o cantitate mare de date
care pot fi utilizate pe scară largă și este nevoie urgentă de o tehnologie care să transforme
aceste date în informații și cunoștințe utile.
Tehnologia data mining este o tehnologie care explorează potențialul datelor prin
clasificarea și gruparea datelor conexe și descoperirea tiparelor și relațiilor dintre date.
Aceasta include trei părți de bază:
⮚ pregătirea datelor
⮚ explorarea tiparelor de date
⮚ exprimarea datelor
Cerința prealabilă înainte de lansarea extragerii de date este configurarea modelului

7
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

și a motorului de extracție, astfel încât să poată realiza clasificarea datelor, gruparea și


descoperirea modelelor conform așteptărilor. Accentul în data mining se pune pe
preprocesarea datelor, care este fundamentul întregii aplicații de extragere a datelor, iar
calitatea acesteia afectează direct rezultatul final [1].
Exploatarea datelor poate fi definită atât din perspectiva tehnică, cât și din
perspectiva comercială.
⮚ Din punct de vedere tehnic, procesul de extragere a informațiilor și cunoștințelor
evidente sau potențial utile din cantități masive de date se numește data mining.
⮚ Din perspectivă comercială, data mining-ul este o tehnologie de procesare a
informațiilor de afaceri.
Procesul specific al tehnologiei de extragere a datelor este împărțit în principal în cinci pași:
1. Stabilirea scopului extragerii de date care implică:
⮚ determinarea obiectivul general al sarcinii de extragere;
⮚ efectuarea unei evaluări preliminare bazată pe obiectiv;
⮚ determinarea tipului de date necesar, costurile resurselor, riscurile
corespunzătoare;
⮚ alegerea unei implementări specifice planului bazat pe rezultatele evaluării.
2. Pregătirea datelor implică:
⮚ selectarea tipului datelor;
⮚ alegerea sursei de extragere a datelor;
⮚ preprocesarea datelor care include:
✔ gestionarea valorilor lipsă;
✔ asigurarea coerenței datelor;
✔ conversia și optimizarea datelor etc.
3. Modelare matematică implică:
⮚ selectarea unui model adecvat în funcție de situația specifică;
⮚ evaluarea modelului după construirea lui;
⮚ validarea încrucișată poate fi folosită pentru a evalua rezultatele și algoritmii
de optimizare, cum ar fi metoda de reducere a gradientului, pot fi utilizați
pentru a optimiza parametrii;
⮚ selectarea modelului cel mai potrivit pe baza rezultatelor evaluării.
4. Evaluarea rezultatelor implica:
⮚ obținerea rezultatelor preliminare cu modelul selectat;
⮚ decizie cu privire la adecvată soluției alese:
✔ dacă modelul poate rezolva problema reală în conformitate cu
cerințele specifice sarcinii, este ales acest model pentru
implementarea afacerii
8
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

✔ altfel, este re-optimizat modelul sau este construit un alt model.


5. Aplicație model: sunt implementate modele adecvate pentru studiile de caz.

2.1 Tehnologia de asociere a datelor


Conceptul de tehnologie de asociere a datelor
Tehnologia de asociere a datelor este utilizată în principal pentru a descoperi
corelația dintre elementele de date valoroase din datele la scară largă și în principal (figura
1):
⮚ reguli de asociere
⮚ secvențe șablon
⮚ analiza corelației
⮚ alte tehnologii.

Figura 1. Tehnologiile data mining


Reguli de asociere
Analiza de asociere este o metodă de explorare a relațiilor dintre elementele de date
și poate fi utilizată pentru a explora tipare frecvente, reguli de asociere sau dependențe.
Analiza de asociere poate fi utilizată pentru a identifica seturi de elemente care apar
simultan într-un anumit set de date (figura 2).
Regulile de asociere sunt reguli care descriu relația dintre elementele setului de date.
Cei trei indicatori importanți ai regulilor de asociere sunt:
9
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

⮚ Support indică frecvența de apariție a setului de elemente în întregul set de date.


⮚ Confidence indică probabilitatea ca setul de elemente B să apară și atunci când
apare setul de elemente A.
⮚ Lift indică gradul de asociere între două seturi de articole.
Algoritmii obișnuiți pentru extragerea regulilor de asociere includ Apriori, FP-Growth și
Eclat.

Identificarea secvențelor șablon (Sequence Pattern Mining)


Descoperirea sub-secvențelor frecvente în datele seriei cronologice este cunoscută
sub denumirea de Sequence Pattern Mining, iar algoritmii obișnuiți pentru extragerea
acestora includ GSP (Generalized Sequential Pattern) și PrefixSpan.
Algoritmul GSP descoperă sub-secvențe frecvente prin extinderea modelului de
secvență în funcție de pași. Pașii algoritmului GSP sunt:
⮚ Generarea secvențelor de interes
⮚ Scanarea bazei de date
⮚ Extragerea rezultatelor
⮚ Repetarea procesului.
Algoritmul PrefixSpan identifică sub-secvențele frecvente proiectând recursiv
(recursively projecting) baza de date.
Pașii algoritmului PrefixSpan sunt:
⮚ proiecția bazei de date
⮚ exploatarea recursivă.

Analiza corelației
Analiza corelației este adesea folosită pentru a măsura puterea și direcția relației
dintre variabile. Metodele comune includ:
⮚ coeficientul de corelație Pearson
⮚ coeficientul de corelație al rangului Spearman.
Coeficientul de corelație Pearson este utilizat în principal pentru a măsura relația
liniară dintre două variabile continue, iar valoarea acestuia variază de la -1 la 1.
Coeficientul de corelație a rangului Spearman, pe de altă parte, este utilizat pentru a
măsura relația monotonă dintre două variabile și este aplicabil atât variabilelor continue
(reale), cât și întregi.

10
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

Figura 2. Clase de activități data mining

2.2 Tehnologia de clasificare a datelor

Tehnica de clasificare a datelor este una dintre tehnicile de bază de data mining și are la
bază construirea unui model de clasificare prin analiza setului de date existent, apoi folosește
acest model pentru a clasifica noile date.
Scopul principal al tehnicilor de clasificare a datelor este de a atribui eșantioanele dintr-
un set de date unor categorii predefinite, ceea ce necesită construirea unui model adecvat
care să poată clasifica cu precizie datele pe baza caracteristicilor eșantionului. Modelul sau
algoritmul utilizat pentru clasificare este cunoscut sub numele de clasificator.
Tehnologiile de clasificare a datelor includ în principal:
⮚ arbori de decizie
⮚ mașini de suport vector (support vector machines)
⮚ naive Bayes
⮚ algoritmi k-nearest neighbor algorithms
⮚ rețele neuronale etc.
Modelul arborelui de decizie este un tip de model arborescent. Este o metodă de
învățare automată supravegheată neparametrică și un model utilizat în mod obișnuit în
domeniul extragerii datelor și învățării automate.
Algoritmi uzuali pentru modelul arborelui de decizie [2]:
⮚ dihotomizatorul iterativ (Iterative dichotomiser) ;
11
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

⮚ arborele de clasificare și regresie (CART);


⮚ detectorul de interacțiune automată chi-pătrat (CHAID);
⮚ arborele statistic eficient și imparțial rapid (quick unbiased efficient statistical tree)
(QUEST).
Mașina de suport vector (support vector machines) este un algoritm de
recunoaștere a modelelor utilizat pe scară largă și un algoritm de clasificare binar bazat pe
teoria învățării statistice. Poate mapa datele brute de intrare la un anumit punct din spațiul
de dimensiuni mari.
Deoarece diferite tipuri de date de eșantion de intrare sunt grupate în diferite locații
în spațiul de dimensiuni înalte, poate realiza clasificarea și recunoașterea diferitelor tipuri
de date de intrare prin găsirea hiperplanului adecvat. Astfel, atunci când date noi sunt
mapate în același spațiu dimensional mare, se poate prezice cărei categorii îi aparțin pe baza
locației punctelor la care sunt mapate [3].
Algoritmul Naive Bayes este un clasificator probabilist simplu bazat pe teorema
Bayes, care presupune că acele caracteristici care afectează clasificarea sunt independente
unele de altele. Deși, în realitate, caracteristicile probabil nu sunt complet independente.
Algoritmul Naive Bayes se bazează pe formula Bayes și poate calcula probabilitatea
posterioară a unei categorii având în vedere un set de caracteristici. Algoritmul Naive Bayes
folosește datele caracteristicilor pentru a calcula probabilitatea fiecărei categorii și apoi
selectează categoria cu cea mai mare probabilitate ca rezultat final [4].
Algoritmul k-Nearest Neighbors (k-NN) este o metodă de învățare bazată pe instanțe
care selectează k-Nearest Neighbors calculând distanța unui eșantion nou de la
eșantioanele din setul de antrenament și decide clasa noului eșantion în mod majoritar
vot.
Rețeaua neuronală este abrevierea rețelei neuronale artificiale.
⮚ Este inspirat de modul de lucru al sistemului nervos al creierului uman.
⮚ Este în esență un model matematic.
⮚ Similar cu rețeaua neuronală a creierului uman, rețeaua neuronală artificială este
compusă din neuroni artificiali și conexiunea dintre neuroni. Printre acești
neuroni, există două tipuri de neuroni speciali, unul pentru primirea informațiilor
externe și celălalt pentru eliberarea de informații. Prin urmare, rețeaua neuronală
poate fi privită ca un sistem de procesare a informațiilor de la intrare la ieșire. Prin
introducerea de informații în rețeaua neuronală, rezultatul clasificării poate fi
obținut prin stratul de ieșire.

12
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

2.3 Tehnologia de clusterizare a datelor (Data Clustering Technology)

Gruparea datelor este o tehnică de grupare a obiectelor de date, astfel încât datele din
același grup să fie similare între ele, în timp ce cele din grupuri diferite sunt diferite.
Elementul cel mai important al tehnologiei este gruparea, adică setul de date este împărțit
într-un număr de subseturi disjunse, iar scopul analizei grupării este de a maximiza
similaritatea intra- cluster și de a minimiza similitudinea dintre clustere.
Tehnicile de grupare a datelor includ în principal:
⮚ clustering K-means;
⮚ clustering ierarhic;
⮚ DBSACAN;
⮚ OPTICS;
⮚ model de amestec Gaussian;
⮚ alți algoritmi obișnuiți.
În procesul de analiză a grupării K-means, numărul de clustere K este mai întâi
determinat, iar apoi K seturi de date de eșantion sunt selectate aleatoriu ca centre de cluster
inițiale. Distanța euclidiană este utilizată ca standard pentru măsurarea similarității, iar
eroarea pătrată este utilizată ca funcție de criteriu de grupare. Apoi repetați iterația pentru
a minimiza valoarea funcției obiectiv. Algoritmul K-means este simplu și are o eficiență de
calcul ridicată, dar este sensibil la inițializare și este predispus să se oprească la optimul local
[5].
Gruparea ierarhică (Hierarchical clustering) realizează gruparea datelor prin
construirea unui arbore ierarhic (dendrogram). Conform diferitelor metode de construcție,
acesta este împărțit în clustering ierarhic nedivizibil (agglomerative) și clustering ierarhic
divizibil. Gruparea ierarhică nu necesită un număr prestabilit de categorii și are o flexibilitate
ridicată, dar complexitatea de calcul este mare.
DBSCAN (Density-Based Spatial Clustering of Applications with Noise) este o
metodă de grupare spațială bazată pe densitate care grupează datele în funcție de
densitate. Metoda măsoară densitatea spațiului în care se află un punct în ceea ce privește
numărul de puncte de date din domeniul acelui punct și caută continuu punctele învecinate
pentru a clasifica datele care sunt suficient de dense pentru a fi clasificate în clustere. Poate
clasifica datele spațiale cu zgomot în grupuri de formă arbitrară [6].
OPTICS este un algoritm de clustering neparametric bazat pe densitate. Având în
vedere un set de nori de puncte într-un anumit spațiu, va scoate un set de secvențe de nori
de puncte, care conțin informații de grupare sub diferite praguri de densitate. Pe baza
acestor informații, rezultatele de ieșire pot fi ajustate în mod flexibil [7].

13
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

Modelul de amestec gaussian este o metodă de grupare bazată pe distribuția


probabilității, care se potrivește setului de date prin amestecarea mai multor distribuții
gaussiene. Modelul de amestec Gaussian presupune că datele provin dintr-un amestec de
distribuții Gaussiene multiple, fiecare distribuție Gaussiană corespunde unui cluster, iar
probabilitatea ca fiecare punct de date să aparțină unui cluster este cunoscută.

3. Studii comparative
Tehnica Bayes [8]
Limitele tehnicii. Pentru instanțele care aparțin setului de date utilizat la calculul
probabilităților a priori și al celor condiționale, “predicția” atributului-obiectiv este 100%
corectă. Însă pentru instanțe din afara setului de date de instruire, eficiența algoritmului este
puternic afectată de prezenta unor probabilități condiționate egale sau foarte aproape de
zero.
O alta limită a algoritmului provine din asumpția ca între atributele independente din
setul de date exista (teoretic) o independența statistică. Aceasta asumpție stă și la originea
adjectivului “naiv” din denumirea algoritmului, având în vedere că independența statistică de
regulă nu se verifică și în practică. Algoritmul este limitat din punct de vedere al inputului la
date booleene sau categorice. Dincolo de efortul de preprocesare necesar pentru
transformarea datelor cu caracter continuu în intervale valorice, așa cum s-a mai menționat,
operațiunea este de multe ori dependentă de experiența și chiar intuiția analistului, factori
subiectivi care vor marca rezultatele explorării.
Avantajele tehnicii. Ținând seama de faptul că pentru calculul probabilităților nu este nevoie
decât de o singură parcurgere a setului de date, algoritmul prezintă avantajul important al
unei viteze mari de construire a modelului de clasificare.
Un alt avantaj semnificativ, algoritmul prezintă capacitatea de a realiza predicții din
informații parțiale. În ciuda sensibilității la caracteristici slab reprezentate în setul de date,
pentru realizarea unei predicții algoritmul nu are obligatoriu nevoie de toate atributele
independente, astfel încât cele identificate de analist a fi irelevante pot fi ușor eliminate din
algoritm. De fapt, chiar daca nu s-ar cunoaște nimic despre atributele independente, analistul
tot ar putea face o predicție (fără pretenția de a fi foarte exactă) numai pe baza
probabilităților a priori.
Modelul obținut prin aplicarea algoritmului are și un conținut descriptiv, care poate fi
util analistului. Probabilitățile condiționate aferente fiecărui atribut independent pot fi
utilizate în a descrie legătura dintre acestea și atributul-obiectiv.

k-NN.
Limitele tehnicii. Timpul de calcul este direct proporțional cu numărul de instanțe din setul
de date. Din acest motiv, pentru seturi mari de date se impune ca în etapa de preprocesare,

14
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

din setul inițial de date să se selecteze un subset de instanțe cu dimensiuni rezonabile.


Algoritmul lucrează eficient în probleme de clasificare atunci când toate clasele aferente
atributului-obiectiv au o reprezentare egală ca pondere în setul de date, fapt care face
necesara “îmbogățirea” setului de date original. Algoritmul pe care se bazează tehnic k-NN
permite doar realizarea unei estimări a valorii atributului-obiectiv, fără a produce informații
suplimentare despre instanța supusă analizei, despre structura setului de date ori despre
categoriile de clasificare a atributului-obiectiv.
De cele mai multe ori este dificil de stabilit ce tip de funcție estimează cel mai bine
distanța dintre doua instanțe. Deși din punct de vedere matematic tehnica permite calculul
distantelor și pentru atribute categorice și booleene, în astfel de cazuri metrica devine
puternic influențată de transformările aplicate de analist setului de date în preprocesare. De
aceea, k-NN este de preferat a fi utilizată mai mult în situațiile în care pentru toate atributele
instanțelor se poate aplica aceeași funcție de distanță.
Avantajele tehnicii. Tehnica permite clasificarea în multiple clase și modelarea relațiilor
neliniare dintre date (în probleme de predicție). Pentru tehnicile care necesita o etapa de
învățare a cărei output îl constituie un model predictiv, exista riscul ca acest model sa devină
desuet în timp, iar predicțiile realizate în baza lui sa piardă din reprezentativitate. În cazul k-
NN, modelul îl constituie chiar setul de date, care se presupune ca odată supus analizei, este
deja în forma sa cea mai recentă. Chiar daca de multe ori pot apărea dificultăți în stabilirea
unei metrici eficiente, algoritmul este unul dintre putinele care acceptă ca input date de
natura diferită (continua, categorica, booleana etc.).

Rețele neuronale
Limitele tehnicii. Rețelele neuronale nu operează decât direct asupra variabilelor numerice.
Drept urmare, orice variabila non- numerică din setul de date care se dorește analizat va
trebui convertită în variabilă numerică înainte de utilizarea sa în instruirea rețelei. În cazul
problemelor complexe, utilizatorul este pus în situația de a rezolva un compromis, între a
creste numărul de neuroni ascunși, ceea ce poate conduce la o instruire foarte lenta si a
accepta o topologie mai simplă, asociată unei soluții mai puțin precise. Pentru seturi de date
cu număr mare de atribute, folosirea rețelelor neuronale devine nefezabilă.
Determinarea numărului de neuroni ascunși, pentru probleme complexe de
clasificare, nu se poate face decât experimental, ceea ce pe de o parte crește substanțial
timpul alocat căutării modelului optim de clasificare, iar pe de altă parte lasă calitatea
rezultatelor analizei sa depindă de nivelul de experiență al utilizatorului. Absența
componentei descriptive într-un model generat de o rețea neuronală face ca evoluția
modelului în etapa de instruire să fie lipsită de transparența pentru utilizator. Datorită
acestei caracteristici, tehnica este deseori comparată cu o “cutie neagră”. Totuși, cea mai
supărătoare caracteristică a rețelelor neuronale este timpul îndelungat necesar pentru o
buna instruire, fapt corelat cu necesitatea existentei unui număr relativ mare de instanțe în

15
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

setul de instruire.
Avantajele tehnicii. Rețeaua odată instruită poate realiza predicții rapide pentru instanțe noi.
Aceasta caracteristică face ca rețelele neuronale sa fie utilizate cu succes în probleme care
necesita răspuns în timp real. Până în prezent, rețelele neuronale reprezintă metoda cea mai
eficienta de modelare a unor relații neliniare. Mai mult, aplicațiile de până acum au
demonstrat aplicabilitatea acestei tehnici în domenii dificil de modelat, precum vederea
electronica sau recunoaștere vocala. Spre deosebire de celelalte tehnici de data mining,
rețelele neuronale nu restricționează output-ul la un singur atribut. Folosind o arhitectură de
rețea potrivita se pot obține predicții simultane pentru mai multe variabile, ceea ce poate
însemnă o eficientizare semnificativă a proceselor de explorare a datelor.

Arbori decizionali
Limitele tehnicii. Majoritatea algoritmilor nu folosesc întregul set de date indicat de utilizator
pentru inducție. Pentru acești algoritmi, construirea arborelui presupune transferul
instanțelor din setul de date de instruire în memoria RAM. Dimensiunea limitată a memoriei
face ca programul să transfere în RAM numai un subset de date, selectat aleator. În
consecința, gradul de reprezentativitate al modelului construit este determinat de
capacitatea aplicație de a selecta un subset reprezentativ pentru întreg setul de inducție. O
critică adusă frecvent arborilor decizionali este aceea că algoritmii de inducție nu iau în
considerare la momentul splitării efectul pe care respectiva separare o are asupra viitoarelor
splitări. În plus, toate separările se fac secvențial, ceea ce determină dependența fiecărei
splitări de cele precedente.
Avantajele tehnicii. Majoritatea algoritmilor care construiesc arbori decizionali pot fi aplicați
fără restricții legate de tipul datelor. Deși variabila dependentă trebuie sa fie de natură
numerică (în cazul problemelor de regresie) sau categorică (în cazul problemelor de
clasificare), pentru majoritatea algoritmilor, variabilele independente pot lua valori în orice
domeniu. Tehnica se caracterizează prin capacitate de prelucrare a unor seturi de date cu
număr mare de atribute. Există situații în care o instanță poate fi descrisă printr-un număr
relativ mare de atribute, de ordinul sutelor sau chiar miilor. În astfel de situații, explorarea
prin tehnica arborilor decizionali reprezintă singura alternativa, cei mai mulți algoritmi fiind
capabili sa trateze seturi de date cu peste 1000 de coloane.

Algoritmii de construire a arborilor decizionali necesită un număr redus de parcurgeri


a setului de date utilizat în inducție. Consecința directa a acestei caracteristici funcționale este
rapiditatea procesului de inducție si aplicarea eficienta asupra seturilor mari de date.
Forma outputului permite nu numai realizarea de previziuni și clasificări, ci și descrierea
relațiilor existente între variabilele independente și variabila dependentă. În plus, forma
grafica a outputului facilitează analiza relațiilor. Există aplicații care permit reprezentarea
arborelui sub forma unui set de reguli care, pentru arbori de dimensiuni mari, este mai ușor
de înțeles.
16
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

4. Stadiul actual
Deși fișierele și bazele de date mari sunt bine cunoscute de mult timp, se poate
considera că primele investigații în Data Mining au început la sfârșitul anilor 80. Astfel, primele
ateliere de lucru (workshop-uri) au avut loc în 1989, 1991, 1993 si 1994. De altfel, rezultatele
atelierului din 1994, completate și sistematizate, au fost introduse în cartea editată de
[Link] et al. Începând din 1995, atelierele de lucru s-au transformat în conferințe anuale.
Astfel, prima conferință anuală a avut loc la Palais Des Congres din Montreal, Canada, în 20-
21 august 1995. A doua conferință anuală a avut loc la Portland, Oregon, SUA, în 2-4 august
1996 cu o participare de peste 500 de persoane. Principalele rezultate ale acestei conferințe
au fost prezentate într-un număr special al prestigioasei reviste Communications of ACM vol.
39, nr. 11, din noiembrie 1996. În sfârșit, în 1997 a avut loc cea de a treia conferință în
domeniul DM și KDD, la Newport Beach, California, în perioada 14-17 august 1997. De altfel,
în 1997 vor avea loc cel puțin 11 manifestări de importantă majoră în acest domeniu [8].

În 1997 este anunțată apariția primului număr al unei reviste destinate acestui
domeniu, intitulată Data Mining and Knowledge Discovery. Ea se va adăuga unei alte reviste
gratuite pe Internet, KDD Nugget, care începând din 1993 a reușit să apară în 108 numere. Un
site excelent, în care se poate găsi această revistă precum și multe alte informații legate de
DM si KDD, este cel al GTE, întreținut de Gregory Piatetsky-Shapiro de la GTE si de Michael
Bedows de la Boston University. Numărul articolelor care se scriu despre acest domeniu este
impresionant. Astfel, reviste de informatică cu o mare circulație, ca Datamation, BYTE, LAN
Magazine, alături de reviste cu o reputație științifică deosebită, consacră numere sau secțiuni
speciale domeniului. Alte reviste, cum ar fi Journal of Intelligent Information Systems (JIIS-
Kluwer), Machine Learning, Intelligent Data Analysis (Elsevier), conțin un număr însemnat de
articole din acest domeniu. Alături de siturile prezentate anterior, alte situri interesante unde
pot fi găsite informații legate de astfel de articole, white paper-uri etc., sunt în lista lui Michael
Ley , în situl lui Thierry Van de Merckt sau în cel al lui Andy Prike.

Situația actuală a Data Mining se datorează însă și faptului că, spre deosebire de alte
dezvoltări ale informaticii, cum au fost Internetul, rețelele neuronale, algoritmii genetici, etc.,
care au pornit de la lumea academică, fiind ulterior preluată de cea a afacerilor, în cazul DM
s-a întâmplat invers, a pornit de la firmele puternice, cum sunt IBM, Microsoft, GTE, etc.,
lumea academică sesizând ulterior problema.
Poate cel mai semnificativ exemplu în domeniu este cazul IBM.
Alte firme mai interesante ar putea fi considerate:
⮚ HMC, care în toamna anului 1995 a elaborat o soluție mixtă hard-soft, Marksman, la
un preț de 48.000$. Produsul are facilități de modelare predictivă pentru analiza
bazelor de date destinate marketingului direct;

17
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

⮚ Information Discovery, care a introdus în același an produsul MAP Discovery, ce


utilizează combinații între statistică, inducție si algoritmi de construire a clusterelor si
claselor; MAP Discovery rulează pe servere Sun UltraSPARC si HP9000;
⮚ Angoss Software din Toronto, care a lansat un produs DM, KnowledgeSeeker; ea a
încheiat o înțelegere cu firma Cognos pentru a include KnowledgeSeeker în produsul
acesteia de EIS (Executive Information System).

18
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

Concluzii
Tehnologiile Data mining (mineritul în date) reprezintă, într-o accepțiune simplă, un
mod automat de detectare într-o bază de date a unor tipare relevante [8].
Data mining utilizează o serie de tehnici statistice și de inteligență artificială ce dau
posibilitatea construirii de modele ce pot previziona comportamentul clienților.
Tehnologia își sporește calitățile prin integrare cu depozitele de date comerciale și cu
noile modalități de prezentare și raportare.
Data mining își datoreaza numele similarității dintre căutarea de informații valoroase într-o
bază de date mare și săparea unor galerii în munte pentru detectarea unor zăcăminte
valoroase.
Data mining distribuit este un proces de descoperire a cunoștințelor (Knowledge
discovery KD), de extragere a informației necunoscută anterior
din baze de date foarte mari. Procesul descoperirii de corelații semnificative, modele și
tendințe se asigură prin explorarea unor mari cantități de date stocate în
depozite de date, utilizând tehnologii de recunoaștere a modelelor, precum şi tehnici
statistice și matematice.
Conform unui raport din 1997 al Grupului Gartner: ,,Data mining și
inteligenta artificială se află între primele cinci tehnologii cheie care vor avea în mod sigur
un impact major asupra unui mare număr de industrii în următorii ani”. Gartner situează
data mining între primele 10 tehnologii în care firmele vor investi în următorii 5 ani.
Studiile arată că în ultima perioadă s-a înregistrat o explozie dramatică a nivelului de
interes privind data mining, în condițiile în care utilizatorii au dorit să profite de
instrumentele oferite de această tehnologie pentru a obține un avantaj
competitiv inteligent în plan concurențial. Anumite produse software de vârf în
domeniul data mining, provenite de la companii ca SAS sau IBM, reprezintă acum mai mult
decât simple motoare de modelare bazate pe algoritmi complecși. Acestea se adresează
unei categorii mai largi de Revista de Marketing Online – Vol.1 Nr.2 36 probleme tehnice şi
economice și se integrează în mediile actuale de tehnologie informațională.
Deși se credea că data miningul va elimina nevoia de specialiști în crearea
de modele statistice, lipsa experienței umane și a intuiției între niște corelații relevante şi
unele nerelevante, lipsă ce caracterizează softurile, infirmă această previziune.
Tradițional sunt avute în vedere mai multe tipuri de analize statistice: analize
predictive, analize descriptive, analize confirmatorii şi analize exploratorii.
Un exemplu tipic de analize predictive şi descriptive sunt cele specifice acțiunilor
şi fenomenelor de marketing. În cazul analizelor confirmatorii, având o ipoteză formulată
aceasta se acceptă sau se respinge. În analizele exploratorii, se urmărește găsirea
de ipoteze, care apoi se acceptă sau se resping. În acest punct sistemul preia ,,inițiativa”
în procesul analizei datelor sistemul gândește singur ipotezele acestea nefiind formulate de
utilizator. În prezent termenul de data mining se referă la procesul automat de analiză

19
UNST Politehnica București Savulescu Andrei
Facultatea de Automatica si Calculatoare An 1 Master ABD

a datelor în care sistemul preia inițiativa de a genera modele. Din punct de vedere al
procesului există trei clase de activități data mining: descoperire, modelare predictivă și
analiza excepțiilor.
Descoperirea este procesul de căutare în baza de date pentru a găsi modele, fără a
avea o idee predeterminată sau ipoteza asupra ceea ce pot fi modele. Cu alte cuvinte
programul preia inițiativa în găsirea a ceea ce sunt modelele interesante, fără a fi necesar ca
utilizatorul să se gândească la întrebările relevante în prealabil. În
marile baze de date există atât de multe modele încât utilizatorul nu ar putea
niciodată practic să își imagineze toate întrebările care ar trebui puse.

BIBLIOGRAFIE
[1] Chen, ZQ și Wu, HQ (2024) Application of Data Mining Technology in Network
[Link] ciberspațială,15, 121-125.
[2] Shen, FLZ și Wang, RP (2024) Aplicarea modelului arborelui de decizie în analiza datelor
de cercetare clinică.Medicina Shanghai,45, 14-18.
[3] Zeng, QT, Chen, GH și Li, WX (2024) Detectarea și clasificarea rapidă a oțelului prin
spectroscopie de defalcare indusă cu laser, bazată pe algoritmul mașinii vectoriale cu
suport pentru roi de [Link] și analiză spectrală,44, 1559-1565.
[4] Li, T., Sun, YY și Li, XL (2024) Cercetări privind diagnosticarea auxiliară a diabetului pe
baza algoritmului de clasificare a învățării [Link]ștințe și tehnologie de
calculator,20, [Link]://[Link]/10.14004/[Link].2024.0489
[5] Zhang, Y., Xu, YM și Zhang, Y. (2021) A Multivariate Linear Regression Prediction Model
for Substation Line Loss Rate Based on a New K-Means Clustering [Link] of
Electric Power Science and Technology,36, 179-186. https://
[Link]/10.19781/[Link].1673-9140.2021.05.022
[6] Huang, J. și Yang, LQ (2024) Un model robust de regresie AdaBoost bazat pe algoritmul
DBSCAN îmbunătăț[Link] Universității Hefei(Ediție cuprinzătoare),41, 1-9.
[7] Pan, Q., Lin, QX și Liu, ZY (2022) Metoda de identificare a celulelor de furtună bazată pe
date radar pe baza algoritmului de grupare OPTICS.Știința și Tehnologia
Meteorologice,50, [Link]://[Link]/10.19517/j.1671-6345.20210375
[8] Gheorghe Orzan (2001) Tehnologii informatice inteligente de accesare multidimensională
a bazelor şi depozitelor de date de marketing, Revista de Marketing Online – Vol.1 Nr.2

20

S-ar putea să vă placă și