Az adattudomány (angolul: data science) olyan interdiszciplináris terület, amely statisztikai módszereket, programozást és szakterületi ismereteket kombinál abból a célból, hogy strukturált és strukturálatlan adatokból értelmes következtetéseket vonjon le. A fogalom az elmúlt másfél évtizedben vált általánosan elterjedtté, párhuzamosan a digitálisan elérhető adatok mennyiségének ugrásszerű növekedésével.
Magyarországon az adattudomány iránti érdeklődés különösen az ELTE és a BME informatikai karain erősödött meg. A Budapesti Műszaki Egyetem Adattudomány mesterszakja, valamint az ELTE különböző analitikai és matematikai programjai az elmúlt években folyamatosan bővültek.
Az adattudomány három pillére
A terület szokásos megközelítése szerint három fő kompetencia-terület metszéspontján helyezkedik el:
Statisztika és matematika: valószínűségszámítás, hipotézisvizsgálat, regresszióanalízis és más kvantitatív módszerek, amelyek az adatelemzés elméleti alapját képezik.
Programozási és informatikai ismeretek: adatkezelési folyamatok, algoritmikus gondolkodás, adatbázis-kezelés, felhőalapú infrastruktúrák.
Szakterületi tudás: az elemzési eredmények értelmezéséhez elengedhetetlen az adott terület (pénzügy, egészségügy, közlekedés stb.) kontextusának ismerete.
Az elemzési munkamenet lépései
Az adattudomány-projektek jellemzően azonos főbb fázisokat követnek, függetlenül a konkrét szakterülettől:
1. Kérdésdefiníció és célmeghatározás
Minden elemzés egy konkrét kérdéssel vagy problémával indul. A pontatlanul megfogalmazott kérdés félrevezető eredményekhez vezet, ezért a projekt elején érdemes precízen rögzíteni, hogy milyen döntést kell az elemzésnek alátámasztania.
2. Adatgyűjtés és -forrásazonosítás
Az adatok forrása lehet belső adatbázis, nyílt adathalmaz vagy API-n keresztül elérhető adat. Magyarországon a KSH (Központi Statisztikai Hivatal) rendszeresen frissített, nyilvánosan elérhető adatokat tesz közzé széleskörű területekről: demográfia, gazdaság, egészségügy, oktatás.
3. Adattisztítás és -előkészítés
A valós adathalmazok szinte mindig tartalmaznak hibákat, hiányzó értékeket, duplikátumokat vagy inkonzisztens formátumokat. Az adattisztítás az elemzési munka egyik legidőigényesebb fázisa, de elhagyása félrevezető következtetésekhez vezet.
4. Exploratív adatelemzés (EDA)
Az exploratív elemzés célja az adatstruktúra, eloszlások és összefüggések feltérképezése vizualizációs és statisztikai eszközökkel, mielőtt bármilyen modellt alkalmaznánk.
5. Modellezés és értékelés
A statisztikai vagy gépi tanulási modellek illesztése csak az előző lépések elvégzése után kezdődik. A modellek teljesítményét keresztvalidációval és különböző metrikákkal (pontosság, F1-score, RMSE stb.) értékelik.
6. Kommunikáció és vizualizáció
Az eredmények hatékony közlése éppoly fontos, mint maga az elemzés. Egy jól megformált vizualizáció és egy érthető jelentés nélkül a legjobb modell sem éri el célját döntéshozói körökben.
A Python-ökoszisztéma az adattudományban
A Python az adattudomány de facto standard nyelve, amit több tényező magyaráz: a könyvtárak gazdag ökoszisztémája, a viszonylag alacsony belépési küszöb és a nagyon aktív közösségi háttér.
- pandas – táblázatos adatkezelés, adattisztítás, aggregáció
- NumPy – numerikus számítások, tömbműveletek
- Matplotlib / Seaborn – statikus vizualizáció
- scikit-learn – gépi tanulási algoritmusok egységes interfészen
- Jupyter Notebook – interaktív fejlesztői és dokumentációs felület
Statisztikai alapfogalmak röviden
Az adatelemzés nem végezhető el a statisztikai alapfogalmak ismerete nélkül. A legfontosabb fogalmak:
- Átlag, medián, szórás – az adathalmazok leíró statisztikái
- Korreláció – két változó együttes változásának mértéke, de nem bizonyítja az oksági kapcsolatot
- p-érték – a hipotézisvizsgálatban a null-hipotézis elvetéséhez szükséges szignifikanciaküszöb
- Konfidencia-intervallum – a becsült paraméter bizonytalanságának mértéke
Továbblépési lehetőségek
Az adattudomány területén való elmélyüléshez több nyílt forrású oktatási anyag áll rendelkezésre. A hazai oktatási intézmények – köztük az ELTE és a BME – számos kurzust és szakirodalom-listát tesznek elérhetővé. A KSH és más intézmények valós adathalmazain elvégzett elemzési gyakorlatok hatékonyan egészítik ki az elméleti tanulmányokat.
A következő cikkek mélyebb betekintést nyújtanak az adatvizualizáció és a gépi tanulás területébe: