Vizualizácia dát L04 (2025)
Preber si túto prednášku so svojou AI
Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.
Zhrnutie prednášky
Prednáška úvodne predstavuje popisné štatistiky (descriptive statistics), ktoré číselne charakterizujú jeden stĺpec dát alebo závislosti medzi dvoma stĺpcami a dopĺňajú sa základnou vizualizáciou. Ilustruje ich na tabuľke 2049 filmov z cvičení. Podrobne vysvetľuje tri miery polohy: aritmetický priemer, medián (prostredná hodnota utriedených dát, pri párnom počte priemer dvoch stredných) a modus (najčastejšia hodnota, pri spojitých dátach závislá od rozdelenia do intervalov). Na príklade platov s jedným extrémnym príjmom ukazuje citlivosť priemeru na odľahlé hodnoty, kým medián zostáva stabilný, a na histograme rokov vzniku filmov vysvetľuje, prečo je priemer menší než medián. Výpočet je ukázaný v Pandas funkciami mean, median a mode.
- - Popisné štatistiky číselne charakterizujú dáta a používajú sa spolu so základnými grafmi na prvotné preskúmanie nových dát.
- - Priemer je súčet hodnôt delený ich počtom; matematicky sa s ním dobre pracuje.
- - Medián je stredná hodnota utriedených dát, pri párnom počte sa berie priemer dvoch stredných hodnôt.
- - Modus je najčastejšia hodnota; pri spojitých dátach je problematický a závisí od voľby intervalov histogramu.
- - Priemer je citlivý na odľahlé hodnoty (outliers), medián nie, preto sa pri platoch uvádza skôr medián.
- - Pri zošikmenom rozdelení sa priemer posúva smerom k odľahlým hodnotám, napr. staré filmy ťahajú priemer roku nadol (priemer 2004, medián 2008, modus 2013).
- - V Pandas sa miery počítajú funkciami mean, median a mode; mode môže vrátiť viac hodnôt, ak sa maximum opakuje.
Zhrnutie pripravené s pomocou AI z prepisu videa.
nechodím na prednášky