Vizualizácia dát L04 (2025)

Zdroj
ručne priradené
Pridané

Pozrieť na YouTube →

Preber si túto prednášku so svojou AI

Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.

Otvoriť AI: ChatGPT · Claude · Gemini

Zhrnutie prednášky

Prednáška úvodne predstavuje popisné štatistiky (descriptive statistics), ktoré číselne charakterizujú jeden stĺpec dát alebo závislosti medzi dvoma stĺpcami a dopĺňajú sa základnou vizualizáciou. Ilustruje ich na tabuľke 2049 filmov z cvičení. Podrobne vysvetľuje tri miery polohy: aritmetický priemer, medián (prostredná hodnota utriedených dát, pri párnom počte priemer dvoch stredných) a modus (najčastejšia hodnota, pri spojitých dátach závislá od rozdelenia do intervalov). Na príklade platov s jedným extrémnym príjmom ukazuje citlivosť priemeru na odľahlé hodnoty, kým medián zostáva stabilný, a na histograme rokov vzniku filmov vysvetľuje, prečo je priemer menší než medián. Výpočet je ukázaný v Pandas funkciami mean, median a mode.

  • - Popisné štatistiky číselne charakterizujú dáta a používajú sa spolu so základnými grafmi na prvotné preskúmanie nových dát.
  • - Priemer je súčet hodnôt delený ich počtom; matematicky sa s ním dobre pracuje.
  • - Medián je stredná hodnota utriedených dát, pri párnom počte sa berie priemer dvoch stredných hodnôt.
  • - Modus je najčastejšia hodnota; pri spojitých dátach je problematický a závisí od voľby intervalov histogramu.
  • - Priemer je citlivý na odľahlé hodnoty (outliers), medián nie, preto sa pri platoch uvádza skôr medián.
  • - Pri zošikmenom rozdelení sa priemer posúva smerom k odľahlým hodnotám, napr. staré filmy ťahajú priemer roku nadol (priemer 2004, medián 2008, modus 2013).
  • - V Pandas sa miery počítajú funkciami mean, median a mode; mode môže vrátiť viac hodnôt, ak sa maximum opakuje.

Zhrnutie pripravené s pomocou AI z prepisu videa.