Vizualizácia dát L02 (2024)

Zdroj
ručne priradené
Pridané

Pozrieť na YouTube →

Preber si túto prednášku so svojou AI

Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.

Otvoriť AI: ChatGPT · Claude · Gemini

Zhrnutie prednášky

Prednáška sa venuje knižnici Pandas, ktorá slúži na prácu s dátami v tabuľkovej forme, kde stĺpce reprezentujú veličiny (atribúty) a riadky jednotlivé entity (pozorovania). Vysvetľujú sa dve základné dátové štruktúry knižnice — jednorozmerná Series a dvojrozmerný DataFrame, pričom každý stĺpec či celá Series má definovaný dátový typ. Na príklade malej tabuľky štyroch európskych krajín sa demonštruje vytvorenie DataFrame dvoma spôsobmi — pomocou slovníka Series a pomocou zoznamu slovníkov reprezentujúcich jednotlivé riadky. Následne sa preberajú atribúty ndim a shape, ktoré umožňujú zistiť rozmernosť a veľkosť tabuľky, čo je dôležité najmä pri práci s väčšími dátovými súbormi načítanými zo súborov. Prednáška smeruje k neskoršiemu indexovaniu a vyhľadávaniu v dátach a k druhej časti, kde sa použije reálna tabuľka všetkých krajín sveta.

  • - Pandas poskytuje dve hlavné dátové štruktúry: Series (1D) a DataFrame (2D)
  • - Stĺpce tabuľky reprezentujú veličiny/atribúty, riadky reprezentujú entity/pozorovania
  • - Každá Series a každý stĺpec DataFrame majú definovaný jednotný dátový typ
  • - DataFrame možno vytvoriť zo slovníka Series alebo zo zoznamu slovníkov po riadkoch
  • - V praxi sa tabuľky väčšinou nevytvárajú ručne, ale načítavajú zo súborov
  • - Atribút ndim udáva počet rozmerov (1 pre Series, 2 pre DataFrame)
  • - Atribút shape udáva veľkosť tabuľky v jednotlivých rozmeroch (počet riadkov/stĺpcov)

Zhrnutie pripravené s pomocou AI z prepisu videa.