Vizualizácia dát L02 (2024)
Preber si túto prednášku so svojou AI
Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.
Zhrnutie prednášky
Prednáška sa venuje knižnici Pandas, ktorá slúži na prácu s dátami v tabuľkovej forme, kde stĺpce reprezentujú veličiny (atribúty) a riadky jednotlivé entity (pozorovania). Vysvetľujú sa dve základné dátové štruktúry knižnice — jednorozmerná Series a dvojrozmerný DataFrame, pričom každý stĺpec či celá Series má definovaný dátový typ. Na príklade malej tabuľky štyroch európskych krajín sa demonštruje vytvorenie DataFrame dvoma spôsobmi — pomocou slovníka Series a pomocou zoznamu slovníkov reprezentujúcich jednotlivé riadky. Následne sa preberajú atribúty ndim a shape, ktoré umožňujú zistiť rozmernosť a veľkosť tabuľky, čo je dôležité najmä pri práci s väčšími dátovými súbormi načítanými zo súborov. Prednáška smeruje k neskoršiemu indexovaniu a vyhľadávaniu v dátach a k druhej časti, kde sa použije reálna tabuľka všetkých krajín sveta.
- - Pandas poskytuje dve hlavné dátové štruktúry: Series (1D) a DataFrame (2D)
- - Stĺpce tabuľky reprezentujú veličiny/atribúty, riadky reprezentujú entity/pozorovania
- - Každá Series a každý stĺpec DataFrame majú definovaný jednotný dátový typ
- - DataFrame možno vytvoriť zo slovníka Series alebo zo zoznamu slovníkov po riadkoch
- - V praxi sa tabuľky väčšinou nevytvárajú ručne, ale načítavajú zo súborov
- - Atribút ndim udáva počet rozmerov (1 pre Series, 2 pre DataFrame)
- - Atribút shape udáva veľkosť tabuľky v jednotlivých rozmeroch (počet riadkov/stĺpcov)
Zhrnutie pripravené s pomocou AI z prepisu videa.
nechodím na prednášky