Cvicenie - Web Mining 28.2.2022 14:45

Zdroj
ručne priradené
Pridané

Pozrieť na YouTube →

Preber si túto prednášku so svojou AI

Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.

Otvoriť AI: ChatGPT · Claude · Gemini

Zhrnutie prednášky

Cvičenie sa venuje samostatnej úlohe, v ktorej študenti zopakujú výpočet dokumentovej frekvencie, inverznej dokumentovej frekvencie (logaritmickej a binárnej) na piatich anglických textoch z informatických webových portálov. Všetko sa programuje v Pythone v Jupyter notebooku s knižnicou NLTK, ktorá rozdelí text na slová (tokenizácia), odstráni stop slová a pomocou WordNet lematizátora získa základný tvar slov. Početnosti slov sa ukladajú do vhodnej štruktúry, napríklad slovníka (dictionary, obdoba hash mapy v Jave), zoznamu alebo Pandas data frame. Výstupom je CSV, ideálne so slovami v riadkoch a dokumentmi v stĺpcoch, ktoré sa odovzdáva zazipované spolu s notebookom. Spolupráca a radenie sú povolené, študenti však musia riešeniu rozumieť a vedieť ho obhájiť.

  • - Úloha: zopakovať výpočet DF a IDF (logaritmickej a binárnej) na 5 anglických textoch z informatických portálov.
  • - Implementácia v Pythone v Jupyter notebooku (odporúčaná Anaconda).
  • - NLTK slúži na tokenizáciu viet na slová, odstránenie stop slov a lematizáciu cez WordNet lematizátor.
  • - Početnosti slov sa ukladajú do dictionary (kľúč = slovo, hodnota = počet), zoznamu alebo Pandas data frame.
  • - Odporúčaný formát CSV: slová v riadkoch, dokumenty v stĺpcoch.
  • - Odovzdáva sa zip so zdrojovým kódom (notebook) a exportovaným CSV.
  • - Spolupráca je povolená, ale každý musí kódu rozumieť a vedieť ho obhájiť.

Zhrnutie pripravené s pomocou AI z prepisu videa.