Machine Learning - 05 - Regularization, Holdout testing
Preber si túto prednášku so svojou AI
Skopíruj pripravený podklad a vlož ho do ChatGPT, Claude alebo inej AI — bude ťa učiť alebo skúšať len z tejto prednášky.
Zhrnutie prednášky
Prednáška nadväzuje na rozklad očakávanej testovacej chyby v strojovom učení. Vychádza z predpokladu neznámeho rozdelenia P(X,Y), z ktorého sa nezávisle vyberajú trénovacie aj testovacie príklady, čo prepája správanie modelu pri trénovaní a pri testovaní. Rozlišuje sa funkcia H-hat natrénovaná na konkrétnej trénovacej množine a najlepšia možná funkcia H-star z priestoru hypotéz vzhľadom na celé rozdelenie. Očakávaná testovacia chyba (pri štvorcovej chybe L2) sa rozkladá na bias, teda chybu najlepšej funkcie z priestoru hypotéz, a variance, teda to, ako ďaleko je natrénovaná funkcia od tej najlepšej. Bias sa následne ďalej rozkladá a súvisí s očakávanou trénovacou chybou. Pojmy bias a variance tu nie sú štatistickými pojmami s rovnakým názvom.
- - Trénovacie a testovacie príklady pochádzajú nezávisle z rovnakého neznámeho rozdelenia P(X,Y).
- - H-hat je funkcia natrénovaná na konkrétnej trénovacej množine, H-star je najlepšia funkcia z priestoru hypotéz vzhľadom na rozdelenie.
- - Očakávaná testovacia chyba je priemer cez výber trénovacej množiny aj testovací príklad.
- - Chyba sa rozkladá na bias (chyba najlepšej funkcie z H) a variance (vzdialenosť naučenej funkcie od najlepšej).
- - Variance závisí od veľkosti a reprezentatívnosti trénovacej množiny.
- - Bias sa dá ďalej rozložiť a súvisí s očakávanou trénovacou chybou.
- - Bias a variance v tomto kontexte nie sú štatistickým biasom a varianciou.
Zhrnutie pripravené s pomocou AI z prepisu videa.
nechodím na prednášky