Gradient

Matematická analýza více proměnných od základních principů

Sestavte všechny parciální derivace funkce f do jednoho vektoru a získáte gradient, zapisovaný jako ∇f („grad f“). Každý optimalizátor v hlubokém učení pracuje na základě tohoto jediného objektu, takže si zaslouží své místo v centru tohoto kurzu.

Gradient není jen pouhý záznam údajů. Jakožto vektor ve vstupním prostoru má směr a délku a obojí má svůj význam. Směr je směrem nejstrmějšího stoupání: namiřte ve směru ∇f a funkce bude stoupat tak rychle, jak je to jen možné. Jeho délka ‖∇f‖ udává přesně to, jak strmé toto stoupání je.

Představte si, že stojíte v mlze na travnatém kopci. Gradient ∇f je šipka, která ukazuje přímo nahoru po nejstrmější části svahu, a její délka vám říká, jak namáhavý tento výstup je. Položte míč a pusťte ho: rozkutálí se přesně v opačném směru a vydá se nejrychlejší cestou dolů.

Kde se to v ML objevujeKdyž stojíte na chybové ploše (loss surface), chcete jít dolů z kopce co nejrychleji. Gradient ∇L ukazuje směrem k nejstrmějšímu růstu, takže ho odečítáte: w ← w − η∇L, což je úprava vah stojící za SGD, Adamem a všemi ostatními optimalizátory. Zpětná propagace (backpropagation) existuje z jediného důvodu: efektivně spočítat tento vektor.
▶ Gradient
← Parciální derivace vyšších řádůSměrová derivace →