Odhad maximální věrohodnosti

Statistická indukce, odhadování a rozhodování z dat

Pokud musíš vybrat jedinou hodnotu parametru θ, nejpřirozenější pravidlo je: vyber θ, které činí data, která jsi skutečně pozoroval, nejpravděpodobnějšími. To je odhad maximální věrohodnosti (MLE), princip za trénováním téměř každého modelu v ML.

Při datech x₁, …, xₙ považovaných za nezávislá je pravděpodobnost celého vzorku součinem pravděpodobností jednotlivých bodů. Jako funkce θ je tento součin věrohodnost:

Násobení mnoha malých pravděpodobností podteče na nulu a je neohrabané k derivaci. Řešení je vzít log: logaritmus součinu je součet a log roste, takže neposune maximum. Maximalizujeme log-věrohodnost:

Kde se to v ML objevujeTrénování modelu je maximální věrohodnost. Minimalizace cross-entropy ztráty je přesně maximalizace log-věrohodnosti štítků; cross-entropy je záporná log-věrohodnost. Minimalizace střední kvadratické chyby je MLE za předpokladu gaussovského šumu. Když zavoláš .backward() a uděláš krok optimalizátorem, šplháš po ploše log-věrohodnosti výše, jen v milionech dimenzí.
▶ Odhad maximální věrohodnosti
← Parametry a odhadyMLE pro běžná rozdělení →