最大概似度估計

從資料中進行推斷、估計和決策

如果你必須為參數 θ 選擇一個單一值,最自然的規則是:選擇讓你實際觀察到的資料最可能出現的 θ。這就是最大概似度估計(MLE),也是訓練幾乎所有機器學習模型背後的原則。

給定假設獨立的資料 x₁, …, xₙ,整個樣本的機率是每個資料點機率的乘積。把它看作 θ 的函數,這個乘積就是概似度:

乘許多很小的機率會下溢到零,而且難以求導。解決方法是取對數:乘積的對數是和,並且 log 單調遞增,所以不會移動最大化點。我們最大化對數概似度:

在機器學習中的應用訓練模型就是最大概似度。 最小化交叉熵損失正好等於最大化標簽的對數概似度;交叉熵就是負對數概似度。最小化均方誤差是 Gaussian 噪聲假設下的 MLE。當你調用 .backward() 並讓最佳化器前進一步時,你就是在攀爬上面的對數概似度曲面,只不過維度有數百萬。
▶ 最大概似度估計
← 參數與估計量常見分布的 MLE →