Estimarea de Verosimilitate Maximă

Inferență, estimare și luarea deciziilor pe baza datelor

Dacă trebuie să alegi o singură valoare pentru parametrul θ, cea mai naturală regulă este aceasta: alege acel θ care face datele pe care le-ai observat de fapt cele mai probabile. Asta este estimarea de verosimilitate maximă (MLE), principiul din spatele antrenării aproape oricărui model în ML.

Date fiind datele x₁, …, xₙ presupuse independente, probabilitatea întregului eșantion este produsul probabilităților per punct. Ca funcție de θ, acest produs este verosimilitatea:

Înmulțirea multor probabilități mici provoacă underflow spre zero și este incomod de derivat. Soluția este să luăm logaritmul: logaritmul unui produs este o sumă, și logaritmul este o funcție crescătoare deci nu mută punctul de maxim. Noi maximizăm log-verosimilitatea:

Unde se regăsește în MLAntrenarea unui model este verosimilitate maximă. Minimizarea pierderii de entropie încrucișată este exact maximizarea log-verosimilității etichetelor; entropia încrucișată este log-verosimilitatea negativă. Minimizarea erorii pătratice medii este MLE sub o presupunere de zgomot Gaussian. Când apelezi .backward() și faci un pas cu optimizatorul, tu urci pe suprafața log-verosimilității de mai…
▶ Estimarea de Verosimilitate Maximă
← Parametri & EstimatoriMLE pentru Distribuții Comune →