Inferență, estimare și luarea deciziilor pe baza datelor
Dacă trebuie să alegi o singură valoare pentru parametrul θ, cea mai naturală regulă este aceasta: alege acel θ care face datele pe care le-ai observat de fapt cele mai probabile. Asta este estimarea de verosimilitate maximă (MLE), principiul din spatele antrenării aproape oricărui model în ML.
Date fiind datele x₁, …, xₙ presupuse independente, probabilitatea întregului eșantion este produsul probabilităților per punct. Ca funcție de θ, acest produs este verosimilitatea:
Înmulțirea multor probabilități mici provoacă underflow spre zero și este incomod de derivat. Soluția este să luăm logaritmul: logaritmul unui produs este o sumă, și logaritmul este o funcție crescătoare deci nu mută punctul de maxim. Noi maximizăm log-verosimilitatea: