Cover photo

Ước Lượng Khả Dĩ Cực Đại (MLE): Bản Giao Hưởng Giữa Luật Số Lớn Và Định Lý Giới Hạn Trung Tâm

Trong thế giới của xác suất và thống kê, nếu phải chọn ra một phương pháp ước lượng mang tính biểu tượng và quyền lực nhất, câu trả lời chắc chắn sẽ gọi tên Ước lượng Khả dĩ Cực đại (Maximum Likelihood Estimation - MLE). Được hoàn thiện bởi nhà thống kê vĩ đại Sir Ronald Fisher vào đầu thế kỷ 20, MLE đã trở thành "trái tim" của hầu hết các mô hình học máy và thống kê hiện đại—từ hồi quy tuyến tính đơn giản cho đến các mạng thần kinh sâu (Deep Neural Networks) phức tạp ngày nay.

Tuy nhiên, tại sao MLE lại hoạt động tốt đến thế? Làm thế nào chúng ta biết được rằng khi kích thước mẫu tiến tới vô cùng, ước lượng MLE sẽ tìm chính xác đến tham số thực của quần thể? Và làm sao để đo lường mức độ dao động ngẫu nhiên xung quanh ước lượng đó?

Câu trả lời nằm ở một sự kết hợp toán học tuyệt mĩ: Bản giao hưởng giữa Luật Số Lớn (Law of Large Numbers - LLN) và Định lý Giới hạn Trung tâm (Central Limit Theorem - CLT). Bài viết này sẽ dẫn dắt bạn qua hành trình khám phá cách hai định lý nền tảng này làm bệ đỡ vững chắc cho toàn bộ lý thuyết tiệm cận của MLE.

1. Khúc Dạo Đầu: Điểm lại hai "Trụ cột" của Thống kê

Trước khi đi sâu vào bản chất của MLE, chúng ta hãy cùng nhìn lại hai định lý vĩ đại này một cách trực quan nhất. Hãy xem chúng như hai công cụ sinh tồn của một nhà thám hiểm:

  • Luật Số Lớn (LLN) - Chiếc La Bàn: Tưởng tượng bạn tung một đồng xu. Nếu tung 10 lần, bạn có thể ra 8 ngửa, 2 sấp (tỷ lệ 80%). Nhưng nếu bạn tung 10.000 lần, tỷ lệ mặt ngửa chắc chắn sẽ tiến rất sát về 50%. LLN phát biểu đơn giản rằng: Dữ liệu càng nhiều, giá trị trung bình mẫu càng hội tụ về giá trị kỳ vọng thực tế. Nó là chiếc la bàn đảm bảo rằng, miễn là bạn đi đủ xa (thu thập đủ data), bạn sẽ đến đúng đích.

  • Định Lý Giới Hạn Trung Tâm (CLT) - Thước Đo Sai Số: Bạn đo chiều cao của mọi người trong một thành phố. Chiều cao có thể phân phối lộn xộn, không hề theo hình quả chuông (Bell Curve). Nhưng nếu bạn lấy ngẫu nhiên 100 người, tính trung bình, rồi lại lấy 100 người khác tính trung bình... thì tập hợp của các giá trị trung bình đó luôn luôn tạo thành một phân phối chuẩn (hình quả chuông). CLT cho chúng ta biết rằng những "sai số ngẫu nhiên" khi gộp lại ở quy mô lớn sẽ luôn tuân theo một quy luật có thể đo lường được.

Bây giờ, khi đã nắm được tinh thần của chiếc la bàn (LLN) và thước đo (CLT), hãy cùng xem cách chúng "thổi hồn" vào phương pháp MLE.

2. Bản chất của MLE: Đi tìm tham số "Khả dĩ" nhất

Giả sử chúng ta quan sát một tập dữ liệu độc lập và cùng phân phối (i.i.d.) X1,X2,,XnX_1,X_2,\dots,X_n từ một phân phối xác suất có mật độ f(x;θ0)f(x;\theta_0), trong đó θ0\theta_0 là tham số thực (true parameter) nhưng chưa biết.

Hàm khả dĩ (Likelihood function) được định nghĩa là tích các hàm mật độ tại các điểm dữ liệu. (Chú thích nhỏ: Tại sao lại là phép nhân? Hãy tưởng tượng bạn dùng cảm biến đo nhiệt độ và áp suất không khí tại $n$ thời điểm độc lập. Xác suất để hệ thống ghi nhận được chính xác toàn bộ chuỗi $n$ kết quả nhiệt độ/áp suất đó cùng lúc bằng đúng xác suất của lần đo 1 nhân với lần đo 2, nhân tới lần đo $n$. Đây là quy tắc cơ bản của các sự kiện độc lập).

Ln(θ)=i=1nf(Xi;θ)L_n(\theta)=\prod_{i=1}^n f(X_i;\theta)

Để dễ tính toán (biến tích thành tổng), ta lấy logarit tự nhiên để thu được hàm log-khả dĩ (Log-Likelihood):

n(θ)=i=1nlogf(Xi;θ)\ell_n(\theta)=\sum_{i=1}^n \log f(X_i;\theta)

Ước lượng MLE θ^n\hat{\theta}_n là giá trị của θ\theta làm cực đại hóa hàm này:

θ^n=argmaxθ(θ)\hat{\theta}_n=\arg\max_{\theta}\ell(\theta)

Nhưng làm thế nào chúng ta biết chắc chắn rằng khi cỡ mẫu nn \to \infty, ước lượng θ^n\hat{\theta}_n sẽ hội tụ về giá trị thực θ0\theta_0? Và làm sao để biết sai số của nó phân phối như thế nào? Đây là lúc LLNCLT bước lên sân khấu.

3. Luật Số Lớn (LLN): Động cơ chứng minh Tính Nhất Quán (Consistency)

Tính chất đầu tiên và quan trọng nhất của một ước lượng tốt là Tính Nhất Quán (Consistency): Khi dữ liệu càng nhiều, ước lượng phải càng tiến gần đến sự thật.

θ^npθ0khi n\hat{\theta}_n \xrightarrow{p} \theta_0 \quad \text{khi } n \to \infty

Để chứng minh điều này, chúng ta cần xem xét hàm trung bình log-khả dĩ:

Mn(θ)=1nn(θ)=1ni=1nlogf(Xi;θ)M_n(\theta)=\frac{1}{n}\ell_n(\theta)=\frac{1}{n}\sum_{i=1}^n \log f(X_i;\theta)

Hãy quan sát kỹ biểu thức trên. Đây chính là trung bình mẫu của nn biến ngẫu nhiên độc lập và có cùng phân phối Yi=logf(Xi;θ)Y_i=\log f(X_i;\theta). Theo Luật Số Lớn (LLN), khi nn \to \infty, trung bình mẫu này phải hội tụ về kỳ vọng toán học của nó:

Mn(θ)pEθ0[logf(X;θ)]M(θ)M_n(\theta)\xrightarrow{p}\mathbb{E}_{\theta_0}[\log f(X;\theta)]\equiv M(\theta)

Phép màu từ Entropy và Bất đẳng thức Jensen

Bây giờ, câu hỏi đặt ra là: Hàm giới hạn M(θ)M(\theta) đạt cực đại ở đâu? Hãy so sánh hiệu số giữa M(θ0)M(\theta_0)M(θ)M(\theta):

M(θ0)M(θ)=Eθ0[logf(X;θ0)f(X;θ)]M(\theta_0)-M(\theta)=\mathbb{E}_{\theta_0}\left[\log\frac{f(X;\theta_0)}{f(X;\theta)}\right]

Biểu thức này chính là Độ lệch Kullback-Leibler (KL Divergence) giữa hai phân phối f(x;θ0)f(x;\theta_0)f(x;θ)f(x;\theta). Áp dụng bất đẳng thức Jensen cho hàm lồi log(t)-\log(t), ta có:

Eθ0[logf(X;θ)f(X;θ0)]logEθ0[f(X;θ)f(X;θ0)]=log(1)=0\mathbb{E}_{\theta_0}\left[-\log\frac{f(X;\theta)}{f(X;\theta_0)}\right]\ge-\log\mathbb{E}_{\theta_0}\left[\frac{f(X;\theta)}{f(X;\theta_0)}\right]=-\log(1)=0

Do đó:

Eθ0[logf(X;θ0)]Eθ0[logf(X;θ)]\mathbb{E}_{\theta_0}[\log f(X;\theta_0)]\ge\mathbb{E}_{\theta_0}[\log f(X;\theta)]

Dấu bằng chỉ xảy ra khi θ=θ0\theta=\theta_0 (dưới điều kiện mô hình định danh được). Điều này nghĩa là hàm kỳ vọng giới hạn đạt cực đại toàn cục duy nhất tại tham số thực θ0\theta_0!

Mn(θ)M_n(\theta) hội tụ đều về M(θ)M(\theta) (nhờ Luật Số Lớn Đồng Đều - Uniform LLN), điểm cực đại của hàm mẫu θ^n\hat{\theta}_n buộc phải hội tụ về điểm cực đại của hàm giới hạn θ0\theta_0.

Luật Số Lớn chính là chiếc la bàn toán học bảo đảm rằng MLE luôn đi đúng hướng và cuối cùng sẽ cập bến sự thật θ0\theta_0.

4. Định Lý Giới Hạn Trung Tâm (CLT): Bản đồ đo lường sự biến động (Asymptotic Normality)

Tìm được "đích đến" θ0\theta_0 là chưa đủ. Trong thực tế, chúng ta chỉ có cỡ mẫu hữu hạn nn. Chúng ta cần biết θ^n\hat{\theta}_n dao động quanh θ0\theta_0 như thế nào để xây dựng khoảng tin cậy và kiểm định giả thuyết. Đây là lúc Định lý Giới hạn Trung tâm (CLT) tỏa sáng.

Khi θ^n\hat{\theta}_n là điểm cực đại của hàm log-khả dĩ, nó phải là nghiệm của phương trình điểm tới hạn (Score Equation):

n(θ^n)=i=1nθlogf(Xi;θ^n)=0\ell'_n(\hat{\theta}_n)=\sum_{i=1}^n \frac{\partial}{\partial \theta}\log f(X_i;\hat{\theta}_n)=0

Để biểu diễn mối liên hệ giữa θ^n\hat{\theta}_nθ0\theta_0, chúng ta áp dụng định lý giá trị trung bình (hay chính là khai triển Taylor bậc nhất với phần dư Lagrange) cho hàm số n(θ)\ell'_n(\theta) xung quanh điểm θ0\theta_0, sau đó đánh giá tại điểm θ^n\hat{\theta}_n:

n(θ^n)=n(θ0)+n(θ~n)(θ^nθ0)\ell'_n(\hat{\theta}_n) = \ell'_n(\theta_0) + \ell''_n(\tilde{\theta}_n)(\hat{\theta}_n - \theta_0)

Trong đó, θ~n\tilde{\theta}_n là một giá trị trung gian nằm giữa ước lượng mẫu θ^n\hat{\theta}_n và tham số thực θ0\theta_0.

θ^n\hat{\theta}_n là nghiệm của phương trình cực đại, đạo hàm tại đó bằng 0 (tức là n(θ^n)=0\ell'_n(\hat{\theta}_n) = 0). Thay điều kiện này vào phương trình khai triển phía trên, ta thu được:

0=n(θ0)+n(θ~n)(θ^nθ0)0=\ell'_n(\theta_0)+\ell''_n(\tilde{\theta}_n)(\hat{\theta}_n-\theta_0)

Biến đổi đại số, chúng ta thu được biểu thức kinh điển:

n(θ^nθ0)=1nn(θ0)1nn(θ~n)\sqrt{n}(\hat{\theta}_n-\theta_0)=\frac{\frac{1}{\sqrt{n}}\ell'_n(\theta_0)}{-\frac{1}{n}\ell''_n(\tilde{\theta}_n)}

Hãy cùng mổ xẻ hai phần của phân số này:

Tử số: Sân khấu của Định lý Giới Hạn Trung Tâm (CLT)

Tử số là:

1nn(θ0)=1ni=1nψ(Xi)\frac{1}{\sqrt{n}}\ell'_n(\theta_0)=\frac{1}{\sqrt{n}}\sum_{i=1}^n \psi(X_i)

(với ψ(Xi)=θlogf(Xi;θ0)\psi(X_i)=\frac{\partial}{\partial \theta}\log f(X_i;\theta_0) là hàm Score của từng quan sát).

Hàm Score này có một tính chất cực kỳ đặc biệt: Kỳ vọng của nó luôn bằng 0:

Eθ0[ψ(X)]=0\mathbb{E}_{\theta_0}[\psi(X)]=0

Và phương sai của nó chính là Thông tin Fisher (Fisher Information) I(θ0)I(\theta_0):

Varθ0(ψ(X))=Eθ0[(θlogf(X;θ0))2]=I(θ0)\text{Var}_{\theta_0}(\psi(X))=\mathbb{E}_{\theta_0}\left[\left(\frac{\partial}{\partial \theta}\log f(X;\theta_0)\right)^2\right]=I(\theta_0)

Vì các ψ(Xi)\psi(X_i) là độc lập và cùng phân phối (i.i.d.) có trung bình bằng 0, Định lý Giới hạn Trung tâm (CLT) lập tức áp dụng và tuyên bố:

1nn(θ0)dN(0,I(θ0))\frac{1}{\sqrt{n}}\ell'_n(\theta_0)\xrightarrow{d}\mathcal{N}(0, I(\theta_0))

Mẫu số: Sự trở lại của Luật Số Lớn (LLN)

Mẫu số là độ dốc (độ cong) của hàm log-khả dĩ:

1nn(θ~n)=1ni=1n2θ2logf(Xi;θ~n)-\frac{1}{n}\ell''_n(\tilde{\theta}_n)=-\frac{1}{n}\sum_{i=1}^n \frac{\partial^2}{\partial \theta^2}\log f(X_i;\tilde{\theta}_n)

θ^npθ0\hat{\theta}_n \xrightarrow{p} \theta_0 (nhờ LLN ở bước trước), điểm trung gian θ~n\tilde{\theta}_n cũng hội tụ về θ0\theta_0. Áp dụng Luật Số Lớn (LLN) một lần nữa dưới điều kiện mượt của hàm số, mẫu số sẽ hội tụ về kỳ vọng của nó:

1nn(θ~n)pEθ0[2θ2logf(X;θ0)]=I(θ0)-\frac{1}{n}\ell''_n(\tilde{\theta}_n)\xrightarrow{p}-\mathbb{E}_{\theta_0}\left[\frac{\partial^2}{\partial \theta^2}\log f(X;\theta_0)\right]=I(\theta_0)

(Sự bằng nhau giữa phương sai của Score và kỳ vọng âm đạo hàm bậc hai của log-mật độ là một đồng nhất thức tuyệt đẹp của thông tin Fisher).

Nhịp cầu Slutsky: Hợp nhất CLT và LLN

Sử dụng định lý Slutsky để kết hợp giới hạn của tử số (được dẫn dắt bởi CLT) và mẫu số (được dẫn dắt bởi LLN), ta có:

n(θ^nθ0)dN(0,I(θ0))I(θ0)=N(0,1I(θ0))\sqrt{n}(\hat{\theta}_n-\theta_0)\xrightarrow{d}\frac{\mathcal{N}(0, I(\theta_0))}{I(\theta_0)}=\mathcal{N}\left(0, \frac{1}{I(\theta_0)}\right)

Định lý Giới hạn Trung tâm chính là chiếc kính hiển vi giúp chúng ta nhìn thấu hình dáng của sự ngẫu nhiên xung quanh ước lượng MLE. Quan trọng hơn, nó là lời khẳng định cho sự tối ưu tuyệt đối của phương pháp này: Khi cỡ mẫu lớn, không những sai số của MLE tuân theo phân phối chuẩn, mà phương sai của nó còn co hẹp lại đến mức cực hạn — chạm tới đáy của Giới hạn dưới Cramér-Rao. Nói cách khác, về mặt tiệm cận, MLE là phương pháp vắt kiệt thông tin từ dữ liệu một cách hiệu quả nhất, không có một công cụ nào có thể làm tốt hơn.

5. Lời Kết: Bản Giao Hưởng Hoàn Hảo

Nếu không có Luật Số Lớn (LLN), chúng ta giống như những người bộ hành không có bản đồ—không thể biết liệu MLE có dẫn ta đến đúng thế giới thực θ0\theta_0 hay không. Nhưng nếu chỉ có LLN, chúng ta sẽ là những người lữ hành mù quáng trước rủi ro—biết hướng đi đúng nhưng bất lực trong việc ước lượng sai số của mỗi bước đi.

Chính Định lý Giới hạn Trung tâm (CLT) đã bù đắp mảnh ghép cuối cùng, biến MLE từ một ý tưởng trực quan thành một công cụ toán học tối thượng có khả năng định lượng rủi ro thông qua phân phối chuẩn.

Mỗi khi bạn chạy một mô hình hồi quy, một thuật toán phân loại Logistic hay huấn luyện một mạng Neural đồ sộ, hãy nhớ rằng đằng sau những dòng code chạy êm ả là một bản giao hưởng toán học tinh tế, nơi LLN chỉ đường và CLT dệt nên tấm lưới bảo hiểm cho những ước lượng của bạn.