本博客转于:http://blog.sina.com.cn/s/blog_598fbae20101blvd.html
在BRM的数学推导中提到了,最大似然估计!!!
最大似然估計(Maximum Likelihood,ML)
最大似然估計概述
最大似然估計是一種統計方法,它用來求一個樣本集的相關概率密度函數的參數。這個方法最早是遺傳學家以及統計學家羅納德·費雪爵士在1912年至1922年間開始使用的。
“似然”是對likelihood 的一種較為貼近文言文的翻譯,“似然”用現代的中文來說即“可能性”。故而,若稱之為“最大可能性估計”則更加通俗易懂。
最大似然法明確地使用概率模型,其目標是尋找能夠以較高概率產生觀察數據的系統發生樹。最大似然法是一類完全基於統計的系統發生樹重建方法的代表。該方法在每組序列比對中考慮了每個核苷酸替換的概率。
例如,轉換出現的概率大約是顛換的三倍。在一個三條序列的比對中,如果發現其中有一列為一個C,一個T和一個G,我們有理由認為,C和T所在的序列之間的關係很有可能更接近。由於被研究序列的共同祖先序列是未知的,概率的計算變得複雜;又由於可能在一個位點或多個位點發生多次替換,並且不是所有的位點都是相互獨立,概率計算的複雜度進一步加大。儘管如此,還是能用客觀標準來計算每個位點的概率,計算表示序列關係的每棵可能的樹的概率。然後,根據定義,概率總和最大的那棵樹最有可能是反映真實情況的系統發生樹。
最大似然估計的原理
給定一個概率分佈D,假定其概率密度函數(連續分佈)或概率聚集函數(離散分佈)為fD,以及一個分佈參數θ,我們可以從這個分佈中抽出一個具有n個值的採樣,通過利用fD,我們就能計算出其概率:
但是,我們可能不知道θ的值,儘管我們知道這些採樣數據來自於分佈D。那麼我們如何才能估計出θ呢?一個自然的想法是從這個分佈中抽出一個具有n個值的採樣X1,X2,...,Xn,然後用這些採樣數據來估計θ.
一旦我們獲得,我們就能從中找到一個關於θ的估計。最大似然估計會尋找關於
要在數學上實現最大似然估計法,我們首先要定義可能性:
並且在θ的所有取值上,使這個[[函數最大化。這個使可能性最大的值即被稱為θ的最大似然估計。
註意
- 這裡的可能性是指
不變時,關於θ的一個函數。
- 最大似然估計函數不一定是惟一的,甚至不一定存在。
連續分佈,連續參數空間