|
生物物理学报 2004
The model for the length distribution of protein coding sequences in different genomes and the genome evolution
|
Abstract:
分析了5种真核、15种细菌和10种古菌基因组中开阅读框架(open reading flame,ORF)的数目随长度的分布,发现不同生物的分布相似且有明显的规律性。用各种分布模型进行拟合比较,结果显示每种生物的这类分布均符合Г(α,β)分布,由此提出生物基因组中ORF的数目随长度的分布是Г(α,β)分布的假设。分析各生物基因组的拟合参数,发现α和β值与基因组进化存在明显的相关性;讨论了α和β值的生物进化意义,并给出了真核生物偏好使用长基因的结论;依照Г(α,β)分布估计了酵母基因组中ORF数目的上限为5870个。该方法对于研究生物基因组进化以及评估理论预测基因的可靠性具有建设性意义。