人类与猪的基因相似度怎么算:计算口径、公式与统计示例

先给结论:“人类与猪的基因相似度”没有一个脱离计算口径的唯一百分比。如果比较的是能否找到对应基因,常见参考基因组注释中,人和猪拥有数量可观的一对一直系同源基因,约为一万七千个量级,占两者蛋白编码基因的大部分;如果比较的是DNA碱基逐位一致率,结果会明显受到比对区域、参考基因组版本、重复序列和计算公式影响。因此,“人猪基因相似度约多少”必须先说明比较对象和分母。

更稳妥的概括是:人和猪都属于有胎盘哺乳动物,许多基本生命活动相关基因具有共同来源和相似功能,但这不等于两种动物的全部DNA有同样高的百分比一致,也不代表所有基因都能一一对应。

人类与猪的基因相似度到底该按什么来算?

“基因相似度”至少可以指三种不同内容:第一种是两种动物各自有多少基因能够找到对应物;第二种是对应基因的DNA或蛋白质序列有多少字符相同;第三种是把整个参考基因组放在一起,计算能够对齐的碱基比例。三种方法的对象、单位和分母不同,得出的百分比不能互相替代。

比较口径 常用公式 主要回答的问题
基因对应关系 共同直系同源基因数 ÷ 参考物种基因数 ×100% 人类的哪些基因在猪体内有对应基因
编码序列一致性 对齐区域中相同碱基数 ÷ 对齐长度 ×100% 对应基因的DNA序列有多像
蛋白质序列一致性 相同氨基酸数 ÷ 对齐氨基酸长度 ×100% 对应蛋白质的结构和功能基础有多保守
全基因组比对 相同碱基数 ÷ 选定的比对区域或总区域 ×100% 两套参考基因组整体有多少区域能够比较

其中,“共同直系同源基因”通常比简单比较基因名称更可靠。它指的是同一个祖先基因在物种分化后形成的对应基因。若只看基因名称,可能把功能相近但来源不同的基因混在一起;若只看序列片段,又可能把重复区域或偶然相似片段误认为真正的同源关系。

如果按基因数量比较,人类和猪能对应多少基因?

按照常见的人类和猪参考基因组注释,两者的蛋白编码基因都大约处于两万条左右的量级,其中有约一万七千个量级的一对一直系同源基因可以建立较可靠的对应关系。以人类蛋白编码基因为分母,可以用下面的方式表达:

人类基因覆盖率=人猪共同直系同源基因数 ÷ 人类蛋白编码基因数 ×100%

用这一口径,通常可以得到“约八成以上人类蛋白编码基因在猪中有对应物”的结论。但它表示的是基因存在和对应关系的覆盖率,不是说这些基因的DNA序列有八成碱基完全相同,更不是说人和猪的整个基因组有八成一样。

如果希望减少分母选择带来的偏差,还可以采用对称的集合相似度:

集合相似度=共同基因数 ÷(人类基因数+猪基因数-共同基因数)×100%

这种算法适合比较两个基因集合的重叠程度,但它仍然只回答“哪些基因同时存在”,不能说明这些基因的序列、表达量或生理作用完全一致。不同数据库对蛋白编码基因、假基因、转录本和基因边界的注释不同,所以同一时期使用不同版本,统计数量也可能出现差异。

换成DNA序列后,为什么不能直接使用同一个百分比?

对应基因的DNA序列通常包含编码区、内含子和调控区域。蛋白质编码区受到功能限制,往往比非编码区域更容易保留;内含子、基因间区、重复序列和染色体结构区域的变化则可能更大。因此,选择“只比编码外显子”还是“比较完整基因”,会直接改变结果。

即使只比较同一对基因,计算结果也可能不同。以一段对齐长度为一千个碱基的区域为例,如果有八百个位置相同,按简单一致率计算就是百分之八十;但如果把插入、缺失、无法可靠对齐的位置纳入惩罚,或者改用相似性评分,结果就不再是同一个数字。

蛋白质序列也有类似情况。DNA发生了部分变化后,由于遗传密码子的冗余性,蛋白质中的氨基酸仍可能保持不变。因此,同一组基因的蛋白质一致率可能高于DNA碱基一致率。另一方面,免疫、感知、繁殖和部分代谢相关基因受到的进化压力不同,不能用一个平均值代表每个基因。

全基因组层面的“相似度”更加复杂。人类和猪的参考基因组长度、染色体结构、重复序列比例和组装质量并不完全相同。某些区域无法一一对齐,并不一定意味着完全没有相关序列,也可能是结构变异、重复序列或当前组装方法造成的比较空缺。因此,公开材料中出现的某个全基因组百分比,必须同时查看比对程序、过滤条件、分母定义和参考基因组版本。

这些统计能说明人和猪在生物学上有多像吗?

基因对应关系越多,通常说明两种动物共享的基本生物学系统越多。例如,细胞复制、能量代谢、蛋白质合成、神经活动和免疫调节等基础过程,都有一批跨物种保守的基因参与。但“有对应基因”只说明遗传来源或基本功能存在联系,不代表该基因在两种动物中的表达时间、表达组织和调控强度相同。

同一个基因在人体和猪体内可能参与相似的生理过程,但由于调控序列、蛋白质结构、组织组成和代谢环境不同,最终表现仍会有差异。所以,研究人员不会只凭一个“基因相似度百分比”判断两种动物是否能够完全互相替代,而是会进一步比较具体基因、蛋白质、通路、组织和表型。

这也是为什么“人和猪的基因有多像”与“猪是否适合作为某类研究对象”不是同一个问题。前者可以用基因组和序列统计回答,后者还需要加入器官结构、生理反应、免疫系统和实验目的等条件。

在什么情况下,哪种相似度说法更合适?

  • 用于科普或基础了解:可以说人和猪有大量共同的直系同源基因,蛋白编码基因层面的对应关系达到八成以上的量级,但不要把它简化成“全基因组相似八成”。
  • 用于生物信息学分析:应注明人类和猪的参考基因组版本、基因注释发布日期、同源基因数据库、筛选条件以及分母,最好同时报告基因数量和序列一致率。
  • 用于比较某个具体功能:应直接比较目标基因或通路,而不是引用全物种平均值。一个高度保守的代谢基因,与快速变化的免疫相关基因,可能得到完全不同的结果。
  • 用于判断DNA样本来源:不能只依靠一个总体相似度百分比,应使用物种特异性标记或经过验证的序列比对方法,因为许多基础基因在不同哺乳动物之间本来就具有相似性。

因此,最准确的回答是:人类与猪在基因集合和许多核心生物学功能上具有较高相似性,但不存在一个适用于所有场景的固定百分比。若比较基因是否有对应物,应使用直系同源基因覆盖率;若比较序列,应明确是DNA、蛋白质、编码区还是全基因组,并以指定参考基因组版本和统计公式为准。

e7fngm7tccikqdpzvbcaxcv3vyeu
免责声明:本内容来自腾讯平台创作者,不代表腾讯新闻或腾讯网的观点和立场。

相关推荐