人类与猪的基因相似度:按基因数量和DNA序列口径统计

“人类与猪的基因相似度”没有一个脱离计算口径后仍然成立的固定百分比。要得到可解释的结果,必须先确定比较对象:是整个基因组、共同的同源基因、某个基因的DNA序列,还是基因编码出的蛋白质。不同对象使用的分母、比对范围和“相同”的判断标准不同,因此结果也不能直接互相替换。

先区分三种常见的相似度

比较口径 实际在计算什么 常用单位
共同同源基因比例 人类基因中有多少能在猪基因组中找到对应的同源基因 基因个数、百分比
DNA序列一致率 两条经过比对的DNA序列中,有多少位置的碱基完全相同 碱基数、百分比
蛋白质序列相似度 对应蛋白质的氨基酸是否相同,或是否属于性质接近的替换 氨基酸数、百分比

因此,“人和猪有多少基因相同”和“人猪DNA序列有多少百分比相同”并不是同一道题。前者关注基因是否存在对应关系,后者关注序列逐位是否一致。即便两个物种拥有大量相同功能的基因,也不代表这些基因的每一个碱基都相同。

如果想比较整个基因组:先统一范围,再计算碱基一致率

整体比较适合回答“两个物种在可对应的基因组区域上有多像”。但人类和猪的基因组长度不同,基因排列、重复序列、插入和缺失也存在差异,所以不能简单地把两套基因组从第一个碱基开始逐位相除。

  1. 确定参考数据。记录人类和猪使用的参考基因组版本、染色体范围以及是否纳入重复区域。不同版本可能会影响可比区域的数量。
  2. 确定比较区域。可以比较全基因组,也可以只比较蛋白质编码区、已确认的同源区域或某类功能区域。范围必须在结果中说明。
  3. 进行序列比对。比对程序会把两物种中可能对应的序列排列在一起,并标记碱基替换、插入和缺失。
  4. 统计可比较位置。通常要说明缺口如何处理:是排除缺口后只统计两边都有碱基的位置,还是将缺口也纳入差异。
  5. 计算一致率。如果排除缺口,基本公式是:DNA一致率 = 完全相同的碱基数 ÷ 可比较的碱基总数 × 100%

例如,某次比对得到100万个位点,其中82万个位置的碱基完全相同,那么该区域的DNA一致率就是82%。这只是一个计算示例,不是人类与猪全基因组的实际统计值。若目标区域原本有120万个碱基,但最终只有100万个位置能够可靠对应,还应同时报告比对覆盖率:100万 ÷ 120万 × 100%,约为83.3%。

覆盖率和一致率需要一起看。只保留容易比对的保守片段,可能得到较高的一致率,但并不能说明整个基因组都达到同样水平;扩大到重复序列、结构变异较多的区域后,结果也可能发生变化。

如果只关心共同基因:计算“对应基因比例”

有些资料说“人类和猪有很多共同基因”,它们通常讨论的是同源基因或直系同源基因,而不是把所有DNA碱基拿来比较。直系同源基因一般指物种分化后由共同祖先基因演化而来的对应基因,判断时还要结合基因注释、进化关系和序列比对。

这种口径的公式是:

对应基因比例 = 找到猪对应基因的人类基因数 ÷ 作为分母的人类基因总数 × 100%

这里的分母尤其重要。若只统计蛋白质编码基因,结果与把非编码基因、假基因或尚未确认功能的基因纳入统计时不同;若反过来以猪的基因总数为分母,得到的比例也不会相同。

举例来说,假设某个研究选定1000个人类蛋白质编码基因,其中900个能找到经过确认的猪直系同源基因,那么该研究口径下的对应基因比例就是90%。这表示“基因层面能找到对应对象”,并不表示这900个基因的DNA序列有90%的碱基完全相同。

如果比较某一个基因:分别看DNA、编码区和蛋白质

当问题涉及某个具体基因、疾病通路或生理功能时,局部比较通常比给出一个全基因组数字更有意义。此时应先确认人类基因和猪基因是否确实是对应的直系同源基因,再决定比较哪一段。

  • 比较基因组DNA:包括外显子、内含子和调控区域时,序列长度与差异往往不同。
  • 比较编码区:只看能够翻译成蛋白质的部分,常用碱基一致率或密码子差异率。
  • 比较蛋白质:将DNA翻译成氨基酸后进行比对,可统计完全相同的氨基酸,也可把性质相近的替换计入“相似”。

假设一个人类和猪的对应编码区经过比对后,有1000个可比较的碱基,其中820个完全相同,那么DNA一致率为82%。如果翻译后的蛋白质有330个可比较的氨基酸,其中310个完全相同,则蛋白质一致率为310 ÷ 330 × 100%,约为93.9%。这两个数字可以同时出现,因为多个不同的DNA密码子可能编码同一种氨基酸。

蛋白质“相似度”还可能采用替换评分矩阵,将带电性质、大小或疏水性相近的氨基酸替换视为保守替换。因此,蛋白质相似度通常高于严格的完全相同率;如果没有写明评分规则,单看“相似度”这个词很难复算。

为什么不同资料会给出不同百分比

  • 比较对象不同:全基因组、同源基因、编码区和蛋白质并非同一个分母。
  • 参考版本不同:基因组装版本更新后,缺口、重复区域和基因注释都可能变化。
  • 对齐范围不同:只统计保守区域,通常比纳入所有可比区域更容易得到较高一致率。
  • 缺口处理不同:有人排除插入和缺失,有人把它们作为差异计入。
  • “相似”定义不同:DNA常按碱基完全一致计算,蛋白质则可能把保守替换也算入。
  • 分母不同:以人类基因为分母、以猪基因为分母,或者以两者交集为分母,结果含义都不同。

怎样准确表述一个计算结果

一个合格的结果至少应同时写出物种、数据版本、比较区域、比对规则、分母、匹配数量和百分比。例如可以表述为:“在指定版本的两物种同源编码区中,排除缺口后统计可比碱基,完全一致碱基占可比碱基的某个比例。”这样的说法比单独写“人类与猪的基因相似度是某个百分比”更准确。

如果只是想了解总体关系,可以记住:人类和猪拥有许多能够对应的同源基因,部分生物学通路也具有可比性;但“共同基因比例”“DNA序列一致率”和“蛋白质相似度”代表不同层次的统计结果。判断一个数字是否可靠,关键不是数字看起来高不高,而是先看它比较了什么、分母是什么,以及哪些区域被纳入了计算。

免责声明:本内容来自腾讯平台创作者,不代表腾讯新闻或腾讯网的观点和立场。

相关推荐