比较人或狗的DNA与猪DNA,先要明确比较的是哪一段遗传物质,再用同源序列进行比对。三者的DNA都由A、T、C、G四种碱基构成,遗传密码和许多基本基因功能相近;真正的差异主要体现在碱基序列、基因排列、染色体结构及调控区域上。比较结果取决于所选基因和分析方法,不能用一个固定百分比概括整套DNA。
先确定比较目的和对象
如果要判断样本属于人、狗还是猪,重点是寻找能区分物种的遗传标记;如果想了解亲缘关系,应比较多个物种共有的同源基因或较大范围的基因组;如果关注某种生理特征,则应选择与该特征相关的基因及调控区域。目的不同,取样范围和结果解释也不同。
比较时还要区分“个体差异”和“物种差异”。同一物种的不同个体之间也存在遗传变异;人、狗、猪之间的差异则是长期演化积累的结果。只拿一个基因或一段短序列,通常不足以代表整个物种。
按序列比对判断异同
- 准备可比数据:使用测序质量可靠、注释清楚的人、狗和猪参考基因组,或取得来源明确的样本并进行测序。不同版本的参考数据可能存在组装差异,分析时应记录所用版本。
- 选择同源区域:优先挑选三种动物中都能找到对应序列的同源基因或基因组片段。若比较某个功能,确认所选区域确实与该功能有关;不要把不同功能的基因直接当作可比对象。
- 清理并对齐序列:检查测序错误、低质量片段和重复序列,再将对应序列排列到同一位置。这样才能识别相同碱基、碱基替换、插入或缺失,以及较大的片段变化。
- 分别统计相似度和覆盖度:相似度可按“对齐区域中相同的碱基数÷可比较的对齐碱基数”计算;覆盖度则说明实际比较了目标区域的多少。报告时应同时交代比较区域、缺口处理方式和计算口径。
- 用多个区域复核:若不同基因得出的关系不一致,可能是基因演化速度不同、基因复制后功能分化,或数据质量和比对范围不一致。扩大到多个独立区域后再判断,通常比依赖单个基因更可靠。
如果只是做物种识别,可采用经过验证的物种特异性检测方法,或比对常用的动物DNA条形码区域,并与可靠的参考序列核对。若结论用于正式检测,应设置已知阳性、阴性对照;单凭一小段序列与某个数据库条目相似,不宜直接下结论。
相同之处:基本结构相同,许多基因可对应
人、狗和猪都是哺乳动物,细胞核DNA采用相同的碱基组成和双螺旋结构,线粒体也含有自己的DNA。参与细胞代谢、发育和遗传信息读取的许多基础基因,在三者中都能找到相对应的版本。这种相似性来自共同祖先,也使研究者可以借助同源基因比较生物学过程。
不过,“存在对应基因”不等于序列完全相同,也不代表表达量、表达时间或生理作用完全一致。一个基因的编码区可能较保守,周围调控区域却有明显差别;同样的基因变化,在不同物种的遗传背景中也可能产生不同影响。
不同之处:看序列、排列和物种关系
| 比较层面 | 主要差异 | 解读要点 |
|---|---|---|
| 碱基序列 | 同源位置可能出现替换、插入或缺失 | 差异程度随基因和区域变化 |
| 基因组组织 | 基因顺序、片段长度及染色体重排不同 | 须比较对应区域,不能只看排列是否相同 |
| 染色体数目 | 人类通常为46条,狗为78条,猪为38条 | 数目不同不等于基因数量或相似度按比例变化 |
| 调控与表达 | 部分基因何时、何处、表达多少存在物种差异 | 仅比较蛋白编码区可能看不到这些差别 |
从分类关系看,狗和猪都属于胎盘哺乳动物中的劳亚兽类,人属于灵长类所在的另一大支。因此在许多保守同源区域中,狗与猪可能表现出较近的演化关系;但具体结果仍取决于分析的基因组区域,不能据此推断每个基因都由“更近”物种共享更多相同碱基。
怎样读懂“DNA相似度”结果
相似度数字只有在比较对象和算法明确时才有意义。只对齐高度保守的基因,结果往往比随机抽取的非编码区域更相似;若把无法对齐的片段排除、计入或按缺口处理,最终比例也会改变。因此,看到一个百分比时,应先检查它代表单个基因、编码区、线粒体DNA,还是全基因组可比部分,并确认是否同时报告覆盖度。
实际操作中,先确定要回答的是物种识别、亲缘关系还是特定基因差异,再选择对应区域和分析标准;随后进行质量检查、多序列比对,并用多个独立片段复核。这样得到的结果,才能区分三者共同的哺乳动物遗传基础与人、狗、猪各自积累的序列和基因组结构差异。