马家辉
宣布于 潇湘名医
+关注
“人类与猪的基因相似度”没有一个脱离盘算口径后仍然建设的牢靠百分比。。要获得可诠释的效果,,,必需先确定较量工具:是整个基因组、配合的同源基因、某个基因的DNA序列,,,照旧基因编码出的卵白质。。差别工具使用的分母、比对规模和“相同”的判断标准差别,,,因此效果也不可直接相互替换。。
先区分三种常见的相似度
| 较量口径 |
现着实盘算什么 |
常用单位 |
| 配条约源基因比例 |
人类基因中有几多能在猪基因组中找到对应的同源基因 |
基因个数、百分比 |
| DNA序列一致率 |
两条经由比对的DNA序列中,,,有几多位置的碱基完全相同 |
碱基数、百分比 |
| 卵白质序列相似度 |
对应卵白质的氨基酸是否相同,,,或是否属于性子靠近的替换 |
氨基酸数、百分比 |
因此,,,“人和猪有几多基因相同”和“人猪DNA序列有几多百分比相同”并不是统一道题。。前者关注基因是否保存对应关系,,,后者关注序列逐位是否一致。。即便两个物种拥有大宗相同功效的基因,,,也不代表这些基因的每一个碱基都相同。。
若是想较量整个基因组:先统一规模,,,再盘算碱基一致率
整体较量适合回覆“两个物种在可对应的基因组区域上有多像”。。但人类和猪的基因组长度差别,,,基因排列、重复序列、插入和缺失也保存差别,,,以是不可简朴地把两套基因组从第一个碱基最先逐位相除。。
- 确定参考数据。。纪录人类和猪使用的参考基因组版本、染色体规模以及是否纳入重复区域。。差别版本可能会影响可比区域的数目。。
- 确定较量区域。。可以较量全基因组,,,也可以只较量卵白质编码区、已确认的同源区域或某类功效区域。。规模必需在效果中说明。。
- 举行序列比对。。比对程序会把两物种中可能对应的序列排列在一起,,,并标记碱基替换、插入和缺失。。
- 统计可较量位置。。通常要说明缺口如那里置:是扫除缺口后只统计双方都有碱基的位置,,,照旧将缺口也纳入差别。。
- 盘算一致率。。若是扫除缺口,,,基本公式是:DNA一致率 = 完全相同的碱基数 ÷ 可较量的碱基总数 × 100%。。
例如,,,某次比对获得100万个位点,,,其中82万个位置的碱基完全相同,,,那么该区域的DNA一致率就是82%。。这只是一个盘算示例,,,不是人类与猪全基因组的现实统计值。。若目的区域原本有120万个碱基,,,但最终只有100万个位置能够可靠对应,,,还应同时报告比对笼罩率:100万 ÷ 120万 × 100%,,,约为83.3%。。
笼罩率和一致率需要一起看。。只保存容易比对的守旧片断,,,可能获得较高的一致率,,,但并不可说明整个基因组都抵达同样水平;;;;;扩大到重复序列、结构变异较多的区域后,,,效果也可能爆发转变。。
若是只体贴配合基因:盘算“对应基因比例”
有些资料说“人类和猪有许多配合基因”,,,它们通常讨论的是同源基因或直系同源基因,,,而不是把所有DNA碱基拿来较量。。直系同源基因一样平常指物种分解后由配合祖先基因演化而来的对应基因,,,判断时还要连系基因注释、进化关系和序列比对。。
这种口径的公式是:
对应基因比例 = 找到猪对应基因的人类基因数 ÷ 作为分母的人类基因总数 × 100%
这里的分母尤其主要。。若只统计卵白质编码基因,,,效果与把非编码基因、假基因或尚未确认功效的基因纳入统计时差别;;;;;若反过来以猪的基因总数为分母,,,获得的比例也不会相同。。
举例来说,,,假设某个研究选定1000小我私家类卵白质编码基因,,,其中900个能找到经由确认的猪直系同源基因,,,那么该研究口径下的对应基因比例就是90%。。这体现“基因层面能找到对应工具”,,,并不体现这900个基因的DNA序列有90%的碱基完全相同。。
若是较量某一个基因:划分看DNA、编码区和卵白质
当问题涉及某个详细基因、疾病通路或心理功效时,,,局部较量通常比给出一个全基因组数字更有意义。。此时应先确认人类基因和猪基因是否确实是对应的直系同源基因,,,再决议较量哪一段。。
- 较量基因组DNA:包括外显子、内含子和调控区域时,,,序列长度与差别往往差别。。
- 较量编码区:只看能够翻译成卵白质的部分,,,常用碱基一致率或密码子差别率。。
- 较量卵白质:将DNA翻译成氨基酸后举行比对,,,可统计完全相同的氨基酸,,,也可把性子相近的替换计入“相似”。。
假设一小我私家类和猪的对应编码区经由比对后,,,有1000个可较量的碱基,,,其中820个完全相同,,,那么DNA一致率为82%。。若是翻译后的卵白质有330个可较量的氨基酸,,,其中310个完全相同,,,则卵白质一致率为310 ÷ 330 × 100%,,,约为93.9%。。这两个数字可以同时泛起,,,由于多个差别的DNA密码子可能编码统一种氨基酸。。
卵白质“相似度”还可能接纳替换评分矩阵,,,将带电性子、巨细或疏水性相近的氨基酸替换视为守旧替换。。因此,,,卵白质相似度通常高于严酷的完全相同率;;;;;若是没有写明评分规则,,,单看“相似度”这个词很难复算。。
为什么差别资料会给出差别百分比
- 较量工具差别:全基因组、同源基因、编码区和卵白质并非统一个分母。。
- 参考版本差别:基因组装版本更新后,,,缺口、重复区域和基因注释都可能转变。。
- 对齐规模差别:只统计守旧区域,,,通常比纳入所有可比区域更容易获得较高一致率。。
- 缺口处置惩罚差别:有人扫除插入和缺失,,,有人把它们作为差别计入。。
- “相似”界说差别:DNA常按碱基完全一致盘算,,,卵白质则可能把守旧替换也算入。。
- 分母差别:以人类基由于分母、以猪基由于分母,,,或者以两者交集为分母,,,效果寄义都差别。。
怎样准确表述一个盘算效果
一个及格的效果至少应同时写出物种、数据版本、较量区域、比对规则、分母、匹配数目和百分比。。例如可以表述为:“在指定版本的两物种同源编码区中,,,扫除缺口后统计可比碱基,,,完全一致碱基占可比碱基的某个比例。。”这样的说法比单独写“人类与猪的基因相似度是某个百分比”更准确。。
若是只是想相识总体关系,,,可以记着。喝死嗪椭碛涤行矶嗄芄欢杂Φ耐椿,,,部学生物学通路也具有可比性;;;;;但“配合基因比例”“DNA序列一致率”和“卵白质相似度”代表差别条理的统计效果。。判断一个数字是否可靠,,,要害不是数字看起来高不高,,,而是先看它较量了什么、分母是什么,,,以及哪些区域被纳入了盘算。。
y54fqvbzqedpnoubelngntydjnfb2me