李怡
宣布于 汹涌网
+关注
DNA相似度,,,,指的是两个DNA样本在某些被较量的位置上有多洪流平相同或靠近。。。。。它并不是一个脱离语境就能自力诠释的牢靠百分比。。。。。同样写着“相似度”,,,,若是较量工具、检测区域、盘算要领差别,,,,数字代表的寄义也可能完全差别。。。。。
明确这类效果时,,,,最主要的不是先判断数字高不高,,,,而是先弄清晰三个问题:较量的是谁与谁、较量了DNA的哪些位置、这个数字接纳什么算法得出。。。。。只有把这三层信息放在一起,,,,才华知道它是在说明配合遗传配景、亲缘关系,,,,照旧仅仅体现某些序列相同。。。。。
DNA相似度详细是什么意思
DNA可以看作由大宗碱基排列形成的遗传信息。。。。。若把两个样本在统一段位置举行排列和比对,,,,某些位置的碱基相同,,,,某些位置差别,,,,就可以凭证“相同位置占所有较量位置的比例”盘算相似度。。。。。最简朴的表达可以明确为:
相似度≈相同或匹配的位置数÷现实加入较量的位置总数。。。。。
但现实中的检测通常不会把所有DNA都逐字逐位较量。。。。。有的检测关注特定基因片断,,,,有的较量短串联重复序列,,,,也有的剖析更普遍的基因组区域。。。。。因此,,,,“相似度”可能是序列相似、标记匹配、遗传距离较近,,,,或者统计模子推算出的关系概率,,,,它们不可直接相互替换。。。。。
还要区分“DNA相似度”和“亲缘概率”。。。。。相似度形貌的是样本之间有几多内容相同;;;亲缘概率则是在已知检测效果、群体频率和假设条件下,,,,盘算某种亲缘关系建设的可能性。。。。。后者不是把前者换算成一个更大的百分比。。。。。
若是较量的是通俗人与通俗人:高相似不即是关系很近
人类个体之间的DNA整体很是相似。。。。。常见的科普表达是,,,,人类相互约有99.9%的DNA序列相同,,,,但详细数值会随着参考基因组、较量规模以及是否纳入结构变异而转变。。。。。这个数字说明人类共享大宗基本遗传信息,,,,并不体现恣意两小我私家都具有近亲关系。。。。。
剩下的差别虽然占比很。。。。。,,,却可能影响外貌、血型、药物反应、疾病易感性等差别特征。。。。。由于整个基因组包括的信息很是重大,,,,“只占很小比例的差别”依然可以包括足以区分个体的内容。。。。。因此,,,,不可用“各人总体上都很像”来推断两小我私家的详细亲缘远近。。。。。
例如,,,,两位没有已知支属关系的人,,,,整体序列也会高度相似;;;兄弟姐妹之间通常共享较多遗传片断,,,,但共享水平并不会在每个位置都恰恰相同。。。。。所谓“相似度高”,,,,需要连系较量区域和遗传关系模子,,,,才华进一步说明它是否凌驾了通俗人之间的配合水平。。。。。
若是用于亲子判断:看的是遗传标记匹配,,,,不是整小我私家的DNA百分比
亲子判断中常用的是多个特定遗传标记,,,,尤其是短串联重复序列。。。。。孩子在每个检测位点划分从生物学怙恃各获得一份遗传信息,,,,因此,,,,检测会视察孩子的相关位点能否由母亲和被检男子的组合合明确释。。。。。
这种场景下,,,,报告中的“支持亲子关系概率”与“DNA相似度”不是统一个看法。。。。。孩子并不是与父亲拥有某个简朴的“百分之几多相似”,,,,而是在多个自力位点上泛起出切合遗传纪律的匹配。。。。。检测位点越多、效果越一致,,,,统计模子通常越能支持某种亲缘关系;;;若是泛起无法由遗传纪律诠释的扫除位点,,,,则可能不支持该关系,,,,详细仍需连系检测系统和报告结论明确。。。。。
因此,,,,看到亲子判断报告时,,,,不宜把“累计亲权指数”“亲权概率”直接明确成“DNA相似度”。。。。。前者是基于统计假设的关系判断,,,,后者通常只是对序列或标记匹配水平的归纳综合。。。。。两者使用的分母、算法和问问题的都差别。。。。。
若是较量的是差别物种或差别人群:数字必需放回较量规模
较量差别物种时,,,,DNA相似度往往受到基因组对齐方法影响。。。。。研究者可能只较量能够对应上的基因区域,,,,也可能把重复序列、缺失片断和结构差别纳入盘算。。。。。于是,,,,统一组生物在差别研究要领下可能获得差别的相似度数字。。。。。
这类效果通常用于说明配合演化配景或遗传距离,,,,不可简朴明确为“相似度抵达某个百分比,,,,就一定保存某种直接祖先关系”。。。。。相似度高可以体现共享较多遗传信息,,,,但配合祖先的时间远近、详细亲缘路径,,,,还要依赖系统发育剖析和更多证据判断。。。。。
在人群较量中也同样云云。。。。。差别地区人群之间保存一些基因频率差别,,,,但人类群体之间的遗传一连性很强,,,,群体内部的个体差别也很富厚。。。。。某个样本与某地区参考群体的相似水平,,,,不可直接等同于小我私家国籍、民族身份或完整祖源。。。。。祖源剖析中的比例通常是模子凭证参考数据库推算的遗传因素预计,,,,并不是小我私家DNA被切成几块后划分属于差别地区。。。。。
为什么统一个“相似度”可能获得差别数字
- 较量工具差别:人与人、亲子样本、兄弟姐妹、差别物种,,,,使用的诠释标准差别。。。。。
- 检测规模差别:只检测几个遗传标记,,,,与较量大宗基因组区域,,,,效果不可直接横向较量。。。。。
- 盘算单位差别:有的统计碱基是否相同,,,,有的统计等位基因是否匹配,,,,有的盘算遗传距离或关系概率。。。。。
- 参考数据库差别:祖源或群体剖析依赖参考人群,,,,数据库组成会影响模子给出的预计。。。。。
- 样本和质量差别:可比对区域缺乏、样本混淆或检测质量较低时,,,,效果的诠释规模会受到限制。。。。。
以是,,,,一个脱离报告名称和检测说明的“DNA相似度百分比”,,,,通常只能说明外貌上的匹配水平,,,,不可自动回覆“是不是亲生”“是不是近亲”或“来自那里”等更详细的问题。。。。。
看到DNA相似度效果时,,,,可以这样判断
- 先看较量工具:确认样本之间是什么关系,,,,报告是在较量个体、支属、物种,,,,照旧参考人群。。。。。
- 再看检测内容:相识剖析的是全基因组、特定基因、STR位点,,,,照旧其他遗传标记。。。。。
- 确认数字的名称:区分“序列一致率”“匹配率”“相似度”“遗传距离”“亲权概率”等术语。。。。。
- 审查结论对应的问题:一个数字只能回覆它被设计往返覆的问题,,,,不可跨场景推导出其他结论。。。。。
归纳综合来说,,,,DNA相似度是对某一组遗传信息相同水平的形貌,,,,而不是所有亲缘问题的统一谜底。。。。。数字越高,,,,通常体现在指定较量规模内越靠近;;;但它事实意味着配合的人类遗传配景、特定标记的匹配,,,,照旧亲缘关系的统计支持,,,,必需由较量工具、检测区域和盘算要领配合决议。。。。。