做基因序列分析时,真正耗时间的地方往往不在打开文件,而在判断哪些序列适合直接比较。实验样本一多,序列长度、方向、测序质量都会出现差别,有时只是一小段碱基质量不好,就会把整段比对带偏。DNASTAR常被用于序列整理、注释查看和多序列比对,处理这类数据时,先把原始序列理顺,再去看差异位置,结果通常更容易判断。
一、DNASTAR怎么进行基因序列分析
DNASTAR处理基因序列时,常会在SeqBuilder Pro和MegAlign Pro之间切换。前者适合查看、编辑单条序列,多个样本需要比较时,再把整理后的序列放进比对模块。
1、先检查准备分析的序列
序列导入以后,先看首尾和整体长度。这个环节看着简单,却能提前发现不少明显的数据问题。
①、启动【DNASTAR Lasergene】。
②、打开【SeqBuilder Pro】。
③、依次点击【File】→【Open】。
④、选择本次要处理的【序列文件】。
⑤、在【序列窗口】中查看碱基内容和序列长度。
⑥、记录连续出现未知碱基或明显缺失的位置。
2、整理目标片段和序列方向
①、在【SeqBuilder Pro】中打开目标【Sequence】。
②、定位实验需要比较的【目标区域】。
③、选中无关的首尾片段并进行编辑。
④、检查当前序列方向。
⑤、方向相反时使用【Reverse Complement】进行调整。
⑥、通过【Save As】保存处理后的文件。
不同样本如果比较范围不一致,MegAlign Pro往往会在两端产生大量没有分析价值的缺口。把目标区域先对齐,后面看结果会清楚很多。
3、进行多序列比对
①、打开【MegAlign Pro】。
②、把整理后的【DNA序列】加入当前项目。
③、检查各条【Sequence】名称是否对应正确样本。
④、进入【Alignment】相关设置。
⑤、选择当前任务使用的比对方法。
⑥、运行【Multiple Alignment】。
⑦、在结果窗口中查看碱基替换、插入、缺失和连续差异区。
二、DNASTAR基因序列分析结果异常如何检查
序列分析异常时,软件未必会弹出错误提示。比较常见的情况是程序正常完成计算,但排列出来的结果明显不顺,这时候要从异常开始的位置往回查。
1、某一段突然出现大量差异
如果前面的序列排列正常,到了某个位置后差异突然增多,先检查这一段原始数据,不要马上把整套参数全部改掉。
①、在【MegAlign Pro】中找到差异开始集中的位置。
②、记下对应的【Sequence】名称。
③、返回【SeqBuilder Pro】打开原始序列。
④、定位相同的【序列区域】。
⑤、检查附近是否存在连续【N】、缺失碱基或异常字符。
⑥、处理能够确认的问题后重新执行【Alignment】。
2、两条序列基本无法对应
①、分别打开两条【Sequence】。
②、检查两条序列的读取方向。
③、确认比较区域是否属于同一段基因。
④、对方向相反的序列执行【Reverse Complement】。
⑤、保存新的【Sequence】。
⑥、重新加入【MegAlign Pro】运行比对。
3、比对结果出现很长的缺口
①、打开当前【Alignment】结果。
②、找到连续出现【Gap】的位置。
③、核对该位置对应的【原始序列】。
④、进入【Alignment】参数页面。
⑤、查看当前缺口相关设置。
⑥、调整参数后重新运行比对。
⑦、保留调整前后的结果进行对照。
如果缺口随着参数变化大幅移动,就需要结合原始序列判断。单纯让排列看起来更整齐,并不能说明结果更可靠。
4、参考序列和样本总是对不上
有时候样本数据本身没有明显问题,但参考对象选错版本、选错区域,也会让结果一直偏离预期。
①、确认当前使用的【参考序列】名称。
②、检查参考文件的版本信息。
③、查看实验序列对应的【目标区域】。
④、核对两边是否属于同一段基因区域。
⑤、更换正确的【参考序列文件】。
⑥、重新执行【Multiple Alignment】。
5、同一批数据两次结果不一样
①、打开之前保存的【MegAlign Pro项目】。
②、核对当时使用的【序列文件】。
③、查看原来的【Alignment】设置。
④、检查当前文件是否做过剪切或方向调整。
⑤、使用原来的数据重新计算。
⑥、对照两次结果中的差异位置。
三、DNASTAR基因序列分析结果如何复核
比对图已经排得很整齐,也不能直接把所有差异都当成可靠结果。准备记录突变、缺失或者样本间差别时,再回原始序列核一次,会少掉不少误判。
1、回查准备记录的关键位点
①、在【MegAlign Pro】中找到目标差异位置。
②、记录对应的【Sequence】名称和附近碱基。
③、打开样本的【原始序列文件】。
④、定位相同的【碱基区域】。
⑤、核对差异位置前后的原始数据。
⑥、确认后再把该位置写入分析记录。
遇到原始序列附近存在连续未知碱基、明显缺口的情况,这个位点就要谨慎处理,不能只凭比对窗口里的字符变化下判断。
2、把分析时用过的文件和设置留好
①、保存当前【MegAlign Pro项目】。
②、另外保留一份【原始序列文件】。
③、保存已经整理过的【处理后序列】。
④、记下本次使用的【Alignment】设置。
⑤、导出需要继续核对的【比对结果】。
过一段时间再看同一批数据时,最容易忘掉的往往不是样本名称,而是当时到底改过哪些序列、用了什么比对条件。把这些资料放在一起,后面新增样本或者回查某个位置时会省下不少重复工作。
总结
DNASTAR做基因序列分析,结果出来以后还得留一点耐心去核对。比对图里看到的差异,有时来自样本本身,有时只是序列方向、截取范围或者原始数据质量带来的变化。碰到看着不太对的位置,回到原始序列再看一遍,往往比反复改设置更有用。平时把原始数据和分析记录留清楚,后面再碰到相似情况,也更容易判断问题出在哪。
