DNASTAR EditSeq序列格式怎样转换,转换之后碱基编号发生错位又该怎样处理,操作者需要先确认原始文件的类型。普通的FASTA、GenBank、EMBL、ABI测序峰图,以及纯文本序列,各自保存下来的信息并不相同。格式转换从表面上看,只是另存为另一种文件,但它实际上会对序列的名称、注释、方向、起止位置和编号显示造成影响。在DNASTAR的文件格式资料里,Lasergene中与分子生物学及蛋白质相关的工具,能够支持多种导入和导出格式,经常被用到的导出格式包括EMBL、FASTA以及GenBank。
一、DNASTAR EditSeq序列格式怎样转换
用EditSeq去处理格式转换时,重要的一步是先打开正确的序列,然后再去挑选合适的输出格式。操作者不能直接去更改文件的扩展名,扩展名被修改以后,并不意味着文件内部的格式已经真正转换成功。
1、先把原始的序列文件打开
操作者通过【File】再到【Open】的路径,把原始的序列文件导入进来,先要确认序列的长度、方向、名称,还有注释,这些内容是不是都显示正常。
假如被打开的文件是一份测序数据,就需要先查看碱基有没有被正确识别,序列两端是否还留着低质量的片段。要是原始数据本身就有缺口、里面出现了许多N碱基,或者它的方向和目标序列正好相反,那么直接把它转换成FASTA或GenBank格式,也不能解决原来的问题,只是把旧有错误换了一套格式重新保存下来。
2、挑选目标保存格式
操作者通过【File】再到【Save As】,或者与导出功能相关的入口,选好目标格式,例如FASTA、GenBank、EMBL,或者纯文本序列。
FASTA这种格式,更加适合用来保存最基础的序列和它的名称,文件结构简洁,方便后续进行比对,也方便提交给其他软件去使用;GenBank、EMBL这一类的格式,更加适合保留注释内容、特征所处的位置,以及序列的来源信息。如果后续还需要把CDS、引物、限制性酶切位点,或者feature注释留下来,那么不建议只把序列存成FASTA格式,因为许多注释信息可能没有办法被完整地保留。
3、批量转换需要使用适合的工具
如果只有少量的文件,用EditSeq逐个进行另存就可以;如果面对一整批ABI、FASTA,或者其他类型的序列文件,则可以考虑使用Lasergene里的批量转换工具。DNASTAR的说明里曾经提到,SeqNinja这个工具可以用来把一个或多个序列文件,较快地转换成另一种文件类型,并且它被包含在多个Lasergene套装里面。在进行批量转换之前,较好的做法是先取两三个文件进行测试,等确认了名称、长度和方向全部正确以后,再去处理整批数据。
二、DNASTAR EditSeq转换后碱基编号错位怎样处理
碱基编号出现错位,经常遇到的原因并不是转换本身失败,而是序列被截掉了一段、被反向互补、低质量片段被去除,或者注释里的坐标没有跟着一起更新。排查的时候,需要把序列的长度和注释所标示的位置放在一起对照。
1、先比较转换前后序列的长度
操作者要对照【Sequence Length】、【起始碱基】和【末端碱基】,确认转换前后的长度是不是还保持一致。
如果长度本身已经减少了,那么编号自然也会跟着出错。常见的情况是,在导出的时候只保存了被选中的区域,或者在导入的时候,软件自行去掉了空格、数字、换行以及无效字符。在纯文本序列里面,如果混杂了编号、空格或说明性的文字,软件在进行识别时,可能会把这些内容忽略掉,这样就会让编号看起来产生了偏移。
2、检查序列是否被做了反向互补操作
如果转换完成之后,序列的方向发生了颠倒,那么原来处于最前面的那个碱基,就不再对应目标序列的起点了。尤其是在进行克隆验证、引物设计,以及测序拼接的过程中,有些序列会先被反向互补再保存下来。在这种情况下,编号就不仅仅偏移了几个碱基,而是整个方向都变了。
遇到这类情形,需要回到原始序列那里,去确认是不是执行过reverse complement操作。引物、酶切位点,还有CDS注释,这几项内容也需要放在一起检查,不能只查看碱基本身。
3、查看注释坐标有没有被保留下来
如果从GenBank格式往FASTA格式去转,许多feature注释不会按照原来的样子被保存下来。等到后面重新打开FASTA文件时,软件能够看到的,就只剩下序列和它的标题,原本位于文件中的CDS、gene、primer、misc feature,它们的坐标很有可能已经丢失了。这个时候,表面上看起来像是编号发生了错位,实际上却是注释信息没有跟随格式一起被存储下来。
三、转换后怎样核对序列才更加稳妥
序列格式被转换完成以后,不能仅仅去看文件是不是还能被打开。真正需要确认下来的,是序列的主体、编号、注释,以及后续分析之间,是否还能够相互对应。
1、用关键位点去核对位置
操作者需要围绕【起始密码子】、【终止密码子】、【限制性内切酶位点】和【引物结合区】,检查转换过后的位置是不是还和原先保持一致。
举例来说,原先引物结合区位于第120位到第140位,转换之后却挪到了第118位到第138位,遇到这种情况,就需要回过头去检查是不是在前面少掉了两个碱基。利用关键位点去下手,比用眼睛逐行去数碱基更加可靠,也更容易把产生偏移的来源找出来。
2、把原始文件和转换文件都保留下来
在动手转换之前,原始的文件不要被覆盖掉。比较建议的做法是,把原始序列、经过清理的序列,以及被转成目标格式的文件,这三个版本都保留好。到了后面,万一发现编号出现错位,还可以回过头去逐一对照,看看在每一个步骤当中,究竟修改了哪些内容。要是只把最后那一份FASTA文件留下来,许多问题到了后面就很难再往回追溯。
3、提交分析前再做一次比对
转换之后的序列,如果准备被用在比对、引物设计、注释提交,或是克隆验证这些用途上,较妥的办法是让它和原始序列再做一次两两比对。只要其中出现了插入、缺失、方向反转,或者头尾被截断的情况,比对出来的结果会比人工查看快得多地把问题暴露出来。
总结
DNASTAR EditSeq的序列格式怎样转换,转换以后碱基编号错位又该怎样处理,关键在于先弄清楚原始文件是何种类型,再根据后续用途,把FASTA、GenBank、EMBL或者其他格式挑选出来。转换完成之后如果出现了编号错位的问题,就先去检查序列的长度、被导出的范围、方向有没有被改动,以及注释坐标是不是被保留了下来。操作者不要一开始就认定是软件在转换时出现了错误。对那些较为重要的序列,建议把原始文件保存下来,再利用关键位点和序列比对的结果进行复核,这样做是为了避免编号偏移的问题,给后续的注释、引物设计,以及实验判断带来干扰。
