#!/bin/tcsh # megablast find predicted exons in genomes; run per genome dir # 0805: change from all-but some, to only GLEANR and NCBI_GNO # $skip= ($gr=~m/DGIL_SNO|BATZ_CNA|RGUI_GID|^TRd\w+/); next if($skip);\ # $skip= ($gr=~m/NCBI_GNO|GLEANR/)? 0 : 1; next if($skip);\ set nb=/bio/bio-grid/ncbi-20060507/ncbi/bin # dpse: dirset={2,3,4_group*,XL_group*,XR_group*} # most: dirset=scaffold_* ##foreach dir ({2,3,4_group*,XL_group*,XR_group*}) foreach dir (scaffold_*) set fex=$dir/*_exons.fa.gz echo "# split $fex by predictors" gunzip -c $fex | env fin=$fex perl -ne 'use FileHandle;\ if(/^>(\D+)/){ $gr=$1; $gr=~s/_$//; $fh=undef;\ $skip= ($gr=~m/NCBI_GNO|GLEANR/)? 0 : 1; next if($skip);\ $fn=$ENV{fin}; $fn=~s,/[^/]*$,/$gr-pexons.fa, or die; \ $fh=$fhs{$fn}; unless($fh){ $fhs{$fn}= $fh= new FileHandle "> $fn"; } }\ print $fh $_ unless($skip);' # fixme _caf > other, but not all *.fa.gz > dsec_br051028.fa.gz # set faz="$dir/d*_caf060210.fa.gz" set faz=`/bin/ls -1 $dir/*_*.fa.gz | grep -v exons` set fna=`echo $faz | sed -e's/.gz//'` gzcat $faz | $nb/formatdb -pF -n $fna -i stdin echo "# megablast start" $fna , `date` foreach predict ($dir/*-pexons.fa) echo "# megablast query=$predict" $nb/megablast -W11 -t16 -N0 -gT -e0.05 -D3 -i $predict -d $fna -o $predict.mbout end /bin/rm $fna.{nsq,nin,nhr} echo "# megablast done" $fna , `date` end exit # --- formatdb ------ now in main loop # --- exon split ---- now in main loop