BUSCO
Nesta seção:
Descrição
BUSCO (Benchmarking Universal Single-Copy Orthologs) é uma ferramenta para avaliar a completude de montagens genômicas, transcriptômicas e anotações baseada em genes ortólogos de cópia única esperados em determinadas linhagens.
Versões Disponíveis
busco/5.5.0
Submissão de Jobs
#!/bin/bash
#SBATCH -J busco
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G
export INPUT="genome.fasta"
export OUTPUT="busco_output/"
module load busco/5.5.0
job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_output -m genome -c $SLURM_CPUS_PER_TASK
Modos de Execução
BUSCO pode ser executado em três modos diferentes:
genome: para montagens genômicas
proteins: para conjuntos de proteínas
transcriptome: para montagens de transcriptoma
Modo Genome
#!/bin/bash
#SBATCH -J busco_genome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
export INPUT="genome.fasta"
export OUTPUT="busco_genome/"
module load busco/5.5.0
job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_genome -m genome -c $SLURM_CPUS_PER_TASK
Modo Proteins
#!/bin/bash
#SBATCH -J busco_proteins
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G
export INPUT="proteins.faa"
export OUTPUT="busco_proteins/"
module load busco/5.5.0
job-nanny busco -i proteins.faa -l eukaryota_odb10 -o busco_proteins -m proteins -c $SLURM_CPUS_PER_TASK
Modo Transcriptome
#!/bin/bash
#SBATCH -J busco_transcriptome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
export INPUT="transcriptome.fasta"
export OUTPUT="busco_transcriptome/"
module load busco/5.5.0
job-nanny busco -i transcriptome.fasta -l eukaryota_odb10 -o busco_transcriptome -m transcriptome -c $SLURM_CPUS_PER_TASK
Bancos de Dados Disponíveis
Lista de linhagens disponíveis:
# Ver bancos disponíveis
busco --list-datasets
Principais bancos:
bacteria_odb10: Bactérias
archaea_odb10: Archaea
eukaryota_odb10: Eucariotos
fungi_odb10: Fungos
metazoa_odb10: Metazoários
vertebrata_odb10: Vertebrados
mammalia_odb10: Mamíferos
aves_odb10: Aves
actinopterygii_odb10: Peixes
embryophyta_odb10: Plantas terrestres
Job Array para Múltiplas Amostras
#!/bin/bash
#SBATCH -J busco_array
#SBATCH --array=1-10
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
#SBATCH --output=busco_%A_%a.out
SAMPLES=(
"sample1.fasta"
"sample2.fasta"
"sample3.fasta"
"sample4.fasta"
"sample5.fasta"
"sample6.fasta"
"sample7.fasta"
"sample8.fasta"
"sample9.fasta"
"sample10.fasta"
)
SAMPLE=${SAMPLES[$SLURM_ARRAY_TASK_ID-1]}
export INPUT="$SAMPLE"
export OUTPUT="busco_${SAMPLE%.fasta}/"
module load busco/5.5.0
job-nanny busco -i $SAMPLE -l eukaryota_odb10 -o busco_${SAMPLE%.fasta} -m genome -c $SLURM_CPUS_PER_TASK
Análise de Resultados
Após a execução, o BUSCO gera um resumo no arquivo short_summary.txt:
cat busco_output/short_summary*.txt
Exemplo de saída:
# BUSCO version is: 5.5.0
# The lineage dataset is: eukaryota_odb10 (Creation date: 2020-09-10, number of BUSCOs: 255)
# Summarized benchmarking in BUSCO notation for file 'genome.fasta'
# BUSCO was run in mode: genome
***** Results: *****
C:98.2%[S:97.6%,D:0.6%],F:0.8%,M:1.0%,n:255
251 Complete BUSCOs (C)
249 Complete and single-copy BUSCOs (S)
2 Complete and duplicated BUSCOs (D)
2 Fragmented BUSCOs (F)
2 Missing BUSCOs (M)
255 Total BUSCO groups searched
Interpretação:
C: Completos (S+D)
S: Completos e cópia única
D: Completos e duplicados
F: Fragmentados
M: Ausentes
Referências
Documentação: https://busco.ezlab.org/
GitHub: https://gitlab.com/ezlab/busco
Bancos de dados: https://busco-data.ezlab.org/
Ver também
Trinity - Montagem de transcriptomas
SPAdes - Montagem de genomas
Processando Simulações - Como submeter jobs