BUSCO

Descrição

BUSCO (Benchmarking Universal Single-Copy Orthologs) é uma ferramenta para avaliar a completude de montagens genômicas, transcriptômicas e anotações baseada em genes ortólogos de cópia única esperados em determinadas linhagens.

Versões Disponíveis

  • busco/5.5.0

Submissão de Jobs

submit_busco.sh
#!/bin/bash
#SBATCH -J busco
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G

export INPUT="genome.fasta"
export OUTPUT="busco_output/"

module load busco/5.5.0

job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_output -m genome -c $SLURM_CPUS_PER_TASK

Modos de Execução

BUSCO pode ser executado em três modos diferentes:

  1. genome: para montagens genômicas

  2. proteins: para conjuntos de proteínas

  3. transcriptome: para montagens de transcriptoma

Modo Genome

submit_busco_genome.sh
#!/bin/bash
#SBATCH -J busco_genome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G

export INPUT="genome.fasta"
export OUTPUT="busco_genome/"

module load busco/5.5.0

job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_genome -m genome -c $SLURM_CPUS_PER_TASK

Modo Proteins

submit_busco_proteins.sh
#!/bin/bash
#SBATCH -J busco_proteins
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G

export INPUT="proteins.faa"
export OUTPUT="busco_proteins/"

module load busco/5.5.0

job-nanny busco -i proteins.faa -l eukaryota_odb10 -o busco_proteins -m proteins -c $SLURM_CPUS_PER_TASK

Modo Transcriptome

submit_busco_transcriptome.sh
#!/bin/bash
#SBATCH -J busco_transcriptome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G

export INPUT="transcriptome.fasta"
export OUTPUT="busco_transcriptome/"

module load busco/5.5.0

job-nanny busco -i transcriptome.fasta -l eukaryota_odb10 -o busco_transcriptome -m transcriptome -c $SLURM_CPUS_PER_TASK

Bancos de Dados Disponíveis

Lista de linhagens disponíveis:

# Ver bancos disponíveis
busco --list-datasets

Principais bancos:

  • bacteria_odb10: Bactérias

  • archaea_odb10: Archaea

  • eukaryota_odb10: Eucariotos

  • fungi_odb10: Fungos

  • metazoa_odb10: Metazoários

  • vertebrata_odb10: Vertebrados

  • mammalia_odb10: Mamíferos

  • aves_odb10: Aves

  • actinopterygii_odb10: Peixes

  • embryophyta_odb10: Plantas terrestres

Job Array para Múltiplas Amostras

submit_busco_array.sh
#!/bin/bash
#SBATCH -J busco_array
#SBATCH --array=1-10
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
#SBATCH --output=busco_%A_%a.out

SAMPLES=(
    "sample1.fasta"
    "sample2.fasta"
    "sample3.fasta"
    "sample4.fasta"
    "sample5.fasta"
    "sample6.fasta"
    "sample7.fasta"
    "sample8.fasta"
    "sample9.fasta"
    "sample10.fasta"
)

SAMPLE=${SAMPLES[$SLURM_ARRAY_TASK_ID-1]}
export INPUT="$SAMPLE"
export OUTPUT="busco_${SAMPLE%.fasta}/"

module load busco/5.5.0

job-nanny busco -i $SAMPLE -l eukaryota_odb10 -o busco_${SAMPLE%.fasta} -m genome -c $SLURM_CPUS_PER_TASK

Análise de Resultados

Após a execução, o BUSCO gera um resumo no arquivo short_summary.txt:

cat busco_output/short_summary*.txt

Exemplo de saída:

# BUSCO version is: 5.5.0
# The lineage dataset is: eukaryota_odb10 (Creation date: 2020-09-10, number of BUSCOs: 255)
# Summarized benchmarking in BUSCO notation for file 'genome.fasta'
# BUSCO was run in mode: genome

***** Results: *****

C:98.2%[S:97.6%,D:0.6%],F:0.8%,M:1.0%,n:255

251    Complete BUSCOs (C)
249    Complete and single-copy BUSCOs (S)
2      Complete and duplicated BUSCOs (D)
2      Fragmented BUSCOs (F)
2      Missing BUSCOs (M)
255    Total BUSCO groups searched

Interpretação:

  • C: Completos (S+D)

  • S: Completos e cópia única

  • D: Completos e duplicados

  • F: Fragmentados

  • M: Ausentes

Referências

Ver também