BUSCO

Description

BUSCO (Benchmarking Universal Single-Copy Orthologs) is a tool to assess the completeness of genomic assemblies, transcriptomes, and annotations based on expected single-copy orthologous genes in specific lineages.

Available Versions

  • busco/5.5.0

Job Submission

submit_busco.sh
#!/bin/bash
#SBATCH -J busco
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G

export INPUT="genome.fasta"
export OUTPUT="busco_output/"

module load busco/5.5.0

job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_output -m genome -c $SLURM_CPUS_PER_TASK

Execution Modes

BUSCO can be run in three different modes:

  1. genome: for genome assemblies

  2. proteins: for protein sets

  3. transcriptome: for transcriptome assemblies

Genome Mode

submit_busco_genome.sh
#!/bin/bash
#SBATCH -J busco_genome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G

export INPUT="genome.fasta"
export OUTPUT="busco_genome/"

module load busco/5.5.0

job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_genome -m genome -c $SLURM_CPUS_PER_TASK

Proteins Mode

submit_busco_proteins.sh
#!/bin/bash
#SBATCH -J busco_proteins
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G

export INPUT="proteins.faa"
export OUTPUT="busco_proteins/"

module load busco/5.5.0

job-nanny busco -i proteins.faa -l eukaryota_odb10 -o busco_proteins -m proteins -c $SLURM_CPUS_PER_TASK

Transcriptome Mode

submit_busco_transcriptome.sh
#!/bin/bash
#SBATCH -J busco_transcriptome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G

export INPUT="transcriptome.fasta"
export OUTPUT="busco_transcriptome/"

module load busco/5.5.0

job-nanny busco -i transcriptome.fasta -l eukaryota_odb10 -o busco_transcriptome -m transcriptome -c $SLURM_CPUS_PER_TASK

Available Databases

List of available lineages:

# Check available datasets
busco --list-datasets

Main databases:

  • bacteria_odb10: Bacteria

  • archaea_odb10: Archaea

  • eukaryota_odb10: Eukaryotes

  • fungi_odb10: Fungi

  • metazoa_odb10: Metazoans

  • vertebrata_odb10: Vertebrates

  • mammalia_odb10: Mammals

  • aves_odb10: Birds

  • actinopterygii_odb10: Fish

  • embryophyta_odb10: Land plants

Job Array for Multiple Samples

submit_busco_array.sh
#!/bin/bash
#SBATCH -J busco_array
#SBATCH --array=1-10
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
#SBATCH --output=busco_%A_%a.out

SAMPLES=(
    "sample1.fasta"
    "sample2.fasta"
    "sample3.fasta"
    "sample4.fasta"
    "sample5.fasta"
    "sample6.fasta"
    "sample7.fasta"
    "sample8.fasta"
    "sample9.fasta"
    "sample10.fasta"
)

SAMPLE=${SAMPLES[$SLURM_ARRAY_TASK_ID-1]}
export INPUT="$SAMPLE"
export OUTPUT="busco_${SAMPLE%.fasta}/"

module load busco/5.5.0

job-nanny busco -i $SAMPLE -l eukaryota_odb10 -o busco_${SAMPLE%.fasta} -m genome -c $SLURM_CPUS_PER_TASK

Results Analysis

After execution, BUSCO generates a summary in the short_summary.txt file:

cat busco_output/short_summary*.txt

Example output:

# BUSCO version is: 5.5.0
# The lineage dataset is: eukaryota_odb10 (Creation date: 2020-09-10, number of BUSCOs: 255)
# Summarized benchmarking in BUSCO notation for file 'genome.fasta'
# BUSCO was run in mode: genome

***** Results: *****

C:98.2%[S:97.6%,D:0.6%],F:0.8%,M:1.0%,n:255

251    Complete BUSCOs (C)
249    Complete and single-copy BUSCOs (S)
2      Complete and duplicated BUSCOs (D)
2      Fragmented BUSCOs (F)
2      Missing BUSCOs (M)
255    Total BUSCO groups searched

Interpretation:

  • C: Complete (S+D)

  • S: Complete and single-copy

  • D: Complete and duplicated

  • F: Fragmented

  • M: Missing

References

See also