BUSCO
In this section:
Description
BUSCO (Benchmarking Universal Single-Copy Orthologs) is a tool to assess the completeness of genomic assemblies, transcriptomes, and annotations based on expected single-copy orthologous genes in specific lineages.
Available Versions
busco/5.5.0
Job Submission
#!/bin/bash
#SBATCH -J busco
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G
export INPUT="genome.fasta"
export OUTPUT="busco_output/"
module load busco/5.5.0
job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_output -m genome -c $SLURM_CPUS_PER_TASK
Execution Modes
BUSCO can be run in three different modes:
genome: for genome assemblies
proteins: for protein sets
transcriptome: for transcriptome assemblies
Genome Mode
#!/bin/bash
#SBATCH -J busco_genome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
export INPUT="genome.fasta"
export OUTPUT="busco_genome/"
module load busco/5.5.0
job-nanny busco -i genome.fasta -l eukaryota_odb10 -o busco_genome -m genome -c $SLURM_CPUS_PER_TASK
Proteins Mode
#!/bin/bash
#SBATCH -J busco_proteins
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 12:00:00
#SBATCH --mem=16G
export INPUT="proteins.faa"
export OUTPUT="busco_proteins/"
module load busco/5.5.0
job-nanny busco -i proteins.faa -l eukaryota_odb10 -o busco_proteins -m proteins -c $SLURM_CPUS_PER_TASK
Transcriptome Mode
#!/bin/bash
#SBATCH -J busco_transcriptome
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
export INPUT="transcriptome.fasta"
export OUTPUT="busco_transcriptome/"
module load busco/5.5.0
job-nanny busco -i transcriptome.fasta -l eukaryota_odb10 -o busco_transcriptome -m transcriptome -c $SLURM_CPUS_PER_TASK
Available Databases
List of available lineages:
# Check available datasets
busco --list-datasets
Main databases:
bacteria_odb10: Bacteria
archaea_odb10: Archaea
eukaryota_odb10: Eukaryotes
fungi_odb10: Fungi
metazoa_odb10: Metazoans
vertebrata_odb10: Vertebrates
mammalia_odb10: Mammals
aves_odb10: Birds
actinopterygii_odb10: Fish
embryophyta_odb10: Land plants
Job Array for Multiple Samples
#!/bin/bash
#SBATCH -J busco_array
#SBATCH --array=1-10
#SBATCH -N 1
#SBATCH -c 8
#SBATCH -t 24:00:00
#SBATCH --mem=32G
#SBATCH --output=busco_%A_%a.out
SAMPLES=(
"sample1.fasta"
"sample2.fasta"
"sample3.fasta"
"sample4.fasta"
"sample5.fasta"
"sample6.fasta"
"sample7.fasta"
"sample8.fasta"
"sample9.fasta"
"sample10.fasta"
)
SAMPLE=${SAMPLES[$SLURM_ARRAY_TASK_ID-1]}
export INPUT="$SAMPLE"
export OUTPUT="busco_${SAMPLE%.fasta}/"
module load busco/5.5.0
job-nanny busco -i $SAMPLE -l eukaryota_odb10 -o busco_${SAMPLE%.fasta} -m genome -c $SLURM_CPUS_PER_TASK
Results Analysis
After execution, BUSCO generates a summary in the short_summary.txt file:
cat busco_output/short_summary*.txt
Example output:
# BUSCO version is: 5.5.0
# The lineage dataset is: eukaryota_odb10 (Creation date: 2020-09-10, number of BUSCOs: 255)
# Summarized benchmarking in BUSCO notation for file 'genome.fasta'
# BUSCO was run in mode: genome
***** Results: *****
C:98.2%[S:97.6%,D:0.6%],F:0.8%,M:1.0%,n:255
251 Complete BUSCOs (C)
249 Complete and single-copy BUSCOs (S)
2 Complete and duplicated BUSCOs (D)
2 Fragmented BUSCOs (F)
2 Missing BUSCOs (M)
255 Total BUSCO groups searched
Interpretation:
C: Complete (S+D)
S: Complete and single-copy
D: Complete and duplicated
F: Fragmented
M: Missing
References
Documentation: https://busco.ezlab.org/
GitHub: https://gitlab.com/ezlab/busco
Databases: https://busco-data.ezlab.org/
See also
Trinity - Transcriptome assembly
SPAdes - Genome assembly
Running Simulations - How to submit jobs