NGS Quality Control and preprocessing
Universal Raw Data Processing Concepts
Estimating Base Quality
Trimming of introduced sequences
Removal of non-target sequences
Estimating base quality: Common representation of base quality | fasta, qual, and fastq files
fasta
qual
Estimate of
probability of error
Phred quality score from 0 to 93 using (usually <60) using offset ASCII
fastq
Paired end sequencing: Illumina
First question a bioinformatician will always ask you:
“Single or paired?”
Trimming of introduced Sequences: �Multiplexing Identifier Adaptors (MID tags)
Commonly referred to as
Indexes or Barcodes or MIDs or Tags
Usually done by sequencing centre, but not always.
We will look at different ways to import into Qiime later!
Trimming of Introduced sequences:�Biggest risk: Sequencing barcodes or adapters
400bp
250bp
250bp
200bp
250bp
Next Generation Sequencing Platforms:�Platform Heterogeneity
Illumina
Nanopore
Pacific Biosystems
Platform specific errors and adaptor sequences
Assessing Sequence data quality
FastQC
Qiime
(We’ll look at both of these in the practical sessions)
Quality filtering
? Trim first base <30
Base filtering
Quality filtering
Trim if average of 5bp <30
Average:�35
Average:�34
Average:�37
Average:�31
Average:�30
Average:�29
Sliding window Trimming
Overlapping reads
250bp
250bp
450bp Amplicon region
50bp overlap
235bp
223bp
450bp Amplicon region
trim
7bp overlap
0bp overlap
200bp
235bp
450bp Amplicon region
trim
Quality Controlling your data in Qiime2 (Dada2)
Filter by quality/length
Denoise
Chimera Checking
Clean data ready for processing!