INTRODUCTION
1
WHY DISTRIBUTED DATABASES
2
PARALLEL VS. DISTRIBUTED DATABASES
3
4
PARALLEL DATABASE
&
PARALLEL PROCESSING
WHY PARALLEL PROCESSING
5
1 Terabyte
At 10 MB/s
1.2 days to scan
1 Terabyte
1,000 x parallel
1.5 minute to scan.
Bandwidth
10 MB/s
time)
DIFFERENT ARCHITECTURE
6
Shared-memory
Shared-disk
Shared-nothing
1- SHARED-MEMORY ARCHITECTURE
7
2- SHARED-DISK ARCHITECTURE
8
3- SHARED-NOTHING ARCHITECTURE
9
TYPES OF PARALLELISM
10
Sequential
Sequential
Sequential
Sequential
Sequential
Order between
them
Pipeline
Partition
IDEAL SCALABILITY SCENARIO
degree of ||-ism
Xact/sec. (throughput)
Ideal
degree of ||-ism
sec./Xact (response time)
Ideal
PARTITIONING OF DATA
12
A...E
F...J
K...N O...S T...Z
A...E
F...J
K...N
O...S
T...Z
A...E
F...J
K...N
O...S
T...Z
To partition a relation R over m machines
Range partitioning Hash-based partitioning
Round-robin partitioning
13
PARALLEL ALGORITHMS FOR DBMS OPERATIONS
PARALLEL SCAN σc(R)
15
PARALLEL DUPLICATE ELIMINATION
15
PARALLEL JOIN R(X,Y) ⋈ S(Y,Z)
16
Original Relations (R then S)
B main memory buffers
Disk
Disk
INPUT
OUTPUT
1
2
hash
function h
B-1
Partitions
1
2
B-1
. . .
PARALLEL SORTING
17
COMPLEX PARALLEL QUERY PLANS
18
A
B
R
S
Sites 1-4
Sites 5-8
Sites 1-8
PERFORMANCE OF PARALLEL ALGORITHMS
19
degree of ||-ism
Xact/sec. (throughput)
Ideal
degree of ||-ism
sec./Xact (response time)
Ideal
PERFORMANCE OF PARALLEL ALGORITHMS (CONT’D)
20
Number of pages of relations R and S
OPTIMIZING PARALLEL ALGORITHMS
22
N..Z
Table Scan
A..M
Index Scan
SUMMARY OF PARALLEL DATABASES
23