Архівування та стиснення даних. Види стиснення даних
Нова українська школа
Урок 7
Інформатика 8
teach-inf.com.ua
за підручником
Ривкінд Й.Я. та ін.
Архіви даних
У цьому розділі ви отримаєте нові, а також поглибите та розширите свої знання й удосконалите навички з таких тем:
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних. Архівування даних.�Резервне копіювання
У цьому пункті йтиметься про:
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Пригадайте
Як здійснюється кодування текстових і числових даних?
Як здійснюється кодування мультимедійних даних?
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Незважаючи на те, що ємності носіїв даних постійно збільшуються, залишається потреба в зменшенні розмірів файлів, особливо у випадках їх передавання комп’ютерними мережами, використання в мобільному зв’язку та на мобільних пристроях.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Для зменшення розмірів файлів використовують спеціальні алгоритми (методи) стиснення даних. Стиснення даних використовується під час створення файлів певних типів, наприклад:
графічних, типу
звукових, типу
відео, типу
TIFF, JPEG, PNG
MPEG3, WMA
MPEG4, WMV, MOV
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Стиснення даних – це процес кодування даних, який здійснюється з метою зменшення розмірів файлів.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Одним з перших застосувань стиснення даних для їх подальшого передавання є використання азбуки Морзе, про яку йшла мова в попередньому пункті.
Основною особливістю цієї азбуки, яка і впливала на довжину коду, що передавався електричними мережами (телеграф), було врахування частотності використання літер у певній мові. Що частіше використовувалася певна літера, то коротший був її код.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Наприклад, для найбільш уживаної в англійських текстах:
використовувався код «.» (одна крапка)
літери «e»
«–» (одне тире)
літери «t»
кодуються комбінаціями з чотирьох символів.
Найменш уживані літери
«b», «h», «j», «p», «q», «v», «x», «y», «z»
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Для тих, хто хоче знати більше
На жаль, таблиця кодування української абетки не в повній мірі реалізує систему, придуману С. Морзе. Річ у тому, що кодування в українському варіанті азбуки Морзе здійснено на основі спорідненості звуків, які позначають літери цих абеток, а не частотності літер в українській мові. Наприклад,
Тому азбука Морзе в українському варіанті не забезпечує в повній мірі стиснення даних.
позначається в азбуці Морзе ‒ ‒ ‒
найбільш уживаною в українських текстах є літера «о»
позначається в азбуці Морзе ‒
лише дев’ята за частотністю літера «е»
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Стиснення текстів з використанням азбуки Морзе можна відслідкувати на прикладі порівняння двійкового кодування з використанням цієї азбуки з кодуванням ASCII фрагмента тексту:
HELLO WORLD
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Навіть при застосуванні основної таблиці ASCII ми бачимо, що кодуванням одного і того самого тексту за системою, що запропонував С. Морзе, ми зменшимо кількість символів для передавання більше ніж удвічі. Для комп’ютерних систем, як пояснено в попередньому пункті, це не зручно.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Стиснення даних
Розрізняють алгоритми стиснення:
Алгоритми
із частковою втратою даних використовують, коли цілісність даних не є дуже суттєвою
Стиснення без втрати даних при якому можливе відновлення вихідних даних без спотворень
Графічні, відео, звукові файли
Текстові і числові
дані
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Для тих, хто хоче знати більше
Алгоритм Д. Хаффмана та алгоритм Шеннона-Фано використовують кодування зі змінною кількістю символів коду на символ повідомлення. Символи, що частіше зустрічаються в повідомленні, кодуються меншою кількістю бітів, а які рідше – більшою.
Методи стиснення даних
Так, наприклад, для кодування з використанням таблиці кодів символів Windows-1251 попереднього речення, яке містить 106 символів, включаючи пропуски, слід використати код завдовжки 1 байт на кожний символ або 106 байтів на все речення.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Для тих, хто хоче знати більше
Якщо ж порахувати, скільки разів той чи інший символ трапляється в реченні, то виявиться, що:
28
всього різних символів, які є в реченні
14 разів
частіше трапляється символ «пропуск»
11 разів
символ «і» трапляється
7 разів
символ «о» трапляється
6 разів
символ «с» трапляється
4 і т. д.
символ «в» трапляється
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Для тих, хто хоче знати більше
Найменше, по одному разу, зустрічаються символи «щ», «з», «–», «.». Позначимо символи, які частіше трапляються, кодом завдовжки 1 біт: символ «пропуск» – 0, а символ «і» – 1; наступні за частотою повторюваності – кодом завдовжки 2 біти: символ «о» – 00, символ «с» – 01 і т. д. Для символів, що трапляються рідше, буде використано код завдовжки 6 біт.
У результаті загальна довжина коду закодованого у такий спосіб речення буде складати 384 біти або приблизно 48 байтів. Як бачимо, загальний обсяг коду речення зменшився більш ніж удвічі. Під час збільшення довжини тексту стиснення буде набагато ефективніше.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Для тих, хто хоче знати більше
Звертаємо вашу увагу, що у стиснутому таким способом файлі повинна додатково міститися сама таблиця кодування та додаткові службові відомості.
Тому під час кодування дуже малих файлів може відбутися не зменшення, а, навпаки, – збільшення розмірів файлів. А для файлів з великим обсягом текстових чи числових даних цей алгоритм дає високий ступінь стиснення.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Для тих, хто хоче знати більше
Алгоритм RLE (англ. Run-length encoding – кодування повторів або довжин серій) використовується здебільшого для кодування графічних даних. Цей метод передбачає заміну послідовності однакових даних її скороченим описом.
Наприклад, у малюнку логотипа корпорації Apple використано тільки два кольори – чорний і білий. Якщо позначити чорний колір кодом «1», а білий – «0», то код першого рядка зображення повинен складатися із 48 кодів «0» (48 бітів). Але їх можна замінити описом, вказавши код символа і кількість повторів – 0 48.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Для тих, хто хоче знати більше
На код опису буде відведено 9 бітів: 1 біт на код «0» і по чотири біти на дві цифри кількості повторів.
Другий ряд пікселів буде закодовано так само, а третій – 0 29 1 4 0 15, що складає 23 біти замість 48.
Для кольорових зображень з великою кількістю одноколірних фрагментів даний алгоритм забезпечить високу ефективність стиснення.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Поміркуйте
Розгляньте малюнок, на якому зображено працівника архіву. Які операції можуть здійснювати працівники архіву? З якою метою здійснюють ці операції?
Як можна удосконалити їх роботу?
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Незважаючи на підвищення надійності комп’ютерів і комп’ютерних носіїв даних, усе ж повної гарантії збереження даних вони не дають. Втрата даних може призвести до дуже серйозних наслідків.
Видалення або пошкодження даних про вклади та перерахування коштів клієнтів призведе до краху банку.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Втрата даних про продаж квитків спричинить перебої в перевезенні пасажирів.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Знищення результатів дослідів може звести нанівець багаторічні наукові дослідження
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Навіть втрата списку контактів у мобільному телефоні принесе вам значні незручності. Тому виникає потреба у створенні копій даних.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Найважливіші дані дублюють, записуючи на:
інші носії даних
віртуальні диски в комп’ютерних мережах тощо
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Зазвичай для зручності збереження та зменшення обсягів даних файли та папки під час створення резервних копій упаковують в один файл або в одну папку.
Такі копії даних називаються архівами, а файли, у які вони упаковуються, – архівними файлами.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Створення копій даних з використанням спеціальних програм, що можуть використовувати стиснення даних, називається архівуванням.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Для створення архівів файлів і папок з використанням засобів операційної системи слід:
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
Продовження…
Стиснути до… ⇒ ZIP-файл.
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Архівування даних і резервне копіювання
У поточній папці буде створено архівний файл з розширенням імені zip і піктограмою або подібною. Архівний файл цього типу опрацьовується операційною системою як звичайна папка. Над цим об’єктом як над папкою та об’єктами, розміщеними в ній, можна виконувати стандартні операції операційної системи:
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Дайте відповіді на запитання
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Розгадайте ребус
Стиснення
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Домашнє завдання
Проаналізувати
§ 2.1, с. 30-33
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Працюємо за комп’ютером
Сторінка
40
cutt.ly/ce2cPgcd
Розділ 2
§ 2.1
© Вивчаємо інформатику teach-inf.com.ua
Успіхів�у навчанні!
Нова українська школа
Урок 7
Інформатика 8
teach-inf.com.ua
за підручником
Ривкінд Й.Я. та ін.