Цифровая грамотность�(Digital Literacy)
Семинар 6
Что такое частотный словарь и зачем он нужен
Закон Ципфа
Если в любом естественном языке все слова упорядочить по убыванию частоты их использования, то частота любого слова в таком списке окажется приблизительно обратно пропорциональной его порядковому номеру (так называемому рангу этого слова).
Поэтический корпус НКРЯ
Необычные ударения в стихах.
Ударение нельзя передвигать по произволу с того слога, на котором оно естественно стоит в данном слове и в данной его грамматической форме; нельзя сказать вместо: человЕк — челОвек.
В старину ударения <...> не всегда совпадали с нынешними: у Пушкина произносится: музЫка, а мы говорим: мУзыка; встречая такие ударения, мы не должны думать, что здесь искусственная передвижка их.��Г. Шенгели, “Техника стиха”.
Акцентологическая норма и произношение
-ён/-ен и -ённый/-енный в стихах и прозе.��Мы имеем дело с поэтическо-прозаической диглоссией, когда для языка поэзии выбирается «возвышенный» (ориентированный на церковнославянский) вариант произношения с -енный, а в обыденной прозе мы в этой же точке, скорее всего, имеем дело с обыкновенным -ённый.
Необычные ударения в стихах
Необычные ударения в стихах
История русской лексики
Корни хлад- и холод-
Какие выводы можно сделать о функционировании в поэзии? А в прозе?
�(Сделайте запрос по двум корням и посмотрите распределение по годам)
AntConc
http://www.laurenceanthony.net/software.html
С помощью данной программы можно производить поиск и подсчет различных элементов текста, анализировать частотность и контекст употребления словоформ, словосочетаний и морфем, сравнивать употребительность словоформ в разных текстах.
Программа может быть использована для получения привязанных к заданной предметной области словарных минимумов, списков устойчивых сочетаний (в том числе терминологических), выборок к тематическим группам слов.
1. Открываем во второй сверху строке меню кнопку «Word List» (вторая справа) и нажимаем кнопку «Start» (внизу ближе к левому краю). Программа выстроит все словоформы текста в порядке частотности
2. Можно сортировать и по другим критериям. Если вместо «Sort by Freq» (в самом низу) выбрать «Sort by Word», произойдет сортировка по алфавиту, если выбрать «Sort by Word End», сортировка пойдет по концу слов.
3. Если к тому же поставим галочку между фразами «Sort by» и «Invert Order», то сортировка пойдет в обратном порядке — от редких слов к частым или от я до а .
4. Можно кликнуть из списка любое слово, начнется его автоматический поиск в окне Concordance.
Конкорданс – это список всех употреблений заданного языкового выражения (например, слова) в контексте со ссылками на источник.
5. Если открыто окно Concordance, искомое слово можно ввести в окошко, находящееся между кнопкой «Start» и фразой «Search Term» и нажать «Start». Будет происходить поиск данного слова в контекстах.
В НКРЯ нечто похожее было тогда, когда мы выводили в KWIC.
6. Если убрать галочку над тем же окошком между словами «Search Term» и «Words», можно будет искать не только конкретную форму слова, но и похожие формы напр. пишем пукт — выйдет пукта, пуктіс, пукты и т. п.
График конкорданса. В этом инструменте все адреса для каждого элемента поиска представлены в виде “штрих-кода”, указывающего на место в файле, где находится элемент. График позволяет увидеть, какие файлы включают искомый элемент. Он также может быть использован для определения, где сталкиваются искомый элемент и кластер.
Кластеры. Инструмент кластеры используется для создания упорядоченного списка кластеров, которые появляются вокруг поиска в целевом файле, перечисленные в левой части главного окна.
Коллокации. Коллокацией называется словосочетание, имеющее признаки синтаксически и семантически целостной единицы, в котором выбор одного из компонентов осуществляется по смыслу, а выбор второго зависит от выбора первого.
Список слов. Данный инструмент подсчитывает все слова в корпусе и представляет их в упорядоченном списке. Это позволяет быстро найти, какие слова употребляются наиболее часто в корпусе.
Список ключевых слов. В дополнение к созданию списка слов, с помощью AntConc можно сравнить слова в целевом файле со словами, которые появляются в «базисном корпусе», чтобы создать список "Ключевых слов", которые являются наиболее частыми (или редкими) в целевых файлах. �
Задание
1. Создайте txt с вашим корпусом текстов. Настройте верное отображение, если видите непонятные символы (меню Global Settings - Char Encoding). Чтобы слова с дефисами считались одним токеном, добавьте Connector и Dash в меню Global Settings - Token Definition.�2. Откройте его в AntConc, посмотрите самые частотные слова.�3. Добавьте список стоп-слов, повторите операцию.�4. Кликнув на 3 устаревших (или других интересных) слова, посмотрите их конкордансы.�5. Постройте частотный список двух-, трех- и т.д. -словных словосочетаний (вкладка Cluster/N-Grams, поставьте галочку на N-Grams, укажите, сколько слов в ngram-е вы хотите видеть, например, Min:3, Max:3, установите порог вхождений в корпусе, например, 10). Кликнув на n-грам, вы также можете попасть в его конкорданс.�6. Постройте списки коллокатов выбранного вами слова (вкладка Collocates), указав границы окна справа / слева.
Voyant Tools