1 of 34

Классическая теория тестов.

Достоинства и недостатки

2 of 34

Статистическое обоснование качества теста

Показатели качества тестовых заданий

Статистические характеристики

3 of 34

Трудность задания

Трудность задания - это характеристика тестового задания, выраженная процентом от количества испытуемых репрезентативной выборки, верно выполнивших задание.

4 of 34

Трудность задания

Рассмотрим ее значение на элементарном примере.

Пусть из 100 учащихся выполнили первое задание 30 учащихся, а второе 60. Это означает, что второе задание менее трудное его надо поставить в начале теста.

Некоторые специалисты пользуются обратной величиной (долей тех, кто с заданием не справился), называемой «индексом трудности».

В ЕГЭ также используют процент выполнения от количества всех приступивших.

5 of 34

Репрезентативная выборка

Репрезентативной называется выборка, составленная в соответствии с теорией формирования представительных выборок, при условии, что была научно доказана представительность выборки ко всей совокупности.

6 of 34

Репрезентативная выборка

Если на первоначальном этапе учитель-предметник имеет в параллели несколько классов, то для начала разработки тематических тестов этого достаточно. Затем лучше всего такую работу проводить на базе методических центров районов, округов, городов, поскольку в этом случае в апробации можно использовать данные, полученные на большем количестве учащихся соответствующего возраста, а в выборке будут представлены учащиеся различных типов образовательных учреждений и разных социальных слоев. В любом случае при описании назначения теста необходимо указать, на какой выборке были получены данные для его апробации.

7 of 34

Статистическая трудность

Статистическая трудность необходима для определения места задания в тесте.

Значение трудности зависит от выборки: для сильных и слабых групп это значение будет меняться. Значения трудности, меньшие 20 и большие 80, считают критическими, и в нормативно-ориентированные тесты такие задания включать не рекомендуют для критериально-ориентированных тестов эта характеристика не существенна.

8 of 34

Статистическая трудность

Истинный балл ученика

Т

b4

b3

b2

b1

Наблюдаемый балл =3

Ось переменной

b1 самое легкое задание

b4 самое трудное задание

Рис.1

9 of 34

Объективность измерения

Объективность измерения зависит от ошибки измерения.Грамотно составленная инструкция для тестируемого поможет избежать или минимизировать случайные факторы, влияющие на ошибку измерения.

  • Квалифицированный отбор содержания заданий для теста,
  • Правильное их расположение,
  • Удачно подобранная форма тестового задания -эти факторы можно регулировать визуальной оценкой профилей.

Этот способ, в отличие от факторного анализа , не требует специальной подготовки и специальной компьютерной программы. Правильная структура знаний соответствует профилю, где все нули следуют только после всех единиц. Если же картина обратная, то это говорит о случайном характере ответов и об отсутствии систематизированных знаний.

10 of 34

Дискриминативность(дифференцирующая способность)

Она определяется как способность отделять испытуемых с высоким общим баллом по тесту от тех, кто получил низкий балл.

Задание, на которое одинаково хорошо могут ответить экзаменуемые как с высокими, так и с низкими способностями, не обладает хорошей дифференцирующей способностью, поскольку не дает никакой информации об относительных уровнях результатов.

11 of 34

Дискриминативность(дифференцирующая способность)

Самый простой наглядный способ вычисления дискриминативности-это применение метода крайних групп (метод № 27), когда при расчете учитываются результаты учащихся, наиболее и наименее успешно справившихся с тестом.

Для этого определяют следующие параметры:

  • N сильные -общее количество испытуемых в сильной группе;
  • N1сильные - количество учащихся в сильной группе, верно выполнивших задание;
  • N слабые - общее количество испытуемых в слабой группе;
  • N1слабые - количество учащихся в слабой группе верно выполнивших задание.

12 of 34

Дискриминативность(дифференцирующая способность)

Вычисляют дискриминативность как разность долей испытуемых из сильной (27%) и слабой (27%) групп, правильно выполнивших задание:

D=

N1 сильн

Nсильн

-

N1 слаб

N слаб

13 of 34

Дискриминативность(дифференцирующая способность)

Значение дискриминативности может изменяться -1 до от +1. Задание со значением, близким к + 1 означает, что большинство сильных учащихся справились с заданием, а слабым это не удалось. Нулевое же значение указывает, что доли справившихся с заданием в сильной и слабой группах равны, поэтому задание нуждается в корректировке.

Причиной тому может быть один из типичных недостатков низкодискриминативных заданий, а именно:

  1. излишняя сложность или запутанность формулировки;
  2. неоднозначность условия:
  3. подсказка в условии;
  4. опора при выполнении задания на память, а не на мыслительные навыки,
  5. наличие двух или более правильных ответов;
  6. наличие терминологической или логической ловушки в условии или ответах.

14 of 34

Мода

Мода - это наиболее часто встречающееся значение среди результатов выполнения теста.

Если одинаково часто встречаются два значения (т е. имеется две моды), то такое распределение называют бимодальным. Бимодальное распределение говорит о неудачно построенном тесте, требующем внимательного анализа других характеристик для выявления причин.

Нормальное же распределение результатов должно быть унимодальным (с одним значением моды) и симметричным.

15 of 34

Мода

16 of 34

Мода

Хороший нормативно-ориентированный тест обеспечивает нормальное распределение индивидуальных баллов репрезентативной выборки тестируемых, если среднее значение баллов (X) находится в центре распределения, а остальные концентрируются вокруг: примерно 70% в центре, а остальные сходят до минимума по краям. Смещение среднего значения влево говорит о слишком трудной подборке заданий теста, и наоборот, смещение вправо о слишком легкой подборке заданий. Среднее выборочное значение вычисляется просто, поскольку оно есть среднее арифметическое индивидуальных баллов тестируемого.

17 of 34

Медиана

Медиана - это значение, которое делит упорядоченное множество данных пополам, так что одна половина значений оказывается больше медианы, а другая - меньше.

Например, в группе (1,3,5,8,11,15,20) медианой будет 8. Если в группе четное число различных значений, то медиана находится посередине между двумя центральными значениями. В группе (1,3,5,8,11,15) медианой будет 6,5. В сложных случаях, когда данные группируются вблизи медианы, придется использовать линейную интерполяцию.

18 of 34

Меры рассеяния

Меры рассеяния – это статистические показатели, характеризующие различия между отдельными значениями выборки. Они позволяют судить о степени однородности полученного множества, его компактности, а косвенно и о надежности полученных данных и вытекающих из них результатов. Наиболее используемые в психологических исследованиях показатели: среднее отклонение, дисперсия, стандартное отклонение.

19 of 34

Среднее отклонение

Среднее отклонение (МД) – это среднеарифметическое разницы (по абсолютной величине) между каждым значением в выборке и ее средним.

20 of 34

Дисперсия

Дисперсия отражает меру неоднородности результатов по тесту и вычисляется по формуле:

21 of 34

Дисперсия

Низкая дисперсия говорит о слабом разделении тестируемых по уровню подготовки, а излишне высокое значение дисперсии говорит об искаженной картине распределения, а значит о наличии проблем в тесте. Для анализа чаще используют стандартное отклонение, которое равно корню квадратному из дисперсии:

22 of 34

Стандартное отклонение

Стандартное отклонение - из-за возведения в квадрат отдельных отклонений d при вычислении дисперсии полученная величина оказывается далекой от первоначальных отклонений и потому не дает о них наглядного представления. Чтобы этого избежать и получить характеристику, сопоставимую со средним отклонением, проделывают обратную математическую операцию – из дисперсии извлекают квадратный корень. Его положительное значение и принимается за меру изменчивости, именуемую среднеквадратическим, или стандартным, отклонением.

23 of 34

Коэффициент корреляции

Для определения связи между различными наборами данных используют коэффициент корреляции Пирсона. В случае необходимости определения связи между заданиями в одном тесте используют преобразованный коэффициент Пирсона, называемый коэффициентом φ 󠁈󠁈󠁋󠁌:

φi j =

где p l j - доля тестируемых, верно выполнивших оба задания (т.е. получивших по 1 баллу за оба задания);

p j - доля тестируемых, правильно выполнивших j-е задание (q j =1);

p l - доля тестируемых, правильно выполнивших задние L - e задание (q l= 1- р l)

p jl - p l p j

√p j q j *p l p l

24 of 34

Коэффициент корреляции

Коэффициенты корреляции для итоговых тестов должны лежать в пределах [0; 0,3]. поскольку итоговый предметный тест гомогенный то корреляция должна быть невысокой и положительной. Если один набор значений распределения задается в дихотомической шкале, а другой в интервальной, то используют коэффициент бисериальной корреляции.

25 of 34

Коэффициент корреляции

При этом на практике используют коэффициент точечно - бисериальной корреляции поскольку он проще в расчетах и обладает существенным преимуществом: его расчетное значение не выходит за границы интервала [-1: +11], в отличие от значений коэффициента бисериальной корреляции:

(r p b i s)j =

(x̅1)j - (x̅ 0) j

S x

(N 1)j * (N 0)j

N (N - 1)

26 of 34

Коэффициент корреляции

(x̅1)j - среднее значение индивидуальных баллов тестируемых, верно выполнивших j-е задание теста; (x̅ 0) j - cреднее значение индивидуальных баллов тестируемых, неверно выполнивших j-е задание теста; S x - cтандартное отклонение по множеству значений индивидуальных баллов; N - общее количество тестируемых; (N 1)j количество тестируемых, верно выполнивших j-е задание теста; (N 0)j Количество тестируемых неверно выполнивших j-е задание теста.

27 of 34

Нормальное распределение

Нормальное распределение, также называемое распределением Гаусса, — распределение вероятностей, которое играет важнейшую роль во многих областях знаний, особенно в физике.

Нормальное распределение зависит от двух параметров —смещения и масштаба, то есть, является, с математической точки зрения, не одним распределением, а целым их семейством. Значения параметров соответствуют значениям среднего (математического ожидания) и разброса (стандартного отклонения).

Стандартным нормальным распределением называется нормальное распределение с математическим ожиданием 0 и стандартным отклонением 1.

28 of 34

Проверка на нормальность

Исключительно важную роль при обработке результатов наблюдений играет проверка нормальности распределения.

Эта задача представляет собой частный случай более общей проблемы, заключающейся в подборе теоретической функции распределения, в некотором смысле наилучшим образом согласующейся с опытными данными.

При большом числе результатов наблюдений (n>40) данная задача решается в следующем порядке.

Весь диапазон полученных результатов наблюдений Xmax ... Xmin разделяют на r интервалов шириной и подсчитывают частоты mi, равные числу результатов, лежащих в каждом i-м интервале, т. е. меньших или равных его правой и больших левой границы.

29 of 34

Проверка на нормальность

Отношения

где n - общее число наблюдений, называются частостями и представляют собой статистические оценки вероятностей попадания результата наблюдений в i-й интервал. Распределение частот по интервалам образует статистическое распределение результатов наблюдений. Если теперь разделить частость на длину интервала, то получим величины

являющиеся оценками средней плотности распределения в интервале

30 of 34

Проверка на нормальность

Отложим вдоль оси результатов наблюдений (рис.11) интервалы в порядке возрастания индекса i и на каждом интервале построим прямоугольник с высотой, равной Полученный график называется гистограммой статистического распределения.

31 of 34

Проверка на нормальность

Площадь суммы всех прямоугольников равна единице:

При увеличении числа наблюдений число интервалов можно увеличить. Сами интервалы уменьшаются, и гистограмма все больше приближается к плавной кривой, ограничивающей единичную площадь, - к графику плотности распределения результатов наблюдений.

32 of 34

Проверка на нормальность

При построении гистограмм рекомендуется пользоваться следующими правилами:

1. Число интервалов выбирается в зависимости от числа наблюдений согласно рекомендациям табл.1.

2. Длины интервалов удобнее выбирать одинаковыми. Однако если распределение крайне неравномерно, то в области максимальной концентрации результатов наблюдений следует выбирать более узкие интервалы.

3. Масштабы по осям гистограммы должны быть такими, чтобы отношение ее высоты к основанию составляло примерно 5:8.

n

r

40-100

7-9

100-500

8-12

500-1000

10-16

1000-10000

12-22

33 of 34

Спасибо за внимание

34 of 34

Список используемой литературы

1.Проверка нормальности распределения результатов наблюдений [Электронный ресурс]

URL:http://www.nntu.ru/RUS/fakyl/VECH/metod/metrology/4_7.htm( Дата обращения 14.03.2016)

2.[Электронный ресурс] URL:https://clck.ru/9mmuJ( Дата обращения 14.03.2016)

3. [Электронный ресурс] URL:http://statanaliz.info/metody/opisanie-dannyx/11-dispersiya-standartnoe-otklonenie-koeffitsient-variatsii( Дата обращения 14.03.2016) 4.[Электронный ресурс] URL: https://clck.ru/9mmvJ( Дата обращения 14.03.2016) 5. [Электронный ресурс] URL: http://uss.dvfu.ru/static/kim_testing_monograph/src/glava_3_4.html ( Дата обращения 14.03.2016)

6. Учебник "Современные средства оценивания результатов обучения" [Электронный ресурс] URL:https://drive.google.com/file/d/0B6H9tDkduikrZnpaMk5CQkFkT1k/view ( Дата обращения 14.03.2016)