Классическая теория тестов.
Достоинства и недостатки
Статистическое обоснование качества теста
Показатели качества тестовых заданий
Статистические характеристики
Трудность задания
Трудность задания - это характеристика тестового задания, выраженная процентом от количества испытуемых репрезентативной выборки, верно выполнивших задание.
Трудность задания
Рассмотрим ее значение на элементарном примере.
Пусть из 100 учащихся выполнили первое задание 30 учащихся, а второе 60. Это означает, что второе задание менее трудное его надо поставить в начале теста.
Некоторые специалисты пользуются обратной величиной (долей тех, кто с заданием не справился), называемой «индексом трудности».
В ЕГЭ также используют процент выполнения от количества всех приступивших.
Репрезентативная выборка
Репрезентативной называется выборка, составленная в соответствии с теорией формирования представительных выборок, при условии, что была научно доказана представительность выборки ко всей совокупности.
Репрезентативная выборка
Если на первоначальном этапе учитель-предметник имеет в параллели несколько классов, то для начала разработки тематических тестов этого достаточно. Затем лучше всего такую работу проводить на базе методических центров районов, округов, городов, поскольку в этом случае в апробации можно использовать данные, полученные на большем количестве учащихся соответствующего возраста, а в выборке будут представлены учащиеся различных типов образовательных учреждений и разных социальных слоев. В любом случае при описании назначения теста необходимо указать, на какой выборке были получены данные для его апробации.
Статистическая трудность
Статистическая трудность необходима для определения места задания в тесте.
Значение трудности зависит от выборки: для сильных и слабых групп это значение будет меняться. Значения трудности, меньшие 20 и большие 80, считают критическими, и в нормативно-ориентированные тесты такие задания включать не рекомендуют для критериально-ориентированных тестов эта характеристика не существенна.
Статистическая трудность
Истинный балл ученика
Т
b4
b3
b2
b1
Наблюдаемый балл =3
Ось переменной
b1 самое легкое задание
b4 самое трудное задание
Рис.1
Объективность измерения
Объективность измерения зависит от ошибки измерения.Грамотно составленная инструкция для тестируемого поможет избежать или минимизировать случайные факторы, влияющие на ошибку измерения.
Этот способ, в отличие от факторного анализа , не требует специальной подготовки и специальной компьютерной программы. Правильная структура знаний соответствует профилю, где все нули следуют только после всех единиц. Если же картина обратная, то это говорит о случайном характере ответов и об отсутствии систематизированных знаний.
Дискриминативность(дифференцирующая способность)
Она определяется как способность отделять испытуемых с высоким общим баллом по тесту от тех, кто получил низкий балл.
Задание, на которое одинаково хорошо могут ответить экзаменуемые как с высокими, так и с низкими способностями, не обладает хорошей дифференцирующей способностью, поскольку не дает никакой информации об относительных уровнях результатов.
Дискриминативность(дифференцирующая способность)
Самый простой наглядный способ вычисления дискриминативности-это применение метода крайних групп (метод № 27), когда при расчете учитываются результаты учащихся, наиболее и наименее успешно справившихся с тестом.
Для этого определяют следующие параметры:
Дискриминативность(дифференцирующая способность)
Вычисляют дискриминативность как разность долей испытуемых из сильной (27%) и слабой (27%) групп, правильно выполнивших задание:
D=
N1 сильн
Nсильн
-
N1 слаб
N слаб
Дискриминативность(дифференцирующая способность)
Значение дискриминативности может изменяться -1 до от +1. Задание со значением, близким к + 1 означает, что большинство сильных учащихся справились с заданием, а слабым это не удалось. Нулевое же значение указывает, что доли справившихся с заданием в сильной и слабой группах равны, поэтому задание нуждается в корректировке.
Причиной тому может быть один из типичных недостатков низкодискриминативных заданий, а именно:
Мода
Мода - это наиболее часто встречающееся значение среди результатов выполнения теста.
Если одинаково часто встречаются два значения (т е. имеется две моды), то такое распределение называют бимодальным. Бимодальное распределение говорит о неудачно построенном тесте, требующем внимательного анализа других характеристик для выявления причин.
Нормальное же распределение результатов должно быть унимодальным (с одним значением моды) и симметричным.
Мода
Мода
Хороший нормативно-ориентированный тест обеспечивает нормальное распределение индивидуальных баллов репрезентативной выборки тестируемых, если среднее значение баллов (X) находится в центре распределения, а остальные концентрируются вокруг: примерно 70% в центре, а остальные сходят до минимума по краям. Смещение среднего значения влево говорит о слишком трудной подборке заданий теста, и наоборот, смещение вправо о слишком легкой подборке заданий. Среднее выборочное значение вычисляется просто, поскольку оно есть среднее арифметическое индивидуальных баллов тестируемого.
Медиана
Медиана - это значение, которое делит упорядоченное множество данных пополам, так что одна половина значений оказывается больше медианы, а другая - меньше.
Например, в группе (1,3,5,8,11,15,20) медианой будет 8. Если в группе четное число различных значений, то медиана находится посередине между двумя центральными значениями. В группе (1,3,5,8,11,15) медианой будет 6,5. В сложных случаях, когда данные группируются вблизи медианы, придется использовать линейную интерполяцию.
Меры рассеяния
Меры рассеяния – это статистические показатели, характеризующие различия между отдельными значениями выборки. Они позволяют судить о степени однородности полученного множества, его компактности, а косвенно и о надежности полученных данных и вытекающих из них результатов. Наиболее используемые в психологических исследованиях показатели: среднее отклонение, дисперсия, стандартное отклонение.
Среднее отклонение
Среднее отклонение (МД) – это среднеарифметическое разницы (по абсолютной величине) между каждым значением в выборке и ее средним.
Дисперсия
Дисперсия отражает меру неоднородности результатов по тесту и вычисляется по формуле:
Дисперсия
Низкая дисперсия говорит о слабом разделении тестируемых по уровню подготовки, а излишне высокое значение дисперсии говорит об искаженной картине распределения, а значит о наличии проблем в тесте. Для анализа чаще используют стандартное отклонение, которое равно корню квадратному из дисперсии:
Стандартное отклонение
Стандартное отклонение - из-за возведения в квадрат отдельных отклонений d при вычислении дисперсии полученная величина оказывается далекой от первоначальных отклонений и потому не дает о них наглядного представления. Чтобы этого избежать и получить характеристику, сопоставимую со средним отклонением, проделывают обратную математическую операцию – из дисперсии извлекают квадратный корень. Его положительное значение и принимается за меру изменчивости, именуемую среднеквадратическим, или стандартным, отклонением.
Коэффициент корреляции
Для определения связи между различными наборами данных используют коэффициент корреляции Пирсона. В случае необходимости определения связи между заданиями в одном тесте используют преобразованный коэффициент Пирсона, называемый коэффициентом φ :
φi j =
где p l j - доля тестируемых, верно выполнивших оба задания (т.е. получивших по 1 баллу за оба задания);
p j - доля тестируемых, правильно выполнивших j-е задание (q j =1);
p l - доля тестируемых, правильно выполнивших задние L - e задание (q l= 1- р l)
p jl - p l p j
√p j q j *p l p l
Коэффициент корреляции
Коэффициенты корреляции для итоговых тестов должны лежать в пределах [0; 0,3]. поскольку итоговый предметный тест гомогенный то корреляция должна быть невысокой и положительной. Если один набор значений распределения задается в дихотомической шкале, а другой в интервальной, то используют коэффициент бисериальной корреляции.
Коэффициент корреляции
При этом на практике используют коэффициент точечно - бисериальной корреляции поскольку он проще в расчетах и обладает существенным преимуществом: его расчетное значение не выходит за границы интервала [-1: +11], в отличие от значений коэффициента бисериальной корреляции:
(r p b i s)j =
(x̅1)j - (x̅ 0) j
S x
(N 1)j * (N 0)j
N (N - 1)
Коэффициент корреляции
(x̅1)j - среднее значение индивидуальных баллов тестируемых, верно выполнивших j-е задание теста; (x̅ 0) j - cреднее значение индивидуальных баллов тестируемых, неверно выполнивших j-е задание теста; S x - cтандартное отклонение по множеству значений индивидуальных баллов; N - общее количество тестируемых; (N 1)j количество тестируемых, верно выполнивших j-е задание теста; (N 0)j Количество тестируемых неверно выполнивших j-е задание теста.
Нормальное распределение
Нормальное распределение, также называемое распределением Гаусса, — распределение вероятностей, которое играет важнейшую роль во многих областях знаний, особенно в физике.
Нормальное распределение зависит от двух параметров —смещения и масштаба, то есть, является, с математической точки зрения, не одним распределением, а целым их семейством. Значения параметров соответствуют значениям среднего (математического ожидания) и разброса (стандартного отклонения).
Стандартным нормальным распределением называется нормальное распределение с математическим ожиданием 0 и стандартным отклонением 1.
Проверка на нормальность
Исключительно важную роль при обработке результатов наблюдений играет проверка нормальности распределения.
Эта задача представляет собой частный случай более общей проблемы, заключающейся в подборе теоретической функции распределения, в некотором смысле наилучшим образом согласующейся с опытными данными.
При большом числе результатов наблюдений (n>40) данная задача решается в следующем порядке.
Весь диапазон полученных результатов наблюдений Xmax ... Xmin разделяют на r интервалов шириной и подсчитывают частоты mi, равные числу результатов, лежащих в каждом i-м интервале, т. е. меньших или равных его правой и больших левой границы.
Проверка на нормальность
Отношения
где n - общее число наблюдений, называются частостями и представляют собой статистические оценки вероятностей попадания результата наблюдений в i-й интервал. Распределение частот по интервалам образует статистическое распределение результатов наблюдений. Если теперь разделить частость на длину интервала, то получим величины
являющиеся оценками средней плотности распределения в интервале
Проверка на нормальность
Отложим вдоль оси результатов наблюдений (рис.11) интервалы в порядке возрастания индекса i и на каждом интервале построим прямоугольник с высотой, равной Полученный график называется гистограммой статистического распределения.
Проверка на нормальность
Площадь суммы всех прямоугольников равна единице:
При увеличении числа наблюдений число интервалов можно увеличить. Сами интервалы уменьшаются, и гистограмма все больше приближается к плавной кривой, ограничивающей единичную площадь, - к графику плотности распределения результатов наблюдений.
Проверка на нормальность
При построении гистограмм рекомендуется пользоваться следующими правилами:
1. Число интервалов выбирается в зависимости от числа наблюдений согласно рекомендациям табл.1.
2. Длины интервалов удобнее выбирать одинаковыми. Однако если распределение крайне неравномерно, то в области максимальной концентрации результатов наблюдений следует выбирать более узкие интервалы.
3. Масштабы по осям гистограммы должны быть такими, чтобы отношение ее высоты к основанию составляло примерно 5:8.
n | r |
40-100 | 7-9 |
100-500 | 8-12 |
500-1000 | 10-16 |
1000-10000 | 12-22 |
Спасибо за внимание
Список используемой литературы
1.Проверка нормальности распределения результатов наблюдений [Электронный ресурс]
URL:http://www.nntu.ru/RUS/fakyl/VECH/metod/metrology/4_7.htm( Дата обращения 14.03.2016)
2.[Электронный ресурс] URL:https://clck.ru/9mmuJ( Дата обращения 14.03.2016)
3. [Электронный ресурс] URL:http://statanaliz.info/metody/opisanie-dannyx/11-dispersiya-standartnoe-otklonenie-koeffitsient-variatsii( Дата обращения 14.03.2016) 4.[Электронный ресурс] URL: https://clck.ru/9mmvJ( Дата обращения 14.03.2016) 5. [Электронный ресурс] URL: http://uss.dvfu.ru/static/kim_testing_monograph/src/glava_3_4.html ( Дата обращения 14.03.2016)
6. Учебник "Современные средства оценивания результатов обучения" [Электронный ресурс] URL:https://drive.google.com/file/d/0B6H9tDkduikrZnpaMk5CQkFkT1k/view ( Дата обращения 14.03.2016)