Разбираемся · Создание онлайн-курсов

Каппа Коэна для онлайн-курса: как проверить согласованность двух кураторов

Два проверяющих могут по-разному применять один критерий к одинаковым работам. Посчитаем совпадения и каппу Коэна на условном примере, затем определим, какие разногласия стоит разобрать с командой.

В этом материале

Ограничьте проверку одним решением

Представим задание, где участник формулирует поручение исполнителю. Кураторы проверяют один признак: указано ли наблюдаемое условие приёмки результата. Возможны два решения — «Да» и «Нет». Например, «Сделайте хороший отчёт» не уточняет проверяемое условие, а «В отчёте есть итог по каждому из трёх подразделений» задаёт конкретный признак.

До сбора оценок запишите определение критерия и примеры границы. Оба куратора должны проверять одну версию работы по одной инструкции. Если один оценивает первый черновик, а другой — исправленный, различие ответов нельзя объяснять только несогласованностью проверяющих.

Общий порядок разработки признаков разобран в статье о критериях оценки учебной работы. Здесь добавляем отдельную задачу: измерить совпадение двух независимых решений и найти материал для уточнения правила.

Соберите независимые пары оценок

Для учебного расчёта возьмём двадцать придуманных работ. Каждую проверяют оба куратора, не видя решения коллеги. В таблице нужны код работы, решение первого, решение второго и краткое основание каждого ответа. Не начинайте обсуждать отдельные спорные работы, пока первоначальные оценки не сохранены.

Пропущенное решение не кодируйте как «Нет». Оно означает отсутствие оценки, а не отсутствие признака в работе. Перед подсчётом выделите полные пары. Если реальная проверка включает только часть работ потока, опишите способ их отбора: удобная подборка очевидных примеров может скрыть трудные случаи.

Каппа Коэна относится к согласованности двух классификаций одних объектов. Для нескольких проверяющих, числовых баллов или иной структуры данных нельзя автоматически переносить описанный здесь расчёт. В нашем примере обе стороны используют одинаковые две категории.

Постройте таблицу четырёх сочетаний

Пусть результаты распределились так: в восьми работах оба ответили «Да», в двух первый ответил «Да», а второй «Нет», в четырёх первый выбрал «Нет», а второй «Да», в шести оба выбрали «Нет». Проверьте сумму: 8 + 2 + 4 + 6 = 20.

Совпадений четырнадцать, поэтому наблюдаемая доля согласия Po = 14 / 20 = 0,70. Первому куратору признак встретился в десяти работах из двадцати, второму — в двенадцати. Сохраните эти частоты рядом с общим процентом: они описывают разные склонности к выбору категории.

Сами числа не показывают, кто прав. Для этого придётся вернуться к текстам работ и определению условия приёмки. Даже одинаковая оценка обоих может быть содержательно ошибочной, если инструкция допускает неверную трактовку.

Вычислите поправку на ожидаемые совпадения

Простая каппа рассчитывается как κ = (Po − Pe) / (1 − Pe). Pe получают из произведений соответствующих долей категорий двух проверяющих. Формула и её компоненты приведены в документации SAS по согласованности оценок.

В нашем наборе доли «Да» равны 0,50 и 0,60, доли «Нет» — 0,50 и 0,40. Поэтому Pe = 0,50 × 0,60 + 0,50 × 0,40 = 0,50. Подставляем: κ = (0,70 − 0,50) / (1 − 0,50) = 0,40.

Это не «сорок процентов правильных проверок». Коэффициент сопоставляет наблюдаемое совпадение с ожидаемым при независимых решениях и таких же долях категорий. Вместе с ним нужно показывать исходную таблицу и число работ. Маленький искусственный набор демонстрирует арифметику, а не устанавливает допустимую норму для школы.

Разберите несовпадения по основаниям

В шести спорных работах найдите формулировки, на которых разошлись решения. Допустим, один куратор считал достаточным наличие срока, а другой требовал описания самого результата. Тогда проблема может быть в смешении двух критериев: «когда передать» и «что должно получиться». Простая просьба проверять внимательнее этого расхождения не устранит.

Добавьте пару граничных примеров и уточните инструкцию. Сохраните первоначальные решения до совместного обсуждения. Если после разговора все договорились об одной оценке, это результат согласования, а не новое независимое измерение. Для повторной проверки понадобится другая сопоставимая подборка работ.

Если критерий связан со структурой объяснения, можно отдельно подготовить примеры по таксономии SOLO. Наличие примеров помогает обсуждать смысл, но числовую проверку согласованности выполняют после независимого оценивания.

Сохраните ограничения и следующее действие

Укажите версии критерия, состав работ, число полных пар и частоты категорий. Каппа зависит от этих частот, поэтому сравнение разных подборок требует осторожности. Если оба куратора всем двадцати работам присвоили только «Да», Po и Pe равны единице: знаменатель формулы нулевой, коэффициент не определён, хотя наблюдаемые решения полностью совпали.

В отчёте нашего примера достаточно записать: двадцать работ, четырнадцать совпадений, каппа 0,40, шесть разногласий переданы на содержательный разбор. Не используйте одно число как рейтинг сотрудников. Полезный результат — более точный критерий и план повторной независимой проверки, а не формальная попытка довести показатель до желаемого значения.

Источники

  1. документации SAS по согласованности оценок ↗
Создать аккаунт и собирать свою библиотеку →
От знаний — к своему курсу

Создайте свой курс в Umhub

Примените то, что узнали: соберите программу, добавьте материалы и пригласите учеников.

Создать курс