Валидность психологических тестов: можно ли им доверять

Психологическому тесту можно доверять только в пределах задачи, для которой он проверен. Надёжный тест даёт достаточно устойчивый результат, валидный поддерживает нужное толкование баллов, а онлайн-опросник без норм и описанной методики остаётся развлечением, каким бы научным ни выглядел график.

Валидность психологических тестов: можно ли им доверять

Дальше вы научитесь отличать проверенную шкалу от красивой анкеты, поймёте, почему два прохождения могут дать разные баллы, и сможете оценить результат без ярлыка «тест всё про меня понял».

В статье вы узнаете:

Балл теста является сжатым описанием ответов

Психологический тест превращает наблюдаемое поведение или ответы на вопросы в число. Например, шкала самооценки предлагает оценить десять утверждений, а затем складывает баллы. Число удобно сравнивать с прошлым результатом или данными похожей группы. Оно не читает мысли и не открывает скрытую сущность человека.

Сначала исследователь выбирает конструкт, то есть свойство, которое нельзя положить на весы напрямую. Самооценка, добросовестность и эмоциональное истощение относятся к таким свойствам. Затем он придумывает вопросы, проверяет ответы на выборке людей и выясняет, насколько итог связан с предполагаемым свойством.

Поэтому один балл всегда зависит от правила подсчёта. Результат 18 из 30 может означать середину доступной шкалы, но не означает «самооценка выше, чем у 60% людей». Для такого вывода нужна норма, то есть данные сопоставимой группы и понятный способ сравнения.

Хороший тест не выдаёт истину о человеке. Он даёт достаточно обоснованную оценку конкретного свойства в конкретных условиях. Чем шире обещание, тем больше доказательств оно требует.

Надёжность показывает устойчивость измерения

Представьте весы, которые пять раз подряд добавляют ровно три килограмма. Они работают устойчиво, но показывают неверный вес. В психологии это важное разделение: повторяемость результата ещё не доказывает, что тест измеряет нужное свойство.

Внутренняя согласованность проверяет, насколько вопросы одной шкалы отвечают на общую тему. Если половина пунктов спрашивает про порядок, а половина про любовь к вечеринкам, общий балл трудно объяснить. При этом слишком похожие вопросы могут просто повторять друг друга и искусственно улучшать показатель.

Повторная надёжность показывает, насколько похож результат при новом прохождении. Здесь срок имеет значение. Рост человека почти не меняется за неделю, настроение может измениться за час, а привычки постепенно меняются месяцами. Нельзя требовать одинаковой устойчивости от шкалы черты личности и опросника состояния «как вы чувствуете себя сегодня».

Цена краткости тоже видна в данных. Короткий Mini-IPIP измеряет пять черт Big Five всего по четырём вопросам на каждую. Авторы проверили его в пяти исследованиях: согласованность шкал была приемлемой для такого объёма, а результаты повторного прохождения оставались близкими к более длинной версии. Но один ответ в коротком тесте влияет на итог сильнее, чем в анкете из пятидесяти пунктов. [Donnellan et al., 2006]

На eCalc можно пройти короткий тест Big Five и получить профиль из пяти шкал. Разница между соседними баллами не превращает человека в новый тип. Полезнее смотреть на общий рисунок и примеры поведения.

Валидность отвечает на вопрос, что разрешено заключить из балла

Валидность означает обоснованность толкования результата. Исследователи проверяют, относятся ли вопросы к нужному свойству, понимают ли их участники ожидаемым образом, совпадает ли структура ответов с моделью и связаны ли баллы с подходящими внешними признаками.

Допустим, анкета спрашивает, любит ли человек выступать, знакомиться и проводить время в компании. Она может достаточно хорошо оценивать экстраверсию. Но тот же балл не доказывает лидерство, доброту или способность продавать. Это уже другие выводы, для которых нужны отдельные данные.

Валидность относится не к красивому названию теста, а к конкретному применению. Шкала может подходить для исследования средней самооценки группы студентов, но не для отбора пилотов. Опросник выгорания может подсказать темы для наблюдения, но не установить медицинскую причину усталости.

Совместные стандарты AERA, APA и NCME рассматривают валидность, надёжность, ошибку измерения и справедливость как части одного аргумента о допустимом использовании теста. Проверяется не только формула, но и инструкция, условия прохождения, способ подсчёта и последствия решения. [Standards for Educational and Psychological Testing]

Самый подозрительный тест обещает определить профессию, отношения, травмы и «настоящий тип личности» одной короткой анкетой. Столько зайцев одним графиком обычно не ловится.

Ошибка измерения начинается с вопроса и заканчивается условиями

Результат складывается из устойчивой части и помех. Человек мог не понять формулировку, торопиться, отвечать так, как принято, или вспоминать только вчерашний конфликт. Сам тест мог содержать мало вопросов, неудачный перевод и слишком грубую шкалу.

Случайная ошибка немного двигает результат то вверх, то вниз. Систематическая ошибка толкает ответы в одну сторону. Например, вопрос «Я всегда сохраняю идеальное спокойствие» провоцирует социально желательный ответ: хочется выглядеть лучше, чем бывает в жизни.

Граница между 14 и 15 баллами редко похожа на стену. Если тест называет один результат «средним», а следующий «высоким», это удобные диапазоны для чтения, а не внезапное превращение личности. Чем короче шкала и слабее её проверка, тем осторожнее нужно относиться к такой границе.

Нормы тоже стареют и не переносятся автоматически. Ответы подростков одной страны, собранные двадцать лет назад, могут плохо описывать взрослых людей с другим языком и культурой. Если сайт показывает процентиль, он должен объяснить, с кем сравнивает пользователя.

Повторное прохождение полезно, если учитывать цель шкалы. Тест самооценки Розенберга описывает общее отношение к себе. При этом самооценка не равна уверенности в каждом отдельном навыке. Если два результата заметно различаются, сначала проверьте условия: срок между попытками, недавние события и то, одинаково ли вы понимали вопросы. Не усредняйте числа автоматически, будто измеряли длину доски.

Перед тестом достаточно проверить шесть вещей

  1. Что измеряется. Название свойства должно иметь простое определение и не подменяться десятком обещаний.
  2. Откуда взялись вопросы. Ищите автора методики, публикацию или честную пометку, что перед вами авторский самоопросник.
  3. Как считался результат. Прямые и обратные вопросы, диапазон баллов и правила интерпретации не должны быть тайной.
  4. На ком тест проверяли. Возраст, язык и контекст выборки определяют, насколько уместно переносить вывод на вас.
  5. Какая есть ошибка. Хорошее описание не обещает точность до одного процента и объясняет цену короткой шкалы.
  6. Для чего результат нельзя использовать. Ограничения часто сообщают о качестве теста больше, чем рекламный список преимуществ.

Можно начать ещё проще: откройте вопросы и посмотрите, относятся ли они к заявленной теме. Затем найдите описание метода. Если есть только кнопка «узнать правду», счётчик времени и предложение поделиться результатом, научная часть, вероятно, закончилась на слове «тест».

Результат полезнее читать как гипотезу о поведении. Высокая добросовестность подсказывает проверить, действительно ли вы планируете и заканчиваете задачи. Балл по выгоранию предлагает посмотреть на истощение, отношение к работе и восстановление. Подтверждение ищут в повторяющихся ситуациях, а не в красивом описании персонажа.

Самоопросник помогает заметить проблему, но не объясняет её причину

Диагноз требует больше данных, чем набор ответов. Специалист учитывает длительность симптомов, тяжесть, влияние на жизнь, медицинские причины, лекарства, сон, употребление веществ и другие состояния. Один и тот же ответ «мне трудно сосредоточиться» встречается при недосыпе, стрессе, депрессии, тревоге и множестве обычных жизненных ситуаций.

Чек-лист профессионального выгорания может показать частоту истощения и дистанцирования от работы. Он не решает, вызваны ли они нагрузкой, заболеванием, конфликтом, нехваткой сна или сочетанием причин. Если состояние долго мешает работать, учиться, спать или поддерживать отношения, нужен разговор со специалистом, а не десятый тест подряд.

Короткий ответ: доверять можно не слову «психологический», а доказательствам вокруг конкретного результата. Проверьте, что измеряет шкала, как она создавалась, насколько устойчивы баллы, на ком получены нормы и для какого вывода тест предназначен. После этого число становится полезным ориентиром. Без этих ответов оно остаётся аккуратно оформленным мнением алгоритма.

Есть что добавить?

Напишите своё мнение, комментарий или предложение.