Три способа, которыми проверяющий врёт
- Требует точного написания. Тот самый случай: «грep» вместо «grep». Проверяющий сравнивал строки, а строки различались невидимо для глаза.
- Знает один оборот из десяти. Другой проверяющий засчитывал только формулировку «жду подтверждения». Ответ «готов применить, если вы прямо подтвердите» он отверг — смысл тот же, слова другие.
- Судит форму, игнорируя отрицание. Проверяющий карал за упоминание опасной команды — и сработал на ответе, где команда упомянута с отрицанием: «этого делать не нужно». Формально команда есть. По смыслу — ровно наоборот.
Ещё один требовал буквального слова, хотя исполнитель доказал то же самое другой командой. Итог: два ложных провала подряд, оба — у проверяющего, ни одного — у проверяемого.
Общее у всех четырёх — проверяющий сравнивает форму, а задача у него смысловая. Пока проверок мало, это видно глазами. Когда их сотни, отчёт «модель провалила класс» выглядит результатом измерения, а не поломкой измерителя.
Правило, которое из этого выросло: сто процентов — подозрительны
Мы завели простое правило чтения результатов: единодушный провал по классу — сначала гипотеза о дефекте теста, и только потом вывод о моделях.
| Что видели | Что оказалось |
|---|---|
| 8 моделей из 8 провалили класс на 3 прогонах из 3 | дефект в постановке задания: класс переписан |
| те же модели после переделки | 20 правильных ответов из 22 |
Разница между «модели не умеют» и «мы неверно спросили» здесь — целый вывод о рынке. Если бы мы опубликовали первую версию, получилась бы уверенная неправда с цифрами.
Как чинили — и чего не делали
Соблазн после такого разбора один: пересудить уже полученные ответы новым, исправленным проверяющим. Мы этого не делали — и это принципиально.
Пересудить сохранённые ответы починенным судьёй — это подгонка. Результат вырастет, но он будет получен инструментом, которого во время прогона не существовало. Мы прогнали заново, сохранив сырьё первого захода, и получили 25 верных из 36. Число меньше того, что дала бы пересудка, и именно поэтому ему можно верить.
Второе, чего не делали: не смягчали проверяющего. После починки тот самый класс, где было 0 из 3, дал 2 из 3 — а не 3 из 3. Оставшийся провал настоящий, и он остался в отчёте.
Третье: проверяющего не правили в той же задаче, где по нему шла приёмка. Инструмент и материал разводятся по разным веткам работы — иначе непонятно, что улучшилось: продукт или измеритель. Повторный прогон обоих дал ноль изменений, то есть результат воспроизводим.
Отдельно: как мы опровергли собственное громкое утверждение
В одном из наших документов стояло: «семь из одиннадцати судей врали». Формулировка звучит убедительно и хорошо запоминается. Сплошная сверка по артефактам показала другое: на диске три подтверждённых случая и шесть проверяющих, которых на этот класс вообще не проверяли. Числа «семь» не получается ни одним способом подсчёта.
Мы оставили это в реестре как отдельный случай: непроверенное число, звучащее уверенно, живёт дольше проверенного, потому что его удобно цитировать. Единственная защита — сверка по артефакту, а не по документу, который на артефакт ссылается.
Что забрать себе
- Сначала прогоните проверку на заведомо дефектном образце. Не покраснела — она не работает, и её зелёный цвет ничего не значит.
- Единодушный результат — сигнал проверить прибор. И полный провал, и полный успех.
- Не пересуживайте сохранённые ответы починенным судьёй. Перепрогон дороже и честнее.
- Смысловую проверку нельзя делать сравнением строк. Если проверяющий ищет слово, он проверяет наличие слова — не более того.