Условия замера и что мы обезличили
Объект — реальная живая страница стороннего проекта. Дефекты на ней зафиксированы и не чинились, поэтому ни имени объекта, ни перечня его дефектов здесь нет: публиковать чужие непочиненные дыры мы не будем. Всё, что ниже, — про приборы, а не про объект.
| Прибор | Находок | Верных | Ложных | Доля ложных |
|---|---|---|---|---|
| Дорогая визуальная модель | 11 | 2 | 6 | 55% |
| Дешёвая визуальная модель | 8 | 5 | 1 | 12,5% |
| Инструментальный проход | 13 классов | 13 | 0 | 0% |
n=1 — и мы это называем. По одному прогону нельзя сказать, что одна модель точнее другой: разброс между прогонами у визуальных задач мы отдельно не мерили. Что можно сказать по одному прогону: у обеих моделей ложные находки были, а у детерминированного прохода их не было ни одной. Ноль в последней строке — не заслуга «лучшей модели», а свойство измерения: контраст, переполнение и размер зоны нажатия считаются, а не оцениваются.
Дороже — не значит достовернее
Порядок находок у обеих моделей выглядел одинаково убедительно: формулировка дефекта, место на экране, объяснение, чем это плохо для посетителя. Разница вскрылась только при поштучной сверке каждой находки с кадром и кодом.
Практический вывод получается неудобный. Визуальная модель применяется как раз там, где сверять дорого: посмотреть на сорок экранов и сказать, где сломалось. Если больше половины находок придётся отбраковать руками, экономия исчезает — сверка стоит дороже просмотра.
Общая оценка следует за числом замеченных багов
Обеим моделям задавался ещё и общий вопрос — как страница выглядит по уровню исполнения. Ответы разошлись, и разошлись показательно: участник, поставивший высокую оценку, не заметил дефектов высокой тяжести; участник, поставивший среднюю, поставил её именно из-за них.
Оценка «дорого/дёшево» звучит как суждение о дизайне — о композиции, типографике, ритме. Фактически она оказалась функцией от одного: сколько поломок модель успела заметить. Заметила мало — похвалила.
Статус этого наблюдения — гипотеза. В нашем же отчёте раздел помечен: оценка не верифицируема, прогон один. Мы приводим наблюдение, потому что оно объясняет механизм и легко проверяется у себя, а не потому, что оно доказано. Проверка простая: дайте модели заведомо чистый макет и он же с одной внесённой поломкой — и посмотрите, сдвинется ли общая оценка вслед за поломкой.
За чем визуальную проверку всё-таки зовут
Несмотря на долю ложных находок, отказаться от прохода по картинке нельзя. Объективных дефектов на объекте зафиксировано 14, из них 4 высокой тяжести. Отдельно посчитаны 6 классов дефектов, которые вообще не видны по исходному коду: никакой линтер, читающий разметку и стили, их не найдёт.
Причина в том, где такие дефекты существуют. Их нет в исходнике: они возникают после раскладки — на конкретной ширине экрана, при конкретной длине текста, после ввода в поле, в наложении двух блоков, которые по отдельности корректны. Проверить это можно только на отрендеренном кадре.
| Что проверяем | Чем ловится | Чего этим способом не увидеть |
|---|---|---|
| Правила разметки и стилей | линтер по исходнику | всё, что возникает только после раскладки на конкретной ширине |
| Измеримые свойства кадра | инструментальный проход по рендеру | смысловые дефекты: текст не на месте, состояние противоречит содержанию |
| Осмысленность картинки | визуальная модель | ничего не гарантирует: больше половины находок может оказаться ложными |
Что забрать себе
- Считайте долю ложных находок, а не число находок. Одиннадцать против восьми выглядит как «нашла больше», а по верным находкам порядок обратный.
- Всё измеримое отдавайте инструменту. Контраст, переполнение, размер зоны нажатия считаются точно — модель на этих же вопросах ошибается и звучит уверенно.
- Не принимайте общую оценку за оценку дизайна. Проверьте на паре «чисто / одна поломка», за чем она следует у вашей модели.
- Прогон один — так и пишите. Мы пишем: n=1, сравнение моделей между собой этим замером не доказано.