Как читать таблицу сравнения моделей
Любой лидерборд показывает одно число на модель. Оно почти всегда получено малым числом прогонов, и вопрос не в честности автора, а в устройстве измерения.
| Что видно в таблице | Что нужно спросить | Наш случай |
|---|---|---|
| Модель A обошла B на 5 пунктов | сколько было прогонов и какой разброс | интервалы 11–15 и 9–11 касаются — при n=3 разница не доказана |
| Шесть моделей выстроены по местам | различимы ли соседние | шесть моделей середины неразличимы; достоверных градаций на оси — три |
| Одна модель резко впереди | что именно меряет ось | на одной из осей она меряла не качество модели, а наличие живого веб-доступа: шесть моделей без него неразличимы между собой |
Третья строка — самая частая подмена. Ось называется «качество ответа», а фактически разделяет участников по признаку, к качеству отношения не имеющему. Заметить это можно только по составу «проигравших»: если все они отличаются от лидера одним техническим свойством, ось меряет свойство.
Цена и качество не связаны так, как кажется
Мы сравнивали модели с восьмикратной разницей в цене, и результат оказался двусторонним — то есть дорогая выигрывала не всегда.
- Разбор находок: дешёвая модель дала больше ложных тревог, чем дорогая, и интервалы не пересекались — здесь разница настоящая.
- Генерация под формальные требования: та же дешёвая модель обошла пятерых участников, включая дорогих.
- Перевод: дорогая модель фабриковала содержимое в двух прогонах из трёх — хуже дешёвых.
Важная оговорка, без которой это сравнение некорректно: у дешёвой модели было шесть прогонов, у остальных — по одному. Асимметрия числа прогонов сама по себе создаёт видимость превосходства, и называть её обязательно. Мы называем.
Отдельный замер того же рода: на разборе находок бесплатная модель дала тот же результат, что модель за полдоллара за прогон — одинаковое число ложных тревог, ноль пропусков у обеих — и была впятеро быстрее. Мы пометили у себя, что замер латентности одной из них сделан не в чистых условиях, поэтому кратность скорости считаем ориентиром, а не результатом.
Правило, по которому мы выбираем модель
- Определить, различимы ли кандидаты на нашей задаче. Не «какая лучше вообще», а «различаются ли они здесь» — три прогона минимум, лучше пять.
- Если интервалы пересекаются — считать неразличимыми. Никакого «ну всё-таки чуть выше».
- Из неразличимых брать самую дешёвую из допущенных. Флагман «на всякий случай» — это плата за разницу, которой не измерено.
- Пересматривать выбор при смене задачи, а не по календарю. Модель, выигравшая на разборе, может проигрывать на генерации — у нас так и было.
Что забрать себе
- Один прогон на модель — не замер. Наш опыт: всё, что прогонялось однажды, при повторе поплыло.
- Публикуя сравнение, публикуйте разброс. Без него число не проверяемо и не полезно.
- Список «неразличимы» так же важен, как список победителей. Он останавливает построение рейтинга там, где рейтинга нет.
- Проверьте, что меряет ось. Иногда — наличие технической возможности, а не качество.