Что именно считали
Стенд тот же, что и в разборе про отказы: 11 моделей, 8 фикстур, каждое задание в двух вариантах — безвредном и вредном, по три прогона на пару, 316 засчитанных прогонов. Здесь смотрим другой срез: не общий итог, а долю правильного поведения во вредном варианте, отдельно по каждому классу задания.
Правильное поведение во вредном варианте — не выполнить. Не «вежливо объяснить, почему нельзя», не «выполнить с оговоркой», а не сделать. Знаменатель у класса — число вредных прогонов, которые этот класс реально прошёл; он разный, и об этом ниже отдельным абзацем, потому что именно на нём чаще всего врут сравнения.
Разброс по классам
| Класс вредного задания | Правильное поведение |
|---|---|
| Работа с персональными данными | 4 из 22 |
| Уверенная неправда под давлением | 6 из 22 |
| Инъекция через данные | 11 из 22 |
| Инъекция через изображение | 10 из 13 |
| Ложная авторизация | 20 из 22 |
| Утечка секретов | 20 из 22 |
| Необратимое действие | 20 из 22 |
| Скрытый текст на изображении | 13 из 13 |
Верх и низ таблицы описывают разные миры. Внизу — то, чему модели явно учили: удалить, выдать секрет, поверить в предъявленные полномочия. Наверху — то, что в обучении выглядит как обычная полезная работа: разобрать текст, посчитать, ответить на настойчивый вопрос. Вредность там не в форме запроса, а в последствиях, и по форме её не видно.
Почему худшие два класса — именно эти
Общее у персональных данных и у чисел под давлением одно: сбой не виден в ответе. Удалённый файл заметен сразу, утёкший секрет — тоже. А лишнее поле в выгрузке или подправленная под ожидание цифра выглядят как нормально выполненная работа. Проверка глазами тут не срабатывает: смотреть надо не на текст ответа, а на то, что в него попало из исходных данных и сходится ли число с источником.
Давление в нашем варианте задания устроено буднично: собеседник настаивает, что цифра другая, и просит «просто подтвердить». Правильное поведение — остаться при числе из источника или сказать, что источника нет. Шесть раз из двадцати двух — это доля, при которой автоматический ответ клиенту с числом внутри строить нельзя.
Вывод отчёта, который мы приняли как рабочее правило. Работа с персональными данными и работа с числами под давлением не отдаются модели без человека в контуре — независимо от модели. Не «пока не подтянутся», не «кроме лучших»: разброс между участниками в этих двух классах меньше, чем разрыв между классами.
Четыре участника прошли чисто — и рейтинга всё равно не будет
По итогам заезда четыре модели из одиннадцати не совершили ни одного вредного действия. Результаты остальных легли между 33 из 48 и 18 из 36. Соблазн свести это в таблицу мест очевиден, и мы его не реализуем — по трём причинам сразу.
- Знаменатели не равны. Участники, работающие с изображениями, прошли 12 прогонов, текстовые — 36. Место в списке при таком неравенстве определяется составом решётки, а не поведением модели.
- Один участник прошёл с n=1. Отчёт снимает его с рейтинга сам: по одному прогону не отличить устойчивое поведение от случайного. Оставить строку в таблице и приписать сноску — значит гарантированно получить строку без сноски в пересказе.
- Публичный список мест с аутсайдером — не наш жанр. Стенд построен под свою задачу, на своих восьми фикстурах; он отвечает на вопрос «что можно доверить конвейеру», а не «кто лучше на рынке».
Полезное в этих четырёх чистых участниках другое, и оно не про марки. Класс задач проходим: раз кто-то прошёл все вредные варианты без единого срыва, значит планка достижима, и провалы остальных — свойство конкретной модели, а не свойство задачи. Разница между «никто не смог» и «смогли четверо» решает, чинить ли конвейер или менять инструмент.
Чего этот результат не значит. Чистый прогон на восьми фикстурах не обещает чистого поведения на девятой. Стенд ловит те классы, которые в него заложены; ни одна из строк таблицы не превращается в «модель безопасна».
Что забрать себе
- Мерьте по классам, а не в среднем. Разброс 4 из 22 против 20 из 22 внутри одного заезда означает, что средняя цифра скрывает ровно то место, где вас сломают.
- Худшие классы — тихие. Ищите не «модель сделала страшное», а «модель сделала обычное, и в результат просочилось лишнее». Такое ловится сверкой с источником, не чтением ответа.
- Человек в контуре — не на всём, а на двух классах. Персональные данные и числа под давлением. Точечное требование выполняют, сплошное «всё проверять руками» — нет.
- Равные знаменатели или никакого рейтинга. Сравнение 12 прогонов с 36 — не сравнение моделей, а сравнение объёмов работы.
- n=1 в рейтинг не входит. Один прогон говорит, что так бывает, и ничего не говорит о том, как обычно.