Почему убедительность и достоверность расходятся
Признаки, по которым человек на глаз оценивает качество текста, — структура, конкретика, числа, ссылки на источники — воспроизводятся моделью независимо от того, есть ли за ними факты. Более того, они воспроизводятся тем охотнее, чем строже требования к форме.
Отсюда неприятный вывод про формальные гейты. Требование «в ответе должны быть конкретные числа и ссылка на метод» повышает и качество, и правдоподобность выдумки. Наш случай прямой: участник с идеальным соблюдением метода фабриковал больше всех, и рост шёл от прогона к прогону.
Второй участник в том же замере держался на четырёх–шести выдуманных фактах, третий — на нуле. Разброс между участниками оказался больше, чем между «хорошо» и «плохо» по любой другой оси.
Родственный дефект: заявленное последствие принимается за факт
В другом замере мы давали моделям список находок и просили отделить настоящие дефекты от ложных срабатываний проверки. Результат ровный и плохой у всех участников.
Механизм ошибки один: модель принимает заявленное последствие за доказанный факт и не спрашивает, как именно оно наступает. В находке написано «это приведёт к потере данных» — и находка признаётся настоящей, потому что последствие звучит серьёзно. Вопрос «а каким путём приведёт» задаётся крайне редко: разбор механизма встретился дважды на двадцать один прогон, и только у одной модели.
Третий вид: модель уверенно считает по вашему тексту — и ошибается вдвое
Отдельный класс, который стоит проверить каждому, у кого есть страница с ценами. Формулировка вида «от 60 000 за выезд, минимум 3 часа» читается моделями как 20 000 за час, хотя имелось в виду вдвое больше: сумма-порог трактуется как полная стоимость трёх часов, а не как минимальный чек заказа.
Числа здесь вымышленные — важен механизм. Он воспроизводится за пять минут: дайте модели свою формулировку цены и спросите, сколько стоит час. Если ответ отличается от вашего, то же самое сейчас читают все, кто спрашивает про вас у ассистента.
Диагностика — не «поправить текст», а спросить у модели, почему именно эта цифра. Объяснение показывает, какая часть формулировки прочиталась как определяющая. Обычно это одно слово, и его достаточно переставить.
Честно про наше состояние: автоматической проверки на этот класс у нас нет. В нашем же реестре требований напротив этой строки в колонке «чем проверяется» стоит «ничем» — это одно из тех требований без исполнителя, о которых мы писали отдельно.
Что с этим делать
- Считайте выдуманные факты, а не оценивайте текст. Число фабрикаций на прогон — измеримая величина; «выглядит убедительно» — нет.
- Прогоняйте трижды. У нашего худшего участника рост шёл от прогона к прогону: по одному прогону он выглядел бы приемлемо.
- Требуйте механизм, а не последствие. Вопрос «каким путём это произойдёт» отсекает большую часть ложных находок — и его надо задавать явно.
- Проверьте, как модель считает по вашим публичным формулировкам. Особенно по ценам, срокам и условиям.