Что нашла машина и что нашёл человек
Разделение прошло не по сложности задачи, а по классу дефекта. Ошибки внутри рамки машина находит хорошо и дёшево. Ошибку самой рамки — не находит вовсе.
| Класс дефекта | Кто поймал за этот день |
|---|---|
| расхождение чисел между документами | машинная проверка |
| заражение контекстом — чужой факт из соседней задачи, попавший в ответ | машинная проверка |
| методологическая подмена — ответ верен, но на другой вопрос | человек, восемь раз; машинных находок этого класса — ноль |
Почему проверяющий не видит рамку
Механика скучная и воспроизводимая у любого, кто раздаёт задачи агентам. Проверяющий получает рамку вместе с задачей: «сверь эти числа», «найди противоречия в этом документе», «проверь охват по этому списку». Внутри рамки он работает добросовестно. Сама рамка для него — условие задачи, а не предмет проверки.
Человек со стороны читает результат иначе: не «сходятся ли числа», а «на какой вопрос это вообще ответ». Отсюда и разница в уловах. Владелец ловил не арифметику — он ловил моменты, когда мы отвечали на удобный вопрос вместо заданного.
Отсюда практический вывод, а не жалоба на ИИ. Машинная проверка закрывает свой класс дёшево и её надо ставить везде. Но контур, где все проверяющие получают рамку из одной постановки, слеп к ошибке этой постановки — сколько бы проверяющих в нём ни было.
Подмена рамки в чистом виде: один прогон, названный замером
Самый дорогой случай того дня выглядел как нормальная работа. Модели сравнивались по ролям, таблица собиралась, числа записывались. Подмена сидела в одном месте: каждое число получено одним прогоном, а подано как свойство модели.
Повтор разнёс шесть таких заявлений. Вот характерные, без имён моделей — при трёх прогонах пофамильные числа означали бы ровно ту же ошибку, о которой материал:
| Заявлено по одному прогону | Что дал повтор |
|---|---|
| 17 из 20 | 11 · 14 · 15 |
| 2 фабрикации | 2 → 0 → 6; заявление отозвано |
| 25 фабрикаций | 25 → 36 → 59 |
| под правилом не соврала | соврала 3 раза из 3 |
| впереди эта модель | впереди оказалась другая, не та, что записана |
| Всё, что прогонялось один раз, при повторе поплыло. Всё, что имело повтор и контроль, устояло. | |
Цена посчитана и записана: таблицу ролей по моделям использовать нельзя — она наполовину собрана из непроверенных чисел. Продукт целого дня замеров отозван и переделан.
Почему отозвали целиком, а не поправили строки. Половина строк держалась, половина нет, и по внешнему виду они не отличались. Таблица, где часть чисел проверена повтором, а часть нет, опаснее пустой: читатель применяет к ней одну степень доверия.
Что поменяли после этого дня
- Число из одного прогона помечается как один прогон. Не «модель делает так», а «в одном прогоне получилось так». Разница в одном слове, и она удерживает от вывода.
- Разброс публикуется вместе со значением. «11 · 14 · 15» несёт больше смысла, чем любое одно из этих чисел, — и сразу показывает, стоит ли вообще сравнивать.
- Продукт, наполовину собранный из непроверенных чисел, отзывается целиком. Починка по строкам оставляет доверие ко всей таблице, которого она не заслужила.
- Рамку проверяет тот, кто не получал постановку. Вопрос ставится другой: не «сходится ли», а «на тот ли вопрос отвечаем». Ответ на него от машины внутри контура не приходит.
- Поправки считаются. Восемь за день, все от человека — метрика контура проверок, а не повод расстроиться. Пока счёт машинных находок этого класса нулевой, ручной приёмке сокращения нет.