Услуги
Сайты и магазиныЛендинги ★Создание сайтовИнтернет-магазины
ИИ и автоматизацияИИ-секретарь ★Автоворонка и прогрев ★Telegram-боты ★Автоматизация ★CRM-разработка
ПродвижениеSEO-продвижениеAI-продвижение ★Контекстная рекламаSMM и соцсети
Наружка, печать и производствоВывески и буквыНаружная рекламаБаннеры и штендерыТипографияВизиткиШирокоформатБрендированиеОклейка автоТорговое оборудованиеМатериалы для рекламы
Дизайн и поддержкаДизайнПоддержка
КомплексDigital под ключ ★
РешенияКейсыПортфолиоЦеныО студииБлогКонтакты Обсудить проект

Пределы моделей

Худшее место моделей — сверка двух чисел: 17 промахов из 21

Сверка двух чисел на одной странице — ровно та работа, которой занят человек при вычитке спецификации. Разбираем, где граница между «поручить модели» и «написать обычный код», и что реально помогает вытянуть эти промахи.

Замер: 9 августа 2026наш замер

Чем проверено: 210 вызовов на пяти классах реальных ошибок, независимое схождение пяти моделей

Короткий вывод. Самое слабое место моделей — не творчество и не логика, а сверка двух чисел между собой. На странице стоят две цифры, которые противоречат друг другу; надо это заметить. 17 промахов из 21 — худший результат из пяти проверенных классов. Именно поэтому мы пишем на такие задачи обычный детерминированный код, а не зовём модель. Второй устойчивый промах: верхнюю границу модели читают, нижнюю почти нет. Все девять оставшихся провалов по длине оказались в короткую сторону — 95, 90 и 118 знаков при требовании 130–165.

Три промаха, которые повторяются у всех

  1. Противоречие двух чисел на одной странице. Это ровно та работа, которой занят человек при вычитке спецификации: тут написано одно, а тремя абзацами ниже другое. Модель читает оба фрагмента и не сопоставляет их между собой.
  2. Нижняя граница диапазона. Ограничение «не длиннее» соблюдается, «не короче» — нет. Промах устойчивый и односторонний: ни одного случая перелёта вверх, все девять — недолёт.
  3. Выдуманное поле, которого не было в задании. Пять моделей из пяти добавили в ответ срок выполнения, хотя в задании сроков не было вовсе. Четверо назвали конкретный срок, один честно написал «зависит от объёма» — и это единственный правильный ответ из пяти.
Общее у всех трёх — они не выглядят как ошибки. Ответ связный, оформлен по правилам, формально полный. Промах виден, только если сверить его с исходным заданием построчно — то есть сделать ровно ту работу, ради которой модель и звали.

Почему на сверку чисел мы больше не зовём модель

Вывод из первого промаха практический: если задача сводится к сравнению значений по правилу, её решает обычный код. Он не устаёт, не зависит от формулировки промпта и стоит нисколько.

ЗадачаЧем решатьПочему
Сверить два числа между собойдетерминированный чекер17 промахов из 21 у моделей; правило формулируется точно
Проверить попадание в диапазондетерминированный чекернижнюю границу модели игнорируют устойчиво
Понять, что текст говорит не то, что заявленомодельздесь правило не формулируется — и здесь модель полезна

Граница проходит не по сложности задачи, а по формулируемости правила. Если правило можно записать — записывайте кодом. Модель нужна там, где правило записать нельзя.

Что помогает, а что нет

Мы проверяли способы вытянуть эти промахи и разделили их на работающие и бесполезные.

  • Работает: критерий приёмки внутри задания. Не «сделай хорошо», а «выполненной работой считается вот такая пара». Тот же эффект, что и в замере, где разрешение отказаться меняло результат в восемнадцать раз.
  • Работает: явный запрет додумывать поля. Строка «в ответе не должно быть ничего, чего нет в задании» снимает выдуманный срок — но её надо написать: сама модель такой границы не держит.
  • Не работает: просьба «будь внимательнее». Мы проверяли; изменений в пределах разброса.
  • Не работает: выбор модели подороже. Промах на сверке чисел встречается у всех проверенных — он про устройство задачи, а не про уровень модели.
Оговорка про замер длины. Он помечен у нас как частичный: изоляция условий соблюдена не полностью, то есть на результат могли повлиять соседние факторы. Направление промаха (всегда в короткую сторону) при этом устойчиво и воспроизводится тривиально — проверить может кто угодно за десять минут.

Что забрать себе

  • Сверку значений не поручайте модели. Это самое слабое её место и самое сильное место обычного кода.
  • Проверяйте нижние границы отдельно. Верхние соблюдаются сами.
  • Сравнивайте ответ с заданием построчно — выдуманное поле выглядит уместным и не вызывает подозрений.
  • Пишите критерий приёмки внутри задания, а не держите его в голове.

Источники материала

  • Отчёт числовой сверки: класс «противоречие двух чисел», счёт промахов, обоснование перехода на детерминированный чекер.
  • Конвейер сборки, раздел о границах длины: разбор девяти оставшихся провалов и формулировка про верхнюю и нижнюю границу, с пометкой о частичной изоляции условий.
  • Арена работ участников: независимое схождение пяти моделей на выдуманном поле.
  • Замер условий постановки: эффект разрешённого и запрещённого отказа на одной задаче.

Третий модуль курса — пределы моделей

Где проходит граница применимости: не по сложности задачи, а по формулируемости правила. Разбирается на ваших задачах — что из них уже сейчас надо отдать обычному коду, а что действительно требует модели.

Программа курса и цены
Соседние материалы
Предыдущий замер: Число из задания никто не проверяетСледующий замер: Разброс перекрывает разницуВсе материалы журнала

Обсудим ваш проект

Оставьте заявку — свяжемся в течение 15 минут в рабочее время, зададим пару вопросов и пришлём ориентир по цене и срокам. Бесплатно, без обязательств.

  1. 1. Заявка или квиз
  2. 2. Короткий созвон / переписка
  3. 3. Бесплатная смета и план
  4. 4. Договор и старт

Бесплатно и ни к чему не обязывает. Ответим за 15 минут.