Услуги
Сайты и магазиныЛендинги ★Создание сайтовИнтернет-магазины
ИИ и автоматизацияИИ-секретарь ★Автоворонка и прогрев ★Telegram-боты ★Автоматизация ★CRM-разработка
ПродвижениеSEO-продвижениеAI-продвижение ★Контекстная рекламаSMM и соцсети
Наружка, печать и производствоВывески и буквыНаружная рекламаБаннеры и штендерыТипографияВизиткиШирокоформатБрендированиеОклейка автоТорговое оборудованиеМатериалы для рекламы
Дизайн и поддержкаДизайнПоддержка
КомплексDigital под ключ ★
РешенияКейсыПортфолиоЦеныО студииБлогКонтакты Обсудить проект

Пределы моделей

Разброс перекрывает разницу: почему таблицы сравнения моделей врут

Разница в цене между соседними уровнями моделей доходит до восьмикратной. Если на вашей задаче кандидаты неразличимы, вся эта разница — чистая экономия, полученная тремя лишними прогонами при выборе.

Замер: 9 августа 2026наш замер

Чем проверено: интервалы по прогонам, список неразличимых пар выписан отдельно

Короткий вывод. Модель A набрала 14 из 20, модель B — 9 из 20. Разрыв в пять пунктов выглядит решающим. Но разбросы по прогонам — 11–15 и 9–11касаются на одиннадцати. При трёх прогонах разница не доказана: нужно минимум пять. Мы выписали все случаи «неразличимы» отдельным списком, чтобы на них не строили рейтинг. На одной оси шесть моделей середины неразличимы между собой. И правило, которое из этого следует: если неразличимы — берём самую дешёвую из допущенных, а не флагман на всякий случай.

Как читать таблицу сравнения моделей

Любой лидерборд показывает одно число на модель. Оно почти всегда получено малым числом прогонов, и вопрос не в честности автора, а в устройстве измерения.

Что видно в таблицеЧто нужно спроситьНаш случай
Модель A обошла B на 5 пунктовсколько было прогонов и какой разбросинтервалы 11–15 и 9–11 касаются — при n=3 разница не доказана
Шесть моделей выстроены по местамразличимы ли соседниешесть моделей середины неразличимы; достоверных градаций на оси — три
Одна модель резко впередичто именно меряет осьна одной из осей она меряла не качество модели, а наличие живого веб-доступа: шесть моделей без него неразличимы между собой
Третья строка — самая частая подмена. Ось называется «качество ответа», а фактически разделяет участников по признаку, к качеству отношения не имеющему. Заметить это можно только по составу «проигравших»: если все они отличаются от лидера одним техническим свойством, ось меряет свойство.

Цена и качество не связаны так, как кажется

Мы сравнивали модели с восьмикратной разницей в цене, и результат оказался двусторонним — то есть дорогая выигрывала не всегда.

  • Разбор находок: дешёвая модель дала больше ложных тревог, чем дорогая, и интервалы не пересекались — здесь разница настоящая.
  • Генерация под формальные требования: та же дешёвая модель обошла пятерых участников, включая дорогих.
  • Перевод: дорогая модель фабриковала содержимое в двух прогонах из трёх — хуже дешёвых.
Важная оговорка, без которой это сравнение некорректно: у дешёвой модели было шесть прогонов, у остальных — по одному. Асимметрия числа прогонов сама по себе создаёт видимость превосходства, и называть её обязательно. Мы называем.

Отдельный замер того же рода: на разборе находок бесплатная модель дала тот же результат, что модель за полдоллара за прогон — одинаковое число ложных тревог, ноль пропусков у обеих — и была впятеро быстрее. Мы пометили у себя, что замер латентности одной из них сделан не в чистых условиях, поэтому кратность скорости считаем ориентиром, а не результатом.

Правило, по которому мы выбираем модель

  1. Определить, различимы ли кандидаты на нашей задаче. Не «какая лучше вообще», а «различаются ли они здесь» — три прогона минимум, лучше пять.
  2. Если интервалы пересекаются — считать неразличимыми. Никакого «ну всё-таки чуть выше».
  3. Из неразличимых брать самую дешёвую из допущенных. Флагман «на всякий случай» — это плата за разницу, которой не измерено.
  4. Пересматривать выбор при смене задачи, а не по календарю. Модель, выигравшая на разборе, может проигрывать на генерации — у нас так и было.
Сколько это экономит. Разница в цене между соседними уровнями моделей доходит до восьмикратной, а между бесплатным пулом и платным прогоном — до полной стоимости. Если на вашей задаче кандидаты неразличимы, вся эта разница — чистая экономия, полученная тремя лишними прогонами при выборе.

Что забрать себе

  • Один прогон на модель — не замер. Наш опыт: всё, что прогонялось однажды, при повторе поплыло.
  • Публикуя сравнение, публикуйте разброс. Без него число не проверяемо и не полезно.
  • Список «неразличимы» так же важен, как список победителей. Он останавливает построение рейтинга там, где рейтинга нет.
  • Проверьте, что меряет ось. Иногда — наличие технической возможности, а не качество.

Источники материала

  • Добор замеров: интервалы по прогонам, список неразличимых пар, вывод о числе достоверных градаций и правило выбора самой дешёвой из допущенных.
  • Замер разбора находок: сравнение бесплатной и платной модели, ложные тревоги, пропуски, латентность с пометкой о нечистых условиях.
  • Сводка по восьмикратной разнице цены: результаты на разборе, генерации и переводе; обязательная оговорка об асимметрии числа прогонов.
  • Конвейер сборки, раздел о статистической значимости при малом числе прогонов.

Седьмой модуль курса — экономика

Как выбрать модель под задачу и посчитать, во что обходится флагман «на всякий случай». Расчёт стоимости типовой операции с применёнными рычагами — один из бланков раздатки, он открыт до оплаты.

Программа курса и цены
Соседние материалы
Предыдущий замер: Чего модели не умеютСледующий замер: Убедительный ≠ достоверныйВсе материалы журнала

Обсудим ваш проект

Оставьте заявку — свяжемся в течение 15 минут в рабочее время, зададим пару вопросов и пришлём ориентир по цене и срокам. Бесплатно, без обязательств.

  1. 1. Заявка или квиз
  2. 2. Короткий созвон / переписка
  3. 3. Бесплатная смета и план
  4. 4. Договор и старт

Бесплатно и ни к чему не обязывает. Ответим за 15 минут.