Главная / Практика

ИИ-практика: журнал замеров

Мы внедряем ИИ у себя — в перевозках, переписке с клиентами, документах и учёте — и записываем, что вышло. Здесь замеры, а не пересказы: каждое число со своим источником, провалы наравне с удачами.

76 материала · каждый — с паспортом «чем проверено» и списком источников · ни одной цифры без замера или первоисточника.

Это рабочий журнал направления, а не витрина: разбор, который не даёт вывода «что делать», сюда не попадает.

Что это за раздел

Рабочий журнал направления ИИ-решений, а не витрина.

Мы транспортная компания, которая внедряет ИИ в первую очередь у себя: распознавание голосовых заявок, разбор переписки с клиентами, сведение документов и денег, проверка собственных страниц. Всё, что попадает в этот журнал, сначала прошло через наш собственный контур и оставило после себя цифру — иногда неудобную.

Раздел собран из тестов, которые мы ставили моделям, и из ошибок, за которые уже заплатили временем и переделками. Он существует не ради контента: разбор, который не заканчивается строкой «что с этим делать», сюда не попадает.

Стандарт журнала: шесть правил против воды

Правила выведены не из головы, а из разбора того, как о внедрении ИИ пишут другие. Каждое закрывает конкретный способ сказать много и не сказать ничего.

  1. У каждого числа есть происхождение. В наших материалах цифра помечена одним из четырёх статусов: замер (сделан нами, воспроизводим), первоисточник (прайс или документация вендора, прочитанные напрямую), оценка (наша модель с явно названным допущением) и «данных нет». Цифра без статуса — это мнение, набранное цифрами.
  2. Провалы публикуются наравне с удачами. Замер, который показал, что приём не работает, стоит столько же, сколько удачный. Ниже есть материал про факт, который мы приняли на веру, подняли до приоритетной задачи — и потом отозвали. Он остался в журнале вместе с разбором, как именно мы промахнулись.
  3. Источник взвешивается до того, как из него делается вывод. Официальный пост вендора, исследование и рассказ практика в ролике с рекламой курса — три разных веса одного утверждения. Мы помечаем класс источника и не смешиваем «проверено» с «человек так сказал».
  4. Каждый материал заканчивается действием. Не «стоит присмотреться» и не «изучить подробнее» — это не выводы. Либо названо, что мы меняем у себя и где именно, либо честно написано «задачи нет».
  5. Честное «нет» — самый частый ответ. В последнем разборе очереди из восьми материалов пять оказались неприменимыми, и в журнале это написано прямо. Подрядчик, у которого ИИ подходит везде, продаёт не результат.
  6. Никаких обещаний по выручке. Мы не пишем «+40% к продажам»: связь между навыком сотрудника и выручкой компании не измеряется честно ни у нас, ни у кого-либо ещё. Обещаем проверяемое: навык, срок, метрику приёмки.

Что мы увидели, разбирая рынок

Мониторинг ведём постоянно: очередь материалов с YouTube-каналов и Telegram-каналов по внедрению ИИ собирается автоматически, дорогой разбор запускается вручную. Это то, что видно из очереди.

Что разобралиЧто нашлиЧто из этого следует
13 подрядчиков по внедрению ИИ Проверяемой метрики приёмки нет ни у одного «Внедрили ИИ» невозможно оспорить, потому что нечего проверять. Мы формулируем приёмку так, чтобы клиент мог её провалить
12 кейсов обучающей программы по ИИ Цифры самозаявленные («заявленный рост +40%»), метрик приёмки нет ни в одном; ни одного кейса в логистике Кейс без метода замера — рекламный текст. Мы показываем срез, скрипт и дату
1118 постов массового конструктора ботов За семь месяцев путь от «подключите ChatGPT» до агента, который сам создаёт сделки в CRM и учится по ссылке на прайс Три типовые услуги стали коробочной функцией. Продавать их как проект больше нельзя — разбор в журнале
Ролики про агентные системы, ~24 000 слов Ни одного числа с методикой замера; в одном случае автор занизил собственную стоимость в полтора раза Приёмы оттуда берём, выводы — нет. Каждый приём проходит наш замер прежде, чем попасть в работу
Канал с агентной тематикой на русском Содержательных постов нет — лента рекламного спама Источник оценивается по прогону, а не по названию. Выключен с указанием причины
Вывод, который мы приняли как рабочий. Рынок обучения и внедрения ИИ переполнен пересказами и беден замерами. Отстройка здесь не в том, чтобы говорить «мы лучше», а в том, чтобы к каждому утверждению прикладывать способ его проверить. Ровно по этому принципу собран журнал — и ровно так же устроен наш курс.

Рубрика «Как мы строили» — заведена по чужой критике

Разбор системы, собранной с ИИ, от практика с 25-летним опытом внедрений. Возражения выписаны дословно, ответы стоят рядом.

Критика была предметной и по делу, поэтому мы не спорили, а завели под каждый пункт материал. Ни один ответ не начинается со слова «на самом деле»: там, где упрёк верен, он подтверждается нашим же замером.

Про уровень подробности. Разговор об архитектуре без единой схемы и без строчки кода — это снова текст о тексте, поэтому в материалах рубрики есть и то и другое: схема контура, граница доверия вокруг ключа подписи, таймлайн разбора по дням, фрагменты записи в хранилище и кусок спроектированной схемы данных. Всё обезличено — боевые адреса, порты и имена таблиц заменены. Показана механика, а карта репозитория к делу не относится.

ВозражениеНаш ответ
«Зная не понаслышке, как ИИ пишет код, — единой модели данных там как раз и нет» Верно. Наше хранилище — файлы без схемы и блокировок, и мы нашли это у себя раньше, чем услышали снаружи → разбор своего хранилища
«ERP — это сильно сложнее, чем набор инструментов» Согласны и не называем свой контур ERP. Граница проведена в том же разборе
«Это эволюция Excel, а раньше ещё и Access» Точное описание. Разница одна: у той автоматизации не было способа узнать, что она врёт, кроме жалобы пользователя
«Ни слова про архитектуру. Какой стек использовался?» Состав целиком, с причиной каждого выбора и списком мест, где сборка упирается → архитектура и стек
«Тот же самый API с внешней системой — надо понимать, что она отдаёт» Именно так. Пять правил, которых нет в документации, и почему без живого ответа нельзя называть срок → разбор интеграции
«Ни разу не видел хорошо написанного требования и особенно кода. Всё приходится допиливать» Верно, и мы это измерили: 210 вызовов на своих реальных классах ошибок → сколько допиливать — в цифрах
«А что входит в 3 недели? Явно надо было проводить аналитику и вникать в проблему» Поденно, включая день сверки слов с выгрузками → что входит в две недели
«Будет много обожжённых… выйдем на какое-то плато» Разделяем прогноз. Обожгутся те, кто решил, что исчезла инженерная работа: она не исчезла, а переехала с написания на постановку и приёмку
Почему мы публикуем чужую критику у себя. Возражения опытного человека — это бесплатный и очень точный список того, что мы обязаны уметь объяснить. Отвечать на него в комментариях бессмысленно: ответ живёт один день. Отвечать материалом с числами — единственный способ, при котором ответ можно проверить.

Материалы

По каждому — паспорт «чем проверено» и список источников в конце.

Замеры и метод

Метод проверки

20 из 20 своих тестов — и 8 реальных багов

Модель проверяет свою работу и ставит «готово». Мы замерили, сколько это стоит, и заменили самоприёмку на состязательный проход.

20/20 зелёных · 8 багов · P0 жил 2 дня

Замер модели

Казахский на слух у ИИ: 73,8% → 49,0% ошибок

«Модель понимает казахский» — непроверяемое утверждение. Мы измерили на открытом корпусе, дообучили и измерили снова тем же срезом.

WER 73,8% → 49,0% · русский не просел

Экономика

Сколько на самом деле стоит ИИ

«Токены дешёвые» и «своё железо выгоднее» — оба утверждения проверяются одним расчётом. Показываем формулу и вводные, чтобы вы посчитали свой случай.

−50% пакетом · 0,1× кэшем · +50% с 1 сентября

Данные и безопасность

Что уходит в модель, а что остаётся у вас

Первый вопрос внедрения — не «какую модель взять», а что именно уйдёт наружу. Три уровня контроля, и честно про тот, которого у нас нет.

6 телефонов, 3 ИНН, 2 ОГРН — на одном прогоне

Анализ рынка

Узкий анализ конкурентов врёт: 2 ложных окна из 2

Пустая клетка на своём рынке значит «здесь этого нет». Пустая на трёх контурах — «этого нет нигде». Разные выводы, и одна из формулировок стоит денег.

4 → 20 сайтов · 68 → 340 клеток · 2 окна оказались ложными

Работа с источниками

Класс источника: как читать чужие кейсы

Ролик с продажей курса, исследование и официальный пост вендора — три разных веса одного утверждения. Плюс наш собственный отозванный факт.

8 материалов → 2 дельты · 5 отказов

Приёмка работы

Метрика приёмки: пункт, которого нет у конкурентов

«Внедрили ИИ» — не результат. Показываем, как выглядит приёмка, которую клиент может проверить сам и оспорить, и почему её ни у кого нет.

0 из 13 подрядчиков · 0 из 12 кейсов

Рынок

Коробка съела три услуги из первой пятёрки

Бот с базой знаний за 10 минут без кода — теперь функция тарифа, а не проект. Разбираем хронологию и то, что коробка не берёт по своей природе.

72 поста за год · 3 позиции закрыты коробкой

Накопленный опыт

70 классов ошибок: как перестать наступать дважды

Разбор инцидента, который остался в переписке, не стоит ничего. Показываем формат записи, который работает, и четыре самых дорогих класса.

~300 инцидентов → 70 классов

Организация работы

Копия устарела за 20 минут

Проверка, запущенная в отставшем дереве, относится к другому коду — но выглядит как проверка вашего. Отчёт при этом читается нормально.

242 ложных находки · отставание 1541 коммит при чистом статусе

Метод проверки

Инструмент честнее меня

Инструмент записал «2/2 ниш · каналов 6/12». В отчёт ушло «2 зелёных». Знаменатель теряется при пересказе — и цифра начинает жить своей жизнью.

8% покрытия вместо «2 зелёных» · 5 ложных отрицаний за сутки

Наш прибор

Наш аудит врал об охвате

Продукт, который мы продаём, ошибался. Нашли сплошным разбором своего кода, починили и измерили результат на чужих сайтах — с названной границей метода.

15,2% → 0,6% · 33 из 33 клиентских утверждений верны

Прибор врёт

Судья сам провалил свой тест

Проверяющий искал подмену букв и сам её пропустил. Разбираем четыре способа, которыми проверяющий врёт, и почему единодушный результат — повод проверить прибор.

0 из 3 у судьи · 8 из 8 «провалов» → 20 из 22 после переделки

Прибор врёт

97% предупреждений — ложные

Три степени бесполезности прибора: кричит почти на всё, кричит на своём, молчит по построению. Последнее опаснее всего — отчёт зелёный, проблема на месте.

2446 из 2510 ложных · 64 настоящих в шуме · 99,8% срабатываний у другой проверки

Что сработало

Что у нас реально сработало

Всё, что прогонялось один раз, при повторе поплыло. Всё, что имело контроль, устояло. Разбираем приём, его цену и четыре вещи, которые он поймал.

2 числа из всех устояли · потолок 50/52 · 0 из 9 тестов ловили дефект

Сведение инструментов

Три инструмента, три ответа

Сведение — это не «сделать одинаково», а превратить случайные расхождения в названные. Плюс класс «код, который выглядит работающим»: отсечка, не отсекавшая ничего.

6 / 7 / 3 цены на одной странице · расхождение извлечения ×3,3

Сведение инструментов

Норма в четырёх версиях

Вердикт зависит от того, кто спросил: каждая проверка держит свою редакцию нормы. Плюс зеркальная дыра — правило, которое живёт только в коде и которое нельзя оспорить.

48 / 44 / 32 / 24 для одной кнопки · 23 противоречия в 20 документах

Метод проверки

Число из задания никто не проверяет

Ошибку в отчёте ищут — отчёт для того и читают. Число из постановки приходит как данность вместе с задачей и уходит в результат уже подтверждённым.

11 звеньев → 0 совпадений · «747 строк» → файла нет · 4 инструмента → 6

Пределы моделей

Чего модели не умеют

Три промаха, повторяющиеся у всех. Ни один не выглядит ошибкой: ответ связный, оформлен по правилам, формально полный.

17 из 21 промах на сверке чисел · 9 из 9 провалов в короткую сторону · 5 из 5 выдумали поле

Пределы моделей

Разброс перекрывает разницу

Как читать лидерборд моделей и как проверить, что ось меряет качество, а не наличие технической возможности у половины участников.

5 пунктов разрыва при пересекающихся интервалах · 6 моделей неразличимы · 3 достоверных градации

Пределы моделей

Убедительный ≠ достоверный

Структура, конкретика, числа и ссылки на метод воспроизводятся независимо от того, есть ли за ними факты — и тем охотнее, чем строже требования к форме.

25 → 36 → 59 фабрикаций при 100% по методу · разбор механизма 2 раза на 21 прогон

Наш прибор

Слепота парсера как «свободная ниша»

Ни один шаг не был ошибкой сам по себе. Ошибка возникла на стыке: «не нашёл» и «нет» стали одним значением, и различить их в таблице уже нельзя.

1 из 6 загрузчиков читал кодировку · охват «9 страниц» при одной прочитанной

Организация работы

Отменили — и сами же сделали

Отменённое решение опаснее непринятого: непринятое видно как пробел, отменённое выглядит как действующая практика — оно уже в коде и не вызывает вопросов.

8 дней между запретом и включением · 44 страницы дублей мимо всех гейтов

Сведение инструментов

Не бросайся править по ключу

Семьсот страниц с одинаковым дефектом почти никогда не означают семьсот ошибок. И часть расхождений чинить нельзя: правильного значения никто не называл.

1622 находки на 1150 страницах · 5 ключей смешивали услуги · причина в одной строке

Прибор врёт

Гард забраковал 19 из 24

Прибор, который никогда не краснеет, и прибор, забраковавший три четверти работы, — одинаково важные новости. У нас в один день нашлись оба.

19 из 24 замеров недействительны · правило с 0 срабатываний при 12 зелёных строках

Наш прибор

Гейт судил по разметке

Из пяти правил четыре опираются на видимый текст, и ни одно не проверяло фактическую видимость. Очевидная починка оказалась хуже дефекта.

52 красных вместо 30 у наивного критерия · +120 ложных на базе · 0 ложных тревог у принятого

Пределы моделей

Отказ от безопасного тоже сбой

Модель, отказавшаяся обработать всю пачку из-за одной вредной вставки в ней, ошиблась так же, как модель, выполнившая вредное. Второе считают все, первое — почти никто.

232 PASS из 316 · 46 пропусков против 28 ложных отказов

Организация работы

Сократили контекст вдвое

Стартовый контекст — то, что агент читает до первого вашего слова. Мы его замерили, сократили вдвое и записали честный минус: одно наше изменение добавило 322 токена.

24 386 → 12 263 токена · оптимизация без замера дала рост 4 431 → 4 918 байт

Метод проверки

Восемь поправок от человека

Машинные проверки нашли числа и заражение контекстом, но не поймали ни одной методологической подмены. Граница проходит там, где меняется рамка, а не значение.

8 поправок за день · 0 из них найдено машиной

Организация работы

«176 мс» оказались 176 секундами

Два самых дорогих сбоя заезда случились с настоящими числами, у которых потерялись единица измерения и владелец. Ложь заметна и вызывает спор, правдоподобное число вопросов не вызывает.

176 мс против 176 325 · медиана 1770–1796 мс · 14 сообщений · 76% против 57,4% · 5 документов · 9 сообщений

Что сработало

Размен 1:22 в нашу пользу

Один и тот же текст стоит по-разному по разные стороны границы «всегда против по вызову». Показываем, как мы осознанно увеличили одну строку стартового контекста и что это дало.

769 → 904 · 2 995 вынесено · размен 1:22 · ≈20×

Метод проверки

Изоляцию проверили 12 запусками

Отключаем агенту инструменты — и любой факт в ответе может приехать только из стартового контекста. Показываем схему из 12 проб, включая две контрольные на исправность самого метода.

12 запусков · 2 контрольных · 2 проекта из 25

Метод проверки

Ответ уже лежал в контексте

Замер способностей модели чего-то стоит, пока верного ответа не было в её контексте. Проверили условие тремя приёмами и на всех трёх нашли у себя утечку.

0 утечек из 4 · 2/2 при нуле вызовов · 7 совпадений из 20 · файл памяти 12:08 против прогона 11:15

Прибор врёт

Правило замера против нас

Три случая одного заезда, где наши собственные правила ударили по нашим же результатам. Один занизил, два касались лучших чисел — и все три пришлось признать.

допуск 10% против 15% · 3/3 против 0/3 · 19 пар из 20 · 1370 тактов · 107,835× · n=1

Наш прибор

22 своих числа: подтвердилось 9

Взяли числа из собственных отчётов и стали искать каждое на диске. Ломаются они не выдумкой, а тремя скучными способами — теряется шкала, знаменатель или состав суммы.

22 числа · 9 подтверждено · 6 частично · 7 не найдено · 7 противоречий · 10,0/9,0/7,5 против 96/72/55

Метод проверки

Проверки, которые никто не зовёт

Инвентаризация «кто кого вызывает» нашла шесть проверок качества, не вызываемых ниоткуда. Ещё один контроль не выполняется нигде, потому что из модуля берут только вспомогательную функцию.

6 невызываемых проверок · 8 красных прогонов подряд · шаг в ~30 документах

Организация работы

255 файлов работы не было в git

Правило игнорирования, написанное под давно решённую задачу, годами прятало рабочие скрипты от команды. Разбираем, как считали реальную потерю и чем «нет по пути» отличается от «нет нигде».

255 вне git · 2575 против 255 · 6 раз за сутки

Пределы моделей

Разницу даёт поиск, а не модель

Пять моделей искали реальных игроков рынка по эталону из 52 компаний, три прогона на участника. Оторвался только участник с живым поиском: 15,4% полноты против 7,7% и ниже у остальных.

15,4% против 7,7 · 3,8 · 0% · эталон 52 компании · 19–20 цитат

Сведение инструментов

Треть требований без исполнителя

Сплошная сверка регламента против кода: 84 требования из 120 имеют проверку, которую реально запускают, 36 не проверяются ничем. Плюс три инструмента, названных в документе и отсутствующих в коде.

120 требований · 84 с гардом · 36 без · 3 фантома · разброс 5–10 раз

Прибор врёт

55% ложных находок у дорогой модели

Две модели смотрели на одни и те же кадры: 11 находок при 6 ложных против 8 находок при 1 ложной. Инструментальный проход по тем же кадрам дал 13 классов, и все они подтвердились.

55% против 12,5% ложных · 13 классов из 13 верны · n=1

Прибор врёт

Зелёный, который ничего не значит

Проверка с накопителем врёт трижды: первая страница пары зелёная всегда, а прогон по подмножеству зелёный целиком. Разбираем это и ещё два способа получить чистый отчёт по больной системе.

5 гейтов из ~17 · 6 правил · 8 сцен

Наш прибор

Детектор врал в обе стороны

Ужесточение фильтра лечит шум и порождает слепоту — обе стороны ошибки надо мерить одновременно, на двух разных корпусах. Момент замера при этом сам оказался частью замера: до отработки скриптов страница другая.

4 класса ложных · 2 пропуска · 16 наложений → 0 · 2 улицы из 3 находок · контроль 6 файлов

Организация работы

Перемерять, а не пересуживать

Правка критерия при уже известном результате — подгонка, даже когда правка объективно верная. Перепрогон дороже переразметки, зато его можно защитить и через месяц.

25 из 36 после перепрогона · контроль 6/6 и 12/12 · файл 7 из 52 против отчёта

Прибор врёт

Половина красного — знак вопроса

Прибор врёт числом в три стороны сразу: раздувает счёт тиражом шаблона, краснеет на пунктуации и молчит там, где выдумка есть. Разбор по причинам стоит часов, но без него число из отчёта нельзя нести в вывод.

101 вопрос: 58 совпало · 22 — знак вопроса · 6489 находок = 1 шаблон × 358 страниц

Метод проверки

Правку принимаем по замеру

Три правки одной работы дали три разных исхода: обвал красного, откат по замеру и ноль изменений. Все три решения приняты сравнением до и после на честно собранном знаменателе, а не обсуждением того, что выглядит полезнее.

821 → 164 красных · знаменатель 2388 → 2196 · 730 файлов · Δ = 0

Метод проверки

Два источника — один проект

Сверка двух источников опирается на молчаливую предпосылку их независимости, и предпосылку почти никогда не проверяют. После проверки происхождения усиление исчезло: остался один голос, продублированный вторым каналом того же проекта.

1590 и 1048 против 878 и 329 · серых советов 9 и 5

Метод проверки

Ноль опровержений на 262 поста

Качество чужого совета снаружи не измерить, а счёт опровержений себя — можно, и он воспроизводим по публичному экспорту. За поздний период у источника таких постов не нашлось ни одного, при этом рекомендация основного инструмента сменилась четыре раза без единой пометки «раньше я советовал другое».

12 опровержений за 3 года · 0 на 262 поста · продающих 8–15% и 42%

Организация работы

Правда оказалась четвёртой

Корректирующий документ воспроизвёл ровно тот класс ошибок, который исправлял: взял состояние из чужого пересказа вместо репозитория. В том же файле стояли отметка «гард реализован и проверен» и строка «коммит не требуется» — гарда в истории репозитория не нашлось.

3 версии факта · верна 4-я · сдано 2 из 5 · 288 файлов .py в основной ветке

Пределы моделей

Риск не размазан ровно

Страшные на слух классы — удалить, выдать секрет, поверить в полномочия — модели держат лучше всего. Ломаются они там, где сбой не виден в ответе: на персональных данных и на числах под давлением.

4 из 22 в худшем классе · 20 из 22 в трёх лучших · 4 модели из 11 без единого пропуска

Метод проверки

Судить по состоянию, а не по словам

Модель умеет отказаться на словах и сделать на деле — и наоборот, отрапортовать об успехе, не сделав ничего. Поэтому вердикт ставится по файлам до и после, а текст ответа читается последним.

52 прогона · 0 пропусков · прочитано 8 из 13 · 7 ложных отказов

Прибор врёт

Успешно — значит только «не упал»

Упавший скрипт чинят в тот же день, а взявший четверть данных и бодро отчитавшийся живёт месяцами и всё это время производит выводы. Дважды «клиент молчит» оказалось фактом о фильтре, а не о клиенте.

74,9% чатов на новом формате · ≈75% выборки отсекалось молча · 0 из 3 → 3 из 3 по адресу

Прибор врёт

Главная всегда особенная

Замер начинается с выбора множества, и множество почти всегда собирается по удобству, а не по определению. Главная, список из задачи и статус репозитория — три удобные точки, каждая из которых дала неверный ответ в одном заезде.

21 из 24 страниц · 16 доменов − 1 − 4 − 1 = 10 живых · хешей разошлось 0 при десяти 404 · 143 → 115 → 0 рабочих копий

Метод проверки

Мёртв 10 дней при статусе «сделано»

Статус карточки, факт запуска и время события описывают действие, а не состояние объекта — и совпадают с ним почти всегда, кроме одного раза. Показываем четыре пробы, которые дают ответ, ничего не спрашивая у исполнителя.

10 дней простоя · 8 выкаток, фикс в одной · 4 независимые причины молчания · 23/23 + 6/6 + 12/12 каналов · 81 материал за прогон

Метод проверки

Одна цифра, два экрана, 8,5 раза

У величины кроме значения есть единица, адрес и горизонт, и постановка задачи теряет все три. После потери два правильных числа спорят друг с другом, и спор неразрешим, пока не названо, где именно считали.

8,5 раза между экранами · 40 пар в данных, 6 на странице водителя · 8 из 9 → 0 нарушений, длины 31–62 · 223 → 326 · 13 → 3 · 52 записи, 28 и 38

Организация работы

Знание есть, дойти нельзя

Поиск не находит, ссылка ведёт не туда, идентификатор меняется под руками — и накопленная база начинает работать как отсутствующая. Показываем приёмку поисковика тремя прогонами и правило записи ссылок, после которого ошибка видна на глаз.

4 причины молчания · 591 против 996 задач · окно 45 дней при возрасте 51 · 1200 → 20 000 символов · 135 файлов в выдаче · номер сменился трижды

Метод проверки

Из мнения есть выход

Правило «статус вывода не выше минимального статуса посылок» дало у нас ошибку в обе стороны, потому что считает статусы, а не приборы, которыми посылки получены. Второй сюжет: утрата поля смысла и утрата поля проверяемости требуют разного лечения, а схема роняла оба случая на одно дно.

10 полей смысла против 6 полей проверяемости · 3 из 3 против 0 из 3 · 1,5 часа ложного вывода

Метод проверки

Недействительно — не опровергнуто

Замер, проведённый в загрязнённых или неравных условиях, ничего не говорит о предмете — он говорит о процедуре, и путать его с опровержением дорого. Второй разрыв: метрика за скользящее окно верно воспроизводится и даёт другое число, что формальное правило считает опровержением.

96 размеченных случаев · 19 из 24 прогонов недействительны · 2 ложных понижения

Прибор врёт

Ноль находок или ноль осмотренных

Без числа осмотренных объектов «ноль нарушений» и «ноль проверенных» выглядят в отчёте одинаково, и это самый крупный и самый дорогой класс ошибок нашего корпуса. Второй сюжет: вердикт автоматической проверки не наблюдение, не измерение и не вывод, а четвёртый тип со своими полями о самом приборе.

28 из 96 случаев · 14 переделок · 33 гейта: 8 провалили тест, 15 без теста

Метод проверки

Три способа оказались одним

Три проверки, смотрящие в одно и то же место, — это один способ, повторённый трижды, и требование «перечислить способы поиска» от такой ошибки не защищает. Тот же сдвиг вопроса с «как» на «где» чинит ещё два класса: мнимую независимость подтверждения и допущение, встроенное в действие.

6 пространств поиска · 88 из 88 веток при 706 непушенных · 10 утрат поля, 4 переделки

Организация работы

Передавай наблюдение, а не вывод

Формулировку координатора тиражируют вниз без перепроверки, поэтому у передаваемого факта два обязательных поля: чем получен и что не проверялось. Разбираем это на выводе по коду ответа, на устаревшем хендоффе и на отказе от собственного верного утверждения.

код 000 · 4 пункта · 3 неверны · 30 минут

Метод проверки

Падеж, стиль и конец сценария

Структурные проверки меряют разметку и метрики, а текст читают на длину и уникальность. За этой границей остаются язык, применённые стили и живой сценарий — три дефекта, прожившие в проде недели.

40 страниц · 175 страниц · 221 файл

Наш прибор

Прибор читает не тот текст

Детектор видит разметку, склеенные ячейки и невидимые символы конца строки — и находит то, чего в тексте нет. Лечится нормализацией входа прибора, а не правкой текста и не понижением порога.

3 ложных адреса · 484 находки · 5 из 6 · 61%

Прибор врёт

Сначала множество, потом число

Отчёт зелёный, арифметика верна, а число посчитано не на том множестве. Разбираем четыре механизма на своих замерах и правило, которое их все ловит: обработано = сошлось + разошлось + не проверено.

176 залито · 174 сверено · 382 против 182

Метод проверки

Источник, который решает

У каждого повторяющегося вопроса есть носитель, который решает, и он редко тот, что под рукой. Разбираем четыре пары: диск против ветки, репозиторий против прода, терминал против файла отчёта, файл доски против серверного слоя.

316 против 284 · 32 закрытых числятся открытыми · отставание диска 405 задач

Прибор врёт

Ложное «нет» описывает канал

Положительный ответ инструмента доказывает себя сам, отрицательный не доказывает ничего: «не найдено» одинаково звучит и когда объекта нет, и когда до него не дошла команда. Разбираем четыре случая и проверку, которая отделяет одно от другого.

0 строк вместо файла · 8 сессий в списке · 3 способа из одного источника · 4 промаха клика

Организация работы

У чего нет приёмщика

Дефекты выживают там, где у результата нет получателя, способного заметить брак. Разбираем четыре таких места — раздачу по зонам, собственное правило координатора, автозапуск по расписанию и гард — и кого в каждом назначать приёмщиком.

8 «своих» задач против 1 · 46 чатов розданы без проверки · 21 процесс при пороге 14

Организация работы

Ущерб за границей своей зоны

Разделение по непересекающимся зонам файлов спасает от конфликтов и делает границу зоны границей внимания. Показываем четыре стыка, где ошибку не видит ни один исполнитель: чужая ветка, чужая база отсчёта, сквозная навигация и общая память машины.

1047 коммитов отставания · 19 и 13 против 7 и 0 · 958 спасённых строк

Как мы строили

Модель данных

«Единой модели данных нет» — верно

Упрёк справедлив, и мы нашли его у себя раньше, чем услышали снаружи. Показываем хранилище как есть: что спроектировано, что работает и чем это уже стреляло.

JSON без схемы · lost update · критерий перехода на СУБД

Архитектура

Архитектура и стек без прикрас

«Ни слова про архитектуру» — справедливое требование. Вот состав целиком, с причиной каждого выбора и с честным списком, где эта сборка упирается.

5 языков · 3 сервиса · 2 агента вне контура сайта

Интеграция

Что на самом деле отдаёт внешний API

«Надо понимать, что она отдаёт» — именно так. Разбираем интеграцию, где документации, по которой её можно собрать, не существует.

1102 строки агента · 105 библиотек · 5 мин, найденных боем

Работа с моделями

Сколько допиливать после ИИ — в цифрах

Тезис «всё приходится допиливать» верен. Мы перевели его в числа: где модели промахиваются, насколько и что с этим делает постановка задачи.

210 вызовов · 17 промахов из 21 · 18/20 против 1/20

Процесс работы

Что входит в две недели разбора — по дням

«Явно надо было проводить аналитику и вникать в проблему» — да. Показываем поденно, как это выглядит и где именно слова расходятся с данными.

10 рабочих дней · 7 ролей интервью · люфт 2–4 дня

Что сработало

Инвариант становится тестом

Пирамида тестов у нас была, а середина пустовала: код, ворочающий деньгами, ловил провалы в проде. Дыра закрыта проверками на настоящем сервере, а слияние — проверкой математических свойств вместо придуманных примеров.

15 из 15 зелёных · 7 тестов свойств · 8 точек записи · 5 из 7 дыр закрыто

Метод проверки

Половина книг — не про нас

Разбор идёт по оглавлению: на каждой теме один вопрос — что у нас в этом месте и чем оно уже стреляло. Список неприменимого вышел длиннее списка находок, и это тоже результат.

7 дыр · 5 присвоенных идей · 5 закрыто, 1 в работе, 1 открыта · 1 глава из 28 у Петцольда

Наш прибор

Сбой находил человек

Три способа не узнать о своей аварии: никто не спрашивает, спрашивает и глотает ответ, спрашивать нечего и некого. Первый закрыт прибором на пять целей, второй — правилом «нет данных значит ошибка», третий пока в работе.

5 целей · пауза 20 секунд · 14 из 16 репозиториев без копии · 99 % = 3,7 дня простоя в год

Организация работы

Удаление — это запись

У нашего режима работы есть учебниковое имя — оптимистичная репликация, и оно приходит с обязательствами. Два из них мы не выполняли: след от удаления и разрешение конфликта по полю, а не по записи целиком.

3 источника сошлись на журнале событий · 2 времени у события · 6 пунктов статуса, половина открыта

От чтения к навыку

Журнал показывает метод. Дальше есть два пути: научить своих людей работать так же — или отдать процесс нам.

Обучение сотрудников работе с ИИ

Практический курс на ваших рабочих задачах: 4 занятия по 90 минут, курс идёт 2–3 недели, группа до 8 человек. Четыре ролевых трека — руководитель, менеджер по продажам, бухгалтер, диспетчер. Упражнения строятся на ваших обезличенных материалах, собранных анкетой до старта.

Цена: курс отдельно — $800 за группу до 8 человек; при пилоте или действующей поддержке — $500; дополнительная группа — +$400.

Полная программа, состав занятий и метрики результата →

Лесенка работ, если хотите не учиться, а получить процесс

ЭтапМалый бизнесСреднийКрупный
Экспресс-аудит
по открытым данным, без обязательств
Бесплатно — любой размер
Анализ конкурентов
цена по охвату рынка, зачитывается в следующий этап на 100%
$300 своя страна · $600 + Россия · $900 + весь мир
PoC: расчёт окупаемости и ТЗне требуется — сразу пилот$1000$2500
Пилот (один процесс, 2–3 недели)$1200/мес$2000/мес$3500/мес
Поддержка$250/мес$400/мес$800/мес

PoC зачитывается в пилот на 100% — за расчёт окупаемости и техническое задание клиент не платит дважды.

Начать с бесплатного экспресс-аудита

Смотрим ваши процессы по открытым данным и говорим, где ИИ окупится, а где нет. Без предоплаты и обязательств — включая ответ «в вашем случае не окупится».

Написать в WhatsApp