Услуги
Сайты и магазиныЛендинги ★Создание сайтовИнтернет-магазины
ИИ и автоматизацияИИ-секретарь ★Автоворонка и прогрев ★Telegram-боты ★Автоматизация ★CRM-разработка
ПродвижениеSEO-продвижениеAI-продвижение ★Контекстная рекламаSMM и соцсети
Наружка, печать и производствоВывески и буквыНаружная рекламаБаннеры и штендерыТипографияВизиткиШирокоформатБрендированиеОклейка автоТорговое оборудованиеМатериалы для рекламы
Дизайн и поддержкаДизайнПоддержка
КомплексDigital под ключ ★
РешенияКейсыПортфолиоЦеныО студииБлогКонтакты Обсудить проект

Замер модели

Казахский и смешанный русско-казахский: замер вместо мнения

Речь клиентов в Казахстане — смесь двух языков в одной фразе. Мы замерили, насколько плохо её слышат готовые модели, дообучили свою и перемерили на том же срезе. Ниже — цифры и честная граница результата.

Замер: 1 августа 2026наш замер

Чем проверено: открытый корпус FLEURS kk_kz, 200 записей (51 мин), скрипт _tools/asr_eval_kk.py, тот же срез для всех моделей

Короткий вывод. На одном и том же срезе казахской речи готовые модели ошибаются в 73,8% (младшая) и 53,4% (втрое более крупная) слов. Наша дообученная младшая модель даёт 49,0% — лучше своей базы в полтора раза и лучше модели втрое большего размера. Русский при этом не просел: 28,2% → 19,9%. Честная граница, которую мы говорим вслух: 49% ошибок по словам — это не «модель понимает казахский». Это «ошибок стало вдвое меньше», и для черновика диспетчера этого хватает, а для автоматического решения без человека — нет.

Задача

Заявки к нам приходят голосом, и значительная часть — на смеси двух языков в одной фразе: казахская конструкция с русскими вставками. Владелец сформулировал требование без вариантов: переключателя языка быть не должно, модель обязана определять язык сама.

До этого наши версии распознавания обучались с жёстко зашитым русским языком. На казахской речи это давало не ошибки, а бессмыслицу: приветствие «Ассалаумағалейкум» превращалось в «Ассал, Вашим», целые фразы читались как набор похожих по звучанию русских слов. Стоковая модель с полностью свободным автоопределением вела себя не лучше — на коротком телефонном аудио она уходила в корейский с уверенностью ниже случайной.

Как мерили

Замер должен быть повторяемым, иначе спорить о нём бессмысленно. Условия зафиксированы так:

  • Срез: открытый корпус FLEURS, казахская часть, сплит test, первые 200 записей — 51 минута аудио. В обучение этот сплит не входил.
  • Метрики: WER (доля неверных слов) и CER (доля неверных символов). Для казахского показательнее CER: язык агглютинативный, одна буква в длинном слове рушит в WER всё слово целиком.
  • Нормализация: регистр и пунктуация ошибками не считаются.
  • Одинаковость: один и тот же скрипт и один и тот же срез для всех сравниваемых моделей.
Почему это важнее самих цифр. «Точность 95%» без указания корпуса, сплита и способа нормализации — не результат, а рекламный слоган: подобрав удобный срез, ту же модель можно показать и как отличную, и как непригодную. Мы называем срез и скрипт, чтобы замер можно было повторить и оспорить.

Замер «до»

МодельWERCERКомментарий
сток, младшая (наша база)73,8%20,8%три слова из четырёх мимо
сток, средняя (втрое крупнее)53,4%12,4%половина слов мимо

Эти две строки — весь ответ на вопрос «а готовые модели разве не умеют казахский». Умеют настолько, что каждое второе слово неверно. Для языка с 20 миллионами носителей это ожидаемо: в обучающих данных его доля мала, и никакой промпт этого не компенсирует.

Что мы сделали

Дообучение одной модели сразу на двух языках страны. Ключевое отличие от предыдущих попыток — каждому примеру ставится свой языковой токен, а не общий русский на весь корпус.

ПараметрЗначение
Базамладшая модель линии (средняя в имеющуюся видеопамять помещается только с чекпоинтингом и учится слишком долго)
Русский корпуснаши живые голосовые заявки: 2702 примера на обучение, 143 на валидацию
Казахский корпусоткрытый FLEURS: 3054 примера, потолок 2800 за эпоху ради баланса примерно 50 на 50
МетодLoRA, r=16 — тот же рецепт, что раньше дал 20,9% против 29,7% у стока на русском
Обучение3 эпохи, 32 минуты, выбор лучшего чекпоинта по валидации: 0,63 → 0,46 → 0,44

Отдельно решался вопрос смешанной речи. Правило простое и проверенное на данных: языковой токен фразы — это доминирующий язык, русские вставки остаются внутри как есть. Модель не пытается переводить их и не спотыкается о них.

Вторая защита — от метаний детектора языка. Если детектор уверен, идёт быстрый путь; если сомневается, аудио расшифровывается обоими языками и побеждает вариант с большей фактической уверенностью модели. Живой пример, ради которого это сделано: на одном клипе детектор отдавал перевес русскому в 68% — и ошибался.

Замер «после»

МодельWERCER
сток, младшая (база нашей версии)73,8%20,8%
сток, средняя (втрое крупнее)53,4%12,4%
наша версия (младшая, дообученная)49,0%11,3%

Русский на нашей валидации: 28,2% → 19,9% по словам и 15,7% → 9,1% по символам. То есть одна модель теперь держит оба языка, и добавление казахского не оплачено русским.

Оговорка к русской строке. Эта валидация участвовала в выборе чекпоинта, поэтому сигнал относительный, а не независимый. Честный русский замер требует отдельной отложенной выборки — она собирается. Мы предпочитаем назвать это в тексте, а не показывать цифру как окончательную.

Проверка на реальном звонке, а не на корпусе

Открытый корпус — это начитанная студийная речь, наши клиенты говорят иначе. Поэтому итоговая проверка шла на живом клипе из очереди — том самом, со смешанной речью.

Что проверялиСредняя стоковая модельНаша версия
Определённый языкрусский (ошибка)казахский
Результат расшифровкирусская бессмыслицаказахская фраза, русская вставка сохранена внутри
Время на клип68 с4,8 с

Разрыв в уверенности между языками на этом клипе стал таким, что двойная расшифровка теперь включается только на действительно спорных случаях — и каждый такой случай пишется в журнал как кандидат в обучающую выборку по смешанной речи.

Что из этого стоит взять другим

  • Проверяйте язык, а не модель. «Модель поддерживает 90 языков» — это про наличие токена языка, а не про качество. Ваш язык проверяется на вашем аудио.
  • Размер модели заменяется данными. Дообученная младшая модель обошла втрое более крупную. Считать «возьмём модель побольше» решением — дорого и не всегда работает.
  • Смешанная речь — отдельный класс задачи. Её нельзя мерить на чистом корпусе; нужен свой срез из собственных записей, и собирается он только разметкой.
  • Называйте порог применимости. Мы говорим прямо: на этой точности расшифровка идёт человеку как черновик, а не в автоматическое решение. Порог — часть результата.

Источники материала

  • Протокол обучения и замера двуязычной модели от 01.08.2026: вводные, параметры, сырые прогоны по каждой модели, живая проверка через рабочую очередь.
  • Отдельный протокол отложенной выборки для честного русского замера — фиксирует, что валидация, участвовавшая в выборе чекпоинта, независимым замером не считается.
  • Корпус FLEURS, казахская часть, сплит test — открытые данные под лицензией CC-BY.

Курс начинается там же, где этот замер

Первое занятие — про то, как поставить ИИ измеримую задачу и как принять результат: что именно меряем, на каком срезе, с чем сравниваем. Без этого «внедрили ИИ» остаётся ощущением, а не фактом.

Программа курса и цены
Соседние материалы
Предыдущий замер: 20 из 20 своих тестов — и 8 реальных баговСледующий замер: Сколько на самом деле стоит ИИВсе материалы журнала

Обсудим ваш проект

Оставьте заявку — свяжемся в течение 15 минут в рабочее время, зададим пару вопросов и пришлём ориентир по цене и срокам. Бесплатно, без обязательств.

  1. 1. Заявка или квиз
  2. 2. Короткий созвон / переписка
  3. 3. Бесплатная смета и план
  4. 4. Договор и старт

Бесплатно и ни к чему не обязывает. Ответим за 15 минут.