Транскрибация звонков: что работает на русской речи, а что ломается
Транскрибация звонков сама по себе не приносит денег: текст разговора никто читать не будет. Ценность появляется на следующем шаге — когда из расшифровки автоматически вытаскиваются причина обращения, договорённости и срок следующего шага, и всё это ложится в карточку CRM без менеджера. Ниже — чем расшифровывать русскую речь, где она разваливается и сколько это стоит в месяц.
Зачем расшифровывать звонки, если текст всё равно не читают
У среднего отдела продаж на десять человек за месяц набегает 1 500–3 000 записей. Руководитель физически прослушивает 20–30 из них, обычно те, на которые пожаловался клиент. Остальное — слепая зона: что менеджер обещал по срокам, назвал ли цену, договорился ли о следующем шаге, почему сделка встала.
Расшифровка превращает эту слепую зону в данные, по которым можно фильтровать и считать. Дальше текст обрабатывает модель и отдаёт структуру: тема обращения, названные товары, возражения, обещания, дата следующего контакта. Именно структура, а не транскрипт, попадает в CRM и в отчёт.
Проект, который заканчивается на «мы получаем текст звонка», почти всегда потом забрасывают. Отчёт с текстами разговоров открывают неделю, потом перестают. Работает только то, что само меняет данные в системе или само пишет ответственному.
Чем расшифровывать русскую речь: движки и цены
Вариантов три: своя копия Whisper на своём сервере, зарубежное облако (OpenAI, Deepgram, Google STT) или российское — прежде всего Yandex SpeechKit. Разница не только в цене, но и в том, куда уходит запись с персональными данными клиента.
| Вариант | Точность на русском | Цена за минуту | Когда брать |
|---|---|---|---|
| Whisper large-v3 у себя на GPU | 3–5 % ошибок на чистом аудио, 8–12 % на телефонной записи | только железо: аренда GPU-сервера от 15–30 тыс. ₽/мес | большой поток, данные не должны покидать контур |
| Whisper large-v3-turbo у себя | почти как large-v3 (5,6 % против 5,4 % на эталонной русской речи) | то же железо, скорость в разы выше | поток тысяч звонков, нужна дешёвая пропускная способность |
| OpenAI API (whisper-1, gpt-4o-transcribe) | уровень large-v3, диаризация включена в ту же цену | $0,006/мин ≈ 0,5 ₽; mini — $0,003 | быстрый старт, записи не критичны по 152-ФЗ |
| Yandex SpeechKit | заявлено 95 %+ на русском, есть свои словари и модель с эмоциями | 10–30 ₽/мин в зависимости от модели | нужен российский контур и договор с оператором в РФ |
| Готовый сервис речевой аналитики | движок под капотом обычно тот же | от 1,5–3 ₽/мин, тарифицируется пакетами | нужен результат завтра и хватает типовых отчётов |
Отложенная обработка и реальное время — разные вещи и по цене, и по устройству. Асинхронно: залил файл, забрал результат через минуту-две, SpeechKit принимает записи до четырёх часов, у Whisper-API стриминга нет вообще. Realtime — отдельные модели и другой порядок цены: у OpenAI живая транскрипция около $0,017 за минуту, втрое дороже пакетной.
Realtime нужен в двух случаях: подсказка менеджеру во время разговора и голосовой робот, который обязан отвечать. Контроль качества, заполнение CRM и отчёты делаются ночью пачкой.
На объёмах разница считается просто. 3 000 звонков по 4 минуты — 12 000 минут в месяц: через OpenAI API это около 6 000 ₽, через SpeechKit по 15 ₽ — 180 000 ₽, на своём GPU-сервере — фиксированные 20–30 тыс. ₽ независимо от объёма. Своё железо начинает выигрывать примерно с 10–15 тысяч минут в месяц.
Где транскрибация ломается на русском
Все заявленные проценты точности измерены на чистой начитке. Телефонный звонок — это 8 кГц, сжатие кодеком, громкая связь, склад на фоне и два человека, которые говорят одновременно. Ошибки идут не случайно, а в предсказуемых местах, и знать их надо заранее.
- Термины и артикулы. «ТП-450», «ВГП 25х3,2», «ГОСТ 8734» — движок слышит набор звуков и подставляет похожее по частотности слово. Лечится словарём: SpeechKit принимает список терминов, для Whisper он подмешивается в подсказку или чинится заменами после расшифровки.
- Имена и названия компаний. «Иванов из Промтеха» превращается в «Иванова из пром теха», и по такому тексту не сматчить контрагента. Названия надёжнее брать из CRM по номеру телефона, а не вылавливать из речи.
- Цифры и суммы. «два пятьсот» может значить и 2 500, и 2,5 млн. Любую сумму из транскрипта считаем черновиком.
- Перебивы и наложение голосов. Самое больное место. Диаризация на двух голосах даёт около 95 % точности, на десяти падает до 60–70 %, а участки, где говорят одновременно, pyannote 3.1 умеет только помечать — распознать их нормально не может никто.
- Моно-запись. Если АТС отдаёт один канал вместо двух, ошибки диаризации накладываются на ошибки распознавания. Двухканальная запись решает это полностью и бесплатно — просто настройка телефонии.
- Шум, громкая связь, улица. Запись с мобильного в цеху даёт 20–30 % ошибок независимо от движка: помогает гарнитура, а не выбор модели.
- «Съеденный» конец фразы. Whisper на плохом сигнале склонен не молчать, а придумывать связные, но не сказанные слова. Это опаснее пропуска — выглядит как настоящая реплика.
Вывод: прежде чем сравнивать движки, надо посмотреть, что отдаёт телефония. Переход с моно на два канала обычно даёт больший прирост, чем смена модели с хорошей на лучшую, и стоит ноль.
Оценивать качество на слух по одному звонку бессмысленно. Нормальная приёмка: берём 30–50 записей, руками пишем эталонную расшифровку для десяти самых сложных и считаем ошибки именно на ваших терминах. Два-три часа работы вместо спора на словах.
Разбор смыслов: что вытаскивать из расшифровки
Дальше работает языковая модель, и главное — не просить у неё «проанализируй звонок»: получится сочинение, которое нельзя ни проверить, ни положить в поле. Просить надо конкретные значения из закрытого списка и цитату-подтверждение из расшифровки.
| Что вытаскиваем | Как формулируется задача модели | Куда попадает |
|---|---|---|
| Тема обращения | выбрать одну из 8–12 категорий, свои придумывать нельзя | поле сделки, срез в отчёте |
| Названные товары и объёмы | список позиций с цитатой, где они прозвучали | черновик заявки, товары сделки |
| Возражение клиента | категория из справочника + цитата | аналитика причин отказа |
| Обещания менеджера | что и к какому сроку обещал, дословно | задача с дедлайном |
| Следующий шаг и дата | дата в ISO или «не договорились» | задача в CRM, поле «следующий контакт» |
| Соблюдение скрипта | чек-лист из 5–8 пунктов, каждый — да/нет/не применимо | оценка звонка, дашборд качества |
| Красный флаг | упоминание конкурента, угроза уйти, жалоба на брак | мгновенное уведомление руководителю |
Чек-лист скрипта — то, за чем приходят чаще всего. Он работает на формальных пунктах: представился, назвал компанию, спросил про сроки, проговорил цену, зафиксировал следующий шаг. И не работает на «установил контакт» или «был доброжелателен» — там модель выдаёт стабильный, но бессмысленный ответ, и такие пункты лучше выкинуть, чем делать вид, что они измеряются.
Быстрее всего окупаются красные флаги: уведомление руководителю в Telegram сразу после звонка, где клиент сказал «тогда мы уйдём к другим», стоит копейки и спасает сделки. Из тех же разобранных звонков потом считаются дашборды для бизнеса.
Пока читаете — можно сразу проверить свою задачу. Опишите процесс, и я скажу, решается ли он и во сколько обойдётся.
Авто-заполнение CRM по итогам звонка
Самая ощутимая для менеджера часть: после разговора он не пишет комментарий, не ставит задачу и не двигает этап — остаётся проверить и поправить. Пятнадцать-двадцать минут в день, но важнее то, что заполнение перестаёт зависеть от настроения.
Технически всё держится на двух связках. Первая — телефония отдаёт запись: у виртуальных АТС вроде Mango Office или UIS есть API и вебхук на завершение звонка, у amoCRM и Битрикс24 запись достаётся из карточки через REST. Вторая — обратная запись результата, то есть обычная интеграция с CRM: поля, права, идемпотентность.
- Ничего не перезаписывать. Робот дописывает комментарий и заполняет пустые поля, но не трогает введённое человеком. Первый же конфликт данных убивает доверие к системе.
- Метка источника. У каждого заполненного роботом поля видно, что оно от робота, и есть ссылка на цитату.
- Смена этапа — только по явным правилам. Двигать сделку по воронке можно, но список условий пишется до запуска и согласуется с руководителем отдела. «Модель решила, что клиент готов» — не условие.
- Молчание — не результат. Пустая, короткая или неуверенно разобранная расшифровка уходит в очередь на просмотр, а не заполняется наугад.
- Первые две недели — с подстраховкой. Робот пишет в отдельное поле, руководитель выборочно сверяет с записью.
Следом почти всегда просят то же для встреч и созвонов: протокол, решения, ответственные, сроки. Механика идентичная, только говорящих больше двух — и диаризация работает заметно хуже.
Робот-обзвон: почему его ненавидят и когда он всё же уместен
Скажу прямо: большинство запросов «сделайте нам голосового робота для обзвона» лучше не выполнять в том виде, в каком их формулируют. Робот, который холодно звонит по купленной базе и зачитывает предложение, приносит раздражение, жалобы и юридический риск, а не продажи.
Причины ненависти вполне конкретные, и все они — про неуважение ко времени человека, а не про качество синтеза речи:
- Звонок не ждали. Холодный обзвон и без робота даёт 1–2 % конверсии, а робот делает это в промышленных масштабах и по тем, кто согласия не давал.
- Робота нельзя перебить. Человек говорит «мне не надо», а тот продолжает зачитывать абзац. Это недоработка сценария, а не судьба.
- Он не понимает отказ: три ветки диалога вместо понимания, любой ответ не по шаблону приводит к повтору вопроса.
- Нельзя попасть к человеку. «Соедините с оператором» должно срабатывать с первого раза и всегда, иначе робот воспринимается как стена.
- Он притворяется живым — и разоблачается за две реплики, вызывая злость.
- Звонит не в то время: робот не чувствует, что 21:40 — плохая идея, если это не прописано.
К этому добавилась материальная правовая сторона. С 1 сентября 2025 года массовые звонки и рассылки допустимы только при предварительном согласии абонента, а само согласие на обработку персональных данных должно быть оформлено отдельным документом, а не пунктом в договоре (156-ФЗ от 24.06.2025). Штраф юрлицу за обработку без надлежащего согласия — 300–700 тыс. ₽, по массовым рекламным звонкам вилка доходит до миллиона. Плюс обсуждается обязанность операторов предупреждать абонента, что звонит робот, — маскировка перестанет работать даже технически.
Уместных сценариев на самом деле немало, просто все они про звонки, которых человек ждёт, и своей базе, а не купленной:
- Подтверждение записи или заказа. «Ваш визит завтра в 15:00: один — подтвердить, два — перенести». Отвечают охотно, потому что это их запись.
- Напоминание о визите. Классика для клиник, сервисов, автосалонов: сокращает неявки, звонок ожидаем.
- Оповещение о готовности. Заказ приехал, техника из ремонта готова — короткий факт без продажи.
- Опрос качества после обращения. Один-два вопроса сразу после закрытия заявки; закон выделяет опросы качества отдельно от рекламного спама.
- Актуализация своей базы по клиентам, которые сами оставляли заявку.
- Массовое информирование при сбое. Когда надо за час обзвонить 2 000 человек с одним и тем же текстом, живой колл-центр этого просто не может.
Правило, которое я предлагаю клиентам: если поводом для звонка служит интерес компании, а не событие в жизни клиента — робота не делаем. Вместо него чат-бот или сообщение в мессенджер: человек ответит, когда ему удобно.
Сроки, цена и с чего начинать
Разработка считается по часам, час работы — от 2 500 ₽. Дальше зависит от того, сколько систем в связке и насколько дисциплинированно ведётся CRM.
- Проверка на ваших записях (1–2 дня, 10–20 тыс. ₽). 30–50 реальных звонков через два движка, подсчёт ошибок на ваших терминах, черновик разбора. Здесь видно, будет польза или качество записи всё убивает.
- Расшифровка потоком + отчёт (около недели). Выгрузка из телефонии, обработка, хранение, поиск по тексту, первая сводка. Уже на этом этапе руководитель ищет по словам вместо прослушивания.
- Разбор смыслов и запись в CRM (1–2 недели). Поля, правила, задачи, уведомления, метки источника. Это и есть ИИ-агент под один процесс — от 60–80 тыс. ₽.
- Голосовой робот, если он нужен. Сценарии, синтез, телефония, перебивание, передача человеку, согласия — самостоятельный проект, дешевле 100 тыс. ₽ нормально не собирается.
Дальше эксплуатация: расшифровка по 0,5–3 ₽ за минуту, разбор моделью — копейки за звонок, хранение и сопровождение от 15 000 ₽/мес. Последнее не формальность: телефония меняет формат вебхука, в CRM появляются новые поля, провайдер снимает модель с поддержки. Что именно ломается и сколько стоит починка — в статье про поддержку после внедрения.
С чего начинать: включить в телефонии двухканальную запись, проверить, что уведомление о записи звучит в начале звонка, и собрать месячный архив. Дальше есть на чём считать, а не гадать.
Частые вопросы
Сколько стоит транскрибация звонков в месяц?
Считается по минутам. Через зарубежное API — около 0,5 ₽ за минуту, готовые сервисы речевой аналитики берут от 1,5–3 ₽, Yandex SpeechKit — 10–30 ₽ в зависимости от модели. Своя копия Whisper на арендованном GPU-сервере обходится в фиксированные 15–30 тыс. ₽ в месяц и начинает выигрывать примерно с 10–15 тысяч минут потока.
Какая точность распознавания русской речи реально получается?
На чистом аудио Whisper large-v3 даёт 3–5 % ошибок в словах. На телефонной записи из АТС — обычно 8–12 %, на моно-записи с перебивами 15–20 %, на мобильном в шумном помещении 25–30 %. Заявленные вендорами «95 % и выше» относятся к чистой начитке, поэтому проверять надо на своих записях и своих терминах.
Можно ли обойтись без отправки записей в зарубежное облако?
Да. Whisper разворачивается на своём или арендованном в России сервере, и запись никуда не уходит; из российских облаков задачу закрывает Yandex SpeechKit по договору с оператором в РФ. Это дороже в разработке и в железе, но снимает вопросы по 152-ФЗ, которые в проектах с записями разговоров возникают всегда.
Нужна ли расшифровка в реальном времени?
Почти никогда. Realtime нужен для подсказки менеджеру во время разговора и для голосового робота, который обязан отвечать. Контроль качества, заполнение CRM и отчёты спокойно делаются пачкой ночью, а живая транскрипция стоит примерно втрое дороже пакетной — около $0,017 против $0,006 за минуту у OpenAI.
Законно ли записывать и расшифровывать разговоры с клиентами?
Записывать можно, если клиент уведомлён о записи в начале разговора и записи хранятся защищённо; продолжение разговора после уведомления считается согласием. С 1 сентября 2025 года согласие на обработку персональных данных должно оформляться отдельным документом, а не пунктом договора. Штраф для юрлица за обработку без надлежащего согласия — от 300 до 700 тыс. ₽, так что формулировки стоит согласовать с юристом до старта.
Робот-обзвон вообще имеет смысл?
Имеет — на своей базе и по поводу, который важен клиенту: подтверждение записи, напоминание о визите, оповещение о готовности заказа, опрос качества, массовое информирование о сбое. Холодный обзвон купленной базы делать не стоит: с 1 сентября 2025 года массовые звонки без предварительного согласия запрещены, штрафы доходят до миллиона рублей, а конверсия остаётся на уровне 1–2 % при большом объёме негатива.
Читайте дальше
Прогнать ваши записи
Пришлите 30–50 реальных звонков — покажу качество расшифровки на ваших терминах, черновик разбора и цену обработки потока в месяц.
Обсудить задачу