Транскрибация звонков: расшифровка, разбор смыслов, CRM
← Все материалы
Разбор

Транскрибация звонков: что работает на русской речи, а что ломается

Транскрибация звонков сама по себе не приносит денег: текст разговора никто читать не будет. Ценность появляется на следующем шаге — когда из расшифровки автоматически вытаскиваются причина обращения, договорённости и срок следующего шага, и всё это ложится в карточку CRM без менеджера. Ниже — чем расшифровывать русскую речь, где она разваливается и сколько это стоит в месяц.

0,5–3 ₽расшифровка одной минуты разговора
5–15 %ошибок в словах на живом звонке из АТС
2–3 недот записей в АТС до авто-заполнения CRM

Зачем расшифровывать звонки, если текст всё равно не читают

У среднего отдела продаж на десять человек за месяц набегает 1 500–3 000 записей. Руководитель физически прослушивает 20–30 из них, обычно те, на которые пожаловался клиент. Остальное — слепая зона: что менеджер обещал по срокам, назвал ли цену, договорился ли о следующем шаге, почему сделка встала.

Расшифровка превращает эту слепую зону в данные, по которым можно фильтровать и считать. Дальше текст обрабатывает модель и отдаёт структуру: тема обращения, названные товары, возражения, обещания, дата следующего контакта. Именно структура, а не транскрипт, попадает в CRM и в отчёт.

Запись из АТСРасшифровка втекстРазбор смысламодельюПоля в CRMСводкаруководителю
Пять шагов. Транскрибация — только второй из них, и самый простой

Проект, который заканчивается на «мы получаем текст звонка», почти всегда потом забрасывают. Отчёт с текстами разговоров открывают неделю, потом перестают. Работает только то, что само меняет данные в системе или само пишет ответственному.

Чем расшифровывать русскую речь: движки и цены

Вариантов три: своя копия Whisper на своём сервере, зарубежное облако (OpenAI, Deepgram, Google STT) или российское — прежде всего Yandex SpeechKit. Разница не только в цене, но и в том, куда уходит запись с персональными данными клиента.

ВариантТочность на русскомЦена за минутуКогда брать
Whisper large-v3 у себя на GPU3–5 % ошибок на чистом аудио, 8–12 % на телефонной записитолько железо: аренда GPU-сервера от 15–30 тыс. ₽/месбольшой поток, данные не должны покидать контур
Whisper large-v3-turbo у себяпочти как large-v3 (5,6 % против 5,4 % на эталонной русской речи)то же железо, скорость в разы вышепоток тысяч звонков, нужна дешёвая пропускная способность
OpenAI API (whisper-1, gpt-4o-transcribe)уровень large-v3, диаризация включена в ту же цену$0,006/мин ≈ 0,5 ₽; mini — $0,003быстрый старт, записи не критичны по 152-ФЗ
Yandex SpeechKitзаявлено 95 %+ на русском, есть свои словари и модель с эмоциями10–30 ₽/мин в зависимости от моделинужен российский контур и договор с оператором в РФ
Готовый сервис речевой аналитикидвижок под капотом обычно тот жеот 1,5–3 ₽/мин, тарифицируется пакетаминужен результат завтра и хватает типовых отчётов

Отложенная обработка и реальное время — разные вещи и по цене, и по устройству. Асинхронно: залил файл, забрал результат через минуту-две, SpeechKit принимает записи до четырёх часов, у Whisper-API стриминга нет вообще. Realtime — отдельные модели и другой порядок цены: у OpenAI живая транскрипция около $0,017 за минуту, втрое дороже пакетной.

Realtime нужен в двух случаях: подсказка менеджеру во время разговора и голосовой робот, который обязан отвечать. Контроль качества, заполнение CRM и отчёты делаются ночью пачкой.

На объёмах разница считается просто. 3 000 звонков по 4 минуты — 12 000 минут в месяц: через OpenAI API это около 6 000 ₽, через SpeechKit по 15 ₽ — 180 000 ₽, на своём GPU-сервере — фиксированные 20–30 тыс. ₽ независимо от объёма. Своё железо начинает выигрывать примерно с 10–15 тысяч минут в месяц.

Где транскрибация ломается на русском

Все заявленные проценты точности измерены на чистой начитке. Телефонный звонок — это 8 кГц, сжатие кодеком, громкая связь, склад на фоне и два человека, которые говорят одновременно. Ошибки идут не случайно, а в предсказуемых местах, и знать их надо заранее.

Диктофон, один говорящий≈ 4 % ошибокДвухканальная запись АТС≈ 9 %Моно-запись, перебивы≈ 17 %Мобильный, шум, склад25–30 %
Порядок ошибок в словах на одном и том же движке — качество записи решает больше, чем модель

Вывод: прежде чем сравнивать движки, надо посмотреть, что отдаёт телефония. Переход с моно на два канала обычно даёт больший прирост, чем смена модели с хорошей на лучшую, и стоит ноль.

Оценивать качество на слух по одному звонку бессмысленно. Нормальная приёмка: берём 30–50 записей, руками пишем эталонную расшифровку для десяти самых сложных и считаем ошибки именно на ваших терминах. Два-три часа работы вместо спора на словах.

Разбор смыслов: что вытаскивать из расшифровки

Дальше работает языковая модель, и главное — не просить у неё «проанализируй звонок»: получится сочинение, которое нельзя ни проверить, ни положить в поле. Просить надо конкретные значения из закрытого списка и цитату-подтверждение из расшифровки.

Что вытаскиваемКак формулируется задача моделиКуда попадает
Тема обращениявыбрать одну из 8–12 категорий, свои придумывать нельзяполе сделки, срез в отчёте
Названные товары и объёмысписок позиций с цитатой, где они прозвучаличерновик заявки, товары сделки
Возражение клиентакатегория из справочника + цитатааналитика причин отказа
Обещания менеджерачто и к какому сроку обещал, дословнозадача с дедлайном
Следующий шаг и датадата в ISO или «не договорились»задача в CRM, поле «следующий контакт»
Соблюдение скриптачек-лист из 5–8 пунктов, каждый — да/нет/не применимооценка звонка, дашборд качества
Красный флагупоминание конкурента, угроза уйти, жалоба на бракмгновенное уведомление руководителю

Чек-лист скрипта — то, за чем приходят чаще всего. Он работает на формальных пунктах: представился, назвал компанию, спросил про сроки, проговорил цену, зафиксировал следующий шаг. И не работает на «установил контакт» или «был доброжелателен» — там модель выдаёт стабильный, но бессмысленный ответ, и такие пункты лучше выкинуть, чем делать вид, что они измеряются.

Быстрее всего окупаются красные флаги: уведомление руководителю в Telegram сразу после звонка, где клиент сказал «тогда мы уйдём к другим», стоит копейки и спасает сделки. Из тех же разобранных звонков потом считаются дашборды для бизнеса.

Пока читаете — можно сразу проверить свою задачу. Опишите процесс, и я скажу, решается ли он и во сколько обойдётся.

Авто-заполнение CRM по итогам звонка

Самая ощутимая для менеджера часть: после разговора он не пишет комментарий, не ставит задачу и не двигает этап — остаётся проверить и поправить. Пятнадцать-двадцать минут в день, но важнее то, что заполнение перестаёт зависеть от настроения.

Телефония: запись + номер + направление звонкаРасшифровка: текст с разделением говорящихРазбор: структура полей + цитаты-подтвержденияЗапись в CRM: черновик комментария, поля, задачаКонтроль: лог, метка «заполнено роботом», ручная правка
Пять слоёв. Без нижнего систему через месяц отключают — никто не понимает, откуда взялись данные

Технически всё держится на двух связках. Первая — телефония отдаёт запись: у виртуальных АТС вроде Mango Office или UIS есть API и вебхук на завершение звонка, у amoCRM и Битрикс24 запись достаётся из карточки через REST. Вторая — обратная запись результата, то есть обычная интеграция с CRM: поля, права, идемпотентность.

Следом почти всегда просят то же для встреч и созвонов: протокол, решения, ответственные, сроки. Механика идентичная, только говорящих больше двух — и диаризация работает заметно хуже.

Робот-обзвон: почему его ненавидят и когда он всё же уместен

Скажу прямо: большинство запросов «сделайте нам голосового робота для обзвона» лучше не выполнять в том виде, в каком их формулируют. Робот, который холодно звонит по купленной базе и зачитывает предложение, приносит раздражение, жалобы и юридический риск, а не продажи.

Причины ненависти вполне конкретные, и все они — про неуважение ко времени человека, а не про качество синтеза речи:

К этому добавилась материальная правовая сторона. С 1 сентября 2025 года массовые звонки и рассылки допустимы только при предварительном согласии абонента, а само согласие на обработку персональных данных должно быть оформлено отдельным документом, а не пунктом в договоре (156-ФЗ от 24.06.2025). Штраф юрлицу за обработку без надлежащего согласия — 300–700 тыс. ₽, по массовым рекламным звонкам вилка доходит до миллиона. Плюс обсуждается обязанность операторов предупреждать абонента, что звонит робот, — маскировка перестанет работать даже технически.

БЕСИТ И ОПАСНОРАБОТАЕТХолодная база, согласия нетПродажа с первой секундыПеребить нельзя«Оператор» не работаетРобот прикидывается человекомЗвонит когда угодноСвои клиенты, согласие естьПодтверждение или напоминаниеПеребивание обрывает репликуЖивой человек по первой просьбе«Это автоматический звонок»Окно 10:00–20:00, будни
Разница не в технологии — в поводе для звонка и в праве человека прервать разговор

Уместных сценариев на самом деле немало, просто все они про звонки, которых человек ждёт, и своей базе, а не купленной:

Правило, которое я предлагаю клиентам: если поводом для звонка служит интерес компании, а не событие в жизни клиента — робота не делаем. Вместо него чат-бот или сообщение в мессенджер: человек ответит, когда ему удобно.

Сроки, цена и с чего начинать

Разработка считается по часам, час работы — от 2 500 ₽. Дальше зависит от того, сколько систем в связке и насколько дисциплинированно ведётся CRM.

  1. Проверка на ваших записях (1–2 дня, 10–20 тыс. ₽). 30–50 реальных звонков через два движка, подсчёт ошибок на ваших терминах, черновик разбора. Здесь видно, будет польза или качество записи всё убивает.
  2. Расшифровка потоком + отчёт (около недели). Выгрузка из телефонии, обработка, хранение, поиск по тексту, первая сводка. Уже на этом этапе руководитель ищет по словам вместо прослушивания.
  3. Разбор смыслов и запись в CRM (1–2 недели). Поля, правила, задачи, уведомления, метки источника. Это и есть ИИ-агент под один процесс — от 60–80 тыс. ₽.
  4. Голосовой робот, если он нужен. Сценарии, синтез, телефония, перебивание, передача человеку, согласия — самостоятельный проект, дешевле 100 тыс. ₽ нормально не собирается.

Дальше эксплуатация: расшифровка по 0,5–3 ₽ за минуту, разбор моделью — копейки за звонок, хранение и сопровождение от 15 000 ₽/мес. Последнее не формальность: телефония меняет формат вебхука, в CRM появляются новые поля, провайдер снимает модель с поддержки. Что именно ломается и сколько стоит починка — в статье про поддержку после внедрения.

С чего начинать: включить в телефонии двухканальную запись, проверить, что уведомление о записи звучит в начале звонка, и собрать месячный архив. Дальше есть на чём считать, а не гадать.

Частые вопросы

Сколько стоит транскрибация звонков в месяц?

Считается по минутам. Через зарубежное API — около 0,5 ₽ за минуту, готовые сервисы речевой аналитики берут от 1,5–3 ₽, Yandex SpeechKit — 10–30 ₽ в зависимости от модели. Своя копия Whisper на арендованном GPU-сервере обходится в фиксированные 15–30 тыс. ₽ в месяц и начинает выигрывать примерно с 10–15 тысяч минут потока.

Какая точность распознавания русской речи реально получается?

На чистом аудио Whisper large-v3 даёт 3–5 % ошибок в словах. На телефонной записи из АТС — обычно 8–12 %, на моно-записи с перебивами 15–20 %, на мобильном в шумном помещении 25–30 %. Заявленные вендорами «95 % и выше» относятся к чистой начитке, поэтому проверять надо на своих записях и своих терминах.

Можно ли обойтись без отправки записей в зарубежное облако?

Да. Whisper разворачивается на своём или арендованном в России сервере, и запись никуда не уходит; из российских облаков задачу закрывает Yandex SpeechKit по договору с оператором в РФ. Это дороже в разработке и в железе, но снимает вопросы по 152-ФЗ, которые в проектах с записями разговоров возникают всегда.

Нужна ли расшифровка в реальном времени?

Почти никогда. Realtime нужен для подсказки менеджеру во время разговора и для голосового робота, который обязан отвечать. Контроль качества, заполнение CRM и отчёты спокойно делаются пачкой ночью, а живая транскрипция стоит примерно втрое дороже пакетной — около $0,017 против $0,006 за минуту у OpenAI.

Законно ли записывать и расшифровывать разговоры с клиентами?

Записывать можно, если клиент уведомлён о записи в начале разговора и записи хранятся защищённо; продолжение разговора после уведомления считается согласием. С 1 сентября 2025 года согласие на обработку персональных данных должно оформляться отдельным документом, а не пунктом договора. Штраф для юрлица за обработку без надлежащего согласия — от 300 до 700 тыс. ₽, так что формулировки стоит согласовать с юристом до старта.

Робот-обзвон вообще имеет смысл?

Имеет — на своей базе и по поводу, который важен клиенту: подтверждение записи, напоминание о визите, оповещение о готовности заказа, опрос качества, массовое информирование о сбое. Холодный обзвон купленной базы делать не стоит: с 1 сентября 2025 года массовые звонки без предварительного согласия запрещены, штрафы доходят до миллиона рублей, а конверсия остаётся на уровне 1–2 % при большом объёме негатива.

транскрибация звонковрасшифровка звонков в текстречевая аналитика звонковавтозаполнение crm по звонкуголосовой робот обзвона

Читайте дальше

Прогнать ваши записи

Пришлите 30–50 реальных звонков — покажу качество расшифровки на ваших терминах, черновик разбора и цену обработки потока в месяц.

Обсудить задачу