Почему 90% холодных рассылок в B2B улетают в спам
11 сентября 2026 г.
TL;DR: Кратко:Whisper, Yandex SpeechKit и Tinkoff VoiceKit про свойства и интеграцию с CRM. Какой сервис распознавания речи выбрать под звонки и встречи.
Whisper, Yandex SpeechKit и Tinkoff VoiceKit переводят записи разговоров в текст и дают разный результат на разных аудио.
Выбрать через какой инструмент сделать расшифровку аудио можно по четырем критериям. Качество исходной записи, требования 152-ФЗ, бюджет и то, куда расшифровка попадает дальше. Whisper подходит там, где нужна точность на записях встреч и есть свои серверы. Yandex SpeechKit распознает речь в момент разговора с хранением данных в России, Tinkoff VoiceKit рассчитан на телефонию и звонки колл-центра.
Если вы собственник бизнеса, руководитель отдела продаж, маркетолог и выбираете технологию расшифровки звонков и встреч, то эта статья для вас.
Во Флайск часто приходят с такой ситуацией - в отделе продаж накапливаются сотни звонков в месяц, а руководитель не успевает всё прослушать. Остальные разговоры не проверяются, и сделать вывод по качеству работы менеджеров трудно.
Часто происходит так:
Менеджер не успевает заполнить карточку после звонка, в CRM остаётся пустое поле.
Руководитель слушает выборочные записи, остальные разговоры не проверяются.
После встречи протокол не пишется, договорённости теряются между письмами.
Юрист запрашивает, где хранятся записи разговоров с клиентами.
Задача во всех четырёх случаях одна, превратить аудио в текст, который дальше читают, ищут и оценивают. Разница между Whisper, SpeechKit и VoiceKit в том, на каком сервисе выходит меньше ошибок и где физически лежат данные.
Whisper относится к открытым моделям распознавания речи, выпустила её компания OpenAI. Модель обучали на многоязычном материале из интернета, поэтому она рассчитана на разговорную речь в разных условиях записи.
Компания разворачивает модель на своих серверах или подключается к платному облачному сервису OpenAI. Открытая лицензия MIT разрешает коммерческое использование, поэтому за саму модель компания не платит, расходы появляются на стороне инфраструктуры и поддержки.
Сильная сторона
Высокая точность на разговорной речи и на записях встреч. Русский язык поддерживается без отдельной донастройки, вместе с ним ещё около сотни языков.
Ограничение
Собственный запуск требует сервера с видеокартой, инженера на поддержку и своей ответственности за защиту данных. Отдельный вопрос возникает при работе через зарубежный облачный сервис, запись уходит за пределы России. Здесь нужно изучать требования 152-ФЗ и мы их разобрали в отдельном разделе.
Когда выбирать
Ваши записи встреч и переговоров в хорошем качестве. Есть данные, которые нельзя отдавать в облако.
Vosk относится к открытым моделям распознавания речи и обычно попадает в сравнение вместе с Whisper.
Whisper точнее работает на живой разговорной речи и поддерживает заметно больше языков. Vosk легче по требованиям к оборудованию, запускается на любом устройстве и работает без видеокарты.
Vosk можно использовать там, где распознавание нужно прямо на устройстве или на сервере без видеокарты. Обе модели работают без выхода в интернет, поэтому записи не покидают серверы компании.
Yandex SpeechKit распознаёт и синтезирует речь в облаке Яндекса, данные обрабатываются на серверах в России. Сервис развивали на основе голосовых продуктов Яндекса под поток обращений, поэтому в нём есть и распознавание готовых записей, и распознавание речи в момент разговора.
Подключение открывается по ключу доступа, своя инфраструктура компании не нужна. Компания платит за минуты распознавания и начинает работу сразу после получения ключа.
Сильная сторона
Распознавание в момент разговора, работа с длинными записями, донастройка под отраслевую лексику словарём терминов. Оплата идёт за минуты распознавания.
Ограничение
Счёт растёт вместе с объёмом. На телефонных записях низкого качества точность падает. Часть возможностей сервиса относится к синтезу речи и к расшифровке звонков отношения не имеет, поэтому при сравнении тарифов важно смотреть именно на распознавание.
Когда выбирать
Нужен быстрый старт без своих серверов, важно хранение данных в России, объём звонков предсказуемый.
Tinkoff VoiceKit распознаёт и синтезирует речь в облаке Т-Банка. Сервис создавали под задачи банковского колл-центра, где основной материал составляют телефонные линии со сжатием звука, поэтому модель настроена на телефонные разговоры.
После ребрендинга банка сервис встречается под обоими названиями, в документации и статьях старое сохранилось. Данные обрабатываются на серверах в России, доступ открывается по договору.
Сильная сторона
Модель настроена на телефонные записи, поэтому на звонках с шумом, сжатием и перебиваниями точность держится лучше. Разделение по спикерам и распознавание в момент разговора рассчитаны на сценарии колл-центра.
Ограничение
Фокус на телефонии. Тарифы и условия обработки уточняются в договоре.
Когда выбирать
Основной поток составляют телефонные звонки, важна точность на плохом качестве связи и разделение реплик менеджера и клиента.
Если не знаете что выбрать, то посмотрите на качество исходной записи, место хранения данных, модель оплаты, что нужно на входе для запуска и куда попадает готовая расшифровка.
Критерий | Whisper | Yandex SpeechKit | Tinkoff VoiceKit |
|---|---|---|---|
Где обрабатываются данные | свои серверы или зарубежный облачный сервис | серверы в России | серверы в России |
Точность на записи встречи | высокая | высокая | средняя |
Точность на телефонном звонке | средняя | средняя | высокая |
Диаризация | настраивается отдельно | есть | есть |
Модель оплаты | инфраструктура и поддержка | за минуту | за минуту |
Что нужно на входе | сервер с видеокартой и инженер | ключ доступа | договор и ключ доступа |
Донастройка под лексику | дообучение или словарь | словарь терминов | словарь терминов |
Кому что подходит:
Whisper: компаниям с инженером в штате и требованием держать записи на своих серверах.
Yandex SpeechKit: тем, кому нужен быстрый запуск и российские серверы без своей инфраструктуры.
Tinkoff VoiceKit: колл-центрам и отделам продаж, где весь поток идёт через телефонию.
Точность в первую очередь определяет качество исходной записи. Одна и та же модель на записи из переговорной и на телефонном звонке даёт разный результат.
На чистой записи встречи распознавание идёт лучше, на телефонном звонке со сжатой линией точность заметно ниже.
Точность снижают четыре фактора:
Телефонная линия со сжатием звука.
Двое говорят одновременно.
Отраслевые термины, названия товаров и фамилии.
Запись одним каналом без разделения на спикеров.
Точность поднимают три вещи:
Словарь терминов компании, куда добавляют названия продуктов, тарифов и типовые возражения.
Запись по отдельным каналам, тогда диаризация срабатывает точнее.
Нормализация текста после распознавания, когда числа, даты и суммы приводятся к единому виду.
Компания, которая настроила запись по каналам и загрузила свою лексику, получит результат лучше, чем компания с записью в один канал через сжатую линию.
Проверить точность на своих данных можно. Возьмите 10 своих записей, включая самые плохие по качеству связи. Прогоните их через две системы. По пяти минутам каждой записи посчитайте ошибки вручную.
Дальше уже решайте по результатам, выбирайте по цене и месту хранения данных.
Запись разговора с клиентом содержит персональные данные, голос, имя, номер телефона, иногда адрес и реквизиты договора. Поэтому компания выбирает, на чьих серверах эти данные окажутся и по каким условиям их будут обрабатывать.
Закон 152-ФЗ требует хранить персональные данные граждан России на серверах внутри страны и ограничивать доступ к ним кругом сотрудников, которым это нужно по работе. Для компании, которая расшифровывает звонки, это означает три вещи. Прямые идентификаторы клиента нужно скрыть от нейросети до того, как она проанализирует текст. Если сервис распознавания работает через зарубежный облачный сервис, для передачи записи за рубеж нужна отдельная процедура. За утечку записи в итоге отвечает компания, которая её собрала.
Отдельно собрали всё по 152-ФЗ и ИИ в бизнесе в статье.
Прямые идентификаторы вы маскируете в расшифровке до того, как текст уйдёт в нейросеть на анализ. Под маскирование попадают ФИО, номер телефона, номер договора, адрес доставки.
Обезличивание засчитывается тогда, когда по самой расшифровке определить конкретного человека нельзя, а связка с реальным контактом хранится отдельно. Замена части цифр в телефоне этому условию не отвечает, потому что остаток вместе с датой звонка выводит на конкретного человека.
В расшифровке звонка остаётся содержание разговора, возражения клиента, договорённости и суммы. Вместо имени и телефона подставляются метки, а связка метки с реальным контактом хранится в CRM на стороне компании. В карточку сделки возвращается текст, по которому руководитель понимает суть разговора без доступа к персональным данным клиента.
При работе через зарубежный облачный сервис запись уходит за пределы России. Закон требует, чтобы база с персональными данными граждан России находилась на территории страны, а передача данных за рубеж шла по отдельной процедуре с уведомлением регулятора.
Закрыть требование можно тремя способами.
Способ | Где хранятся данные | Когда подходит |
|---|---|---|
Whisper на своих серверах | на серверах компании | чувствительные данные, большой объём часов, есть инженер |
Yandex SpeechKit или Tinkoff VoiceKit | серверы в России | быстрый старт без своей инфраструктуры |
Зарубежный облачный сервис распознавания | за пределами России | обезличенные записи без персональных данных |
Факт российских серверов сам по себе вопрос не закрывает. Пропишите в договоре с поставщиком состав обрабатываемых данных, срок хранения записей и порядок их удаления. Отдельно проверьте, использует ли поставщик ваши записи для обучения своих моделей, такой пункт встречается в пользовательских соглашениях облачных сервисов.
Ответственность несёт компания, которая собирает записи. Сервис распознавания выступает обработчиком по поручению, и передача ему данных не снимает обязанностей с оператора.
С 2025 года действуют ужесточённые санкции за утечку персональных данных, включая оборотные штрафы, которые считают от годовой выручки при повторном нарушении.
У облачных сервисов цена растёт вместе с объёмом минут, у собственного сервера складывается в постоянную сумму, которая не зависит от того, сколько звонков вы обработали.
Небольшой поток дешевле отдать в облако. На большом объёме лучше и выгоднее собственный запуск.
Три модели оплаты, между которыми выбирает бизнес.
Whisper на своих серверах: платят за сервер с видеокартой, электричество и время инженера. Стоимость минуты падает с ростом объёма, но появляется постоянная статья расходов на поддержку.
Облачный сервис, SpeechKit или VoiceKit: платят за минуту распознавания. Расход растёт вместе с объёмом звонков, своей инфраструктуры нет.
Готовый виджет для CRM: платят за минуты, при этом распознавание, разделение по спикерам и запись результата в карточку сделки входят в одну услугу.
Сравнивать только цену за минуту недостаточно. Сравнивайте стоимость интеграции, поддержку после запуска и время на настройку словаря терминов. Первые недели важно прогнать словарь под лексику компании, и это время тоже стоит денег.
Например, FlySense AI, виджет для amoCRM, забирает записи звонков из подключённой телефонии и обрабатывает их без участия менеджера.
Что делает с каждым звонком:
собирает саммари: договорённости и следующий шаг, сразу в карточку сделки
расшифровывает разговор целиком, с разбивкой по спикерам и таймкодами
определяет настроение клиента по ходу разговора: позитив, негатив, нейтрально
проставляет теги: тема обращения, упомянутые продукты, возражения
синхронизирует текст с аудио: строка подсвечивается по ходу воспроизведения, клик по строке перематывает запись на нужное место
Телефония, которая поддерживается: Sipuni, UIS, OnlinePBX, МТС B2B, МегаФон, Билайн, Манго Телеком, Novofon, SIPNET.
Языки: 15+, с автоопределением. Русский, английский, испанский, немецкий, финский, французский, иврит, итальянский, казахский, нидерландский, польский, португальский (включая бразильский), шведский, турецкий, узбекский (латиница).
По скорости: 7-минутный звонок расшифровывается за 39 секунд. Оплата 2,5 ₽ за минуту записи, баланс не сгорает.
Если вы получите расшифровку, это ещё не значит, что её будет удобно читать, обрабатывать и использовать в работе. Обычно сама расшифровка лежит там же, где лежала запись, и читают её так же редко. Удобнее, когда текст попадает в карточку сделки и по нему строится оценка разговора.
Для amoCRM это готовое решение, виджет FlySense AI, описанный выше. Он записывает расшифровку, саммари и тональность в карточку сделки сам, без действий менеджера. Что это меняет в работе:
Руководитель читает расшифровку вместо прослушивания записи, на разбор одного разговора уходит меньше времени.
Поиск по тексту поднимает разговоры, где звучало конкретное возражение, название конкурента или обещание скидки.
Карточка сделки заполняется без ручного ввода, данные по звонку появляются в CRM сразу после разговора.
Ниши, где такой сценарий востребован:
фитнес-сети: контроль качества звонков на входящих заявках. Во Флайск такой пилот внедрили в сеть фитнес-клубов YoBody, каждый звонок оценивается по чек-листу, соответствие скрипту, тональность, время реакции, топ нарушений, проблемные диалоги автоматически уходят руководителю клуба
ниши с быстрым решением, например мебель, окна, ремонт: большой поток коротких звонков, при котором выборочный контроль не показывает картину
B2B-продажи: длинные разговоры, где на первом месте договорённости и следующие шаги
Виджет работает только внутри amoCRM. Для других CRM и для встреч нужен отдельный контур.
Для CRM без готового виджета Флайск собирает контур транскрибации под ваши процессы, отдельную сборку из движка распознавания, маскирования данных и выгрузки результата. Движок подбирают под тип записей, расшифровка уходит в ту систему, где с ней работают.
Встречи и видеоконференции идут отдельным сценарием. Для расшифровки встреч во Флайск применяется Контур.Толк, дальше из текста собирается протокол с договорённостями и задачами.
Схема работы для звонков и встреч одинаковая:
Запись попадает в обработку из телефонии или из сервиса видеовстреч.
Движок распознавания переводит её в текст с разделением по спикерам.
Персональные данные маскируются перед анализом.
Нейросеть собирает выжимку разговора и оценку по заданным критериям.
Результат уходит в карточку CRM или в протокол встречи.
Различаются источник записи и набор критериев оценки. Для звонков берут чек-лист качества и работу с возражениями, для встреч, договорённости, сроки и ответственных.
Пока руководитель успевает разбирать поток вручную или задача не повторяется постоянно, отдельный сервис для распознавания речи не нужен. Вот четыре ситуации, в которых внедрение не окупится:
Звонков меньше сотни в месяц, руководитель успевает слушать записи выборочно и картину по отделу видит.
Задача разовая, например разобрать десяток интервью для исследования. Хватает бесплатного онлайн-сервиса.
Телефония и CRM уже дают встроенную расшифровку, качества которой достаточно для чтения и поиска.
Записи не ведутся или качество линии такое, что распознавание даёт текст с ошибками в каждом втором предложении. Сначала настраивается запись, потом распознавание.
Нужно полноценное использование сервисов, если расшифровку читают регулярно и на её основе принимают решения по людям, скриптам и сделкам.
Под записи встреч и переговоров берут Whisper или Yandex SpeechKit, под телефонный поток Tinkoff VoiceKit. Универсального фаворита нет, движок подбирают под тот материал, которого в компании больше. На практике на результат сильнее влияет качество самой записи и загруженный словарь терминов компании.
Модель распространяется по открытой лицензии MIT, которая разрешает коммерческое использование без лицензионных платежей. Расходы появляются на стороне инфраструктуры, компания оплачивает сервер с видеокартой и часть времени инженера на запуск и последующую поддержку. За защиту записей при таком варианте отвечает сама компания.
Оба сервиса обрабатывают данные на серверах в России, это закрывает требование о локализации. Состав обрабатываемых данных и сроки хранения фиксируются в договоре с поставщиком, поэтому его условия проверяют отдельно.
Чаще выбирают Tinkoff VoiceKit, он рассчитан на телефонию и колл-центры. У Whisper и SpeechKit точность на телефонных записях ниже, чем на записи из переговорной. Разрыв проверяют на своей выборке записей.
Облачные сервисы берут плату за минуту распознавания, собственный запуск Whisper стоит как сервер с видеокартой плюс время инженера на поддержку. На небольшом потоке облако обходится дешевле, свой сервер оправдывает себя на большом объёме часов или там, где записи нельзя выносить за пределы компании. Точку равенства считают по своему объёму минут.
Если поток составляют телефонные звонки и данные можно обрабатывать в российском облаке, отдельная интеграция движка не нужна, задачу закрывает готовый виджет с транскрибацией и записью результата в карточку сделки. Если в компании преобладают встречи или записи нельзя выносить со своих серверов, движок выбирают отдельно.
Whisper берут под записи встреч и под требование держать данные на своих серверах. Yandex SpeechKit подходит для быстрого старта на российских серверах без своей инфраструктуры. Tinkoff VoiceKit точнее остальных на телефонном потоке с плохим качеством связи.
Сервис выбирают под тип записей и под требования к данным. При этом качество записи и словарь терминов компании влияют на результат сильнее, чем правильно выбранная модель.
Расшифровка будет полезна тогда, когда попадает в карточку сделки и по ней принимают решения. Файл с текстом, который лежит отдельно от CRM, работу отдела продаж не упрощает.
Виджет для amoCRM
Все расшифровки в одном месте. В карточку сделки уходит расшифровка с таймкодами, саммари с договорённостями, тональность и теги.
Ещё материалы из раздела «Статьи»