Сервис расшифровки аудио в текст (speech-to-text) с API

Заказчик
Dmytro
Параметры проекта
Вариант сотрудничестваОдноразовый проект
РазделРазработка программ
Предоплатабез предоплат
Способы оплатыНаличные, Банковский перевод
Приём заявокот сегодня, 21:46 до 2026-08-30
Описание проекта
Наша компания еженедельно обрабатывает большой объём аудиозаписей — звонки службы поддержки, удалённые собеседования и внутренние совещания команды — и нам нужен надёжный сервис автоматической расшифровки речи в текст. Основная задача — принимать аудиофайлы в распространённых форматах и превращать их в точный, удобочитаемый текст. В каждой расшифровке должно быть чётко видно, кто и что говорил: реплики нужно размечать по отдельным спикерам, а каждый фрагмент снабжать точными таймкодами, чтобы любую строку можно было сопоставить с конкретным моментом исходной записи. Система обязана работать как с русским, так и с английским аудио, включая смешанные записи, где участники переключаются между языками в рамках одного разговора.
Помимо точности распознавания, для нас важно, как сервис встроится в наш рабочий процесс. Движок расшифровки должен быть доступен через понятный и задокументированный API, чтобы наши внутренние приложения могли отправлять аудио, запрашивать статус обработки и получать готовые расшифровки программно, без ручных действий. Мы рассчитываем на корректную обработку длинных записей, фонового шума и перекрывающейся речи, а также на структурированный вывод, который можно хранить и искать. Идеальный подрядчик реализует бэкенд на Python, подключит проверенную модель распознавания и сдаст решение, стабильно работающее под ежедневной нагрузкой, а не разовый скрипт. Пожалуйста, приложите примеры похожих проектов по расшифровке или обработке аудио и опишите, как вы подойдёте к разделению спикеров и настройке точности для нашей языковой пары.
— Эндпоинты API для загрузки аудио и получения расшифровок
— Разметка спикеров (диаризация) и таймкоды на уровне слов или сегментов
— Поддержка русского, английского и смешанных по языку записей
— Бэкенд на Python с задокументированным и тестируемым развёртыванием
Помимо точности распознавания, для нас важно, как сервис встроится в наш рабочий процесс. Движок расшифровки должен быть доступен через понятный и задокументированный API, чтобы наши внутренние приложения могли отправлять аудио, запрашивать статус обработки и получать готовые расшифровки программно, без ручных действий. Мы рассчитываем на корректную обработку длинных записей, фонового шума и перекрывающейся речи, а также на структурированный вывод, который можно хранить и искать. Идеальный подрядчик реализует бэкенд на Python, подключит проверенную модель распознавания и сдаст решение, стабильно работающее под ежедневной нагрузкой, а не разовый скрипт. Пожалуйста, приложите примеры похожих проектов по расшифровке или обработке аудио и опишите, как вы подойдёте к разделению спикеров и настройке точности для нашей языковой пары.
— Эндпоинты API для загрузки аудио и получения расшифровок
— Разметка спикеров (диаризация) и таймкоды на уровне слов или сегментов
— Поддержка русского, английского и смешанных по языку записей
— Бэкенд на Python с задокументированным и тестируемым развёртыванием