Сервіс розшифрування аудіо в текст (speech-to-text) з API

Роботодавець
Dmytro
Параметри проєкту
Варіант співпраціОдноразовий проєкт
РозділРозробка програм
Передоплатабез передоплат
Способи оплатиГотівка, Банківський переказ
Прийом заявоквід сьогодні, 21:46 до 30.08.2026
Опис проєкту
Наша компанія щотижня обробляє великий обсяг аудіозаписів — дзвінки служби підтримки, віддалені співбесіди та внутрішні наради команди — і нам потрібен надійний сервіс автоматичного розшифрування мовлення в текст. Основне завдання — приймати аудіофайли у поширених форматах і перетворювати їх на точний, зручний для читання текст. У кожному розшифруванні має бути чітко видно, хто і що говорив: репліки потрібно розмічати за окремими спікерами, а кожен фрагмент супроводжувати точними таймкодами, щоб будь-який рядок можна було зіставити з конкретним моментом вихідного запису. Система зобов'язана працювати як з російським, так і з англійським аудіо, зокрема зі змішаними записами, де учасники перемикаються між мовами в межах однієї розмови.
Окрім точності розпізнавання, для нас важливо, як сервіс вбудується в наш робочий процес. Рушій розшифрування має бути доступним через зрозумілий і задокументований API, щоб наші внутрішні застосунки могли надсилати аудіо, запитувати статус обробки та отримувати готові розшифрування програмно, без ручних дій. Ми розраховуємо на коректну обробку довгих записів, фонового шуму та мовлення, що перекривається, а також на структурований вивід, який можна зберігати й шукати. Ідеальний підрядник реалізує бекенд на Python, підключить перевірену модель розпізнавання і здасть рішення, що стабільно працює під щоденним навантаженням, а не разовий скрипт. Будь ласка, додайте приклади подібних проєктів із розшифрування чи обробки аудіо та опишіть, як ви підійдете до розділення спікерів і налаштування точності для нашої мовної пари.
— Ендпоінти API для завантаження аудіо та отримання розшифрувань
— Розмітка спікерів (діаризація) і таймкоди на рівні слів або сегментів
— Підтримка російської, англійської та змішаних за мовою записів
— Бекенд на Python із задокументованим і тестованим розгортанням
Окрім точності розпізнавання, для нас важливо, як сервіс вбудується в наш робочий процес. Рушій розшифрування має бути доступним через зрозумілий і задокументований API, щоб наші внутрішні застосунки могли надсилати аудіо, запитувати статус обробки та отримувати готові розшифрування програмно, без ручних дій. Ми розраховуємо на коректну обробку довгих записів, фонового шуму та мовлення, що перекривається, а також на структурований вивід, який можна зберігати й шукати. Ідеальний підрядник реалізує бекенд на Python, підключить перевірену модель розпізнавання і здасть рішення, що стабільно працює під щоденним навантаженням, а не разовий скрипт. Будь ласка, додайте приклади подібних проєктів із розшифрування чи обробки аудіо та опишіть, як ви підійдете до розділення спікерів і налаштування точності для нашої мовної пари.
— Ендпоінти API для завантаження аудіо та отримання розшифрувань
— Розмітка спікерів (діаризація) і таймкоди на рівні слів або сегментів
— Підтримка російської, англійської та змішаних за мовою записів
— Бекенд на Python із задокументованим і тестованим розгортанням