Облачный сервис для обработки контента

Консорциум 3i Technologies разработал облачный сервис для профессиональной обработки речевых данных из медийного контента – 3i Speech Recognition API.

Он позволяет с точностью более 90% переводить теле- и радио-эфиры и медиа-архивы ТВ-каналов и радиостанций в текстовый формат.

Сервис работает с аудио и видео любой длительности и обрабатывает загруженные в облако файлы в несколько раз быстрее реального времени звучания, выдавая на выходе «стройный» текст, разбитый на предложения с расставленными знаками препинания. Бета-версия 3i Speech Recognition API открыта для публичного тестирования.

«Это специализированный сервис, ориентированный на обработку именно телевизионного или радио-контента. Мы разработали уникальные модели, которые позволили добиться очень высокой точности распознавания. Надеемся, что он будет полезен профессионалам, которые работают с медиа-контентом. В дальнейшем он может стать частью высокотехнологичных решений для массового потребителя, например, основой для перевода иностранных каналов и субтитрирования в режиме реального времени. Все технологии для создания такого продукта у компаний, входящих в консорциум, уже есть», — говорит председатель совета директоров консорциума 3i Technologies Алексей Любимов.

В сервисе используются языковые и акустические модели, построенные с применением машинного обучения, технологий рекуррентных нейронных сетей (Recurrent Neural Network, RNN) и взвешенных конечных автоматов (Weighted Finite State Transducer, WFST). Вычислительная инфраструктура реализована с ускорением на GPU, что позволяет получать многократный прирост производительности относительно CPU.

Языковые модели для повышения качества распознавания могут быть адаптированы под узкую предметную область. Например, для перевода в текст «экономических» или «отраслевых» передач, в которых спикеры используют профессиональную лексику.

Бета-версия 3i Speech Recognition поддерживает русский и английский языки. Новинка  будет полезна для  разработчиков программного обеспечения, системных интеграторов, специалистов в области создания и обработки медиаконтента (телерадиовещательные компании, продакшн-студии, креативные агентства, фрилансеры и т.д.). Она  быстро и легко интегрируется в приложения и комплексные решения сторонних разработчиков.

Консорциум 3i Technologies учрежден в 2014 году компаниями DSS Lab и InfoQubes, в 2016 к нему присоединилась компания PROMT. Консорциум объединяет российские научные и инженерные коллективы, специализирующиеся на разработке технологий, продуктов и сервисов интеллектуальной обработки больших массивов данных различной природы. Консорциум  обладает уникальными технологиями поиска, обработки и анализа текстовой, аудио- и видеоинформации, которые защищены патентами и авторскими свидетельствами. Компании, входящие в консорциум, предлагают широкий спектр программной продукции: от мобильных приложений до комплексных прикладных ИТ-решений и программных библиотек для сторонних разработчиков.

 

Похожие записи