Компания Meta представила Muse Voice Transcribe — свою первую модель реального времени для распознавания голоса, которая существенно улучшает возможности диктовки на Mac. Теперь пользователи смогут наслаждаться мульти-язычной транскрипцией в режиме реального времени прямо на своих устройствах.
Muse Voice Transcribe использует потоковое автоматическое распознавание речи и разделение голосов, что позволяет модели распознавать речь и одновременно отделять разных говорящих в записях, поддерживая более 20 голосов. Инновационная система определяет, когда кто-то закончил говорить, что делает процесс диктовки еще более комфортным и эффективным.
Модель была обучена на более чем 70 языках, из которых 25 были валидированы к моменту запуска. Она способна обрабатывать аудиофайлы длиной более часа и поддерживает переключение языков внутри и между предложениями, что значительно повышает точность распознавания.
Клиенты могут воспользоваться услугой Muse Voice Transcribe через Meta Model API по тарифу $3 за 1000 аудиоминут, что соответствует $0.18 за час. Она также уже используется для диктовки в приложениях Meta AI для Mac и Muse Code, где пользователи могут удерживать клавишу Fn, чтобы вводить текст в любые приложения.
Система Muse Voice Transcribe занимает первое место в рейтинге технологий распознавания голоса в режиме реального времени по состоянию на 1 сентября. Именно это делает новинку важным шагом вперёд для всех, кто активно использует голосовые команды в своей работе.
Meta продолжает расширять возможности своих AI-продуктов, а Muse Voice Transcribe — это лишь начало. Повысьте свою продуктивность с помощью этой потрясающей технологии!
Фото обложки: Soundtrap / Unsplash

