Miso Labs представила MisoTTS — модель синтеза речи с открытыми весами объемом 8 миллиардов параметров. По данным компании, модель использует технологию остаточного векторного квантования (RVQ) для расширения диапазона звучания без увеличения количества параметров.
Архитектура MisoTTS состоит из основного компонента объемом 7,7 миллиарда параметров и декодера глубины на 300 миллионов параметров. Модель обучена учитывать как текстовый ввод, так и контекст аудио, что позволяет ей адаптироваться к тону голоса говорящего.
По информации разработчика, открытый доступ к весам модели позволяет исследователям и разработчикам использовать MisoTTS в собственных проектах. Компания позиционирует решение как инструмент для создания эмоционально окрашенного синтеза речи.
Использование остаточного векторного квантования позволило разработчикам достичь большего разнообразия звучания при сохранении эффективности модели. Технология предполагает, что специалисты могут адаптировать модель под конкретные требования приложений.
Источник: Marktechpost
Реклама: 🔥 Хочешь получить Telegram Premium и стать гуру Polymarket? Кликай сюда!
