risha
6 червня 2026, 17:14
Нова open-sourse SOTA tts від Miso Labs, маленька, спритна, якісна, спрямована на генерацію розмовної мови MisoTTS 8B
Клонує будь-який голос за 10-секундним аудіосемплом, голос агента залишається ідентичним оригіналу всю розмову
Відповідає місо за 110мс, можна сказати ріалтайм
На бекбоні у неї flama-8B (Llama 3.2‑style) та аудіо декодер flama-300M, головний мінус що мова тільки англійська
Спробувати – демоспейс
HuggingFace
Github
Сайт — тут можна потестувати прямо на головній сторінці
smaller consumer GPUs (4 – 16 GB) are not sufficient for the full model.😒
«головний мінус що мова тільки англійська»
думаю це плюс бо я вже бачу схемки розводняків, які загалом навіть уже існують але з цим стануть в рази простіше реалізуємими…