Voicebox: локальная ИИ-студия для клонирования и синтеза голоса

Разработчик Джейми Пайн выпустил Voicebox — открытую десктопную ИИ-студию для работы с голосовым вводом и выводом. Платформа объединяет функции клонирования голоса по короткому аудиофрагменту, синтеза речи и глобальной диктовки текста, работая полностью локально на устройстве пользователя. Архитектура включает собственную языковую модель для постобработки текста и формирования персонажей, что исключает необходимость передачи данных на внешние серверы.
Система предоставляет доступ к семи движкам синтеза речи, среди которых Qwen3-TTS, Kokoro и HumeAI TADA, охватывающих 23 языка. Выбор движка определяет специфику генерации: например, модель Chatterbox Turbo способна интерпретировать паралингвистические теги вида [laugh] или [sigh], интегрируя неречевые звуки непосредственно в аудиопоток. Ограничения на длину исходного текста обходятся за счет автоматического разбиения на фрагменты с последующим наложением кроссфейда, что позволяет непрерывно озвучивать длинные статьи или главы аудиокниг.
Помимо базового синтеза, в приложение встроен многодорожечный редактор для сведения диалогов и система постобработки с эффектами реверберации, компрессии и изменения тона. Наличие встроенного сервера MCP и REST API позволяет интегрировать созданные профили в сторонние инструменты разработки, в результате чего ИИ-агенты вроде Claude Code или Cursor могут транслировать ответы синтезированным голосом. Клиент написан на Rust с использованием фреймворка Tauri и задействует аппаратное ускорение вычислений через Metal на macOS и CUDA на Windows.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад