Гайд по использованию SLON6 CC для качественного синтеза речи
SLON6 CC, нейросетевой синтезатор речи на базе трансформеров, запущенный в октябре 2023 года. Поддерживает 15 языков, 12 русскоязычных акцентов, 3 диалекта и 98% естественности речи по тестам на понятность. С оценкой MOS 4.7 по шкале 5-балльной, с поддержкой 12 уровней интонации и 300+ вариантов пауз. Подходит для подкастов, озвучки медицинских текстов с точностью 98%, чат-ботов, видео- и сценарного контента.
Что понадобится
- Система с GPU, поддерживающим CUDA (рекомендуется RTX 3060 или выше)
- 8 ГБ ОЗУ и более (минимум 16 ГБ для стабильной работы)
- ПО для запуска SLON6 CC (официальный пакет от «Слово и Голос»)
- Исходный текст в формате .txt или .srt с тегами для пауз и интонаций
- Файлы для обработки: .wav (24-бит, 48 кГц) для максимальной детализации
Пошаговая настройка
- Убедитесь, что в системе установлены драйверы CUDA и поддержка GPU. Проверьте через
nvcc --versionилиnvidia-smi. - Скачайте версию SLON6 CC 1.3. В ней включена улучшенная обработка пауз и дыхательных интонаций. Синтез с 1.3 на 17% точнее по интонации, чем в SLON5.
- Загрузите текст в .txt-файл. Добавьте теги:
[pause:500]для пауз,[breath]для дыхания. Это снижает шум в финальном аудио. - Настройте параметры:
sample_rate=48000,bit_depth=16(выходное аудио). Если нужна максимальная детализация, используйтеbit_depth=24при экспорте. - Установите
pitch_shift=0.0. Неправильная настройка приводит к «высокому» или «навязчивому» голосу. Проверьте на примере фразы: «Сегодня погода отличная». - Запустите синтез. Скорость, до 180 слов в минуту при сохранении естественности. При превышении, качество начинает деградировать.
- При необходимости, используйте внешние скрипты для многоголосового синтеза. SLON6 CC не поддерживает его встроенно.
- Проверьте результат: аудио должно быть чистым, без «пляски» интонации. При искажениях, уменьшите
tempo_scaleдо 1.0. Динамическое изменение темпа без предварительной настройки не сохраняет качество.
Частые ошибки и советы
- Ошибка: Использование .wav с 16-битной глубиной в финальном выводе. Решение: Используйте 24-бит для редактирования. 16-бит, только для финального экспорта.
- Ошибка: Попытка изменить темп в реальном времени. Решение: Настраивайте темп заранее. Включение динамического изменения приводит к резким сбоям в интонации.
- Ошибка: Запуск на CPU. Решение: Обязательно используйте GPU. На CPU скорость падает до 30–40 слов в минуту.
- Совет: Если нужен голос с акцентом, выбирайте из 12 поддерживаемых. Например, «московский», «сибирский», «южный».
Чек-лист перед запуском
- GPU поддерживает CUDA
- ОЗУ, минимум 8 ГБ (16 ГБ, оптимально)
- Используется SLON6 CC 1.3
- Текст с тегами пауз и дыхания
- Выходной формат, .wav, 24-бит, 48 кГц
- pitch_shift = 0.0
- tempo_scale = 1.0 (если нет предварительной настройки)
Вопросы и ответы
- Можно ли использовать SLON6 CC в прямом эфире? Да, при наличии достаточного железа. Скорость синтеза, до 180 слов/мин. Подходит для живого сопровождения.
- Поддерживает ли SLON6 CC 3D-эффекты голоса? Нет. Только двумерная стерео-передача. Для 3D-эффектов требуется внешняя обработка через библиотеки вроде WebAudio API.
- Как проверить, что голос звучит естественно? Сравните с аудио от живого озвучивателя. Используйте тестовые фразы: «Вот это да, просто впечатляет», проверьте интонацию на концах фраз.
- Какова точность восприятия речи SLON6 CC? По тестам на слуховых испытаниях, 94% понятности при 100% естественности по оценке экспертов.
- Где можно использовать SLON6 CC? В чат-ботах, подкастах, озвучке видео, сценарных проектах и цифровых помощниках.
- Поддерживает ли SLON6 CC русский язык? Да, с 12 голосами, включая мужской, женский и детский.