1. Сначала перепишите текст под слух
Текст, который нормально читается глазами, часто плохо звучит голосом: длинные фразы, сложные обороты, три смысла в одном предложении. Перед генерацией разбейте материал на короткие фразы и оставьте один смысл на один голосовой блок.
- Предложение 6-12 слов обычно звучит лучше длинного абзаца.
- Уберите канцелярит: “осуществляем”, “реализуем”, “в рамках”.
- Сначала назовите пользу, потом детали.
- CTA в конце пишите спокойно, без рекламного крика.
2. Задайте роль голоса, а не просто “красиво”
Модель лучше работает, когда понимает, кто говорит: эксперт, основатель, диктор, ведущий подкаста, наставник или рекламный voiceover. Роль сразу меняет темп, паузы и интонацию.
- Эксперт: спокойно, уверенно, с ясными паузами.
- Реклама: живее, но без крика.
- Инструкция: медленнее, с паузами после шагов.
- Аватар: личное обращение, естественная речь, мягкий финал.
3. Используйте audio tags точечно
Audio tags помогают подсказать эмоцию и паузу, но их легко переборщить. Лучше 2-3 подсказки на абзац, чем разметка каждого слова.
- [calmly] — спокойная подача.
- [short pause] — короткая пауза после важной мысли.
- [emphasis] — мягкий акцент на выгоде или ключевом слове.
- [warmly] — человеческий тон для обращения или аватара.
4. Рабочий prompt для запуска
Хороший prompt собирает роль, темп, эмоцию, ограничения и сам текст. Так результат проще улучшать вторым запуском.
- Роль: “прочитай как эксперт/ведущий/основатель”.
- Темп: “средний, без скороговорки”.
- Эмоция: “спокойно, уверенно, с легкой улыбкой”.
- Ограничение: “без театральности, без рекламного крика”.
