1. Сначала перепишите текст под слух

Текст, который нормально читается глазами, часто плохо звучит голосом: длинные фразы, сложные обороты, три смысла в одном предложении. Перед генерацией разбейте материал на короткие фразы и оставьте один смысл на один голосовой блок.

  • Предложение 6-12 слов обычно звучит лучше длинного абзаца.
  • Уберите канцелярит: “осуществляем”, “реализуем”, “в рамках”.
  • Сначала назовите пользу, потом детали.
  • CTA в конце пишите спокойно, без рекламного крика.
Для 15 секунд обычно хватает 35-45 русских слов. Для 30 секунд — примерно 70-90 слов.

2. Задайте роль голоса, а не просто “красиво”

Модель лучше работает, когда понимает, кто говорит: эксперт, основатель, диктор, ведущий подкаста, наставник или рекламный voiceover. Роль сразу меняет темп, паузы и интонацию.

  • Эксперт: спокойно, уверенно, с ясными паузами.
  • Реклама: живее, но без крика.
  • Инструкция: медленнее, с паузами после шагов.
  • Аватар: личное обращение, естественная речь, мягкий финал.

3. Используйте audio tags точечно

Audio tags помогают подсказать эмоцию и паузу, но их легко переборщить. Лучше 2-3 подсказки на абзац, чем разметка каждого слова.

  • [calmly] — спокойная подача.
  • [short pause] — короткая пауза после важной мысли.
  • [emphasis] — мягкий акцент на выгоде или ключевом слове.
  • [warmly] — человеческий тон для обращения или аватара.
Если голос звучит театрально, уменьшайте количество tags и упрощайте текст.

4. Рабочий prompt для запуска

Хороший prompt собирает роль, темп, эмоцию, ограничения и сам текст. Так результат проще улучшать вторым запуском.

  • Роль: “прочитай как эксперт/ведущий/основатель”.
  • Темп: “средний, без скороговорки”.
  • Эмоция: “спокойно, уверенно, с легкой улыбкой”.
  • Ограничение: “без театральности, без рекламного крика”.
Шаблон: “[calmly] Прочитай как экспертное объяснение. Темп средний, паузы после смысловых блоков. Голос уверенный, без дикторского пафоса. Текст: …”