Монтаж вертикального ролика это самая тупая повторяемая работа в контенте. Ты снимаешь одним дублем шесть минут, потом полдня режешь паузы, ставишь титры, подбираешь вставки и музыку. И так каждый раз.
Я собрал конвейер, который делает это сам. Ниже разбор, как он устроен, и цифры последнего прогона: на входе съёмка 6 минут 20 секунд одним дублем, на выходе готовая вертикалка 40 секунд. 22 склейки, 45 строк титров, 11 кусков сырья выброшено целиком. Машина работала 12 минут 5 секунд, руками в этом прогоне не сделано ничего.
Из чего состоит конвейер
Пять шагов, каждый отдельная команда. Между ними файлы, а не человек в голове.
1. Речь в текст с таймингами. Сначала съёмка расшифровывается пословно, с точным временем каждого слова. Без этого дальше нечего резать. Я использую распознавание речи от ElevenLabs, оно платное по минутам, тариф смотрите на их странице: https://elevenlabs.io. Бесплатная альтернатива, которая ставится локально, это Whisper от OpenAI: https://github.com/openai/whisper. Качество на русском у него ниже, но для черновой нарезки хватает.
2. Чистка звука. Отдельным шагом убирается шум и выравнивается голос. Важная деталь: таймлайн при этом не трогается, иначе все тайминги из первого шага поедут.
3. План монтажа. Здесь система решает, что оставить. Она берёт куски, где есть смысл и есть картинка под них, и выбрасывает всё остальное. В последнем прогоне из 380 секунд осталось 40, самый длинный выброшенный кусок был 84 секунды. Результат этого шага обычный текстовый файл со списком фрагментов, титров и вставок, его можно открыть и поправить руками.
4. Рендер. Сборка картинки: резы, титры, графические вставки, эффекты. Я собираю это на Remotion, это видео на React: https://www.remotion.dev. Лицензия бесплатная для частных лиц и небольших команд, для компаний платная, условия на их сайте. Рендер 40-секундного ролика в вертикали занял 11 минут 51 секунду на обычном ноутбуке.
5. Музыка. Последним шагом добавляется трек с автоматическим приглушением под голос. Бесплатный инструмент для склейки и звука это ffmpeg: https://ffmpeg.org.
Где стоят проверки
Самое ценное в такой системе это не рендер, а два гейта перед ним.
Гейт контракта проверяет, что ни один рез не попадает на середину слова. Это главная болезнь автомонтажа: система верит таймингам распознавания речи, а они всегда чуть плывут, и на выходе получаются обрубленные фразы. У меня этот гейт живой: соседний ролик он завернул с 12 ошибками вида «рез режет слово» и просто не пустил дальше. Ролик не вышел, пока границы не сдвинули в паузу.
Гейт охвата проверяет сам ролик как контент: есть ли хук на экране, нет ли жаргона в первой строке, есть ли причина сохранить или переслать, есть ли призыв, укладывается ли длина в рабочий коридор. Семь правил, все выведены из своих же роликов, которые залетели и которые не залетели.
Без этих проверок автомонтаж выдаёт красивый мусор с ровной скоростью.
Чего такая система не умеет
- Она не придумает за вас, о чём говорить. План строится из того, что вы сказали.
- Она не спасёт плохую съёмку. Плохой звук на входе остаётся плохим звуком на выходе.
- Она требует одного дубля подряд, а не десяти обрывков. Паузы и оговорки внутри дубля нормально, их она и выбрасывает.
- Она не заменяет вкус. Гейты ловят грубые ошибки, но выбор темы и хука остаётся за человеком.
Как собрать такое у себя
Начните с трёх шагов, а не с пяти: распознавание речи, ручной список кусков в текстовом файле, склейка через ffmpeg. Это уже снимает большую часть рутины. Гейты добавляйте после того, как первый ролик соберётся: сначала проверку резов по словам, потом свои правила по охвату.
Главное правило, к которому я пришёл: система должна резать по звуку, а не по расшифровке. Расшифровка нужна, чтобы понять смысл, но границы куска ставятся в тишину.
Один вопрос
Такой конвейер собирается не только под монтаж. Он собирается под любую работу, которая повторяется по одному и тому же сценарию.
Какую работу у вас сейчас делают руками, хотя её мог бы делать такой же конвейер? Напишите одной строкой, что за процесс и сколько времени он съедает. Читаю и отвечаю сам, скажу честно, что из этого реально отдаётся AI, а что нет.
Какую работу у вас делают руками? Напишите одной строкой.
Написать Тимуру →Какую работу у вас сейчас делают руками, хотя её мог бы делать конвейер?
Напишите одной строкой, что за процесс и сколько времени он съедает. Читаю и отвечаю сам, скажу честно, что из этого реально отдаётся AI, а что нет. Если нужна сборка под ключ, разберём её в том же разговоре.