ГлавнаяГайдыБесплатноСтарт $19НовостиБизнесу
Все гайды
Инструменты

Конвейер, который монтирует рилс за тебя: 6 минут сырья в 40 секунд

Разбор своей системы автомонтажа: что делает каждый шаг, какие инструменты внутри, где стоят проверки качества и чего такая система не умеет. С реальными цифрами одного прогона.

Инструменты·Aug 23, 2026·8 min read

Монтаж вертикального ролика это самая тупая повторяемая работа в контенте. Ты снимаешь одним дублем шесть минут, потом полдня режешь паузы, ставишь титры, подбираешь вставки и музыку. И так каждый раз.

Напишите одной строкой, какую работу у вас делают руками. Читаю и отвечаю сам, скажу что из этого реально отдаётся AI.Написать Тимуру →

Я собрал конвейер, который делает это сам. Ниже разбор, как он устроен, и цифры последнего прогона: на входе съёмка 6 минут 20 секунд одним дублем, на выходе готовая вертикалка 40 секунд. 22 склейки, 45 строк титров, 11 кусков сырья выброшено целиком. Машина работала 12 минут 5 секунд, руками в этом прогоне не сделано ничего.

Из чего состоит конвейер

Разборы AI-инструментов несколько раз в неделю. Только рабочие фишки.Читать в Telegram

Пять шагов, каждый отдельная команда. Между ними файлы, а не человек в голове.

1. Речь в текст с таймингами. Сначала съёмка расшифровывается пословно, с точным временем каждого слова. Без этого дальше нечего резать. Я использую распознавание речи от ElevenLabs, оно платное по минутам, тариф смотрите на их странице: https://elevenlabs.io. Бесплатная альтернатива, которая ставится локально, это Whisper от OpenAI: https://github.com/openai/whisper. Качество на русском у него ниже, но для черновой нарезки хватает.

2. Чистка звука. Отдельным шагом убирается шум и выравнивается голос. Важная деталь: таймлайн при этом не трогается, иначе все тайминги из первого шага поедут.

3. План монтажа. Здесь система решает, что оставить. Она берёт куски, где есть смысл и есть картинка под них, и выбрасывает всё остальное. В последнем прогоне из 380 секунд осталось 40, самый длинный выброшенный кусок был 84 секунды. Результат этого шага обычный текстовый файл со списком фрагментов, титров и вставок, его можно открыть и поправить руками.

4. Рендер. Сборка картинки: резы, титры, графические вставки, эффекты. Я собираю это на Remotion, это видео на React: https://www.remotion.dev. Лицензия бесплатная для частных лиц и небольших команд, для компаний платная, условия на их сайте. Рендер 40-секундного ролика в вертикали занял 11 минут 51 секунду на обычном ноутбуке.

5. Музыка. Последним шагом добавляется трек с автоматическим приглушением под голос. Бесплатный инструмент для склейки и звука это ffmpeg: https://ffmpeg.org.

Где стоят проверки

Самое ценное в такой системе это не рендер, а два гейта перед ним.

Гейт контракта проверяет, что ни один рез не попадает на середину слова. Это главная болезнь автомонтажа: система верит таймингам распознавания речи, а они всегда чуть плывут, и на выходе получаются обрубленные фразы. У меня этот гейт живой: соседний ролик он завернул с 12 ошибками вида «рез режет слово» и просто не пустил дальше. Ролик не вышел, пока границы не сдвинули в паузу.

Гейт охвата проверяет сам ролик как контент: есть ли хук на экране, нет ли жаргона в первой строке, есть ли причина сохранить или переслать, есть ли призыв, укладывается ли длина в рабочий коридор. Семь правил, все выведены из своих же роликов, которые залетели и которые не залетели.

Без этих проверок автомонтаж выдаёт красивый мусор с ровной скоростью.

Чего такая система не умеет

  • Она не придумает за вас, о чём говорить. План строится из того, что вы сказали.
  • Она не спасёт плохую съёмку. Плохой звук на входе остаётся плохим звуком на выходе.
  • Она требует одного дубля подряд, а не десяти обрывков. Паузы и оговорки внутри дубля нормально, их она и выбрасывает.
  • Она не заменяет вкус. Гейты ловят грубые ошибки, но выбор темы и хука остаётся за человеком.

Как собрать такое у себя

Начните с трёх шагов, а не с пяти: распознавание речи, ручной список кусков в текстовом файле, склейка через ffmpeg. Это уже снимает большую часть рутины. Гейты добавляйте после того, как первый ролик соберётся: сначала проверку резов по словам, потом свои правила по охвату.

Главное правило, к которому я пришёл: система должна резать по звуку, а не по расшифровке. Расшифровка нужна, чтобы понять смысл, но границы куска ставятся в тишину.

Один вопрос

Такой конвейер собирается не только под монтаж. Он собирается под любую работу, которая повторяется по одному и тому же сценарию.

Какую работу у вас сейчас делают руками, хотя её мог бы делать такой же конвейер? Напишите одной строкой, что за процесс и сколько времени он съедает. Читаю и отвечаю сам, скажу честно, что из этого реально отдаётся AI, а что нет.

Какую работу у вас делают руками? Напишите одной строкой.

Написать Тимуру →
одна строка

Какую работу у вас сейчас делают руками, хотя её мог бы делать конвейер?

Напишите одной строкой, что за процесс и сколько времени он съедает. Читаю и отвечаю сам, скажу честно, что из этого реально отдаётся AI, а что нет. Если нужна сборка под ключ, разберём её в том же разговоре.