кейс
Как мы сократили время производства видеоартефактов InterDead и построили воспроизводимый конвейер
Кейс о воспроизводимом производстве видеоартефактов InterDead с WhisperX, LLM-подсказками и FFmpeg.
Попытка ускорить создание коротких внутримировых видео превратилась в управляемую инженерную систему, определяющую визуальную идентичность InterDead.
Контекст и цель
В InterDead короткие видео работают как артефакты — диегетические следы, появляющиеся и в приложении-прототипе InterDeadProto, и на сайте проекта.
Для стабильного производства контента нам был нужен механизм быстрой и предсказуемой сборки с едиными стилистическими правилами, без ручного перемонтажа каждой итерации.
Структурная формула всех артефактов проста:
аудио + фоновое изображение + emoji-наложения, синхронизированные по времени слов
Почему ручной монтаж не сработал
Первые попытки в Canva и Adobe Premiere Pro показали, что ручная сборка становится узким местом. Каждое новое видео требовало полной пересинхронизации, стиль менялся от артефакта к артефакту, а небольшие правки превращались в отдельные микропроекты.
Параллельное сравнение дало измеримый результат: ручной монтаж занимал в среднем 2,5–3 часа, а конвейер — 35–50 минут. Время сократилось на 65–75%, последовательность результата заметно выросла.
Шероховатость, которую мы сохранили
Сгенерированные конвейером видео выглядят более техническими, чем вручную смонтированные. Это поддерживает эстетику артефакта. FFmpeg позволяет добавить процедурную анимацию, а спрайты — движение, но визуальная сдержанность лучше соответствует внутренней логике InterDead. Шероховатость стала осознанным свойством.
Архитектура конвейера
Разработка ведётся в InterDeadReferenceLibrary/tools/, а сам процесс остаётся строго линейным и детерминированным.
Сначала whisperx_timing_builder принимает аудио, выполняет выравнивание WhisperX и создаёт aligned.json с точным временем каждого слова. Синхронизация по словам даёт объективные, измеримые точки.
Затем LLM-шаг использует aligned.json, редакционные блоки, шаблоны и полную расшифровку, чтобы сформировать структурированный массив cues[] для наложений. Пропущенный ASR фрагмент отмечается явно, без выдуманного тайминга.
Финальная конфигурация может собираться полностью автоматически, однако семантический контроль важнее устранения последнего ручного шага.
В конце emoji_overlay_video_builder собирает видео через FFmpeg с фиксированным набором emoji, безопасной зоной, стабильными отступами и детерминированными наложениями. Монтажной шкалы времени нет — только композиция по правилам.
Вспомогательные ресурсы
Музыка генерируется через Suno; коммерческое использование требует активной подписки. Фоновые изображения создаются GPT-инструментами и формируют узнаваемую палитру и зернистость. Emoji рендерятся из набора Twemoji 72×72 PNG для одинакового результата на разных платформах.
Результат
Конвейер — дисциплинированный производственный метод: он сокращает повторяющуюся работу, обеспечивает соблюдение визуальных ограничений и сохраняет инженерный контроль над генеративными компонентами. Его основные принципы — воспроизводимость, предсказуемость и стилистическая дисциплина.