кейс
Як ми скоротили час виробництва відеоартефактів InterDead і побудували відтворюваний конвеєр
Кейс про детермінований конвеєр WhisperX, LLM і FFmpeg, що скоротив виробничий час на 65–75%.
Спроба прискорити створення коротких внутрішньосвітових відео перетворилася на контрольовану інженерну систему, що визначає візуальну ідентичність InterDead.
Контекст і мета
Короткі відео в InterDead є артефактами — дієгетичними слідами, що з’являються в InterDeadProto та на сайті проєкту.
Для стабільного виробництва нам був потрібен механізм швидкого й передбачуваного складання відео за єдиними стилістичними правилами без ручного перемонтажу кожної ітерації.
аудіо + фонове зображення + emoji-накладання, синхронізовані за таймінгом слів
Чому ручний монтаж не спрацював
Ранні спроби в Canva та Adobe Premiere Pro створили вузьке місце. Кожне відео вимагало повної ресинхронізації, стиль змінювався між артефактами, а дрібна правка ставала окремим мікропроєктом.
Паралельне порівняння дало вимірюваний результат: ручний монтаж займав у середньому 2,5–3 години, конвеєр — 35–50 хвилин. Скорочення становило 65–75% за вищої послідовності.
Шорсткість, яку ми зберегли
Конвеєрні відео виглядають технічніше за ручний монтаж, і це підтримує естетику артефактів. Процедурна анімація та sprite-накладання можливі, але візуальна стриманість краще відповідає внутрішній логіці InterDead.
Шорсткість стала властивістю, а не дефектом.
Архітектура конвеєра
Розробка відбувається в InterDeadReferenceLibrary/tools/, а конвеєр лишається лінійним і детермінованим.
Спочатку whisperx_timing_builder приймає аудіо, виконує вирівнювання WhisperX і створює aligned.json із точними таймінгами слів. Синхронізація за словами дає об’єктивні вимірювані сигнали.
Далі LLM-промпт використовує aligned.json, редакційні блоки, шаблони й повну транскрипцію для створення масиву cues[]. Якщо ASR пропускає фрагмент, система позначає це замість вигадування таймінгу. Семантичний контроль важливіший за усунення останнього ручного кроку.
На завершення emoji_overlay_video_builder збирає відео через FFmpeg із фіксованим набором emoji, безпечною зоною, стабільними відступами й детермінованими накладаннями. Монтажної шкали часу немає — лише композиція за правилами.
Допоміжні ресурси
Музика генерується через Suno; комерційне використання потребує активної підписки. Фонові зображення створюються GPT-інструментами та формують упізнавану палітру й зернистість. Emoji рендеряться з набору Twemoji 72×72 PNG для однакового результату на різних платформах.
Результат
Конвеєр є дисциплінованим виробничим методом: скорочує повторювану роботу, примушує дотримуватися візуальних обмежень і зберігає інженерний контроль над генеративними компонентами. Його засади — відтворюваність, передбачуваність і стилістична дисципліна.