кейс

Как мы сократили время производства видеоартефактов InterDead и построили воспроизводимый конвейер

Кейс о воспроизводимом производстве видеоартефактов InterDead с WhisperX, LLM-подсказками и FFmpeg.

Дата: 2026-02-20

Авторы: Sam Starling

Категории: кейсы

Теги: interdead, case-study, pipeline, automation, ffmpeg, whisperx, llm

Попытка ускорить создание коротких внутримировых видео превратилась в управляемую инженерную систему, определяющую визуальную идентичность InterDead.

Контекст и цель

В InterDead короткие видео работают как артефакты — диегетические следы, появляющиеся и в приложении-прототипе InterDeadProto, и на сайте проекта.

Для стабильного производства контента нам был нужен механизм быстрой и предсказуемой сборки с едиными стилистическими правилами, без ручного перемонтажа каждой итерации.

Структурная формула всех артефактов проста:

аудио + фоновое изображение + emoji-наложения, синхронизированные по времени слов

Почему ручной монтаж не сработал

Первые попытки в Canva и Adobe Premiere Pro показали, что ручная сборка становится узким местом. Каждое новое видео требовало полной пересинхронизации, стиль менялся от артефакта к артефакту, а небольшие правки превращались в отдельные микропроекты.

Параллельное сравнение дало измеримый результат: ручной монтаж занимал в среднем 2,5–3 часа, а конвейер — 35–50 минут. Время сократилось на 65–75%, последовательность результата заметно выросла.

Шероховатость, которую мы сохранили

Сгенерированные конвейером видео выглядят более техническими, чем вручную смонтированные. Это поддерживает эстетику артефакта. FFmpeg позволяет добавить процедурную анимацию, а спрайты — движение, но визуальная сдержанность лучше соответствует внутренней логике InterDead. Шероховатость стала осознанным свойством.

Архитектура конвейера

Разработка ведётся в InterDeadReferenceLibrary/tools/, а сам процесс остаётся строго линейным и детерминированным.

Сначала whisperx_timing_builder принимает аудио, выполняет выравнивание WhisperX и создаёт aligned.json с точным временем каждого слова. Синхронизация по словам даёт объективные, измеримые точки.

Затем LLM-шаг использует aligned.json, редакционные блоки, шаблоны и полную расшифровку, чтобы сформировать структурированный массив cues[] для наложений. Пропущенный ASR фрагмент отмечается явно, без выдуманного тайминга.

Финальная конфигурация может собираться полностью автоматически, однако семантический контроль важнее устранения последнего ручного шага.

В конце emoji_overlay_video_builder собирает видео через FFmpeg с фиксированным набором emoji, безопасной зоной, стабильными отступами и детерминированными наложениями. Монтажной шкалы времени нет — только композиция по правилам.

Вспомогательные ресурсы

Музыка генерируется через Suno; коммерческое использование требует активной подписки. Фоновые изображения создаются GPT-инструментами и формируют узнаваемую палитру и зернистость. Emoji рендерятся из набора Twemoji 72×72 PNG для одинакового результата на разных платформах.

Результат

Конвейер — дисциплинированный производственный метод: он сокращает повторяющуюся работу, обеспечивает соблюдение визуальных ограничений и сохраняет инженерный контроль над генеративными компонентами. Его основные принципы — воспроизводимость, предсказуемость и стилистическая дисциплина.

Полная техническая спецификация

Назад к журналу