Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
🎯 О чём этот конспект: Разбор архитектуры и реверс-инжиниринг популярных ИИ-приложений для замены персонажей в видео (таких как Higgsfield Genjutsu). Пошаговое руководство по разделению движения («How») и личности («Who»), обходу IP/копирайт-фильтров в видеогенераторах (Kling / Cense 2.5) с помощью карт глубины, изоляции аудио и трекинга лиц через Google MediaPipe.
👤 Кому будет полезно: Вайбкодерам, разработчикам AI-агентов, создателям контента и строителям AI-врапперов, желающим собирать коммерческие пайплайны генерации видео без ручного труда и ограничений платформенных цензоров.
✨ Что получите: Полный 11-шаговый автоматизированный пайплайн и 2 архитектурные схемы (глубинный композитинг через SAM 3 + Depth Anything и быстрый трекинг через Face Mesh), готовые промпты, конфигурации окружения и логику работы с API видеогенераторов.
1. Фундаментальный принцип обхода IP-фильтров: разделение «Who» и «How»
Контекст: При попытке загрузить сцену из известного фильма или видео с популярной личностью в Kling (Cense 2.5) для замены лица система моментально выдаёт ошибку блокировки интеллектуальной собственности (IP Block). Копирайт-фильтры видеомоделей сканируют входной поток по двум параметрам: визуальная узнаваемость лиц и аудиодорожка (музыка и тембр). Однако модели генерации опираются на два независимых слоя данных: «Кто» находится в кадре (личность, лицо, голос, саундтрек) и «Как» объекты двигаются (тайминг, кинематика тела, артикуляция губ). Фильтр безопасности триггерится исключительно на слой личности. Если убрать визуальные черты лица и исказить музыкальное сопровождение, сохранив каркас движения и вокальную дорожку для липсинка, генератор воспринимает видео как абстрактный мокап.
Тайминг: ,
Выгода: Позволяет использовать абсолютно любые референсные сцены из фильмов, клипов или мемов без риска отклонения генерации цензурой.
Как применить:
Шаг 1: Анализ исходного медиафайла — Исходное видео разделяется на визуальный и аудиопоток.
Шаг 2: Удаление слоя «Who» — Из видеоряда удаляются текстуры лиц и одежды, из аудиоряда вырезается защищенный копирайтом инструментал.
Шаг 3: Сохранение слоя «How» — Сохраняются векторные смещения, глубина пространства и вокальные форманты для управления генерацией новой личности.
Результат: Чистый референсный каркас движения, который гарантированно проходит модерацию в Kling/Cense 2.5.
2. Подготовка визуального скелета и обход аудио-фильтров
Контекст: Чтобы скрыть лицо актёра, обычный блюр или пикселизация не подходят — они ломают пространственное восприятие модели. Решением является создание карты глубины (Depth Mask) через Depth Anything, где сцена преобразуется в монохромный или псевдоцветной градиент удалённости от камеры. Одновременно решается проблема звука: модель не может синхронизировать губы (lip-sync), если видео полностью замьючено — ей необходимы речевые форманты. Однако оригинальный саундтрек распознается алгоритмами Content ID. Поэтому вокал изолируется от музыки, а затем повышается по тональности (Pitch Shift), превращаясь в синтетическую акапеллу, сохраняющую ритмику речи.
Тайминг: ,
Выгода: Сохранение 100% точности синхронизации губ и движений тела без единого совпадения по аудио- и видео-хешам правообладателей.
Как применить:
Шаг 1: Генерация карты глубины — Replicate / FAL / Hugging Face — Пропустите референсное видео через модель Depth Anything Video для генерации карты глубины.
Шаг 2: Изоляция вокала — Demucs / CapCut — Разделите аудиодорожку на инструментал и голос, удалив фоновую музыку.
Шаг 3: Питч-шифтинг вокала — Rubber Band / CapCut — Повысьте тональность изолированного голоса на +3 полутона (Pitch Up), чтобы сбить сигнатуру оригинального голоса.
Шаг 4: Сборка модифицированного референса — Сведите цветовую/серую карту глубины с изменённым вокалом в один технический MP4-файл.
Результат: Техническое видео с контурами глубины и питченым голосом, готовое к передаче в API генератора.
3. Настройка окружения и оптимизация расходов через Draft Mode
Контекст: Прямые генерации видео в разрешении 1080p стоят дорого и при неудачных попытках сжигают бюджет за минуты. Kling 2.5 (через Enhancer API) поддерживает режим драфтов (Draft Mode в 480p). Ключевая ошибка разработчиков — скачивание полученного 480p-видео и его повторная отправка в API как нового референса для апскейла. Это создаёт новый несвязанный таск, который генерирует абсолютно другой результат. Режим Draft Mode работает исключительно через сквозной task_id (Request ID): вы генерируете быстрые и дешёвые превью в 480p, находите нужную итерацию и аппрувите именно её task_id на финальный рендер в 1080p.
Тайминг: ,
Выгода: Снижение затрат на тестирование пайплайнов до 80% за счёт итераций на дешёвых драфтах 480p перед разовой оплатой финального 1080p-рендера.
Шаг 2: Хостинг ассетов — Видеогенераторы принимают только прямые публичные ссылки, а не локальные файлы. Настройте загрузку входных ассетов на временный CDN (например, Catbox или S3-бакет).
Шаг 3: Вызов генерации в Draft Mode — Сформируйте запрос к API с флагом драфта:
Шаг 4: Финализация через Task ID — Получив успешный результат превью, отправьте команду подтверждения для конкретного task_id без повторной загрузки видеофайла.
Результат: Экономичный рабочий процесс с защищённым хранением ключей и возможностью бесконечных правок без переплат.
4. Решение проблем обесцвечивания и артефактов силуэта (Композитинг через SAM 3)
Контекст: Если скормить модели чистую карту глубины, возникают две проблемы: фон становится серым/монохромным (модель не знает реальных цветов локации), а генератор слишком жёстко «обводит» исходный силуэт, оставляя тело и прическу оригинального актёра. Первая проблема решается промпт-инъекцией: агент анализирует скриншот реальной комнаты (без людей) и добавляет детальное описание окружения в промпт. Вторая проблема решается композитингом: модель сегментации SAM 3 (Segment Anything Model 3) вырезает силуэты людей из карты глубины покадрово и накладывает их поверх исходного цветного фона. Модель видит реальный цветной фон и абстрактных персонажей без лиц, полностью меняя их пропорции под загруженное фото.
Тайминг: ,
Выгода: Идеальная интеграция нового персонажа в оригинальное освещение и интерьер без серых артефактов и сохранения телосложения старого актёра.
Как применить:
Шаг 1: Извлечение окружения мультимодальной моделью — Передайте скриншот оригинального видео AI-агенту с промптом:
Analyze this studio screenshot. Describe the lighting, background colors, furniture, and atmosphere in detail. Do NOT describe or mention any people, faces, or characters present in the scene.
Шаг 2: Сегментация персонажей через SAM 3 — Прогоните видео через Segment Anything, выделив только силуэты людей на каждом кадре.
Шаг 3: Наложение маски глубины на фон — В видеоредакторе или скрипте положите вырезанные силуэты из карты глубины поверх оригинального цветного видео (с заглушенным звуком).
Шаг 4: Сборка и отправка обновлённого пейлоада — Передайте в Kling 2.5 композитное видео и обновлённый промпт с описанием студии.
Studio interview setting with warm key lighting, soft dark background, cinematic bokeh. Replace the depth-masked figure with the character in Reference Image 1, matching head proportions, exact facial features, photorealistic skin texture, natural eye contact.
Результат: Полноцветное видео с точной заменой тела, лица, причёски и сохранением реалистичного освещения локации.
Контекст: Ручное повторение всех шагов в CapCut и веб-интерфейсах занимает до 20 минут на одно видео. Коммерческие врапперы автоматизируют эту цепочку через единый оркестратор API-запросов. Пайплайн объединяет Replicate (для извлечения аудио и карт сегментации) и Enhancer API (для работы с Kling 2.5), завершая процесс автоматической подменой оригинального звука в финальный рендер.
Тайминг: ,
Выгода: Полная автоматизация процесса: генерация видео в 1 клик через веб-интерфейс или AI-агента за 2–3 минуты.
+-----------------------------------------------------------------------------------+
| 11-STEP AUTOMATED REVERSE WORKFLOW |
+-----------------------------------------------------------------------------------+
[1] Upload Original MP4 ------> [Save Master Audio Track for Step 10]
|
+--> [2] Demucs (Replicate) ---------> Split Vocals from Instrumental
| |
| v
| [3] Rubber Band API ------------> Pitch Shift Vocals (+3 semitones)
|
+--> [4] Depth Anything Video -------> Generate Depth Mask Video
| |
| v
+--> [5] SAM 3 Tracking -------------> Segment People Out (Frame-by-Frame)
|
v
[6] Composite: Depth People OVER Original Video Background
|
v
[7] Inject Pitched Vocals into Composite Video
|
v
[8] Quality Control (Human-in-the-Loop check of mask edges)
|
v
[9] Kling 2.5 via Enhancer API (Draft Mode 480p)
|
v
[10] Strip Kling Audio + Re-attach Original Master Soundtrack (Step 1)
|
v
[11] Approve Task ID -> Render Final 1080p MP4
Как применить:
Шаг 1: Загрузка оригинала — Исходный файл сохраняется локально; оригинальный чистый звук кэшируется для финального этапа.
Шаг 2: Разделение дорожек (Demucs) — Нейросеть Demucs на Replicate отделяет вокал от бита.
Шаг 3: Питч-шифтинг (Rubber Band) — Сдвиг вокала вверх на 3 полутона.
6. Экспресс-пайплайн через Face Mesh на базе Google MediaPipe (478 точек)
Контекст: Если в видео присутствует только один говорящий персонаж по центру (Talking Head), сложный композитинг через SAM 3 и Depth Anything избыточен. Достаточно использовать Face Mesh — векторную полигональную сетку из 478 ключевых точек, которая накладывается прямо на лицо актёра на каждом кадре. Сетка полностью скрывает черты оригинального лица от IP-сканеров, но передаёт микромимику (движение глаз, губ, бровей, носа). Координаты сохраняются в структурированный JSON, что делает этот пайплайн сверхбыстрым: достаточно наложить сетку, повысить питч голоса и отправить файл в генератор.
Тайминг: ,
Выгода: Ускорение препроцессинга в 3–4 раза за счёт исключения тяжёлых моделей сегментации видео.
Шаг 1: Установка зависимостей — Настройте окружение с библиотекой Google MediaPipe:
pip install mediapipe opencv-python numpy
Шаг 2: Генерация Face Mesh оверлея — Запустите трекинг 478 точек лица на исходном видео и сохраните координаты в face_landmarks.json.
Шаг 3: Наложение сетки на видео — Отрендерите видеоряд, где поверх лица говорящего нарисована векторная сетка, и замените аудио на питченную версию.
Шаг 4: Отправка в Kling 2.5 — Передайте полученное видео с сеткой и референсное фото вашего персонажа в API.
Результат: Максимально точное повторение оригинальной мимики и липсинка при минимальных вычислительных затратах.
FAQ
В: Почему нельзя просто замазать лицо блюром или закрасить черным кругом?
О: Грубое маскирование (блюр, сплошная заливка) уничтожает пространственную информацию о поворотах головы, мимике и освещении. Модель генерации видео не сможет понять, в какую сторону направлен взгляд и как открывается рот, что приведёт к искажениям лица и потере липсинка. Depth Mask и Face Mesh скрывают личность, но сохраняют кинематический каркас.
В: Зачем менять тональность голоса через питч, если музыка уже удалена?
О: Аудиофильтры копирайта сканируют не только инструментал, но и спектрограмму голоса (тембр и форманты известных личностей). Повышение тональности на 3 полутона сбивает аудио-хеш и алгоритмы распознавания, сохраняя при этом фонетическую структуру слов, необходимую Kling для артикуляции губ.
В: Чем отличается апскейл скачанного драфта от подтверждения Task ID?
О: Повторная загрузка скачанного 480p-файла инициализирует новую генерацию «с нуля» — модель заново интерпретирует кадры, меняя внешность персонажа и артефакты. Подтверждение существующего task_id обращается к латентному состоянию уже созданного драфта в памяти нейросети и рендерит именно эту версию в высоком разрешении без изменений композиции.
В: Что делать, если в сцене участвуют два человека?
О: Для сцен с двумя и более персонажами используйте основной 11-шаговый пайплайн (Depth Anything + SAM 3). Быстрый метод с Face Mesh лучше всего работает при наличии одного человека, смотрящего в камеру, так как трекинг нескольких перекрывающихся лиц может сбоить.
В: Почему генератор делает тело персонажа похожим на оригинального актёра, даже если лицо заменено?
О: Это происходит, когда модель воспринимает контур карты глубины как жёсткую границу тела. Чтобы разрушить привязку к исходному силуэту, используется SAM 3: вырезанные силуэты из карты глубины накладываются на реальный цветной фон комнаты, а промпт дополняется текстовым описанием интерьера.
В: Какие форматы и лимиты видео поддерживаются пайплайном?
О: Оптимальный формат — MP4 или MOV длительностью до 30 секунд. Все входные медиафайлы должны передаваться через публичные URL (например, временный CDN-хостинг), так как API видеомоделей не принимают прямую бинарную передачу тяжёлых файлов в теле JSON.
Ресурсы и ссылки
Enhancer API — Провайдер API для Kling / Cense 2.5 с поддержкой Draft Mode и без обучения на данных пользователя — упомянут в видео.
Replicate — Облачная платформа для запуска open-source моделей (Demucs, Rubber Band, Depth Anything) — https://replicate.com
Depth Anything Video — Модель оценки глубины на видеоряде — доступна на Replicate / FAL / Hugging Face.
SAM 3 (Segment Anything Model) — Модель сегментации и покадрового трекинга объектов — доступна на Replicate.
Demucs — Нейросеть для изоляции вокала и разделения аудиодорожек от Meta — доступна на Replicate.
Google MediaPipe Face Landmarker — Инструмент детекции 478 ключевых точек лица — официальный репозиторий Google / PyPI.
Catbox / Temp Files — Сервисы временного хостинга файлов для генерации прямых CDN-ссылок — упомянуты в видео.
Конспект создан на основе видео «How Higgsfield Genjutsu Actually Works (Reverse Engineered)» канала Serio. Все права на оригинальный материал принадлежат авторам.Источник: https://www.youtube.com/watch?v=d6spCMcfkew