VibeCoderzVibeCoderz
Все статьи
2026/07/2910 мин чтения

FLUX 3 от Black Forest Labs: одна модель — видео, аудио, изображения и роботы на заводах Audi

23 июля 2026 немецкая лаборатория Black Forest Labs объявила о выходе FLUX 3. Это не просто новый видеогенератор — это первая в мире модель, обученная одновременно на видео, аудио, изображениях и управлении роботами в единой архитектуре. Один набор в…

Содержание (14)+

23 июля 2026 немецкая лаборатория Black Forest Labs объявила о выходе FLUX 3. Это не просто новый видеогенератор — это первая в мире модель, обученная одновременно на видео, аудио, изображениях и управлении роботами в единой архитектуре. Один набор весов, который понимает мир как целое.

За три года до этого те же люди придумали latent diffusion — технологию в основе Stable Diffusion и большинства современных AI-генераторов изображений. FLUX.1 скачали больше 500 миллионов раз. Adobe Photoshop использует FLUX-модели.

Теперь они берут тот же подход и применяют его к видео, звуку и роботам одновременно. 93% предпочтения над Luma Ray 3.2 в собственных тестах. Роботы на заводах Audi, собирающие то, что классическая автоматизация не могла. И обещание открытых весов.

Но потрогать пока нельзя почти ничего.

FLUX 3 от Black Forest Labs (23 июля 2026) — первая мультимодальная foundation model: видео до 20 секунд с нативным аудио, изображения, предсказание действий роботов в одной архитектуре. 93% над Luma, 77% над Runway. Video и Action — early access. Image — скоро. Dev (открытые веса) — конец 2026. Цены не объявлены. В статье: архитектура, бенчмарки, FLUX-mimic на Audi, сравнение с конкурентами, когда что ждать.

Ссылки:


Если вы не следили за AI-генерацией видео — вот контекст

Три года назад появился Stable Diffusion — открытая модель для создания изображений по текстовому описанию. Те, кто его создали, потом основали Black Forest Labs и выпустили FLUX.1 — он стал новым стандартом для AI-генерации изображений в коммерческих продуктах (Adobe Photoshop, Canva, Picsart).

Параллельно появились Runway, Sora, Luma, Kling — модели, которые по текстовому описанию создают не картинку, а видеоклип. Проблема у всех одна: видео генерировалось отдельно, звук добавлялся отдельно и часто не совпадал с тем, что происходит на экране.

FLUX 3 — это попытка сделать иначе: одна модель видит мир целиком и создаёт видео со звуком за один проход. Плюс — неожиданно — управляет роботами.


Что такое Real World Models — философия, которая за этим стоит

Black Forest Labs дали своему подходу название: Real World Models.

Логика простая. Ни одна модальность по отдельности не даёт полной картины реального мира.

Изображение — это пространство в один момент времени. Видео добавляет время и то, как объекты движутся и взаимодействуют. Звук раскрывает причинно-следственные связи — по звуку удара можно понять массу предмета, по фоновому шуму — место. Язык соединяет всё это с целями и намерениями.

FLUX 3 обучается на всём одновременно. Звук должен совпадать с событием в кадре. Движение должно подчиняться физике. Будущее должно следовать из прошлого. Модель, которая это понимает, — не просто «делает красивое видео». Она понимает, как устроен мир.

И это же понимание, как выяснилось, нужно роботу для того, чтобы знать, как взять в руку кабель.


Архитектура: Self-Flow и почему роботы — это не случайно

Self-Flow — что это и зачем

Техническая основа FLUX 3 называется Self-Flow. Метод опубликован BFL в марте 2026.

Стандартные генеративные модели — diffusion, flow-matching — оптимизированы на один показатель: качество финального вывода. Они генерируют красивое видео, но их внутренние представления о мире «запутаны» — не структурированы так, чтобы их можно было использовать для чего-то ещё.

Self-Flow решает обе задачи одновременно: улучшает качество генерации и делает внутренние features структурированными и пригодными для downstream-задач. Это и есть ключ к тому, почему одна архитектура работает и для видео, и для роботов.

Как обучалась модель

FLUX 3 — diffusion transformer (DiT), обученный на:

  • Десятках миллионов часов общего видео (физика движения, свет, взаимодействия объектов)
  • Сотнях тысяч часов видео с манипуляциями (для роботов — как берут, кладут, собирают)
  • Изображениях и аудио

Интересная деталь про звук: видео-предикшн занял больше 95% тренировочного времени. Аудио — меньше 0.5% токенов в типичном клипе. Когда модель научилась понимать физику мира через видео — она начала понимать звук почти «бесплатно». Звук удара следует из физики удара, которую модель уже знает.

Роботы: случайность или прорыв

Когда BFL добавили в обучение предсказание действий роботов — качество видео упало примерно на 10%. Это ожидаемо: модель теперь учится двум вещам одновременно.

Через ~3500 дополнительных шагов обучения модель восстановила полное качество видео — и при этом научилась предсказывать действия роботов. Это было неочевидно заранее.

Вывод: внутренняя репрезентация мира, которая нужна для генерации убедительного видео, — та же самая, которая нужна роботу чтобы понять, как двигаться. Это не случайное совпадение. Это показывает, что unified обучение на реальном мире даёт что-то большее, чем сумма частей.


Четыре продукта — что, когда, для кого

ПродуктСтатусДоступ
FLUX 3 VideoEarly AccessЗаявка на bfl.ai
FLUX 3 Action (FLUX-mimic)Early AccessТолько партнёры mimic robotics
FLUX 3 Image«В ближайшие недели»Не объявлено
FLUX 3 DevКонец 2026Открытые веса

Цены не объявлены ни для одного тира.

Кто уже тестирует FLUX 3 Video: Canva, Burda, Magnific (ex-Freepik), Krea, Picsart. Adobe Photoshop уже использует предыдущие FLUX-модели.


FLUX 3 Video: что умеет

Режимы генерации

РежимЧто делает
Text-to-VideoВидео + аудио из текстового описания
Image-to-VideoАнимация из стартового кадра или изображений как референсов
Video-to-VideoТрансформация существующего видео в новый контекст
Generative ContinuationПродолжение видео и аудио
Keyframe-to-VideoКонтролируемые переходы между ключевыми кадрами
Agentic ChainingСклейка клипов в длинные multi-shot секвенции

Максимальная длина: 20 секунд за генерацию. Это больше, чем большинство конкурентов. Столько же было у Sora, которую OpenAI закрыла.

Нативный звук — как это работает

Большинство видеогенераторов работают в два шага: сначала создают видео, потом добавляют звук отдельной моделью. Проблема: звук и картинка часто не совпадают по тайммингу, а «звук удара» не всегда звучит как удар конкретного предмета.

В FLUX 3 — один проход. Видео и аудио генерируются одновременно. Звук следует из физики: модель знает массу предмета, знает как он движется, поэтому знает как он звучит. Поддерживаются диалоги на нескольких языках с синхронизацией движений губ.

Визуальные сильные стороны

По заявлению BFL — особенно хорош в: точных человеческих мимиках и эмоциях, мультиязычном тексте на экране, типографике и анимированном дизайне, широком стилистическом диапазоне (от анимации до кинематографа).


Бенчмарки: честный разбор

Цифры

Условия тестов: 10-секундные клипы, 720p, text-to-video с аудио. Human preference.

Против когоFLUX 3 preference
Luma Ray 3.293% — разгром
Runway Gen-4.577% — уверенная победа
Grok Imagine Video69% — сильный перевес
Kling v3 Pro60% — заметное преимущество
HappyHorse v1 / v1.157-59% — небольшое преимущество
Seedance 2.052% — статистически ничья
Gemini Omni Flash52% — статистически ничья

Что это реально означает

FLUX 3 уверенно опережает «старых лидеров» — Runway и Luma, которые доминировали в 2025 году. 93% и 77% — это серьёзные цифры, даже со скидкой на self-reporting.

С новым поколением — Seedance 2.0 и Gemini Omni Flash — ничья. 52% статистически неотличимо от 50/50. FLUX 3 в топовой лиге, но не один на вершине.

Честные оговорки — что нужно знать

Все результаты — внутренние тесты BFL, не независимый аудит. Методология не раскрыта: размер выборки, подбор промптов, критерии оценки неизвестны. Тесты на 10 секундах, не на максимальных 20. Для FLUX 3 Image бенчмарков нет вообще. BFL сами пишут: «модель и харнесс ещё в разработке, результаты preliminary».


FLUX-mimic: от видеогенерации к роботам на Audi

Это самая неожиданная часть анонса — и, возможно, самая важная долгосрочно.

mimic robotics — стартап из Цюриха. Совместно с BFL они создали FLUX-mimic: систему, где лёгкий action decoder читает внутренние представления FLUX 3 (те же самые, что генерируют видео) и переводит их в движения роботов.

Не нужна отдельная робототехническая модель. Не нужно учить физику с нуля. FLUX 3 уже знает, как объекты движутся, как взаимодействуют, как меняются под воздействием — и робот использует эти знания напрямую.

Что уже работает на Audi

Christoph Schneider из Audi Production Lab подтвердил: система развёрнута и протестирована в реальном производстве.

Задачи: сборка компонентов, вставка электроники, работа с мягкими материалами — уплотнителями, кабелями. Последнее особенно важно: мягкие деформируемые материалы — главная проблема классической промышленной робототехники. Их поведение непредсказуемо, жёсткое программирование не справляется.

Производительность: менее 80 мс латентности на одном RTX 5090. Полная система — 101 мс.

Цитата Audi: «Эти роботы решают сложные задачи манипуляции с мягкими материалами, которые были бы просто невозможны с обычной робототехникой».


Сравнение с конкурентами

МодельМакс. длинаАудиоРазрешениеЦена 10 сек 720pДоступность
FLUX 3 Video20 сек✅ Нативное720p (тесты)❓ Не объявленаEarly Access
HappyHorse 1.115 сек✅ Синхр.1080p~$1.82Доступна
Veo 3.1per-secДо 4K$4.00Доступна
Veo 3.1 Fastper-secДо 4K$1.00Preview
Gemini Omni Flash10 сек✅ Нативное720p$1.00Доступна
Runway Gen-4.5РаздельноДоступна
Luma Ray 3.2РаздельноДоступна
Kling v3 ProРаздельноДоступна

Главные отличия FLUX 3: единая архитектура (ни у кого нет), 20 секунд (одна из самых длинных генераций), нативный звук в одном проходе (в отличие от Runway/Luma/Kling), обещание открытых весов.

Главный минус: ничего нет в публичном доступе прямо сейчас.


Кто такие Black Forest Labs

BFL основана в августе 2024 в Фрайбурге — Robin Rombach и командой, которая создала latent diffusion (архитектура лежит в основе Stable Diffusion и большинства современных image-генераторов).

ФактЗначение
Оценка$3.25 млрд
Привлечено>$450 млн
Инвесторыa16z, NVIDIA, Salesforce, Adobe Ventures, Figma Ventures, Canva, Deutsche Telekom
Команда~100 человек
FLUX.1 / FLUX.2 скачаны>500 млн раз
Используется вAdobe Photoshop, Canva, Picsart, Krea, Magnific

Martin Scorsese — тоже в списке пользователей FLUX-моделей. Это показывает диапазон: от производственных конвейеров Audi до кино.


Почему open weights — это потенциально большая история

FLUX.1 Dev вышел с Apache 2.0-like лицензией и стал стандартом для enterprise image-генерации. Adobe Photoshop встраивает FLUX. Picsart. Canva. Тысячи команд строят на этих весах.

FLUX 3 Dev с открытыми весами запланирован на конец 2026. Если лицензия будет такой же пермиссивной — это может стать «Stable Diffusion для видео»: первая открытая мультимодальная модель, которую форкнут, файнтюнят и встроят во все возможные инструменты.

Ни Runway, ни Luma, ни Kling не обещают открытых весов. Sora (OpenAI) тоже закрытая. FLUX 3 Dev может занять уникальную нишу.

Но пока это обещание. Без даты, без информации о лицензии, без технических деталей.


Честно про ограничения — что вызывает скепсис

Ничего нельзя потрогать. Video и Action — gated early access. Image — «скоро». Dev — «конец 2026». Публичного API нет, цен нет, весов нет.

Бенчмарки self-reported. Без независимой верификации 93% над Luma — сильное заявление, но только заявление.

52% против новых лидеров. Против Gemini Omni Flash и Seedance 2.0 — статистическая ничья. Не хуже, но и не лучше.

720p в тестах. Конкуренты уже показывают 1080p и 4K. Максимальное разрешение FLUX 3 не объявлено.

FLUX 3 Image не показан. А именно за image-качество FLUX любят и используют. Отсутствие примеров — странно.

Обещание видеомодели было в 2024. BFL обещали видео ещё два года назад. Это наконец произошло, но история ожиданий есть.


Что делать прямо сейчас

Вы...Что делать
Медиа, кино, рекламаПодать заявку на early access — bfl.ai
Разработчик / исследовательЖдать FLUX 3 Dev (конец 2026), следить за bfl.ai
Робототехника, производствоСледить за mimic robotics, early access на Action
Дизайнер / маркетологЖдать FLUX 3 Image — обещают «скоро»
Строите продукт на image-генерацииИзучить интеграцию FLUX.1 / FLUX.2 уже сейчас

FAQ

Почему FLUX 3 важен если его нельзя использовать?
Архитектурный прорыв — unified обучение на видео+аудио+изображениях+роботах — значим независимо от доступности. Если FLUX 3 Dev выйдет с открытыми весами, это изменит экосистему так же, как FLUX.1 изменил image-генерацию.

Нативный звук — в чём реальная разница?
Когда звук добавляется отдельно (Runway, Luma, Kling), он не «знает» физику того, что происходит на экране. FLUX 3 знает: обучена на видео с физикой мира. Звук удара следует из физики удара. Это принципиально другое качество синхронизации.

FLUX-mimic реально работает или это маркетинг?
Audi подтвердили публично и с именем конкретного человека (Christoph Schneider, Audi Production Lab). Роботы в реальном цехе, реальные задачи. Это не стенд на выставке.

Если у Luma и Runway уже есть аудио — в чём преимущество FLUX 3?
У конкурентов аудио добавляется пост-обработкой, отдельной моделью. В FLUX 3 — один проход. Разница в физической точности синхронизации и в том, что звук следует из понимания физики, а не из pattern-matching.

Когда FLUX 3 можно будет запустить локально?
FLUX 3 Dev (открытые веса) — конец 2026. Детали лицензии и требования к железу не объявлены. FLUX.1 Dev работал на потребительских GPU — есть основание надеяться на похожее.

Это лучше Veo 3.1?
По бенчмаркам BFL 52% против Gemini Omni Flash (на той же технологии что Veo) — ничья. Veo 3.1 доступен прямо сейчас по $4/10 сек, FLUX 3 — нет. До публичного запуска и независимых тестов сравнивать бессмысленно.


Глоссарий

Latent diffusion — архитектура генеративных моделей, работающая не с пикселями напрямую, а со сжатыми представлениями (latent space). Изобретена командой BFL, лежит в основе Stable Diffusion и большинства image-генераторов.

Diffusion Transformer (DiT) — архитектура нейросети, сочетающая диффузионный процесс с transformer-блоками. Используется в FLUX 3.

Self-Flow — метод BFL (март 2026): одновременно улучшает качество генерации и делает внутренние представления модели структурированными для downstream-задач.

Flow-matching — метод обучения генеративных моделей, альтернатива диффузии. Задаёт «поток» трансформации шума в данные.

Нативный звук — аудио, генерируемое в одном проходе вместе с видео, а не добавляемое отдельно пост-обработкой.

FLUX-mimic — продукт BFL + mimic robotics: action decoder читает внутренние представления FLUX 3 и переводит их в движения роботов.

Unified architecture — единая архитектура для нескольких модальностей. FLUX 3 — один набор весов для видео, аудио, изображений и действий роботов.

Human preference — метод оценки: людям показывают два вывода модели (без указания, какая модель что сделала) и просят выбрать лучший. 93% означает, что FLUX 3 выбирали в 93% попарных сравнений с Luma.

Sample efficiency — способность модели хорошо работать при ограниченном объёме обучающих данных. FLUX-mimic работает даже с замороженным бэкбоном FLUX 3.

Early Access (gated) — закрытый ранний доступ: нужно подать заявку, компания решает, кого пускать.


Официальный сайт BFL и заявка на early access — bfl.ai. Разбор от VentureBeat — venturebeat.com. Детали архитектуры — The Decoder. FLUX-mimic — mimic-robotics.com.

Смотрите каталог AI-инструментов для генерации видео и медиа на VibeCoderz — там актуальные сравнения всех видеогенераторов.

Вопросы по выбору инструментов для медиа и контент-продакшена — к Максиму.


Обновлено: 28 июля 2026. Источники: bfl.ai, VentureBeat, TechCrunch, The Decoder, Decrypt, MarkTechPost, Hugging Face, Value Add VC.

All Posts

Автор

Максим Наговицын
Максим Наговицын

Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу

2026/07/29

10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.

Об авторе →

Читать далее

📢 Новость

Claude Code: новый CLI-агент от Anthropic

Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.

2026/02/27
📝 Конспект

Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов

Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.

2026/02/28
📝 Конспект

YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026

Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.

2026/02/28
📝 Конспект

Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода

Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.

2026/02/28
📝 Конспект

Vk Fast Cash Strategy

Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех

2026/02/28