23 июля 2026 немецкая лаборатория Black Forest Labs объявила о выходе FLUX 3. Это не просто новый видеогенератор — это первая в мире модель, обученная одновременно на видео, аудио, изображениях и управлении роботами в единой архитектуре. Один набор в…
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
23 июля 2026 немецкая лаборатория Black Forest Labs объявила о выходе FLUX 3. Это не просто новый видеогенератор — это первая в мире модель, обученная одновременно на видео, аудио, изображениях и управлении роботами в единой архитектуре. Один набор весов, который понимает мир как целое.
За три года до этого те же люди придумали latent diffusion — технологию в основе Stable Diffusion и большинства современных AI-генераторов изображений. FLUX.1 скачали больше 500 миллионов раз. Adobe Photoshop использует FLUX-модели.
Теперь они берут тот же подход и применяют его к видео, звуку и роботам одновременно. 93% предпочтения над Luma Ray 3.2 в собственных тестах. Роботы на заводах Audi, собирающие то, что классическая автоматизация не могла. И обещание открытых весов.
Но потрогать пока нельзя почти ничего.
FLUX 3 от Black Forest Labs (23 июля 2026) — первая мультимодальная foundation model: видео до 20 секунд с нативным аудио, изображения, предсказание действий роботов в одной архитектуре. 93% над Luma, 77% над Runway. Video и Action — early access. Image — скоро. Dev (открытые веса) — конец 2026. Цены не объявлены. В статье: архитектура, бенчмарки, FLUX-mimic на Audi, сравнение с конкурентами, когда что ждать.
Ссылки:
Три года назад появился Stable Diffusion — открытая модель для создания изображений по текстовому описанию. Те, кто его создали, потом основали Black Forest Labs и выпустили FLUX.1 — он стал новым стандартом для AI-генерации изображений в коммерческих продуктах (Adobe Photoshop, Canva, Picsart).
Параллельно появились Runway, Sora, Luma, Kling — модели, которые по текстовому описанию создают не картинку, а видеоклип. Проблема у всех одна: видео генерировалось отдельно, звук добавлялся отдельно и часто не совпадал с тем, что происходит на экране.
FLUX 3 — это попытка сделать иначе: одна модель видит мир целиком и создаёт видео со звуком за один проход. Плюс — неожиданно — управляет роботами.
Black Forest Labs дали своему подходу название: Real World Models.
Логика простая. Ни одна модальность по отдельности не даёт полной картины реального мира.
Изображение — это пространство в один момент времени. Видео добавляет время и то, как объекты движутся и взаимодействуют. Звук раскрывает причинно-следственные связи — по звуку удара можно понять массу предмета, по фоновому шуму — место. Язык соединяет всё это с целями и намерениями.
FLUX 3 обучается на всём одновременно. Звук должен совпадать с событием в кадре. Движение должно подчиняться физике. Будущее должно следовать из прошлого. Модель, которая это понимает, — не просто «делает красивое видео». Она понимает, как устроен мир.
И это же понимание, как выяснилось, нужно роботу для того, чтобы знать, как взять в руку кабель.
Техническая основа FLUX 3 называется Self-Flow. Метод опубликован BFL в марте 2026.
Стандартные генеративные модели — diffusion, flow-matching — оптимизированы на один показатель: качество финального вывода. Они генерируют красивое видео, но их внутренние представления о мире «запутаны» — не структурированы так, чтобы их можно было использовать для чего-то ещё.
Self-Flow решает обе задачи одновременно: улучшает качество генерации и делает внутренние features структурированными и пригодными для downstream-задач. Это и есть ключ к тому, почему одна архитектура работает и для видео, и для роботов.
FLUX 3 — diffusion transformer (DiT), обученный на:
Интересная деталь про звук: видео-предикшн занял больше 95% тренировочного времени. Аудио — меньше 0.5% токенов в типичном клипе. Когда модель научилась понимать физику мира через видео — она начала понимать звук почти «бесплатно». Звук удара следует из физики удара, которую модель уже знает.
Когда BFL добавили в обучение предсказание действий роботов — качество видео упало примерно на 10%. Это ожидаемо: модель теперь учится двум вещам одновременно.
Через ~3500 дополнительных шагов обучения модель восстановила полное качество видео — и при этом научилась предсказывать действия роботов. Это было неочевидно заранее.
Вывод: внутренняя репрезентация мира, которая нужна для генерации убедительного видео, — та же самая, которая нужна роботу чтобы понять, как двигаться. Это не случайное совпадение. Это показывает, что unified обучение на реальном мире даёт что-то большее, чем сумма частей.
| Продукт | Статус | Доступ |
|---|---|---|
| FLUX 3 Video | Early Access | Заявка на bfl.ai |
| FLUX 3 Action (FLUX-mimic) | Early Access | Только партнёры mimic robotics |
| FLUX 3 Image | «В ближайшие недели» | Не объявлено |
| FLUX 3 Dev | Конец 2026 | Открытые веса |
Цены не объявлены ни для одного тира.
Кто уже тестирует FLUX 3 Video: Canva, Burda, Magnific (ex-Freepik), Krea, Picsart. Adobe Photoshop уже использует предыдущие FLUX-модели.
| Режим | Что делает |
|---|---|
| Text-to-Video | Видео + аудио из текстового описания |
| Image-to-Video | Анимация из стартового кадра или изображений как референсов |
| Video-to-Video | Трансформация существующего видео в новый контекст |
| Generative Continuation | Продолжение видео и аудио |
| Keyframe-to-Video | Контролируемые переходы между ключевыми кадрами |
| Agentic Chaining | Склейка клипов в длинные multi-shot секвенции |
Максимальная длина: 20 секунд за генерацию. Это больше, чем большинство конкурентов. Столько же было у Sora, которую OpenAI закрыла.
Большинство видеогенераторов работают в два шага: сначала создают видео, потом добавляют звук отдельной моделью. Проблема: звук и картинка часто не совпадают по тайммингу, а «звук удара» не всегда звучит как удар конкретного предмета.
В FLUX 3 — один проход. Видео и аудио генерируются одновременно. Звук следует из физики: модель знает массу предмета, знает как он движется, поэтому знает как он звучит. Поддерживаются диалоги на нескольких языках с синхронизацией движений губ.
По заявлению BFL — особенно хорош в: точных человеческих мимиках и эмоциях, мультиязычном тексте на экране, типографике и анимированном дизайне, широком стилистическом диапазоне (от анимации до кинематографа).
Условия тестов: 10-секундные клипы, 720p, text-to-video с аудио. Human preference.
| Против кого | FLUX 3 preference |
|---|---|
| Luma Ray 3.2 | 93% — разгром |
| Runway Gen-4.5 | 77% — уверенная победа |
| Grok Imagine Video | 69% — сильный перевес |
| Kling v3 Pro | 60% — заметное преимущество |
| HappyHorse v1 / v1.1 | 57-59% — небольшое преимущество |
| Seedance 2.0 | 52% — статистически ничья |
| Gemini Omni Flash | 52% — статистически ничья |
FLUX 3 уверенно опережает «старых лидеров» — Runway и Luma, которые доминировали в 2025 году. 93% и 77% — это серьёзные цифры, даже со скидкой на self-reporting.
С новым поколением — Seedance 2.0 и Gemini Omni Flash — ничья. 52% статистически неотличимо от 50/50. FLUX 3 в топовой лиге, но не один на вершине.
Все результаты — внутренние тесты BFL, не независимый аудит. Методология не раскрыта: размер выборки, подбор промптов, критерии оценки неизвестны. Тесты на 10 секундах, не на максимальных 20. Для FLUX 3 Image бенчмарков нет вообще. BFL сами пишут: «модель и харнесс ещё в разработке, результаты preliminary».
Это самая неожиданная часть анонса — и, возможно, самая важная долгосрочно.
mimic robotics — стартап из Цюриха. Совместно с BFL они создали FLUX-mimic: систему, где лёгкий action decoder читает внутренние представления FLUX 3 (те же самые, что генерируют видео) и переводит их в движения роботов.
Не нужна отдельная робототехническая модель. Не нужно учить физику с нуля. FLUX 3 уже знает, как объекты движутся, как взаимодействуют, как меняются под воздействием — и робот использует эти знания напрямую.
Christoph Schneider из Audi Production Lab подтвердил: система развёрнута и протестирована в реальном производстве.
Задачи: сборка компонентов, вставка электроники, работа с мягкими материалами — уплотнителями, кабелями. Последнее особенно важно: мягкие деформируемые материалы — главная проблема классической промышленной робототехники. Их поведение непредсказуемо, жёсткое программирование не справляется.
Производительность: менее 80 мс латентности на одном RTX 5090. Полная система — 101 мс.
Цитата Audi: «Эти роботы решают сложные задачи манипуляции с мягкими материалами, которые были бы просто невозможны с обычной робототехникой».
| Модель | Макс. длина | Аудио | Разрешение | Цена 10 сек 720p | Доступность |
|---|---|---|---|---|---|
| FLUX 3 Video | 20 сек | ✅ Нативное | 720p (тесты) | ❓ Не объявлена | Early Access |
| HappyHorse 1.1 | 15 сек | ✅ Синхр. | 1080p | ~$1.82 | Доступна |
| Veo 3.1 | per-sec | ✅ | До 4K | $4.00 | Доступна |
| Veo 3.1 Fast | per-sec | ✅ | До 4K | $1.00 | Preview |
| Gemini Omni Flash | 10 сек | ✅ Нативное | 720p | $1.00 | Доступна |
| Runway Gen-4.5 | — | Раздельно | — | — | Доступна |
| Luma Ray 3.2 | — | Раздельно | — | — | Доступна |
| Kling v3 Pro | — | Раздельно | — | — | Доступна |
Главные отличия FLUX 3: единая архитектура (ни у кого нет), 20 секунд (одна из самых длинных генераций), нативный звук в одном проходе (в отличие от Runway/Luma/Kling), обещание открытых весов.
Главный минус: ничего нет в публичном доступе прямо сейчас.
BFL основана в августе 2024 в Фрайбурге — Robin Rombach и командой, которая создала latent diffusion (архитектура лежит в основе Stable Diffusion и большинства современных image-генераторов).
| Факт | Значение |
|---|---|
| Оценка | $3.25 млрд |
| Привлечено | >$450 млн |
| Инвесторы | a16z, NVIDIA, Salesforce, Adobe Ventures, Figma Ventures, Canva, Deutsche Telekom |
| Команда | ~100 человек |
| FLUX.1 / FLUX.2 скачаны | >500 млн раз |
| Используется в | Adobe Photoshop, Canva, Picsart, Krea, Magnific |
Martin Scorsese — тоже в списке пользователей FLUX-моделей. Это показывает диапазон: от производственных конвейеров Audi до кино.
FLUX.1 Dev вышел с Apache 2.0-like лицензией и стал стандартом для enterprise image-генерации. Adobe Photoshop встраивает FLUX. Picsart. Canva. Тысячи команд строят на этих весах.
FLUX 3 Dev с открытыми весами запланирован на конец 2026. Если лицензия будет такой же пермиссивной — это может стать «Stable Diffusion для видео»: первая открытая мультимодальная модель, которую форкнут, файнтюнят и встроят во все возможные инструменты.
Ни Runway, ни Luma, ни Kling не обещают открытых весов. Sora (OpenAI) тоже закрытая. FLUX 3 Dev может занять уникальную нишу.
Но пока это обещание. Без даты, без информации о лицензии, без технических деталей.
Ничего нельзя потрогать. Video и Action — gated early access. Image — «скоро». Dev — «конец 2026». Публичного API нет, цен нет, весов нет.
Бенчмарки self-reported. Без независимой верификации 93% над Luma — сильное заявление, но только заявление.
52% против новых лидеров. Против Gemini Omni Flash и Seedance 2.0 — статистическая ничья. Не хуже, но и не лучше.
720p в тестах. Конкуренты уже показывают 1080p и 4K. Максимальное разрешение FLUX 3 не объявлено.
FLUX 3 Image не показан. А именно за image-качество FLUX любят и используют. Отсутствие примеров — странно.
Обещание видеомодели было в 2024. BFL обещали видео ещё два года назад. Это наконец произошло, но история ожиданий есть.
| Вы... | Что делать |
|---|---|
| Медиа, кино, реклама | Подать заявку на early access — bfl.ai |
| Разработчик / исследователь | Ждать FLUX 3 Dev (конец 2026), следить за bfl.ai |
| Робототехника, производство | Следить за mimic robotics, early access на Action |
| Дизайнер / маркетолог | Ждать FLUX 3 Image — обещают «скоро» |
| Строите продукт на image-генерации | Изучить интеграцию FLUX.1 / FLUX.2 уже сейчас |
Почему FLUX 3 важен если его нельзя использовать?
Архитектурный прорыв — unified обучение на видео+аудио+изображениях+роботах — значим независимо от доступности. Если FLUX 3 Dev выйдет с открытыми весами, это изменит экосистему так же, как FLUX.1 изменил image-генерацию.
Нативный звук — в чём реальная разница?
Когда звук добавляется отдельно (Runway, Luma, Kling), он не «знает» физику того, что происходит на экране. FLUX 3 знает: обучена на видео с физикой мира. Звук удара следует из физики удара. Это принципиально другое качество синхронизации.
FLUX-mimic реально работает или это маркетинг?
Audi подтвердили публично и с именем конкретного человека (Christoph Schneider, Audi Production Lab). Роботы в реальном цехе, реальные задачи. Это не стенд на выставке.
Если у Luma и Runway уже есть аудио — в чём преимущество FLUX 3?
У конкурентов аудио добавляется пост-обработкой, отдельной моделью. В FLUX 3 — один проход. Разница в физической точности синхронизации и в том, что звук следует из понимания физики, а не из pattern-matching.
Когда FLUX 3 можно будет запустить локально?
FLUX 3 Dev (открытые веса) — конец 2026. Детали лицензии и требования к железу не объявлены. FLUX.1 Dev работал на потребительских GPU — есть основание надеяться на похожее.
Это лучше Veo 3.1?
По бенчмаркам BFL 52% против Gemini Omni Flash (на той же технологии что Veo) — ничья. Veo 3.1 доступен прямо сейчас по $4/10 сек, FLUX 3 — нет. До публичного запуска и независимых тестов сравнивать бессмысленно.
Latent diffusion — архитектура генеративных моделей, работающая не с пикселями напрямую, а со сжатыми представлениями (latent space). Изобретена командой BFL, лежит в основе Stable Diffusion и большинства image-генераторов.
Diffusion Transformer (DiT) — архитектура нейросети, сочетающая диффузионный процесс с transformer-блоками. Используется в FLUX 3.
Self-Flow — метод BFL (март 2026): одновременно улучшает качество генерации и делает внутренние представления модели структурированными для downstream-задач.
Flow-matching — метод обучения генеративных моделей, альтернатива диффузии. Задаёт «поток» трансформации шума в данные.
Нативный звук — аудио, генерируемое в одном проходе вместе с видео, а не добавляемое отдельно пост-обработкой.
FLUX-mimic — продукт BFL + mimic robotics: action decoder читает внутренние представления FLUX 3 и переводит их в движения роботов.
Unified architecture — единая архитектура для нескольких модальностей. FLUX 3 — один набор весов для видео, аудио, изображений и действий роботов.
Human preference — метод оценки: людям показывают два вывода модели (без указания, какая модель что сделала) и просят выбрать лучший. 93% означает, что FLUX 3 выбирали в 93% попарных сравнений с Luma.
Sample efficiency — способность модели хорошо работать при ограниченном объёме обучающих данных. FLUX-mimic работает даже с замороженным бэкбоном FLUX 3.
Early Access (gated) — закрытый ранний доступ: нужно подать заявку, компания решает, кого пускать.
Официальный сайт BFL и заявка на early access — bfl.ai. Разбор от VentureBeat — venturebeat.com. Детали архитектуры — The Decoder. FLUX-mimic — mimic-robotics.com.
Смотрите каталог AI-инструментов для генерации видео и медиа на VibeCoderz — там актуальные сравнения всех видеогенераторов.
Вопросы по выбору инструментов для медиа и контент-продакшена — к Максиму.
Обновлено: 28 июля 2026. Источники: bfl.ai, VentureBeat, TechCrunch, The Decoder, Decrypt, MarkTechPost, Hugging Face, Value Add VC.