FLUX 3: un solo modello per immagini, video e audio

Black Forest Labs ha lanciato FLUX 3, il primo modello della famiglia FLUX che va oltre la generazione di immagini. Un'unica architettura genera immagini, video con audio nativo (fino a 20 secondi) e action prediction, addestrata congiuntamente su tutte le modalità. Non sono tre modelli con un brand in comune: è un solo set di pesi che produce video, immagini, audio e predizioni di azione robotica.
Perché riguarda chi fa vibe coding
Per un progetto indie o un MVP, la generazione di media è spesso il collo di bottiglia: hero image, demo video, clip per i social, screenshot stilizzati. Di solito si salta tra un tool per le immagini, uno per il video, uno per l'audio. FLUX 3 vuole coprire tutto da un solo punto di generazione.
Video con audio nativo: clip fino a 20 secondi con audio sincronizzato (dialoghi, effetti, ambience) nella stessa generazione. Niente post-produzione audio separata, niente lip-sync da allineare. Supporta dialoghi multilingua nella stessa scena. Sul lato immagini: editing con immagini e video di riferimento, testo accurato in più lingue e script, stili diversi (fotorealismo, illustrazione, 3D, line art). Gli input sono flessibili: text-to-video, image-to-video, video-to-video, keyframe-to-video, estensione di video+audio esistenti. I tester riportano fino a 10 media di riferimento, ma BFL non l'ha confermato ufficialmente.
C'è anche l'agentic chaining: concatenazione di più generazioni in sequenze multi-shot con coerenza di personaggi e scene, utile per storyboard e video esplicativi. E la tipografia, un punto debole storico di tutti i modelli video, che qui dovrebbe essere migliorata grazie al training congiunto con dati immagine.
Come funziona: Self-Flow
FLUX 3 è costruito su Self-Flow (pubblicato da BFL a marzo 2026), un approccio che allinea generazione e comprensione multimodale nella stessa architettura. Le immagini insegnano struttura spaziale, il video insegna dinamica temporale e fisica, l'audio rivela relazioni causali tra eventi e suoni. Addestrati insieme, i vincoli reciproci tra modalità producono output più coerenti. Il suono di un vetro che si rompe corrisponde all'impatto visivo perché il modello li ha imparati insieme, non separatamente.
Stato attuale
- FLUX 3 Video (+ audio nativo opzionale): Early Access gated, aperto a tutti previa approvazione. Accesso da bfl.ai/models/flux-3.
- FLUX 3 Image: previsto "nelle prossime settimane".
- FLUX 3 Action: solo partner selezionati (Mimic Robotics, testato su task produttivi Audi). Non disponibile al pubblico.
- FLUX 3 Dev (open weights): confermato per il 2026, arriva per ultimo. Sarà il primo Dev multimodale (video, audio, immagini, action), non solo immagini come i predecessori. Nessuna licenza o data precisa.
- Nessun pricing pubblicato, nessun accesso API pubblico, nessun peso scaricabile al momento.
Benchmark: preliminari
BFL ha pubblicato confronti di preferenza umana su clip 10s 720p text-to-video con audio:
- vs Luma Ray 3.2: 93%
- vs Runway Gen-4.5: 77%
- vs Grok Imagine Video: 69%
- vs Kling v3 Pro: 60%
- vs Happy Horse v1: 59%
- vs Seedance 2.0 e Gemini Omni Flash: 52%
I numeri descrivono un checkpoint pre-release, non il modello in Early Access. Metodologia, sample size e rater non sono stati pubblicati. E i margini sotto il 5% (52% vs Seedance/Omni) sono statisticamente fragili: "sostanzialmente alla pari" è l'interpretazione corretta.
Il contesto competitivo
FLUX 3 non è l'unico modello video con audio: Sora 2 e Veo 3.1 lo supportano, ma con pipeline separate o aggiornamenti successivi. Il punto di FLUX 3 è la generazione congiunta in un solo passaggio di inferenza. Seedance 2.5 (in arrivo) offre 30 secondi in 4K con 50 input di riferimento, più lungo ma senza audio nativo. Kling v3 Pro ha un'API stabile e collaudata. Runway Gen-4.5 è integrato in una suite creativa completa.
Per chi deve scegliere oggi: FLUX 3 se l'audio nativo e la coerenza multimodale sono prioritari; Kling o Runway se serve un'API stabile e un ecosistema maturo; Seedance se la durata massima conta di più.
Chi c'è dietro
BFL è il team dei creatori di Stable Diffusion (Rombach, Blattmann, Esser). Circa 100 persone tra Freiburg e San Francisco. Valutazione $3,25B, $450M+ da a16z, Nvidia, Salesforce Ventures, Canva, Adobe Ventures. Certificati ISO 27001 e SOC 2 Type II. FLUX già alimenta feature generative in Adobe Photoshop, Picsart e altri. Tra i partner di testing di FLUX 3: Canva, Krea, Picsart, Magnific (ex Freepik), Burda. Martin Scorsese è advisor.
In breve
- FLUX 3: un solo modello per immagini, video+audio nativo (20s) e action prediction
- Early Access Video aperto ora (gated, previa approvazione); Image in arrivo; Dev open weights entro fine 2026
- Nessun pricing, nessuna API pubblica, nessun peso scaricabile al momento
- Benchmark preliminari su checkpoint pre-release, senza metodologia pubblica
- Costruito su Self-Flow: training congiunto multimodale per coerenza tra modalità
📌 Questo articolo riassume una discussione su r/vibecodingitalia. Leggi il post originale.

Scritto da
Michael Gasperini@TheStreamCode
Founder & Sviluppatore
Founder di Vibe Coding Italia, la community italiana sull'intelligenza artificiale. Progetta e sviluppa prodotti con l'AI e ne racconta l'applicazione pratica attraverso guide e articoli.
Claude Fable 5.1 è disponibile: più forte di Fable 5 nei benchmark, più economico sulle workload agentiche
Claude Fable 5.1 è disponibile: più forte di Fable 5 nei benchmark, cache read al 75% in meno, Mythos 5.1 riservato ai programmi verificati. Numeri e limiti.
Leggi articoloHerdr: il runtime che tiene vivi i vostri coding agent anche quando chiudete il terminale
Herdr è il runtime open source che sposta i terminali degli agenti su un server: chiusure e riavvii non fermano più Claude Code e Codex. Windows nativo.
Leggi articoloPaseo: gestire Claude Code, Codex e gli altri coding agent da telefono, browser e terminale
Paseo è l'orchestratore open source e self-hosted per dirigere i coding agent da desktop, mobile, web e CLI: 39 agenti supportati e relay cifrato.
Leggi articolo



