FLUX 3: un solo modello per immagini, video e audio

Black Forest Labs ha lanciato FLUX 3, il primo modello della famiglia FLUX che va oltre la generazione di immagini. Un'unica architettura genera immagini, video con audio nativo (fino a 20 secondi) e action prediction, addestrata congiuntamente su tutte le modalità. Non sono tre modelli con un brand in comune: è un solo set di pesi che produce video, immagini, audio e predizioni di azione robotica.
Perché riguarda chi fa vibe coding
Per un progetto indie o un MVP, la generazione di media è spesso il collo di bottiglia: hero image, demo video, clip per i social, screenshot stilizzati. Di solito si salta tra un tool per le immagini, uno per il video, uno per l'audio. FLUX 3 vuole coprire tutto da un solo punto di generazione.
Video con audio nativo: clip fino a 20 secondi con audio sincronizzato (dialoghi, effetti, ambience) nella stessa generazione. Niente post-produzione audio separata, niente lip-sync da allineare. Supporta dialoghi multilingua nella stessa scena. Sul lato immagini: editing con immagini e video di riferimento, testo accurato in più lingue e script, stili diversi (fotorealismo, illustrazione, 3D, line art). Gli input sono flessibili: text-to-video, image-to-video, video-to-video, keyframe-to-video, estensione di video+audio esistenti. I tester riportano fino a 10 media di riferimento, ma BFL non l'ha confermato ufficialmente.
C'è anche l'agentic chaining: concatenazione di più generazioni in sequenze multi-shot con coerenza di personaggi e scene, utile per storyboard e video esplicativi. E la tipografia, un punto debole storico di tutti i modelli video, che qui dovrebbe essere migliorata grazie al training congiunto con dati immagine.
Come funziona: Self-Flow
FLUX 3 è costruito su Self-Flow (pubblicato da BFL a marzo 2026), un approccio che allinea generazione e comprensione multimodale nella stessa architettura. Le immagini insegnano struttura spaziale, il video insegna dinamica temporale e fisica, l'audio rivela relazioni causali tra eventi e suoni. Addestrati insieme, i vincoli reciproci tra modalità producono output più coerenti. Il suono di un vetro che si rompe corrisponde all'impatto visivo perché il modello li ha imparati insieme, non separatamente.
Stato attuale
- FLUX 3 Video (+ audio nativo opzionale): Early Access gated, aperto a tutti previa approvazione. Accesso da bfl.ai/models/flux-3.
- FLUX 3 Image: previsto "nelle prossime settimane".
- FLUX 3 Action: solo partner selezionati (Mimic Robotics, testato su task produttivi Audi). Non disponibile al pubblico.
- FLUX 3 Dev (open weights): confermato per il 2026, arriva per ultimo. Sarà il primo Dev multimodale (video, audio, immagini, action), non solo immagini come i predecessori. Nessuna licenza o data precisa.
- Nessun pricing pubblicato, nessun accesso API pubblico, nessun peso scaricabile al momento.
Benchmark: preliminari
BFL ha pubblicato confronti di preferenza umana su clip 10s 720p text-to-video con audio:
- vs Luma Ray 3.2: 93%
- vs Runway Gen-4.5: 77%
- vs Grok Imagine Video: 69%
- vs Kling v3 Pro: 60%
- vs Happy Horse v1: 59%
- vs Seedance 2.0 e Gemini Omni Flash: 52%
I numeri descrivono un checkpoint pre-release, non il modello in Early Access. Metodologia, sample size e rater non sono stati pubblicati. E i margini sotto il 5% (52% vs Seedance/Omni) sono statisticamente fragili: "sostanzialmente alla pari" è l'interpretazione corretta.
Il contesto competitivo
FLUX 3 non è l'unico modello video con audio: Sora 2 e Veo 3.1 lo supportano, ma con pipeline separate o aggiornamenti successivi. Il punto di FLUX 3 è la generazione congiunta in un solo passaggio di inferenza. Seedance 2.5 (in arrivo) offre 30 secondi in 4K con 50 input di riferimento, più lungo ma senza audio nativo. Kling v3 Pro ha un'API stabile e collaudata. Runway Gen-4.5 è integrato in una suite creativa completa.
Per chi deve scegliere oggi: FLUX 3 se l'audio nativo e la coerenza multimodale sono prioritari; Kling o Runway se serve un'API stabile e un ecosistema maturo; Seedance se la durata massima conta di più.
Chi c'è dietro
BFL è il team dei creatori di Stable Diffusion (Rombach, Blattmann, Esser). Circa 100 persone tra Freiburg e San Francisco. Valutazione $3,25B, $450M+ da a16z, Nvidia, Salesforce Ventures, Canva, Adobe Ventures. Certificati ISO 27001 e SOC 2 Type II. FLUX già alimenta feature generative in Adobe Photoshop, Picsart e altri. Tra i partner di testing di FLUX 3: Canva, Krea, Picsart, Magnific (ex Freepik), Burda. Martin Scorsese è advisor.
In breve
- FLUX 3: un solo modello per immagini, video+audio nativo (20s) e action prediction
- Early Access Video aperto ora (gated, previa approvazione); Image in arrivo; Dev open weights entro fine 2026
- Nessun pricing, nessuna API pubblica, nessun peso scaricabile al momento
- Benchmark preliminari su checkpoint pre-release, senza metodologia pubblica
- Costruito su Self-Flow: training congiunto multimodale per coerenza tra modalità
📌 Questo articolo riassume una discussione su r/vibecodingitalia. Leggi il post originale.

Scritto da
Michael Gasperini@TheStreamCode
Founder & Sviluppatore
Founder di Vibe Coding Italia, la community italiana sull'intelligenza artificiale. Progetta e sviluppa prodotti con l'AI e ne racconta l'applicazione pratica attraverso guide e articoli.
Claude Opus 5 è disponibile: vicino a Fable 5, metà del prezzo
Anthropic rilascia Claude Opus 5: benchmark vicini a Fable 5 a $5/$25 per milione di token. Nuovo default su Max, Fast mode 2.5x, model ID claude-opus-5.
Leggi articoloIl Token Plan di Alibaba e la preview di Qwen 3.8 Max
Il Token Plan di Alibaba offre accesso multi-modello da 6$/mese. Qwen 3.8 Max (2.4T parametri) è in preview con crediti al 10% e sconto notturno dell'80%.
Leggi articoloQoder alza il tetto: dentro Cantus e Qwen3.8-Max
Qoder presenta Cantus, il modello proprietario per task agentici, e Qwen3.8-Max-Preview da 2,4 trilioni di parametri. Cosa sappiamo finora.
Leggi articolo



