
图片中的清晰文字
创作海报、产品图和社交媒体图片,文字清晰地嵌在画面里,支持多种风格和比例。
一个模型贯通图片、视频和音频,为真实的创作工作流而设计。
支持多种风格、比例和分辨率的图片生成与编辑,并计划支持在图片中渲染多语言文字。
计划生成最长 20 秒的视频,对白、音效和环境声在同一次生成中产出,并与画面动作对齐。
包括文生视频、图生视频、视频延展,以及使用关键帧控制从开头到结尾的运动。
图片、视频和音频由同一个模型处理,目标是在不同输出之间保持风格与角色一致。
Flux 3 面向人物表情、音画同步和多语言对白等复杂创作需求。
通过串联多个镜头,构建超过单条片段长度的连续场景。
图片生成、带声音的视频,以及跨镜头一致的角色。

创作海报、产品图和社交媒体图片,文字清晰地嵌在画面里,支持多种风格和比例。

把提示词或静态图片变成短视频,对白、音效和环境声已经就位,并和画面动作对齐。

在多个镜头和更长场景中,保持角色、光线和视觉风格一致。
用 Flux 3 生成图片和带声音的视频,只需三步。
选择想创作的内容,再用自然语言描述场景、风格和氛围。
选择画面比例;如果是视频,再设置时长和是否包含音频。
在浏览器中生成,预览结果,然后下载自带声音的图片或视频。
关于 Flux 3 的功能、视频、音频和使用方式的常见问题。
Flux 3 是一个多模态 AI 模型,在一个架构中处理图片、视频和音频。作为一款 AI 图片与视频生成器,它从静态图片扩展到带声音的完整场景,一句提示词就能生成一张图片,或一段配好声音的短视频。它在此前的 Flux 图片模型基础上,加入了视频和原生音频。
可以。Flux 3 生成最长 20 秒、自带原生音频的视频,对白、音效和环境声与画面内容同步。由于音频和视频一起生成,撞击声会落在对应的画面帧上,说话也会对上口型,无需单独做音频后期。
Flux 3 支持文生视频、图生视频、保持元素一致的视频转换,以及关键帧控制。文生视频只凭一句提示词,图生视频让静态图动起来,关键帧则用来设定镜头的开头和结尾。多个镜头还能串联成更长的连续片段。
本站目前尚未接入 Flux 3。它正处于早期访问推出阶段,我们会在获得稳定、受支持的接入方式后再开放生成功能。在此之前,你可以先用我们已上线的 AI 图片和视频生成器创作。
它的主要优势是音频与视频一起原生生成,而不是事后单独添加。由于一个模型同时贯通图片、视频和音频,声音、风格和角色在同一段场景里都能保持一致。很多其他工具是先生成一段无声视频,再让你自己配音或对轨。
早期评测使用了带音频的 10 秒 720p 视频,而 Flux 3 最长可生成 20 秒片段,并支持多种画面比例。本站正式开放后的分辨率和时长选项仍可能随推进而调整。