模型01
FLUX 3 横跨图像、视频、音频与动作预测
Black Forest Labs 发布 FLUX 3,以统一多模态架构覆盖图像、视频、音频与动作预测,视频进入早期访问。统一媒体与动作有机会减少构思、运动与声音之间的转换损失,但能力广不等于制作可控。替换专用模型前,应分别测试参考遵循、时序与局部编辑。
模型层变得更宽,制作证据也变得更长:FLUX 3 用一套架构连接四种模态,Luma 展示群像角色,OVERGROWN 则记录一部 300 多镜头影片的制作过程。
Black Forest Labs 发布 FLUX 3,以统一多模态架构覆盖图像、视频、音频与动作预测,视频进入早期访问。统一媒体与动作有机会减少构思、运动与声音之间的转换损失,但能力广不等于制作可控。替换专用模型前,应分别测试参考遵循、时序与局部编辑。
Luma 展示一组群像角色,让他们看起来在当前画面之前与之后都仍有生活。多角色连贯性比单一主角更难,因为服装、视线与空间关系必须同时成立。测试群像工作流时应加入正反打与重新站位,而不只看一张合影,并记录每个角色由哪份参考控制。
Google Flow 展示 Henry Daubrez 的 13 分钟影片《OVERGROWN》:制作六个月、超过 300 个镜头,每个镜头都从图像开始。这些数字揭示长篇 AI 影片的真实成本:连续性、筛选与收尾会在数百个决定中累积。团队应按通过镜头与修改轮次做预算,而不是按生成次数,并保留每条视频的首帧谱系。