7 月 23 日 · 快讯

FLUX 3 统一媒体与动作,300 镜头 AI 影片显露真实连续性成本

模型层变得更宽,制作证据也变得更长:FLUX 3 用一套架构连接四种模态,Luma 展示群像角色,OVERGROWN 则记录一部 300 多镜头影片的制作过程。

模型01

FLUX 3 横跨图像、视频、音频与动作预测

Black Forest Labs 发布 FLUX 3,以统一多模态架构覆盖图像、视频、音频与动作预测,视频进入早期访问。统一媒体与动作有机会减少构思、运动与声音之间的转换损失,但能力广不等于制作可控。替换专用模型前,应分别测试参考遵循、时序与局部编辑。

来源 Black Forest Labs @bfl_ai · 2026.07.23

案例02

Luma 展示一组在单帧之外仍有存在感的角色

Luma 展示一组群像角色,让他们看起来在当前画面之前与之后都仍有生活。多角色连贯性比单一主角更难,因为服装、视线与空间关系必须同时成立。测试群像工作流时应加入正反打与重新站位,而不只看一张合影,并记录每个角色由哪份参考控制。

来源 Luma AI @LumaLabsAI · 2026.07.23

案例03

《OVERGROWN》做到 13 分钟与 300 多个镜头

Google Flow 展示 Henry Daubrez 的 13 分钟影片《OVERGROWN》:制作六个月、超过 300 个镜头,每个镜头都从图像开始。这些数字揭示长篇 AI 影片的真实成本:连续性、筛选与收尾会在数百个决定中累积。团队应按通过镜头与修改轮次做预算,而不是按生成次数,并保留每条视频的首帧谱系。

来源 Google Flow @FlowbyGoogle · 2026.07.23