一个关键词,可能把整张图带偏
给 AI 一句「一个人戴着护士帽」,生成的画面可能连护士服、医院一起带出来。把提示改成「不戴护士帽」,医院还在。安全帽容易带出工地,圣诞帽带出节日布景,厨师帽带出后厨。否定了帽子,也未必能消除这个词带来的场景联想。
参考视频把这类现象称为「提示词污染」。用大白话理解,就是某个关键词把模型带进了熟悉的画面组合,连不需要的东西也一起出现了。
手机打游戏就是一个例子。想画男生在地铁里玩手机,结果手机屏幕却朝着观众,人物像在反着拿手机。画面强调了「游戏」需要被看见,人物和手机的关系反倒画错了。
把动作换成能看见的姿势
遇到这种偏差,可以先删掉容易引起联想的词,直接描述画面。
一个男生在地铁里,双手横向拿着手机。「打游戏」换成了握手机的姿势。男生、地铁和手机都保留着,画面不必再费劲展示手机上运行的游戏。
类似的做法也适用于身材。想让穿着衣服的人显得身材好,写「八块腹肌」可能把画面引向露出腹部、直接展示肌肉。换成「肩宽腰窄」,强调的是衣服下仍能看出的轮廓,更贴近原本的画面要求。
电脑屏幕的方向也容易出问题。「一个男生在电脑前修图」可能把显示器正面转向观众,方便展示修图内容。参考视频还给了一个反向尝试:把人物的描述改成「看向显示器背面」。这句话按人的理解并不顺,但在素材演示的结果里,反而纠正了屏幕方向。
这类反向描述适合留作某个模型画错时的试法。正常的朝向描述能生效,就直接把人物、屏幕和镜头的位置说清楚。
背影和视线,拆成两件事描述
「宇航员背对镜头望向地球」听起来很明确,出图却可能变成侧身,甚至露出正脸。
从画面上看,「背对镜头」需要背部、背包和头盔后侧;「望向」又容易让画面强调眼睛、面罩和脸。两套特征挤在一起,侧身就成了同时容纳它们的一种结果。
把人物朝向和环境分开写会更直接:
一个宇航员站在月球上,背对着镜头。
远方的太空中悬浮着一颗地球。画面需要表现的是宇航员的背影和远处的地球。删掉「望向」,不必再靠正脸或眼睛交代视线。
参考视频把这种用具体视觉特征表达抽象要求的现象称为「视觉代偿」。这个说法适合帮助观察画面偏差,不能直接当成对模型内部计算过程的证明。
改景别时,写清楚要放大的细节
想拉近宇航员的镜头,可以增加对胸前生命支持设备、面罩和服装缝线的描述。这些细节需要在画面里占据足够的位置,才容易被展示出来。
想要脸部特写,就把描述集中到面罩和五官上。全身、远处环境和细小的面部特征同时写得很重,容易让画面重点打架。
| 目标画面 | 可以着重描述的可见部分 |
|---|---|
| 更近的人物镜头 | 胸前设备、面罩、衣服缝线 |
| 面部特写 | 面罩、五官 |
| 从上方俯拍 | 头顶、肩膀、氧气瓶、顶部接头 |
「特写」「中景」「全景」这些镜头词仍然可以用。结果没达到预期时,再补充目标镜头下真正可见的东西,通常比重复强调拍摄角度更有调整方向。
提示词怎样参与生成过程
图片可以表示成一组数字,视频又包含连续的画面。把这些数字组合起来,就能把一张图或一段视频理解成高维空间里的一个点。大部分随意组合的数字只能得到噪声,生成模型要学习的是怎样得到接近训练数据、看起来合理的结果。
以扩散模型的训练为例,先给图像加入已知的噪声,再让模型根据带噪图像、时间步和文字描述预测噪声。把预测与实际加入的噪声比较,用误差训练模型。生成时从随机噪声开始,经过多轮计算得到画面。
实际处理的也未必是原始像素。VAE 可以先把画面压缩到潜在表示,模型在这个表示上计算,完成后再解码回画面。这样能减轻直接处理大量像素的负担。
这类生成过程可以采用 Transformer 作为模型结构,常见名称是 DiT。还有流匹配等不同训练方式,不能把所有视频模型都当成同一种噪声预测流程。
同样是提示词,视频还要对上时间
「生成一段太空大战」给模型留了很大的发挥空间。飞船怎么排列、爆炸出现在什么位置、镜头怎么移动,都可以有许多种结果。只要看起来像太空大战,就有机会被接受。
换成一段普通的人物镜头,要求逐字说出台词,再让口型和手势卡准每个时间点,难度就会变高。人物少、场景简单,仍然可能因为一句话或一个动作没对上而整段不能用。
评价 AI 视频的难度,可以先看允许有多少种合格结果。参考视频用「解空间」解释这种差别:宽泛要求能接受的结果多,精确要求能接受的结果少。这里的空间是理解生成过程的比喻,画面简单并不代表要求宽松。
参考图和参考视频,让要求更具体
文字之外,参考素材也能约束生成结果。参考视频以 Seedance 2.0 为例,演示了把多张图片指定为主体参考、把另一张图作为场景参考,再让一段视频提供动作参考的用法。
这些参考素材补足了只靠文字难以说清楚的外观、场景和动作。模型有更明确的目标,生成结果就更容易接近设想。
参考条件有用,严格对齐每个细节仍然是另一层要求。角色像参考图,动作像参考视频,和每个动作都在指定时刻准确发生,验收难度差得很远。条件更具体,也不能简单理解成一定更难生成;它既能帮助模型定位目标,也会提高对结果的要求。
台词、数数和科普动画,难在配合
宽泛的场面可以接受很多种变化。精确的台词要核对每个字;数数配手势,要让声音、数字顺序和手指动作同时对应;科普动画则要求图形、文字和讲解在正确的时间出现。
这些内容里,一个细节错了就可能改变意思。图形多移动一点、数字跳错顺序,观众接收到的解释也会跟着出错。画面再好看,都补不了内容上的偏差。
参考视频演示了数数配手势等失败案例,并据此讨论当时模型的局限。这类例子适合用来理解精确控制的难点,不能据此断言所有模型永远做不到,也不能把它当成判断视频真假的可靠方法。
有些要求可以拆开完成。逐字台词可以先生成语音,再处理口型;需要精确控制的动画,可以用编程或传统动画工具制作。把任务交给可控的环节,通常比一直抽卡更容易保住内容。
按画面偏差修改提示词
构图时可以先列出镜头里要看见什么:人物露出哪一面,手怎么拿物件,屏幕朝向哪里,远处有什么。
生成后也按同样的顺序检查。手机方向错了,就改握持和屏幕朝向;人物不肯转过身,就减少对正脸、眼睛的强调;镜头不够近,就把描述集中到需要放大的部位。一次改一个画面关系,更容易看出是哪句话影响了结果。
按内容对画面的要求安排制作方式
有声小说的配图视频、创意短片或一闪而过的气氛镜头,通常能接受较大的视觉变化。AI 生成素材可以放在这些环节尝试,尤其是人工制作成本较高的场面。
讲解图、流程演示和严格跟随剧情的镜头,对画面和内容的关系要求更细。如果先生成画面,再为了迁就结果修改文案或剧情,作品就容易被素材带着走。对内容有明确安排时,先确定必须准确的部分,再决定哪些镜头适合生成,哪些需要单独制作。
学习 AI 视频的价值,也包括摸清这种边界。会生成某一类画面,门槛会随着工具普及而变化;选题、故事和表达还要由创作者决定。投入时间做内容时,把精力放到作品为什么值得看、哪些细节必须准确,比围着一种生成效果反复制作更有长期价值。
参考文献