学习模式

【提示词创作第六十七节】AI资产怎么做,画面才稳定?

19小时前 资产稳画面 作者:西瓜
AI资产
提示词创作
人物一致性
场景一致性
道具资产
色板资产
四视图
工作流
导语:很多人做AI视频时,会把问题全部归结到提示词上。

人物变脸了,就觉得是提示词不够精准。
场景变乱了,就继续往提示词里加“保持一致”。
打斗不好看,就把“激烈”“电影感”“震撼”这些词写得更满。
色彩不统一,就在后面补一句“高级配色”。

但真正做过完整项目的人都知道,提示词只能解决一部分问题。

如果前期没有资产,AI每一张图、每一个镜头都像是在重新猜。它不知道这个角色的正脸是什么样,不知道侧脸比例是否一致,不知道服装背面有没有图案,不知道房间左边是什么、右边是什么,也不知道一个技能释放出来到底是什么形态。

所以AI视频想稳定,不是先写一段很长的提示词,而是先把AI需要理解的信息准备好。

这就是AI资产的意义。

AI资产不是随便找几张参考图,也不是把好看的图放进文件夹里。它更像是给AI建立一套“视觉说明书”。这套说明书告诉AI:角色是谁,长什么样,穿什么衣服,在什么空间里活动,会使用什么道具,整体色彩应该保持什么方向。

当这些信息足够清楚时,提示词才会真正发挥作用。

这一节我们就从零开始讲清楚,AI资产到底该怎么做,人物、场景、道具、色板分别要准备什么,以及最容易踩的坑在哪里。

一、为什么AI创作一定要先做资产


很多人刚开始做AI视频时,都会有一个误区:以为一张角色图就能生成一整条片子。

比如你生成了一个很满意的女主,正脸好看,服装也不错,然后直接拿这张图去做后面的所有镜头。第一张可能还可以,第二张侧脸开始变,第三张背影衣服变了,第四张动作一大,脸直接换成另一个人。

这不是模型故意不听话,而是你给它的信息太少。

AI看到一张图时,它只能知道这个角色在这个角度、这个光线、这个表情下大概长什么样。它并不知道这个人的侧脸结构,也不知道后脑勺发型,不知道衣服背面细节,更不知道她运动时表情该怎么变化。

所以你写“同一个女孩”“保持人物一致”“same character”,只能起到很有限的作用。

真正有效的方法,是在前期把角色拆成可控资产。

人物要有脸部资产、妆造资产、表情动作资产。

场景要有多角度资产和空间布局。

道具要有实体道具和虚拟道具。

色板要有颜色、属性和使用场景。

这样AI生成时,不是在凭空想象,而是在已有视觉资料里做延展。

这也是为什么越复杂的AI视频,越不能只依赖一句提示词。提示词负责下达任务,资产负责提供依据。没有依据,提示词写得再漂亮,也很容易失控。



二、人物资产:先让AI认清楚这个人是谁


人物资产是所有AI资产里最重要的一类。

因为观众对人物变化最敏感。场景里的椅子变一点,观众不一定马上能发现,但人物的脸型、眼睛、发型、气质一变,观众一眼就会觉得不对。所以你想让AI稳定生成同一个角色,第一步不是直接做视频,而是先把这个角色的人物资产建立出来。

很多人理解人物资产时,会停留在“有一张角色图就够了”。但实际上,一张图只能告诉AI这个角色在某一个角度、某一种光线、某一个状态下长什么样。它并不能完整告诉AI,这个人的正脸结构是什么,侧脸骨骼是什么,背面发型是什么,服装正反面又分别是什么样。

这也是为什么很多人第一张图做得很好看,到了第二张、第三张就开始变脸。因为AI没有真正“认清楚”这个人,它只是在根据一张图去猜。

所以人物资产的核心,不是一张图,而是一套能让AI读懂人物结构的信息板。

1.制作人物资产之前,先准备一张基础人物图

在做人物资产之前,你首先要有一张清晰的人物图片,作为后续生成资产的基础图。

这张图不一定非要来自参考图,也可以先通过前面的课程方法去生成一个原创角色。如果你手里还没有稳定的人物基础图,可以先通过【提示词创作第六十五节:不用参考图,也能捏出原创AI角色脸】(点击跳转)的方法,先做出一张你满意的人物正面图。等这张图的人脸、气质、发型和基础妆造都确定下来之后,再进入人物资产制作阶段。

这张就是我的人物图

这里要注意,基础人物图最好满足几个条件。

第一,人脸要清晰。
第二,发型和头部轮廓要明确。
第三,服装最好有一定识别点。
第四,画面不要太花,尽量避免过重的氛围特效、过强的镜头光斑和太复杂的背景。

因为这张图不是最终成片,它更像是后面所有资产的“母图”。母图越清晰,后面转出来的资产越稳定。

2. 用 nanobanan pro 把人物图转成四视图资产

当你有了一张稳定的人物基础图之后,下一步就可以使用 nanobanan pro(工具入口可参考这个教程https://www.super-i.cn/info-2796.html),把这张图转化为人物资产图。

这一步的目的,不是简单“换个版式”,而是把一个角色拆解成更适合AI读取的信息结构。也就是说,你要让AI不只看到“这个人很好看”,而是看到“这个人正脸长什么样、侧脸长什么样、服装结构是什么样、背面造型又是什么样”。

目前你这里可以直接用两套模板。它们都能做人物资产,但用途和优缺点不一样。

模板一:横版四视图

一张正脸大图 + 全身三视图

这是比较标准的一套人物资产模板。它的结构很直观:左边是一张精细正脸特写,右边是正面、侧面、背面三张全身图。

它适合刚开始搭建人物资产时使用,因为信息结构清楚,AI也比较容易理解。

提示词如下(直接使用上面的主图使用nanobanan pro去生成):

“生成图中人物的真人形象四视图,白底图,左侧部分展示了角色的精细真人特写肖像。其面部特征、骨骼结构、神态表情、发型及头部配饰必须与参考图严格一致,呈现自然的皮肤纹理、毛孔和发丝细节,高解析保留毛孔、细纹、绒毛、眉睫、发际线碎发与皮肤受光后的微小起伏,不磨皮、不锐化过头、不做人像美容,摄影棚质感,需要完全正脸,无动作,真人定妆照。右侧部分展示了该角色完全相同的全身真人照片,呈标准 A-pose 站姿,并以精确的三视图排列:正视图、侧视图和背面图。超模的身体比例、完整的服装设计、布料层次、鞋子及整体穿搭风格必须严格遵循。所有服装和配饰均呈现真实的物理材质质感。”

优点

这套模板的优点,是结构标准,生成逻辑比较稳定。左侧的大正脸可以帮助AI固定五官结构,右侧的全身三视图可以帮助AI理解角色的身体比例、服装轮廓和背面造型。如果你只是想先快速建立一个角色基础资产,这套模板是够用的。


缺点
但它也有一个明显缺点,就是它只有一张大正脸,没有侧脸大图。这样一来,后续在生成视频时,如果镜头转到半侧脸或者侧脸,AI有时还是会自己补结构,导致人脸一致性下降。

另外,右侧那张纯侧视图虽然在理论上是三视图的一部分,但它在很多实际视频生成场景里利用率并不高。因为纯正侧面的人体站姿参考,在镜头里并不是最常见的使用角度,很多时候它只是“存在”,但不一定真正高频被用到。也正因为这样,这整张图的信息利用率其实不算最高。

所以这套模板更像是一个标准版、基础版人物资产。它很适合入门,也很适合角色初步建档,但如果你后面非常看重人脸一致性,它还不算最优解。

模板二:上方双头像,下方服装正背面

两张大头像 + 放大的服装主体图

第二套模板,就是现在更推荐的版本。因为它把信息利用率做得更高,也更符合后续视频生成的实际需求。

这套模板的逻辑很清楚(直接使用上面的主图使用nanobanan pro去生成):

上方三分之一,用两张大头像,分别展示正脸和侧脸。
下方三分之二,用两张服装与身体参考图,左边是放大的正面服装主体图,右边是完整背面全身图。

提示词如下:

生成图中人物的真人形象设定四视图,灰色摄影棚背景,整体为专业真人角色定妆参考板,规整排版,干净简洁,不是海报,不是杂志大片,不要剧情动作,不要复杂场景。

整体版式严格分为上下两部分:上半部分占画面高度三分之一,下半部分占画面高度三分之二。
上方区域展示两张精细真人面部特写,左侧为正面面部特写,右侧为侧面面部特写。两张特写都以头部与肩颈为主,构图紧凑,清晰展示人物五官、骨骼结构、妆容、发型、头饰与神态。人物面部特征、发型、妆造、头部配饰必须与参考形象严格一致。皮肤质感真实自然,保留毛孔、细纹、绒毛、眉睫、碎发与皮肤受光后的细微起伏,不磨皮,不过度锐化,不做人像美容,呈现高解析真人摄影棚定妆照质感。

下方区域展示两张身体与服装参考图,左右排列。

左侧图片必须是放大后的正面服装展示图,人物采用标准 A-pose 站姿。
这一张图的重点不是完整全身入镜,而是“人物尺度明显放大”,让角色在画面中占据更大比例。
左侧图片必须使用更近距离的正面取景,人物从肩颈下方开始入画,到鞋子结束,头部因画面放大而被完整裁切到画面之外。
请注意,这张图不是普通远距离全身照,而是近距离放大的正面服装图:人物身体在画面中的占比要明显更大,上半身与下半身都要被放大展示,整体视觉效果像时装定妆板中的服装主体展示图。
人物双肩、双臂、双手、躯干、腰部、腿部、鞋子必须完整保留,画面边缘只允许裁掉头部,不能裁掉手、脚或身体主体。
左侧这张图必须比右侧背面图看起来更“近”、更“满”、更“放大”,让服装细节和身体比例更突出。
禁止把左侧图做成普通小比例全身图,禁止人物在左侧图中显得太小,禁止头部仍然留在画面内,禁止只裁掉半个头或留出下巴、嘴巴、鼻子、头发边缘。

右侧图片为背面全身图,标准 A-pose,完整展示从头部到鞋子的背面全身。人物背对镜头,完整保留背面头部、发型背部、服装背面结构、鞋子与整体轮廓,用于展示角色背面造型。右侧这张图为常规完整背面全身展示,人物比例正常,不需要像左图那样放大裁切。

下方两张图必须为同一个人物、同一套服装、同一组配饰、同一身体比例。整体保持超模感修长比例,但不要夸张变形。服装设计、布料层次、鞋子、穿搭风格、服装结构与配饰样式必须严格遵循原图。所有服装与配饰都要呈现真实物理材质质感,布料有自然褶皱、垂坠和厚薄变化,金属有真实反光,皮革、丝绸、纱质等材质表现真实自然。若原图服装为开叉长裙,则左侧正面放大图中人物可自然一条腿向前迈出半步,以展示开叉结构和露腿效果,但整体仍需保持定妆照式稳定姿态,不要做走秀动作。

光线只使用干净统一的摄影棚三点式打光:正左侧主光,正右侧辅助光,后右侧轮廓光。不要杂乱光效,不要彩色灯光,不要强氛围特效。背景为纯净灰色无缝影棚背景。

严格要求:
上方两张脸部特写占画面上三分之一。
下方两张身体图占画面下三分之二。
左下图必须是“放大后的正面服装展示图”,人物在画面中的占比明显更大,头部因近距离取景被完整裁切出画面。
右下图必须是完整背面全身图。
禁止左下图做成普通比例全身小图。
禁止左下图出现任何头部信息。
禁止左右服装不一致。
禁止人物比例漂移。
禁止 AI 油腻感、塑料皮肤感、过度美颜感、廉价 CG 感。

这套模板的优势非常明显。

第一,它有两张大头像,一张正脸,一张侧脸。
这会比只有一张正脸更能帮助AI固定面部结构,尤其是当后续视频镜头涉及转头、侧拍、半侧脸特写时,人物一致性会更稳定。

第二,它把下方左侧的正面全身图做成了“放大版服装主体图”。
这一步其实非常关键。因为正脸在上方已经重复展示过一次了,如果下方还再放一张普通比例的正面全身图,那整张资产图会有一部分信息被重复占用。而你现在这个模板,直接把正面全身图的头部裁掉,只保留肩颈以下到鞋子的部分,相当于把版面空间腾出来,重点展示服装、身体比例和材质细节,这样信息利用率会更高。

第三,它保留了一张完整背面全身图。
这样角色背面的发型、服装结构、鞋子轮廓仍然被完整交代到了,不会因为追求脸部而丢失背面信息。

所以从实际使用角度来看,这套模板比第一套更适合后续视频生成。因为它更重视“人脸稳定”和“版面利用率”,而不是机械地追求标准三视图。

3. 这两套模板该怎么选

如果你只是刚开始做角色建档,想先快速得到一套标准版人物资产,那第一套模板可以直接用。它的结构简单,比较适合做基础版角色资料页。

但如果你的目标是后续做视频,尤其是要做多镜头、多景别、包含人物近景和侧脸镜头的内容,那么第二套模板明显更实用。因为它在同一张图里放进了更高价值的信息:正脸大图、侧脸大图、放大的服装主体图和完整背面全身图。这样AI在后续读取时,会更容易抓住人物的面部结构和服装细节。

你可以把两者理解成两种不同方向的资产页。

第一套更偏“标准建档”。
第二套更偏“面向视频生成优化”。



三、妆造资产:不是一套衣服,而是同一个角色的造型库


妆造资产的作用,不是固定角色只穿一套衣服,而是为同一个角色建立不同的服装造型。

因为一个角色在完整视频里,往往会出现在不同场景中。比如日常场景、运动场景、工作场景,或者一些特殊剧情场景。这时候角色可以换衣服,但不能换人。也就是说,不管服装怎么变,这个人的脸、发型、身材比例和整体气质都要保持一致。

所以妆造资产的核心,不是重新做一个新角色,而是在同一个角色的基础上,扩展出不同服装版本。

这一类资产的制作并不复杂,步骤其实很简单。

第一步,先准备一张这个角色的全身图。
这张全身图可以直接基于第二章已经做出来的人物角色生成。先让这个角色有一张清晰、稳定的全身图,白底或者灰底都可以,站姿尽量标准,方便后面做服装替换。

提示词比较简单(使用你的人物去生成全身图 模型nanobanan pro):

生成这个人物的全身图。并且保持超模的身材比例

第二步,替换成你需要的其他服装。

比如你想让这个角色有日常装、运动装、职场装,或者战斗装,就可以基于这张全身图,分别把服装替换成你需要的版本。这里要注意的是,替换的只是衣服,不是人物本身。也就是说,脸、发型、身材比例和角色气质都不要变,变的只是服装和配饰。

提示词比较简单(使用全身图与你的服装去生成 模型nanobanan pro):

将图1的妆造替换成图2的一整套妆造,保持超模的身材比例

第三步,把换好服装的全身图,再按照第二章的方法生成四视图。
也就是说,每一套服装都要重新做一张对应的四视图资产。这样AI后面在生成视频时,才会知道这个角色穿这套衣服时,正面是什么样,侧面是什么样,背面又是什么样。

比如你做了三套造型:
一套日常装,
一套运动装,
一套正式装。

那就分别为这三套造型,各自生成一张四视图。这样你后面需要哪个场景,就调用哪一套妆造资产,而不是临时让AI去猜“这个角色换了什么衣服”。

所以妆造资产的逻辑其实很直接:

先有同一个角色的全身图,
再替换不同服装,
最后按照第二章的方法,把每一套服装都做成四视图。



四、表情和动作资产


很多人做静态角色还可以,一到视频就崩。

原因是角色没有表情和动作资产。

AI并不知道这个人笑起来是什么样,生气时眉眼怎么变化,奔跑时身体姿态如何,打斗时表情是紧张还是冷静。你不告诉它,它就会套用模型里最常见的表演方式。

所以第三类人物资产,是表情和动作资产。

表情资产解决的是角色的情绪一致性。
动作资产解决的是角色的动作连续性。

1. 表情资产:让角色的情绪不变脸

表情资产主要用来固定角色在不同情绪下的面部变化。

一个完整的角色,不可能永远只有一个表情。她可能有自然状态、微笑、专注、惊讶、疑惑、疲惫、紧张、生气、冷漠、痛苦、释然等不同状态。如果你不提前做表情资产,后面生成视频时,AI就会按照它默认的人脸表演方式去补。

这就容易出现一个问题:表情是有了,但人物不像了。

比如你想让一个清冷型角色微笑,结果AI把她生成成甜妹笑容。
你想让一个成熟角色紧张,结果AI把五官挤得很夸张。
你想让一个角色愤怒,结果AI直接把脸做成漫画式怒吼。

这些都说明,表情没有被资产化。

表情资产的制作方式也很简单。你可以基于前面已经做好的角色图,让AI生成一张表情九宫格或者十六宫格。重点不是让每个表情都很夸张,而是让每个表情都符合角色本身的气质。

提示词可以这样写:

基于参考图中的同一个人物,生成一张真人角色表情资产图,灰色摄影棚背景,九宫格或十六宫格规整排版。所有表情都必须保持同一个人物的面部特征、脸型比例、五官结构、发型轮廓、妆容和年龄感完全一致。每一格展示一种不同表情状态,包括自然、专注、轻微微笑、疑惑、惊讶、紧张、疲惫、冷静、皱眉、生气、释然等。表情变化要真实克制,不要夸张漫画化,不要大幅改变五官比例,不要变脸,不要过度美颜,不要塑料皮肤感。画面为真实摄影棚定妆照质感,光线干净统一,背景简洁,重点展示同一个角色在不同情绪下的面部反应。

做表情资产时,要注意一个关键点:表情不要越多越好,而是要和你的剧情有关。

如果你做的是生活流剧情,可以多做自然、疑惑、轻微笑、疲惫、失落、释然。
如果你做的是动作片,可以多做专注、警觉、紧张、吃力、愤怒、冷静。
如果你做的是悬疑片,可以多做观察、怀疑、压抑、惊讶、恐惧、沉思。
如果你做的是爱情片,可以多做克制微笑、回避眼神、犹豫、委屈、释然、心动。

表情资产不是为了堆满情绪,而是为了让角色在需要表演的时候,不会突然变成另一个人。

2. 动作资产:先让AI帮你拆动作,再去生成图鉴

动作资产解决的是另一个问题:动作有没有体系。

很多人做动作画面时,会直接写“激烈打斗”“快速闪避”“电影感动作戏”。但这样写出来的动作通常比较散,前后不连贯,也很难形成一套可以复用的动作参考。

所以动作资产更好的制作方式,不是自己一张一张硬想动作,而是先把你的剧情想法交给AI,让AI自动帮你拆成一套16宫格动作图鉴方案。

比如你可以先输入一个想法:

女特工在雨夜地下停车场被一名壮汉伏击,她没有武器,只能利用闪避、反关节、膝击、摔投和现场杂物反击。整体要像现代动作电影,黑暗、冷峻、真实,不要血腥。请帮我生成16宫格动作招式图鉴的提示词。

然后再接上下面这段总提示词:

你是一名电影动作分镜设计师和视觉提示词工程师。用户会输入一个剧本、片段或简单想法。你的任务是把它转化为一套“动作招式图鉴海报”的图像生成方案。

要求:
1 根据剧本提取核心冲突、人物关系、场景、情绪和动作风格。
2 将动作拆成16个连续分镜,每个分镜只表现一个清晰动作瞬间。
3 每个分镜需要包含:编号、招式名、画面描述、动作视觉重点、单图生成提示词。
4 提示词只描述电影画面,不写真实伤害教学步骤。
5 保持人物服装、场景、光线、镜头风格统一。
6 生成图片时不要要求模型生成中文文字,文字用于后期排版。
7 最后输出一个总海报排版提示词,以及标题、副标题、每格招式名和简短说明。

输出格式:
海报主题
整体视觉设定
人物设定
场景设定
16格动作分镜
每格单图提示词
海报排版提示词
后期文字内容

如果用户的输入不是动作戏,也要把它转化为相同结构的图鉴式分镜,例如追逐图鉴、谈判图鉴、恐怖逃生图鉴、悬疑线索图鉴、恋爱互动图鉴等。
适合不同题材的变体公式:

动作片:
角色A与角色B在某场景中发生近身冲突,拆成16个攻防动作,黑红硬核图鉴。

悬疑片:
侦探在某场景中发现线索,拆成16个观察、推理、追踪、对峙镜头,黑红案件图鉴。

恐怖片:
主角在某空间中躲避怪物,拆成16个惊吓、逃跑、藏匿、发现真相镜头,黑红生存图鉴。

科幻片:
角色在未来设施中执行任务,拆成16个装备使用、潜入、战斗、逃离镜头,蓝黑科技图鉴。

爱情片:
两人在某个情绪场景中关系变化,拆成16个眼神、靠近、误会、和解镜头,柔和电影分镜图鉴。

输入之后,AI会先帮你分析这个片段的核心冲突、人物关系、场景气氛和动作风格,然后把它拆成16个连续动作分镜。每一格都会有一个明确动作瞬间,以及对应的单图生成提示词。

使用gpt image2.0生成

当然,这个方法不只适合打斗。

如果你的内容是追逐戏,它可以变成追逐图鉴。
如果你的内容是悬疑戏,它可以变成线索图鉴。
如果你的内容是恐怖戏,它可以变成逃生图鉴。
如果你的内容是爱情戏,它也可以变成互动图鉴。

所以动作资产的本质,不是单纯做打斗招式,而是把一个剧情片段拆成一套可视化分镜资产。



五、场景资产:不要只给AI一张好看的空间图


场景资产经常被忽略。

很多人以为,场景只要生成一张好看的大图就够了。比如一个房间、一条街道、一间办公室、一座废墟。问题是,当你开始切镜头时,AI并不知道这个空间的完整结构。

第一镜头里门在左边,第二镜头门可能跑到右边。
第一镜头桌子靠窗,第二镜头桌子可能消失。
第一镜头人物从门口走进来,第二镜头空间布局完全变了。

这就是场景一致性的问题。

想解决它,场景资产不能只有单图,而要有多角度图。

一个比较稳定的方法是做九宫格场景资产。前八张是场景的不同角度,最后一张是平面布局图。

前八张可以包括:正面视角、反打视角、左侧视角、右侧视角、入口视角、角落视角、俯视局部、关键道具近景。

最后一张平面布局图,用来告诉AI空间结构,比如门在哪里、窗在哪里、桌子在哪里、人物可以从哪里走到哪里。

场景资产怎么做

第一步,先明确你要什么场景。

比如你想做一个“女主独自在旧公寓里寻找线索”的悬疑短片场景,那你就先告诉AI:

我要一个旧公寓室内空场景,用于悬疑短片。场景要真实、安静、压抑,不要恐怖片式夸张布景。空间里需要有客厅、玄关、旧沙发、茶几、窗帘、半开的房门、散落文件、老照片、台灯、鞋柜和一些生活痕迹。整体感觉像一个人刚刚离开不久。

第二步,把你的需求和下面这套提示词模板一起交给AI。

也就是说,你先和AI说你要什么场景,然后再把这整套模板一起发给它。这样AI就会直接帮你整理出一整套完整的场景提示词。

下面这段就是可直接使用的模板示例:

按照以下模板结合我想法给我一套场景提示词。
乒乓球馆空场景:《漂亮但不会打》

生成一套 现代室内乒乓球馆轻喜剧短剧空场景设计参考图,整体采用生活流电影美术风格与影视级场景设计语言,建筑可视化与短剧场景设计结合,完整展示室内乒乓球馆、绿色乒乓球桌、球网、地胶、长椅、置物区、饮水区、散落乒乓球、球拍、运动包、拍摄机位、空间关系与平面布局。画面中不要出现任何人物、路人、人影、背影、人体剪影、手、脸。
场景设定为女主第一次打乒乓,表面想拍出运动生活感,实际全程接不到球的轻喜剧空场景。整体气质平淡、无趣、真实生活流,带轻微自嘲娱乐感。以绿色乒乓球桌与场边长椅作为视觉核心,重点展示球到处乱飞后的痕迹:桌角旁散落的乒乓球、靠墙的球拍、半瓶水、运动包、擦汗纸巾、歪放的毛巾、地面滚远的球。 场景采用社区室内球馆或普通运动中心设计,冷白顶灯、绿色球桌、深色地胶、白色边线、墙面防撞软包、场边长椅、储物柜、饮水机、运动包置物区。空间包含入口、更衣/置物区、主球桌区、隔壁球桌区、长椅休息区、饮水区、捡球动线。整体空间真实合理,不要专业大赛场馆,不要观众席,不要夸张竞技灯光。 时间设定为白天或傍晚室内,顶灯冷白,窗边有少量自然光,整体低饱和、干净、生活化。灯光在球桌表面、球网、地胶和白色乒乓球上形成柔和高光。画面具有 Kodak Portra 400 胶片色彩,微偏绿暖调 Teal & Warm Amber,轻微颗粒,柔焦,真实运动馆空气感。
采用 3×3 九宫格布局:
室内乒乓球馆主空间完整广角全景
绿色乒乓球桌、球网、地胶完整空间关系
球馆入口与置物区视角
场边长椅、运动包、半瓶水、毛巾休息区
主球桌旁散落乒乓球与球拍的中景空镜
从球桌对面反向看向长椅和饮水区
乒乓球、球拍、擦汗纸巾、半瓶水道具特写
地面滚远的球、桌角、球网、运动包细节组合
场景平面布局图,标注入口、主球桌、隔壁球桌、长椅、置物区、饮水区、捡球动线、演员预留运动路线
Architectural Visualization,
Film Production Design,
Modern Chinese Slice of Life Comedy,
Empty Indoor Table Tennis Hall,
Community Sports Center,
Cinematic Environment Concept Art,
Sports Hall Scene Bible,
Photorealistic,
Kodak Portra 400,
Teal Warm Amber,
Global Illumination,
Ultra Detailed,
Cinematic Composition,
Scene Bible,
Masterpiece

Negative Prompt:人物、路人、人影、背影、人体剪影、手、脸、运动员、观众、拥挤人群、比赛现场、专业竞技赛场、卡通、二次元、游戏场景、过度梦幻、廉价影楼、塑料质感、文字错误、水印、logo、字幕、高饱和霓虹、赛博朋克。

第三步,让AI直接输出一套场景提示词。

这一步你不用自己再手动拆。因为当你把需求和模板一起交给AI之后,它就会自动按这个结构,帮你整理成一套完整的场景生图提示词。

第四步,把AI输出的提示词拿去 image2.0 生成图片。

直接把这整套提示词输入 image2.0,就可以开始生成场景资产图。



六、道具资产:重要道具不要让AI临时猜


除了人物、妆造和场景,道具也是AI视频里很容易出问题的一类资产。

很多人做视频时,会把道具直接写进提示词里。比如“人物拿着一个绿色包包”“桌上放着一瓶水”“地上有一个球拍”“角色手里拿着某个产品”。如果这个道具只是偶尔出现一次,问题可能不大。但如果它会在视频里反复出现,或者会被人物拿起、放下、使用、携带,那它就不能只靠一句提示词临时生成。

因为AI每次生成时,都会重新理解这个道具。

所以只要一个道具在视频里有明确作用,就应该提前单独做成资产。

实体道具最常用的制作方式,就是三视图。

也就是正面、侧面、背面,必要时再加一个局部细节特写。

道具资产的制作步骤也很简单。

第一步,先确定这个道具是不是重要道具。
如果它只是背景里一闪而过的小物件,可以不用单独做。
但如果它会被人物拿在手里,或者会影响剧情、动作、镜头衔接,那就需要做成资产。

第二步,生成这个道具的三视图。
画面最好使用白底或者浅灰底,不要复杂场景,不要人物手持,不要强氛围光。因为这一张图的目的不是出片,而是把道具结构交代清楚。

第三步,如果道具有关键细节,就额外生成局部特写。

提示词也非常简单,只需要在网络上找一张你所需道具图片,随后使用nanobanan pro生成:

生成一个实体道具三视图资产图,白色或浅灰色背景,展示【填写道具名称】的正面、侧面、背面,并增加一个局部细节特写。道具整体造型、颜色、材质、比例和关键结构必须保持统一。

虚拟道具

虚拟道具不是现实里能被人物拿起的物品,而是一些会出现在画面里的技能、招式、攻击轨迹、能量效果、烟雾、光效、UI界面或者特殊视觉元素。

比如角色打出一道光刃,不只是“有一道光”,而是有起手、蓄力、挥出、轨迹、命中、消散这些阶段。

比如一段打斗招式,也不是单独一个姿势,而是前后连续的动作关系。

所以虚拟道具更适合放到前面的动作资产里,用16宫格动作图鉴的方法去拆。

简单来说,实体道具用三视图解决,虚拟道具用16宫格动作图鉴解决。

看得见、摸得着、能被人物拿起的物品,就做成实体道具三视图。带动作过程、技能变化、攻击轨迹和视觉节奏的内容,就放进动作资产里,用连续图鉴的方式让AI理解。



七、色板资产:不要只放几块颜色,要让AI知道颜色怎么用


很多人做色板,就是随便放几块好看的颜色。

比如蓝色、黄色、灰色、白色排在一起,然后告诉AI“使用这个色板”。但实际生成时,画面还是会乱。因为AI不知道这些颜色谁是主色,谁是辅助色,谁应该出现在人物身上,谁应该出现在背景里,谁应该控制暗部,谁又应该作为视觉焦点。

所以真正有用的色板资产,不是简单的颜色拼贴,而是一份清楚的色彩使用说明。

它至少要包含三层信息。

第一层,是颜色本身。
也就是具体色值或色彩方向,比如深蓝、暖黄、灰绿、米白、暗棕。

第二层,是颜色的视觉属性。
比如这个颜色是主色、辅助色、点缀色,还是阴影色。它是干净、沉稳、明亮、复古、冷峻,还是柔和。

第三层,是颜色的使用场景。
比如深蓝用于背景和暗部,暖黄用于人物衣服和视觉焦点,米白用于皮肤受光和墙面反射,灰绿色用于环境阴影。

如果没有第二层和第三层,色板就只是颜色展示。AI不知道主次,也不知道使用范围。

色板资产的制作方式,大致有两种。

第一种,是从电影参考里提取色板。

这个方法适合你已经有明确的视觉方向。比如你想要某种电影里的冷峻感、复古感、夏日感、压抑感、荒凉感,或者都市生活流质感。这个时候不要只找一张图,而是尽量找多张同一风格的电影画面作为参考。

因为单张参考图容易有偶然性。
可能这一张刚好是夜景,这一张刚好有强逆光,这一张刚好有某个特殊道具颜色。
如果你只从一张图里提取色板,很容易把偶然颜色当成整体风格。

更好的做法是,找多张同一风格的电影参考图,然后让AI观察它们的共同点。

分析截图的提示词如下:

你现在是一名电影调色师、视觉美术指导和AI视频色板设计师。

我会上传多张电影画面参考图。请你不要逐张分析,也不要从每张图里分别提取颜色,而是从所有参考图中提取共同的色彩规律,帮我生成一套适合AI视频创作使用的电影色板资产方案。

注意:
色板数量控制在7个颜色。
每个颜色必须输出标准HEX色值,格式必须为 #RRGGBB。
不要输出过多颜色,不要超过7个。
不要只输出5个颜色,色彩层次需要足够完整。
不要把单张图里偶然出现的小面积颜色当成核心色。
不要提取随机颜色,要提取多张参考图共同形成的色彩逻辑。
色板标注只需要包含:颜色类型、HEX色值、使用场景。
不要在色板标注里写长段解释,不要写复杂理论,不要写过多文字。

请严格完成以下任务:
第一步:整体色彩分析
请分析这些参考图共同的视觉特征,包括:
整体冷暖倾向
明暗关系
饱和度高低
对比度强弱
暗部偏色
高光偏色
肤色表现
背景主色
点缀色
画面情绪

第二步:提取7个核心色板
请提取7个核心颜色,分别为:
1. 主色 用于画面最大面积的背景、环境或整体基调。
2. 辅助色 用于人物服装、家具、空间材质或画面中等面积区域。
3. 暗部色 用于阴影、画面边缘、空间纵深和压暗区域。
4. 高光色 用于光源、反光、受光面、皮肤亮部或画面提亮区域。
5. 肤色区 用于人物面部、手部、身体受光区域,保持真人肤色自然。
6. 环境反射色 用于墙面反光、地面反光、空气感、环境偏色和整体统一。
7. 点缀色 用于小面积视觉焦点,比如道具、灯光、服装局部、线索物或画面记忆点。
每一种颜色只需要包含:
颜色类型: HEX色值: 使用场景:
第三步:生成色彩使用规则
请告诉我这套色板在AI视频画面中应该如何使用,包括:
主色应该用于哪些大面积区域 辅助色适合出现在哪里 暗部色如何控制画面层次 高光色如何控制真实光感 肤色区如何保持人物自然真实 环境反射色如何统一画面 点缀色如何避免过量 哪些颜色可以大面积使用 哪些颜色只能小面积使用 哪些颜色需要避免
第四步:生成AI色板资产图提示词
请基于以上分析,帮我写一段可以直接用于 image2.0 生成“电影色板资产图”的完整提示词。
这张色板资产图只包含7个核心色块:
主色 辅助色 暗部色 高光色 肤色区 环境反射色 点缀色
每个色块旁边只标注三类信息:
颜色类型 HEX色值 使用场景
不要出现长段说明。 不要出现复杂设计理论。 不要出现过多文字。 不要出现人物、场景、海报构图。 整体画面要像专业电影美术色板参考图,干净、规整、实用,适合用于AI视频创作。
第五步:输出格式
请严格按照以下格式输出:
一、参考图整体色彩规律
二、7色核心色板
1. 主色 HEX色值: 使用场景:
2. 辅助色 HEX色值: 使用场景:
3. 暗部色 HEX色值: 使用场景:
4. 高光色 HEX色值: 使用场景:
5. 肤色区 HEX色值: 使用场景:
6. 环境反射色 HEX色值: 使用场景:
7. 点缀色 HEX色值: 使用场景:
三、色彩使用规则
四、适合 image2.0 的色板资产图提示词
五、Negative Prompt

第二种,是在你已经有剧本的情况下,让AI顺着对话直接生成色板提示词。

这个方法适合你还没有明确电影参考,但你已经知道故事内容、人物关系、场景气质和情绪方向。比如你已经写好了一个短片剧本,知道它是悬疑、轻喜剧、爱情、动作、科幻,或者生活流短剧。这个时候就可以直接让AI根据剧本,帮你生成一套适合这个故事的色板方案。

你可以这样和AI对话:

你现在是一名电影美术指导、电影调色师和AI视频色板设计师。
我会提供一个剧本、短片设定、故事梗概或场景想法。请你根据内容中的故事类型、人物关系、场景气质、情绪方向和视觉风格,帮我生成一套适合AI视频创作使用的电影色板资产方案。
注意:
色板数量控制在7个颜色。
每个颜色必须输出标准HEX色值,格式必须为 #RRGGBB。
不要输出过多颜色,不要超过7个。
不要只输出5个颜色,色彩层次需要足够完整。
不要给随机颜色,要根据剧本的情绪、场景、人物和叙事需求生成色彩逻辑。
色板标注只需要包含:颜色类型、HEX色值、使用场景。
不要在色板标注里写长段解释,不要写复杂理论,不要写过多文字。
这套色板要服务整条AI视频,而不是单张海报。

请严格完成以下任务:
第一步:剧本视觉分析
请根据我提供的剧本或故事设定,分析以下内容:
故事类型 核心情绪 人物关系 主要场景 时间氛围 画面气质 适合的电影色彩方向 整体冷暖倾向 明暗关系 饱和度高低 对比度强弱 适合的光线风格
第二步:生成7个核心色板

请生成7个核心颜色,分别为:

1. 主色
用于画面最大面积的背景、环境或整体基调。

2. 辅助色
用于人物服装、家具、空间材质或画面中等面积区域。
3. 暗部色
用于阴影、画面边缘、空间纵深和压暗区域。

4. 高光色
用于光源、反光、受光面、皮肤亮部或画面提亮区域。

5. 肤色区
用于人物面部、手部、身体受光区域,保持真人肤色自然。

6. 环境反射色
用于墙面反光、地面反光、空气感、环境偏色和整体统一。

7. 点缀色
用于小面积视觉焦点,比如道具、灯光、服装局部、线索物或画面记忆点。

每一种颜色只需要包含:

颜色类型:
HEX色值:
使用场景:

第三步:生成色彩使用规则

请告诉我这套色板在AI视频画面中应该如何使用,包括:

主色应该用于哪些大面积区域
辅助色适合出现在哪里
暗部色如何控制画面层次
高光色如何控制真实光感
肤色区如何保持人物自然真实
环境反射色如何统一画面
点缀色如何避免过量
哪些颜色可以大面积使用
哪些颜色只能小面积使用
哪些颜色需要避免

第四步:根据镜头类型生成使用建议

请分别说明这套色板在以下镜头中的使用方式:

人物特写
中近景对话
室内场景
室外场景
动作镜头
情绪镜头
空镜
道具特写
结尾镜头

第五步:生成AI色板资产图提示词

请基于以上分析,帮我写一段可以直接用于 image2.0 生成“电影色板资产图”的完整提示词。
这张色板资产图只包含7个核心色块:

主色
辅助色
暗部色
高光色
肤色区
环境反射色
点缀色

每个色块旁边只标注三类信息:

颜色类型
HEX色值
使用场景

不要出现长段说明。 不要出现复杂设计理论。 不要出现过多文字。 不要出现人物、场景、海报构图。 整体画面要像专业电影美术色板参考图,干净、规整、实用,适合用于AI视频创作。

第六步:输出Negative Prompt

请输出一段适合这套色板资产图使用的Negative Prompt,用来避免高饱和霓虹、廉价影楼感、塑料质感、过度梦幻、杂乱颜色、错误文字、水印、logo、字幕等问题。

输出格式如下:

一、剧本视觉分析

二、7色核心色板

1. 主色
HEX色值:
使用场景:

2. 辅助色
HEX色值:
使用场景:

3. 暗部色
HEX色值:
使用场景:

4. 高光色
HEX色值:
使用场景:

5. 肤色区
HEX色值:
使用场景:

6. 环境反射色
HEX色值:
使用场景:

7. 点缀色
HEX色值:
使用场景:

三、色彩使用规则

四、不同镜头中的色彩使用建议

五、适合 image2.0 的色板资产图提示词

六、Negative Prompt

如果你要更稳定,也可以把两种方法结合起来。

先用多张电影参考提取色彩方向,确定整体风格。
再把你的剧本、人物、场景和情绪告诉AI,让AI根据这个方向生成更适合项目的色板提示词。
最后再用 image2.0 生成一张色板资产图。



八、最后一步:把资产标注清楚,交给视频模型使用


前面我们已经讲完了人物资产、妆造资产、表情动作资产、场景资产、道具资产和色板资产的制作方式。

但资产做好以后,不是把所有图片一股脑丢给视频模型就结束了。

真正关键的一步,是让AI知道:每一张资产图分别是干什么的。

把资产上传进去,然后用文字把每一张资产的身份标注清楚。

比如你上传了一张人物四视图,就不要只说“参考这张图”。你要告诉AI:

这张图是女主的人物身份资产,用来保持脸部特征、发型、身材比例和整体气质一致。

如果你上传的是妆造资产,就要标注:

这张图是女主的运动造型资产,用来保持这场戏里的服装、鞋子、配饰和整体穿搭一致。

如果你上传的是表情资产,就要标注:

这张图是女主的表情资产,本镜头需要参考其中“尴尬但强装镇定”的表情状态,表情要克制,不要夸张喜剧化。

如果你上传的是动作16宫格,就要标注:

这张图是动作资产, 作为人物打斗的动作参考

如果你上传的是场景九宫格,就要标注:

这张图是场景资产, 作为乒乓球场景的视觉锚定。

如果你上传的是实体道具三视图,就要标注:

这张图是道具资产,用来保持绿色运动包的形状、颜色、材质、拉链位置和肩带结构一致。本镜头中运动包放在长椅旁边,不需要人物手持。

如果你上传的是色板资产,就要标注:

这张图是整条视频的色板资产,用来统一画面色彩。主色用于环境背景,暗部色用于空间边缘,高光色用于灯光和反光,点缀色只用于小面积道具,不要生成高饱和霓虹色。

简单来说:

资产负责稳定,标注负责调用,提示词负责镜头。



结尾


AI创作发展到现在,提示词已经不是单独存在的能力。

真正稳定的画面,往往来自“资产”和“提示词”的配合。

提示词决定你要生成什么,资产决定AI凭什么生成。
提示词决定方向,资产决定边界。
提示词负责表达创意,资产负责控制结果。

如果你只是想生成一张图,可以靠灵感和描述。
但如果你想做一条完整视频、一个系列角色、一套品牌视觉,资产就是绕不开的基础。

所以从这一节开始,不要再把所有问题都丢给提示词。



速用卡

角色设计执行卡

把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。

一句话重点

这节课不是让你照着参考图抄脸,而是围绕「AI资产怎么做,画面才稳定?」把原创角色脸拆成结构、比例、五官主次和妆造记忆点。

落地顺序

按原文节奏走最稳:先吃透「为什么AI创作一定要先做资产」,再把「人物资产:先让AI认清楚这个人是谁」定住,接着处理「妆造资产:不是一套衣服,而是同一个角色的造型库」;最后用「表情和动作资产」收口。

照着做清单
  1. 先把「为什么AI创作一定要先做资产」里说的脸型或气质定住。
  2. 围绕「人物资产:先让AI认清楚这个人是谁」收一收五官,不要让每个部位都抢戏。
  3. 按「妆造资产:不是一套衣服,而是同一个角色的造型库」去统一气质,不要只改表面。
  4. 把「表情和动作资产」这一点先定准,再往下走。
  5. 先把「场景资产:不要只给AI一张好看的空间图」提到的误区排掉,别踩同一坑。
  6. 先把「道具资产:重要道具不要让AI临时猜」提到的误区排掉,别踩同一坑。
最容易踩坑

不要直接套真人脸或影视角色脸;不要把所有五官都做成强特征,否则容易撞脸、割裂、不稳定。

成品自检

检查角色是否有清晰记忆点;年龄感和气质是否一致;换妆造后脸是否稳定;是否不像任何明确真人或影视角色。

可直接复制的万能模板
请围绕「AI资产怎么做,画面才稳定?」帮我做一个可直接执行的方案。
我的目标是:【填写你的具体目标】
我的素材/产品/角色信息是:【填写已有素材和限制】

请输出:角色定位、脸型方向、三庭五眼比例、五官主次、妆造记忆点、完整生图提示词。要求原创、有辨识度、避免撞脸和网红脸。