现在的AI视频已经可以生成非常清晰的人脸、自然的皮肤纹理和相对复杂的人物动作,但很多作品仍然存在一个很难忽略的问题:单独截取其中一帧看,人物似乎没有什么明显错误,可一旦让画面真正运动起来,就会产生一种明显的“AI感”。
这种感觉并不一定来自模型能力不足,也不一定能够通过增加“8K、超高清、电影质感、细腻皮肤”这类词语解决。很多时候,真正影响人物真实感的,是人物在不同镜头中的身份是否稳定、所处的环境是否符合真实生活的视觉经验,以及人物在画面中有没有合理的事情可以做。
换句话说,AI视频中的“真实”并不只是画质问题,而是一整套人物、环境和行为之间的关系。
如果把一次AI视频生成看成一场虚拟拍摄,那么参考图更像演员和场地资料,而提示词真正承担的工作,其实已经非常接近导演。我们不仅需要告诉模型“画面中有什么”,还要进一步明确人物是谁、身处什么环境、为什么做出某个动作,以及这些动作按照什么顺序发生。
这一节,我们就从人物、场景、道具和时间轴几个部分,重新建立一套更适合真人类AI视频的提示词方法。
第一章:真实感不是画质,而是关系
在AI视频刚开始普及时,画质本身确实是一个重要问题,因此很多提示词模板都会加入“8K、高清、超真实、细腻纹理、电影级摄影”等描述。
随着模型能力不断提高,这些词并没有完全失去作用,但它们已经很难成为决定人物真实感的核心因素。
人类判断一段影像是否真实时,并不会只观察人物皮肤够不够清晰。我们还会无意识地观察很多关系,例如人物和环境之间是否匹配、身体动作有没有重量、视线有没有明确落点、动作之间有没有前因后果,以及人物换一个角度以后还是不是同一个人。
例如,一个女生坐在咖啡店里,如果她从头到尾只是保持标准坐姿、微笑并看向镜头,即使五官非常精致,画面依然容易像一段AI人物展示视频。
但如果她先低头看了一眼桌上的杯子,伸手握住杯柄,喝了一口咖啡,再把杯子重新放下,随后因为窗外有人经过而短暂抬头,这个人物就会立刻拥有更多生活中的状态。
所以真人感并不完全来自“人物有多完美”,反而来自大量符合现实规律的小细节。
这也是为什么制作真人类AI视频时,我们不能只把注意力放在人物长相和视觉风格上,而应该优先解决几个更加基础的问题:人物是否始终是同一个人,环境是否像真实存在的地方,人物为什么要在这个环境中行动,以及这些动作是否按照合理的顺序发生。
第二章:先锁定人物身份,再设计人物状态
人物一致性在真人AI视频中是最容易出现问题的环节之一,但在实际工作流中,它并不需要过度复杂化。
通常我们只需要准备人物的四视图(俩张人脸图,一张躯干侧脸图,一张背身图),作为基础参考素材,让模型明确“这个人长什么样”。在Seedance 2.5这类模型中,参考图本身已经具备较强的身份锁定能力,因此关键不在于额外增加复杂标注,而在于在提示词中明确“使用哪一张参考图对应哪个角色”,避免多人物时发生混淆

四视图提示词:
生成图中人物的真人形象设定四视图,灰色摄影棚背景,整体为专业真人角色定妆参考板,规整排版,干净简洁,不是海报,不是杂志大片,不要剧情动作,不要复杂场景。
整体版式严格分为上下两部分:上半部分占画面高度三分之一,下半部分占画面高度三分之二。 上方区域展示两张精细真人面部特写,左侧为正面面部特写,右侧为侧面面部特写。两张特写都以头部与肩颈为主,构图紧凑,清晰展示人物五官、骨骼结构、妆容、发型、头饰与神态。人物面部特征、发型、妆造、头部配饰必须与参考形象严格一致。皮肤质感真实自然,保留毛孔、细纹、绒毛、眉睫、碎发与皮肤受光后的细微起伏,不磨皮,不过度锐化,不做人像美容,呈现高解析真人摄影棚定妆照质感。
下方区域展示两张身体与服装参考图,左右排列。
左侧图片必须是放大后的正面服装展示图,人物采用标准 A-pose 站姿。 这一张图的重点不是完整全身入镜,而是“人物尺度明显放大”,让角色在画面中占据更大比例。 左侧图片必须使用更近距离的正面取景,人物从肩颈下方开始入画,到鞋子结束,头部因画面放大而被完整裁切到画面之外。 请注意,这张图不是普通远距离全身照,而是近距离放大的正面服装图:人物身体在画面中的占比要明显更大,上半身与下半身都要被放大展示,整体视觉效果像时装定妆板中的服装主体展示图。 人物双肩、双臂、双手、躯干、腰部、腿部、鞋子必须完整保留,画面边缘只允许裁掉头部,不能裁掉手、脚或身体主体。 左侧这张图必须比右侧背面图看起来更“近”、更“满”、更“放大”,让服装细节和身体比例更突出。 禁止把左侧图做成普通小比例全身图,禁止人物在左侧图中显得太小,禁止头部仍然留在画面内,禁止只裁掉半个头或留出下巴、嘴巴、鼻子、头发边缘。
右侧图片为背面全身图,标准 A-pose,完整展示从头部到鞋子的背面全身。人物背对镜头,完整保留背面头部、发型背部、服装背面结构、鞋子与整体轮廓,用于展示角色背面造型。右侧这张图为常规完整背面全身展示,人物比例正常,不需要像左图那样放大裁切。
下方两张图必须为同一个人物、同一套服装、同一组配饰、同一身体比例。整体保持超模感修长比例,但不要夸张变形。服装设计、布料层次、鞋子、穿搭风格、服装结构与配饰样式必须严格遵循原图。所有服装与配饰都要呈现真实物理材质质感,布料有自然褶皱、垂坠和厚薄变化,金属有真实反光,皮革、丝绸、纱质等材质表现真实自然。若原图服装为开叉长裙,则左侧正面放大图中人物可自然一条腿向前迈出半步,以展示开叉结构和露腿效果,但整体仍需保持定妆照式稳定姿态,不要做走秀动作。
光线只使用干净统一的摄影棚三点式打光:正左侧主光,正右侧辅助光,后右侧轮廓光。不要杂乱光效,不要彩色灯光,不要强氛围特效。背景为纯净灰色无缝影棚背景。
严格要求:
上方两张脸部特写占画面上三分之一。 下方两张身体图占画面下三分之二。 左下图必须是“放大后的正面服装展示图”,人物在画面中的占比明显更大,头部因近距离取景被完整裁切出画面。 右下图必须是完整背面全身图。 禁止左下图做成普通比例全身小图。 禁止左下图出现任何头部信息。 禁止左右服装不一致。 禁止人物比例漂移。 禁止 AI 油腻感、塑料皮肤感、过度美颜感、廉价 CG 感。
在多角色场景中,为了进一步降低模型误判的概率,可以在提示词中做一个非常轻量的区分标记,例如C1、C2这样的编号(人物多的时候可以这样标记)。这个编号的作用并不是强化身份本身,而是确保模型在处理多人物关系时不会把参考图对应错对象。换句话说,它更像是一个“索引标签”,而不是额外的身份设定。

同时,在标注人物时,只需要补充少量关键外观信息即可,例如服装风格、整体气质或标志性穿搭,而不需要再重复堆叠大量面部细节。因为在四视图已经存在的情况下,过多重复描述反而可能干扰模型对参考图的权重判断。
例如可以简单写成:
人物C1(对应参考图1),22岁女性,穿浅色针织上衣与深色长裙,黑色自然长发,中分,整体气质偏安静。
人物C2(对应参考图2),24岁男性,深色休闲外套,短发,整体偏随性风格。

完成这种轻量标注后,直接交给Seedance 2.5进行生成即可,模型会基于参考图完成主体一致性,而提示词的作用主要是“防止人物对错号 + 补充基础视觉信息”,而不是重新定义人物本身。
在这种工作流下,人物一致性的核心其实已经从“描述人物”转变为“正确引用参考图”。
第三章:场景不要只追求漂亮,要符合真实拍摄逻辑
人物身份稳定之后,第二个决定真实感的因素就是环境。
很多人在准备场景参考时,会优先寻找非常漂亮的室内摄影、建筑摄影或者商业空间图片。这些素材本身质量很高,构图、布光和景深也非常专业,但它们并不一定适合所有真人AI视频。

摄影作品
专业摄影作品往往经过精心设计。
窗外不过曝,暗部层次丰富,家具位置规整,主体与背景之间有漂亮的景深分离,每一个视觉元素都处于最舒服的位置。
但现实生活中的手机视频通常没有这么完美。
普通人在卧室里随手拍摄时,窗户可能轻微过曝,画面边缘可能出现一部分没有整理好的床铺,桌面上可能放着充电线、水杯和刚刚看过的书,镜头高度也不会每一次都处于最标准的位置。

这些“不够完美”的部分,反而构成了生活感。
因此,如果目标是制作更加自然的真人视频,场景参考最好优先考虑具有生活记录属性的素材。
这里真正重要的并不是必须使用某个品牌的手机拍摄,而是画面本身有没有普通人的观察方式:自然环境光、正常手持高度、不过度设计的构图、合理的景深,以及真实存在的生活痕迹。
在挑选环境时,可以重点观察几个方面。
首先是光源。最好能够明确主要光线来自哪里。如果房间左侧有一扇窗,那么人物的受光方向也应该大致符合这个关系。否则人物就容易像后期贴进背景。

其次是镜头高度。生活记录通常接近人物胸口、眼睛或者普通手持高度,而不是大量使用贴地超低机位或者极端俯拍。

另外还要看空间里有没有真实使用痕迹。一间真正有人居住的卧室,不太可能像家具品牌样板间一样完全没有生活用品。床单的褶皱、翻开的书、喝到一半的水、正在充电的手机,都能够让空间显得更加可信。

第四章:用道具和动作链解决“人物不知道干什么”
场景准备完成以后,下一步通常是人物行为。
这里有一个非常常见的问题:人物周围什么都没有,于是我们只能反复写“人物自然坐着”“人物微笑”“人物看向窗外”“人物轻轻转头”。
这些动作不是不能用,但如果整段视频都依赖这种抽象行为,人物很快就会产生明显的数字模特感。
道具可以很好地解决这个问题。

道具首先能够丰富环境,但更加重要的是,它可以为人物提供明确的行为对象。原始文案中把它概括成“给人物找事情做”,这个理解非常准确。
如果人物面前什么都没有,我们只能写:
人物自然坐在桌边。

但如果桌面上有一杯咖啡,就可以设计成:
人物先低头看向杯子,右手握住杯柄,将咖啡杯慢慢拿起,喝一小口以后重新放回桌面。

如果人物身边有一本书,还可以继续出现翻页、阅读、合上书本等动作。
如果是手机,则可以设计屏幕亮起、人物低头查看、犹豫后没有拿起手机等更加细小的行为。
所以,道具不是为了单纯让画面看起来丰富,而是在解决一个更重要的问题:
人物为什么要动。
适合真人视频的道具通常都很普通,例如杯子、书、手机、耳机、相机、梳子、钥匙、背包和雨伞等。
它们的共同点是交互方式明确,而且人物执行动作以后,物体状态也会产生对应变化。
在此基础上,还要进一步把单个动作变成“动作链”。
例如:
女孩喝咖啡。
这只是一个动作。
但如果写成:
女孩原本看向窗外,桌上的手机突然震动,她低头看了一眼屏幕,但没有立刻拿起手机,而是伸手握住旁边的咖啡杯,喝了一口以后再把视线重新放回手机。
视频提示词:
使用参考图1作为人物主体,严格保持人物的五官、发型、服装、身形比例与整体气质一致;使用参考图2作为场景环境,保持临水咖啡店原有的空间布局、靠窗座位、木质窗框、室内暖色环境与窗外湖景;使用参考图3作为咖啡杯道具,使用参考图4作为桌面手机道具,保持所有参考对象的外观一致。
生成一段约8—10秒的真实生活记录视频。整体氛围明亮、阳光、轻松愉快,像朋友坐在她对面用手机随手记录下来的一个下午。温暖的自然阳光从窗外照入,在人物脸部、发丝和桌面形成柔和明亮的光线,窗外湖面有自然反光,室内暖色木质环境与日光融合,画面通透、有温度。
人物坐在靠窗的位置,身体自然放松。开始时她看着窗外湖面,嘴角带着轻微笑意,随后像意识到朋友正在拍自己一样,自然转过头看向摄影机,与镜头发生短暂眼神交流,露出一个轻松自然的笑容,带一点被朋友拍到时的随性感,然后重新把目光移向窗外。
桌上的手机突然轻微震动,她注意到以后自然低头看向手机屏幕,没有马上伸手拿手机,而是短暂停顿一下。随后她抬眼再次看了一下摄影机,像是在用眼神回应正在拍摄她的人,带着一点轻松开心的笑意,然后自然伸手握住旁边咖啡杯的杯柄。
她把咖啡杯拿起来喝一小口,喝完后轻轻放回桌面。放下杯子的过程中,她再次短暂看向镜头,嘴角自然上扬,像是在和镜头后的朋友分享这个舒服的下午,随后才把视线重新落到手机上。
整个过程中人物会自然眨眼、轻微歪头、调整坐姿和改变视线,摄影机与人物之间始终存在一种朋友之间的轻松互动感。人物不是持续盯着镜头,也不是刻意面对镜头表演,而是在看窗外、看手机、喝咖啡的过程中偶尔注意摄影机,并给予自然的眼神和笑容回应。
镜头采用中近景到半身景别,机位接近坐在人物对面的朋友视角,轻微手持晃动,摄影机可以随着人物的小动作产生自然调整和非常缓慢的靠近。不要机械稳定,不要明显商业运镜,不要让人物始终正对镜头。整体像朋友之间随手拍摄的一段真实日常视频,阳光、开心、松弛、有互动感。
人物立刻会自然很多。
原因是动作之间出现了因果关系。
手机震动引起注意,所以人物低头;她没有立刻拿手机,于是出现一个很短的停顿;随后人物选择喝咖啡,又产生新的行为目标。
这类行为逻辑比单纯增加动作数量更重要。
另外,也不要害怕人物停下来。
现实生活中,大量状态都非常细微,例如眨眼、呼吸、调整坐姿、手指停留在杯柄上、看了一眼手机却没有马上动作。
这些短暂的停顿,本身就是表演。
10s视频并不需要每一秒都发生明显动作。减少动作数量,增加动作之间的联系和停顿,往往会比继续增加复杂行为更加自然。
第五章:完整提示词要有结构,时间轴负责真正的表演
稳定的方式,可以把真人视频提示词拆成四个部分。
第一部分是整体拍摄方式,告诉模型这段画面应该像什么设备、什么状态拍出来,例如手机生活记录、自然光、轻微手持、不过度商业布光。

第二部分是人物身份,把人物编号、核心面部特征和需要持续保持一致的内容写清楚。

第三部分是道具标注

第四部分才是时间轴,用真实时间安排人物行为、视线变化、道具状态和镜头移动。

第六章:最后再处理画质词,并建立固定检查方法
可以把整个制作过程固定成一套简单工作流:
先准备人物素材,提取身份锚点;再寻找符合生活拍摄逻辑的场景参考;随后选择两到三个真正能够参与动作的道具;再设计人物行为和动作链;最后用时间轴把整个过程组织起来。
这样一来,“让人物更真实”就不再是一个非常模糊的目标,而是被拆成了几个可以分别修改的问题。
人物变脸,就修改身份。
环境太假,就修改场景。
动作机械,就修改行为。
镜头混乱,就修改时间轴。
相比不断重新生成和碰运气,这样的提示词结构更容易测试,也更容易复用。
结语
AI视频中的“活人感”,本质上并不是某一个特殊关键词,也不是多写几次“真实、自然、电影感”就能够获得的效果。
真正决定人物是否可信的,是人物在不同角度下依然保持身份稳定,人物状态能够延续之前发生的事情,环境符合现实中的拍摄逻辑,道具给人物提供了合理的行动理由,而动作之间又存在自然的前因后果。
当这些关系被写清楚以后,提示词就不再只是对一幅画面的描述,而开始承担导演的工作。
所以以后制作真人AI视频时,可以先暂时放下“8K”“顶级画质”“超真实”这些词,先问自己几个更加重要的问题:
这个人是谁?她现在在哪里?她为什么要做这个动作?做完以后,下一秒应该发生什么?
当这些问题都有明确答案时,人物才真正开始从一张“会动的AI图片”,变成一个正在画面中生活的人。
提示词结构执行卡
把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。
这节课的重点不是堆形容词,而是围绕「刺猬星球super-i_AI教程免费在线教学」把提示词写成能执行、能复用、能检查的结构。
按原文节奏走最稳:先吃透「第一章:真实感不是画质,而是关系」,再把「第二章:先锁定人物身份,再设计人物状态」定住,接着处理「第三章:场景不要只追求漂亮,要符合真实拍摄逻辑」;最后用「第四章:用道具和动作链解决“人物不知道干什么”」收口。
- 先把「第一章:真实感不是画质,而是关系」里的变量写全。
- 这一段别堆词,先把作用分清。
- 先把「第三章:场景不要只追求漂亮,要符合真实拍摄逻辑」提到的误区排掉,别踩同一坑。
- 把「第四章:用道具和动作链解决“人物不知道干什么”」这一点先定准,再往下走。
- 把「第五章:完整提示词要有结构,时间轴负责真正的表演」这一点先定准,再往下走。
- 做完「第六章:最后再处理画质词,并建立固定检查方法」后,把可复用句子留下。
不要只堆形容词;提示词要写清主体、场景、镜头、光线、动作、限制条件和验收标准。
检查提示词是否有清晰主体;是否说明画面关系;是否有可执行动作;是否包含避免跑偏的限制条件。
请围绕「刺猬星球super-i_AI教程免费在线教学」帮我做一个可直接执行的方案。 我的目标是:【填写你的具体目标】 我的素材/产品/角色信息是:【填写已有素材和限制】 请输出:提示词结构拆解、中文提示词、英文提示词、负面限制词、生成后修改建议和自检清单。要求每个词都有明确作用。