学习模式

刺猬星球super-i_AI教程免费在线教学

导语:怎么更好的控制生成?

提示词负责描述想要什么,条件图负责限定画面必须怎样生成。学会深度图、法线图和动态轮廓图,单张图片也能延展机位、人物细节与产品动画。

很多人使用AI生成图片或视频时,仍然把主要精力放在提示词上:不断补充景别、光线、镜头、材质和动作,希望模型能够完整理解自己的意图。

但当任务涉及动作复刻、机位变化、人物结构保持或产品形态转换时,仅靠文字往往不够。文字擅长描述内容,却不擅长精确规定每一个区域应该位于哪里,也很难持续约束同一个主体在多个画面中的结构。

这时,真正有效的方法不是继续堆叠形容词,而是给模型增加一种更直接的视觉条件。

深度图告诉模型前后距离,法线图告诉模型表面朝向,轮廓图告诉模型外形边界。它们不是最终画面,而是介于参考图与结果图之间的“结构说明书”。

这套方法来自早期扩散模型和三维制作中的控制思路,但放进现在的图像模型、视频模型和代码工具中,依然可以解决很多新的问题。

因为今天的模型更擅长补充材质、光影和真实细节,我们不必再让条件图承担全部生成工作,只需要让它负责最容易失控的部分:空间、表面和形状。

一、先理解条件图到底控制什么


普通提示词是在说“画面里有什么”。

例如:

一名穿黑色长裙的女性站在草地上,低机位拍摄,阴天,电影感。

模型会根据这段文字自行决定人物距离、身体姿态、衣服褶皱和背景层次。每次生成时,这些决定都有可能变化。

条件图则是在说“这些内容必须按照什么结构出现”。

深度图会把离镜头近的区域和远的区域分开;法线图会用不同颜色记录表面朝向;轮廓图只保留主体边缘,让模型明确外形从哪里开始、在哪里结束。

因此,提示词与条件图并不是替代关系。

提示词控制题材、风格、材质和氛围,条件图控制空间、结构和变化路径。真正稳定的工作流,通常是“文字描述+视觉条件+主体资产”共同完成,而不是依赖某一段万能提示词。



二、深度图:把平面图片变成可以重新取景的空间


深度图是一张灰度图。

通常离镜头较近的部分更亮,较远的部分更暗,也可以采用相反规则,关键是整张图保持统一。它不记录物体是什么,只记录每个区域距离摄像机大概有多远。

很多人只把深度图用于动作迁移,例如提取参考人物的身体深度,再让新角色按照相同姿态生成。

其实它更有价值的用途,是把单张图片转换成一个近似可以移动机位的二维半空间,也就是常说的2.5D场景。

这里需要先明确:单张深度图无法恢复被遮挡物体的背面,也无法真正还原完整三维世界。它更像把原画面沿着深度方向拉开,形成一组具有前后关系的表面。

只要机位移动幅度适中,就可以获得比直接让模型“凭空换角度”更稳定的新视角。

第一步:选择适合处理的原图

主体与背景需要有清楚的前后关系,人物轮廓不能被大量物体遮挡,画面也不要包含过多透明玻璃、镜面反射、烟雾或密集发丝。

正面或轻微侧面的中近景,通常比极端透视、复杂群像和严重遮挡的画面更容易得到干净深度。

第二步:提取深度图

可以把原图交给 Image2.0 ,让它只输出灰度深度关系,不保留原始颜色和纹理。

深度图提取提示词:

把输入图片转换为单目相对深度图,用作后续图像生成的空间结构控制。
必须保持:原图画幅比例、构图、镜头视角、主体位置与尺度、人物姿势、物体轮廓、前后遮挡关系和背景空间结构。
深度规则:近处显示为白色,远处显示为黑色,中间距离使用连续灰阶;同一连续表面保持平滑的深度过渡,物体边界清晰。
禁止:重新设计构图,移动、增加或删除人物与物体,改变姿势,补画新细节,保留原图颜色、纹理、文字、材质和光影风格。
输出:只输出一张与原图尺寸一致的纯灰度深度图,不添加边框、说明文字、色彩图例或装饰。

第三步:把深度图构建成可观察的空间

这里可以让Codex编写一个简单的Python、Three.js或Blender脚本,将灰度值转换成顶点位移,把原图作为纹理贴回表面,并加入能够旋转、平移和调整焦距的虚拟摄像机。

给Codex的任务提示词:

请读取我上传的原图和对应深度图,创建一个可交互的2.5D场景。
按照深度图的灰度值,将画面转换为带有前后位移的网格或点云,并将原图作为纹理正确投射到表面。
加入能够旋转、平移、推进和后退的虚拟摄像机,支持调整焦距与视场角。
默认视角必须与原图一致,同时提供轻微左移、轻微右移、低机位和高机位四个摄像机预设。
移动摄像机时尽量减少边缘撕裂,并对新暴露出的空白区域使用邻近颜色延展,不要编造复杂的物体背面。
增加深度强度、摄像机距离、焦距和位移幅度调节选项,最后支持导出当前视角的高清图片。
这里要特别注意,目标不是把一张图片真正建模成完整人物,而是获得一个能够轻微调整视角的空间参考。
机位移动得越远,原图中没有的信息暴露得越多,画面破损也会越明显。

第四步:移动虚拟摄像机,导出新视角

最重要的不是移动得有多远,而是控制在深度图能够承受的范围内。

通常可以尝试:

摄像机轻微向左或向右移动;
机位略微升高或降低;
保持位置不变,只改变焦距;
轻微推进,强化前景与背景距离;
轻微后退,为人物周围增加空间。

不要直接绕到人物侧后方,也不要一次移动很大的角度。单张图片没有记录人物背面和被遮挡区域,移动过大只会暴露空白、拉伸纹理和重复边缘。

新视角的作用也不是直接成为最终成片,而是为图像模型提供更加明确的构图参考。

第五步:结合人物资产重新生成

把新视角、人物资产和最终画面要求一起交给AI。

新视角负责空间和动作,人物资产负责脸、服装和角色身份,提示词负责环境、光线与最终质感。

新视角生成提示词:

以新机位参考图为主要构图和动作依据,严格保持人物身体姿态、四肢方向、镜头高度、透视关系和主体在画面中的位置。 以人物资产图控制脸型、五官、发型、服装、配饰和身体比例。 重新生成完整写实画面,修复深度拉伸产生的空白、破损边缘和重复纹理,使人物与地面接触自然,背景结构连续,光影方向统一。 不得改变人物动作,不得把中景改成全身,不得增加其他人物,不得改变人物的服装设计和主要配饰。

这一步中,每张参考图的职责一定要写清楚。

不要只写“参考图片生成相似画面”,而要明确:

新视角图控制构图与姿态;
人物资产控制身份与服装;
文字控制场景、光影和质感。



三、法线图:不改变结构,重新控制人物表面


法线图同样是一种结构图,但它记录的不是距离,而是表面朝向。

常见法线图呈现蓝、紫、青、红等颜色,不同颜色代表表面朝向不同方向。三维建模中经常使用法线信息表现凹凸和表面细节,而在AI人物制作中,它可以帮助模型理解脸部转折、肌肉起伏、衣服褶皱和首饰雕刻。

直接要求模型“让皮肤更清晰、衣服更有细节”,常常会带来过度锐化、毛孔堆积和脏乱纹理。

法线图的优势是,它先保留表面结构,再让模型重新覆盖材质。

这样增加的不是随机噪点,而是顺着面部和物体形体生长的光影与纹理。

第一步:提取人物法线图

参考图最好具备清楚的轮廓和稳定光线,脸部不能被强阴影完全遮挡。

提示词需要强调保持五官结构,而不是把图像处理成普通的蓝紫色特效。

法线图提取提示词:

请为我上传的人物图片提取高精度相机空间法线图。
要求:
1. 不要用图像生成模型模拟法线图,调用表面法线估计模型完成。 2. 保留人物面部、五官、发型、服装褶皱和首饰的表面起伏。

第二步:重新生成皮肤、服装和饰品材质

把原图、法线图和人物身份参考一起输入生成模型。

原图提供整体构图,法线图提供表面转折,身份图防止换脸。此时提示词不要继续堆叠“极致细节”“超清毛孔”等词,而要说明材质应该如何响应人物结构。

法线控制的人物重绘提示词:

图1是人物身份与妆造参考。 图2是相机空间法线图,只用于约束人物的表面结构和立体转折,不参考图2的颜色。
严格保持图1的人物身份、五官比例、发型、服装、构图和表情。 根据图2重新构建眉骨、眼窝、鼻梁、唇峰、下颌与面部轮廓, 沿正确的表面朝向补充自然皮肤纹理、细小毛孔、眼睑褶皱和嘴唇纹理。 同时恢复衣服褶皱、刺绣、首饰浮雕与材质转折。
不要改变脸型,不要过度锐化,不要磨皮,不要生成塑料肤质, 不要复制法线图的彩色外观。 输出真实、细腻但不过度修饰的人物画面。



四、动态轮廓图:给产品变化规定一条可执行路径


产品动画最常见的问题,是起点和终点看起来都正确,中间过程却失控。

例如让一个LOGO变成手机,模型可能先把LOGO溶解,再突然出现一台近似手机;或者手机在变形过程中不断改变摄像头数量、边框比例和品牌标志。

原因是文字只告诉模型“从A变成B”,没有说明中间每一步应该怎样变化。

动态轮廓图的作用,就是把变化过程拆成一组连续外形。

第一张是LOGO轮廓,最后一张是产品轮廓,中间帧逐步完成面积扩张、边缘移动、孔洞变化和部件分离。

视频模型不再需要自己猜测形状路径,只需要在既定轮廓上补充材质、光线和特效。

第一步:准备起点与终点资产

LOGO最好使用透明背景或纯色背景,产品图尽量采用正面、侧面或四分之三角度,轮廓完整,不被手和道具遮挡。

起点与终点的画布比例、主体中心和朝向也要尽量统一。

第二步:让Codex生成中间轮廓

比起简单降低两张图片的透明度并进行叠加,更稳定的方法是先转成二值蒙版,再通过轮廓点匹配、距离场插值或形态学变化生成连续序列。

给Codex的动态轮廓任务提示词:

请读取起点LOGO图片和终点产品图片,分别去除背景并提取主体二值轮廓。
统一两张图片的画布尺寸、主体中心、朝向和占画面比例。
生成一组从LOGO轮廓连续变化到产品轮廓的中间帧,建议输出24张PNG图片,组合成一段4s的视频。
变化必须连续,不能简单进行交叉淡化。主体外边缘应逐帧移动,内部镂空和产品部件应分阶段出现。
所有图片使用纯黑背景和纯白主体,同时输出透明背景版本。

第三步:让视频模型补充材质和特效

把轮廓序列、产品资产一起交给视频模型。

轮廓负责运动路径,产品图负责真实外观,提示词负责解释变形机制。

视频生成提示词:

参照视频1,从图2的logo沿着周作为的边缘变成图1的手机,自然真实,手机不能发生形变,



五、什么时候应该使用哪一种图


当问题主要发生在镜头、透视、动作和前后关系时,优先使用深度图。

它适合人物动作复刻、单图换机位、空间重构、巨物压迫和微缩世界。

当问题主要发生在脸部起伏、皮肤受光、衣服褶皱、首饰雕刻和妆容贴合时,优先使用法线图。

它适合人物重绘、角色材质升级、妆容替换和三维感增强。

当问题主要发生在产品外形、LOGO转化、部件拆解和中间过程一致性时,优先使用动态轮廓图。

它适合品牌开场、产品发布动画、包装展开和结构演示。

如果一个任务同时存在多个问题,也不要一次塞入所有条件。

先解决最大的失控点,再逐层增加控制。

例如先用深度图确定新机位,再用法线图修复人物表面;先用轮廓序列确定产品变形,再用产品参考图补充材质。

分阶段生成通常比一次完成更加稳定,也更容易定位问题。



结语


AI生成正在变得越来越简单,很多过去必须依赖复杂节点和参数的方法,未来可能会被模型直接完成。

但这并不意味着理解深度、表面和轮廓没有价值。

相反,模型越强,创作者越需要知道问题究竟出在哪里,才能选择最少但最有效的控制方式。

当画面换角度失败时,不要继续补充“侧面、低机位、广角”;当人物变得油腻时,不要继续堆叠“超清、极致细节”;当产品变形失控时,也不要只写“丝滑转场”。

先判断模型缺少的是空间、表面还是形状,再选择对应的条件图。

提示词负责表达创意,条件图负责固定规则,资产负责保持身份。

把这三部分组合起来,AI生成才会从反复抽取结果,逐渐变成一套能够复用、检查和调整的制作流程。



速用卡

电商转化执行卡

把这节课压缩成一张可执行卡片:看重点、照步骤、避坑,再复制模板直接开做。

一句话重点

这节课讲的不是单纯出图,而是围绕「刺猬星球super-i_AI教程免费在线教学」把产品主体、卖点和场景一起做成能转化的视觉方案。

落地顺序

按原文节奏走最稳:先吃透「先理解条件图到底控制什么」,再把「深度图:把平面图片变成可以重新取景的空间」定住,接着处理「法线图:不改变结构,重新控制人物表面」;最后用「动态轮廓图:给产品变化规定一条可执行路径」收口。

照着做清单
  1. 先把「先理解条件图到底控制什么」里的卖点讲清楚。
  2. 这一段别让背景抢了产品主体。
  3. 把「法线图:不改变结构,重新控制人物表面」这一点先定准,再往下走。
  4. 先把「动态轮廓图:给产品变化规定一条可执行路径」里的卖点讲清楚。
  5. 做完「结语」后,检查材质和转化感。
最容易踩坑

不要只追求画面好看而忘记卖点;产品主体、材质、使用场景和购买理由必须清楚。

成品自检

检查产品是否一眼可见;核心卖点是否明确;材质是否真实;场景是否服务购买决策;是否适合做主图、详情页或短视频。

可直接复制的万能模板
请围绕「刺猬星球super-i_AI教程免费在线教学」帮我做一个可直接执行的方案。
我的目标是:【填写你的具体目标】
我的素材/产品/角色信息是:【填写已有素材和限制】

请输出:产品卖点拆解、主视觉方案、场景图提示词、短视频脚本和转化自检清单。要求产品突出、材质真实、卖点清楚。