把摄影里的机位讲明白,写 AI 人像提示词就有思路了
我们在用 AI 画人像的时候,经常会遇到一种很迷惑的情况。相机机位不知道怎么描述。
角色、五官什么的看着都不错,衣服、场景、光线也不错,但整张图看起来就是有点别扭,有一些平平无奇。
于是我们开始往提示词里加一些构图和机位词:低机位、高机位、俯拍、仰拍、广角、特写……词越写越多,画面却变得越来越偏离我们最初的意图。
有时候想显腿长,结果最后连脸一起仰变形了;想突出眼神,结果人物只占画面一小块,观众先看到的反而是后面的背景东西。
所以我尝试着把这些东西翻译成大家都能看懂的语言,把机位拆开讲。
一些在摄影中常见的坑,放在 AI 绘图里同样能用来排查问题。
因为很多时候,我们缺的不是更多摄影名词,而是没说清楚:相机在哪、朝向哪里,最后又要把人物画到多大。
1. 机位如何进行拆分
很短的一句话:先把机位拆成相机高度、拍摄方位和拍摄距离。
先记住这三点,然后再往下面看。
2. "换个角度"这句话,信息量几乎为零
平常我们拍照片时,经常会对模特说:换个角度试一试。
但是这个角度,它到底指的是什么呢?
在现实生活中,可能只是模特姿势变一下,相机拿高一点或者放低一点;也可能是从人物正面绕到侧面;还有可能是镜头从水平位置变成向下的俯拍。
有时候,甚至可能是我们往前走了几步,让画面中的主体人物角色变大了,这样也会觉得角度变了。
这些变化其实都是混合在一起的。
在我们真人拍摄的时候,只需要不断变换位置、按下快门,就能够看到不同的照片。
但是交给 AI 的时候,我们很容易把这些要求写得不清楚,让 AI 乱猜。
所以如果让我来说的话,写提示词时,可以把这三点展开成下面四个检查项:高度之外再看镜头朝向,距离则结合最终景别来描述。
- 高度:相机相对拍摄目标,是同高、高于还是低于。
- 方位(角度):摄影机在人物正面、侧面、背面,还是三分之二侧面。
- 镜头朝向:镜头水平正对、向下俯拍,还是向上仰拍。
- 景别:人物最终在画面里有多大,是远景、全景、中景、近景还是特写。
这里说的"方位",是摄影机绕到人的哪一面。它和镜头向上还是向下,不是同一件事。
后面的景别,是照片内的取景范围大小。它受拍摄距离和焦距共同影响,不能直接等同于相机离人物多少米。
比如"从人物正面拍"只说明摄影机在正面,没有告诉 AI 相机有多高,也没有说明镜头是否俯拍。
反过来,"低机位"也没有告诉 AI 你想拍人物正面还是侧面,更没有说最后要全身还是只看脸。
所以只写一句"低机位人像",模型要替你决定的东西还是太多了。
这个东西其实我在我的生图课程里面提过一部分。
这张图是用"低机位人像"得到的几张图片拼合而成的。
仔细看,人物姿势、脸部朝向和取景范围都变了,也没有统一呈现出清楚的仰拍关系。
所以一个"低机位",还不足以把画面定下来。
3. 相机贴地,不一定就是低机位
这里我想说的,其实是一个最反直觉的东西,也是我觉得大家最应该记住的一点。
我们通常情况下都会通过相机离地面的高度,来判断一个摄影机的机位。
相机在地上,我们就认为它是低机位;相机举过角色的头顶,就是高机位。
但其实,在摄影过程中,更准确的判断方式是:先确定你要拍的区域,也就是这张图真正要表现的部分,再找到这个区域的中心点。
比如你要拍脸,目标中心可能在鼻梁附近。
相机与这个中心保持同等高度,镜头保持水平并正对它时,这才是这套定义里的平视。
假如现在你要拍的是脚上的鞋子,目标中心就落在脚部。
此时,如果把相机放在地上,它其实就已经贴近地面了。
但只要它与脚部中心同高,镜头保持水平正对,拍出来的仍然叫平视。
所以我说,相机放得低,并不能说明你是低机位拍摄,只能说明你的机器离地面很近、很低。
把前面这个判断放到 AI 生图里,对我们写提示词就很重要。
你看,如果现在你想拍鞋的产品细节,写的是"低机位拍摄",AI 很有可能会给你一张从地面仰看整个人的画面。
鞋和腿被夸张地放大,脸部也因为仰拍产生了一些局部拉伸感。
所以更清楚的写法应该是:
以鞋和脚部为画面主体,相机与脚部中心同高,镜头水平正对鞋面,不向上仰拍人物;取景从小腿中部到地面。
这张已经把取景收到了鞋和脚部;但还能看到较多鞋面,它主要说明取景目标变了,不能仅凭这张图就认定镜头严格保持水平。
所以我们写的不是一个很含糊的摄影标签,而是在告诉 AI:看哪里、相机在哪里、镜头朝哪里、画面收到哪里。
4. 同样距离两米,拍出来也可能完全不同
还有一点我觉得也很重要:我们在写提示词的时候,有时会陷入一种误区,就是只写相机离人物多远。
我不知道大家有没有经历过这种情况。
“相机距离人物 2 米”,听起来很具体,但它还不够。
在真实摄影的时候,我们在同一个位置换用不同焦距,比如 30mm、50mm、80mm,画面能收进来的范围不同,人物在画面里的大小也会改变。
所以换句话说,距离要和焦距、最终的景别一起看。
对 AI 生图来说,镜头数字不能单独使用。
很多模型不会像真实摄影机那样精确执行每一个焦段。
你写了"85mm",它可能给你一点中长焦人像的感觉,但不代表摄影机位置、透视和画面范围都会严格按照真实镜头计算。
所以,比起只扔一个数字,我更建议把你真正想看到的结果写出来。
比如:
相机距人物约3米,使用广角视角,人物全身完整可见,人物在画面中占比较小,保留大量环境,不拉长四肢。
或者:
相机距人物约1.8米,中长焦人像视角,胸部以上近景,脸部是画面主体,背景范围较小,避免广角贴脸变形。
这两张主要看全身与紧凑人像的取景差别。
人物姿势也有变化,因此不能把所有差异都归到焦距上。
同一位置换焦距,取景范围会变;但别顺手把它写成"透视只由焦距决定"。
相机位置和拍摄距离,同样会影响我们看到的人脸、身体与背景关系。
当然,上面的提示词也可以先简化成"中长焦人像视角,胸部以上近景,脸部是画面主体,背景范围较小"。
这段已经交代了想要的取景效果,可以先用它尝试,再看是否需要补距离。
因为后面的描述已经把人脸占比和背景范围说清楚了,单张图里就不一定非要加一个米数。
但这不代表两种写法的结果完全一样,也不代表近景就等于距离 1.8 米。
以后玩 AI 视频,需要交代相机从哪里推进、后撤到哪里时,距离和空间关系仍然很重要。
5. 远、全、中、近、特,决定观众先看什么
只要我们玩摄影玩图,那我们总能听到这几个景别:远全中近特嘛。
这些词不是用来给提示词增加摄影感的装饰。
它们真正控制的是:观众第一眼会看什么。
这组图可以先看人物占比怎样逐步变大:前两格都能看到全身,后面逐渐收到上半身和脸部。
最右两格已经接近面部特写,不能把五格机械地当作五种景别的标准裁切。
远景里,人物虽然可以完整出现,但环境占比很大。
它适合告诉观众"这个人在哪里",或者让人物成为巨大环境中的一部分。
全景同样能看到完整身体,但人物占比更大。
它更适合看身材、站姿、肢体动作和完整造型。
中景会再靠近一点,通常还能看到一部分身体动作,同时让人物产生更明显的交流感。
近景把注意力收到脸和上半身,适合看人物状态、造型和表情。
特写则进一步强调眼神、嘴角、皮肤、饰品或其他局部细节。
具体裁到膝盖、胸口还是肩膀,不同摄影和影视体系会有不同习惯。
对 AI 绘图来说,与其死记一条裁切线,不如先问自己:
这一张,我到底想让观众看环境、看完整动作、看人物交流,还是看脸部情绪?
假如你想展示一套服装,却只写"人物特写",模型当然可能把腿和鞋裁掉。
假如你想看一个人忍住眼泪的细微表情,却又要求"辽阔城市远景、展示完整环境",最后人物可能只剩画面里的一小块。
眼神写得再细,也很难被观众看到。
所以景别不是最后补上的词,它应该从画面目标里长出来。
6. 机位选择——平视不是万能答案
很多大师的作品往往都是用平视的角度,拍摄出最震撼人心的画面。
但往往我们去用平视拍摄的时候,拍出来的就好像街边的游客照。
平视最大的作用,不是让人像自动变得高级,而是尽量不额外夸张人脸的上下比例,让我们看到的五官更接近平常正面看一个人的感觉。
但平视也不能消除近距离拍摄带来的透视夸张。
所以,如果你画的是证件照、职业形象照,或者想要一张自然、直接、五官比例相对稳定的人像,平视通常会是一个很稳妥的起点。
但是在提示词里,只写"平视"还是不够。
因为 AI 可能只是把人物的眼睛画成看向前方,却没有真的把相机放到脸部中心的位置。
我们可以写得更具体一点:
相机与人物脸部中心同高,镜头水平正对鼻梁中部,不俯拍、不仰拍;胸部以上近景,保持自然的正面五官比例,避免广角贴脸变形。
这样,"平视"就不再只是一个形容词,而是有了相机高度、镜头朝向和最终景别。
当然,平视也不是所有人像的标准答案。
如果你想让人物显得更高大、更有压迫感,可以尝试把相机放到脸部中心以下,再向上仰拍。
如果想让脸部下半部分在视觉上更收,或者需要一个明确的俯视关系,也可以把相机抬高以后向下拍。
没有哪个机位一定更好看。
我们只需要判断:这张图是要如实、直接地看见这个人,还是需要一种更明显的造型关系?
脸部是否自然,还会受到焦距、拍摄距离、人物朝向、姿势和画面边缘变形影响。
所以不要看到"平视更自然",就在每一条人像提示词里都强行加上平视。
7. 眼神写得很细,情绪为什么还是出不来
我们在写人物情绪的时候,经常会把大量文字放在眼神和表情上。
比如"克制的伤感"“眼眶微湿”“嘴角放松”。
这些细节已经写得很具体了,最后生成出来的画面却还是没什么情绪。
这个时候,问题不一定出在表情词上,而可能是人物在画面里太小了。这里很重要!
人物明明看着镜头,但画面同时又要求全身、远景、复杂街道、霓虹招牌、路人和很多环境细节。
观众第一眼都在看穿搭、场景和那些高饱和的东西,脸上的微表情自然就很难被看到。
如果你想让观众直接读到人物脸上的情绪,可以优先这样控制:
- 人物用正面或者接近正面的方位。
- 相机与脸部中心同高,或者保持接近平视的观看关系。
- 景别收到近景或特写,让眼神和嘴角能够被看清楚。
- 把背景里的高饱和颜色、杂乱物体和无关道具压下去。
反过来,如果你想表达的是"一个人被巨大环境吞没"的孤独,那就可以故意把人物放小,用远景来表现人与空间的关系。
所以我们在写情绪之前,要先决定:这份情绪是要从脸上被看见,还是从人物和环境的关系里被看见?
决定了这个问题以后,再去选景别和机位,画面就不会一边要求观众看脸,一边又拿一大堆环境信息把脸淹没。
8. 把机位写成一条可以检查的提示词
所以我们在写 AI 人像方面的提示词的时候,先把机位按下面这几个问题检查一遍:
画面目标:观众第一眼应该看什么?
人物方位:正面、三分之二侧面、纯侧面,还是背面?
目标锚点:脸部、胸部、脚部、手部,还是某个道具?
相机高度:与锚点同高、高于锚点,还是低于锚点?
镜头朝向:水平正对、向下俯拍,还是向上仰拍?
景别:远景、全景、中景、近景,还是特写?
注意力限制:哪些背景、穿搭和道具不能抢戏?
把它压成一条提示词,可以写成:
我要让观众先看【目标】。人物为【方位】,拍摄锚点是【部位】;相机【与锚点同高/高于/低于】,镜头【水平正对/向下俯拍/向上仰拍】;采用【景别】,控制【背景和道具】不抢走注意力。
例如,要画一张突出克制伤感的脸部人像,可以写:
我要让观众先看到人物克制的伤感。成年女性正面看向镜头,拍摄锚点为脸部中心;相机与脸部中心同高,镜头水平正对,采用胸部以上近景。眼眶微湿,嘴角放松,不大哭;背景为连续、低对比的深绿色灌木,不出现高饱和标牌、路人和杂乱道具,不让背景抢走脸部注意力。
这套结构不是让每一条提示词都变得更长。
它只是帮我们把原来混在"换个角度"里的东西分开。
哪一项没有说清,就补哪一项;哪一项不是画面重点,就不用为了显得专业硬塞进去。
所以如果人像出来以后,我们感觉不太对劲,先别急着换模型,也别乱加一些摄影词。
先看看问题到底出在高度、方位、镜头朝向,还是景别。
把真正出错的那个变量改掉,通常比再加一句"高级电影感"更有用。