文 | 新声Pro,作者 | 冯勇
当AIGC影像不再只是跳出早期依赖「抽卡」生成单一特写与零碎分镜的短片阶段,实质性迈向复杂叙事与重体量制作阶段,空间成为当下AIGC影像创作正在克服的重要难点。
可以类比实拍流程里的商业片、大制作,其为了保持影片世界观美学的呈现统一、空间纵深关系真实,往往需要实地造景、搭建拍摄影棚。
在AIGC影片创作中,空间的难点主要体现在两方面:
一是资产维度,受限于大模型的算力分配,单次图片/视频生成难以兼顾高精度的主体与复杂的环境。这倒逼创作者必须将数字资产筹备作为核心前置环节,建立一套可跨场景复用、质量稳定的AI资产库,以保障成片的视觉连贯性。
二是空间构建和角色调度维度,复杂的AI内容创作同样涉及人物走位、摄影机运动、景深关系等,需要基于拍摄空间进行规划。但目前视频大模型的底层逻辑是基于二维图像进行概率预测,天然缺乏物理坐标系与空间常识;在处理复杂的人物走位和镜头调度时,就迫使创作者必须介入更加精确的调度引导与分镜设计。
当更多重体量AI影像作品正在不断落地,超创们在具体创作中对构建空间的不断尝试,就像是在AI世界搭建摄影棚,他们需要像筹备服化道一样提前储备数字资产,也通过工具锁定空间关系?最终的目的都是为了能构建一个观感真实、立体生动的三维世界。
对抗平均化审美的资产
AI工作流里的数字资产,涵盖人物、场景、道具等核心视觉元素的参考图,是进行AI内容生成前的重要筹备。
目前,资产质量在专业化的AI创作里愈发显得重要——所有的场景、道具、主配角人物等一切视觉呈现都属于资产,有确定性的资产作基础,成片内容的一致性更易得到保证。前期创建并固化的资产,在后续戏份中仍然可以直接调用,能大幅减少后期重复抽卡的时间和算力成本。
特别是奇幻、战争、悬疑等重度依赖场景与视效的题材,更需庞大的前置资产库作为质量底座;可以说,资产厚度直接决定了AI作品的视觉风格与质感上限。
尽管有观点认为,AI时代,作品的风格审美与影调特色已不再是创作者核心壁垒。但在具体创作中,如何去除AI味,如何将一个AI作品的真实感从70分提升到90分,仍是头部创作者出圈的核心要素。
如抖音头部AI超创@Mx-Shell 创作的AI微电影《丧尸清道夫》,其成功破圈首先就得益于@Mx-Shell 将「美式复古+科幻赛博」的画面风格实现了极逼真呈现。
此外,做资产之所以成为当下一个重点,本质上是创作者在与大模型的「算力分配机制」作斗争。
在今年的上影节AI片场创作实践内,有过实拍经验、《愤怒的小孩》《合法伴侣》的导演黄雷发现,当他给AI的要求越多,算力分配就越平均,最终会导致每个细节都趋于平庸。「复杂镜头需要的算力远超简单镜头,在平台均等扣除积分的机制下,复杂镜头必崩」。
另一位参与上影节AI片场的AI创作者王泽也遇到了同样的困境:为了节省算力,AI甚至会在生成时「在群演身上贴主角的脸,但凡能看清五官的群演都要单独做资产,要么用遮挡、虚化来处理」。这意味着,为了成片质量保障和视觉风格统一,前期建立一套完备细致的资产必不可少。
《乘船而去》导演陈小雨做AI资产的方法论,正是考虑到单次算力有限的难题:「不指望一步到位,把复杂的任务拆解,让AI每次只专注于一件事」。
@Mx-Shell 在他发布的视频中也分享过创作《丧尸清道夫》主角的资产流程,衣着风格、配枪道具以及角色的模特站姿等,都是分别找参考图生成再合成的,甚至参考图还需要在前期进行多次生图调整。
![]()
@Mx-Shell 还会进行负面资产框定,不仅规定「角色是什么」,还明确「角色不是什么」来剔除错误元素。当然这一切是建立在其较为专业、成熟的提示词功底之上。
抖音博主@阿盐 创作的国风奇幻AI短片《穿越山海经》,其中包含大量高频打斗场面与奇幻视效,需依托极其庞大的资产库提供底层支撑。所以,其前期创作的资产不仅包括各角色的三视图,片中的多个古代怪兽、山海奇观,甚至是天庭上的云朵、花草等元素的资产图,@阿盐 都单独进行了构建。
![]()
另一个成本更高但也更精细的资产方式是通过「实拍转绘+AI生成」实现。实地采集光影结构、空间透视和建筑细节,再将其喂给AI作为起始帧、参考图,能给AI搭建起真实的物理框质感。
陈小雨目前在进行AI长片《机器背包客》的制作,就曾在4月中旬,带着编剧组、摄影指导、美术指导、制片人前往拉丁美洲,进行了为期一个多月的实景采风。「我们想要建立自己的资产库,实地的去拍很多的道具场景,而不是全靠提示词生成。」这些实景的素材,加上团队「手搓」的3D资产,将共同构成《机器背包客》的数字资产。
当然,在创作预算和时间有限的前提下,资产也不一定是越丰富越好。凭借AI作品《积木》在戛纳国际电影节科幻电影峰会斩获金奖,年仅26岁的AI超创@山音 的解决办法是:先厘清要在片子中突出什么样的氛围和情绪,然后着重打造该方面的资产。
如《阿明的一天》主题是体现当代人工作压抑、被领导折磨的普世情绪,他主要打磨的资产便是公司暗沉的环境和其中多个框住员工的工位。
![]()
跳出内容创作者视角,数字资产在产业链各环节同样具备战略价值。水母智能、Seko AI等工具方为提升垂直赛道竞争力,已将积累数字角色资产、提供风格化场景作为上半年的核心竞争点。
影视和剧集公司也的确生长出了数字艺人(包括AI演员、AI歌手)的资产需求,所以上半年,市场中衍生出了专门从事AI数字人脸售卖的中间业务。
商业化落地较早的@麦橘 的团队业务便是专注于「AI捏脸」这一环节,然后售卖给影视、剧集公司。某种程度上,他们都是在用不同方式,为专业的AI创作实现「搭建虚拟影棚」的工作。
AI缺少坐标系和空间感
搭建好虚拟影棚后,如何在其中进行空间调度是另一客观问题。
长片内容里,对于需要通过镜头语言实现叙事和情感表达的导演而言,人物调度、机位运动、景深遮挡等要素都需要一个具明确空间感的场景来实现。
而大模型本质是基于二维图像进行概率预测,没有坐标系和重力系统,不理解物理规则和空间关系。黄雷表示:「AI是没有坐标系的;除非你先在内部建立一个坐标系并教会它识别,明确告知演员站位与镜头调度,生成才不会出错。」
同是上影节AI片场创作者的李鑫欣也道出了AI在空间调度能力上的局限:在室内戏创作时,仅仅是几个角色的日常对话,她就遇到过人物无视空间障碍物进行走位、直接穿过桌角的穿帮问题。
所以,如何让AI在一个虚拟空间内理解真实的三维感?如何在一个虚拟空间内处理人物与环境之间的交互?成为目前创作者普遍面临的核心难题。
创作过全网爆款AI作品《牌子》的@DIDI_OK,其7月10日新上线的AI短片《垃圾站》中面临的最大问题就来自空间。他告诉《叁拾代》:「目前的AI是完全没有场景识别能力的,无法理解构图和角色站位」。
「垃圾站这个物体不存在,AI不知道它长什么样,所以每一次生成都会长得不一样」。@DIDI_OK表示付出了很大努力,才最终形成了一个相对有空间感的作品,能让观众大概理解方位。
目前尚在河北传媒学院读影视研究生的王意辉也是一名AI创作者。他用分镜举例空间关系方面遇到的难题:「在一些景别、镜头切换时,比如四个人坐在一起,如果中间穿插一个特写镜头,就容易发生四人空间关系错乱」。
![]()
目前,大众维度出现了不少吐槽「难以驯服AI」的玩梗视频,抖音、小红书等短视频平台上有一批创作者在探讨空间调度难题的内容,以「规驯AI」。
首先,为让AI能够理解并且建构出一个3D空间/物体,需在前期生成该空间/物体在各个视角的细节图,再喂给AI,让AI将其拼凑起来。
其次,人物走位、人与环境交互这类动态的空间关系处理,最基础的方式是,为每个分镜头撰写大量精细的提示词,甚至是设计起始帧参考图,以严格控制该片段内的镜头运动和人物走向。
目前较精细的AI短片创作其实已经达到了这个精度,如@Mx-Shell 《丧尸清道夫》的分镜提示词,在每一次视频生成中都精确到5s左右。
![]()
此外,可通过示意图辅助AI理解。如做AI创作经验分享的小红书博主@彬彬AI实战圈,近期就分享过借助「俯视图场景调度图」让AI进行空间理解的方式。俯视角度下,三维空间化为了二维平面,其中再添加上人物站位和运动方向引导线,就能让AI理解场景中的人物站位,以及保持镜头切换中的关系稳定性。
![]()
Agent也给出了工具端的解决方式。最近两个月,许多AI视频Agent都上线了3D导演工作台功能。比如爱奇艺旗下AI平台「纳逗Pro」的3D导演台,可解决人物站位错乱,精确控制镜头角度,一键生成位置参考图等难题。
![]()
更宏观角度,当前AI技术前沿的「世界模型」所探索的,正是致力于为AI构建一个内部的数字物理引擎,使其能够理解并推演真实世界的运行规律。
可以说,只有实现调度精度,让镜头语言从单调的正反打特写走向复杂交互,才能够让AI作品拥有媲美实拍的视觉张力和情绪表达。这是AI创作实现工业化生产的必经之路。
可能未来一段时间,AI创作都离不开解决空间关系以及场景调度的问题,甚至会作为一个长久性难题和区分创作者能力高下的门槛。







快报
根据《网络安全法》实名制要求,请绑定手机号后发表评论