- 焦点
价值 350 万的「提示词」开源了,揭秘全球首先部全 AI 生成的电影首先片|翻译|动作|人物|镜头|摄影机_网易订阅
时间:2010-12-5 17:23:32 作者:娱乐 来源:焦点 查看: 评论:0
内容摘要:电影发明以后,人类的生命,比以前至少延长了三倍。AI 电影发明以后,人类的生命又能延长多少倍。350 万元,115451 个资产文件,95 分钟,15 人团队,14 天的 AI 生成周期,一部完全由

电影发明之后,价值人类的物镜网易生命,比以前至少延首先了三倍。提示头摄
AI 电影发明之后,词开成人类的源揭译动影机生命又能延首先多少倍。350 万元,秘全115451 个资产文件,球首全95 分钟,先部15 人团队,生首先14 天的电影订阅 AI 生成周期,一部完全由 AI 生成的片翻电影来了。没有摄影机,作人没有演员,价值也没有实体场景,物镜网易电影中的提示头摄每一帧都是由 AI 生成。视往往和对白题由 Seedance 2.0 生成,角色与场景采取 Soul Cinema,图像修改则调用 Nano Banana Pro、Seedream 4.5 和 GPT Image 2。今年五月,这部 AI 电影在戛纳电影节同期的第三方行业活动中放映,是一部涵盖博物馆盗窃、恶魔、地狱和超能力的动作奇幻片。完善电影视往往来源:X@higgsfieldROKO、JAXX、LULU 和 REIN——四个一无所有、无所畏惧的街头孩子。某一天,一座博物馆,一个方式划——直到一切在他们于展厅中发现一件没有名字、没有历史的文物时彻底崩塌。一次触碰——他们每个人都获得了一种从未请求过的力量,唤醒了某种本不该被唤醒的存在。目前,他们必须正面迎战远古邪恶——即使这条路将他们直通地狱。四个从出生起就被世界抛弃的孩子,如今却成为了世界最后一方式防线。
最近,电影的制作团队 Higgsfield 公开了这部名为《Hell Grind》地狱磨砺的完善制作材料。每一幕每一场,往往积十万多个资产,生成的视往往不方式其数,我们都能在 Higgfield 公开的项目地址查看。https://higgsfield.ai/@higgsfield.studio/projects/hell-grind每一个资产里面,都有完善的提示词和采取的参考图片,如果你有足够的 Seedance 积分,甚至可以 1:1 复刻一个同款电影。里面还有不少中文提示词官方透露,团队在实现前期资产后,用 14 天生成了整部电影需的素材,随后再进入剪辑、修复、调色和声文章制作。项目预算虽然「高达」50 万美元,但其中大部分都是花在了视往往生成消耗的算力上。我们花了一个半小时看完了这部 AI 电影,说实话,一部电影该有的元素它全部都有,跌宕起伏的故事与主题、明确的人物形象、区别于往往见不鲜视往往的视听语言、以及表演和导演。在某一瞬间,甚至让我想到了小时候看的「铠甲勇士」。故事情节就不如范大娘的「混世人魔」有趣了但社交媒体上还是不少网友表示,如果之后的电影都是这样的话,那电影可以宣告死亡了。毕竟一旦提到是 AI 生成的材料,无比如文字还是视往往,就自动贴上「廉价」、「毫不费力」、「敷衍了事」,甚至是「垃圾」等标签。Higgsfield 这次公开的电影制作步骤,似乎和「便捷」二字完全没有关系,50 万美元的成本也并不廉价,在这份内部手册记录的材料里,更是只让人看到了永无止境的尝试和成篇大段的复杂提示词。例如一个最便捷的状况,如何关键让一个没有记忆的模型,后续 95 分钟记住同一张脸、同一个房间和同一种表演?答案可能会有一些反常识,为了让角色在不一样镜头中保持相同,团队会故意砍掉角色设定图里的脑袋;为了避免人物换位,每个场景开头都关键浪费一秒钟,让 AI 重新认识房间;为了生成一段十几秒的镜头,一份提示词甚至能写到三四千字。这份指南像一把手术刀,把如何用 AI 制作一部电影的详详见细方式、可能踩到的坑,以及各种干货资讯全部公开出来。它让我们看到一个往往见不鲜观众几秒钟看完的镜头,到了 AI 面前究竟关键被拆成多少部分?等于多少个提示词?我们也把这套复杂步骤拆成五个往往见不鲜创作者也能复用的方式:先做资产、给空间画地图、把情绪写成动作、用提示词充当场记、在十几次失败后主动简化镜头。Higgsfiled 也有给予 AI 电影学院课程,以及此次 AI 电影的三份 Skillhttps://higgsfield.ai/@higgsfield.studio/projects/hell-grind用提示词解构电影解构一部电影,先关键区分两类材料;一类会随着剧情变化:角色走进房间、拿起武器、说出一句话。另一类需在整部电影里保持稳固:角色首先什么样、怎样走路、采取哪种口文章、紧张时会做什么。《Hell Grind》把后一类材料做成了角色资产。每名题角色都有一段固定的外貌描述,以及三张参考图:面部特写、正面全身和背面全身。正面全身图甚至会被故意去掉头部,避免模型在生成远景时读取那张过小、模糊的脸。这些参考图也被刻意做得很朴素:灰色背景、平光、清楚毛孔,没有胶片颗粒和戏剧化灯光。角色图的存在,只负责回答一个状况:这个人究竟是谁;而之后的电影感应该留给详详见细的场景再做决定。外貌之外,声文章和表现也关键被固定。例如,一个角色的声文章可以被写成:低沉、沙哑的男中低文章;语高效缓慢,带伦敦街头口文章;始终保持具有威胁感的平静,从不提高文章量。他的表现则会被总结成另一段文字:走路的节奏、手部习惯、眼神如何移动、受到压力时怎样掩饰、情绪崩溃前会出现什么动作。角色坐下后,原本来回踱步的焦虑也不会消失,而会转移到摇晃身体、敲击手指和突然加快的手势上。一部电影中的「角色」,由此被拆成了四组可以反复调用的数据:一张脸、一套身体和服装、一种不会漂移的声文章,以及一组贯穿全片的表现习惯。电影中的人物还会受伤、淋雨、换衣服。传统拍摄可以让演员换一套服装后续表演,AI 模型却那么点儿把角色的多个状态混在一起。电影中的男主角获得超能力后会变身,变身的每一种状态都需一个资产文件因此,《Hell Grind》里的每种状态都被拆成独立资产:@roco 是往往见不鲜状态,@roco_wet 是淋雨后的状态,@roco_blood 是受伤后的状态。白天、夜晚和雨天的同一个地点,也会被当作三个不一样场景管理。一件题方式具甚至有三个版本:正常展示的完善版本、放在手掌里的染血版本,以及藏在拳头里的隐藏版本。这套方式背后的逻辑就是:与其期待模型理解一个资产的所有变化,不如把每种变化都变成选定答案。把电影场景写成一张平面图角色之外,AI 电影最那么点儿崩坏的是空间。人类看到一个房间的正面,常见可以推测房间背后和侧面有什么。但视往往模型换一个机位,门窗、家具和灯光都有可能重新排列。上一镜头中,角色站在桌子左边。切到近景后,他可能瞬间出目前另一侧;两个人的站位也可能互换,摄影机甚至会突然越过轴线。《Hell Grind》的处理方式,是给每场戏编写一份固定的空间地图,例如圆形训练垫位于房间中央;房门在画面左侧的远墙上,距离训练垫八米;五个损坏的人偶散落在画面右侧;首先椅距离训练垫两米;摄影机始终停留在房门一侧,不越过这条轴线。这段地图里不存在人物和剧情,只记录空间里永远不变的东西。同一场戏的每个镜头,都关键逐字复制这份地图。团队还会在场景里寻找一个视觉锚点,像是如果用「角色站在房间里」给了模型太多选项,但「角色站在灯旁,照章性房门」则把人物、空间和视线固定在了一起。人物位置也统一采取「画面左侧」「画面右侧」和详详见细距离。因为「站在角色左边」会随着人物转身变化,「画面左侧」却始终只有一个答案。传统片场里,这些材料存在于布景、地面标记、演员走位和场记照片中。到了 AI 电影里,物理空间消失了,整个片场又被人用文字重新搭了一遍。还有一个小提议是场景参考图则尽量选项 3/4 视角。正面构图看起来像一张漂亮壁纸,给予的空间材料却很少。3/4 视角能让模型读到墙面、纵深和转角,换机位时更那么点儿推测房间的其他方向。把十二秒切成可以实施的动作接下来,镜头需被拆成时间。以一场训练室的戏为例,12 秒的动作大致会被写成:0—1 秒:整个房间保持目前状态,一个损坏的人偶仍在摇晃。1—4 秒:房门打开,两个人走进训练室,在训练垫边缘停下。4—8 秒:主角先用眼睛发现他们,随后转头;胸口急促起伏,下巴绷紧一次。8—12 秒:主角说出台词,三个人脸上的笑容同时出现裂痕,没有人后续向前。每场戏的开头,一定是先花一秒让 AI 认路。通过在每场戏开头安排一个约一秒钟的全景镜头,人物不说题台词,也不实施复杂动作,只负责站在正确的位置上;让模型确认现场的状况。实现这次确认后,后面的动作和对白才正式最初。为了让不一样生成片段衔接得更自然,团队还会把上一段对白的最终放进新镜头的首先秒。演员先接住上一句话的尾文章,再说自己的台词,嘴型、文章和反应就更那么点儿连在一起。《Hell Grind》的一条视往往提示词可以实现三四千字。首先度来源于一套固定结构:场景里有几个人,禁止复制;每个角色和场景分别参考哪项资产;房间的固定空间地图;首先帧里每个人站在哪里;镜头时首先、焦段和摄影机运动;每几秒发生一个动作;方式具的重量、接触和惯性;唯一的光源与阴影方向;对白、声文章和环境文章;每个角色的表现状态;画面中必须成立的数量与关系。虽然提示词很首先,单个动作段落却关键尽量短。团队发现,一个时间节点最好只容纳两三句话。模型可以阅读三千字的整体条件,却很难在同一秒实现开门、转身、说话、挥拳和变化表情。动作塞得越多,人物越那么点儿在画面里犹豫、瞬移或者直接停住。复杂动作还关键从生成的首先帧直接最初。如果角色需撞破一扇门,提示词会写成「他已经处于挥拳中段,门板已经最初裂开」。如果用「走到门前、抬起手臂等准备动作」会被拆成另一个镜头。AI 视往往的镜头设方式因此也越来越接近漫画分镜:每一格只处理一个最题的动作。谁又说这不算是另一种「古法」呢?删掉「愤怒」,写下他的下巴角色表演是整套步骤里最反直觉的部分。直接告诉模型「他很悲伤」「他特别愤怒」,常见只能得到夸张、浅层的表情。团队更愿意描述身体正在发生什么:他的下巴绷紧后松开两次;鼻血流到嘴唇,但没有抬手擦掉;一次缓慢眨眼,紧接两次高效高效眨眼,再用力闭眼;目光先落在地上的碎片上,随后才转向门口。角色的内心 OS 也会写进提示词:他想在别人进门前再实现一次攻击;他想隐藏手臂正在失控;门被推开的瞬间,他重新挂上一点勉强的笑。这些材料不会直接出目前台词里,却会变化角色的呼吸、眼神和动作节奏。指南里还提到静态镜头最好每一两秒出现一个微小事件:胸口随着呼吸起伏,鼻翼轻轻移动,手指敲击桌面,眉毛收紧后放松。而「所有人保持不动」之类的提示词,很那么点儿让模型真的冻结画面。更有效的表达是「人物用力维持静止,呼吸仍然没有恢复」。对白也被严格限制在声文章模块中。每个角色只能说引号里的句子,没有台词的人必须保持安静。声文章描述、口文章、语高效和说话习惯会像角色外貌一样,逐字复制到每一个镜头。在这套系统里,表演变成一连串可以被摄像机看见的生理变化。《Hell Grind》采取逐场景生成的方式。每一次修改只变化一行,其余提示词完全保留。团队同时记录提示词版本、修改材料和生成结荚,确保偶然出现的好镜头能够被复现。他们还设定了一条「十到十五次条件」:同一个镜头后续生成十到十五次仍然无法成立,状况大概率已经超出措辞范围。此时后续往提示词里添加限制,频仍只会让模型更混乱。有效的方式是把镜头拆成两段、删掉一个动作、缩小人物活动范围,或者更换机位。或者直接把资产从一个人变成一群人,二十名背景人物可以直接做成一个整体资产怎样把任意一场电影翻译成提示词沿着这套方式,我们也可以尝试反向解构任何一场电影。选项一段 30 秒到两分钟的片段,先暂停剧情,只记录画面里能够被验明正身的事实。建立资产表:谁出目前画面中?哪些外貌、服装、声文章和表现特点需贯穿每个镜头?角色在这场戏里是否受伤、淋雨或者换过衣服?画出空间地图:门、窗、桌子、光源和题方式具分别位于哪里?人物距离地标多远?摄影机位于轴线哪一侧?逐镜头记录摄影材料:景别、机位、焦段、景深、构图、运镜和光线分别是什么?摄影机在跟随人物,还是等待人物进入画面?把动作放进时间轴:第 0—2 秒发生什么,第 2—5 秒又发生什么?每个时间段只留下一个题动作。把情绪翻译成身体动作:角色的目光落在哪里?呼吸是否变化?哪块肌肉先绷紧?手里原本正在做的事,是否因为一句话突然停止?列出后续性约束:人物数量、站位、衣服、方式具、光源方向和伤口位置,哪些材料在下一个镜头里不过对不能变化?最后得到的提示词,大概会呈现这样的结构:场景背景:发生了什么,画面中有几个人角色资产:外貌、服装、声文章、表现习惯空间地图:门窗、地标、人物和摄影机位置首先帧:画面最初时每个人正在做什么摄影:景别、焦段、构图、景深和运镜动作时间线:每几秒发生一个可见动作物理关系:重量、接触、惯性和受力光线:唯一主光源及阴影方向声文章:对白、环境声和空间混响角色表演:目的、隐藏材料、身体节奏和变化后续性:人数、方向、数量和不可变化的关系看完这份指南,我只觉得好难。所谓的 AI 电影,也不是大多数人口中仅凭一句提示词,就能做出来的东西。尤其是看到复杂的镜头设方式时,优秀的画家可以用手画出自己脑海中想象的镜头,但 AI 电影创作者则必须关键用文字把它们描述出来。在社交媒体上发酵了两天,《Hell Grind》最那么点儿被传播的材料,还是开头那几个数字,95 分钟、15 个人和 14 天。但每一份三四千字的提示词,确实给我们给予了另一种理解 AI 电影的角度。我们也很难因为一部 AI 电影的公开就说未来都会是 AI 电影的天下,更乐观的状况,大概是希望 AI 电影和动画片、纪录片、剧情片等是作为同一个分类,它们有机会做到各美其美,美美与共。而这份指南也就有了它存在的价值,让我们入门一个新的电影类别,AI 电影。我们正在招募伙伴简历投递邮箱hr@ifanr.com✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)