English

我照网上教程写了半年提示词,官方文档里居然写着「别这么写」?

猫斯卡编辑部 | 最后更新日期

三条片子的提示词 5374 个字,我一个字都没写

话不多说,先看三条片子。

视频 1 · 唐宫寝殿·夜,Seedance 2.0,15 秒
视频 2 · 吴道子画室·日,Seedance 2.0,15 秒
视频 3 · 黎国城郊山野·日,MiniMax H3,12 秒

三条都是十几秒,我挨个说说它们牛在哪儿。

第一条,钟馗夜里撞进唐宫寝殿打小鬼。

它的提示词里有一句硬约束:钟馗身高约 1.9 米,小鬼约 0.8 米,约为成年人的一半,同框时必须保持这一相对大小,禁止放大小鬼或缩小钟馗。

一大一小这个反差,是这场戏好看的全部理由,它给写死了。

五个镜头,每个都写了从什么画面起、到什么画面落,连光比都标着 8:1。

唐宫寝殿的场景图。这张也是系统自己写提示词出的,我没动手
唐宫寝殿的场景图。这张也是系统自己写提示词出的,我没动手
钟馗
钟馗
小鬼。1.9 米和 0.8 米这个体量差,从定妆图就定下来了
小鬼。1.9 米和 0.8 米这个体量差,从定妆图就定下来了

第二条,唐玄宗让吴道子画钟馗。

四个镜头,三句台词,谁说的、什么音色、说话时镜头怎么怼上去,一句一句绑死。

唐玄宗那句「蓬发,蓝袍」是中低声区、厚重从容的六十岁老年男声;吴道子回「陛下,臣未曾见过此人」是中声区沉稳、略带苍劲感的五十余岁中年男声。

第三镜更狠,写的是急推硬停:从半身中近景一口气推到眼部大特写,硬停在那句「朕见过。你照朕说的画」上。

吴道子画室
吴道子画室
唐玄宗
唐玄宗
吴道子
吴道子

第三条,商朝末年,一个少女藏在土坡后面。

这条换了另一家的视频模型,提示词只有 602 个字,比前两条短了一大截。

短归短,该有的一样没少:航拍起手从高空俯瞰城郊全景,缓慢下推落到土坡后的中近景,指节发白,怀里死死攥着半袋粟米,眼睛盯着山下扬起的烟尘。

黎国城郊山野
黎国城郊山野
黎黍
黎黍

这三段提示词加起来 5374 个字。

全文我原样附在文章最后了,一个标点都没改。搁在这儿你就不往下读了。。。

这三条是在猫斯卡直接生成的,网址 www.maosika.com。

我一个字都没写,也没连过一根线,就点了个生成。

可我不是一直这么省事的。

这半年,这些字都是我自己一个一个抠出来的。

先说说我这半年是怎么写提示词的

这套东西我是在网上学的。

教程看了一堆,课也买过,钱没少花。

真要把一条提示词写好,是真费劲。这一镜从哪起、到哪落、人站在谁的左边、光从哪面打过来、说话的时候镜头动不动,一句一句抠,一条几百字能磨掉大半个下午。

绞尽脑汁写出来的,还不一定对。

写不好的下场很直接:抽一次,废一条,白烧一次算力的钱。改了再抽,还是翻车,再改再抽。。。

钱就是这么没的。

所以后来我干了件事,把厂商的官方文档翻出来,一份一份读。

好家伙,读完发现一个挺尴尬的事儿。

我这半年学的东西,有好几条,官方明明白白写着别这么写。

第一条:「第 3 秒镜头推近」,模型压根看不见这句

网上的教程特别爱教时间轴。

0 到 3 秒推近,3 到 6 秒摇过去,6 到 9 秒切特写,写得跟剪辑表一样工整。

我也这么写过,还觉得自己挺专业。

火山方舟给 Seedance 2.0 配的官方提示词规则里,原话是这样的:

顺序使用「镜头1 / 镜头2 / 镜头3 …」,禁止写绝对秒数(如 0–3s)。Seedance 2.0 对精确时间支持不稳定。

同一份规则里还立了条原则,叫镜头顺序优先于绝对时间。

说人话就是:你写的秒数,它不保证认。你以为在指挥剪辑点,其实是在给自己加戏。

2.5 那代确实认整数时间段了,但官方也把丑话说在前面:这些时间段表示事件预算,不是帧级剪辑点,还专门提醒别声称能精确到 0.5 秒。

该怎么改:把秒数换成「镜头1、镜头2、镜头3」,一镜一句,顺序说清楚就行。

你回头看开头那两条唐朝的片子,里面全是「镜头1、镜头2」,一个秒数都没有。

第二条:四视图六视图,正是角色变双胞胎的原因

这条我踩得最狠。

网上教做人物参考图,一律教你出四视图、六视图,正面侧面背面转一圈,最好再在图上标好「正面」「侧面」,说这样模型才认得清人。

官方那份规则里的原话是:

使用大头照 + 全身照,禁用人物多视图 / 三视图(多视图易触发 ID 漂移与双胞胎)。

它还给了处理办法:检测到你传的是三视图或多视图,主动建议你拆成大头照(仅头部、无表情)加全身照。

道理其实不难想。一张图上摆着四个人形,模型凭什么知道这是同一个人转了四圈,而不是四个长得像的人。

于是你那场戏里就冒出来一对双胞胎。

该怎么改:一张无表情的大头照管脸,一张全身照管身形和衣服,分开传,别合成一张。

我在这上面白扔的抽卡次数,现在想起来还肉疼。

第三条:参考图不是挂得越多越好

我以前的习惯是能挂几张挂几张。

主角一张、配角一张、场景一张、道具再来两张,反正上限是九张,不挂白不挂。

官方的推荐配置是这样的:

推荐 4–5 个素材:角色图 1–2(大头照 + 全身照)+ 场景图 1 + 运镜视频 1 + 音频 1;不建议用满素材上限。

还有一条叫重要素材前置:越需要精准参考的素材,在提示词里放得越靠前。

挂满不但没让画面更准,反倒容易让模型分不清谁才是这一镜的主角。

该怎么改:一场戏只挂这场真正出现的人,加一张场景图,就够了。

开头那三条,最多的一条也只挂了三张:一张场景,两个人。

说到这儿才是重点:这些规则你背下来也没用

我一开始的反应估计跟大伙儿一样:行,那我把官方文档背熟,不就完了。

后来发现这条路走不通,两个原因。

头一个,规则跟着版本变。

2.0 禁止写秒数,2.5 认整数时间段;2.0 禁用人物多视图,2.5 又支持了;2.0 的参考素材上限是九张图,2.5 变成总共五十份。

你去年背熟的那套,今年就是错的。而模型半年一换代。

第二个更要命:这压根不是写作技巧,是每场戏都要重做一遍的机械活。

这一场谁在场、谁有定妆图谁没有、图按什么顺序挂、这句台词是谁说的、会不会把镜头主体抢走、小鬼跟钟馗差几倍高。

一集二十个分镜,一部剧一百集,你自己算算这是多少遍。

人手工干这个,不出错才怪。

那正确的写法长什么样

不背文档,也得知道好提示词长什么样。这几条能直接抄走:

这八条不用猫斯卡也能照着写,抄走就行。

问题只剩一个:每一场戏都手动来一遍,你受得了吗。

回头再看开头那三条

现在你把文末那三段提示词拉出来看,会发现它们全是照着上面这些规矩写的。

我挑几处对着说。

体量用倍数写死。1.9 米对 0.8 米,还补一句禁止放大小鬼或缩小钟馗。这比写「一个高大一个矮小」管用得多。

每镜都有起幅和落幅。画室那条第四镜是垂直下移:起幅是吴道子执笔手腕的中近景,落幅是空白素绢的大特写,笔尖触绢落下第一笔墨。镜头怎么动、停在哪,全在里头。

台词跟着人走。谁说哪句、什么声线、说的时候手上在干嘛,一句一句分开写,不会串。

每张图派什么活儿也写明白。哪张管空间、哪张管脸,各管各的。

最能说明问题的是长度这件事。

同样是我点一下生成,给 Seedance 2.0 的那两条写出来 3070 字和 1702 字,给另一家模型的那条只有 602 字。

格式不一样,长度差五倍,因为这两家认的东西本来就不一样。

规则跟着模型走,这活儿本来就不该由你来记。

这是猫斯卡里的拍摄卡片,提示词就在这儿生成,能打开看,也能自己改
这是猫斯卡里的拍摄卡片,提示词就在这儿生成,能打开看,也能自己改
人物图是同一套逻辑,档案立好脸就定住了。地址还是 www.maosika.com
人物图是同一套逻辑,档案立好脸就定住了。地址还是 www.maosika.com

最后说句实在的

我不是说学提示词没用。

懂一点,你至少知道机器写得对不对,改的时候心里有数。这跟导演不用自己扛摄影机、但得看得懂机位是一个道理。

我是说,把这份文档当必修课去背,性价比太低。它半年一变,而且每场戏都得重来一遍。

开头那三条片子,我出手的地方只有两处:挑了挑本子,选了选片。

中间那 5374 个字,一个都没写。

附:三条片子的提示词全文

一个标点没改,从任务记录里逐字搬过来的。嫌长可以直接划过去,留着以后对照用。

一、唐宫寝殿·夜(3070 字,五个镜头)

整体设定为唐宫寝殿深夜对峙,悬疑追查低照氛围,暗部压向深青冷蓝,关键光与肤色推向琥珀暖橙,冷暖严格分离。将 @图片1 中的唐宫寝殿夜内空间(朱漆立柱、妆台、香炉、殿门、烛火)定义为 <场景1>;将 @图片2 中的魁伟男子定义为 <主体1>(钟馗),音色为偏低沉厚、略带粗粝感的三十岁左右男声;将 @图片3 中的阴邪小怪定义为 <主体2>(小鬼),音色为尖细高亮、带破音颤感的阴邪小怪声。严格体量约束:<主体1> 身高约1.9米,<主体2> 身高约0.8米,约为成年人的一半,同框时必须保持这一相对大小,禁止放大小鬼或缩小钟馗。 镜头1:贴地低角度跟拍冲入(low mount tracking, ground level dolly, 21mm wide angle),起幅:殿门外黑暗地面与门槛的低角度特写 → 落幅:中景,<主体1> 持剑撞开殿门冲入殿内,肩背沉厚顶满画框上沿,<主体1> 肩背绷紧,一手持剑前伸,步幅沉稳定如铁塔,呼吸粗重,衣摆与发丝被冲势带起,殿门在他身后向内弹开,烛火被穿堂风骤然吹斜,方案E悬疑低照青调,唯一动机光源为殿内数盏跳动烛火与殿外冷蓝夜色,光比8:1,暗部保留细节,空气中浮尘在斜切光柱里翻涌,殿门撞开时带起一阵冷风卷动地上香灰,<殿门被猛地撞开的沉重木响,烛火噼啪,衣摆破风声,低频压迫嗡鸣>。 镜头2:固定机位锁定视角(locked-off shot, eye level, 35mm wide angle),起幅:殿内纵深中景,<主体1> 位于画面近景左侧持剑而立 → 落幅:<主体2> 佝偻着身子跳上妆台,位于画面远端右侧,<主体2> 四肢蜷曲,以蹲跳姿态灵便窜上妆台,肩膀耸起,眼珠快速转动,受惊般缩了一下脖子,<主体1> 沉肩坠步,剑锋横在身前,重心压低,方案E悬疑低照青调,烛火自妆台铜镜与朱漆立柱上反射暖橙高光,殿内大面积沉入青蓝暗部,光比8:1,妆台上铜镜反射跳动烛火,香炉中细烟袅袅上升,<小鬼爪子抓挠妆台木面的细碎声响,远处烛火噼啪,殿外夜风呜咽>。 镜头3:侧向平移跟拍横扫(trucking shot, lateral dolly, 35mm wide angle),起幅:<主体1> 沉腰侧身的中景 → 落幅:香炉被撞翻、火星四溅的近景,<主体1> 手腕发力,剑锋自右向左低缓横扫,肩背转动带动腰胯,动作沉猛但不狂乱;<主体2> 借着剑锋掠过的惯性团身翻滚闪开,背脊擦过地面,顺势撞翻身侧香炉,香炉倾倒时火星与香灰向四周炸开,<主体2> 落地后四肢撑地,毛发竖起,方案E悬疑低照青调,横扫剑锋带起的气流使烛火剧烈摇曳,暖橙火光在朱漆地面与铜炉表面快速扫过,光比8:1,香炉翻倒瞬间火星与香灰在冷蓝暗部中炸开成暖橙粒子,铜炉在地面滚动发出闷响,<剑锋破风的锐响,香炉翻倒的金属撞击声,火星噼啪溅落,<主体2> 翻滚时衣料摩擦地面的窸窣声>。 镜头4:低角度仰拍上挑(low angle hero shot, tilt up, 21mm wide angle),起幅:<主体1> 踏前一步压低重心的脚部与剑锋低角度近景 → 落幅:<主体2> 被剑锋挑飞撞向朱漆立柱的中景,<主体1> 踏前一步,靴底重重碾地,膝盖微屈压低重心,手腕自下而上缓慢挑起剑锋,动作由腰腿发力贯通至剑尖;<主体2> 被剑锋自下挑起,身体在空中蜷缩成一团,背脊重重撞上朱漆立柱,柱面沿撞击点裂开一道口子,<主体2> 沿柱面滑落至地,落地瞬间摄影机短促一顿,方案C对峙冲突,硬侧光自主侧烛台打来,<主体1> 半面受暖橙硬光、半面沉入青蓝阴影,光比8:1,<主体2> 被击飞时带起的香灰与火星在光柱中飞散,朱漆立柱碎屑沿裂口缓缓落下,<靴底踏地的沉闷重音,剑锋上挑破风声,<主体2> 背脊撞柱的闷响,柱面木裂声,落地时一声短促重音后环境声骤然压低>。 镜头5:长焦压缩正面逼近(long lens compression, 200mm telephoto, slow creep-in),起幅:<主体2> 瘫坐柱脚的中景 → 落幅:<主体1> 一步一步逼近至<主体2>面前的近景,<主体2> 缩在朱漆立柱根部,身体佝偻成一团,肩膀剧烈颤抖,仰头看向逼近的<主体1>,尖声开口说话;<主体1> 一步一步缓慢逼近,每一步靴底落地都沉缓有力,剑锋垂在身侧,面部半明半暗,眼神沉定,语速缓慢、声音低沉厚重地自报身份,方案C对峙冲突,硬侧光8:1大光比,<主体1> 脸部半明半暗,受光面为暖琥珀橙,背光面沉入青蓝冷影但保留五官细节,朱漆立柱表面烛火跳动,<主体2> 身侧地面香灰余烬明灭,空气中细尘缓落,<靴底碾地的缓慢脚步声,<主体2> 尖细高亮、带破音颤感的声音说:{你不是死了吗。},随后<主体1> 偏低沉厚、略带粗粝感的三十岁左右男声,一字一顿说道:{终南山钟馗。武举不第,触阶而死。}>。 镜头6:急推硬停至大特写(crash push-in, hard stop, 85mm portrait lens),起幅:<主体1> 伸手探向<主体2>后颈的中景 → 落幅:<主体1> 一把揪住<主体2>后颈将其提起的面部与手部大特写,<主体1> 借着逼近的惯性顺势伸出手,指节收紧,一把揪住<主体2>后颈将其提起,手腕稳如铁钳,肩背纹丝不动,下颌微沉,目光直视手中<主体2>,以低沉厚重、略带粗粝的声音沉声说出誓言;<主体2> 被揪住后颈提离地面,四肢悬空乱蹬,身体缩成一团,方案C对峙冲突,硬侧光自侧面烛台打来,<主体1> 面部受光面为暖琥珀橙硬光,指节与剑锋边缘有高光轮廓,暗部压向深青但保留皮肤与衣料纹理,光比8:1,<主体2> 被提起时带起的香灰与火星在两人之间缓慢飞散,烛火在<主体1> 眼中映出细小暖橙光点,<衣料被攥紧的摩擦声,<主体2> 悬空时四肢乱蹬的细碎挣扎声,<主体1> 偏低沉厚、略带粗粝感的三十岁左右男声沉声说道:{今誓为陛下,除尽天下妖孽。},话音落时环境声骤然收窄,只留烛火噼啪与两人呼吸声>。 电影胶片质感,shot on ARRI Alexa 65,Panavision anamorphic lens,变形宽银幕镜头,teal and orange color grade,青橙分级,hard motivated key light,硬光大光比,暗部保留细节,lifted film blacks,shadow detail retained,35mm Kodak Vision3 film grain,35mm胶片颗粒,halation around highlights,高光柔滚降,180 degree shutter with natural motion blur,自然运动模糊,oval bokeh,shallow depth of field,高清,细节丰富,电影质感,低饱和,画面铺满无黑边,no letterbox,人物面部稳定不变形、五官清晰、动作连贯自然,不僵硬,无穿模无卡顿,保持无字幕,避免生成任何文字或字幕,不要生成水印,不要生成 Logo,视频全程禁止出现外形、着装、配饰完全一致的人物,禁止生成同款分身、双胞胎效果,同一画面中<主体1>与<主体2>仅各出现一次,严格保持<主体1>约1.9米、<主体2>约0.8米的体量差,同框时通过机位仰俯与画面占比明确呈现大小差距,禁止放大小鬼或缩小钟馗,服化道严格符合唐代宫廷寝殿时代设定,禁止跨时代物件入画。

二、吴道子画室·日(1702 字,四个镜头)

整体设定为盛唐吴道子画室内日景文戏,自然窗光斜入,尘埃在光柱中浮动,青橙分级电影质感,冷青暗部托暖橙肤色与绢面高光。将 @图片1 中的吴道子画室日景空间定义为 <场景1>;将 @图片2 中的唐玄宗定义为 <主体1>(唐玄宗),音色为中低声区、厚重从容的六十岁左右老年男声;将 @图片3 中的吴道子定义为 <主体2>(吴道子),音色为中声区沉稳、略带苍劲感的五十余岁中年男声。 镜头1:固定机位中近景(eye level, 85mm portrait lens, shallow depth of field),起幅:<主体1> 立于画案侧前方中近景,身后窗棂投下斜向硬光 → 落幅:<主体1> 面部受光面暖橙、半侧沉入冷青阴影的同景别,<主体1> 站姿端凝雍容,肩背沉稳不晃,下颌微抬,目光落向画案方向,语速沉缓开口说 {蓬发,蓝袍。},动机光源为侧方高窗日光,光比6:1,空气中细尘在斜射光柱里缓慢翻卷,窗纸被风轻拂使光影微微游移,音频:衣料窸窣、远处庭院鸟鸣、低沉平稳的语声。 镜头2:过肩镜头固定机位(over-the-shoulder, 50mm standard lens, natural perspective),起幅:越过 <主体2> 肩头看向空白素绢与悬笔的中景 → 落幅:笔尖悬停于绢面上方一寸的同景别,<主体2> 立在画案前微微前倾,执笔手臂稳而不颤,指节轻收,悬腕屏息,侧头略向 <主体1> 方向回应,语气恭谨沉稳地说 {陛下,臣未曾见过此人。},动机光源为窗光自侧前方照落,绢面呈象牙白高光,人物肩背压入冷青阴影,光比5:1,笔锋上一点将落未落的墨珠在光里微颤,案面绢帛被穿堂风轻轻掀动边角,音频:毛笔与空气的极静摩擦、衣料轻响、沉稳男声。 镜头3:急推硬停至面部特写(crash push-in with hard stop, 85mm portrait lens, T1.4 shallow depth of field),起幅:<主体1> 半身中近景 → 落幅:<主体1> 眼部与眉骨大特写硬停,<主体1> 眼神不怒自威,眉峰微沉,语气不容置疑地压低声线说 {朕见过。你照朕说的画。},动机光源为侧硬光切过面部,半明半暗,光比8:1,空气中微尘在脸侧光柱里浮动,背景虚化为冷青椭圆散景,音频:语声落定后环境声短暂一静,只留窗纸轻响与两人呼吸声。 镜头4:垂直下移镜头(tilt down, 50mm standard lens),起幅:<主体2> 执笔手腕的中近景 → 落幅:空白素绢纸面的大特写,狼毫笔尖触绢落下第一笔墨,墨色在绢上缓缓晕开一道浓黑线条,<主体2> 手腕稳而不颤,指腹轻压笔杆,呼吸放轻,动机光源为顶侧窗光垂直落在绢面,墨色沉而不僵,绢面纤维纹理清晰,光比4:1,笔尖落墨瞬间带起极细墨星微溅,尘埃在绢面上方光柱中沉降,音频:<狼毫触绢的细微摩擦声>、墨汁渗入绢丝的轻响、落笔后一瞬的静默。 电影胶片质感,shot on ARRI Alexa 65,Panavision anamorphic lens,teal and orange color grade,hard motivated key light,lifted film blacks with shadow detail retained,35mm Kodak Vision3 film grain,halation around highlights,filmic highlight rolloff,oval bokeh,180 degree shutter with natural motion blur,no letterbox,画面铺满无黑边;高清,细节丰富,电影质感,硬光大光比,暗部保留细节,青橙分级,低饱和;人物面部稳定不变形、五官清晰、动作连贯自然,不僵硬,无穿模无卡顿;保持无字幕,避免生成任何文字或字幕,不要生成水印,不要生成 Logo;视频全程禁止出现外形、着装、配饰完全一致的人物,禁止生成同款分身、双胞胎效果,同一画面中仅保留单个对应人物,不出现人物重复复刻。

三、黎国城郊山野·日(602 字,换了另一家模型)

参考 @图片1 中的黎国城郊山野日间场景,参考 @图片2 中的<主体1>(黎黍),音色为中声区、清亮略紧带怯意的少女声,生成黎黍半蹲在土坡后藏身的画面。开场采用航拍运镜,镜头从高空俯瞰暮春风卷草叶的城郊山野全景,随后缓慢下推落至土坡后方的中近景:<主体1>半蹲在土坡后,指节发白,怀里死死攥着半袋粟米,袋口被手捏得发皱,眼睛睁得极大,紧盯山下扬起的烟尘,呼吸压得极轻,肩膀微微绷紧。<风卷草叶的簌簌声>,<远处隐约传来烟尘扬起的沉闷声响>。古风写实摄影,电影风格,强对比度,极致细节,Chinese period drama, photorealistic, cinematic, high contrast, ultra-fine detail;情绪场景为分离误会(冷疏压抑),主色C6青黛,辅色C1月白+C9中性灰,整体色温偏冷5800-7000K,肤色微暖5200-5600K,强对比度,中低饱和度30-50%,明暗反差鲜明,冷色铺底,暖光仅落在人物面部与粟米袋局部;面容细腻渲染,皮肤细腻,发丝根根分明、发丝细腻渲染,纹理细节超清晰;高清,细节丰富,电影质感,色彩自然,光影柔和;人物面部稳定不变形、五官清晰、动作连贯自然,不僵硬,无穿模无卡顿;保持无字幕,不要生成水印,不要生成Logo;严禁卡通/动漫/二次元/插画风,严禁高饱和荧光色/霓虹色,严禁现代元素入镜,严禁面部变形/多指/肢体异常。

关于猫斯卡 | 猫斯卡 · 专业AI视频自动生产系统。把创意评估、剧本写作、人物场景道具定妆、镜头提示词与出片串成一条可审、可改、可回退的生产链。官网:www.maosika.com