1. 从“能出片”到“出好片”Ref2VA 模式到底解决了什么问题很多人第一次接触 MiniMax H3 的时候注意力都放在“本地部署”“推荐配置”“整合包”这些环节上觉得只要模型跑起来了输入一句话就能出片。实际用下来你会发现真正决定成片质量的往往不是显卡型号而是你喂给模型的那段提示词。尤其是 H3 的全参考模式也就是大家常说的 Ref2VA它和普通的文生视频T2V、首尾帧FL2VA在提示词写法上完全是两套逻辑。Ref2VA 的核心思路是你给它一组参考素材图片、视频片段、风格样本它需要理解“我要保留参考里的什么”“我要改变参考里的什么”“最终画面要长成什么样”。这三件事如果没在提示词里说清楚模型就会自由发挥结果就是参考图里的角色换了脸、服装变了色、镜头运动跟你想的完全不是一回事。我见过太多人拿着精心挑的参考图最后生成出来一个“长得有点像但哪哪都不对”的东西问题基本都出在提示词没有按 Ref2VA 的格式来组织。这篇内容就是围绕 Ref2VA 的提示词改写格式展开的。我会把参考标签怎么打、六段结构怎么排、保留分析怎么做这三件事拆开讲透同时补充我在实际改写过程中踩过的坑和总结出来的技巧。不管你是刚拿到 H3 整合包的新手还是已经在导演台里跑过几十条片子的老手这套格式指南都能直接拿去用。关键词就几个参考标签、六段结构、保留分析记住这三个词后面的内容都是围绕它们展开的。2. Ref2VA 提示词改写的整体设计思路2.1 为什么 Ref2VA 不能照搬 T2V 的写法普通文生视频的提示词本质上是“描述一个不存在的画面”。你写“一个穿红色连衣裙的女孩在雨中奔跑”模型从零开始构建没有任何约束自由度极高。但 Ref2VA 不一样你给了参考素材模型的第一反应是“我要尽量贴近参考”这时候如果你的提示词还是纯描述性的模型就会陷入两难参考图里女孩穿的是蓝色裙子你提示词写红色它到底听谁的实测下来H3 在 Ref2VA 模式下对参考素材的优先级是高于文本描述的但又不是完全忽略文本。这就导致一个很尴尬的局面你写“红色连衣裙”它可能给你生成一个蓝中带红的诡异颜色或者干脆保留蓝色但把款式改了。所以 Ref2VA 的提示词必须换一种写法不是“描述画面”而是“描述参考素材与目标画面之间的映射关系”。这个映射关系怎么建立靠的就是参考标签和保留分析。参考标签告诉模型“这段文字对应的是哪张参考图的哪个部分”保留分析告诉模型“这部分我要原样保留那部分我要改掉”。六段结构则是把整个映射关系拆成六个维度让模型逐项理解。这三者配合起来才能让模型在“参考”和“创作”之间找到平衡点。2.2 六段结构的底层逻辑让模型逐项对齐六段结构不是随便定的它对应的是视频生成里最关键的六个维度主体、动作、场景、镜头、风格、约束。每一段都有明确的职责而且顺序不能乱。为什么顺序不能乱因为 H3 的文本编码器在处理长提示词时前面的内容会形成“上下文锚点”后面的内容会在此基础上做增量理解。如果你把风格放在主体前面模型可能会先锁定风格然后强行把主体往风格里塞结果就是主体变形。我自己的习惯是把六段结构理解成“给模型的一份施工图纸”第一段是“要建什么”主体第二段是“它怎么动”动作第三段是“建在哪”场景第四段是“从哪个角度看”镜头第五段是“用什么材料装修”风格第六段是“哪些不能动”约束。这个类比不一定严谨但能帮你快速记住每段的职责。六段结构还有一个好处是可复用。你改写一条 Ref2VA 提示词改完之后可以把主体段和风格段抽出来换掉动作段和场景段快速生成同一角色的不同场景视频。这在做系列内容的时候特别省时间不用每次从头写。2.3 参考标签与保留分析的配合关系参考标签是“指路牌”保留分析是“施工要求”。没有参考标签模型不知道你说的“参考图1”到底指哪张没有保留分析模型不知道参考图里的哪些元素要保留、哪些要替换。两者必须成对出现而且要在提示词里形成明确的对应关系。举个例子你有两张参考图图A是一个角色的正面半身像图B是一套服装的细节图。你的参考标签应该写成[ref1: 角色面部与发型]、[ref2: 服装款式与配色]然后在保留分析里写清楚“ref1 的面部特征、发型长度与发色保留ref2 的服装廓形与主色保留但材质改为哑光”。这样模型才能精确地知道每个参考图负责什么以及保留到什么程度。很多人改写失败就是因为参考标签写得太笼统比如[ref1: 角色]、[ref2: 服装]模型拿到这种标签只能猜“角色”是指脸还是全身“服装”是指款式还是颜色。猜错了成片就偏了。所以参考标签一定要细到“面部特征”“发型”“服装廓形”“配色”这个粒度。3. 核心细节解析与实操要点3.1 参考标签的写法规范与常见错误参考标签的基本格式是[refN: 描述]N 是参考素材的序号描述是这个素材负责的内容。描述要具体但不能太长控制在 10 个字以内最好。太长了模型抓不住重点太短了又不够精确。我整理了一个参考标签的写法对照表左边是常见错误写法右边是推荐写法你可以直接对照自己的提示词检查错误写法问题推荐写法[ref1: 角色]太笼统模型不知道指脸还是全身[ref1: 角色面部与发型][ref2: 衣服]没说明是款式还是颜色[ref2: 服装廓形与主色][ref3: 背景]没说明是室内还是室外[ref3: 室内场景布局][ref1: 参考图1]等于没写[ref1: 角色五官比例][ref2: 风格]风格太抽象模型无法定位[ref2: 画面色调与光影]还有一个细节参考标签在提示词里的位置。我的经验是放在六段结构的第一段之前单独成行让模型先建立“有哪些参考素材”的认知然后再进入六段描述。如果你把参考标签混在段落里模型可能会把它当成普通文本处理参考权重会下降。注意参考标签的序号必须和你在导演台或整合包里上传的素材顺序一致。如果你上传了三张图但提示词里只写了[ref1]和[ref2]模型会对第三张图产生困惑可能随机分配权重导致成片不稳定。3.2 六段结构的逐段拆解与参数化写法六段结构每一段都有它的写法要求我逐段来说。第一段主体段。这一段要写清楚画面里的核心主体是什么包括外观、数量、位置关系。Ref2VA 模式下主体段要尽量引用参考标签比如“以[ref1]的面部特征为基础生成一个 25 岁左右的女性角色位于画面中央偏左”。这样模型就知道主体是从参考图来的而不是凭空生成。第二段动作段。动作段描述主体在做什么包括动作类型、速度、幅度。Ref2VA 模式下动作段通常不需要参考标签因为参考图是静态的动作是你要新增的内容。但如果你有视频参考素材可以用[refN]来指定动作来源。动作段的写法要具体比如“缓慢转头视线从画面左侧移向右侧嘴角微微上扬”而不是“她在动”。第三段场景段。场景段描述主体所处的环境包括空间类型、光照条件、背景元素。如果参考图里有场景用[refN]引用如果没有就纯文本描述。场景段要注意和主体段的空间关系一致比如主体在画面中央偏左场景段就不要写“背景右侧有一扇窗”否则模型会 confused。第四段镜头段。镜头段描述摄影机的运动方式包括机位、焦段、运动轨迹。Ref2VA 模式下镜头段是自由度最高的一段因为参考图通常不包含镜头信息。你可以写“中景机位与主体视线平齐缓慢推近”也可以写“特写浅景深镜头轻微手持晃动”。镜头段的写法直接影响成片的“电影感”值得多花时间打磨。第五段风格段。风格段描述画面的整体视觉风格包括色调、光影、质感、参考风格。如果参考图有明确的风格用[refN]引用如果没有就写具体的风格描述词。风格段最容易犯的错误是堆砌形容词比如“唯美、高级、电影感、大片质感”这些词模型理解不了。要写具体的比如“低饱和度青橙色调柔光胶片颗粒感”。第六段约束段。约束段描述哪些内容不能出现或者哪些内容必须保留。这一段是 Ref2VA 模式特有的也是保留分析的落脚点。约束段要写清楚“保留什么”“禁止什么”比如“保留[ref1]的面部特征和[ref2]的服装廓形禁止出现文字、水印、多余肢体”。3.3 保留分析的三个层级全保留、部分保留、替换保留分析是 Ref2VA 提示词改写的核心中的核心。我把它分成三个层级全保留参考素材里的某个元素完全不动原样出现在成片里。比如角色的面部特征、服装的 logo、场景的建筑结构。全保留的写法是“[refN]的 XX 特征完全保留不做任何修改”。部分保留参考素材里的某个元素保留一部分修改另一部分。比如保留服装的廓形但改变颜色保留角色的发型但改变发色。部分保留的写法是“保留[refN]的 XX将 YY 改为 ZZ”。替换参考素材里的某个元素完全替换成新的内容。比如把参考图里的背景从室内换成室外把角色的服装从现代换成古装。替换的写法是“将[refN]的 XX 替换为 YY参考权重降低”。这三个层级要在约束段里明确写出来而且要和参考标签一一对应。我见过有人写了[ref1: 角色面部]但约束段里只写了“保留角色特征”没说是保留面部还是保留全身结果模型把参考图里的服装也一起保留了导致成片和预期不符。提示保留分析的粒度越细成片越可控但提示词也会越长。我的经验是核心元素面部、服装廓形、场景结构写到“部分保留”的粒度就够了次要元素配饰、背景细节可以放宽到“全保留”或“替换”不用每个都写。4. 实操过程与核心环节实现4.1 从零改写一条 Ref2VA 提示词的完整流程我拿一个实际案例来演示。假设我要生成一条视频一个穿汉服的女性角色在竹林里舞剑参考素材有三张——图A是角色面部特写图B是汉服款式图图C是竹林场景图。第一步写参考标签。三张图分别对应[ref1: 角色面部与发型][ref2: 汉服廓形与配色][ref3: 竹林场景布局]第二步写主体段。“以[ref1]的面部特征和发型为基础生成一个 20 岁左右的女性角色身穿[ref2]的汉服位于画面中央全身入镜。”第三步写动作段。“角色右手持剑缓慢抬起至胸前然后向右侧挥出动作流畅衣摆随动作飘动。”第四步写场景段。“场景参考[ref3]竹林环境地面有落叶背景有薄雾光线从画面左上方射入。”第五步写镜头段。“中景机位与角色腰部平齐镜头缓慢向右平移跟随角色动作。”第六步写风格段。“低饱和度青绿色调柔光胶片颗粒感参考[ref3]的光影氛围。”第七步写约束段。“保留[ref1]的面部特征和发型保留[ref2]的汉服廓形和主色保留[ref3]的竹林布局和光影方向。禁止出现文字、水印、多余肢体禁止改变角色性别。”这条提示词写完之后我实测跑了三次成片的面部一致性、服装廓形、场景氛围都基本符合预期。唯一的问题是动作段里的“衣摆随动作飘动”在第一次生成时没有体现第二次我把动作段改成“挥剑时衣摆明显飘动幅度较大”就出来了。4.2 参数配置与参考权重的调整方法Ref2VA 模式下参考权重是一个关键参数。在导演台里每个参考素材都有一个权重滑块默认是 0.5。权重越高模型越倾向于保留参考素材的内容权重越低模型越倾向于自由发挥。我的经验是面部参考权重设 0.7-0.8太低会换脸太高会僵硬。服装参考权重设 0.5-0.6保留廓形但允许材质和褶皱变化。场景参考权重设 0.4-0.5保留布局但允许光影和细节变化。风格参考权重设 0.3-0.4只做氛围引导不锁死具体元素。这些数值不是绝对的要根据参考素材的质量和你的目标来调。如果参考图质量很高权重可以适当降低因为模型本身就能提取到足够的信息如果参考图质量一般权重就要提高否则模型会忽略参考。还有一个技巧如果你发现某个参考元素总是被模型忽略可以在约束段里用“必须保留”的措辞同时把对应参考的权重提高 0.1-0.2。反过来如果某个参考元素总是过度影响成片就在约束段里写“参考权重降低”同时把权重调低。4.3 六段结构的顺序调整与特殊情况处理六段结构的标准顺序是主体、动作、场景、镜头、风格、约束。但在某些特殊情况下这个顺序可以微调。比如你要生成一条“风格优先”的视频也就是风格参考特别重要其他元素都可以让步。这时候可以把风格段提到主体段之前让模型先锁定风格再在风格框架内生成主体。但这样做有风险主体可能会被风格带偏所以只适合风格参考非常明确且你愿意接受主体变化的情况。再比如你要生成一条“动作优先”的视频动作的精确度比主体外观更重要。这时候可以把动作段提到主体段之前但同样有风险主体可能会为了配合动作而变形。我的建议是除非你有明确的理由否则不要轻易调整六段顺序。标准顺序是经过大量测试验证的稳定性最好。还有一种情况是参考素材里包含视频片段。这时候动作段可以直接引用视频参考比如“动作参考[ref4]的视频片段保持动作节奏和幅度一致”。但要注意视频参考的权重不宜过高否则成片会变成参考视频的“翻版”失去创作空间。5. 常见问题与排查技巧实录5.1 参考标签失效的四种典型表现与修复方法参考标签失效是 Ref2VA 模式下最常见的问题。我整理了四种典型表现和对应的修复方法表现可能原因修复方法成片完全忽略参考图参考标签格式错误或权重为 0检查标签格式是否为[refN: 描述]权重是否大于 0.3参考图元素部分丢失标签描述太笼统模型抓不住重点把标签描述细化到具体特征如“面部五官比例”而非“角色”参考图元素过度影响权重过高或约束段没写清楚降低权重 0.1-0.2在约束段写“参考权重降低”多个参考图互相干扰标签序号与素材顺序不一致核对上传顺序确保[ref1]对应第一张图我踩过最坑的一次是参考标签写成了[ref1角色]用了中文冒号。模型直接把这个标签当成了普通文本完全没有触发参考机制。后来改成英文冒号[ref1: 角色]就正常了。这个细节很小但很容易忽略。5.2 六段结构写完后成片偏色的排查思路成片偏色是另一个高频问题。很多人写完六段结构跑出来发现颜色跟参考图完全不一样第一反应是模型有问题其实大概率是风格段和约束段没配合好。排查思路是这样的先看风格段有没有写具体的色调描述。如果你只写了“电影感”模型会随机选一个它认为“电影感”的色调可能是青橙也可能是暖黄。你要写“低饱和度青橙色调”或者“高对比度冷蓝色调”模型才有明确的目标。再看约束段有没有写“保留参考图的色调”。如果你在风格段写了“低饱和度青橙色调”但参考图是暖黄色调模型会优先执行风格段的描述忽略参考图的色调。这时候你要在约束段里写“色调参考[refN]风格段描述仅作为补充”。还有一个隐藏原因是参考图的色彩空间。如果你上传的参考图是 sRGB但模型内部处理用的是线性空间色彩会有偏差。这个问题在整合包里通常有自动转换但如果你用的是手动部署需要检查一下色彩管理配置。5.3 保留分析写得太细导致成片僵硬的平衡技巧保留分析写得太细成片会僵硬写得太粗成片会跑偏。这个平衡怎么找我的经验是“核心元素细写次要元素粗写”。核心元素包括面部特征、服装廓形、场景主结构、镜头运动方向。这些元素如果跑偏了成片就废了所以必须细写。比如面部要写到“五官比例、脸型、发型长度、发色”服装要写到“廓形、主色、材质倾向”。次要元素包括配饰、背景细节、光影微调、材质纹理。这些元素即使有偏差也不会影响成片的整体效果所以可以粗写。比如配饰只写“保留参考图中的耳饰”不用写具体款式背景细节只写“保留竹林布局”不用写每根竹子的位置。这样写的好处是模型在核心元素上有明确的约束不会跑偏在次要元素上有一定的自由度成片不会僵硬。我实测下来这种“粗细结合”的写法成片质量比全细写或全粗写都要好。注意如果你做的是系列内容需要多个视频之间保持高度一致性那核心元素的保留分析要写得更细甚至要固定随机种子。但如果是单条视频可以适当放宽。5.4 常见问题速查表问题排查方向快速修复成片换脸面部参考权重过低或标签不明确权重调到 0.7-0.8标签细化到“面部五官”服装变色风格段色调描述覆盖了参考图约束段写“服装配色参考[refN]”动作不自然动作段描述太抽象改成具体动作序列如“先抬手再挥出”镜头运动缺失镜头段没写或写得太笼统写清楚机位、焦段、运动轨迹场景元素错位场景段与主体段空间关系不一致统一空间描述如“主体在画面中央偏左”成片有文字水印约束段没写禁止项约束段加“禁止出现文字、水印”参考图被完全忽略标签格式错误或权重为 0检查冒号是否为英文权重是否大于 0.36. 我个人的实操体会与后续扩展方向这套 Ref2VA 提示词改写格式我前后用了大概两个月跑了上百条片子最大的体会是参考标签和保留分析是“约束”六段结构是“框架”两者缺一不可。只写六段结构不写参考标签模型不知道参考什么只写参考标签不写六段结构模型不知道最终画面长什么样。两者配合起来才能让模型在“参考”和“创作”之间找到那个微妙的平衡点。还有一个体会是不要追求一次写完美。我现在的习惯是先写一版六段结构跑一次看哪些元素跑偏了然后在约束段里针对性加强。通常跑两到三次就能达到可用状态。如果你追求一次成型反而容易在提示词里堆太多约束导致成片僵硬。后续如果想进一步扩展可以尝试把六段结构模板化做成一个可复用的提示词框架。比如主体段和风格段固定动作段和场景段做成变量这样就能快速生成同一角色的不同场景视频。另外如果你用的是 ComfyUI 整合包可以把这套格式写成一个节点组输入参考图和六段文本自动拼接成完整提示词省去手动改写的麻烦。最后分享一个小技巧在写约束段的时候把“禁止项”放在“保留项”后面。实测下来模型对“禁止项”的注意力会稍微高一点放在后面能更好地压制不该出现的元素。这个技巧不一定有理论依据但在我自己的测试里确实能减少文字水印和多余肢体的出现概率。
