这类工具最值得先看的不是功能列表而是能不能在普通环境里稳定跑起来以及从想法到视频的整个流程是否清晰可控。Seedance2.0 配合 Coze 工作流核心解决的是“快速生成口播带货类视频”的需求它把写脚本、生成语音、生成画面、剪辑合成这几个环节串成了一个自动化流程。如果你经常需要制作产品展示、种草推荐、换装走拍这类内容又不想每次都手动剪辑这个组合值得一试。但别急着上手我建议先把整个流程拆开看。它本质上是一个“文本驱动视频”的自动化方案你给一个产品描述或核心卖点工作流会帮你生成口播文案再转成语音最后用 AI 生成或匹配视频画面合成一个完整的短视频。整个过程在云端完成不需要本地强大的 GPU但需要你理解每个环节的输入输出以及如何调整参数来控制最终效果。下面我会按实际落地顺序拆一遍从环境准备、流程搭建、参数调试到最终输出把每个环节的要点和容易踩的坑都讲清楚。即使你之前没接触过 Coze 或 AI 视频生成跟着步骤走也能跑通。1. 先理清整个工作流的逻辑从文案到视频分几步在开始搭建之前必须理解这个自动化流程是怎么串起来的。很多人一上来就找教程复制工作流但一旦某个环节出错或者想调整风格就完全不知道从哪下手。整个流程可以拆解为四个核心阶段每个阶段都有对应的工具和需要你关注的参数。1.1 第一阶段文案生成与优化这是整个流程的起点也是最容易出问题的地方。你需要一个明确的“输入”。这个输入可以是一个产品名称、几个核心卖点、一段简短的描述甚至是一篇商品详情页的链接。工作流的第一步就是通过一个大语言模型比如 GPT-4、DeepSeek 等来消化这个输入并生成一段适合口播的视频脚本。这里的关键不是让 AI 写一篇华丽的文章而是生成“适合念出来”的文案。你需要关注几个点口播感文案要有停顿、有语气词、有节奏不能是生硬的书面语。在给 AI 的提示词Prompt里一定要强调“生成口播文案”、“口语化”、“有感染力”。时长控制生成的文案字数要对应你想要的视频时长。一般来说中文口语每分钟大约能说 180-220 字。如果你想做一个 30 秒的视频文案长度控制在 90-110 字左右比较合适。结构固定好的口播视频通常有固定结构开头吸引注意力抛出问题或痛点、中间介绍产品卖点1-3个、结尾引导行动点击购买、关注等。你可以在提示词里明确要求这个结构。在 Coze 工作流中这一步通常用一个LLM 节点来完成。你需要配置好这个节点的系统提示词System Prompt和用户输入。系统提示词决定了 AI 的角色和写作风格比如“你是一个专业的带货主播擅长用热情、亲切的口吻介绍美妆产品”。1.2 第二阶段文本转语音TTS文案生成后下一步就是把它变成人声。这里的选择很多比如 Coze 平台自带的 TTS 能力或者接入第三方服务如微软 Azure TTS、阿里云 TTS 等。不同的语音引擎声音质感、情感丰富度和价格都不一样。这个阶段要注意语音选择选择符合你视频定位的声音。是年轻活泼的女声还是沉稳可靠的男声是偏新闻播报还是偏聊天分享语速与停顿TTS 通常可以调节语速。建议将语速设置为中等偏快以匹配短视频的节奏。可以在文案中手动添加停顿符号如、。或特定的[pause]标记取决于 TTS 引擎的支持情况让语音更有呼吸感。输出格式确保 TTS 节点输出的音频文件格式是通用的如.mp3或.wav并且需要记录下音频文件的存储地址通常是返回一个可访问的 URL供下一个节点使用。1.3 第三阶段视频素材生成与匹配这是最核心也最耗资源的环节即 Seedance2.0 发挥作用的地方。你需要根据文案内容生成或匹配对应的视频画面。这里通常有两种模式文生视频Text-to-Video直接使用 Seedance2.0 这类模型输入描述性提示词例如“一个女生在阳光下的草坪上开心地旋转穿着碎花裙手持一款防晒霜镜头特写产品”模型直接生成一段短视频。图生视频Image-to-Video先有一张或多张产品图、模特图然后让模型基于这些图片生成动态视频。这对于需要精准展示产品外观的带货视频非常有用。关键决策点用谁的算力Seedance2.0 模型可能部署在特定平台如即梦官网、某些 AI 平台。你需要在 Coze 工作流中通过HTTP 请求节点或平台提供的专用插件节点去调用这些服务的 API。参数调优视频生成的质量和成本受多个参数影响提示词Prompt用于描述画面要具体、有画面感。避免抽象词汇。负向提示词Negative Prompt用来排除不想要的元素如“模糊、变形、多只手、丑陋”。视频尺寸Resolution如 720p (1280x720) 或 1080p (1920x1080)。短视频平台常用 9:16 的竖版如 1080x1920。时长DurationSeedance 等模型通常支持生成几秒到十几秒的短视频。你需要根据文案长度决定生成一个长视频还是分段生成多个短视频再拼接。种子Seed固定种子值可以保证每次生成的视频画面一致便于调试和批量生成风格统一的视频。1.4 第四阶段音画合成与输出有了音频文件和视频文件可能是一个或多个最后一步就是把它们合成在一起并可能加上字幕、背景音乐、LOGO 等元素。合成工具可以在 Coze 工作流中集成一个视频处理服务同样通过 API 调用或者将音频和视频的 URL 输出在外部用 FFmpeg 等工具合成。一些高级的工作流可能会内置简单的合成节点。字幕生成这是一个提升视频专业度的可选步骤。可以根据 TTS 生成的音频通过语音识别ASR服务自动生成字幕文件如 .srt 格式然后在合成时压入视频。最终输出工作流的终点应该是一个可以直接下载或访问的视频文件 URL。你需要检查这个视频的声画是否同步、画质是否达标、内容是否符合预期。理解这四步之后你再去看任何“一键生成”的工作流都会清晰很多。接下来我们进入具体的搭建环节。2. 搭建前的环境与资源准备在 Coze 里拖拽节点之前有几项准备工作必须做完。这些事没做好工作流百分之百跑不起来。2.1 Coze 平台账号与基础认知Coze 是一个集成了多种 AI 能力的低代码平台你可以把它理解为一个可视化编程工具用连线的方式把不同的 AI 功能节点组合起来。注册与登录访问 Coze 官网用手机号或邮箱注册账号。目前有国内版和国际版注意你访问的域名。了解核心概念Bot机器人/智能体你创建的自动化应用工作流就运行在 Bot 里面。工作流Workflow由多个节点Node和连接线Edge组成的自动化流程。节点Node代表一个具体操作如“调用 LLM”、“发送 HTTP 请求”、“条件判断”。变量Variable用于在不同节点间传递数据比如上一步生成的文案可以存入一个叫script的变量下一步的 TTS 节点再来读取它。积分/额度Coze 平台调用大模型、TTS、ASR 等服务通常需要消耗积分或额度。新用户有免费额度但用于生成视频的 API 调用特别是 Seedance2.0可能涉及第三方计费需要提前了解。2.2 关键服务的 API 密钥准备工作流需要调用外部服务你必须先获得这些服务的“通行证”——API Key。大模型 API Key如果你不满足于 Coze 内置的模型想用 GPT-4、Claude 或国内的其他大模型你需要去对应平台如 OpenAI, Anthropic, 智谱AIDeepSeek等申请 API Key。重要保管好你的 API Key不要泄露在公开的教程或代码里。Seedance2.0 访问权限这是核心。你需要确认在哪里可以使用 Seedance2.0 模型。方式一官方 API。查看即梦 Seedance2.0 的官方文档或平台看是否提供对外开放的 API 接口。如果有通常需要注册、申请并获得一个 API Key 和接口地址Endpoint。方式二集成平台。有些 AI 平台如某些国内的 MaaS 平台可能已经集成了 Seedance2.0你可以在该平台内直接使用并获得该平台的 API Key。方式三本地部署高级。如果你有强大的 GPU 服务器理论上可以尝试本地部署开源模型但这对于“快速出视频”的目标来说门槛和成本都太高不推荐新手尝试。关键点你必须拿到一个可以 HTTP 调用的接口 URL 和对应的鉴权方式通常是 API Key 放在请求头里。没有这个视频生成环节就无法实现。TTS/ASR 服务 API Key可选如果你对 Coze 内置的语音不满意或者需要更专业的字幕生成可能需要准备微软 Azure、阿里云等服务的语音相关 API Key。2.3 明确你的输入与输出预期在搭建前想清楚你要什么这能帮你少走弯路。输入样例准备 2-3 个具体的产品描述样例。例如“一款主打玻尿酸补水的面膜适合熬夜党能快速提亮肤色”。输出要求视频风格是真人实拍感还是动画风格是写实还是偏梦幻视频比例竖屏9:16还是横屏16:9视频时长目标 15秒、30秒还是 60秒是否加字幕需要自动生成字幕吗是否加背景音乐如果需要是工作流自动添加还是后期手动加把这些想清楚后面配置每个节点时目标就非常明确。3. 在 Coze 中逐步搭建工作流现在进入实操环节。我们以创建一个新的 Bot 为例在里面构建工作流。3.1 创建 Bot 与初始化工作流登录 Coze 后点击“创建 Bot”给你的 Bot 起个名字比如“带货视频生成器”。进入 Bot 编辑界面后找到“工作流”标签页点击“创建工作流”。你会看到一个空白的画布。我建议先不要追求一步到位搭建完整流程而是采用“分步测试法”先确保每个独立环节能跑通再把它们连起来。3.2 第一步测试文案生成节点从左侧节点库中拖拽一个LLM节点到画布上。配置该节点模型选择可以选择 Coze 平台提供的模型如Coze-128K也可以连接你已配置好的第三方模型需要在“插件”或“知识库”设置中提前绑定你的 API Key。系统提示词System Prompt这里定义 AI 的角色和任务。例如你是一个专业的短视频带货文案写手。请根据用户提供的产品信息生成一段富有感染力的口播视频脚本。 要求 1. 语言口语化自然亲切像朋友分享一样。 2. 结构为开头吸引注意提出痛点- 介绍产品核心卖点1-3个- 结尾引导行动如“点击下方链接购买”。 3. 文案总字数控制在100字左右对应约30秒视频时长。 4. 输出纯文案文本不要加任何标记或说明。用户输入User Input这里连接工作流的输入。你可以先写死一个测试产品描述比如“{{input}}”然后在工作流触发时传入。添加一个文本Text节点作为输入一个调试Debug节点作为输出。将它们与 LLM 节点连接文本 - LLM - 调试。点击画布右上角的“测试”按钮。在弹出框的input变量里填入你的产品描述点击运行。查看 Debug 节点的输出检查生成的文案是否符合“口播感”和结构要求。如果不满意回头调整系统提示词。3.3 第二步测试文本转语音节点文案生成没问题后在 LLM 节点后添加一个文本转语音TTS节点。Coze 可能内置了此节点也可能需要你搜索添加。配置 TTS 节点输入文本选择上游 LLM 节点输出的变量比如{{LLM.output}}。声音选择从列表中选择一个你喜欢的声音。注意听一下样例选择符合带货氛围的。语速/音调按需调整。输出该节点通常会输出一个音频文件的 URL将其赋值给一个变量如audio_url。将 Debug 节点移到 TTS 节点之后运行测试。这次你应该能在 Debug 信息中看到一个音频链接点击可以试听。确保语音清晰、情感合适、语速匹配。3.4 第三步最关键的一步——集成 Seedance2.0 视频生成这是整个工作流的技术核心也是最多坑的地方。添加 HTTP 请求节点从节点库中添加一个HTTP 请求节点或叫“网络请求”。配置请求参数这是最需要仔细核对的地方。你需要根据 Seedance2.0 API 的官方文档来填写。URL填入你获得的 Seedance2.0 API 接口地址。例如https://api.example.com/v1/video/generate。方法通常是POST。Headers请求头添加Authorization或X-API-Key等字段值为你的 API Key。格式通常是Bearer your_api_key_here或直接your_api_key_here。务必确认文档要求。Body请求体选择JSON格式。内容需要严格按照 API 文档填写。一个典型的请求体可能如下{ prompt: 一个时尚女生在都市街头行走突然从包里拿出一支口红涂抹镜头特写口红丝滑的质感背景虚化阳光明媚画面电影感, negative_prompt: 丑陋模糊变形多只手文字水印, width: 1080, height: 1920, seed: 42, num_frames: 30, fps: 25 }关键点prompt提示词从哪里来这里有两种思路思路A直接用前面 LLM 生成的完整口播文案作为视频提示词。但这通常太长AI 视频模型难以理解。效果可能不好。思路B推荐在工作流中再添加一个LLM 节点专门负责“将口播文案浓缩成1-2句画面感强的视频描述”。例如第一个 LLM 生成文案“这款口红质地丝滑不拔干持久一整天……”第二个 LLM 的任务是“请将以上产品文案提炼成一个具体的、有画面感的视频场景描述用于AI生成视频。只输出描述句子。” 这样得到的prompt质量会高很多。处理响应HTTP 请求节点会返回 API 的响应。你需要解析这个响应拿到生成的视频文件地址。响应通常也是 JSON 格式。例如{code: 0, data: {video_url: https://.../video.mp4}, msg: success}。你需要使用代码Code节点或JSON 解析节点从响应体中提取出video_url这个字段并存入一个变量如video_url。测试与排错先单独测试这个 HTTP 请求节点。可以手动构造一个简单的prompt进行测试。查看响应状态码。如果不是 200检查 URL、API Key、网络权限。如果返回错误信息根据信息调整请求参数。重要视频生成是异步任务很多 API 并不是立即返回视频文件而是先返回一个task_id你需要再用这个task_id去轮询另一个接口查询任务状态直到任务完成才返回video_url。这意味着你的工作流需要增加“轮询”逻辑这通常涉及循环Loop节点和延迟Delay节点。这是搭建中的一个难点。3.5 第四步音视频合成与最终输出假设你已经拿到了audio_url和video_url。寻找合成方案方案ACoze 内搜索 Coze 插件市场或节点库看是否有“视频合成”、“FFmpeg”之类的节点。如果有直接使用配置输入为两个 URL。方案B外部 API使用第三方视频处理 API如一些云服务商提供的媒体处理服务。这需要再添加一个 HTTP 请求节点调用该合成 API。方案C简化输出如果工作流只用于 demo 或对合成要求不高可以暂时不合成。直接输出audio_url和video_url然后手动用剪映等工具快速合成。这对于验证流程可行性是更快的方式。添加字幕可选在 TTS 之后可以添加一个语音转文本ASR节点将音频转成文字再通过一个文本处理节点生成.srt格式的字幕文件。最后在视频合成时将字幕文件也作为输入。设置工作流输出在最终节点将合成后的视频文件 URL或分开的音频、视频 URL设置为工作流的输出变量。整体联调连接所有节点输入 - LLM(文案) - LLM(提炼画面) - HTTP(生成视频) - 轮询 - 获取视频URL - TTS - 获取音频URL - 合成 - 输出。进行端到端测试。4. 参数调优与效果提升指南工作流能跑通只是第一步要做出可用、好用的视频必须精细调整各个环节的参数。这里把每个环节的关键调优点梳理出来。4.1 文案提示词优化让 AI 写出更带货的脚本系统提示词是灵魂。不要只写“生成口播文案”要给它更具体的指令和样例。加入角色和场景“假设你是在抖音拥有百万粉丝的美妆博主‘小美’正在直播间向粉丝热情推荐一款新品面膜。你的语言风格是亲切、有活力、喜欢用感叹号和表情符号。”给出结构模板“严格按照以下结构写作1. 开头10字内用疑问句抓住眼球例如‘熬夜脸又黄又糙怎么办’。2. 卖点介绍分三点每点用‘它最大的亮点就是…’‘更厉害的是…’‘最让我惊喜的是…’开头。3. 结尾引导行动例如‘今天在我直播间直接给你们炸福利价’”控制长度和禁忌“总字数严格控制在90-110字。禁止出现‘大家好’、‘欢迎收看’等老套开头。禁止使用复杂难懂的科技词汇。”4.2 视频生成提示词工程从文案到画面这是决定视频质量上限的环节。让第二个 LLM 节点学会“翻译”卖点文案为视觉语言。给“翻译官”LLM 清晰的指令你是一个视频导演擅长将产品卖点转化为具体的电影镜头。 任务将给定的口播文案提炼成一个单一的、充满动感和细节的短视频画面描述。 要求 1. 描述一个连贯的、10秒左右的场景。 2. 聚焦人物动作、表情、产品特写、环境氛围。 3. 使用具体的视觉词汇如“特写”、“慢动作”、“从…摇到…”、“阳光透过树叶的光斑”、“丝绸般顺滑的质感”。 4. 输出仅一句话不要分段不要解释。 示例 输入文案“这款防晒霜清爽不粘腻成膜快海边度假必备。” 输出描述“一个女生在海边欢笑奔跑抬手涂抹防晒霜镜头特写乳液在皮肤上迅速化成水珠并被吸收的瞬间背景是湛蓝的海水和耀眼的阳光。”善用负向提示词Negative Prompt这是提升画面质量的利器。通用性较强的负向提示词包括ugly, blurry, low resolution, cartoon, 3d render, deformed, distorted, extra limbs, bad anatomy, text, watermark, signature。你可以根据你的产品类型添加更具体的例如做美食视频可以加raw, uncooked, burnt。4.3 视频生成参数详解调用 Seedance2.0 API 时这些参数直接影响结果参数含义与建议影响prompt画面描述。必须具体、有镜头语言。决定生成内容。negative_prompt排除内容。使用通用组合场景特例。减少画面错误提升质量。width/height视频分辨率。竖屏视频用1080x1920。适配平台影响生成速度与成本。seed随机种子。固定一个数字如12345可使生成结果可复现。便于调试和生成风格一致的系列视频。num_frames总帧数。duration num_frames / fps。30帧视频约1.2秒。决定视频时长。通常需要50-150帧2-6秒。fps帧率。常用25或30。影响视频流畅度。cfg_scale提示词相关性。值越高越遵循提示词通常7-12。平衡创意与可控性。太高可能画面僵硬。steps生成步数。步数越多质量可能越高耗时越长。影响生成时间和质量。可从20开始尝试。实测建议先用一组固定的参数seed固定生成多个视频只改变prompt观察提示词的影响。然后再固定prompt调整cfg_scale、steps等感受画质和风格的变化。找到一组效果稳定、成本可接受的“黄金参数”。4.4 工作流稳定性与效率优化当单次生成成功后就要考虑批量、稳定和错误处理。错误处理与重试在 HTTP 请求节点调用视频生成 API后一定要添加条件判断Condition节点。判断响应状态码是否为 200或者返回的 JSON 中code是否为 0。如果失败可以设计重试逻辑例如跳转回前一个节点重试或记录错误并继续下一个任务而不是让整个工作流崩溃。异步任务轮询如果视频生成是异步的轮询逻辑要设置超时和最大重试次数。例如每 5 秒查询一次任务状态最多查询 60 次即等待 5 分钟。超时后应判定为失败进行错误处理。批量处理Coze 工作流可以触发批量运行。你可以准备一个产品列表如一个 CSV 文件或 JSON 数组通过循环Loop节点为列表中的每个产品执行一次完整的视频生成流程。注意输出时要妥善命名文件避免覆盖例如将产品 ID 或名称包含在输出的文件名中。成本与耗时监控视频生成是主要成本来源。记录每次调用的耗时和状态有助于你评估效率。可以在工作流中添加日志Log节点将关键信息如任务ID、开始时间、结束时间、状态输出到控制台或外部文件。5. 常见问题排查与进阶思路即使按照教程搭建也难免遇到问题。这里列出几个高频问题点和排查思路。5.1 工作流运行报错或卡住问题点击测试后工作流一直“运行中”或直接报错。排查顺序检查节点连接确保每个节点的输出变量名与下游节点的输入变量名引用完全一致。Coze 对变量名大小写敏感。检查 API 密钥与网络重点检查调用 Seedance2.0 的 HTTP 请求节点。确认 API Key 未过期、有余额、填写格式正确是否多了空格。尝试在浏览器或 Postman 中直接调用该 API看能否成功。检查输入输出格式LLM 节点的输出是否是纯文本TTS 节点接收的文本是否过长或有特殊字符HTTP 请求的 Body 是否符合 JSON 格式使用 Debug 节点查看每个步骤的实际输出。检查异步轮询如果卡在视频生成环节很可能是轮询逻辑陷入死循环。检查轮询的条件判断是否正确任务状态是否从“处理中”变成了“成功”或“失败”。增加一个超时跳出循环的逻辑。5.2 生成的视频质量不佳问题画面模糊、扭曲、内容与文案无关。排查与优化提示词问题这是首要原因。你的视频prompt是否足够具体、有画面感不要用“一个好看的人用产品”要用“一个亚洲模特点在明亮的化妆镜前微笑着拿起一款银色包装的口红镜头给到口红旋转出来的特写膏体质地细腻有光泽”。多用名词和形容词少用抽象词。负向提示词不足强化你的negative_prompt。把常见的低质量描述都加进去。模型能力边界理解当前 AI 视频生成的局限性。它很难生成精确的文字、复杂的手部动作、多人物交互或特定的品牌 Logo。调整你的文案和画面描述避开这些难点。参数调整适当提高steps和cfg_scale可能提升质量但也会增加生成时间。找到一个平衡点。5.3 音画不同步或合成失败问题最终视频里人声和嘴型或画面切换对不上。解决时长匹配确保生成的视频时长num_frames / fps与 TTS 音频的时长大致匹配。如果视频短了可以循环播放视频片段如果视频长了可以在合成时截取音频对应长度的视频部分。这可能需要你在合成节点进行更精细的配置。合成工具如果使用外部合成 API查阅其文档看是否支持根据音频时长自动裁剪视频或指定输出时长。手动校对对于非常重要的视频目前最可靠的方式仍然是工作流输出分开的音视频文件后导入专业剪辑软件如剪映、Premiere进行最终校对和合成。自动化流程可以完成80%的工作最后20%的精细调整手动完成效率依然很高。5.4 进阶让工作流更智能基础流程跑通后可以考虑以下增强点多镜头生成与剪辑不要只生成一个长镜头。可以让工作流根据文案的不同段落生成多个 3-5 秒的短视频片段每个片段对应一个卖点然后自动将这些片段与对应的音频段落合成最后拼接成一个完整的视频。这需要更复杂的工作流编排和视频处理能力。自动添加背景音乐与音效在工作流中集成一个音乐库根据视频风格如欢快、舒缓、科技感自动选择背景音乐并在合成时以较低音量混入。个性化模板为不同品类的产品美妆、3C、食品创建不同的提示词模板和视频风格参数。在工作流开始时让用户选择品类然后自动加载对应的模板。结果审核与筛选批量生成时可以引入一个“筛选”环节。例如生成多个候选视频调用一个视觉质量评估的 API 进行打分只输出分数最高的那个。这个方案的真正价值不在于“全自动”而在于“标准化”和“提效”。它把视频创作中重复、耗时的部分写口播稿、找素材、粗剪自动化了让你能把精力集中在更核心的创意和优化上。一开始搭建可能会花点时间但一旦流程跑顺批量生产内容的速度会有质的提升。先从最简单的单视频生成做起确保每个环节都理解透彻再逐步增加复杂度和自动化水平。
