StoryDiffusion长序列故事图像生成工具让多帧漫画中的角色保持一致【免费下载链接】StoryDiffusionAccepted as [NeurIPS 2024] Spotlight Presentation Paper项目地址: https://gitcode.com/GitHub_Trending/st/StoryDiffusionStoryDiffusion 是一个开源的图像生成工具基于扩散模型一种生成图像的深度学习方法。它要解决的问题是连续生成多张图时同一角色在不同画面里长相和服装对不上。当你需要制作漫画、儿童绘本或社交媒体故事图时它可以让主角从第一格到最后一格保持同一张脸。 项目简介StoryDiffusion 解决什么问题StoryDiffusion 出自 NeurIPS 2024 Spotlight 论文技术核心是一个一致自注意力模块它挂在扩散模型SD1.5 或 SDXL 系之上让整段图像序列共享同一份角色特征该模块可热插拔不改动底模。它和普通文本生图工具不同在于单张生图工具只管一张画得像而它管的是一整串图里的角色是同一个。️ 效果展示StoryDiffusion 漫画生成示例这张图展示了一次完整的漫画生成结果按剧情输入多段文字描述后生成的分镜中主角的发色、眼镜、西装在所有画面里保持一致叙事从家中读报推进到森林中的宝藏屋。 快速上手StoryDiffusion 安装步骤与最低显存要求克隆仓库到本地git clone https://gitcode.com/GitHub_Trending/st/StoryDiffusion创建 Python 3.8 以上环境官方建议 3.10安装 PyTorch 2.0 及requirements.txt中的依赖。运行官方低显存版 Gradio 演示执行python gradio_app_sdxl_specific_id_low_vram.py。在浏览器界面填入人物参考图与多段剧情描述点击生成图片会自动保存到 results 文件夹。硬件门槛低显存版在 24GB 显存Tesla A10 30GB 内存上实测通过官方预期 20GB 以上显存可正常运行。核心能力拆解StoryDiffusion 主要功能角色一致长序列生成输入至少 3 段推荐 5–6 段文字描述输出角色形象全程一致的漫画序列兼容所有 SD1.5/SDXL 底模。参考图人物还原输入一张真人照片PhotoMaker 模式生成的漫画角色会与该照片长相一致参考图在 1024x1024 下效果最好。双人同框单帧可同时包含两个人物适合生成对话与相遇类分镜这也是它对单人物方案的扩展。低显存推理官方提供针对显存优化过的 Gradio 版本把本地部署门槛压到 24GB 显存左右。两阶段视频扩展在生成的一致图像序列之上可用运动预测器做图生视频衔接成长视频该部分权重尚未开源。适用场景与人群谁会用 StoryDiffusion场景具体用法漫画创作者用多段剧情提示词批量产出整话故事的分镜草稿主角形象前后统一教师 / 绘本作者输入多个场景描述生成一套角色不跑偏的儿童故事绘本社媒内容创作者生成同一角色贯穿的多格故事图用于连载式帖子AI 工具爱好者克隆仓库跑 Gradio 演示本地验证一致自注意力效果如果你属于以上任何一种角色都可以先跑一次低显存 demo用自己的人物照片测试效果再决定要不要深入配置。注意事项 / 已知限制显存要求不低低显存版按 24GB 显存 30GB 内存设计8–12GB 的消费级显卡难以直接跑动 SDXL 版本参考图模式PhotoMaker还会进一步吃掉显存。提示词数量有下限一致自注意力模块要求至少 3 段文字描述给少了分镜布局会明显变差。视频生成部分运动预测器与长视频模型的源码和预训练权重尚未开源目前只能在本地完整复现漫画图像生成。建议你先从gradio_app_sdxl_specific_id_low_vram.py跑通一轮本地效果项目的最新进展与版本变化可以查看仓库内的 update.md。【免费下载链接】StoryDiffusionAccepted as [NeurIPS 2024] Spotlight Presentation Paper项目地址: https://gitcode.com/GitHub_Trending/st/StoryDiffusion创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
