AI Story Pipeline
我和伙伴一起做了一套 AI 连载剧制作工具,把小说解析、角色设定、剧本、分镜、视频和配音放进同一个 Web 系统。我主要负责产品梳理、系统架构和前后端开发,也完成了模型接入、部署与测试。后来,我们用这套系统制作了《影楼诡事》。
先从一部真正要做的短剧开始。
这个项目的想法最早由合作伙伴提出。我们想尝试用 AI 做连续短剧,讨论下来发现,制作过程中需要在文本、生图、视频和配音工具之间反复切换。角色设定、镜头描述和生成素材也要跟着来回整理。
于是,我们决定把这些步骤放到同一个系统里,并用《影楼诡事》试着走完一次制作。团队一共三人:我负责产品和技术,伙伴一起讨论方向,前端同事负责部分 UI 界面搭建。
从一段小说,到可以逐个修改的镜头。
我先按实际制作顺序拆出几个阶段。小说输入后,系统提取角色、场景和道具;确认这些信息,再整理剧本和分镜。分镜画面选定后继续生成视频,配好声音,最后组织片段、合成成片。
一部剧的文本、角色图、分镜和音视频都放在同一个项目下。制作时可以回到对应阶段修改内容,生成效果不合适的镜头也可以单独重做。

先把内容确认清楚,再进入图片和视频生成。
- 01小说解析提取人物、场景与道具
- 02角色与资产核对信息,确定参考图
- 03剧本与分镜拆解剧情,编辑镜头
- 04画面与声音生图、视频生成与配音
- 05合成成片组织视频片段与音频
角色信息、剧本、分镜和生成结果都可以人工确认与修改。
先认清角色,再让他出现在不同镜头里。
小说里,同一个人可能有几种称呼,人物信息也分散在不同段落。AI 有时会把这些称呼拆成不同角色。如果直接往下生成,后面的角色图和分镜就会跟着出错。
我在角色提取后加了一步人工确认,先核对名字和人物关系,再确定角色参考图。后续分镜持续使用这张图,尽量减少脸型、发型和服装的变化。
固定参考图能提高前后镜头的稳定性,但仍然需要检查生成结果。人物外观是否一致,最终还要逐镜头看。

AI 做初步提取,人来核对和修正。
每次生成沿用同一份视觉设定,再检查结果。

分镜要留得住修改的空间。
一段剧本写清了发生什么,却未必说清镜头怎么拍。画面里有谁、站在哪里、用什么景别、镜头是否移动,这些都需要在生成视频之前补出来。
所以我把分镜做成独立的编辑阶段。系统先根据剧本和已有资产给出一版镜头,创作者可以改画面描述和提示词、插入新镜头、调整顺序,也可以重新生成某个分镜。确认后再去生图和制作视频。

这些信息跟随镜头进入后续生成。
- 内容
- 对应剧情、出场角色、场景与道具
- 画面
- 景别、构图、动作、光线与氛围
- 动态
- 镜头运动、时长、视频生成提示词

每个制作环节,都能选择合适的模型。
文本、生图、视频和配音对模型的要求不同,同一环节也常常要在效果、速度和费用之间做选择。我把这些接入分开,让使用者按当前任务选择模型。
成本方面,我们先采用直接的办法:提供多种模型,由创作者按预算和效果选择。第一版的主要精力放在各阶段的数据衔接、人工编辑和实际制作上。
用《影楼诡事》走完一次制作。
系统完成部署和流程测试后,我们用《影楼诡事》验证了从小说输入到成片输出的制作过程。页面开头的视频就是实际产出,包含生成的镜头和配音。
这次制作也让我更清楚地看到哪些地方需要人来判断:角色是否认对、前后镜头是否像同一个人、画面是否说清了剧情。这些检查和修改的入口,都是制作工具里需要认真做好的部分。


我负责把产品想法整理成具体的制作流程,完成系统架构、前后端业务开发、AI API 接入与多模型支持,并推进部署、测试和实际内容验证。合作伙伴参与产品方向讨论,部分前端 UI 由同事搭建。

