AI Melody
让 AI 配合直播中的演唱
我为一位从事音频内容的客户,独立设计、开发并交付了 AI Melody。我将本地 AI 音频处理、麦克风检测、多音轨播放和专业声卡整合为一款 Windows 桌面产品:直播前准备好 AI 人声,直播中根据主播发声状态自动控制播放,再将音轨送入 Studio One 和后续直播链路。

“让 AI 配合主播唱歌”,需要落到一整条音频工作流里。
客户长期从事音频相关的自媒体内容,希望开发一款能在音乐直播中使用的 AI 工具。最初的需求很直接:主播演唱时,软件自动配合播放 AI 人声;主播停下来时,保留伴奏,减少直播过程中频繁操作软件的负担。
当我把这个想法拆开后,发现它同时涉及 AI 人声生成、麦克风检测、音轨同步、专业声卡与直播软件。我的工作是把这些能力组织成一款主播能直接使用的产品,并按可供更多主播使用的通用工具来规划。
客户委托 · 独立完成
- 产品
- 客户沟通、需求分析、产品规划与架构
- 设计与开发
- UI、前端、Electron、Python 与本地 AI 模型接入
- 集成与交付
- VAD、音轨控制、声卡输出、Studio One 联动与环境测试
我把高计算量的生成任务,放在开播之前。
最重要的架构判断,是将 AI 音频生成与直播时的控制拆开。如果在演唱过程中才生成人声,计算速度、稳定性和延迟都会进入实时链路。直播场景需要的是声音在正确的时刻出现,因此我选择先生成整首 AI 人声,再控制已有音轨。
产品由此分成两个阶段:直播前负责人声分离、音色克隆与歌曲人声生成;直播中负责检测、同步、切换与输出。这让复杂的模型运算退出实时路径,也让用户清楚知道哪些工作需要提前准备。
准备声音
将歌曲和主播音色,转换成可以直接播放的素材。
- UVR 分离人声与伴奏
- 上传主播声音,建立音色
- 生成整首 AI 人声音轨
控制声音
依据麦克风状态,控制同一播放位置上的音轨。
- 麦克风进入 VAD 检测
- 自动切换 AI 人声播放状态
- 多通道输出至专业音频链路
让分离、克隆和生成,成为一次连续的准备过程。
如果把模型单独交给用户,主播需要在多个工具之间反复导入和导出文件。我将这些操作收进 AI Melody:先创建曲库条目,导入原歌、伴奏、人声和歌词;只有完整歌曲时,也可以通过 UVR 自动拆分音轨。
接着,主播上传自己的语音或演唱录音,由本地模型建立对应音色,并提前生成整首歌曲的 AI 人声。Electron 桌面端承接操作与反馈,Python 模块负责主要音频处理和模型调用,核心生成过程在本地完成。

两类素材,汇入同一首歌曲。
原歌提供歌曲内容,主播录音提供目标音色。伴奏保留为独立音轨,用于后续同步播放。
与伴奏一起进入曲库,等待直播时调用。
演唱时加入 AI 人声,停下来后继续伴奏。
在 Auto 模式下,软件持续采集麦克风,通过 VAD(人声活动检测)判断当前发声状态。检测到主播开始演唱时,系统播放伴奏与提前生成的 AI 人声;主播停止演唱后,关闭 AI 人声音轨,伴奏继续。
这不是从头重播一段人声,而是在同一个歌曲播放位置上控制音轨。VAD 判断、音轨状态与输出需要相互对应;呼吸声、环境噪声和非演唱语音也可能影响检测,因此误触发、切换延迟与实际听感是我在集成和测试中重点关注的问题。
一条时间线,两种输出状态。
两条音轨保持同一播放位置
让 AI Melody 接入主播已有的声卡与 Studio One。
主播通常已经有专业声卡、Studio One 和 OBS 等直播软件。我把 AI Melody 放在这条工作流中:将不同音轨按通道输出到声卡,交给 Studio One 继续处理,再进入后续直播链路。
麦克风在 AI Melody 中主要承担 VAD 检测与播放触发,主播的原始麦克风声音并不由 AI Melody 直接作为最终直播声音输出。这意味着我既要处理软件中的播放状态,也要在真实硬件环境里确认每条音轨最终去了哪里。
控制信号与音频输出,各自走清楚的路径。
麦克风决定何时切换,准备好的音轨决定输出什么。
- 01AI Melody同步播放伴奏与 AI 人声
- 02多通道声卡将音轨送入对应通道
- 03Studio One接入主播的 DAW 工作流
- 04直播软件进入后续直播音频链路
界面提供 Studio One 双轨预设:伴奏 1/2,人声 3/4。
把直播时需要关注的信息,留在同一个工作区。
主界面左侧是曲库,中间集中呈现当前歌曲、播放模式、音频波形和进度,右侧承接歌词与音频设置。主播可以在同一视野里确认正在播放什么、处于哪种模式,以及声音将输出到哪个设备。
我用深色界面、半透明层次与蓝紫渐变波形组织视觉,突出播放状态与声音反馈。输出设备、声道预设、VAD 灵敏度、伴奏变调和 Python 服务状态都有直接可见的位置,方便在准备和直播过程中定位配置与连接问题。
找到要播的歌
歌曲列表、搜索与导入入口集中在左侧;底部显示 Python 音频服务连接和任务状态。
看清当前状态
当前歌曲、Auto 等播放模式、波形、播放进度与麦克风状态组成主要操作区。
确认声音去向
歌词与输出设备、声道预设、VAD 灵敏度和变调参数集中在右侧。
桌面体验、音频引擎与账号服务,共同组成可交付的产品。
- Windows 桌面端
- Electron · HTML / CSS / JavaScript曲库、界面、任务反馈与播放控制。
- 音频与本地 AI
- Python · UVR · VAD音轨分离、音色克隆、AI 人声生成、麦克风采集与音频处理。
- 账号与轻量后台
- 登录 · 注册 · 授权用户与套餐管理,按日、月、年管理使用授权。
交付的最后一段,在真实直播环境中完成。
项目开发周期约一个半月,主要投入集中在产品逻辑、AI 音频整合、音轨控制和实际环境联调。测试不只检查页面是否可用,还要确认声卡输出是否正确、Studio One 能否接收对应音轨、VAD 是否稳定,以及切换是否影响听感。
AI Melody 已经交付客户,并在真实直播环境中稳定运行。从最初的自动跟唱想法,到本地 AI 处理、桌面产品和专业音频链路,我独立完成了整个过程。这个项目体现了我将产品、设计、软件与硬件环境一起推进到实际使用的能力。
到直播现场
Windows AI 音频产品
- 生成
- 在本地完成直播前的 AI 音频准备
- 控制
- 通过 VAD 自动控制同步音轨的播放状态
- 接入
- 多通道声卡、Studio One 与客户实际直播环境
这是一个由我独立完成的客户委托项目。我负责客户沟通、需求分析、产品架构与 UI 设计,以及前端、Electron 桌面端、Python 音频模块、本地 AI 模型接入、VAD 与音轨控制、声卡和 Studio One 联动,最后完成测试与交付。