AI Melody
让 AI 配合直播中的演唱

2026

我为一位从事音频内容的客户,独立设计、开发并交付了 AI Melody。我将本地 AI 音频处理、麦克风检测、多音轨播放和专业声卡整合为一款 Windows 桌面产品:直播前准备好 AI 人声,直播中根据主播发声状态自动控制播放,再将音轨送入 Studio One 和后续直播链路。

AI Melody 主播放界面,左侧曲库,中间为播放模式和蓝紫音频波形,右侧为歌词与音频输出设置
AI Melody 主播放界面:将曲库、播放模式、波形、歌词和音频设置收进一个直播工作区。

“让 AI 配合主播唱歌”,需要落到一整条音频工作流里。

客户长期从事音频相关的自媒体内容,希望开发一款能在音乐直播中使用的 AI 工具。最初的需求很直接:主播演唱时,软件自动配合播放 AI 人声;主播停下来时,保留伴奏,减少直播过程中频繁操作软件的负担。

当我把这个想法拆开后,发现它同时涉及 AI 人声生成、麦克风检测、音轨同步、专业声卡与直播软件。我的工作是把这些能力组织成一款主播能直接使用的产品,并按可供更多主播使用的通用工具来规划。

从需求到交付约 1.5 个月

客户委托 · 独立完成

产品
客户沟通、需求分析、产品规划与架构
设计与开发
UI、前端、Electron、Python 与本地 AI 模型接入
集成与交付
VAD、音轨控制、声卡输出、Studio One 联动与环境测试

我把高计算量的生成任务,放在开播之前。

最重要的架构判断,是将 AI 音频生成与直播时的控制拆开。如果在演唱过程中才生成人声,计算速度、稳定性和延迟都会进入实时链路。直播场景需要的是声音在正确的时刻出现,因此我选择先生成整首 AI 人声,再控制已有音轨。

产品由此分成两个阶段:直播前负责人声分离、音色克隆与歌曲人声生成;直播中负责检测、同步、切换与输出。这让复杂的模型运算退出实时路径,也让用户清楚知道哪些工作需要提前准备。

BEFORE LIVE / 直播前

准备声音

将歌曲和主播音色,转换成可以直接播放的素材。

  1. UVR 分离人声与伴奏
  2. 上传主播声音,建立音色
  3. 生成整首 AI 人声音轨
输出:伴奏 + 已生成的 AI 人声
ON AIR / 直播中

控制声音

依据麦克风状态,控制同一播放位置上的音轨。

  1. 麦克风进入 VAD 检测
  2. 自动切换 AI 人声播放状态
  3. 多通道输出至专业音频链路
重点:检测、同步、播放与输出

让分离、克隆和生成,成为一次连续的准备过程。

如果把模型单独交给用户,主播需要在多个工具之间反复导入和导出文件。我将这些操作收进 AI Melody:先创建曲库条目,导入原歌、伴奏、人声和歌词;只有完整歌曲时,也可以通过 UVR 自动拆分音轨。

接着,主播上传自己的语音或演唱录音,由本地模型建立对应音色,并提前生成整首歌曲的 AI 人声。Electron 桌面端承接操作与反馈,Python 模块负责主要音频处理和模型调用,核心生成过程在本地完成。

创建曲库条目弹窗,可选择原歌、伴奏、人声干声和歌词,并勾选使用 UVR 从原歌自动分离
歌曲导入已有音轨可以直接导入,只有原歌时则进入 UVR 自动分离流程。

两类素材,汇入同一首歌曲。

原歌提供歌曲内容,主播录音提供目标音色。伴奏保留为独立音轨,用于后续同步播放。

歌曲素材原始歌曲 UVR 分离保留伴奏与人声干声
音色素材主播录音 本地音色克隆建立用于生成的主播音色
提前生成整首 AI 人声

与伴奏一起进入曲库,等待直播时调用。

演唱时加入 AI 人声,停下来后继续伴奏。

在 Auto 模式下,软件持续采集麦克风,通过 VAD(人声活动检测)判断当前发声状态。检测到主播开始演唱时,系统播放伴奏与提前生成的 AI 人声;主播停止演唱后,关闭 AI 人声音轨,伴奏继续。

这不是从头重播一段人声,而是在同一个歌曲播放位置上控制音轨。VAD 判断、音轨状态与输出需要相互对应;呼吸声、环境噪声和非演唱语音也可能影响检测,因此误触发、切换延迟与实际听感是我在集成和测试中重点关注的问题。

AUTO MODE / 播放逻辑示意

一条时间线,两种输出状态。

伴奏持续播放
AI 人声加入播放

两条音轨保持同一播放位置

当前输出伴奏 + AI 人声交互示意,不采集麦克风或播放音频。

让 AI Melody 接入主播已有的声卡与 Studio One。

主播通常已经有专业声卡、Studio One 和 OBS 等直播软件。我把 AI Melody 放在这条工作流中:将不同音轨按通道输出到声卡,交给 Studio One 继续处理,再进入后续直播链路。

麦克风在 AI Melody 中主要承担 VAD 检测与播放触发,主播的原始麦克风声音并不由 AI Melody 直接作为最终直播声音输出。这意味着我既要处理软件中的播放状态,也要在真实硬件环境里确认每条音轨最终去了哪里。

控制信号与音频输出,各自走清楚的路径。

麦克风决定何时切换,准备好的音轨决定输出什么。

控制输入麦克风 VAD 播放状态
  1. 01AI Melody同步播放伴奏与 AI 人声
  2. 02多通道声卡将音轨送入对应通道
  3. 03Studio One接入主播的 DAW 工作流
  4. 04直播软件进入后续直播音频链路

界面提供 Studio One 双轨预设:伴奏 1/2,人声 3/4。

把直播时需要关注的信息,留在同一个工作区。

主界面左侧是曲库,中间集中呈现当前歌曲、播放模式、音频波形和进度,右侧承接歌词与音频设置。主播可以在同一视野里确认正在播放什么、处于哪种模式,以及声音将输出到哪个设备。

我用深色界面、半透明层次与蓝紫渐变波形组织视觉,突出播放状态与声音反馈。输出设备、声道预设、VAD 灵敏度、伴奏变调和 Python 服务状态都有直接可见的位置,方便在准备和直播过程中定位配置与连接问题。

01 / 曲库

找到要播的歌

歌曲列表、搜索与导入入口集中在左侧;底部显示 Python 音频服务连接和任务状态。

02 / 播放

看清当前状态

当前歌曲、Auto 等播放模式、波形、播放进度与麦克风状态组成主要操作区。

03 / 设置

确认声音去向

歌词与输出设备、声道预设、VAD 灵敏度和变调参数集中在右侧。

桌面体验、音频引擎与账号服务,共同组成可交付的产品。

Windows 桌面端
Electron · HTML / CSS / JavaScript曲库、界面、任务反馈与播放控制。
音频与本地 AI
Python · UVR · VAD音轨分离、音色克隆、AI 人声生成、麦克风采集与音频处理。
账号与轻量后台
登录 · 注册 · 授权用户与套餐管理,按日、月、年管理使用授权。

交付的最后一段,在真实直播环境中完成。

项目开发周期约一个半月,主要投入集中在产品逻辑、AI 音频整合、音轨控制和实际环境联调。测试不只检查页面是否可用,还要确认声卡输出是否正确、Studio One 能否接收对应音轨、VAD 是否稳定,以及切换是否影响听感。

AI Melody 已经交付客户,并在真实直播环境中稳定运行。从最初的自动跟唱想法,到本地 AI 处理、桌面产品和专业音频链路,我独立完成了整个过程。这个项目体现了我将产品、设计、软件与硬件环境一起推进到实际使用的能力。

DELIVERED / 已交付从想法
到直播现场

Windows AI 音频产品

生成
在本地完成直播前的 AI 音频准备
控制
通过 VAD 自动控制同步音轨的播放状态
接入
多通道声卡、Studio One 与客户实际直播环境
我的贡献

这是一个由我独立完成的客户委托项目。我负责客户沟通、需求分析、产品架构与 UI 设计,以及前端、Electron 桌面端、Python 音频模块、本地 AI 模型接入、VAD 与音轨控制、声卡和 Studio One 联动,最后完成测试与交付。

下一个项目

互动体验项目

查看项目合集 ↗