铭文分音-声音分离

在线云端服务

将音频分离工具部署至本地往往耗时较长,且对电脑硬件有一定要求。为降低用户使用门槛,我们将铭文分音打造为SaaS模式,服务部署于云端,无需本地复杂配置即可使用,相关优化测试如下:

测试场景覆盖各类音频视频格式及多元音乐风格
支持系统Windows
适配内容来源各短视频平台及常见公开音乐源
测试周期1周
音频质量表现音质清晰、保真度高
处理效率对比运行速度领先于同类工具UVR5
文件存储特性云端加密保存,有效降低文件丢失风险

核心分离模型

铭文分音搭载多类专业分离模型,适配不同分离需求:

  • 多音轨分离模型:支持提取目标音轨与剩余音频的双重分离
  • 单音轨分离模型:专注于人声与伴奏的精准剥离,是当前行业内表现突出的人声伴奏分离方案
  • 专项功能模型:涵盖人声提取、和声去除、降噪修复、嘈杂人声分离、声部分离、乐器提取等细分场景,可根据实际需求自由选用

模型关键指标说明

  • SDR(源失真比):评估分离结果与原始音频匹配度的核心指标,数值越高表示分离效果越好,单位为分贝(dB)
  • SI-SDR(尺度不变源失真比):SDR指标的优化变体,规避了音频响度振幅变化对结果的影响,数值越高性能越优
  • 分离完整性指标:包含“溢出度”与“饱满度”两个维度,数值越高说明分离越彻底,目标音频残留越少

石引声音分离

第三方模型适配与选择建议

用户可通过国内镜像站获取相关模型资源,无需依赖境外网站;非官方模型可通过模型名称、上传时间等维度择优选用;如需关注行业最新音频分离动态,可参考专业技术社区的相关分享。

闪念剪人声分离

本地安装与使用指南

安装前置要求

  • 设备需配备英伟达显卡
  • 无需网络翻墙即可正常使用
  • 磁盘剩余空间不低于30G

安装步骤

  1. 获取官方安装包并下载
  2. 配置FFmpeg与CUDA环境变量,确保工具正常运行
  3. 启动本地客户端程序

操作流程

  1. 选择适配的模型类型
  2. 根据分离需求选定具体模型
  3. 设置输出格式:支持WAV、FLAC、MP3格式
  4. 勾选需要输出的音轨(可多选)
  5. 上传或拖拽待分离的音频文件

注意:本地推理不建议使用CPU,若使用AMD Ryzen 7 6800H 12核CPU,处理4分钟音频约需30-40分钟

核心配置参数

  • batch_size:处理批次大小,数值越大占用显存越多,默认值为1,若显存剩余充足可适当调整以加快速度,增大该参数几乎不影响推理速度,建议设为1
  • num_overlap:窗口重叠长度,数值越小推理速度越快但会轻微影响效果,数值越大效果越好但速度越慢,平衡速度与质量可设为4,嫌慢可设为2(几乎听不出质量损失)
  • chunksize:音频切片大小,增大数值可提升分离效果,但会增加处理时间与显存占用,具体默认值可参考模型说明
  • TTA增强:测试时间增强,启用后处理时间增至原3倍,仅能略微提升质量(几乎感知不到),不建议启用

常见问题解答

  1. 为何不再选用UVR5?

可根据实际需求继续使用UVR5,其官方稳定版已停更近一年,测试版仍在迭代支持新模型。工具仅为操作载体,核心效果依赖加载的模型,不存在绝对优劣,无需刻意褒贬。

  1. 使用中遇到问题如何解决?

可查阅官方帮助文档或在相关技术社区提问。

  1. 是否支持50系列显卡?

支持,具体适配情况可参考官方文档说明。