铭文分音-声音分离
在线云端服务
将音频分离工具部署至本地往往耗时较长,且对电脑硬件有一定要求。为降低用户使用门槛,我们将铭文分音打造为SaaS模式,服务部署于云端,无需本地复杂配置即可使用,相关优化测试如下:
| 测试场景覆盖 | 各类音频视频格式及多元音乐风格 |
|---|---|
| 支持系统 | Windows |
| 适配内容来源 | 各短视频平台及常见公开音乐源 |
| 测试周期 | 1周 |
| 音频质量表现 | 音质清晰、保真度高 |
| 处理效率对比 | 运行速度领先于同类工具UVR5 |
| 文件存储特性 | 云端加密保存,有效降低文件丢失风险 |
核心分离模型
铭文分音搭载多类专业分离模型,适配不同分离需求:
- 多音轨分离模型:支持提取目标音轨与剩余音频的双重分离
- 单音轨分离模型:专注于人声与伴奏的精准剥离,是当前行业内表现突出的人声伴奏分离方案
- 专项功能模型:涵盖人声提取、和声去除、降噪修复、嘈杂人声分离、声部分离、乐器提取等细分场景,可根据实际需求自由选用
模型关键指标说明
- SDR(源失真比):评估分离结果与原始音频匹配度的核心指标,数值越高表示分离效果越好,单位为分贝(dB)
- SI-SDR(尺度不变源失真比):SDR指标的优化变体,规避了音频响度振幅变化对结果的影响,数值越高性能越优
- 分离完整性指标:包含“溢出度”与“饱满度”两个维度,数值越高说明分离越彻底,目标音频残留越少
石引声音分离
第三方模型适配与选择建议
用户可通过国内镜像站获取相关模型资源,无需依赖境外网站;非官方模型可通过模型名称、上传时间等维度择优选用;如需关注行业最新音频分离动态,可参考专业技术社区的相关分享。
闪念剪人声分离
本地安装与使用指南
安装前置要求
- 设备需配备英伟达显卡
- 无需网络翻墙即可正常使用
- 磁盘剩余空间不低于30G
安装步骤
- 获取官方安装包并下载
- 配置FFmpeg与CUDA环境变量,确保工具正常运行
- 启动本地客户端程序
操作流程
- 选择适配的模型类型
- 根据分离需求选定具体模型
- 设置输出格式:支持WAV、FLAC、MP3格式
- 勾选需要输出的音轨(可多选)
- 上传或拖拽待分离的音频文件
注意:本地推理不建议使用CPU,若使用AMD Ryzen 7 6800H 12核CPU,处理4分钟音频约需30-40分钟
核心配置参数
- batch_size:处理批次大小,数值越大占用显存越多,默认值为1,若显存剩余充足可适当调整以加快速度,增大该参数几乎不影响推理速度,建议设为1
- num_overlap:窗口重叠长度,数值越小推理速度越快但会轻微影响效果,数值越大效果越好但速度越慢,平衡速度与质量可设为4,嫌慢可设为2(几乎听不出质量损失)
- chunksize:音频切片大小,增大数值可提升分离效果,但会增加处理时间与显存占用,具体默认值可参考模型说明
- TTA增强:测试时间增强,启用后处理时间增至原3倍,仅能略微提升质量(几乎感知不到),不建议启用
常见问题解答
- 为何不再选用UVR5?
可根据实际需求继续使用UVR5,其官方稳定版已停更近一年,测试版仍在迭代支持新模型。工具仅为操作载体,核心效果依赖加载的模型,不存在绝对优劣,无需刻意褒贬。
- 使用中遇到问题如何解决?
可查阅官方帮助文档或在相关技术社区提问。
- 是否支持50系列显卡?
支持,具体适配情况可参考官方文档说明。