Skip to content

ChanTrail/2TO5.1-OR-2TO7.1

Repository files navigation

🎵 立体声转5.1&7.1声道混音工具

Web GUI 版本 v3.1.1
将普通立体声音频转换为沉浸式环绕声体验

Version Python License Platform


📖 简介

立体声转5.1&7.1声道混音工具是一款专业级音频转换应用,可将普通立体声(2.0)音频智能转换为家庭影院级别的 5.17.1 环绕声格式。

本工具采用先进的 BS-RoFormer 深度学习模型进行音频源分离,将原始音频分解为人声、低音、鼓声、吉他、钢琴、伴奏等独立音轨,然后通过可视化 Web GUI 界面让用户自由调整各声道的混音配置,最终输出高质量的多声道环绕声音频。

开发者: ChanTrail

✨ 功能特点

🎛️ Web GUI 可视化界面

  • 现代化的 Web 界面,直观易用
  • 实时预览混音效果
  • 可视化环绕声声道布局
  • 支持独奏/静音单个声道

🔊 智能音频处理

  • 双模式转换:支持 5.1 和 7.1 环绕声格式,可随时切换
  • 多模型支持:可在设置页面切换不同的分离模型
  • 智能音频分离:将音频分离为 7 个独立音轨(vocals, bass, drums, guitar, piano, instrumental, other)
  • 自定义声道配置:自由调整每个声道的音源和音量
  • 配置槽功能:保存和快速切换多组混音配置

📦 批量处理

  • 支持多文件批量处理
  • 一键应用配置到所有文件
  • 智能跳过已处理文件
  • 实时显示分离进度

🚀 高性能

  • GPU 加速:支持 CUDA 加速(推荐 3GB+ 显存)
  • CPU 模式:无显卡也可使用
  • 高质量输出:FLAC 无损格式

💻 系统要求

项目 最低要求 推荐配置
操作系统 Windows 10 Windows 10/11
Python 3.12(整合包已内置) 3.12
显卡 - NVIDIA GPU (≥3GB 显存)
内存 8GB 16GB+
磁盘空间 10GB 20GB+

📥 安装说明

整合包用户(推荐)

本程序提供整合包形式,已包含所有依赖项和 Python 环境,无需额外安装

下载并解压整合包 下载

手动安装

# 克隆仓库
git clone https://github.com/ChanTrail/2TO5.1-OR-2TO7.1.git
cd 2TO5.1-OR-2TO7.1

# 安装依赖
.\Python\python -m pip install -r requirements.txt

# 下载模型文件到 bsroformer/models/
# 下载模型配置文件到 bsroformer/configs/

模型及配置文件下载

🚀 快速开始

方式一:双击启动

双击 start.bat

方式二:命令行启动

.\Python\python main.py

使用流程

  1. 启动程序 → 自动打开浏览器访问 Web GUI
  2. 选择配置(左侧面板):
    • 处理模式:GPU(推荐)或 CPU
    • 分离模型:选择要使用的 AI 模型
  3. 选择配置(右侧面板):
    • 声道模式:5.1 或 7.1
    • 输入/输出目录
  4. 开始处理 → 等待音频分离完成
  5. 调整混音
    • 在混音器界面调整各声道配置
    • 实时预览混音效果
    • 保存常用配置到配置槽
  6. 导出文件 → 获得高质量环绕声音频

📁 目录结构

2TO5.1-OR-2TO7.1/
├── main.py                 # 主程序入口
├── web_mixer.py            # Web GUI 服务器
├── model.txt               # 模型配置文件
├── web_templates/          # Web 页面模板
│   ├── setup.html          # 设置页面
│   └── mixer.html          # 混音器页面
├── bsroformer/             # 音频分离模块
│   ├── inference.py        # 推理脚本
│   ├── configs/            # 模型配置
│   └── models/             # 模型文件 (需下载)
├── temp/                   # 临时文件目录 (分离时自动生成)
├── Python/                 # 内置 Python 环境
├── tests/                  # 测试用例
├── requirements.txt        # 依赖列表
├── envinstall.bat          # Python 软件包安装脚本
├── start.bat               # 启动脚本
├── README.md               # 说明文档
└── LICENSE                 # 许可证

🎚️ 声道配置

5.1 声道布局

声道 英文名 默认音源
左前 (L) Left Front drums (左声道)
右前 (R) Right Front drums (右声道)
中置 (C) Center vocals (单声道)
低音 (LFE) Low Frequency Effects bass (单声道)
左环绕 (LS) Left Surround vocals, piano, guitar, other
右环绕 (RS) Right Surround vocals, piano, guitar, other

7.1 声道布局

在 5.1 基础上改变环绕声道:

声道 英文名 默认音源
左环绕 (LS) Left Surround vocals, piano
右环绕 (RS) Right Surround vocals, piano
左后环绕 (LB) Left Back vocals, guitar, other
右后环绕 (RB) Right Back vocals, guitar, other

🔧 技术架构

┌─────────────────────────────────────────────────────────┐
│                    Web GUI (Flask)                       │
├─────────────────────────────────────────────────────────┤
│  setup.html          │           mixer.html              │
│  - 处理模式/模型选择  │           - 声道混音配置          │
│  - 声道模式/目录    │           - 实时预览              │
│  - 处理进度显示      │           - 配置槽管理            │
└─────────────────────────────────────────────────────────┘
                              │
                              ▼
┌─────────────────────────────────────────────────────────┐
│                 Audio Processing Engine                  │
├─────────────────────────────────────────────────────────┤
│  BS-RoFormer Model     │    PyDub + NumPy + SoundFile   │
│  - 音频源分离          │    - 声道混音                   │
│  - 多模型支持          │    - FLAC 编码                  │
│  - GPU/CPU 加速        │                                │
└─────────────────────────────────────────────────────────┘

❓ 常见问题

Q: GPU 模式运行出错?

确保:

  1. 已安装 NVIDIA 显卡驱动
  2. 显存 ≥ 3GB
  3. 如仍有问题,切换到 CPU 模式
Q: 处理速度很慢?
  • 推荐使用 GPU 模式
  • 长音频文件需要更多处理时间
  • CPU 模式下处理速度较慢是正常现象
Q: 为什么输出是 FLAC 格式?

FLAC 是无损压缩格式,可以:

  • 保持原始音频质量
  • 支持多声道音频
  • 文件大小适中
Q: 如何保留分离的临时文件?

程序退出时会询问是否删除临时文件,选择"取消"即可保留。

📋 依赖项

核心依赖

  • Flask - Web 服务器
  • PyDub - 音频处理
  • NumPy - 数值计算
  • SoundFile - 音频文件 I/O

深度学习

  • PyTorch 2.8.0+cu129 - 深度学习框架
  • TorchAudio - 音频处理
  • BS-RoFormer - 音频分离模型

其他

  • librosa, tqdm, einops, omegaconf 等

完整依赖列表请参见 requirements.txt

📄 许可证

本项目采用 GPL-3.0 许可证。详见 LICENSE 文件。

🙏 致谢


立体声转5.1&7.1声道混音工具 v3.1.1
by ChanTrail

About

一个通过模型分离音频中的乐器,再重新混合以达到立体声转5.1声道&7.1声道的效果的工具

Resources

Stars

Watchers

Forks

Releases

Packages

Used by

Contributors

Languages