IndexTTS + ASMR-J2C Windows 手把手部署与使用教程
本教程面向普通 Windows 用户,尽量做到“双击即可完成”。推荐有 NVIDIA 独立显卡(8GB 显存以上更佳),纯 CPU 也能跑但速度很慢。
一、准备工作(必做)
1. 硬件与系统建议
Windows 10/11 64位
内存:16GB 及以上(推荐 32GB)
显卡:NVIDIA 显卡,显存 ≥8GB(RTX 3060/4060 等即可)
硬盘:预留至少 20~30GB 空间(模型 + 依赖)
2. 必须安装的软件
Git
下载地址:https://git-scm.com/download/win
安装时一路默认即可。ffmpeg(必须加入系统 PATH)
推荐去 https://www.gyan.dev/ffmpeg/builds/ 下载
ffmpeg-release-essentials.zip解压到例如
C:\ffmpeg把
C:\ffmpeg\bin添加到系统环境变量 PATH验证:打开 CMD 输入
ffmpeg -version,能显示版本即成功。
Python 3.11 或 3.12(推荐 3.11)
安装时务必勾选 “Add python.exe to PATH”
验证:CMD 输入
python --version
(可选但强烈推荐)NVIDIA 驱动 + CUDA
显卡驱动保持最新
如需完整加速,可安装 CUDA Toolkit 12.x(IndexTTS 推荐 12.8+)
二、下载项目
有两种方式:
方式 A:Git 克隆(推荐)
git clone https://github.com/sh1nny0u/ASMR-J2C.git
cd ASMR-J2C
方式 B:直接下载 ZIP
去 https://github.com/sh1nny0u/ASMR-J2C 点击 Code → Download ZIP,解压后进入文件夹。
重要提示:路径尽量不要包含中文和空格,推荐放到 D:\AI\ASMR-J2C 这类纯英文路径。
三、一键安装(核心步骤)
项目已经把复杂流程封装成 bat 脚本。
安装 IndexTTS2 服务
双击运行:setup-index.bat首次运行会自动创建虚拟环境、安装依赖、下载 IndexTTS 模型。
过程可能较长(网络好 10~30 分钟,慢的话 1 小时以上),请耐心等待。
国内网络建议提前设置 HuggingFace 镜像(见下方常见问题)。
安装 ASMR-J2C 本身
双击运行:setup-j2c.bat启动服务
双击运行:start.bat会自动启动 IndexTTS 服务 + ASMR-J2C 前端页面。
浏览器一般会自动打开,如果没有,手动访问:
http://127.0.0.1:端口(具体端口以启动窗口提示为准,常见是 7860 或项目指定端口)。
结束服务
使用完毕后,双击:stop.bat强制释放端口,避免下次启动冲突。
四、首次使用流程
准备材料
原日语音频(WAV/MP3 等,清晰人声优先)
中文 LRC 字幕(时间轴尽量准确,对应原日语句子)
目标音色参考音频(5~15 秒干净人声,可用中文或日语,建议同一说话人)
在网页界面操作
上传原音频
上传中文 LRC 字幕
上传参考音频
设置情绪参数(IndexTTS 支持情感向量、情感参考音频等)
选择是否开启「双语音声」模式(原声 + 中文混音)
点击生成,等待任务完成
生成完成后下载最终 WAV/MP3。
五、进阶:单独使用 IndexTTS 2.5(可选)
如果只想用 IndexTTS 做普通克隆/情感合成,不跑 ASMR-J2C:
# 进入官方仓库(或项目自带的 indexTTS2 目录)
git clone https://github.com/index-tts/index-tts.git
cd index-tts
# 安装 uv
pip install -U uv
# 安装依赖(国内镜像)
uv sync --all-extras --default-index "https://mirrors.aliyun.com/pypi/simple"
# 下载模型(2.5)
uv tool install "huggingface-hub"
set HF_ENDPOINT=https://hf-mirror.com
hf download IndexTeam/IndexTTS-2.5 --local-dir=checkpoints
# 启动 WebUI
uv run webui.py
浏览器打开 http://127.0.0.1:7860。
六、常见问题与解决方法
问题 | 解决方法 |
|---|---|
模型下载极慢/失败 | 设置环境变量 |
CUDA / 显存不足 | 使用 BF16/FP16 模式;关闭其他占显存程序;降低 batch 或换更小模型 |
DeepSpeed 安装失败(Windows 常见) | 去掉 |
ffmpeg 找不到 | 确认已加入系统 PATH,重启 CMD/PowerShell |
端口被占用 | 运行 |
生成中文语速/时长不对 | 在界面调整语速参数,或手动微调 LRC 时间轴 |
情感不明显 | 提高 emo_alpha,或使用情感参考音频 + 情感向量组合 |
七、使用建议与注意事项
第一次生成会比较慢(模型加载 + 缓存),后续会快很多。
字幕质量直接决定最终效果,建议先用专业工具(如 Aegisub、剪映)把 LRC 对齐好。
生成任务较吃资源,建议关闭浏览器其他标签和无关软件。
商用前请确认原音频版权与参考音色授权,避免法律风险。
项目开源协议为 GPL-3.0,使用时请遵守。
八、推荐目录结构示例
D:\AI\
├── ASMR-J2C\ ← 主项目
│ ├── setup-index.bat
│ ├── setup-j2c.bat
│ ├── start.bat
│ ├── stop.bat
│ └── ...
└── materials\ ← 素材库
├── original\ ← 日语原音频
├── lrc\ ← 中文字幕
└── ref\ ← 参考音色
按照以上步骤,绝大多数用户都能在 1~2 小时内完成首次部署并成功生成第一条中文配音。
如果在某一步卡住(报错信息截图最好),把具体报错贴出来,我可以继续帮你针对性排查。祝部署顺利!