VoiceStudio:开源免费的 ElevenLabs 替代品,语音克隆+视频配音全搞定 (2026-09-25)
目录

VoiceStudio:开源免费的 ElevenLabs 替代品,语音克隆+视频配音全搞定
写于 2026-09-25 | 分类:开源软件、AI语音、效率工具
说到 AI 语音工具,你第一个想到的是不是 ElevenLabs?确实好用,但一个月 $5 到 $330 的订阅费,再加上你的音频数据要上传到人家服务器处理——想想就肉疼。
今天给大家安利一款完全免费、完全离线、完全本地的开源替代品——VoiceStudio(原名 OmniVoice-Studio)。34.7K GitHub Star,社区非常活跃,支持 646 种语言,功能一点不比 ElevenLabs 差。
🔧 VoiceStudio 是什么?
一句话说清楚:一款开源免费的 AI 语音工具箱,集成了语音克隆、语音设计、视频配音、有声书制作、实时听写等功能,所有处理都在你自己的电脑上完成,不联网、不上传、不付费。

核心卖点:
- 语音克隆:3 秒音频就能克隆任何人的声音,零样本合成
- 语音设计:从零创造一个全新声音——性别、年龄、口音、语调、情感全自定义
- 视频配音:自动转录→翻译→重新配音→导出 MP4,全程本地
- 有声书制作:EPUB/PDF 导入→多角色配音→章节渲染→.m4b 导出
- 实时听写:全局快捷键一键唤出,语音转文字
- 646 种语言,16 种 TTS 引擎,11 种 ASR 引擎
- 完全离线:模型下载好后,断网也能用
📥 安装教程
方式一:下载安装包(推荐新手)
官方提供全平台安装包:
- Windows:下载 .exe 安装包,双击安装即可
- macOS:下载 .dmg 文件,拖到 Applications 即可
- Linux:下载 .AppImage 或 .deb 包
夸克网盘下载(Windows 版):
夸克网盘下载:https://pan.quark.cn/s/822f8b39472d
首次启动会自动创建 Python 环境并下载默认模型,之后再打开就秒启动了。
方式二:Docker 部署
如果你有 Docker 环境,一行命令搞定:
docker run -d -p 127.0.0.1:3900:3900 -v omnivoice-data:/app/omnivoice_data palashdeb/omnivoice-studio:stable
有 NVIDIA 显卡的话加 –gpus all 参数就能用 GPU 加速。
方式三:从源码编译
需要 Node.js 20+ 和 Python 3.11+:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop
🎙️ 语音克隆实战
打开软件后,点击左侧的 Studio 标签:
- 上传参考音频:准备一段 3 秒以上的干净人声(没有背景音乐),点击上传
- 输入文本:在文本框输入你想要克隆声音说的内容
- 选择引擎:默认用 OmniVoice 引擎,效果最好。也可以在设置里切换其他 16 种 TTS 引擎
- 点击生成:等几秒钟就能听到克隆出来的声音了
小技巧:参考音频越干净,克隆效果越好。避免用有回音或背景噪声的录音。
🎨 语音设计:从零创造声音
不想克隆别人的声音?那就自己创造一个!在 Voice Design 标签里:
- 选择性别(男/女)
- 设置年龄范围(年轻/中年/老年)
- 选择口音(美式英语/英式英语/中文等)
- 调整语调和情感(高兴/平静/严肃)
- 微调音高和风格
调整好参数后点击预览,不满意就继续调,直到满意为止。调好的声音可以保存到 Voice Gallery,随时在 Studio 和其他功能里使用。
🎬 视频配音:一键翻译换声
这是 VoiceStudio 最炸裂的功能。操作流程:
- 导入视频:支持 MP4/MOV 等常见格式
- 自动转录:Whisper 引擎自动识别视频中的语音并生成字幕
- 翻译文本:可以选择翻译成任何支持的语言
- 重新配音:用你克隆的声音或设计的新声音重新给视频配音
- 导出:生成新的 MP4 视频,音画同步
从导入到导出,全程在本地完成,不上传任何数据到云端。做自媒体的朋友可以试试,效率比手动录音高太多了。
📖 有声书制作
VoiceStudio 内置有声书编辑器:
- 导入 EPUB 或 PDF 电子书
- 支持多角色配音——给不同角色分配不同的声音
- 渲染成章节级别的音频
- 导出为 .m4b 格式(带章节标记的有声书格式)
8GB 显存的显卡就能跑,长章节也能渲染完成。
⌨️ 实时听写:全局快捷键
在任意应用里按 Cmd+Shift+Space(Mac)或 Ctrl+Shift+Space(Windows)就能唤出听写浮窗,说话实时转文字,可以配合本地 LLM 做文字整理。
💡 使用感受
实测下来,VoiceStudio 的语音克隆效果已经非常接近 ElevenLabs 了,特别是中文克隆质量很高。视频配音功能目前还在 Beta 阶段,偶尔会有时间轴偏移的情况,但整体可用。
最大的优势就是完全免费、完全离线。不用担心音频数据被上传到第三方服务器,对于有隐私需求的用户来说非常友好。16 种 TTS 引擎可以自由切换,总能找到适合自己的声音风格。
⚠️ 注意事项
- 软件目前还在 Beta 阶段,可能有 bug,建议下载最新版本
- 本地运行需要一定的硬件要求:最低 8GB 内存,有 NVIDIA 显卡效果更好
- 首次启动需要下载模型文件,文件较大,请确保网络通畅
- 如果遇到问题,可以通过 Settings → About → Run self-check 进行诊断
📥 下载方式
夸克网盘下载(Windows 版):
夸克网盘下载:https://pan.quark.cn/s/822f8b39472d
GitHub 官方仓库(含全平台安装包):
https://github.com/debpalash/VoiceStudio
相关资源
- GitHub 地址:https://github.com/debpalash/VoiceStudio
- 官方文档:https://github.com/debpalash/VoiceStudio/tree/main/docs
📢 关注公众号:「实用软技」,在公众号窗口里回复关键字”软件”即可免费获取
