VoiceStudio:开源免费的 ElevenLabs 替代品,语音克隆+视频配音全搞定 (2026-09-25)

VoiceStudio:开源免费的 ElevenLabs 替代品,语音克隆+视频配音全搞定

写于 2026-09-25 | 分类:开源软件、AI语音、效率工具

说到 AI 语音工具,你第一个想到的是不是 ElevenLabs?确实好用,但一个月 $5 到 $330 的订阅费,再加上你的音频数据要上传到人家服务器处理——想想就肉疼。

今天给大家安利一款完全免费、完全离线、完全本地的开源替代品——VoiceStudio(原名 OmniVoice-Studio)。34.7K GitHub Star,社区非常活跃,支持 646 种语言,功能一点不比 ElevenLabs 差。

🔧 VoiceStudio 是什么?

一句话说清楚:一款开源免费的 AI 语音工具箱,集成了语音克隆、语音设计、视频配音、有声书制作、实时听写等功能,所有处理都在你自己的电脑上完成,不联网、不上传、不付费。

核心卖点:

  • 语音克隆:3 秒音频就能克隆任何人的声音,零样本合成
  • 语音设计:从零创造一个全新声音——性别、年龄、口音、语调、情感全自定义
  • 视频配音:自动转录→翻译→重新配音→导出 MP4,全程本地
  • 有声书制作:EPUB/PDF 导入→多角色配音→章节渲染→.m4b 导出
  • 实时听写:全局快捷键一键唤出,语音转文字
  • 646 种语言,16 种 TTS 引擎,11 种 ASR 引擎
  • 完全离线:模型下载好后,断网也能用

📥 安装教程

方式一:下载安装包(推荐新手)

官方提供全平台安装包:

  • Windows:下载 .exe 安装包,双击安装即可
  • macOS:下载 .dmg 文件,拖到 Applications 即可
  • Linux:下载 .AppImage 或 .deb 包

夸克网盘下载(Windows 版):

夸克网盘下载:https://pan.quark.cn/s/822f8b39472d

首次启动会自动创建 Python 环境并下载默认模型,之后再打开就秒启动了。

方式二:Docker 部署

如果你有 Docker 环境,一行命令搞定:

docker run -d -p 127.0.0.1:3900:3900 -v omnivoice-data:/app/omnivoice_data palashdeb/omnivoice-studio:stable

有 NVIDIA 显卡的话加 –gpus all 参数就能用 GPU 加速。

方式三:从源码编译

需要 Node.js 20+ 和 Python 3.11+:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

🎙️ 语音克隆实战

打开软件后,点击左侧的 Studio 标签:

  1. 上传参考音频:准备一段 3 秒以上的干净人声(没有背景音乐),点击上传
  2. 输入文本:在文本框输入你想要克隆声音说的内容
  3. 选择引擎:默认用 OmniVoice 引擎,效果最好。也可以在设置里切换其他 16 种 TTS 引擎
  4. 点击生成:等几秒钟就能听到克隆出来的声音了

小技巧:参考音频越干净,克隆效果越好。避免用有回音或背景噪声的录音。

🎨 语音设计:从零创造声音

不想克隆别人的声音?那就自己创造一个!在 Voice Design 标签里:

  • 选择性别(男/女)
  • 设置年龄范围(年轻/中年/老年)
  • 选择口音(美式英语/英式英语/中文等)
  • 调整语调和情感(高兴/平静/严肃)
  • 微调音高和风格

调整好参数后点击预览,不满意就继续调,直到满意为止。调好的声音可以保存到 Voice Gallery,随时在 Studio 和其他功能里使用。

🎬 视频配音:一键翻译换声

这是 VoiceStudio 最炸裂的功能。操作流程:

  1. 导入视频:支持 MP4/MOV 等常见格式
  2. 自动转录:Whisper 引擎自动识别视频中的语音并生成字幕
  3. 翻译文本:可以选择翻译成任何支持的语言
  4. 重新配音:用你克隆的声音或设计的新声音重新给视频配音
  5. 导出:生成新的 MP4 视频,音画同步

从导入到导出,全程在本地完成,不上传任何数据到云端。做自媒体的朋友可以试试,效率比手动录音高太多了。

📖 有声书制作

VoiceStudio 内置有声书编辑器:

  • 导入 EPUB 或 PDF 电子书
  • 支持多角色配音——给不同角色分配不同的声音
  • 渲染成章节级别的音频
  • 导出为 .m4b 格式(带章节标记的有声书格式)

8GB 显存的显卡就能跑,长章节也能渲染完成。

⌨️ 实时听写:全局快捷键

在任意应用里按 Cmd+Shift+Space(Mac)或 Ctrl+Shift+Space(Windows)就能唤出听写浮窗,说话实时转文字,可以配合本地 LLM 做文字整理。

💡 使用感受

实测下来,VoiceStudio 的语音克隆效果已经非常接近 ElevenLabs 了,特别是中文克隆质量很高。视频配音功能目前还在 Beta 阶段,偶尔会有时间轴偏移的情况,但整体可用。

最大的优势就是完全免费、完全离线。不用担心音频数据被上传到第三方服务器,对于有隐私需求的用户来说非常友好。16 种 TTS 引擎可以自由切换,总能找到适合自己的声音风格。

⚠️ 注意事项

  • 软件目前还在 Beta 阶段,可能有 bug,建议下载最新版本
  • 本地运行需要一定的硬件要求:最低 8GB 内存,有 NVIDIA 显卡效果更好
  • 首次启动需要下载模型文件,文件较大,请确保网络通畅
  • 如果遇到问题,可以通过 Settings → About → Run self-check 进行诊断

📥 下载方式

夸克网盘下载(Windows 版):

夸克网盘下载:https://pan.quark.cn/s/822f8b39472d

GitHub 官方仓库(含全平台安装包):

https://github.com/debpalash/VoiceStudio

相关资源

  • GitHub 地址:https://github.com/debpalash/VoiceStudio
  • 官方文档:https://github.com/debpalash/VoiceStudio/tree/main/docs

📢 关注公众号:「实用软技」,在公众号窗口里回复关键字”软件”即可免费获取

100T高转存免费网盘资源精选【持续更中~~~~】:点击查看

发表回复