开源推荐:VoiceStudio — 本地语音AI工作室,语音克隆+视频配音完全免费


    上周帮做短视频的朋友试配音,他花了200块买了一个月的 ElevenLabs 会员,结果生成的中文语音还是有一股”翻译腔”。我说:「你不知道有个开源工具能本地跑语音克隆吗?不要钱、不要API、不要联网。」他一脸不信:「还有这好事?」

    其实很多人做视频配音、有声书、语音转文字,第一反应就是去订阅 ElevenLabs 或者微软 Azure 这些付费服务。但今天推荐一款让我回不去的本地语音AI工具——VoiceStudio

什么是 VoiceStudio?

    简单说:语音克隆 + 视频配音 + 语音转文字 + 有声书生成,四合一,完全在你电脑上本地运行。不需要注册账号,不需要 API Key,不需要联网,数据不会上传到任何服务器。

    它被叫做”开源版 ElevenLabs”,在 GitHub 上已经拿到 32,900+ 颗星,本周更是冲上了 GitHub 周榜 TOP 3。下载量超过 22 万次,支持 646 种语言——中英文自然不在话下,日语、韩语、西班牙语、阿拉伯语全覆盖。

5大核心功能

1. 语音克隆(Voice Clone)

    录一段 3 秒的语音样本,它就能模仿你的声音生成任意文本的朗读。对,只要 3 秒——录一句”你好,我是XXX”就够了。克隆出来的声音保留了你的语调、语速和音色特征,拿来配音短视频、做播客 intro、或者给角色配音都很自然。

2. 语音设计(Voice Design)

    没有语音样本也没关系——你可以用文字描述一个声音:”30岁男性,磁性低沉,带一点东北口音”,它就能凭空生成一个符合描述的声音。性别、年龄、口音、音高、情绪,全部可以调。相当于你手里有一个声音设计师,指哪打哪。

3. 视频配音(Video Dubbing)

    这是最实用的功能。导入一段英文视频,它会自动识别语音、翻译成中文、再用配音合成新的音频,而且还能保留每个说话人的音色——A 说的话用 A 的声音配中文,B 说的话用 B 的声音配。做跨语言内容的创作者,这个功能直接省掉几千块的外包费。

4. 语音转文字(Transcription)

    把录音、播客、会议记录丢进去,自动转成文字。支持自动断句、说话人识别,转出来的文本还能直接编辑。开会录音再也不用一字一句手动打了。

5. 有声书生成(Audiobook)

    丢一篇小说或 EPUB 电子书进去,它可以自动分章节,用不同角色的声音朗读——主角用一个声音,配角用另一个声音,旁白再用一个。做一个有声书从”人工录制两周”变成”点击按钮等几分钟”。

为什么比 ElevenLabs 好?

对比项 VoiceStudio ElevenLabs
价格 ✅ 完全免费开源 ❌ $5/月起,高级功能$99/月
数据隐私 ✅ 100%本地运行,数据不出电脑 ❌ 上传到云端服务器
语音克隆 ✅ 3秒样本即可克隆 ✅ 需要更多样本
视频配音 ✅ 多人声保留 + 自动翻译 ✅ 付费功能
语言支持 ✅ 646种语言 ✅ 29种语言
离线使用 ✅ 完全离线 ❌ 需要联网
API 调用限制 ✅ 无限制,本地随便调 ❌ 按字符数收费

安装教程

    VoiceStudio 支持 Windows、macOS 和 Linux,安装非常简单:

Windows 用户:下载 .exe 安装包,双击运行,一路”下一步”即可。安装完成后打开软件,首次运行会让你选择语音引擎(推荐选 faster-whisper),点”安装”等几分钟就好。

macOS 用户:下载 .dmg 文件,拖到 Applications 文件夹即可。Apple Silicon 和 Intel 版本都有。

命令行一键安装(推荐):

    打开终端,输入:

curl -fsSL https://voicestudio.sh/install | sh

    一行命令搞定,自动下载安装。Windows 用户可以用 PowerShell:irm voicestudio.sh/install | iex

使用体验

    说实话,刚打开 VoiceStudio 的时候就被惊艳到了——界面非常现代,左边是功能导航,右边是工作区,整体设计有点像专业音频编辑软件但更简洁。上手难度比想象中低很多。

    语音克隆是我用得最多的功能。录了 3 秒自己的声音,然后让它读一段文章——效果真的很惊艳,语调和节奏都很像真人。用它给短视频配旁白,完全听不出是 AI 生成的。

    视频配音功能也很强大——导入一段英文教程视频,它自动识别出 3 个说话人,分别翻译并配音,每个角色的声音都不一样。虽然翻译质量比不上专业译者,但作为快速配音工具已经足够用了。

    唯一的小缺点是首次运行需要下载语音模型文件,大概 1-2GB,需要等一会儿。但下载完之后所有功能都离线可用,不会占用网络带宽。

下载安装

📥 软件下载

夸克网盘下载:https://pan.quark.cn/s/da5e3e3975fa

包含 Windows 安装包(v0.5.3)| 官网:https://voicestudio.sh

    下载后双击安装,跟着向导走就行。首次打开会让你选语音引擎,推荐选 faster-whisper(速度快、效果好)。安装完引擎后就可以开始用了。

💬 关注公众号:「实用软技」,在公众号窗口里回复关键字「语音」即可免费获取


觉得有用?点个在看👇

100T高转存免费网盘资源精选【持续更中~~~~】:点击查看

发表回复