Voicebox 是一款开源应用,可将你的 Mac 变成一个小型本地语音合成和克隆工作室。它使用 Qwen3-TTS 模型直接在您的设备上生成逼真的音频,无需依赖云服务、令牌或付费订阅。
一款专为 macOS 设计的语音克隆应用
借助 Voicebox,您可以通过几秒钟的参考音频创建语音配置文件(最多 30 秒)。Qwen3-TTS 模型会分析语调、音色和口音,并以相当高的保真度将其复现。您只需上传一个语音文件,或从您的 Mac 麦克风录制一个,注明所说内容,或者使用自动转录,这样您就可以准备好一个配置文件,无需重复该过程即可生成新的音频。
使用自定义声音配置生成音频
一旦您保存了个人资料,只需输入您想要的文本, Voicebox就会以该声音生成音频。这使您可以在保持语气的同时,将短语翻译成其他语言,例如,您可以为视频游戏项目制作家庭配音或生成语音。您还可以导出语音配置文件并与其他用户共享,这样他们就可以在自己的设备上生成音频。
自动转录和系统音频捕获
该应用集成了 Whisper,它可以将音频转换为文本,并与生成的语音同步。这使得可以更轻松地直接在时间线上编辑对话,调整停顿或纠正发音,而不会失去语音配置的一致性。此外,它还包括系统音频捕获功能,可让您录制 Mac 上的声音(例如来自游戏或通话的声音),并将其用作新克隆或音频场景的参考。
用于其他项目的本地语音服务器和 API
Voicebox 不仅仅是其图形界面;得益于其集成的 REST API,它还可以作为本地语音服务器运行。您可以通过一次点击将其激活,从游戏、应用程序或 AI 代理发送文本,并以标准格式获取生成的音频。这使得旁白、对话或通知自动化成为可能,而无需依赖外部服务。该应用使用 Tauri、Rust 和 Python 开发,因此比许多基于 Electron 的替代方案更轻量。即便如此,性能仍将取决于你的 Mac 有多强大,以及 Qwen3-TTS 模型的设置方式,因为所有处理都在本地完成。
使用任何声音创建带旁白的故事
Voicebox还具有一个用于生成叙述故事的部分。你只需要说明你想要发生什么,应用就会使用你所选择的语气生成内容。这是一个有用的功能,可用于创作有趣的内容、儿童故事或语音草图。
我在 Mac 上使用 Voicebox 的体验
当我在 macOS 上测试 Voicebox 时,克隆过程既快速又简单:只需几秒钟的音频就足以创建一个配置文件,并在时间线上生成几个语音片段。体验很流畅,不过一些高级选项仍然缺失,例如添加更多样本以提高质量,或对克隆声音进行微调。
我最喜欢的地方Voicebox,以及可以改进的地方
· 我最喜欢的是:整个克隆和合成过程都在你的 Mac 本地完成,无需依赖云端或支付订阅费用。
· 我会改进的方面:增加更强的声音自定义功能,并支持多个音频样本,因为这将有助于获得更逼真的结果。此外,生成时间可能会因您的设备性能和所选模型而有所不同。
下载 Voicebox,并将你的 Mac 打造成一个完全本地的语音克隆与合成工作室,支持 Qwen3-TTS 和 Whisper。
如果你满足以下条件,Voicebox 那么 非常适合你
✓ 你希望在 macOS 上克隆声音并生成语音音频,而不依赖云端服务
✓ 你从事播客、配音、游戏或 AI 智能体相关工作,并需要一个用于语音场景的时间线编辑器
✓ 你偏好本地、私密且开源的解决方案,并希望能将其集成到其他项目中
评论
还没有关于 Voicebox 的评论。成为最先发表评论的人吧! 评论