



详细说明
Voicebox 是一款“本地优先”的 AI 语音工作室,集成了 ElevenLabs 和 WisprFlow 的功能,是一款免费且开源的替代方案。它支持仅凭数秒音频即可克隆声音,利用 7 种 TTS 引擎生成 23 种语言的语音,通过全局快捷键在任意文本输入框进行语音听写,并能为任何支持 MCP 协议的 AI 智能体赋予你指定的声音。
语音输入/输出(I/O)流程的两大云端巨头分别占据了流程的两端——ElevenLabs 负责输出,WisprFlow 负责输入。Voicebox 则兼顾两者,通过内置的本地大语言模型(LLM)进行优化并支持个性化人设,且所有处理过程均在你的本地设备上运行。
· 完全隐私保护——模型、语音数据及录音内容绝不会离开你的设备
· 7 种 TTS 引擎——Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、HumeAI TADA 以及 Kokoro
· 声音克隆与预设音色——支持基于参考样本的零样本(zero-shot)克隆,或使用 Kokoro 和 Qwen CustomVoice 提供的 50 多种精选预设音色
· 23 种语言——涵盖英语、阿拉伯语、日语、印地语、斯瓦希里语等多种语言
· 后期处理效果——包括音高变换、混响、延迟、合唱、压缩及各类滤波效果
· 富有表现力的语音——通过 Chatterbox Turbo 支持 [笑声]、[叹息]、[喘息] 等副语言(paralinguistic)标签;通过 Qwen CustomVoice 实现自然语言驱动的语音播报控制
· 支持无限长度——针对脚本、文章及章节自动分段并应用交叉淡入淡出效果
· 故事编辑器——提供多轨时间轴,适用于对话、播客及叙事内容的制作
· 语音输入——支持全局听写快捷键(含“按住说话”与“切换”模式)、macOS 辅助功能验证的自动粘贴、各文本输入框内置麦克风功能,以及基于 Whisper 的语音转文字(STT)技术
· 智能体语音输出——仅需一次工具调用(`voicebox.speak`),任何支持 MCP 协议的智能体(如 Claude Code、Cursor、Cline)即可使用您克隆的音色与您对话
· 语音个性设定——可为任意音色配置自定义人格,并利用内置本地大模型进行创作、重写或回复;智能体亦可通过 MCP 调用这些功能
· API 优先——提供 REST API 及内置 MCP 服务器,便于将语音输入/输出功能集成至您的应用程序与智能体中
· 原生性能——基于 Tauri (Rust) 构建,非 Electron 架构
· 全平台运行——支持 macOS (MLX/Metal)、Windows (CUDA)、Linux、AMD ROCm、Intel Arc 及 Docker
