VoxCPM是什么

VoxCPM 由面壁智能和清华大学联合开发的一款开源语音合成工具。最新的 VoxCPM2 基于 MiniCPM-4,采用无分词器的扩散自回归架构,直接在连续语音空间生成音频,跳过了传统 TTS 的离散 token 环节。模型有 20 亿参数,用超过 200 万小时的多语种音频训练,支持 30 种语言和 9 种中文方言,输出 48kHz 高保真音频。代码和权重按 Apache-2.0 协议开源,可以商用。

VoxCPM核心功能

  • 文本转语音:直接输入文本就能合成,不用标语言标签。覆盖中英日韩法德西俄等 30 种语言,还有粤语、四川话、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话 9 种方言。

  • 音色设计:不用准备参考音频,写一段自然语言描述就能生成新声音,比如"年轻女性,声音温柔甜美"或"中年男性,沉稳有磁性"。

  • 可控声音克隆:上传几秒参考音频就能复刻音色,还能叠加风格指令调整情绪、语速和表现力。

  • 极致克隆:需要参考音频和对应的文本转录,模型把参考音频当作前缀来续写,能还原口音、气息、咬字等细节。

  • 48kHz 高保真:用 AudioVAE V2 非对称编解码,输入 16kHz 音频就能输出 48kHz,自带超分。

  • 实时流式合成:RTX 4090 上 RTF 约 0.3,Nano-vLLM 或 vLLM-Omni 加速后约 0.13。

VoxCPM应用场景

  • 有声书与播客:模型能根据文本自动调整韵律,读诗温柔,播报清晰,不用人工标情绪。

  • 游戏开发:策划用文字描述就能给 NPC 生成专属声音,不用找配音演员录大量台词。已有配音的角色也能用极致克隆补录临时对白。

  • 多语种内容创作:同一条链路能覆盖中英日韩等语言,音色跨语言稳定,适合做全球化视频配音或跨境电商广告。

  • 智能客服与虚拟助手:企业可以给 AI 客服定制声音,也能用 LoRA 微调,5-10 分钟音频就能适配特定说话人。

VoxCPM优缺点

优点:

  • 语言覆盖广,30 种语言加 9 种方言,开源里不多见

  • 音色设计是开源里较早用自然语言实现的

  • 部署生态全,Python SDK、WebUI、vLLM-Omni 生产服务、llama.cpp-omni 端侧都有

  • 提供 OpenAI 兼容 API,老项目迁移方便

  • Apache-2.0 可商用,没有隐藏费用

缺点:

  • 音色设计和可控克隆的结果每次可能不一样,建议多试 1-3 次

  • 部分小语种效果不如中英日稳定

  • 显存要 8GB 左右,低配机器有点吃力

  • 声音克隆有滥用风险,官方禁止用于冒充他人或欺诈

VoxCPM如何使用

本地部署:

pip install voxcpm

环境要求:Python ≥ 3.10,PyTorch ≥ 2.5.0,CUDA ≥ 12.0

基础文本转语音:

from voxcpm import VoxCPM
import soundfile as sf
model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)
wav = model.generate(
    text="VoxCPM2 是目前推荐使用的多语言语音合成版本。",
    cfg_value=2.0,
    inference_timesteps=10,
    seed=42,
)
sf.write("demo.wav", wav, model.tts_model.sample_rate)

音色设计(文本开头加括号描述):

wav = model.generate(
    text="(年轻女性,声音温柔甜美)你好,欢迎使用VoxCPM2!",
    cfg_value=2.0,
    inference_timesteps=10,
    seed=42,
)

声音克隆(传参考音频路径):

wav = model.generate(
    text="这是VoxCPM2生成的克隆语音。",
    reference_wav_path="path/to/voice.wav",
)

带风格控制(在文本里加指令):

wav = model.generate(
    text="(稍快一点,欢快的语气)这是带风格控制的克隆语音。",
    reference_wav_path="path/to/voice.wav",
)

极致克隆(需要参考音频和转录文本):

wav = model.generate(
    text="这是使用VoxCPM2的极致克隆演示。",
    prompt_wav_path="path/to/voice.wav",
    prompt_text="参考音频的文本转录。",
    reference_wav_path="path/to/voice.wav",
)

图形界面体验:

python app.py --port 8808

生产环境(vLLM-Omni,带 PagedAttention 和 OpenAI 兼容 API):

vllm serve openbmb/VoxCPM2 --omni --port 8000

端侧/CPU 部署(llama.cpp-omni,支持 GGUF 格式,Apple Silicon 通过 Metal 加速,RTF 约 1.76):

./build/bin/voxcpm2-cli \
    -t "你好,我是通过 llama.cpp-omni 运行的 VoxCPM2。" \
    -o output.wav VoxCPM2-BaseLM-Q8_0.gguf VoxCPM2-Acoustic-F16.gguf

VoxCPM与竞品对比


VoxCPM2ElevenLabsFish AudioCosyVoice2GPT-SoVITS
开源协议Apache-2.0,可商用闭源商业服务部分开源/商业授权Apache-2.0MIT
参数规模2B未公开4B(S2)0.5B约 1B
支持语言30 种 + 9 种方言70+ 种13+ 种中英为主中英为主
音色设计自然语言描述生成支持支持有限支持不支持
声音克隆可控克隆 + 极致克隆即时/专业克隆零样本克隆支持支持
输出音质48kHz高音质高音质24kHz通常 24-44.1kHz
本地部署完全支持不支持仅部分权重完全支持完全支持
API 定价免费(自托管)$5-$990/月$15/百万字符免费(自托管)免费
典型显存~8GB云端云端~6GB~4-6GB

常见问题

  • Q:收费吗? 模型本身完全免费。权重和代码按 Apache-2.0 开源,可自由商用。只有需要官方企业级定制服务时,才联系商务团队。

  • Q:显存要求多少? VoxCPM2 推荐约 8GB,VoxCPM1.5 约 6GB,0.5B 版本约 5GB。llama.cpp-omni 的 Q8_0 量化可以在 CPU 或 Apple Silicon 上跑。

  • 支持哪些部署方式? 官方有 Python SDK、命令行、WebUI、vLLM-Omni 生产服务、Nano-vLLM 高吞吐推理、llama.cpp-omni 端侧部署,社区还有 ComfyUI 节点、Rust 重写版本等。

  • Q:克隆声音需要多长的参考音频? 通常 3-10 秒就能零样本克隆。追求极致还原的话,建议 10 秒以上清晰无噪声的音频,并在极致克隆模式下提供准确的文本转录。

  • Q:生成效果不稳定怎么办? 音色设计和风格控制目前确实有一定随机性,官方建议对同一指令多生成 1-3 次,挑最好的。也可以调 cfg_value 和 inference_timesteps 参数来平衡音质和稳定性。