VoxCPM是什么
VoxCPM 由面壁智能和清华大学联合开发的一款开源语音合成工具。最新的 VoxCPM2 基于 MiniCPM-4,采用无分词器的扩散自回归架构,直接在连续语音空间生成音频,跳过了传统 TTS 的离散 token 环节。模型有 20 亿参数,用超过 200 万小时的多语种音频训练,支持 30 种语言和 9 种中文方言,输出 48kHz 高保真音频。代码和权重按 Apache-2.0 协议开源,可以商用。
VoxCPM核心功能
文本转语音:直接输入文本就能合成,不用标语言标签。覆盖中英日韩法德西俄等 30 种语言,还有粤语、四川话、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话 9 种方言。
音色设计:不用准备参考音频,写一段自然语言描述就能生成新声音,比如"年轻女性,声音温柔甜美"或"中年男性,沉稳有磁性"。
可控声音克隆:上传几秒参考音频就能复刻音色,还能叠加风格指令调整情绪、语速和表现力。
极致克隆:需要参考音频和对应的文本转录,模型把参考音频当作前缀来续写,能还原口音、气息、咬字等细节。
48kHz 高保真:用 AudioVAE V2 非对称编解码,输入 16kHz 音频就能输出 48kHz,自带超分。
实时流式合成:RTX 4090 上 RTF 约 0.3,Nano-vLLM 或 vLLM-Omni 加速后约 0.13。
VoxCPM应用场景
有声书与播客:模型能根据文本自动调整韵律,读诗温柔,播报清晰,不用人工标情绪。
游戏开发:策划用文字描述就能给 NPC 生成专属声音,不用找配音演员录大量台词。已有配音的角色也能用极致克隆补录临时对白。
多语种内容创作:同一条链路能覆盖中英日韩等语言,音色跨语言稳定,适合做全球化视频配音或跨境电商广告。
智能客服与虚拟助手:企业可以给 AI 客服定制声音,也能用 LoRA 微调,5-10 分钟音频就能适配特定说话人。
VoxCPM优缺点
优点:
语言覆盖广,30 种语言加 9 种方言,开源里不多见
音色设计是开源里较早用自然语言实现的
部署生态全,Python SDK、WebUI、vLLM-Omni 生产服务、llama.cpp-omni 端侧都有
提供 OpenAI 兼容 API,老项目迁移方便
Apache-2.0 可商用,没有隐藏费用
缺点:
音色设计和可控克隆的结果每次可能不一样,建议多试 1-3 次
部分小语种效果不如中英日稳定
显存要 8GB 左右,低配机器有点吃力
声音克隆有滥用风险,官方禁止用于冒充他人或欺诈
VoxCPM如何使用
本地部署:
pip install voxcpm
环境要求:Python ≥ 3.10,PyTorch ≥ 2.5.0,CUDA ≥ 12.0
基础文本转语音:
from voxcpm import VoxCPM
import soundfile as sf
model = VoxCPM.from_pretrained("openbmb/VoxCPM2", load_denoiser=False)
wav = model.generate(
text="VoxCPM2 是目前推荐使用的多语言语音合成版本。",
cfg_value=2.0,
inference_timesteps=10,
seed=42,
)
sf.write("demo.wav", wav, model.tts_model.sample_rate)音色设计(文本开头加括号描述):
wav = model.generate( text="(年轻女性,声音温柔甜美)你好,欢迎使用VoxCPM2!", cfg_value=2.0, inference_timesteps=10, seed=42, )
声音克隆(传参考音频路径):
wav = model.generate( text="这是VoxCPM2生成的克隆语音。", reference_wav_path="path/to/voice.wav", )
带风格控制(在文本里加指令):
wav = model.generate( text="(稍快一点,欢快的语气)这是带风格控制的克隆语音。", reference_wav_path="path/to/voice.wav", )
极致克隆(需要参考音频和转录文本):
wav = model.generate( text="这是使用VoxCPM2的极致克隆演示。", prompt_wav_path="path/to/voice.wav", prompt_text="参考音频的文本转录。", reference_wav_path="path/to/voice.wav", )
图形界面体验:
python app.py --port 8808
生产环境(vLLM-Omni,带 PagedAttention 和 OpenAI 兼容 API):
vllm serve openbmb/VoxCPM2 --omni --port 8000
端侧/CPU 部署(llama.cpp-omni,支持 GGUF 格式,Apple Silicon 通过 Metal 加速,RTF 约 1.76):
./build/bin/voxcpm2-cli \ -t "你好,我是通过 llama.cpp-omni 运行的 VoxCPM2。" \ -o output.wav VoxCPM2-BaseLM-Q8_0.gguf VoxCPM2-Acoustic-F16.gguf
VoxCPM与竞品对比
| VoxCPM2 | ElevenLabs | Fish Audio | CosyVoice2 | GPT-SoVITS | |
|---|---|---|---|---|---|
| 开源协议 | Apache-2.0,可商用 | 闭源商业服务 | 部分开源/商业授权 | Apache-2.0 | MIT |
| 参数规模 | 2B | 未公开 | 4B(S2) | 0.5B | 约 1B |
| 支持语言 | 30 种 + 9 种方言 | 70+ 种 | 13+ 种 | 中英为主 | 中英为主 |
| 音色设计 | 自然语言描述生成 | 支持 | 支持 | 有限支持 | 不支持 |
| 声音克隆 | 可控克隆 + 极致克隆 | 即时/专业克隆 | 零样本克隆 | 支持 | 支持 |
| 输出音质 | 48kHz | 高音质 | 高音质 | 24kHz | 通常 24-44.1kHz |
| 本地部署 | 完全支持 | 不支持 | 仅部分权重 | 完全支持 | 完全支持 |
| API 定价 | 免费(自托管) | $5-$990/月 | $15/百万字符 | 免费(自托管) | 免费 |
| 典型显存 | ~8GB | 云端 | 云端 | ~6GB | ~4-6GB |
常见问题
Q:收费吗? 模型本身完全免费。权重和代码按 Apache-2.0 开源,可自由商用。只有需要官方企业级定制服务时,才联系商务团队。
Q:显存要求多少? VoxCPM2 推荐约 8GB,VoxCPM1.5 约 6GB,0.5B 版本约 5GB。llama.cpp-omni 的 Q8_0 量化可以在 CPU 或 Apple Silicon 上跑。
支持哪些部署方式? 官方有 Python SDK、命令行、WebUI、vLLM-Omni 生产服务、Nano-vLLM 高吞吐推理、llama.cpp-omni 端侧部署,社区还有 ComfyUI 节点、Rust 重写版本等。
Q:克隆声音需要多长的参考音频? 通常 3-10 秒就能零样本克隆。追求极致还原的话,建议 10 秒以上清晰无噪声的音频,并在极致克隆模式下提供准确的文本转录。
Q:生成效果不稳定怎么办? 音色设计和风格控制目前确实有一定随机性,官方建议对同一指令多生成 1-3 次,挑最好的。也可以调 cfg_value 和 inference_timesteps 参数来平衡音质和稳定性。

短剧Agent
小说转剧本
小说剧本
分镜脚本
动漫创作
短剧生成
后期制作
分发变现
短剧数据
资源素材
市场洞察
短剧出海
工具横评 


UpDream - 剧本转视频 & 剧本策划助手







