希望拥有通过参考音频及转录克隆声音,且需要通过 SFT 或 LoRA 进行微调以适应特定领域的 AI 工程师。
核心能力
根据自然语言描述(性别、年龄、音调、情感、语速)创建全新的声音,无需参考音频。
从短参考音频片段克隆音色,并允许通过风格引导来控制情感、语速和表达。
通过延续参考音频及其文本转录,重现声音的细微差别,以保留音色、节奏、情感和风格。
通过 AudioVAE V2 内置超分辨率功能,直接输出 48kHz 录音室质量的音频。
支持全量 SFT 和 LoRA 微调,以适应特定的说话人、语言或领域。
限制与风险
声音设计和可控声音克隆的结果在不同运行之间可能会发生变化。
官方支持 30 种语言;其他语言可能需要测试或微调。
该技术存在被滥用于冒充、欺诈或虚假信息的潜在风险。
如何开始
通过标准 pip install voxcpm 安装,预训练权重会自动下载。支持通过 CLI 或 Python API 使用,项目也提供了本地 Web Demo 供交互测试。
核验依据
README: VoxCPM is a **tokenizer-free** Text-to-Speech system that directly generates continuous speech representations via an end-to-end **diffusion autoregressive architecture**
README: pip install voxcpm
README: For production multi-tenant deployments, use **[vLLM-Omni](https://github.com/vllm-project/vllm-omni)** — the official vLLM project's omni-modal extension with native **VoxCPM2**…
README: | **VRAM** | ~8 GB | ~6 GB | ~5 GB |
README: 🔊 **48kHz High-Quality Audio** — Accepts 16kHz reference audio and directly outputs 48kHz studio-quality audio via AudioVAE V2's asymmetric encode/decode design, with built-in sup…