vosk-api 是一个离线语音识别库,提供涵盖 20+ 语言的连续大词表转录、流式 API、说话人识别和可重配词表功能。借助 50MB 级别的紧凑模型,它能够在从 Raspberry Pi 到大型服务器的多种设备上本地运行,适用于对隐私要求高且不依赖云服务的场景。
项目概览
通过约 50MB 的小型模型即可在 Raspberry Pi 等设备上覆盖 20+ 语言的离线大词表语音识别,且无需调用付费云服务。
项目类型
语音音频 · 基础设施
应用场景
会议记录 · 语音音频 · 自动化执行
部署方式
查看项目说明
License
Apache-2.0
适合谁
需要在 iOS、Android 或 Raspberry Pi 等设备上实现离线、隐私优先的本地语音识别的开发者。
需要将 20+ 种语言的语音转录功能直接以代码库形式集成到应用程序中的工程团队。
核心能力
在无互联网连接的环境下,提供连续的大词表语音识别功能。
提供流式 API 以支持实时转录,实现零延迟响应。
在进行语音识别的同时,识别并标注不同的说话人。
允许针对特定使用场景重新配置和调整识别词汇表。
支持 20+ 种语言和方言的语音识别。
提供 50 MB 大小的小型语音识别模型,适应资源受限设备的部署条件。
可从 Raspberry Pi 和 Android 智能手机扩展至大型服务器集群运行。
限制与风险
用户必须单独下载并配置 Vosk 语音识别模型后才能执行识别任务。
由于目标平台从 Raspberry Pi 延伸至服务器集群,跨环境部署的复杂程度存在差异。
如何开始
首先安装目标编程语言对应的 vosk-api 库,随后单独下载所需的 Vosk 语音识别模型,最后通过库 API 对接并处理音频流。
核验依据
README: Vosk is an offline open source speech recognition toolkit. It enables speech recognition for 20+ languages and dialects - English, Indian English, German, French, Spanish, Portugu…
GitHub 项目简介: Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node
README: Vosk models are small (50 Mb) but provide continuous large vocabulary transcription, zero-latency response with streaming API, reconfigurable vocabulary and speaker identification.