AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
按分类找 AI 开源项目
更多筛选
0
翻译字幕
浏览当前公开快照中“翻译字幕”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
openai/whisper
— whisper 是一个基于大规模弱监督训练的通用语音识别模型,可通过单一模型完成多语言语音识别、语音翻译和语言辨识。它以多任务序列到序列方式替代传统语音处理流水线中的多个独立阶段。
PDFMathTranslate/PDFMathTranslate
— pdfmathtranslate 是一款用于翻译科学 PDF 文档并保留原始版面布局的工具。它能够在翻译过程中保留公式、图表、目录和注释,并支持生成双语对照文档。
pipecat-ai/pipecat
— pipecat-ai/pipecat 是一个 Python 框架,提供可组合的管道、多智能体编排和可插拔的 AI 服务,用于构建实时语音和多模态对话智能体。该框架解决编排音频、视频、AI 服务与传输层时超低延迟需求的工程问题。
SYSTRAN/faster-whisper
— systran/faster-whisper 适合需要在本地或自托管环境中运行 Whisper 转录、并关注推理速度与内存占用的开发者。项目支持 CPU 与 CUDA GPU、多种计算类型、批量转录、语音活动检测、单词级时间戳及模型转换,但采用最新 CTranslate2 时需核对 CUDA 12 与 cuDNN 9 的兼容性。
modelscope/FunASR
— FunASR 是一个工业级语音识别工具包,提供离线、流式及边缘部署的语音转写能力,涵盖 ASR、VAD、标点恢复、说话人分离和情绪识别。其提供高速语音识别(实时率因子最高可达 340 倍),旨在作为 Whisper 和云 API 的更快速替代方案。
Huanshere/VideoLingo
— videolingo 是一条自动化视频翻译与配音流水线,能够生成单行字幕并合成配音视频。它通过 NLP 和 AI 技术处理视频的转录、翻译、对齐和配音环节。
jianchang512/pyvideotrans
— pyvideotrans 将语音识别、字幕翻译、多角色配音和音视频合成串联为一条完整流水线,同时支持本地离线部署和多种主流在线 API。Windows 用户可直接使用预打包程序免配置运行。
WEIFENG2333/VideoCaptioner
— videocaptioner 是一款桌面端视频字幕处理工具,将语音转写、字幕优化、翻译和视频合成整合在一套流水线中。它提供免费的 ASR 与翻译选项(无需配置即可使用),同时也支持接入大语言模型(LLM)提升处理效果。
abus-aikorea/voice-pro
— voice-pro 是一个基于 Gradio 的多功能语音处理 Web 应用,将语音识别、多语言翻译、配音、文本转语音、零样本声音克隆、音频处理、YouTube 下载和人声分离整合在单一界面中。它适合需要在一个工具内完成端到端音视频本地化与语音生成工作流的开发者和内容创作者。
mengxi-ream/read-frog
— read-frog 是一款面向语言学习者的浏览器阅读辅助工具,将网页与视频字幕转化为双语阅读、划词解析、听读和复习流程。它适合希望在日常浏览中持续积累词汇与语境知识,并愿意按需配置翻译或模型服务的用户。
×