AI 开源项目雷达
帮你从 GitHub 上快速发现、理解和复用高质量 AI 开源项目。
榜单
合集
Skills 库
分类
AI 搜索
左右滑动查看全部
↔
←
返回 AI 工作站
AI 搜索
搜项目、查事实、做对比,也能把复杂需求整理成可执行方案
AI 搜索
从一个真实需求开始
点击只会填入搜索框,你可以继续修改
项目
RAG 开源项目
按相关性与成熟度排序
Skills
代码安全审查
查找可复用能力
事实
Dify 的 License
只回答已核验信息
对比
Dify vs RAGFlow
企业知识库如何选
替代
Dify 的替代项目
发现同类选择
方案
搭建内部知识库
组合项目、Skills 与步骤
高频资源合集
更多筛选
0
多语言翻译与字幕制作
浏览当前公开快照中“多语言翻译与字幕制作”相关的 AI 开源项目,并查看许可证、部署、适用场景、限制和核验来源。
abus-aikorea/voice-pro
— voice-pro 是一个基于 Gradio 的多功能语音处理 Web 应用,将语音识别、多语言翻译、配音、文本转语音、零样本声音克隆、音频处理、YouTube 下载和人声分离整合在单一界面中。它适合需要在一个工具内完成端到端音视频本地化与语音生成工作流的开发者和内容创作者。
harry0703/MoneyPrinterTurbo
— moneyprinterturbo 面向希望从主题或关键词生成短视频的创作者,可串联脚本、素材匹配、配音、字幕与视频合成。它更适合能够自行部署并配置模型及语音服务凭据的团队,而不是需要全托管服务的非技术用户。
PDFMathTranslate/PDFMathTranslate
— pdfmathtranslate 是一款用于翻译科学 PDF 文档并保留原始版面布局的工具。它能够在翻译过程中保留公式、图表、目录和注释,并支持生成双语对照文档。
NVIDIA-NeMo/Speech
— nvidia-nemo/speech 是面向研究人员和 PyTorch 开发者的语音 AI 框架,用于构建、定制和部署语音识别(ASR)、语音合成(TTS)及语音大模型。目前项目正处于转型期,重心转向音频、语音和多模态大模型。
Huanshere/VideoLingo
— videolingo 是一条自动化视频翻译与配音流水线,能够生成单行字幕并合成配音视频。它通过 NLP 和 AI 技术处理视频的转录、翻译、对齐和配音环节。
WEIFENG2333/VideoCaptioner
— videocaptioner 是一款桌面端视频字幕处理工具,将语音转写、字幕优化、翻译和视频合成整合在一套流水线中。它提供免费的 ASR 与翻译选项(无需配置即可使用),同时也支持接入大语言模型(LLM)提升处理效果。
huggingface/speech-to-speech
— speech-to-speech 是一个模块化的开源语音智能体管道,VAD、STT、LLM、TTS 组件均可通过命令行参数替换,并通过兼容 OpenAI Realtime 协议的 WebSocket API 暴露服务,支持在自托管环境下构建低延迟的端到端语音交互助手。
mengxi-ream/read-frog
— read-frog 是一款面向语言学习者的浏览器阅读辅助工具,将网页与视频字幕转化为双语阅读、划词解析、听读和复习流程。它适合希望在日常浏览中持续积累词汇与语境知识,并愿意按需配置翻译或模型服务的用户。
×