由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
OpenBMB/VoxCPM
VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统
modelscope/FunASR
端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。
DrewThomasson/ebook2audiobook
从电子书生成有声书,支持语音克隆及1107种以上语言!
argmaxinc/argmax-oss-swift
面向苹果芯片的端侧语音人工智能
snakers4/silero-models
Silero模型:提供预训练语音转文本、文本转语音和文本增强模型,极致简化实现
jianchang512/pyvideotrans
将视频从一种语言翻译为另一种语言,并嵌入配音与字幕。
huggingface/speech-to-speech
语音转语音:致力于构建开源模块化GPT4-o的项目
dograh-hq/dograh
开源语音代理平台
OpenMOSS/MOSS-TTS
MOSS‑TTS 系列是由 MOSI.AI 与 OpenMOSS 团队开发的开源语音与声音生成模型系列。
harry0703/MoneyPrinterTurbo
利用AI大模型一键生成高清短视频
ggml-org/whisper.cpp
OpenAI Whisper模型的C/C++移植版本
Zackriya-Solutions/meetily
Meetily是一款隐私优先的AI会议助手,基于Rust构建,提供比Parakeet/Whisper快4倍的实时转录、说话人分离及Ollama摘要功能。100%本地处理,无需云端。作为排名第一的自托管开源AI会议记录工具,支持macOS与Windows系统。
supertone-inc/supertonic
闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。
alphacep/vosk-api
适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。
NVIDIA/DeepLearningExamples
按模型组织的尖端深度学习脚本——易于在企业级基础设施上进行训练和部署,并具备可复现的准确性与性能。
k2-fsa/sherpa-onnx
基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。
espeak-ng/espeak-ng
eSpeak NG是开源语音合成器,支持上百种语言和口音
Osmantic/ODS
将您的PC、Mac或Linux设备转变为AI服务器,支持大语言模型推理、聊天界面、语音、智能体、工作流、RAG及图像生成。
Light-Heart-Labs/ODS
将您的PC、Mac或Linux设备转变为AI服务器,支持LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。
Light-Heart-Labs/DreamServer
随处可用的本地AI,人人皆可——涵盖LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。无需云端,无需订阅。
相关项目推荐
public-apis/public-apis
免费API资源汇总列表
EbookFoundation/free-programming-books
📚 免费提供的编程书籍
donnemartin/system-design-primer
学习如何设计大规模系统。为系统设计面试做准备。包含Anki记忆卡片。
practical-tutorials/project-based-learning
基于项目的教程精选列表
NousResearch/hermes-agent
与你共同成长的智能体
TheAlgorithms/Python
所有算法均使用Python实现