由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
NVIDIA-NeMo/NeMo
专为从事大语言模型、多模态和语音人工智能(自动语音识别与文本转语音)的研究人员和开发者打造的可扩展生成式AI框架
OpenBMB/VoxCPM
VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统
deepfakes/faceswap
面向所有人的深度伪造软件
huggingface/speech-to-speech
语音转语音:致力于构建开源模块化GPT4-o的项目
janishar/mit-deep-learning-book-pdf
伊恩·古德费洛、约书亚·本吉奥和亚伦·库维尔合著的MIT深度学习书籍PDF格式(完整版及分册)
MITDeepLearning/introtodeeplearning
麻省理工学院6.S191课程实验材料:深度学习导论
abus-aikorea/voice-pro
为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。
supertone-inc/supertonic
闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。
snakers4/silero-models
Silero模型:提供预训练语音转文本、文本转语音和文本增强模型,极致简化实现
FluidInference/FluidAudio
在您的应用中集成前沿CoreML音频模型——文本转语音、语音转文本、语音活动检测及说话人分离。基于Swift开发,由顶尖开源技术驱动。
phuc-nt/my-translator
实时语音翻译——支持macOS和Windows,免费TTS,无需服务器,仅需使用你自己的API密钥
soniqo/speech-swift
面向 Apple Silicon 的 AI 语音工具包 — 基于 MLX 和 CoreML 的 ASR、TTS、语音到语音、VAD 及说话人分离功能。
相关项目推荐
public-apis/public-apis
免费API资源汇总列表
EbookFoundation/free-programming-books
📚 免费提供的编程书籍
donnemartin/system-design-primer
学习如何设计大规模系统。为系统设计面试做准备。包含Anki记忆卡片。
practical-tutorials/project-based-learning
基于项目的教程精选列表
NousResearch/hermes-agent
与你共同成长的智能体
TheAlgorithms/Python
所有算法均使用Python实现