由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
OpenBMB/VoxCPM
VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统
abus-aikorea/voice-pro
为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。
huggingface/speech-to-speech
语音转语音:致力于构建开源模块化GPT4-o的项目
NVIDIA/DeepLearningExamples
按模型组织的尖端深度学习脚本——易于在企业级基础设施上进行训练和部署,并具备可复现的准确性与性能。
pyannote/pyannote-audio
说话人日志神经构建模块:语音活动检测、说话人变更检测、重叠语音检测、说话人嵌入
supertone-inc/supertonic
闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。
jianchang512/pyvideotrans
将视频从一种语言翻译为另一种语言,并嵌入配音与字幕。
k2-fsa/sherpa-onnx
基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。
espeak-ng/espeak-ng
eSpeak NG是开源语音合成器,支持上百种语言和口音
argmaxinc/argmax-oss-swift
面向苹果芯片的端侧语音人工智能
dograh-hq/dograh
开源语音代理平台
Osmantic/ODS
将您的PC、Mac或Linux设备转变为AI服务器,支持大语言模型推理、聊天界面、语音、智能体、工作流、RAG及图像生成。
Light-Heart-Labs/ODS
将您的PC、Mac或Linux设备转变为AI服务器,支持LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。
Light-Heart-Labs/DreamServer
随处可用的本地AI,人人皆可——涵盖LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。无需云端,无需订阅。
fastai/fastai
fastai深度学习库
advimman/lama
🦙 LaMa图像修复:基于傅里叶卷积的鲁棒大掩码修复方案,WACV 2022
huggingface/pytorch-image-models
规模最大的PyTorch图像编码器/骨干网络集合。包含训练、评估、推理、导出脚本与预训练权重——支持ResNet、ResNeXT、EfficientNet、NFNet、Vision Transformer(ViT)、MobileNetV4、MobileNet-V3和V2、RegNet、DPN、CSPNet、Swin Transformer、MaxViT、CoAtNet、ConvNeXt等模型
modelscope/FunASR
端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。
Blaizzy/mlx-audio-swift
一个用于在Apple Silicon上使用MLX进行音频处理的模块化Swift SDK
myshell-ai/OpenVoice
MIT与MyShell联合开发的即时语音克隆技术
相关项目推荐
jackfrued/Python-100-Days
Python - 100天从新手到大师
microsoft/generative-ai-for-beginners
21堂课带你入门生成式AI开发
rasbt/LLMs-from-scratch
使用PyTorch从零开始逐步实现类ChatGPT大型语言模型
microsoft/ML-For-Beginners
12周、26节课、52个测验,面向所有人的经典机器学习课程
openai/openai-cookbook
OpenAI API 使用示例与指南
CompVis/stable-diffusion
潜在文本到图像扩散模型