由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
index-tts/index-tts
工业级可控高效的零样本文本转语音系统
huggingface/transformers
🤗 Transformers:面向文本、视觉、音频及多模态模型的尖端机器学习模型定义框架,支持推理与训练全流程。
huggingface/datasets
🤗 最大的 AI 模型即用数据集中心,提供快速、易于使用且高效的数据操作工具
NVIDIA-NeMo/NeMo
专为从事大语言模型、多模态和语音人工智能(自动语音识别与文本转语音)的研究人员和开发者打造的可扩展生成式AI框架
unslothai/unsloth
大语言模型微调与强化学习 🦥 以2倍速度训练OpenAI gpt-oss、Qwen3、Llama 4、DeepSeek-R1、Gemma 3,节省70%显存
huggingface/speech-to-speech
语音转语音:致力于构建开源模块化GPT4-o的项目
NVIDIA/DeepLearningExamples
按模型组织的尖端深度学习脚本——易于在企业级基础设施上进行训练和部署,并具备可复现的准确性与性能。
debpalash/VoiceStudio
VoiceStudio 是 ElevenLabs 的开源、完全本地化替代方案 — 提供 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声读物创建。
NVIDIA-NeMo/Speech
一个可扩展的生成式 AI 框架,专为从事大语言模型、多模态及语音 AI(自动语音识别与文本转语音)的研究人员和开发者构建。
mozilla-ai/llamafile
用单个文件分发和运行大语言模型。
OpenBMB/VoxCPM
VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统
modelscope/FunASR
端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。
myshell-ai/OpenVoice
MIT与MyShell联合开发的即时语音克隆技术
RVC-Boss/GPT-SoVITS
1分钟的语音数据也可以用来训练一个好的TTS模型! (几张声音克隆镜头)
supertone-inc/supertonic
闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。
abus-aikorea/voice-pro
为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。
k2-fsa/sherpa-onnx
基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。
calesthio/OpenMontage
全球首个开源智能体视频制作系统,集成12条流水线、52种工具及500余项智能体技能,可将您的AI编程助手转变为完整的视频制作工作室。
ImageMagick/ImageMagick
ImageMagick是一款免费开源的图像处理软件套件,可用于创建、编辑、转换和显示图像。它支持200多种格式,并提供强大的命令行工具与API接口,支持跨平台的自动化处理、脚本编写和系统集成。
alphacep/vosk-api
适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。
相关项目推荐
jackfrued/Python-100-Days
Python - 100天从新手到高手
microsoft/generative-ai-for-beginners
21堂课带你入门生成式AI开发
rasbt/LLMs-from-scratch
使用PyTorch从零开始逐步实现类ChatGPT大型语言模型
microsoft/ML-For-Beginners
12周、26节课、52个测验,面向所有人的经典机器学习课程
openai/openai-cookbook
OpenAI API 使用示例与指南
microsoft/ai-agents-for-beginners
构建AI智能体的11门入门课程