由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
speech
话题找到数量
huggingface/transformers
🤗 Transformers:面向文本、视觉、音频及多模态模型的尖端机器学习模型定义框架,支持推理与训练全流程。
unslothai/unsloth
大语言模型微调与强化学习 🦥 以2倍速度训练OpenAI gpt-oss、Qwen3、Llama 4、DeepSeek-R1、Gemma 3,节省70%显存
calesthio/OpenMontage
全球首个开源智能体视频制作系统,集成12条流水线、52种工具及500余项智能体技能,可将您的AI编程助手转变为完整的视频制作工作室。
Zackriya-Solutions/meetily
Meetily是一款隐私优先的AI会议助手,基于Rust构建,提供比Parakeet/Whisper快4倍的实时转录、说话人分离及Ollama摘要功能。100%本地处理,无需云端。作为排名第一的自托管开源AI会议记录工具,支持macOS与Windows系统。
NVIDIA-NeMo/Speech
一个可扩展的生成式 AI 框架,专为从事大语言模型、多模态及语音 AI(自动语音识别与文本转语音)的研究人员和开发者构建。
IDEA-Research/Grounded-Segment-Anything
Grounded SAM:融合Grounding DINO与Segment Anything及Stable Diffusion与Recognize Anything——自动检测、分割并生成万物
NVIDIA-NeMo/NeMo
专为从事大语言模型、多模态和语音人工智能(自动语音识别与文本转语音)的研究人员和开发者打造的可扩展生成式AI框架
alphacep/vosk-api
适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。
NVIDIA/DeepLearningExamples
按模型组织的尖端深度学习脚本——易于在企业级基础设施上进行训练和部署,并具备可复现的准确性与性能。
kmario23/deep-learning-drizzle
通过聆听这些精彩讲座,沉浸式学习深度学习、强化学习、机器学习、计算机视觉和自然语言处理!!
abus-aikorea/voice-pro
为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。