由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

speech

话题找到数量

huggingface/transformers

🤗 Transformers:面向文本、视觉、音频及多模态模型的尖端机器学习模型定义框架,支持推理与训练全流程。

166k
34k
1.8k
+1.3k
排名 #10
9月16日
查看详情

harry0703/MoneyPrinterTurbo

利用AI大模型一键生成高清短视频

118k
18k
1.5k
+385
排名 #17
8月29日
查看详情

unslothai/unsloth

大语言模型微调与强化学习 🦥 以2倍速度训练OpenAI gpt-oss、Qwen3、Llama 4、DeepSeek-R1、Gemma 3,节省70%显存

76k
7k
1.5k
+68
排名 #14
9月19日
查看详情

RVC-Boss/GPT-SoVITS

1分钟的语音数据也可以用来训练一个好的TTS模型! (几张声音克隆镜头)

61k
6.6k
1.1k
+24
排名 #19
8月27日
查看详情

calesthio/OpenMontage

全球首个开源智能体视频制作系统,集成12条流水线、52种工具及500余项智能体技能,可将您的AI编程助手转变为完整的视频制作工作室。

55k
6.9k
1.3k
+454
排名 #20
8月31日
查看详情

ggml-org/whisper.cpp

OpenAI Whisper模型的C/C++移植版本

53k
6.2k
2.2k
+173
排名 #9
9月16日
查看详情

OpenBMB/VoxCPM

VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统

37k
4.3k
1.3k
+99
排名 #18
9月16日
查看详情

myshell-ai/OpenVoice

MIT与MyShell联合开发的即时语音克隆技术

37k
4.2k
921
+141
排名 #15
8月30日
查看详情

debpalash/VoiceStudio

VoiceStudio 是 ElevenLabs 的开源、完全本地化替代方案 — 提供 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声读物创建。

32k
3.8k
450
+10k
排名 #15
9月16日
查看详情

cjpais/Handy

完全离线的免费开源可扩展语音转文本应用程序

31k
2.9k
1.2k
+84
排名 #16
9月17日
查看详情

Zackriya-Solutions/meetily

Meetily是一款隐私优先的AI会议助手,基于Rust构建,提供比Parakeet/Whisper快4倍的实时转录、说话人分离及Ollama摘要功能。100%本地处理,无需云端。作为排名第一的自托管开源AI会议记录工具,支持macOS与Windows系统。

30k
3.3k
1.4k
+50
排名 #6
9月1日
查看详情

mozilla-ai/llamafile

用单个文件分发和运行大语言模型。

25k
1.6k
1.2k
+25
排名 #13
9月1日
查看详情

index-tts/index-tts

工业级可控高效的零样本文本转语音系统

22k
2.8k
411
+492
排名 #12
8月16日
查看详情

huggingface/datasets

🤗 最大的 AI 模型即用数据集中心,提供快速、易于使用且高效的数据操作工具

21k
3.4k
607
+20
排名 #18
9月7日
查看详情

screenpipe/screenpipe

screenpipe将您的电脑转变为个人AI助手,它能知晓您的一切操作。记录、搜索、自动化,全部本地运行,完全私密,尽在您掌控。

20k
2.1k
1.1k
+33
排名 #12
8月10日
查看详情

modelscope/FunASR

端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。

18k
1.9k
1.3k
+2.1k
排名 #14
6月30日
查看详情

NVIDIA-NeMo/Speech

一个可扩展的生成式 AI 框架,专为从事大语言模型、多模态及语音 AI(自动语音识别与文本转语音)的研究人员和开发者构建。

18k
3.6k
1.1k
+42
排名 #17
8月24日
查看详情

jianchang512/pyvideotrans

将视频从一种语言翻译为另一种语言,并嵌入配音与字幕。

17k
2.2k
865
+22
排名 #10
6月9日
查看详情

IDEA-Research/Grounded-Segment-Anything

Grounded SAM:融合Grounding DINO与Segment Anything及Stable Diffusion与Recognize Anything——自动检测、分割并生成万物

17k
1.6k
1.1k
+7
排名 #16
5月28日
查看详情

NVIDIA-NeMo/NeMo

专为从事大语言模型、多模态和语音人工智能(自动语音识别与文本转语音)的研究人员和开发者打造的可扩展生成式AI框架

17k
3.4k
1.6k
+9
排名 #22
6月12日
查看详情

alphacep/vosk-api

适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。

15k
1.8k
1k
+27
排名 #16
9月6日
查看详情

k2-fsa/sherpa-onnx

基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。

14k
1.7k
1.3k
+19
排名 #11
9月18日
查看详情

NVIDIA/DeepLearningExamples

按模型组织的尖端深度学习脚本——易于在企业级基础设施上进行训练和部署,并具备可复现的准确性与性能。

14k
3.4k
1.1k
排名 #8
5月16日
查看详情

supertone-inc/supertonic

闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。

13k
1.5k
1k
+8
排名 #15
9月8日
查看详情
助手