由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

text-to-speech

话题找到数量

harry0703/MoneyPrinterTurbo

利用AI大模型一键生成高清短视频

118k
18k
1.5k
+385
排名 #17
8月29日
查看详情

unslothai/unsloth

大语言模型微调与强化学习 🦥 以2倍速度训练OpenAI gpt-oss、Qwen3、Llama 4、DeepSeek-R1、Gemma 3,节省70%显存

76k
7k
1.5k
+68
排名 #14
9月19日
查看详情

RVC-Boss/GPT-SoVITS

1分钟的语音数据也可以用来训练一个好的TTS模型! (几张声音克隆镜头)

61k
6.6k
1.1k
+24
排名 #19
8月27日
查看详情

calesthio/OpenMontage

全球首个开源智能体视频制作系统,集成12条流水线、52种工具及500余项智能体技能,可将您的AI编程助手转变为完整的视频制作工作室。

55k
6.9k
1.3k
+454
排名 #20
8月31日
查看详情

OpenBMB/VoxCPM

VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统

37k
4.3k
1.3k
+99
排名 #18
9月16日
查看详情

myshell-ai/OpenVoice

MIT与MyShell联合开发的即时语音克隆技术

37k
4.2k
912
+141
排名 #15
8月30日
查看详情

debpalash/VoiceStudio

VoiceStudio 是 ElevenLabs 的开源、完全本地化替代方案 — 提供 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声读物创建。

32k
3.8k
438
+10k
排名 #15
9月16日
查看详情

index-tts/index-tts

工业级可控高效的零样本文本转语音系统

22k
2.8k
409
+492
排名 #12
8月16日
查看详情

jianchang512/pyvideotrans

将视频从一种语言翻译为另一种语言,并嵌入配音与字幕。

17k
2.2k
863
+22
排名 #10
6月9日
查看详情

k2-fsa/sherpa-onnx

基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。

14k
1.7k
1.3k
+19
排名 #11
9月18日
查看详情

supertone-inc/supertonic

闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。

13k
1.5k
1k
+8
排名 #15
9月8日
查看详情

abus-aikorea/voice-pro

为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。

12k
1.7k
668
+46
排名 #11
8月3日
查看详情

Blaizzy/mlx-audio

基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。

7.8k
689
1.1k
+12
排名 #15
8月17日
查看详情

espeak-ng/espeak-ng

eSpeak NG是开源语音合成器,支持上百种语言和口音

6.8k
1.3k
976
+39
排名 #18
8月30日
查看详情

argmaxinc/argmax-oss-swift

面向苹果芯片的端侧语音人工智能

6.3k
596
870
+2
排名 #8
8月16日
查看详情

snakers4/silero-models

Silero模型:提供预训练语音转文本、文本转语音和文本增强模型,极致简化实现

6k
370
623
+5
排名 #15
8月4日
查看详情

Osmantic/ODS

将您的PC、Mac或Linux设备转变为AI服务器,支持大语言模型推理、聊天界面、语音、智能体、工作流、RAG及图像生成。

5.8k
814
866
+497
排名 #9
9月1日
查看详情

dograh-hq/dograh

开源语音代理平台

4k
797
1k
+1.3k
排名 #8
5月31日
查看详情

0xShug0/audio.cpp

一款用于音频模型的一体化纯 C++ 推理引擎,由 ggml 提供支持。支持TTS、STT、VAD、语音转换、音乐生成等,性能高度优化。没有 Python 依赖。

2.8k
315
204
+396
排名 #4
9月16日
查看详情

OpenMOSS/MOSS-TTS

MOSS‑TTS 系列是由 MOSI.AI 与 OpenMOSS 团队开发的开源语音与声音生成模型系列。

2.8k
247
871
+904
排名 #21
5月31日
查看详情

Light-Heart-Labs/ODS

将您的PC、Mac或Linux设备转变为AI服务器,支持LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。

2.5k
374
799
+21
排名 #10
7月1日
查看详情

Light-Heart-Labs/DreamServer

随处可用的本地AI,人人皆可——涵盖LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。无需云端,无需订阅。

2.3k
356
1k
+87
排名 #9
6月27日
查看详情

fikrikarim/parlor

设备端实时多模态AI。与完全运行在您本机上的AI进行自然的语音和视觉对话,由Gemma 4 E2B和Kokoro驱动。

1.9k
232
721
+3
排名 #9
7月4日
查看详情

techjarves/Portable-Local-Studio

Portable local AI studio for Windows, Linux, and macOS. Zero-setup GUI for Image Generation, GGUF LLMs, Text to Speech & Speech to Text

1.4k
348
12
+9
排名 #6
9月19日
查看详情
助手