由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

speech

话题找到数量

kmario23/deep-learning-drizzle

通过聆听这些精彩讲座,沉浸式学习深度学习、强化学习、机器学习、计算机视觉和自然语言处理!!

12k
3k
742
+9
排名 #4
7月20日
查看详情

abus-aikorea/voice-pro

为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。

12k
1.7k
670
+46
排名 #11
8月3日
查看详情

openvinotoolkit/openvino

OpenVINO™是用于优化和部署AI推理的开源工具套件

10k
3.4k
1.7k
+6
排名 #8
9月19日
查看详情

pyannote/pyannote-audio

说话人日志神经构建模块:语音活动检测、说话人变更检测、重叠语音检测、说话人嵌入

10k
1.1k
1.2k
+4
排名 #9
8月25日
查看详情

QwenAudio/SenseVoice

开源 SenseVoiceSmall 模型,适用于普通话、粤语、英语、日语和韩语 ASR、语言 ID、情绪识别和音频事件检测。

9.3k
821
467
+74
排名 #11
9月6日
查看详情

OpenWhispr/openwhispr

支持本地模型(Nvidia Parakeet/Whisper)与云端模型(BYOK)的语音转文字听写应用,注重隐私优先,并实现跨平台兼容。

7.9k
961
730
+85
排名 #9
9月8日
查看详情

Blaizzy/mlx-audio

基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。

7.8k
689
1.1k
+12
排名 #15
8月17日
查看详情

HenryNdubuaku/maths-cs-ai-compendium

成为顶尖的人工智能与机器学习研究工程师

6.9k
825
957
+381
排名 #7
7月18日
查看详情

espeak-ng/espeak-ng

eSpeak NG是开源语音合成器,支持上百种语言和口音

6.8k
1.3k
976
+39
排名 #18
8月30日
查看详情

argmaxinc/argmax-oss-swift

面向苹果芯片的端侧语音人工智能

6.3k
596
875
+2
排名 #8
8月16日
查看详情

snakers4/silero-models

Silero模型:提供预训练语音转文本、文本转语音和文本增强模型,极致简化实现

6k
370
634
+5
排名 #15
8月4日
查看详情

cactus-compute/cactus

在手机、可穿戴设备及AI原生硬件上本地运行人工智能

6k
497
1.1k
+425
排名 #17
8月31日
查看详情

Osmantic/ODS

将您的PC、Mac或Linux设备转变为AI服务器,支持大语言模型推理、聊天界面、语音、智能体、工作流、RAG及图像生成。

5.8k
814
869
+497
排名 #9
9月1日
查看详情

openutau/OpenUtau

开放歌唱合成平台 / 开源UTAU继任者

4.3k
543
926
+4
排名 #13
8月31日
查看详情

JohnSnowLabs/spark-nlp

顶尖自然语言处理技术

4.1k
743
1.1k
排名 #10
7月17日
查看详情

dograh-hq/dograh

开源语音代理平台

4k
797
1k
+1.3k
排名 #8
5月31日
查看详情

stakira/OpenUtau

开放歌声合成平台/开源UTAU后继项目

3.9k
492
1.2k
+6
排名 #6
6月1日
查看详情

SakiRinn/LiveCaptions-Translator

基于Windows LiveCaptions的轻量级强大实时音频/语音翻译工具

3.5k
247
1.1k
+8
排名 #5
8月13日
查看详情

tmoroney/auto-subs

在您的设备上即时生成AI驱动的字幕。可独立运行或连接达芬奇调色软件。

3.5k
223
669
+15
排名 #7
5月31日
查看详情

0xShug0/audio.cpp

一款用于音频模型的一体化纯 C++ 推理引擎,由 ggml 提供支持。支持TTS、STT、VAD、语音转换、音乐生成等,性能高度优化。没有 Python 依赖。

2.8k
315
222
+396
排名 #4
9月16日
查看详情

OpenMOSS/MOSS-TTS

MOSS‑TTS 系列是由 MOSI.AI 与 OpenMOSS 团队开发的开源语音与声音生成模型系列。

2.8k
247
883
+904
排名 #21
5月31日
查看详情

getopenscreen/openscreen

录制您的屏幕,发送演示。免费开源、GPU 加速、无水印、无需订阅。 Windows、macOS、Linux。积极维护。

2.6k
165
324
+69
排名 #12
9月9日
查看详情

microsoft/foundry-local

暂无项目描述

2.5k
357
0
+1
排名 #8
8月7日
查看详情

Light-Heart-Labs/ODS

将您的PC、Mac或Linux设备转变为AI服务器,支持LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。

2.5k
374
805
+21
排名 #10
7月1日
查看详情
助手