由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

speech-to-text

话题找到数量

ggml-org/whisper.cpp

OpenAI Whisper模型的C/C++移植版本

53k
6.2k
2.2k
+173
排名 #9
9月16日
查看详情

debpalash/VoiceStudio

VoiceStudio 是 ElevenLabs 的开源、完全本地化替代方案 — 提供 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声读物创建。

32k
3.8k
438
+10k
排名 #15
9月16日
查看详情

cjpais/Handy

完全离线的免费开源可扩展语音转文本应用程序

31k
2.9k
1.2k
+84
排名 #16
9月17日
查看详情

Zackriya-Solutions/meetily

Meetily是一款隐私优先的AI会议助手,基于Rust构建,提供比Parakeet/Whisper快4倍的实时转录、说话人分离及Ollama摘要功能。100%本地处理,无需云端。作为排名第一的自托管开源AI会议记录工具,支持macOS与Windows系统。

30k
3.3k
1.4k
+50
排名 #6
9月1日
查看详情

mozilla-ai/llamafile

用单个文件分发和运行大语言模型。

25k
1.6k
1.2k
+25
排名 #13
9月1日
查看详情

screenpipe/screenpipe

screenpipe将您的电脑转变为个人AI助手,它能知晓您的一切操作。记录、搜索、自动化,全部本地运行,完全私密,尽在您掌控。

20k
2.1k
1.1k
+33
排名 #12
8月10日
查看详情

modelscope/FunASR

端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。

18k
1.9k
1.3k
+2.1k
排名 #14
6月30日
查看详情

jianchang512/pyvideotrans

将视频从一种语言翻译为另一种语言,并嵌入配音与字幕。

17k
2.2k
863
+22
排名 #10
6月9日
查看详情

alphacep/vosk-api

适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。

15k
1.8k
1k
+27
排名 #16
9月6日
查看详情

k2-fsa/sherpa-onnx

基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。

14k
1.7k
1.3k
+19
排名 #11
9月18日
查看详情

abus-aikorea/voice-pro

为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。

12k
1.7k
668
+46
排名 #11
8月3日
查看详情

QwenAudio/SenseVoice

开源 SenseVoiceSmall 模型,适用于普通话、粤语、英语、日语和韩语 ASR、语言 ID、情绪识别和音频事件检测。

9.3k
821
459
+74
排名 #11
9月6日
查看详情

OpenWhispr/openwhispr

支持本地模型(Nvidia Parakeet/Whisper)与云端模型(BYOK)的语音转文字听写应用,注重隐私优先,并实现跨平台兼容。

7.9k
961
723
+85
排名 #9
9月8日
查看详情

Blaizzy/mlx-audio

基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。

7.8k
689
1.1k
+12
排名 #15
8月17日
查看详情

argmaxinc/argmax-oss-swift

面向苹果芯片的端侧语音人工智能

6.3k
596
870
+2
排名 #8
8月16日
查看详情

snakers4/silero-models

Silero模型:提供预训练语音转文本、文本转语音和文本增强模型,极致简化实现

6k
370
623
+5
排名 #15
8月4日
查看详情

Osmantic/ODS

将您的PC、Mac或Linux设备转变为AI服务器,支持大语言模型推理、聊天界面、语音、智能体、工作流、RAG及图像生成。

5.8k
814
862
+497
排名 #9
9月1日
查看详情

dograh-hq/dograh

开源语音代理平台

4k
797
1k
+1.3k
排名 #8
5月31日
查看详情

SakiRinn/LiveCaptions-Translator

基于Windows LiveCaptions的轻量级强大实时音频/语音翻译工具

3.5k
247
1.1k
+8
排名 #5
8月13日
查看详情

tmoroney/auto-subs

在您的设备上即时生成AI驱动的字幕。可独立运行或连接达芬奇调色软件。

3.5k
223
666
+15
排名 #7
5月31日
查看详情

0xShug0/audio.cpp

一款用于音频模型的一体化纯 C++ 推理引擎,由 ggml 提供支持。支持TTS、STT、VAD、语音转换、音乐生成等,性能高度优化。没有 Python 依赖。

2.8k
315
202
+396
排名 #4
9月16日
查看详情

getopenscreen/openscreen

录制您的屏幕,发送演示。免费开源、GPU 加速、无水印、无需订阅。 Windows、macOS、Linux。积极维护。

2.6k
165
318
+69
排名 #12
9月9日
查看详情

microsoft/foundry-local

暂无项目描述

2.5k
357
0
+1
排名 #8
8月7日
查看详情

Light-Heart-Labs/ODS

将您的PC、Mac或Linux设备转变为AI服务器,支持LLM推理、聊天界面、语音、智能体、工作流、RAG及图像生成。

2.5k
374
799
+21
排名 #10
7月1日
查看详情
助手