由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
speech-to-text
话题找到数量
Zackriya-Solutions/meetily
Meetily是一款隐私优先的AI会议助手,基于Rust构建,提供比Parakeet/Whisper快4倍的实时转录、说话人分离及Ollama摘要功能。100%本地处理,无需云端。作为排名第一的自托管开源AI会议记录工具,支持macOS与Windows系统。
alphacep/vosk-api
适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。
abus-aikorea/voice-pro
为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。
QwenAudio/SenseVoice
开源 SenseVoiceSmall 模型,适用于普通话、粤语、英语、日语和韩语 ASR、语言 ID、情绪识别和音频事件检测。
OpenWhispr/openwhispr
支持本地模型(Nvidia Parakeet/Whisper)与云端模型(BYOK)的语音转文字听写应用,注重隐私优先,并实现跨平台兼容。
Blaizzy/mlx-audio
基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。
SakiRinn/LiveCaptions-Translator
基于Windows LiveCaptions的轻量级强大实时音频/语音翻译工具
0xShug0/audio.cpp
一款用于音频模型的一体化纯 C++ 推理引擎,由 ggml 提供支持。支持TTS、STT、VAD、语音转换、音乐生成等,性能高度优化。没有 Python 依赖。
getopenscreen/openscreen
录制您的屏幕,发送演示。免费开源、GPU 加速、无水印、无需订阅。 Windows、macOS、Linux。积极维护。