由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

huggingface

huggingface/speech-to-speech

Python 活跃
545
2026-08-02
10k
+4k
#11
1.3k

项目介绍

语音转语音:致力于构建开源模块化GPT4-o的项目

Build local voice agents with open-source models

智能解读

智能解读 自动生成

语音转语音(Speech-to-Speech)是一个完全模块化、低延迟的开源语音代理管道,由四个独立组件依次串联:语音活动检测(VAD)→ 语音转文本(STT)→ 大语言模型(LLM)→ 文本转语音(TTS)。每个模块都支持自由替换,例如STT可使用本地Parakeet模型,TTS可选用Qwen3或Pocket TTS,LLM既能接入OpenAI等云端服务,也能通过vLLM或llama.cpp在本地运行,实现全栈开源。项目通过兼容OpenAI Realtime协议的WebSocket API对外暴露,客户端可直接连接使用。该方案已在数千台Reachy Mini机器人中作为对话后端稳定运行,适用于构建实时语音助手、智能客服、交互式机器人等场景。开发者能快速启动服务,并灵活切换语音识别、语言模型和语音合成组件,兼顾性能与定制化需求。

智能标签

生成技术栈、用途、特征、受众等多维度标签

使用场景

使用场景 自动生成

这个项目最适合需要低延迟、模块化、可本地部署的实时语音对话代理场景,特别是当开发者希望灵活替换组件(如LLM或TTS)或集成到现有机器人/外设系统时。

1

本地语音助手

开发者想在本地运行完全离线的语音对话代理,避免云端延迟和数据隐私风险。

使用项目内置的本地STT(如Parakeet TDT)、LLM(如通过llama.cpp运行Gemma 4)和TTS(如Qwen3-TTS),启动完全本地化的语音代理流水线。

在无网络的内网环境中部署智能客服机器人,所有音频处理与推理均在本地完成,响应延迟可控,数据不出设备。

2

多语言实时翻译

开发者需要构建一个支持多语言轮流识别的语音交互系统,例如中英混合对话的实时翻译。

利用项目支持的多种STT/TTS语言模型(如多语言Whisper和Qwen3-TTS),通过更换组件轻松切换源语言和目标语言,LLM中间处理翻译逻辑。

跨国会议助手:与会者说中文,系统识别后通过LLM翻译为英文并语音合成输出,支持双向实时翻译。

3

机器人客服集成

开发者希望在实体机器人(如Reachy Mini)上集成语音对话能力,但需要低延迟和模块化控制。

直接使用该项目的生产级流水线(已在Reachy Mini验证),通过OpenAI兼容的WebSocket API与机器人控制模块对接,无需从头搭建语音链路。

前台接待机器人:用户语音问路,机器人通过VAD检测说话、STT转文字、LLM生成回答、TTS语音播报,同时支持打断和连续对话。

4

自定义语音代理测试

开发者想快速对比不同LLM、STT或TTS组件的效果,但每次替换需要大量代码重构。

项目采用模块化设计,通过CLI参数即可替换任意组件(如从OpenAI LLM切换到vLLM本地服务器),方便进行A/B测试和性能评估。

测试新发布的TTS模型:仅需修改启动参数 --tts my-tts-model,项目自动加载并流式合成,评估语音自然度和延迟。

项目健康度

A
86/100
优秀
活跃度人气增长社区文档
活跃度 20/23

距上次更新 5 天

人气 24/25

平台 Star TOP 5% · Forks 1,279

增长 24/25

本周 +4,020 ⭐ · 本月 +4,740 ⭐

社区 8/17

18 位贡献者 · 0 条平台评论

文档 10/10

文档资料完整

在 GitHub 上查看

项目信息

作者 huggingface
来源 GitHub
周期 每周
仓库ID huggingface/speech-to-speech
最新提交 2026-07-31 23:14:20
第一收录 2026-08-03 09:02:06
最后更新 2026-08-03 09:02:06

赞赏支持

如果本站对你有帮助,欢迎打赏支持

微信打赏码

微信

支付宝打赏码

支付宝

评论 0

登录 后发表评论

加载评论中...

助手