探索包含 tts 主题特性的所有开源仓库、扩展插件与智能体组件。
流式zipformer2实现语音识别,支持生成可编辑对话草稿,可自定义唤醒词,搭配Edge TTS按句朗读并同步输出实时字幕,支持开口打断交互,无需API Key即可使用。
提供实时语音聊天能力,支持可配置翻译、多款TTS语音合成,可自动启动本地服务无需额外配置,即装即用,交互流畅,适配本地化语音交互需求。
提供网页端内容自动朗读能力,可智能识别跳过代码块与表格内容,默认采用免费浏览器本地TTS,也可切换豆包云TTS获得更自然的朗读效果,开箱即用无需额外配置。
提供带麦克风按钮的语音会话循环能力,支持浏览器本地及本地部署的语音转写(Web Speech、FunASR、whisper.cpp),内置文本转语音工具,可直接搭建纯语音交互的会话流程。
DeepSeek Harness 语音双件套插件:voice_tts(edge-tts 协议免费微软神经语音合成,Sec-MS-GEC 本地 DRM 生成)/ voice_stt(OpenAI 兼容 ASR)/ voice_list。· T...
适配DeepSeek Harness的第三方Fish Audio语音合成插件,可逐条朗读回复内容,支持自动朗读开关切换,需用户自行提供Fish Audio API密钥使用。
支持为AI智能体提供微信风格语音呼叫功能,内置联系人簿可管理成员专属音色,集成Kokoro开源中文TTS实现自然语音合成,搭配GINKA桌面助理使用流畅。
自动语音识别技术,集成于编辑器内,提供专属语音输入按钮,支持实时将语音内容转写为对应文本,无需手动敲击键盘即可快速完成内容录入,操作便捷高效。
edge-tts提供免费页内内容播报,集成百炼paraformer实现实时语音转文字输入,支持Alt+Q快捷键一键唤起,可自动发送转换内容,轻量无依赖开箱即用。
可将任意静态照片转化为可响应交互的虚拟女孩形象,她能跟随对话自然转动、微笑、说话,动作与语音完全同步,低延迟高细节,交互体验流畅自然。
语音插件提供逐条消息语音播放、自动公告播报、麦克风听写输入能力,支持自由组合阿里云DashScope或火山引擎的云端TTS、ASR服务,无需复杂配置即可快速接入。
Give a DeepSeek Harness agent a voice it owns — offer_call rings the human (接听/拒接/稍后); local TTS via CrispASR + Qwen3-TT...