挖掘有趣 Github 的猫。


有事联系:https://t.me/qumaobot
🍭 #开源项目 #语音转文字 #TelegramBot


🏵 Whisperbot - 语音转文字自动化处理程序

🍥 简介:
Whisperbot 是一款基于 Whisper 语音识别模型构建的 Telegram 机器人程序。该程序通过集成 OpenAI 的 Whisper 模型,实现对接收到的语音消息进行自动解析,并实时转换为结构化文本。系统具备高效的语音识别能力,旨在为用户提供轻量化的音频转录解决方案,适用于处理多语言语音数据的快速转录需求。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #语音处理 #人工智能 #开源项目


🏵 FireRedVAD - 多语言语音与音频事件检测系统


🍥 简介:
FireRedVAD 是一款工业级语音活动检测(VAD)及音频事件识别系统。该系统架构先进,具备卓越的鲁棒性与高精度表现,支持全球超过 100 种语言的实时处理。其核心算法经过深度优化,适用于复杂的噪声环境,可广泛集成于语音识别预处理、实时监控及音频分析等各类生产环境应用场景中,提供稳定高效的语音数据提取方案。


🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #语音识别 #人工智能 #音频处理


🏵 FireRedVAD - 多语言语音及音频事件检测系统


🍥 简介:
FireRedVAD 是一款工业级语音活动检测(VAD)与音频事件识别系统。该系统架构先进,具备卓越的鲁棒性,支持识别超过 100 种语言。它能够精准区分语音信号与背景噪声,并有效识别多种音频触发事件,适用于高并发、高精度的实时音频处理及自动化语音分析任务。


🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #开源项目 #人工智能 #语音合成

🏵 MOSS-TTS - 高保真语音与音频生成模型

🍥 简介:
MOSS-TTS 是一套开源语音与音频生成模型架构。该程序支持生成高保真音频内容,具备语音克隆、多角色对话交互、实时语音合成以及音效处理等核心功能。系统通过先进的算法实现自然流畅的音频输出,适用于多种语音处理场景,开发者可基于此项目快速部署高质量的语音生成解决方案。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #开源工具 #语音合成 #本地部署


🏵 Supertonic - 高效本地文本转语音引擎

🍥 简介:
Supertonic 是一款基于 ONNX Runtime 构建的轻量级多语言语音合成系统。该程序专为端侧推理设计,具备极低的资源占用率。系统完全实现本地化运行,无需依赖云端服务器或 API 接口,在确保处理速度的同时,消除了数据传输过程中的隐私泄露风险。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #语音识别 #效率工具


🏵 DeLive - 系统音频实时语音转文字


🍥 简介:
DeLive 是一款桌面端音频处理工具,支持实时采集系统音频并接入十二种自动语音识别引擎进行转录。程序将数据保存在本地,具备全文检索功能,并集成 AI 辅助校对系统。支持 Markdown 格式对话、问答生成、结构化摘要及思维导图导出。同时,该软件支持离线导入音频或视频文件,并可调用多种云端引擎实现自动化转录处理。


🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #开源工具 #语音合成

🏵 Voicebox - 本地化语音克隆与合成工具

🍥 简介:
Voicebox 是一款开源语音合成套件,支持在本地运行以确保数据隐私。该工具具备语音克隆功能,仅需少量音频样本即可生成高保真语音模型。系统内置五种主流文本转语音(TTS)引擎,支持全球 23 种语言,并提供音频特效处理及多音轨时间轴编辑器,能够实现复杂的语音合成与编辑任务,满足各类本地化音频创作需求。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #人工智能 #语音识别


🏵 Insanely Fast Whisper - 高性能语音转文字工具

🍥 简介:
该工具基于命令行运行,旨在实现音频文件的高速转录。软件深度集成OpenAI Whisper Large v3模型,并针对NVIDIA显卡及Mac平台进行了深度优化。通过应用Flash Attention等技术,显著提升了处理效率与推理速度,适用于对语音识别实时性要求较高的计算场景,是实现大规模音频自动转写的高效方案。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #AI工具 #语音代理


🏵 Quickvoice_mcp - QuickVoice AI语音代理交互

🍥 简介:
Quickvoice_mcp 是一个专门设计的MCP服务器实现。其核心功能是为QuickVoice AI语音代理提供稳定的交互接口与环境。该程序能够处理与AI语音代理相关的通信协议,确保数据传输的准确性与效率,旨在优化自动化语音系统或集成语音服务的功能扩展和部署。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #音频处理 #语音转写


🏵 Buzz - 离线音频转写与翻译

🍥 简介:
Buzz是一款基于OpenAI Whisper模型的桌面应用程序。该软件支持在个人电脑上离线执行音频转写及翻译功能。用户可利用其将本地音频文件内容转换为文本,并提供多语言翻译服务,所有处理均在本地完成,不依赖外部网络,确保数据隐私与操作效率。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #AI工具 #语音合成


🏵 Free-voice-clone - 免费语音克隆模型库

🍥 简介:
Free-voice-clone 是一个开源集合,收录所有本地部署且免费的开源语音合成模型和音乐生成模型。它提供了多种语音克隆与文本转语音(TTS)技术,以及各类音乐创作算法。该项目为开发者和研究人员汇集了无需商业许可的智能音频处理工具,涵盖多种技术栈和实现方式。

🎈 【进入项目】


🗣 活动线报 | 掘金项目
🍭 #语音合成 #AI工具

🏵 Voicebox - 开源语音合成平台

🍥 简介:
Voicebox是一款开源语音合成工具,支持克隆语音、生成高质量语音内容以及开发语音应用。所有功能均可在本地计算机上运行,提供高效、私密的语音处理解决方案。

🎈 【进入项目】

🗣 活动线报 | 掘金项目
🗣 每日羊毛线报 👈


🏵 SoftWhisper - 音视频转录助手

🍥 简介:
SoftWhisper 基于强大的 Whisper 模型,专为音频和视频内容的高准确率转录设计。用户可灵活选择模型类型、转录语言与任务,并支持自定义转录片段的起止时间及束宽参数优化结果。软件内置友好的图形界面,操作简便,且具备说话人分离功能,适用于多语种环境和多场景应用。无论是会议记录、访谈整理还是内容归档,SoftWhisper 都能高效满足自动转录需求。

🍭 #语音转写 #音视频处理


🎈 【进入项目】


🎯 关注频道 🤖 合作/投稿
#Whisper #语音


🏵 #程序 | Whisper - 使用GPU进行快速语音识别

🍥 简介:
Whisper是一个基于DirectCompute的高性能GPGPU推理库,用于实现OpenAI的Whisper自动语音识别(ASR)模型。它是一个纯C++实现,除了必要的操作系统组件外,没有其他运行时依赖。它比OpenAI的实现快得多,使用混合F16/F32精度,并具有内置的性能分析器。它使用Media Foundation处理音频,支持大多数音频和视频格式,以及大多数在Windows上工作的音频捕获设备。它还具有语音活动检测和简单易用的COM风格API。


🎈 【进入项目】


🫥 关注频道 🤖 合作/投稿
 
 
Back to Top