FunASR 生态系统

基于 FunASR、SenseVoice、Paraformer 构建的开源项目与集成方案。

50+
集成项目
31
MLT-Nano 语种
37K+
GitHub Stars
100万+
月安装量

视频与媒体工具

6K+ stars
基于语音识别的智能视频剪辑。自动生成字幕,支持按关键词和说话人剪辑视频片段。下载 v2.1.1
视频官方
10.5K+ stars
实时流式转写服务。已合并的 SenseVoiceSmall backend 接入 LocalAgreement 与 VAC/VAD 流水线,保留 word timestamp,支持自动检测及普通话、粤语、英语、日语和韩语。
实时转写SenseVoiceSmall
13.7K+ stars
v5.2.0-beta2 已提供 Fun-ASR Nano 与 SenseVoice 本地视频字幕引擎,覆盖 Windows、macOS、Linux,并提供 Q4、Q8、F16 模型。PR #13063 更新 CrispASR 运行时并核验 SenseVoice Metal 路径;查看使用与选型
视频字幕Fun-ASR NanoSenseVoice
17.6K stars
视频翻译工具。使用 FunASR 进行中文语音识别,自动生成和翻译字幕。
视频翻译
10.4K stars
Gradio WebUI 音频处理工具箱,集成 TTS、语音克隆与 ASR 能力。
音频TTS
3.2K stars
AI 视频配音工具包。自动语音识别、翻译和语音克隆,实现多语言视频配音。
配音视频

语音输入与桌面应用

13.1K+ stars
开源 AI 可穿戴设备与移动应用。已合并的 #10447 增加默认开启的“向 Omi 发送原始音频”开关。关闭后,raw audio 仅发往所选 STT provider;转写文本和非音频数据仍可发送到 Omi。设备编码不受 Custom STT 支持时会失败关闭,不会回退上传 Omi 音频。STT provider 可配置为 FunASR / SenseVoice 兼容服务。
可穿戴设备Custom STT隐私
5.5K stars
PC 端语音输入工具。按住 CapsLock 说话,松开自动上屏。基于 FunASR Paraformer 离线识别。
桌面语音输入
1.8K stars
macOS/Windows 语音输入工具。按住快捷键说话,松开即得润色后的文字。使用 SenseVoice 模型。
桌面macOS
30K+ stars
跨平台本地 AI 桌面应用。SenseVoice 集成已在 #7436 合并,通过 sherpa-onnx 在 macOS、Linux 和 Windows 离线自动识别中文、英文、日文、韩文和粤语。当前可在 v1.4.159-rc.1 预发布版使用;v1.4.158 稳定版尚不包含。
桌面离线SenseVoice
2.2K stars
开源 Wispr Flow 替代方案。集成 FunASR 本地模型和可配置大语言模型的桌面语音工作流。
桌面语音输入
1.2K stars
多功能桌面应用程序,集成音视频处理、图片编辑和 AI 增强语音转写。
桌面工具箱
704 stars
本地端侧隐私安全语音输入工具。通过快捷键将语音实时转文字并自动输入。支持 MCP 集成。
语音输入隐私
325 stars
实时音频翻译工具。捕获系统声音和麦克风,使用 SenseVoice 识别后 LLM 流式翻译显示。
翻译实时
139 stars
高性能 Linux 离线中文语音输入法。基于 FunASR,0.1 秒瞬时上屏,支持 IBus/Fcitx5。
Linux输入法
103 stars
macOS 离线语音转文字工具。按键说话即用,支持任意应用内使用,完全本地处理。
macOS语音输入
74 stars
语音驱动的桌面写作工具。支持语音输入、文本润色和跨应用协作。
桌面写作
73 stars
纯离线语音输入工具,Typeless 免费平替。SenseVoice + DirectML,数据永不出设备,适合涉密场景。
离线安全

语音助手与智能体

12.8K stars
数字人 Agent 框架,连接 2.5D/3D 虚拟人与大语言模型。使用 FunASR 实时语音识别。
数字人智能体
13.4K stars
开源 AI 数字人工具包,支持离线视频生成和实时交互。使用 FunASR 进行语音识别。
数字人视频生成
7.1K stars
中文语音对话机器人/智能音箱,支持树莓派部署,内置 FunASR 语音识别引擎。
IoT助手
6.9K stars
手机端编程助手,通过 Sherpa ONNX 使用 Paraformer 和 SenseVoice 进行语音识别。
编程智能体
3.3K stars
数字人对话系统,融合 ASR、LLM 和 TTS,实现与虚拟形象自然对话。使用 FunASR 语音识别。
数字人对话
2.1K stars
音视频内容提取工具,自动整理为结构化 Markdown 笔记。使用 FunASR 高精度转写。
笔记效率
1.7K stars
类 GPT-4o 语音聊天机器人,完整 ASR + LLM + TTS 语音对话方案。使用 FunASR 语音识别。
语音对话GPT-4o

AI 平台与框架

75K+ stars
可视化工作流与 Agent 平台,已通过 #14225 合并专用 FunASR speech-to-text 组件。默认连接本地 /v1sensevoice,支持可选网关鉴权和语言选择;自托管服务启用 SSRF 防护时,请把服务主机加入 allow-list。
WorkflowLocal FunASROpenAI 兼容
88.6K+ stars
开源 RAG 与智能体平台。已合并的 #17388 让本地 FunASR 使用默认 http://localhost:8000/v1 时无需 API key;配置密钥时仍发送 Bearer 认证,并在 multipart 转写前校验模型名,避免缺失配置触发 panic。
RAG本地 FunASR可选认证
313 stars
音频模型评测框架。#47 已注册 fun-asr-nano-2512,固定 Hugging Face 模型 revision 与运行依赖,通过隔离子进程执行评测;合并前在 H100 上完成了固定样例 smoke test,结果不代表所有数据集、语言或部署硬件。
评测Fun-ASR-Nano可复现 revision
58K stars
训练数据标注与 WebUI 转写支持 Fun-ASR-Nano、SenseVoice 和经典 FunASR 模型。已合并的 #2824 将项目依赖修正为 Transformers >=4.51,<5:4.51 是其验证矩阵中首个可构建 Qwen3 的版本,避免选择 Fun-ASR-Nano 后在转写前触发 KeyError: qwen3。另见 runtime fallbackbackend 文档
TTS数据集转写Qwen3
33K stars
自托管 OpenAI 替代方案。FunASR 作为语音识别后端(PR 审核中)。
LLM自托管
54.3K stars
OpenAI 兼容 AI Gateway。FunASR / SenseVoice 可通过 custom_openai 作为自托管语音转写端点接入。
AI GatewayOpenAI 兼容
12.5K stars
语音与多模态对话 AI 框架。FunASR 作为社区 STT 集成。
对话 AI
9.8K stars
OpenMMLab 开源音频、音乐和语音生成工具包。使用 FunASR 进行 TTS 评测与数据处理。
音频工具OpenMMLab
150K stars · 352 installs
FunASR 官方插件 0.1.1 已上线 Dify Marketplace,内置 SenseVoice、Fun-ASR-Nano 与 Paraformer,支持最大 25 MB 音频上传。
官方插件语音转写
9.3K stars
分布式推理框架。内置 FunASR 语音识别后端,支持一键部署 ASR 模型服务。
推理框架分布式
5K stars
一站式 AI 数字人系统,支持视频合成、声音合成与克隆。集成 FunASR 语音识别。
数字人AIGC
1.6K stars
轻量级多模态模型,融合视觉、音频和语言理解能力。使用 FunASR 作为语音识别模块。
多模态LLM
95 stars
ComfyUI 自定义节点,集成 SenseVoice 和 CosyVoice。可视化搭建语音识别与合成工作流。
ComfyUI工作流

SenseVoice 社区扩展

894 stars
增强版 SenseVoice,支持高精度单词级时间戳输出。速度与原版一致。
时间戳SenseVoice
541 stars
SenseVoice API 和 WebSocket 服务器。支持 VAD 检测、实时流式识别和说话人验证。
APIWebSocket
451 stars
伪流式 SenseVoice 实现,支持热词增强。实现低延迟准实时语音识别。
流式热词
111 stars
基于 ONNX Runtime 的 SenseVoice 推理库。企业级部署方案,无需 PyTorch 依赖。
ONNX部署
109 stars
SenseVoice 的 FastAPI 封装,ONNX 推理,体积更小。附带量化模型,支持 GPU 加速。
FastAPI量化
93 stars
SenseVoice API 服务,可无缝对接 OneAPI。统一接口管理多个语音识别模型。
OneAPIAPI

跨平台推理

5K+ stars
跨平台语音处理框架。可在 iOS、Android、树莓派、浏览器上运行 SenseVoice 和 Paraformer。
移动端边缘计算
1.1K+ stars
已合并的 Fun-ASR-Nano 原生实现通过纯 C++ / GGML 在 CPU 或 CUDA 上运行,提供 CLI 与兼容 OpenAI 的本地 HTTP 转写服务。查看固定提交的使用与验证指南
Fun-ASR-NanoC++ / GGML
7.7K+ stars
面向 Apple Silicon 的原生 MLX 音频运行时。主分支已提供 Fun-ASR-Nano 模型转换、Python/CLI 与 OpenAI 兼容转写,并在 #885 合并统一 hotwords/context 支持。当前路径仅转写、无时间戳,VAD 与说话人分离需外置;模型范围见 Fun-ASR 仓库
Apple SiliconFun-ASR-NanoOpenAI 兼容
20.7K+ stars
多智能体互动课堂,已通过 #1044 合并原生本地 FunASR provider。按照 配置指南 设置 ASR_FUNASR_BASE_URL 后,可把 WAV 音频发送到 OpenAI 兼容转写端点,并在 SenseVoiceSmall、Paraformer 与 Fun-ASR-Nano 之间选择;无需 API Key。服务端能力与部署边界以 FunASR 仓库 为准。
Local ASRMulti-agentOpenAI 兼容
608 stars
跨平台 ASR 推理库,基于 ONNX Runtime 和 FunASR。开箱即用,支持中英文混合识别。
ONNX跨平台
550 stars
SenseVoice 模型的 C/C++ 实现。无需 Python 依赖,纯 C++ 推理。
C++嵌入式
142K stars
Hugging Face Transformers 库。Fun-ASR-Nano 集成(PR 审核中)。
ML 框架
211 stars
OpenAI 兼容的语音服务器,支持 FunASR、Whisper、Bark、CosyVoice 后端。
API 服务OpenAI 兼容
136 stars
开箱即用的本地私有化语音服务。微服务架构,兼容阿里云语音 API 与 OpenAI TTS API,集成 FunASR 和 CosyVoice。
API 服务私有部署
113 stars
基于 GGML 的 C++ 推理引擎。支持 CPU/CUDA,实时麦克风流式识别,单 GGUF 文件部署。
GGMLC++
79 stars
多模型 ASR 推理方案,支持 Paraformer、SenseVoice、Whisper 等。ONNX 推理,适配多场景。
多模型ONNX

快速上手

pip install funasr

# Python API
from funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall")
result = model.generate(input="audio.wav")

# 或启动 OpenAI 兼容 API 服务
pip install vllm fastapi uvicorn python-multipart
funasr-server --device cuda

使用 FunASR 构建了项目?欢迎提交到此列表。

GitHub 提交 Issue