公开中文语音样本的实际波形

OPEN SOURCE / SPEECH INTELLIGENCE

FunASR

让语音,成为可用的信息。

语音识别、时间戳、说话人分离。从一行 Python,到你自己的生产服务。

公开样本 · 中文

欢迎大家来体验达摩院推出的语音识别模型。

一个工具箱,多种可能

为你的应用,选对模型。

开发者文档

从问题,直接到答案。

部署选择器

在你的硬件上,找到合适的运行时。

从本地 CPU 到 GPU 集群,每条路径都有安装步骤、测试记录和已知限制。

工作负载
硬件
优先目标

完整矩阵

运行时一览

查看全部部署路径 11
方案 工作负载 硬件 接口 状态
MOSS 统一转写与说话人分离 batch / private-api cpu / nvidia-gpu / desktop-edge-gpu / kubernetes OpenAI-compatible HTTP / vLLM 社区验证
vLLM 原生 FunASR 服务 batch / private-api nvidia-gpu / kubernetes OpenAI-compatible HTTP 社区验证
SenseVoice TensorRT / Triton batch / private-api nvidia-gpu / kubernetes Triton gRPC/HTTP / TensorRT plan 生产验证
llama.cpp / GGUF 独立运行 edge / batch cpu / desktop-edge-gpu CLI / local HTTP server 生产验证
SenseVoice 原生 OpenAI 实时服务 private-api / realtime / edge cpu / nvidia-gpu OpenAI-compatible HTTP / OpenAI realtime WebSocket 生产验证
audio.cpp 原生 Fun-ASR-Nano 与 SenseVoice edge / batch / private-api cpu / nvidia-gpu / desktop-edge-gpu CLI / OpenAI-compatible HTTP 社区验证
OpenAI 兼容私有 API private-api / batch cpu / nvidia-gpu / kubernetes OpenAI-compatible HTTP / OpenAPI 生产验证
实时流式与字幕 realtime cpu / nvidia-gpu / kubernetes WebSocket / Python client 社区验证
容器与 Kubernetes private-api / batch / realtime kubernetes / cpu / nvidia-gpu Docker Compose / Kubernetes ClusterIP 社区验证
ONNX / C++ CPU 运行时 batch / realtime / edge cpu C++ / ONNX Runtime 社区验证
生产上线检查 private-api / batch / realtime / edge cpu / nvidia-gpu / desktop-edge-gpu / kubernetes HTTP / WebSocket 生产验证

可验证接口

先验证服务,再接入客户端

健康、模型身份和真实转写是三个独立检查。

localhost:8000
curl -fsS http://localhost:8000/health
# {"status":"ok"}

curl -fsS http://localhost:8000/v1/models
# {"data":[{"id":"sensevoice"}]}

curl -fsS http://localhost:8000/v1/audio/transcriptions \
  -F file=@meeting.wav -F model=sensevoice

生产边界

运行时负责推理,平台负责暴露方式

FunASR 原生

模型加载、转写接口、时间戳、VAD、流式协议和运行时日志。

网关与平台

TLS、认证、租户配额、限流、审计、上传策略、监控和滚动发布。

上线证据

目标硬件的容量测试、已知音频 smoke test、版本清单和可执行回滚。

生态仓库

从模型到视频工作流

按目标进入专用仓库,核对模型、部署边界与可复现示例。

工业语音工具箱

FunASR

统一语音识别、VAD、标点、说话人分离与工业部署的开源工具箱。

查看 FunASR

高精度转写

Fun-ASR

端到端语音识别模型家族,覆盖旗舰与 31 语言 MLT 检查点。

查看 Fun-ASR

多语种与情感

SenseVoice

覆盖语音识别、语言、情感与音频事件的多语言理解模型。

查看 SenseVoice

智能视频剪辑

FunClip

以语音与文本定位为核心的视频理解与智能剪辑工作流。

查看 FunClip

下一步

选择一条路径,完成第一次可复现验证