2
实时流式识别
麦克风或音频流输入,边说边出结果。适合实时字幕、直播转写、语音助手。
模型怎么选
旗舰 Fun-ASR-Nano(LLM-ASR)是离线模型,是文件转写和 OpenAI 兼容 API 服务的默认选择(本页第 1、3 节)。而真正边说边出的低延迟实时流式,用 FunASR 专门的流式模型 paraformer-zh-streaming —— 即下方示例。同一套工业级 FunASR,按场景搭配模型。
from funasr import AutoModel
# Paraformer 流式模型
model = AutoModel(model="paraformer-zh-streaming", vad_model="fsmn-vad")
# 流式推理:chunk_size = [5, 10, 5] 表示 600ms 前瞻
chunk_size = [5, 10, 5]
cache = {}
# 模拟流式输入(实际使用时替换为麦克风采集)
import soundfile as sf
speech, sr = sf.read("meeting.wav")
chunk_stride = chunk_size[1] * 960 # 每个 chunk 的采样点数
for i in range(0, len(speech), chunk_stride):
chunk = speech[i:i+chunk_stride]
is_final = (i + chunk_stride >= len(speech))
result = model.generate(
input=chunk, cache=cache,
is_final=is_final, chunk_size=chunk_size
)
print(result[0]["text"], end="", flush=True)
实时输出(逐步更新)
今天我们讨论...三个议题。好的,第一个是...关于 Q3 计划。
WebSocket 实时服务
如果需要浏览器端实时识别,FunASR 提供完整的 WebSocket 服务方案。参见
GitHub 仓库 中的
examples/ 目录获取 WebSocket 服务端和浏览器客户端代码。