FunASR v1.3.28:实时识别可靠性与字幕对齐修复

FunASR 工业级语音识别视觉图

FunASR v1.3.28 是一次面向实时转写和字幕生成的可靠性热修复。实时 WebSocket 最终解码退化时会保留连续完整的最佳结果,SenseVoice 字幕也会保持文本、标签和时间戳对齐。

签名发布页同时提供 Python wheel、源码包和九个平台的 llama.cpp / GGUF 自包含运行时。

这次修复了什么

场景v1.3.28 行为用户收益
VAD 锁句后的终稿退化为短前缀、重复文本或异常服务保留覆盖当前语音段的干净连续 partial实时终稿不再丢失句尾,也不会被重复幻觉替换
短音频尾部随后收到 STOP待处理采样统一进入最终解码路径短句结尾不会被静默丢弃
WebSocket 断线或处理异常显式导入连接异常,其他错误稳定进入通用处理异常处理不再依赖 websockets 的延迟属性和导入顺序
SenseVoice 字幕分句富标签、标点和词/BPE 时间戳保持对齐中文不会被压成一个字幕块,英文原文也不会受损

1. 升级 Python 包

实时识别和字幕部署都建议固定到本次热修复版本:

python -m pip install -U "funasr==1.3.28"
funasr --version

包版本、命令行版本和服务启动横幅都会显示 1.3.28;已有模型缓存和 API 请求格式无需迁移。

2. 实时识别与字幕入口

Fun-ASR-Nano 实时会话可使用包内入口并参照仓库 vLLM 指南配置。客户端 COMMIT 与服务端 VAD 模式现在共享修复后的最终收尾逻辑。

funasr-realtime-server --help
# 模型和设备参数见 docs/vllm_guide_zh.md
精确合并源码通过 118 项聚焦回归测试;实时 WebSocket 文件还独立通过 60 项测试,覆盖 STOP 最终解码和不依赖导入顺序的异常处理。

SenseVoice 用户通过同一次包升级获得字幕对齐修复,无需迁移输出结构。

3. 下载 llama.cpp / GGUF 自包含运行时

runtime-llamacpp-v0.1.9 同时提供九个 Linux x64/ARM64、macOS ARM64 和 Windows x64 包,其中 Linux 支持 AVX2/Vulkan,Windows 支持 AVX2/Vulkan/CUDA,并提供 funasr-llamacpp-windows-x64-vulkan.zip。每个压缩包都带自包含的 llama-funasr-* 二进制入口。

模型、命令与硬件选择见 llama.cpp / GGUF 专页,发布资产和模型版本保持对应,避免用户在多个 release 中寻找文件。

四个仓库分别解决什么

仓库适合关注的内容
FunASR工具包、服务、OpenAI API、vLLM、llama.cpp 与部署文档
Fun-ASRFun-ASR-Nano / MLT 模型、能力、评测和模型级集成
SenseVoice多语言 ASR、情感、语言和音频事件识别
FunClip由语音识别驱动的视频理解、检索与剪辑

从最适合你的入口跑通一个真实音频。遇到问题可在 GitHub 提交可复现 issue;如果项目对你有用,也欢迎 Star 你实际使用的仓库。

查看 v1.3.28 发布与下载