FunASR v1.3.28:实时识别可靠性与字幕对齐修复
FunASR v1.3.28 是一次面向实时转写和字幕生成的可靠性热修复。实时 WebSocket 最终解码退化时会保留连续完整的最佳结果,SenseVoice 字幕也会保持文本、标签和时间戳对齐。
签名发布页同时提供 Python wheel、源码包和九个平台的 llama.cpp / GGUF 自包含运行时。
这次修复了什么
| 场景 | v1.3.28 行为 | 用户收益 |
|---|---|---|
| VAD 锁句后的终稿退化为短前缀、重复文本或异常 | 服务保留覆盖当前语音段的干净连续 partial | 实时终稿不再丢失句尾,也不会被重复幻觉替换 |
短音频尾部随后收到 STOP | 待处理采样统一进入最终解码路径 | 短句结尾不会被静默丢弃 |
| WebSocket 断线或处理异常 | 显式导入连接异常,其他错误稳定进入通用处理 | 异常处理不再依赖 websockets 的延迟属性和导入顺序 |
| SenseVoice 字幕分句 | 富标签、标点和词/BPE 时间戳保持对齐 | 中文不会被压成一个字幕块,英文原文也不会受损 |
1. 升级 Python 包
实时识别和字幕部署都建议固定到本次热修复版本:
python -m pip install -U "funasr==1.3.28"
funasr --version
包版本、命令行版本和服务启动横幅都会显示 1.3.28;已有模型缓存和 API 请求格式无需迁移。
2. 实时识别与字幕入口
Fun-ASR-Nano 实时会话可使用包内入口并参照仓库 vLLM 指南配置。客户端 COMMIT 与服务端 VAD 模式现在共享修复后的最终收尾逻辑。
funasr-realtime-server --help
# 模型和设备参数见 docs/vllm_guide_zh.md
精确合并源码通过 118 项聚焦回归测试;实时 WebSocket 文件还独立通过 60 项测试,覆盖 STOP 最终解码和不依赖导入顺序的异常处理。
SenseVoice 用户通过同一次包升级获得字幕对齐修复,无需迁移输出结构。
3. 下载 llama.cpp / GGUF 自包含运行时
runtime-llamacpp-v0.1.9 同时提供九个 Linux x64/ARM64、macOS ARM64 和 Windows x64 包,其中 Linux 支持 AVX2/Vulkan,Windows 支持 AVX2/Vulkan/CUDA,并提供 funasr-llamacpp-windows-x64-vulkan.zip。每个压缩包都带自包含的 llama-funasr-* 二进制入口。
- 不想维护 Python 环境:选标准 CPU 包。
- 桌面 GPU:按平台选择 Vulkan 或 CUDA 包。
- 边缘设备与 Apple Silicon:选择 ARM64 包。
模型、命令与硬件选择见 llama.cpp / GGUF 专页,发布资产和模型版本保持对应,避免用户在多个 release 中寻找文件。
四个仓库分别解决什么
| 仓库 | 适合关注的内容 |
|---|---|
| FunASR | 工具包、服务、OpenAI API、vLLM、llama.cpp 与部署文档 |
| Fun-ASR | Fun-ASR-Nano / MLT 模型、能力、评测和模型级集成 |
| SenseVoice | 多语言 ASR、情感、语言和音频事件识别 |
| FunClip | 由语音识别驱动的视频理解、检索与剪辑 |
从最适合你的入口跑通一个真实音频。遇到问题可在 GitHub 提交可复现 issue;如果项目对你有用,也欢迎 Star 你实际使用的仓库。
查看 v1.3.28 发布与下载