FunASR v1.4.3:可选 Silero VAD 与大规模固定 K 说话人聚类
FunASR v1.4.3 为 AutoModel(vad_model="silero-vad") 增加可选 Silero VAD 适配器,直接返回 FunASR 兼容的毫秒级片段,并支持阈值、8/16 kHz 输入、ONNX 模式和最长片段限制。
已知说话人数的说话人分离在大规模 embedding 输入下改用固定 K 聚类,避免内存开销较高的稠密谱聚类。签名 GitHub Release 同时提供 wheel、sdist、九个平台的 llama.cpp / GGUF 运行时和 SHA256SUMS-v1.4.3,共 12 个资产。
本次更新
| 能力 | v1.4.3 内容 | 用户收益 |
|---|---|---|
| 可选 VAD | silero-vad 与 silero_vad 别名接入现有 AutoModel VAD 流程 | 无需改变后续 ASR 流程即可选择 Silero VAD |
| 输入与输出 | 8/16 kHz waveform 输入,输出毫秒级区间;支持阈值、最短静音、ONNX 与最长片段参数 | 片段边界可直接供 FunASR 的长音频识别使用 |
| 说话人聚类 | 已知说话人数且 embedding 较大时使用固定 K 聚类 | 避开稠密谱聚类的平方级内存压力 |
| 默认行为 | Silero 作为 funasr[silero] 可选依赖,原有 FSMN VAD 不变 | 基础安装与既有生产配置保持兼容 |
1. 安装并确认版本
从 public PyPI 固定正式版:
python -m pip install -U "funasr==1.4.3"
funasr --version
启用 Silero VAD:
python -m pip install -U "funasr[silero]==1.4.3"
model = AutoModel(
model="paraformer-zh",
vad_model="silero-vad",
device="cpu",
vad_kwargs={"silero_threshold": 0.5, "silero_min_silence_duration_ms": 100},
)
result = model.generate(input="audio.wav")
public PyPI 只发布 funasr-1.4.3-py3-none-any.whl 与 funasr-1.4.3.tar.gz。它们从 exact main 独立构建,并再次 no-cache 下载、隔离安装和 smoke。
exact-main 源码测试 167 项全部通过;compileall、PEP 517 构建、Twine、源码与产物 diff、无依赖与完整依赖隔离安装均通过。public wheel、sdist 与 GitHub 12 个资产已重新下载并逐项核对 size 和 SHA-256。
2. 九个平台运行时与校验清单
同一发布页复用并验证了 runtime-llamacpp-v0.2.0 的全部九个平台资产:
linux-arm64、linux-x64、linux-x64-avx2、linux-x64-vulkanmacos-arm64windows-x64、windows-x64-avx2、windows-x64-cuda、windows-x64-vulkan
下载后在同一目录校验:
sha256sum -c SHA256SUMS-v1.4.3
模型、命令与硬件选择见 llama.cpp / GGUF 专页。manifest 覆盖 wheel、sdist 和九个 runtime;manifest 自身的 GitHub digest 也已核验。
先用固定版本在真实音频上复现,再按 SHA-256 选择适合硬件的运行时。遇到问题请附模型、设备、输入边界和可复现命令。
查看 v1.4.3 发布与 12 个资产