FunASR v1.4.3:可选 Silero VAD 与大规模固定 K 说话人聚类

FunASR v1.4.3 发布视觉图

FunASR v1.4.3 为 AutoModel(vad_model="silero-vad") 增加可选 Silero VAD 适配器,直接返回 FunASR 兼容的毫秒级片段,并支持阈值、8/16 kHz 输入、ONNX 模式和最长片段限制。

已知说话人数的说话人分离在大规模 embedding 输入下改用固定 K 聚类,避免内存开销较高的稠密谱聚类。签名 GitHub Release 同时提供 wheel、sdist、九个平台的 llama.cpp / GGUF 运行时和 SHA256SUMS-v1.4.3,共 12 个资产。

本次更新

能力v1.4.3 内容用户收益
可选 VADsilero-vadsilero_vad 别名接入现有 AutoModel VAD 流程无需改变后续 ASR 流程即可选择 Silero VAD
输入与输出8/16 kHz waveform 输入,输出毫秒级区间;支持阈值、最短静音、ONNX 与最长片段参数片段边界可直接供 FunASR 的长音频识别使用
说话人聚类已知说话人数且 embedding 较大时使用固定 K 聚类避开稠密谱聚类的平方级内存压力
默认行为Silero 作为 funasr[silero] 可选依赖,原有 FSMN VAD 不变基础安装与既有生产配置保持兼容

1. 安装并确认版本

从 public PyPI 固定正式版:

python -m pip install -U "funasr==1.4.3"
funasr --version

启用 Silero VAD:

python -m pip install -U "funasr[silero]==1.4.3"

model = AutoModel(
    model="paraformer-zh",
    vad_model="silero-vad",
    device="cpu",
    vad_kwargs={"silero_threshold": 0.5, "silero_min_silence_duration_ms": 100},
)
result = model.generate(input="audio.wav")

public PyPI 只发布 funasr-1.4.3-py3-none-any.whlfunasr-1.4.3.tar.gz。它们从 exact main 独立构建,并再次 no-cache 下载、隔离安装和 smoke。

exact-main 源码测试 167 项全部通过;compileall、PEP 517 构建、Twine、源码与产物 diff、无依赖与完整依赖隔离安装均通过。public wheel、sdist 与 GitHub 12 个资产已重新下载并逐项核对 size 和 SHA-256。

2. 九个平台运行时与校验清单

同一发布页复用并验证了 runtime-llamacpp-v0.2.0 的全部九个平台资产:

下载后在同一目录校验:

sha256sum -c SHA256SUMS-v1.4.3

模型、命令与硬件选择见 llama.cpp / GGUF 专页。manifest 覆盖 wheel、sdist 和九个 runtime;manifest 自身的 GitHub digest 也已核验。

先用固定版本在真实音频上复现,再按 SHA-256 选择适合硬件的运行时。遇到问题请附模型、设备、输入边界和可复现命令。

查看 v1.4.3 发布与 12 个资产