FunASR 技术博客

全部文章

保留全部历史文章。旧文中的版本与测量对应当时环境,当前配置请以维护中的文档为准。

应用实践

会议转写,怎样才算做好了?

有文字还不够:检查关键内容、说话人轮次和时间覆盖。

选型指南

接入 Transformers,先选对权重

同名模型的权重格式不能混用。先理清格式,再跑通原生接入。

版本记录

v1.4.14:源码包与 MOSS 入口

应用实践

把多人录音变成可剪辑的字幕

从一段对话出发,生成带匿名说话人标签的字幕,再按人选段。

版本记录

v1.4.5:Python 依赖与运行时

版本记录

v1.4.3:VAD 与说话人聚类

应用实践

在 Subtitle Edit 中生成本地字幕

版本记录

v1.4.0:安装包与参数校验

版本记录

FunClip v2.1.0:首个版本化发布

版本记录

v1.3.28:实时识别与字幕修复

版本记录

v1.3.27:语种信息与回退处理

版本记录

v1.3.26:API 与运行时入口

选型指南

FunASR 模型选型笔记

应用实践

用时间戳定位原始录音

选型指南

迁移语音 API 前,先核对什么

技术解读

怎样给转写结果补标点

技术解读

VAD 如何找到语音区间

选型指南

自托管语音服务的迁移笔记

选型指南

CPU 语音识别的部署取舍

应用实践

日语录音转写实践

应用实践

中文录音转写入门

选型指南

中文与粤语:历史对比实验

应用实践

粤语录音转写实践

选型指南

用 llama.cpp 部署中文语音识别

技术解读

文字之外,语音里还有什么信息

应用实践

用 Python 转写一份录音

应用实践

把语音转写接进自己的 API

先跑通本地请求,再明确鉴权、返回格式和服务责任。

应用实践

从录音生成字幕文件

应用实践

从命令行转写音频

技术解读

长录音为什么会漏掉结尾?

从切分边界、生成上限和结果覆盖出发,检查长录音的遗漏。

技术解读

说话人分离:谁在何时说话

应用实践

实时字幕的流式识别路径

应用实践

SenseVoice 部署入门

选型指南

FunASR 与 Whisper:历史测量记录

选型指南

Fun-ASR-Nano 使用笔记