从录音、字幕到自己的服务,走完一条应用路径。
有文字还不够:检查关键内容、说话人轮次和时间覆盖。
从一段对话出发,生成带匿名说话人标签的字幕,再按人选段。
先跑通本地请求,再明确鉴权、返回格式和服务责任。