开始使用
- 该解决方案部署成功后,环境初始化及应用安装受网络、带宽影响,部署时间会有波动,CPU版本预计部署10分钟,GPU版本预计部署20分钟,部署完成方可正常使用。
安全组规则修改(可选)
- 安全组实际是网络流量访问策略,包括网络流量入方向规则和出方向规则,通过这些规则为安全组内具有相同保护需求并且相互信任的云服务器、云容器、云数据库等实例提供安全保护。
- 如果您的实例关联的安全组策略无法满足使用需求,比如需要添加、修改、删除某个TCP端口,请参考以下内容进行修改。
- 添加安全组规则:根据业务使用需求需要开放某个TCP端口,请参考添加安全组规则添加入方向规则,打开指定的TCP端口。
- 修改安全组规则:安全组规则设置不当会造成严重的安全隐患。您可以参考修改安全组规则,来修改安全组中不合理的规则,保证云服务器等实例的网络安全。
- 删除安全组规则:当安全组规则入方向、出方向源地址/目的地址有变化时,或者不需要开放某个端口时,您可以参考删除安全组规则进行安全组规则删除。
CPU版本页面
- 访问VibeVoice-CPU版本页面:打开浏览器输入地址:“http://公网IP:7860”,即可访问VibeVoice界面
图1 版本整体页面展示

- 点击上传音频,开始上传要转录的音频文件
图2 上传音频

- (可选)选择热词,增加转录的正确率
图3 添加热词

- 配置说明:界面左边有很多的参数配置,参考“表1 配置说明”根据自己的需求选择合适的配置。 表1 配置说明
参数名称
是否可选
参数描述
默认值
线程数
必填
推理使用的并行线程数,数值越大推理越快,但CPU占用率会越高,建议根据服务核心数进行选择。
4
模式
必填
有两种模式:offline模式和online模式。offline模式表示将转录的结果一次性输出(但是能够处理的音频受到内存的大小限制,16G内存只能处理30s内的音频文件)、online模式表示将转录的结果流式输出(由于底层会对处理的音频进行切片,因此可以处理时间更长的音频)。
offline
温度
必填
控制采样编码的随机性,值越高输出越多样的候选词,值越低输出的词越确定。
0.7
Top-p
必填
只从累计概率不超过该值的高概率候选词中采样,值越低候选范围越窄,输出越保守。
0.9
- 点击转写开始进行转写
图4 转写结果

- 选择好源语言和目标语言,点击翻译即可对转录的文本进行翻译
图5 翻译结果

GPU版本页面
- 访问VibeVoice-GPU版本页面:打开浏览器输入地址:“http://公网IP:7860”,即可访问VibeVoice-GPU界面
图1 GPU版本整体页面展示

- (可选)配置云端模型或者本地部署模型来获取翻译能力以及总结能力,这里配置的是华为云的Maas模型。
图2 配置云端模型

- 点击上传音频,开始上传要转录的音频文件
图3 点击上传“音频或视频”,开始上传要转录的音频或视频文件

- 配置说明:界面有很多的参数配置,参考“表1 配置说明”根据自己的需求选择合适的配置。 表1 配置说明
参数名称
是否可选
参数描述
默认值
最大生成Token数
必填
表示转录输出最多包含多少个token数,超过此数量模型会强制停止生成
32768
是否启用采样
必填
默认不采用时,采用贪心算法,每步选取概率最高的token,输出确定且稳定,但是长音频容易陷入重复循环无法终止。启用采样后,每步从概率分布中随机采样,引入多样性这样可以打破重复陷阱,但是同一音频多次转录的结果可能不同。
不启用
重复惩罚
必填
对已生成的token施加概率衰减,抑制模型重复输出相同的内容。重复惩罚越高,每生成一个token就会降低该token再次出现的概率,防止长音频转录时模型陷入重复循环无法终止的问题。
1
上下文信息
选填
用于向模型提供北京信息以提高转录正确率,模型转录时候会参考这些提示更准确的识别相关的词汇。
Empty
热词知识库
选填
配置热词库,方便一键加载
Empty
- 点击“开始转录”进行转录
图4 转录结果

- 点击“AI总结”查看总结信息
图5 查看AI总结信息

- 在指定好“源语言”和“目标语言”后,点击“翻译”对转录的文本进行翻译
图6 翻译结果
