开发者可以在低代码智能体编排页面设置是否允许用户在扣子商店通过语音或视频与智能体实时沟通,并可设置音色和默认输入方式。
在智能客服、智能穿戴、语音陪伴等音视频场景中,为智能体开启音视频通话功能并合理设置音色,可显著提升其交互的丰富性和生动性,使沟通更加直观、高效。同时,合适的音色能赋予智能体更具亲和力、专业性或个性化的语音表达,从而增强用户对智能体的好感度和信任感,更好地满足用户在不同场景下的多样化需求,进一步优化用户与智能体之间的交互体验。
开启了语音通话和视频通话的智能体,发布至扣子商店等渠道后,将支持用户通过语音、视频、或共享屏幕的方式与其交互,用户可体验到如图所示的音视频通话效果。
语音通话

视频通话

共享屏幕

说明
注意
试听多情感音色时,扣子编程将按照文字转语音的字符数收费,费用详细说明请参见音视频费用。

| 参数 | 说明 |
|---|---|
| 情感 | 情感参数用于指定智能体音色的情感类型,例如开心、悲伤等。你可以从下拉列表中选择该音色对应的情感。不同音色支持的情感范围不同。 |
|
情感值 |
情感值用于量化情感的强度。数值越高,情感表达越强烈,例如: “开心” 的情绪值 5 比 1 更显兴奋。 取值范围:1.0~5.0,默认值:4.0。 |
说明
开启视频通话时,智能体或工作流需要选择支持图片理解的模型,例如豆包·视觉理解·Pro 模型。
设置入口

设置后的效果

| 参数 | 说明 |
|---|---|
|
每秒抽帧数 |
在视频通话过程中,摄像头或屏幕共享捕捉画面的频率。捕捉到的画面会作为视觉模型的输入,帮助智能体理解用户的动作和行为。抽帧数越高,智能体能够获取的画面信息越丰富,从而更准确地理解用户的意图和行为,但会增加 Token 消耗。 默认值为 |
|
开始说话前抽取秒数 |
在用户开始说话之前,抽取指定秒数的画面,能够帮助智能体提前了解用户在说话前的动作状态,从而更全面地理解用户的意图与行为。 单位为秒,默认值为 |
设置入口

设置后的效果


开启了语音通话或视频通话的智能体,发布扣子商店后,如果默认输入方式是打字输入或语音输入,你可以在智能体右上角单击通话按钮,选择语音通话、视频通话或屏幕共享。如果默认输入方式为语音通话或视频通话,打开智能体并接听后,即可通过语音或视频方式与智能体交互。


