8月6日,豆包正式宣布,视频通话功能升级,接入原生音视频全双工大模型SeedRealtime。 据介绍,SeedRealtime大模型支持音视频联合理解,能够识别对话对象,判断应该聆听、什么时候进行回复或是保…
豆包介绍称,该模型上线后,豆包视频通话可以在连续变化的真实场景中实现更自然的连续交互,边看、边听、边说,所有用户均可体验。
在多人聚会场景中,模型能够识别不同人物身份并持续对应发言者;帮助外国游客实时理解中文菜单和服务员介绍;在博物馆中持续观察镜头画面,识别指定文物后主动提醒;辅助用户操作咖啡机并根据画面变化实时纠错;阅读论文时…
模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16