模型能够结合画面、声音和时序信息理解用户意图,例如利用视觉信息消除同音词歧义、识别手势和指代对象,并持续跟踪画面变化,在目标出现时主动提醒用户。
06/25 00:14
06/25 00:13
06/13 18:29
06/13 18:26
06/13 18:25
06/13 18:23
06/13 18:20
06/13 18:16