南京大学团队曾于2019年发布COIN数据集,包含近12万段教学视频,旨在检验人工智能理解人类行为的能力。时隔七年,这一领域出现新趋势:视频理解模型性能显著提升,但应对不同类型问题时仍存在明显短板。同一模型在处理动作识别、未来预测、流程归纳等多样化任务时,往往因能力需求差异导致效果下降。
当前主流方案将多任务训练数据混合输入模型,期望其自动区分任务类型。这种思路借鉴自大语言模型的发展经验,但存在根本缺陷:模型内部处理不同任务时使用完全相同的参数。以Transformer解码器中的前馈神经网络为例,无论用户询问当前动作还是后续步骤,答案都需经过同一套参数计算。这如同要求全科医生同时精通所有专科领域,既难以深入掌握单项技能,又可能因不同科室诊断逻辑冲突导致判断失误,学术界将这种现象称为"负迁移"。
混合专家模型(MoE)曾被视为解决方案,其通过动态激活不同参数组应对输入内容。自2017年谷歌提出稀疏门控MoE以来,该技术已衍生出Switch Transformer、GShard等变体,并在视觉领域催生V-MoE等架构。但传统MoE存在关键局限:其路由决策基于词元或图像块级别,而非完整任务。在视频理解场景中,这种碎片化处理会破坏任务连贯性,实验显示词元级路由模型的五项任务平均准确率仅61.4%,甚至低于不使用路由的密集模型。
针对上述问题,研究团队提出任务专家混合架构(MoTE)。该架构将解码器中的共享前馈网络拆分为一个通用专家和多个任务专家,每个视频-提示词样本整体通过固定专家路径处理。以COIN数据集为例,模型设置识别当前步骤、预测下一步、识别整体任务等五个专家,配合处理基础视觉变换的共享专家。训练时直接利用任务标签作为路由依据,无需额外设计门控机制。
共享专家的设计颇具巧思。其承担所有任务共需的基础视觉语言转换功能,相当于医院分诊台的基础检查项目。任务专家则专注特定逻辑,如预测流程需理解时间因果链,而动作识别仅需分析单帧画面。这种分工避免重复训练通用能力,使专家参数更高效。实验表明,完整复制预训练模型参数的专家比神经元切分版本准确率高2.6个百分点,验证了完整参数初始化的必要性。
面对真实场景中缺乏任务标签的情况,研究团队开发出基于提示词匹配的路由机制。每个专家配备自然语言描述,系统通过计算用户输入与描述的余弦相似度确定专家路径。使用2270万参数的文本编码器,该机制在五种任务意图识别中达到100%准确率,单次匹配耗时仅4.35毫秒。不过研究者承认,当前评测未覆盖模糊或组合型提问场景。
参数效率是MoTE的显著优势。以1B参数量的Llama-3.2为基座,添加五个任务专家后总参数量增至5.3B,但单样本实际激活参数仅约2.0B。这种设计使计算量随任务增加保持稳定,如同图书馆藏书量增长不影响单次借阅负担。实验数据显示,MoTE模型在COIN任务上取得62.9%的平均准确率,超越8B参数量基线模型,同时将计算量降低70%,推理延迟缩短36%。
模块化设计赋予系统灵活扩展能力。新增任务专家时,仅需训练该专家参数而冻结其他部分,已训练任务准确率不受影响。实验验证,依次添加四个专家过程中,首个训练的"步骤识别"准确率始终稳定在63.1%。不过这种冻结训练方式会导致整体性能比联合训练低1.9个百分点,反映出稳定性与灵活性的权衡关系。
为验证架构普适性,研究团队将MoTE迁移至文档理解领域。在GLM-OCR模型基础上添加关键信息抽取专家后,新模型在SROIE数据集上准确率提升32.86个百分点,CORD数据集上更暴涨75.72个百分点,且原有OCR功能未受影响。这表明"共享骨干+任务专家"的设计原则可扩展至图像文档等不同模态。
当前方法仍存在局限性。任务边界模糊或复合型提问会降低提示词路由效果,扩展新任务时的冻结训练机制也限制了整体性能。研究团队建议未来探索允许共享部分有限更新的机制,以平衡稳定性与灵活性需求。这些发现为多任务视频理解提供了新思路,其模块化设计或将成为下一代智能系统的关键组件。





京公网安备 11011402013531号