当前位置: 首页 » 资讯 » 新科技 » 正文

从“看不懂”到“可编辑”:AVA-Encoder如何破解AI电影创作难题?

IP属地 中国·北京 编辑:大力财经 头部财经 时间:2026-09-18 00:24:09

当AI能够编写代码、绘制图像甚至生成视频时,一个疑问随之浮现:为何它仍无法创作一部像样的电影?答案并非技术不足,而是电影这一艺术形式本身,从未为机器的“理解”方式而设计。导演、摄影师与剪辑师通过数十年经验编织出的叙事网络,将画面、声音、剧情与镜头语言紧密交织,但这些隐藏在成片背后的逻辑,对AI而言如同无字天书。

阿里巴巴通义千问团队提出了一项名为AVA-Encoder的系统,试图在电影与AI之间架起一座桥梁。其核心目标是将电影转化为机器可读、可编辑、可再生的结构化知识图谱,同时确保关键信息不流失。这一过程面临多重挑战:传统方法或依赖像素级底层视觉表示,或压缩信息为线性文字流,或仅记录稀疏语义事实,均无法同时满足“理解”与“生成”的双重需求。

研究团队提出以“重建”作为检验标准:若系统能将结构化表示还原为与原片高度相似的视频,则证明其保留了完整信息。为此,他们设计了“电影知识图谱”,将故事、事件、镜头、角色等信息组织为带明确类型的节点与边,并将图片、音频等多媒体资产单独存储于关联层。例如,一个镜头的“角色状态”记录表情与动作,“镜头语言状态”记录推拉摇移,“音频状态”记录对话与背景音乐,所有节点均以结构化文本呈现,便于AI直接处理。

为将视频内容填入图谱,系统采用三级理解流程:全局理解先提取整体故事脉络与反复出现的角色、场景,建立“注册表”统一命名;镜头理解结合全局信息分析单个镜头;关键帧理解则聚焦静态画面细节。这种“先整体后局部”的设计显著提升重建准确率——实验显示,分层理解使准确率从单层处理的27.5%跃升至45.8%,提升幅度达66.5%。

系统还引入“双环文本梯度优化”机制实现自我进化。外环通过伪训练积累通用编码策略,内环针对具体视频精修图谱内容,两者分工避免“通用经验”与“个案调整”相互干扰。为确保修改有效性,系统采用QA问答验证机制,将视频拆解为30个具体是非题(如“角色是否微笑”),通过答对率量化重建质量。“防遗忘门”与“防退化门”分别防止系统学习新内容时丢失旧经验,或为修正错误而破坏原有正确信息。

实验数据显示,AVA-Encoder在四个评测维度上的总体得分达49.0%,较最强基准方法提升20.7个百分点。尤其在关键帧对比中,得分从39.5%跃升至73.7%,表明系统对角色长相、场景布局等细节的还原能力大幅提升。更值得注意的是,其自动生成的编码策略在效率与效果上均超越人类专家:人工调优需3万余token提示词,而AI策略仅用8千余token,且得分更高。

电影知识图谱的应用潜力不止于重建。研究团队演示了角色置换与视觉风格修改场景:替换角色形象或调整画面风格时,系统可自动定位所有相关镜头与关键帧,实现“改一处、动全局”的精准编辑。这种能力源于图谱中预设的“受影响子图”传播规则,通过物料闭包、语义一致性检查与层级更新三步,确保改动既完整传播又不引发连锁失控。

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。