第一代剪辑器在哪里失手

设想一场已经四比零的对局(示意),对手早已放弃,我方在终局团战里打出五杀。按事件检测的逻辑,这是最高优先级的片段;按观众的感受,这是一段没有悬念的收尾。检测器看到的是数量,观众要的是意义。

这不是某个模型不够好,而是任务定义的问题。事件检测回答“哪里出现了击杀”,剧情理解要回答“这次击杀改变了什么”。五杀不一定值得剪,原因就在这里。

公开评测:模型看得懂什么

EgoEsportsQA 提供了一个可以核对的参照。它取自职业电竞比赛的第一人称视频,包含 1745 个问答,覆盖三款第一人称射击游戏;评测拆成两个维度:认知维度有11个子任务,电竞知识维度有6个子任务。

公开的结论有两点值得记住:

  • 表现最好的视频语言模型,准确率约为71.58%;
  • 模型更擅长基础视觉感知和宏观理解,在深层战术推理和细粒度微操上更弱。

换成剪辑语言:模型能认出“这是一次交火”,却不一定判断得出“这次绕后是整局的转折”。让它直接决定哪一段最精彩,风险恰恰落在最需要判断力的地方。

超长录像:合并镜头再评分

另一项工作 SVHighlights 面向长体育视频:320个视频,平均约2小时,合计约640小时,任务是长视频精彩片段检测。它提出免训练的 TF-SELECTOR:先把语义相近的镜头合并成片段,再交给多模态语言模型评分,结果优于视频时序定位基线。

对游戏录像的启发是结构上的。比赛录像里大量画面语义高度重复,逐帧或逐秒打分既昂贵又嘈杂,先合并成有意义的段落再评分,更接近人工剪辑先粗后细的习惯。需要注意,这项研究针对的是体育长视频,迁移到具体游戏时还要补充游戏状态信息,比如比分、资源、地图控制,这属于工程上的合理推断,并非论文结论。

剧情理解意味着多出哪些环节

把上述结论拼起来,一个合理的设计通常包含四步:

  1. 检测:用事件日志和画面找出候选点,追求召回而不是精度;
  2. 归段:把相邻候选并入同一叙事段,并向前补足铺垫,可参考事件前窗口的处理
  3. 解释:为每个候选写出“重要在哪里”,例如逆转、终结、关键判断;
  4. 复核:把解释和片段一起交给人确认。

第三步是新增的,也是模型最容易出错的一步,所以第四步不能省。公开数据里,Game-MUG 收集了英雄联盟直播的文本、音频和事件日志,Autohighlight 等工作利用众包信号做高光检测,说明观众反应和事件日志可以互相校验解释是否站得住。

金沙娱乐的取舍

以下是方向,不是产品实测结果。金沙娱乐AI在剪辑上的思路是把“解释”做成一等公民:每个候选片段都带一句理由,让创作者能快速判断,也方便在App里手动微调

一个仍然开放的问题是:当模型给出的理由与人的直觉不一致时,该以谁为准?在准确率还停留在七成量级的当下,答案大概只能是让人保留最后一票。