三种“精彩”,三套依据

先把三类片段拆开看,会发现它们的主要证据来自不同地方。

类型主要证据 时间尺度容易误判的地方
击杀类 击杀数、操作难度、技能衔接几秒到十几秒 数据漂亮但局势已定
翻盘类 比分或经济差的曲线反转、关键资源易手 几十秒到数分钟 单个片段里看不出反转
搞笑类 意外行为、物理异常、解说与观众的笑声 几秒 模型缺乏“幽默”的定义

击杀类靠密度,翻盘类靠趋势,搞笑类靠反差。三者的判断依据一个在“数”,一个在“线”,一个在“预期被打破”。

为什么一个模型通吃会出问题

设想一个只在击杀集锦上训练的模型,遇到翻盘场景会怎样?翻盘往往没有华丽操作,可能是一次防守到位、一波换血后的成功拖延。模型给这类画面打低分,翻盘就被漏掉。反过来,若为了兼顾翻盘而降低击杀权重,五杀又被埋没。

搞笑类的问题更隐蔽。所谓有趣,常常是“违反了游戏应有的样子”:角色被卡在场景里,载具倒着飞上天。要识别它,模型需要先知道“正常应该怎样”,再去发现偏离。这更接近异常检测,与击杀的“越多越强”并不同一逻辑。把它们放进同一个分数轴,其实是把三种不同量纲的东西硬加在一起。

共用底座 加 类型路由

更常见的做法不是各做一套完全独立的系统,而是分成两层。

共用底座负责提取所有类型都会用到的特征:画面的镜头运动与特效、音频的能量与语气、游戏事件流、局势状态。这一层不带偏好,只产出“这一刻发生了什么”。

类型路由与专用评分则在底座之上:先判断候选片段可能属于哪一类,交给相应的评分逻辑。击杀评分看事件密度与局势权重,翻盘评分需要回看更长的窗口去计算局势曲线,搞笑评分侧重异常事件与观众的即时反应。已有的一些研究,如利用直播观众信号检测英雄联盟高光的工作,就是把观众反应作为独立于操作数据的信号来源,说明多种信号并存、按需取用是合理的方向。

路由不必是硬分类。一个片段完全可以既是击杀又是翻盘,这时更稳的是软路由:让多个评分器都给分,再取最高,或按类型加权融合。

训练数据也要分开看

类型分开以后,评估也要分开。一个在击杀集锦上表现很好的模型,整体平均分不能说明它会不会漏掉翻盘。合理的做法是按类型各自准备一批人工标注的样本,分别统计漏检与误报,尤其关注样本少的类型,比如搞笑类,它本来就稀少,一旦整体指标里被击杀类淹没,问题就看不见了。

路由出错怎么办

  1. 类型判断错了:比如把翻盘的收尾当成普通击杀。对策是设置兜底,任一评分器给出极高分的片段,即使路由不匹配也保留进候选池。
  2. 新类型出现:换了一款游戏,出现前所未有的玩法。这时共用底座仍能提取特征,专用评分则需要补充规则,先用低置信度标记,交给人工确认。
  3. 用户偏好不同:同一批录像,做击杀集锦的用户和做搞笑合集的用户想要的完全不同。类型应当由用户来选,模型给出各类型的候选,而不是替用户决定风格。
说明:以下取舍属于通用工程思路,文中举例均为假设场景;金沙娱乐AI剪辑的类型选择功能以后续公布为准。

一个对局里的三种候选

假设一场四十分钟的对局,粗筛后有二十个候选。其中八个被路由到击杀类,四个到翻盘类,三个到搞笑类,另有五个多类型混合。用户只选“翻盘集锦”时,系统会把翻盘评分器排前的片段放在最前,同时把与之相邻的击杀片段作为情绪铺垫保留,而不是孤立地只取那四个。这种情况下,路由更像是给评分“换权重”,而非给片段贴标签,也和候选排序的整体流程相互衔接。

类型分清之后,真正的问题才开始:同一个精彩片段,怎样从横屏变成竖屏而不丢关键信息。