YH Technologies at ActivityNet Challenge 2018
Ting Yao and Xue Li YH Technologies Co., Ltd, Beijing, China {tingyao.ustc,
Abstract
This notebook paper presents an overview and comparative analysis of our systems designed for the following five tasks in ActivityNet Challenge 2018: temporal action proposals, temporal action localization, dense-captioning events in videos, trimmed action recognition, and spatio-temporal action localization.
中文速览
视频中的行为理解涉及时序定位、空间定位、描述生成等多个子任务,现有方法往往各自为战、缺乏系统整合。研究团队针对ActivityNet 2018挑战赛的五项任务——时序动作候选生成、时序动作定位、视频密集描述、剪辑动作识别和时空动作定位——分别设计并整合了一套完整系统:核心思路是用多流特征(帧级、短片段、光流、音频)加P3D残差网络提取表示,再通过三阶段候选生成网络(粗粒度CPN→细粒度CAN→重排序PRN)产生高质量时序候选,后续各任务在此基础上叠加分类、字幕生成或时空管道追踪模块。实验结果显示,该系统在时序动作定位上达到34.22%的平均mAP,密集描述任务通过策略梯度优化与检索重排序进一步提升了METEOR指标,各任务均在挑战赛中取得有竞争力的成绩。这项工作的价值在于系统地验证了多线索融合与多阶段精化策略在复杂视频理解场景中的有效性,为后续研究提供了可复用的模块化框架。
原文 arXiv:1807.00686;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1807.00686v1