XINRAN DUAN / 返回总览
EMNLP 2026 MAIN · FIRST AUTHOR

长视频不是更长的 caption,
而是一套可用的内容结构

业务需要把一部长视频转成带时间边界、情节或主题完整、跨章节一致的描述,才能继续做检索、热点分析与预测。

95.36 → 116.88同 Qwen 骨干,CIDEr +21.52
Top 15%EMNLP 2026 主会评审区间
Localize + Describe同时处理边界和高层章节描述

从业务需求反推模型问题

传统 DVC 关注局部事件;真正的长视频内容底座还必须回答三个问题:什么时候进入新阶段、当前章节究竟讲什么、前文哪些设定仍然重要。

01 / BOUNDARY

平滑转场难定位

视觉和措辞仍然连续,但预测依赖已经发生变化;只看相似度容易错过真正的主题切换。

02 / CONTEXT

长程语境会割裂

分段生成降低成本,却会丢失前文定义、人物关系或逻辑前提。

03 / PRODUCT

输出必须能消费

时间边界、章节粒度和描述一致性决定了下游是否能直接检索、统计与建模。

核心方法:从表面相关转向预测支持

CausalChapter 方法总览
LCDS 用相邻窗口间的依赖下降辅助定位章节边界;CSSE 通过移除候选历史片段,保留真正改变当前预测的上下文。
LCDS

找边界

遮蔽前一窗口的语义单元,观察后一窗口的重建变化;依赖骤降提示平滑转场。

CSSE

选上下文

移除候选历史章节,按当前描述变化量重新排序,而不是仅依赖语义相似。

INTERVENTION

准确口径

这里衡量的是预测层面的可观测影响,不宣称恢复真实世界因果结构。

Case:相似度会合并章节,依赖变化能找回真实结构

CausalChapter 章节边界与描述定性案例
论文定性案例:CausalChapter 的边界和描述更接近 Ground Truth;Chapter-Llama 将多个相邻概念合并为粗粒度章节。
现象

坐标系、位置函数、位移、速度在表面上高度相关,长上下文模型容易把它们合成少数大段。

我们的判断

相邻内容相似,不代表它们对后续预测的支持关系相同;依赖变化提供了额外边界信号。

业务价值

更细且稳定的内容单元,才方便下游定位某一情节、概念或热点的发生区间。

一句话讲法:我不是给视频生成一段更长的摘要,而是在构建一层可被下游系统直接消费的“时间化内容 API”。
下一项:任务冲突如何变成协同CurvSeg / ICLR 2026 →