当我们看一部悬疑电影时,我们的大脑是在什么时候开始推理事件的真相的呢?通常我们不会等到电影放映结束、别人提问时才开始思考,而是在每一个镜头闪过时,就在潜意识里梳理逻辑、猜测凶手。
然而,目前的视频大模型(VideoLLMs)却显得有些“反应迟钝”。它们要么是只顾着看(流式感知),缺乏深度思考;要么是等提问来了,才开始漫长的思维链(Chain-of-Thought, CoT)推理,导致用户等得心急火燎。为了打破这个僵局,来自华中科技大学和小米公司的研究团队提出了一种全新的范式:Video Streaming Thinking(视频流式思考,简称 VST)。
它模仿人类的认知过程,在视频流输入的过程中同步激活逻辑推理流,将沉重的推理计算分摊到视频播放的每一刻。这样一来,当用户提问时,模型已经“胸有成竹”,能够实现极速响应。

- 论文地址: https://arxiv.org/abs/2603.12262
- 项目主页: https://1ranguan.github.io/VST/
- 代码仓库: https://github.com/1ranGuan/VST
- 录用机构: 华中科技大学、小米公司 MiLM Plus
为什么我们需要“边看边思考”?
在实时交互、具身智能等场景下,视频理解模型面临着严苛的挑战:既要看得深(逻辑推理),又要回得快(实时响应)。
以往的在线视频模型(如图 1b 所示)大多专注于如何更有效地压缩视觉特征,虽然速度快,但缺乏显式的分析推理。而借鉴自大语言模型的测试时缩放(Test-time Scaling)技术,虽然能通过 CoT 显著提升性能(如图 1c),但提问后的重度计算会导致巨大的延迟。
![图 1:基准测试结果与范式对比。VST 在保持低延迟的同时,在在线和离线视频理解基准测试中均表现强劲。]()
图 1:基准测试结果与范式对比。VST 在保持低延迟的同时,在在线和离线视频理解基准测试中均表现强劲。
VST 的核心思想非常直观:既然提问后的推理太慢,那我们就把推理提前。 通过在视频流输入期间间歇性地生成“流式思考”(Streaming Thoughts),VST 成功地将推理成本“消解”在了视频播放的过程中。
VST 的技术内幕:双记忆系统与两阶段训练
1. 核心架构:双记忆系统
VST 采用了一种双记忆系统来处理无限长度的视频流,其核心在于将视觉动态转化为语义理解:
- 短期视觉缓存(Short-term Native Visual Memory):保留当前窗口内的原始视觉特征,确保感知的细腻度。
- 长期文本语义记忆(Long-term Textual Semantic Memory):通过 LLM 将过去发生的事件压缩成文本形式的中间思考,并以先进先出(FIFO)的策略进行更新。
![图 2:VST 流水线示意图。模型利用流式思考机制将视觉动态压缩为长期文本记忆。]()
图 2:VST 流水线示意图。模型利用流式思考机制将视觉动态压缩为长期文本记忆。
在每一个时间步 ,模型的输入(Input)是当前的视频片段 和累积的文本记忆 。 模型的输出(Output)则是一个流式思考 ,它总结了当前片段的精华并更新到记忆中。当用户查询 到来时,模型结合最新的视觉缓存和完整的文本记忆,直接给出答案。
![image.png]()
这种设计不仅分摊了计算量,还保证了逻辑的连贯性,让模型在“看”的过程中始终保持着对历史剧情的深刻理解。
2. 训练流水线:从模仿到自我进化
为了让模型学会这种“边看边想”的本领,团队设计了两阶段的后训练方案:
- VST-SFT(监督微调):这是打基础的阶段。团队引入了特殊的流式注意力掩码(Streaming Attention Mask),强制模型在训练时只能看到当前的视觉窗口和历史文本记忆。这就像是给模型戴上了“因果护目镜”,确保它在训练时就养成不依赖未来信息的习惯。
- VST-RL(强化学习):这是进阶阶段。采用 GRPO 算法,在多轮交互环境中进行端到端优化。模型通过自我探索生成思考路径,并根据最终答案的正确性获得奖励。这种“结果导向”的训练让模型生成的中间思考越来越具有启发性。
![图 3:训练流水线概览。(a) VST-SFT 应用流式掩码;(b) VST-RL 通过代理循环进行策略优化。]()
图 3:训练流水线概览。(a) VST-SFT 应用流式掩码;(b) VST-RL 通过代理循环进行策略优化。
3. 数据合成:基于知识图谱的自动化工厂
高质量的流式推理数据非常稀缺。研究团队开发了一套基于知识图谱(Knowledge Graph)的合成流程:先提取视频中的实体和关系构建图谱,再采样多跳证据链,最后利用强力的离线模型(如 Gemini)生成带有“流式思考”的问答对。最终,团队合成了 100K 组高质量样本,解决在线推理数据匮乏的问题。
![图 4:流式思考 QA 数据策划流程。]()
图 4:流式思考 QA 数据策划流程。
实验结果:性能与速度的双重飞跃
研究人员在多个主流榜单上对 VST 进行了严苛的测试。
1. 刷新在线理解纪录
在 StreamingBench 实时理解任务中,VST-7B 取得了 79.5% 的优异成绩,不仅刷新了开源在线模型的纪录,甚至超越了 GPT-4o (73.3%) 和 Gemini 1.5 Pro (75.7%) 等顶尖商业模型。
![表 1:StreamingBench 实时理解任务对比。]()
表 1:StreamingBench 实时理解任务对比。
而在 OVO-Bench 上,VST-7B 同样表现出色,尤其是在考察长程记忆的 Backward Tracing 任务中,其性能提升非常显著,证明了文本记忆系统在处理长视频时的优越性。
![表 2:OVO-Bench 上的对比结果。]()
表 2:OVO-Bench 上的对比结果。
2. 极速响应:告别“转圈圈”
最能体现 VST 价值的是延迟数据。在 VideoHolmes 榜单的测试中,VST-7B 的 QA 响应延迟仅为 0.56s。相比之下,同样具备推理能力的 Video-R1 w/ CoT 需要等待 8.80s。这意味着 VST 在提供深度思考的同时,几乎做到了“秒回”,响应速度提升了 15.7 倍。
![表 6:推理延迟对比。VST 在保持低延迟的同时实现了强大的推理能力。]()
表 6:推理延迟对比。VST 在保持低延迟的同时实现了强大的推理能力。
很有意思的一点是,这种范式在不同规模的模型上都表现出了极佳的普适性。从 3B 到 32B,加入 VST 机制后,模型的性能均得到了稳定提升。
![表 5:不同基础模型规模下的消融研究。]()
表 5:不同基础模型规模下的消融研究。
3. 案例分析:更稳健的逻辑
在图 6 的案例中,我们可以清晰地看到 VST 的优势。面对一个关于“模糊脸男子出现规律”的复杂问题,基准模型 Video-R1 因为需要在提问后回顾长视频,容易产生幻觉;而 VST 因为在观看过程中就记录了时间戳和关键事件,能够准确推导出正确答案,且延迟极低。
![图 6:VideoHolmes 案例研究。VST-7B 能够准确捕捉时间线上的细微线索。]()
图 6:VideoHolmes 案例研究。VST-7B 能够准确捕捉时间线上的细微线索。
写在最后
通过将推理成本分摊到视频流的每一个片段,VST 在“深度思考”与“实时响应”之间进行了有成效的探索。目前 VST 的代码已经开源,支持多种规模模型。对于关注实时视频交互、智能监控或机器人视觉的开发者来说,这无疑是一个值得尝试的基座。
入群加好友(v:xiao-ma-baoli),请备注你感兴趣的技术方向