现有方法要么单轮推理(看一遍回答),要么解耦迭代(每轮独立,上下文不共享)。Video-o3 在一次统一推理中自然交替 Think → Tool → Answer,所有轮次共享 attention 上下文。
模型收到问题 + 全局视频后,判断是否需要更多证据。若需要,生成结构化指令(时间窗口 + token 配额),调用 VideoCrop 裁剪目标片段。裁剪结果注入对话,触发下一轮推理。循环直到证据充分,输出最终答案。
共享上下文带来注意力弥散:规划工具调用时被已裁剪片段干扰,回答时忽略精细证据产生"假装思考"。TDAM 在 SFT 阶段对 10% 数据施加掩码约束——找线索时屏蔽局部片段,回答时屏蔽全局概览。既训练专业能力,又保留联合推理灵活性。
RL 阶段用 VTGR 平衡探索覆盖与推理效率。奖励 = 答案正确 × (1 + 轨迹奖励) + 格式奖励。轨迹奖励包含 Hybrid Clue Score(定位精度)和 Turn Decay Factor(冗余轮次惩罚),激励模型精确定位并及时收手。
四步自动化管线:线索定位 → 有效性验证 → 轨迹生成 → 逻辑一致性检查。产出 173K 高质量工具交互轨迹,按证据基数和视觉显著性分为四个象限。
| 方法 | VideoMME | MLVU | LVBench | Video-Holmes |
|---|---|---|---|---|
| Qwen2.5-VL | 65.1 | 70.2 | 45.3 | 38.6 |
| VideoChat-R1 | 63.6 | 68.7 | 37.0 | 36.3 |
| LOVE-R1 | 65.6 | 69.9* | 44.0* | 43.9* |
| Video-Zoomer | 64.6* | 69.9* | 47.5 | 45.3* |
| Video-o3 (SFT+RL) | 66.5 | 72.1 | 47.6 | 46.5 |
推理效率:相比解耦方法,推理时间减少 46%(10.2s vs 18.9s),因为共享上下文复用 KV cache。
ICML 2026 7B 模型 SOTA 原生工具调用 RL 训练 多跳推理