Memento
Similarity-gated visual memory and persistent-query retrieval for proactive ultra-long streaming video.
Similarity-gated visual memory and persistent-query retrieval for proactive ultra-long streaming video.
Hierarchical external event memory and agentic on-demand retrieval for streaming video reasoning.
Causal ViT activation reuse and pre-LLM visual token pruning for faster streaming Video-LLMs.
Temporal-order instruction tuning and uncertainty-gated historical KV retrieval for streaming Video-LLMs.
Training-inference aligned real-time understanding for effectively infinite video streams.
A recent-frame baseline for streaming video understanding.
Multi-grained KV-cache compression for long streaming VideoQA.
A model note on Qwen3-VL: long-context vision-language modeling, video understanding, and multimodal agent ability.
Video-aware Graph Retrieval-Augmented Generation via Temporal and Semantic Hybrid Reasoning.
Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding.