Look Around and Pay Attention: Multi-camera Point Tracking Reimagined with Transformers
Paper • 2512.04213 • Published • 1
None defined yet.
Motion-o: Trajectory-Grounded Video Reasoning
HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models