LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget Paper • 2607.14952 • Published 9 days ago • 197
UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics Paper • 2606.15890 • Published Jun 14 • 1
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios Paper • 2511.18011 • Published Nov 22, 2025 • 1
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks Paper • 2606.09669 • Published Jun 8 • 47
Imagination Helps Visual Reasoning, But Not Yet in Latent Space Paper • 2602.22766 • Published Feb 26 • 45
AgenticDataBench: A Comprehensive Benchmark for Data Agents Paper • 2607.01647 • Published 23 days ago • 37
WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory Paper • 2607.02517 • Published 23 days ago • 33
Program-as-Weights: A Programming Paradigm for Fuzzy Functions Paper • 2607.02512 • Published 23 days ago • 125
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios Paper • 2511.18011 • Published Nov 22, 2025 • 1