SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
Paper ⢠2509.17664 ⢠Published ⢠4
None defined yet.
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs