Papers
17
Total Citations
291
H-Index
7
About
Mingyu Ding is a researcher whose work spans computer vision, robotics, and embodied artificial intelligence, with particular expertise in scene understanding, autonomous systems, and generative models for robot planning. His early contributions focused on camera re-localization, exemplified by CamNet (2019, 138 citations), a coarse-to-fine retrieval framework that advanced the reliability of visual localization for robotics and autonomous driving applications. This work established his reputation in spatial perception and scene representation, further extended through NeRF-Loc, which applies transformer architectures to object localization within Neural Radiance Fields. More recently, Ding has emerged as a significant voice in embodied AI, introducing EmbodiedGPT (2023, 41 citations), a multimodal foundation model enabling robots to plan and execute long-horizon tasks through embodied chain-of-thought reasoning. His work on diffusion-based planning — including SkillDiffuser and AdaptDiffuser — explores hierarchical skill abstraction and self-evolving planners for offline reinforcement learning. The RoboTwin benchmark (2025) further demonstrates his commitment to scalable evaluation frameworks for dual-arm robotic manipulation. Complementing these efforts, his road surface reconstruction datasets directly address real-world autonomous driving safety. Across his body of work, Ding consistently bridges foundational perception research with practical robotics deployment.
Research Focus
Key Achievements
Top Papers
- 1CamNet: Coarse-to-Fine Retrieval for Camera Re-Localization138 citations · 2019
- 2EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought41 citations · 2023
- 3A road surface reconstruction dataset for autonomous driving29 citations · 2024
- 4
- 5RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins16 citations · 2025
- 6
- 7AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners8 citations · 2023
- 8
- 9
- 10