PERCEPTION开放获取
理解视觉与语言信息并与人类和环境交互的机器智能
Van Quang Nguyen
2026
摘要
本文提出GRIT和LTMI等新型架构,改进图像描述、视觉对话和交互指令跟随等视觉-语言任务。通过整合网格与区域特征及轻量级注意力机制,提升了推理精度与速度。
关键词
image captioningvisual dialoginstruction followingtransformervision-language
相关论文
PERCEPTION
开放获取📊 4 引用
如何缓解越野环境中语义分割的分布偏移
Ji-Hoon Hwang, Daeyoung Kim, Hyung-Suk Yoon 等 5 位作者
2026
PERCEPTION
📊 0 引用
基于原型模糊推理与证据融合的不确定性引导工业机器人可进化识别框架
Yanrun Zhou, Zihao Lei, Guangrui Wen 等 7 位作者
Robotics and Computer-Integrated Manufacturing · 2026
PERCEPTION
📊 0 引用
基于点云配准的非破坏性高分辨率涂层厚度三维扫描测量
Simon Duenser, Ivo Aschwanden, Raamadaas Krishnadas 等 5 位作者
Robotics and Computer-Integrated Manufacturing · 2026
PERCEPTION
📊 0 引用
迈向智能机器人时代:用于高级感知系统的多模态柔性触觉传感器
Sili Ding, Feng Xu, Jie Chen 等 6 位作者
Progress in Materials Science · 2026