首页 /研究 /LeAct:从专家行动中学习推理
LEARNING

LeAct:从专家行动中学习推理

Ziran Yang, Chengshuai Shi, Raj Ghugare, Benjamin Eysenbach, Karthik Narasimhan, Chi Jin

发表年份
2026
访问权限
开放获取

摘要

该论文提出LeAct方法,从专家系统(如游戏引擎、规划器)的沉默行动中恢复自然语言推理链,以提升学生模型的泛化能力。实验表明,该方法在多个不完全信息游戏和模拟机器人基准上显著优于基线,接近求解器的数值下限。

关键词

reasoningexpert systemschain-of-thoughtlatent variablereinforcement learning

相关论文

查看 LEARNING 分类全部论文