
由麻省理工学院(MIT)、哈佛大学和华盛顿大学的研究人员开发的强化学习方法使用了非专家用户的众包反馈来训练机器人。
麻省理工学院的Marcel Torne表示,使用人工引导探索(HuGE)方法,“奖励功能引导代理人进行探索,而不是告诉它完成任务的准确步骤。”
研究人员将这个过程分为两个部分,使用一个目标选择算法不断更新,其中使用众包人类反馈,另一个算法使得人工智能代理能够自我监督地进行探索,受目标选择器的指导。
在模拟和现实世界的测试中,HuGE使代理人能够比其他方法更快地完成目标。来自MIT新闻查看完整文章
摘要版权 © 2023 SmithBucklin ,华盛顿特区,美国 