Press "Enter" to skip to content

“众包反馈帮助训练机器人” (Zhòngbāo fǎnkuì bāngzhù xùnliàn jīqìrén)

这种新方法可以异步地收集反馈意见,让全世界的非专家用户能够为教育机器人做出贡献。 ¶ 归属: Christine Daniloff, MIT/iStock

由麻省理工学院(MIT)、哈佛大学和华盛顿大学的研究人员开发的强化学习方法使用了非专家用户的众包反馈来训练机器人。

麻省理工学院的Marcel Torne表示,使用人工引导探索(HuGE)方法,“奖励功能引导代理人进行探索,而不是告诉它完成任务的准确步骤。”

研究人员将这个过程分为两个部分,使用一个目标选择算法不断更新,其中使用众包人类反馈,另一个算法使得人工智能代理能够自我监督地进行探索,受目标选择器的指导。

在模拟和现实世界的测试中,HuGE使代理人能够比其他方法更快地完成目标。来自MIT新闻查看完整文章

摘要版权 © 2023 SmithBucklin ,华盛顿特区,美国 “众包反馈帮助训练机器人” (Zhòngbāo fǎnkuì bāngzhù xùnliàn jīqìrén) 四海 第2张

Leave a Reply

Your email address will not be published. Required fields are marked *