扫地机器人强化学习教程——第一章 项目背景与快速入门

第一章 项目背景与快速入门

本章目标

完本章,你将知道强化学习在解决什么问题,能够区分它与监督学习,理解扫地机器人为什么适合用强化学习,并在 Windows 上运行第一个二维网格强化学习程序。

本章内容

强化学习(Reinforcement Learning,RL)是一类通过智能体与环境交互,并根据奖励信号学习决策策略的方法。其训练数据不是预先标注的样本,而是智能体执行动作后得到的状态变化和奖励结果。在扫地机器人项目中,移动、避障、清扫和回充均可通过该交互机制建模。
本项目以一个二维室内地图为舞台。机器人从充电桩附近出发,在障碍物、道路和污渍之间移动。项目目标不是编写大量“遇到什么情况就如何转弯”的规则,而是设计可反复训练的环境和反馈机制,使机器人逐步形成更优的清扫策略。后续章节将把这一思路扩展为完整工程:读取地图、构造状态和动作、设计奖励、训练 PPO 模型、评估模型并与开悟平台接口对接。

posted @ 2026-08-04 19:23  song__1218  阅读(12)  评论(0)    收藏  举报