強化学習 迷路ラボ
正解を教えなくても、AIは「ごほうび」と「失敗」から道を覚えられる?
準備OK
強化学習とは?
ロボットは最初、ゴールへの道を知りません。自分で動き、ゴールではごほうび、落とし穴ではマイナスを受け取ります。何度も試すうちに、よい行動を覚えていきます。
「教科書の正解」ではなく、「行動した結果」から学ぶのが強化学習です。
1
迷路と冒険度を選ぼう
迷路
冒険度
冒険度30%なら、約30%の確率でランダムな方向へ進み、残りは今までに覚えた中で一番よさそうな方向へ進みます。
2
ロボットに学習させよう
まずは「1回ゆっくり学ぶ」を押すと、試行錯誤する様子を見られます。
3
学習のようすを観察しよう
🤖 ロボット
🏁 ゴール
🕳️ 落とし穴
高いごほうびの期待
紫の矢印=今のおすすめ方向
ゴールまでの歩数
10回ごとの平均歩数
線が下がるほど、少ない歩数でゴールできるようになっています。失敗した回は80歩として数えます。
1回でもらったごほうびの合計
10回ごとの平均ごほうび
4
考えてみよう
研究チャレンジ
① 冒険度10%、30%、60%で、100回後の成功率を比べよう。
② 落とし穴迷路で、短い危険な道と長い安全な道のどちらを覚えるか見よう。
③ 学習をリセットしても、毎回まったく同じ道を覚えるか確かめよう。
① 冒険度10%、30%、60%で、100回後の成功率を比べよう。
② 落とし穴迷路で、短い危険な道と長い安全な道のどちらを覚えるか見よう。
③ 学習をリセットしても、毎回まったく同じ道を覚えるか確かめよう。
発展:Q学習の中身を見る
各マスで「上・右・下・左」のどれがよいかを表す数値をQ値といいます。行動するたびに、次の式で少しずつ更新しています。
新しいQ値 ← 今のQ値 + 学習率 ×(ごほうび + 未来の期待 − 今のQ値)ゴールのごほうびが、少しずつ手前のマスへ伝わることで、ロボットは道を覚えます。
先生・保護者向け:教材上のポイント
本教材は表形式Q学習を使用しています。状態は7×7の位置、行動は上下左右、ごほうびは通常移動−0.1、壁への衝突−1、ゴール+10、落とし穴−8です。未知状態の探索にはε-greedy法を用い、学習率0.25、割引率0.92としています。