AI LAB / EXPERIMENTAL FACILITY FUJIMOTO LAB ↗ LAB INDEX TEACHER
LAB 05 / ACT / REWARD

失敗から、覚える。

正解ルートは教えない。ごほうびと失敗を繰り返しながら、AIが自分で行動を選べるようになる過程を観察する。

ACTION / REWARD / Q-LEARNING
AI LAB / 2026
REWARDEXPLORE

迷路ロボットに、少し冒険させよう

いつもの道ばかり選ぶロボットは、近道を見つけにくいかもしれません。冒険度を10%と60%に変え、同じ迷路・同じ学習回数で比べてみよう。予想が外れたら、そこが発見の入り口なんだよ。

  1. 冒険度10%で学習
  2. 冒険度60%で学習
  3. 成功回数と歩数を比べる

なぜ?冒険を増やすと新しい道を試しやすくなる一方、よい道から外れることもあります。結果には偶然も入るので、一回だけで「必ずこちらがよい」とは決められません。

準備:ブラウザだけ・カメラ不要。自習のお試し約5分/小学校1コマ45分/中学校1コマ50分。入口に戻る / 実験へ進む ↓

← AI LAB

強化学習 迷路ラボ

正解を教えなくても、AIは「ごほうび」と「失敗」から道を覚えられる?

準備OK

強化学習とは?

ロボットは最初、ゴールへの道を知りません。自分で動き、ゴールではごほうび、落とし穴ではマイナスを受け取ります。何度も試すうちに、よい行動を覚えていきます。

「教科書の正解」ではなく、「行動した結果」から学ぶのが強化学習です。
1

迷路と冒険度を選ぼう

迷路

冒険度

冒険度30%なら、約30%の確率でランダムな方向へ進み、残りは今までに覚えた中で一番よさそうな方向へ進みます。
2

ロボットに学習させよう

まずは「1回ゆっくり学ぶ」を押すと、試行錯誤する様子を見られます。
3

学習のようすを観察しよう

🤖 ロボット 🏁 ゴール 🕳️ 落とし穴 高いごほうびの期待 紫の矢印=今のおすすめ方向
ゴールまでの歩数
10回ごとの平均歩数

線が下がるほど、少ない歩数でゴールできるようになっています。失敗した回は80歩として数えます。

1回でもらったごほうびの合計
10回ごとの平均ごほうび
学習を始めると、ここにAIの成長が表示されます。
4

考えてみよう

研究チャレンジ
① 冒険度10%、30%、60%で、100回後の成功率を比べよう。
② 落とし穴迷路で、短い危険な道と長い安全な道のどちらを覚えるか見よう。
③ 学習をリセットしても、毎回まったく同じ道を覚えるか確かめよう。
発展:Q学習の中身を見る

各マスで「上・右・下・左」のどれがよいかを表す数値をQ値といいます。行動するたびに、次の式で少しずつ更新しています。

新しいQ値 ← 今のQ値 + 学習率 ×(ごほうび + 未来の期待 − 今のQ値)

ゴールのごほうびが、少しずつ手前のマスへ伝わることで、ロボットは道を覚えます。

先生・保護者向け:教材上のポイント

本教材は表形式Q学習を使用しています。状態は7×7の位置、行動は上下左右、ごほうびは通常移動−0.1、壁への衝突−1、ゴール+10、落とし穴−8です。未知状態の探索にはε-greedy法を用い、学習率0.25、割引率0.92としています。