From 0a919d165e568ecf0ca2d45378f90c4b3166752d Mon Sep 17 00:00:00 2001 From: Ognjen Stefanovic Date: Fri, 27 Sep 2024 19:13:04 +0300 Subject: [PATCH] Fix typo in Q-value equation --- 2_reinforcement_learning/RL_tutorial.ipynb | 2 +- 2_reinforcement_learning/RL_tutorial_solution.ipynb | 2 +- 2 files changed, 2 insertions(+), 2 deletions(-) diff --git a/2_reinforcement_learning/RL_tutorial.ipynb b/2_reinforcement_learning/RL_tutorial.ipynb index ef868b2..c62de6b 100644 --- a/2_reinforcement_learning/RL_tutorial.ipynb +++ b/2_reinforcement_learning/RL_tutorial.ipynb @@ -622,7 +622,7 @@ "\n", "Now, if we have a path, we can, for any step t, define the value of the action $a_t$ in the state $s_t$:\n", "\n", - "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+1} + \\gamma^{k-t+i} V(s_{k+1})$$\n" + "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+i+1} + \\gamma^{k-t+1} V(s_{k+1})$$\n" ] }, { diff --git a/2_reinforcement_learning/RL_tutorial_solution.ipynb b/2_reinforcement_learning/RL_tutorial_solution.ipynb index 4e36fc4..0810127 100644 --- a/2_reinforcement_learning/RL_tutorial_solution.ipynb +++ b/2_reinforcement_learning/RL_tutorial_solution.ipynb @@ -685,7 +685,7 @@ "\n", "Now, if we have a path, we can, for any step t, define the value of the action $a_t$ in the state $s_t$:\n", "\n", - "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+1} + \\gamma^{k-t+i} V(s_{k+1})$$\n" + "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+i+1} + \\gamma^{k-t+1} V(s_{k+1})$$\n" ] }, {