diff --git a/2_reinforcement_learning/RL_tutorial.ipynb b/2_reinforcement_learning/RL_tutorial.ipynb index ef868b2..c62de6b 100644 --- a/2_reinforcement_learning/RL_tutorial.ipynb +++ b/2_reinforcement_learning/RL_tutorial.ipynb @@ -622,7 +622,7 @@ "\n", "Now, if we have a path, we can, for any step t, define the value of the action $a_t$ in the state $s_t$:\n", "\n", - "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+1} + \\gamma^{k-t+i} V(s_{k+1})$$\n" + "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+i+1} + \\gamma^{k-t+1} V(s_{k+1})$$\n" ] }, { diff --git a/2_reinforcement_learning/RL_tutorial_solution.ipynb b/2_reinforcement_learning/RL_tutorial_solution.ipynb index 4e36fc4..0810127 100644 --- a/2_reinforcement_learning/RL_tutorial_solution.ipynb +++ b/2_reinforcement_learning/RL_tutorial_solution.ipynb @@ -685,7 +685,7 @@ "\n", "Now, if we have a path, we can, for any step t, define the value of the action $a_t$ in the state $s_t$:\n", "\n", - "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+1} + \\gamma^{k-t+i} V(s_{k+1})$$\n" + "$$Q_t(s_t, a_t) = \\sum_{i=0}^{k-t} \\gamma^i r_{t+i+1} + \\gamma^{k-t+1} V(s_{k+1})$$\n" ] }, {