INNER CODE UNIT · Python
target
rasbt/machine-learning-book · ch19/cartpole/main.py:85
target = r + self.gamma * pred.max()
target_all = self.model(torch.tensor(s, dtype=torch.float32))[0]
target_all[a] = target
batch_states.append(s.flatten())
batch_targets.append(target_all)
self._adjust_epsilon()
self.optimizer.zero_grad()
pred = self.model(torch.tensor(batch_states, dtype=torch.float32))
loss = self.loss_fn(pred, torch.stack(batch_targets))
loss.backward()
self.optimizer.step()
return loss.item()