Fix discriminator reward
Had wrong sign.
This commit is contained in:
@@ -135,9 +135,11 @@ class HLOptions(OptionsEnv):
|
||||
self.steps = 0
|
||||
|
||||
def _after_step(self):
|
||||
self.r += self.discount**self.steps * self.discriminator.discrim_net.discriminator(
|
||||
torch.tensor(self.s).unsqueeze(0).to(self.discriminator.discrim_net.device()),
|
||||
torch.tensor([[self.a]]).to(self.discriminator.discrim_net.device()),
|
||||
self.r += self.discount**self.steps * self.discriminator.discrim_net.reward_train(
|
||||
state=torch.tensor(self.s).unsqueeze(0).to(self.discriminator.discrim_net.device()),
|
||||
action=torch.tensor([[self.a]]).to(self.discriminator.discrim_net.device()),
|
||||
next_state=torch.tensor(self.s).unsqueeze(0).to(self.discriminator.discrim_net.device()), # unused
|
||||
done=torch.tensor(self.done).unsqueeze(0).to(self.discriminator.discrim_net.device()), # unused
|
||||
)
|
||||
self.steps += 1
|
||||
|
||||
|
||||
Reference in New Issue
Block a user