4 Commits

Author SHA1 Message Date
Arec Jamgochian
e0d205bbd7 updating experiment B vecenv 2022-02-28 21:44:10 -08:00
ebuehrle
910615cc00 Add best config from previous runs 2022-03-01 06:34:51 +01:00
ebuehrle
7a134d98c9 120 episodes per rolloout 2022-02-28 22:41:39 +01:00
ebuehrle
261e35eae8 More policy iterations per epoch 2022-02-28 22:39:28 +01:00
2 changed files with 42 additions and 9 deletions

View File

@@ -0,0 +1,33 @@
{
"experiment": "A",
"trainenv": {
"stop_on_collision": false,
"safe_actions_collision_method": "circle",
"abort_unsafe_collision_method": "circle"
},
"policy": {
"learning_rate": 0.0003,
"learning_rate_decay": 1.0,
"clip_ratio": 0.2,
"iterations_per_epoch": 500,
"hidden_layer_size": 40,
"n_hidden_layers": 3,
"activation": 0,
"option": 0
},
"value": {
"learning_rate": 0.001,
"iterations_per_epoch": 1000
},
"discriminator": {
"learning_rate": 0.001,
"weight_decay": 0.0001,
"iterations_per_epoch": 100,
"n_hidden_layers_element": 3,
"n_hidden_layers_global": 2,
"hidden_layer_size": 10,
"activation": 0
},
"train_epochs": 150,
"seed": 0
}

View File

@@ -62,7 +62,7 @@ def training_function(config):
), options=option_list[config['policy']['option']],
safe_actions_collision_method=config['trainenv']['safe_actions_collision_method'],
abort_unsafe_collision_method=config['trainenv']['abort_unsafe_collision_method'],
) for _ in range(60)]
) for _ in range(120)]
elif config['experiment'] == 'B':
envs = sum([[SafeOptionsEnv(Setobs(
@@ -78,7 +78,7 @@ def training_function(config):
), options=option_list[config['policy']['option']],
safe_actions_collision_method=config['trainenv']['safe_actions_collision_method'],
abort_unsafe_collision_method=config['trainenv']['abort_unsafe_collision_method'],
) for _ in range(15)] for track in range(4)],[])
) for _ in range(30)] for track in range(4)],[])
else:
raise NotImplementedError
@@ -142,7 +142,7 @@ def training_function(config):
v_opt=v_opt,
v_iters=config['value']['iterations_per_epoch'],
epochs=config['train_epochs'],
rollout_episodes=60,
rollout_episodes=120,
rollout_steps=60,
gamma=0.99,
gae_lambda=0.9,
@@ -185,11 +185,11 @@ if __name__ == '__main__':
'learning_rate': 3e-4,
'learning_rate_decay': 1.0,
'clip_ratio': 0.2,
'iterations_per_epoch': 100,
'hidden_layer_size': tune.grid_search([20, 40]),
'n_hidden_layers': tune.grid_search([2, 3]),
'iterations_per_epoch': tune.grid_search([250, 500, 750]),
'hidden_layer_size': 40, #tune.grid_search([20, 40]),
'n_hidden_layers': 3, #tune.grid_search([2, 3]),
'activation':0,
'option': tune.grid_search(list(range(len(option_list))))
'option': 0, #tune.grid_search(list(range(len(option_list))))
},
'value': {
'learning_rate': 1e-3,
@@ -199,8 +199,8 @@ if __name__ == '__main__':
'learning_rate': 1e-3,
'weight_decay': 1e-4,
'iterations_per_epoch': 100,
'n_hidden_layers_element': tune.grid_search([3,4]),
'n_hidden_layers_global': tune.grid_search([1,2]),
'n_hidden_layers_element': 3, #tune.grid_search([3,4]),
'n_hidden_layers_global': 2, #tune.grid_search([1,2]),
'hidden_layer_size': 10,
'activation': 0,
},