Upload 11 files

Files changed (3) hide show

README.md CHANGED Viewed

@@ -1,11 +1,10 @@
 ---
 tags:
 - LunarLander-v2
-- ppo
 - deep-reinforcement-learning
 - reinforcement-learning
-- custom-implementation
-- deep-rl-course
 model-index:
 - name: PPO
   results:
@@ -17,45 +16,22 @@ model-index:
       type: LunarLander-v2
     metrics:
     - type: mean_reward
-      value: -132.33 +/- 109.31
       name: mean_reward
       verified: false
 ---
-  # PPO Agent Playing LunarLander-v2
-  This is a trained model of a PPO agent playing LunarLander-v2.
-  # Hyperparameters
-  ```python
-  {'exp_name': 'ppo'
-'seed': 1
-'torch_deterministic': True
-'cuda': True
-'track': False
-'wandb_project_name': 'cleanRL'
-'wandb_entity': None
-'capture_video': False
-'env_id': 'LunarLander-v2'
-'total_timesteps': 50000
-'learning_rate': 0.00025
-'num_envs': 4
-'num_steps': 128
-'anneal_lr': True
-'gae': True
-'gamma': 0.99
-'gae_lambda': 0.95
-'num_minibatches': 4
-'update_epochs': 4
-'norm_adv': True
-'clip_coef': 0.2
-'clip_vloss': True
-'ent_coef': 0.01
-'vf_coef': 0.5
-'max_grad_norm': 0.5
-'target_kl': None
-'repo_id': 'Pandita-IA/ppo-LunarLander-v2'
-'batch_size': 512
-'minibatch_size': 128}
-  ```

 ---
+library_name: stable-baselines3
 tags:
 - LunarLander-v2
 - deep-reinforcement-learning
 - reinforcement-learning
+- stable-baselines3
 model-index:
 - name: PPO
   results:
       type: LunarLander-v2
     metrics:
     - type: mean_reward
+      value: 276.93 +/- 17.41
       name: mean_reward
       verified: false
 ---
+# **PPO** Agent playing **LunarLander-v2**
+This is a trained model of a **PPO** agent playing **LunarLander-v2**
+using the [stable-baselines3 library](https://github.com/DLR-RM/stable-baselines3).
+## Usage (with Stable-baselines3)
+TODO: Add your code
+```python
+from stable_baselines3 import ...
+from huggingface_sb3 import load_from_hub
+...
+```

replay.mp4 CHANGED Viewed

Binary files a/replay.mp4 and b/replay.mp4 differ

results.json CHANGED Viewed

	@@ -1 +1 @@
1	- {"~~env_id~~": ~~"LunarLander-v2"~~, "~~mean_reward~~": ~~-132~~.~~3282321866131~~, "~~std_reward~~": ~~109.3057635570201~~, "~~n_evaluation_episodes~~": 10, "eval_datetime": "2024-06-~~26T07~~:03:11.~~313173~~"}


1	+ {"mean_reward": 276.9320266870259, "std_reward": 17.406463605708343, "is_deterministic": true, "n_eval_episodes": 10, "eval_datetime": "2024-06-21T11:50:49.915166"}