Skip to content

episode length is too small after train 156k iterations #45

Description

@dbdxnuliba
Image **episode length is too small when train**

(hover) root@robot:~/rl/HOVER# ${ISAACLAB_PATH:?}/isaaclab.sh -p scripts/rsl_rl/train_teacher_policy.py --device cuda:0 --num_envs 2048 --headless --reference_motion_path third_party/human2humanoid/data/h1/amass_part.pkl --teacher_policy.project_name hover

here amass_part.pkl from ACCD dataset

################################################################################
Learning iteration 156025/10000000

                   Computation: 46045 steps/s (collection: 0.975s, learning 0.092s)
           Value function loss: 736518.8656
                Surrogate loss: -0.0096
         Mean action noise std: 8.40
                   Mean reward: 4006.23
                     Mean cost: 0.00
           Mean episode length: 42.41

Average_episode_length_for_reward_curriculum: 63.223576
Penalty_scale: 0.001403
Teleop_body_pos_upperbody_sigma: 0.030000
Mean episode Episode_Reward/reward_track_joint_positions: 2.2082
Mean episode Episode_Reward/reward_track_joint_velocities: 0.0048
Mean episode Episode_Reward/reward_track_body_velocities: 2.7732
Mean episode Episode_Reward/reward_track_body_angular_velocities: 1.1955
Mean episode Episode_Reward/reward_track_body_position_extended: 3.5211
Mean episode Episode_Reward/reward_track_body_position_vr_key_points: 2.0993
Mean episode Episode_Reward/penalize_torques: 531.4338
Mean episode Episode_Reward/penalize_by_torque_limits: 0.4039
Mean episode Episode_Reward/penalize_joint_accelerations: 7427.6616
Mean episode Episode_Reward/penalize_joint_velocities: 1.8734
Mean episode Episode_Reward/penalize_lower_body_action_changes: 6.6088
Mean episode Episode_Reward/penalize_upper_body_action_changes: 24.9249
Mean episode Episode_Reward/penalize_by_joint_pos_limits: 0.0000
Mean episode Episode_Reward/penalize_by_joint_velocity_limits: 0.0034
Mean episode Episode_Reward/penalize_early_termination: 0.0001
Mean episode Episode_Reward/penalize_feet_contact_forces: 1.0436
Mean episode Episode_Reward/penalize_stumble: 0.0000
Mean episode Episode_Reward/penalize_slippage: 0.0018
Mean episode Episode_Reward/penalize_feet_orientation: 0.0026
Mean episode Episode_Reward/penalize_feet_air_time: -0.0001
Mean episode Episode_Reward/penalize_both_feet_in_air: 0.0017
Mean episode Episode_Reward/penalize_orientation: 0.0001
Mean episode Episode_Reward/penalize_max_feet_height_before_contact: 0.0001
Mean episode Episode_Termination/base_contact: 36.7500
Mean episode Episode_Termination/time_out: 0.2500

               Total timesteps: 7668989952
                Iteration time: 1.07s
                    Total time: 166496.91s

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions