diff --git a/.gitattributes b/.gitattributes index eff0c36ad4833921ae913e85670f4af0e89bfd7c..dac41830ec2b3d328e8ff2a4b20a2fce83074c27 100644 --- a/.gitattributes +++ b/.gitattributes @@ -286,3 +286,4 @@ factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor: factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed12/episode_metrics.jsonl filter=lfs diff=lfs merge=lfs -text factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed10/episode_metrics.jsonl filter=lfs diff=lfs merge=lfs -text factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed11/episode_metrics.jsonl filter=lfs diff=lfs merge=lfs -text +factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/episode_metrics.jsonl filter=lfs diff=lfs merge=lfs -text diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/best_000048564_24864768_reward_1967.617.pth b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/best_000048564_24864768_reward_1967.617.pth new file mode 100644 index 0000000000000000000000000000000000000000..be15db0606a7e8b20257583956c107e028f1850f --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/best_000048564_24864768_reward_1967.617.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3638bfd9a6ad5c3439f6a35358c28a65f8306835715491c14de117861d5362b5 +size 42707820 diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000028152_14413824.pth b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000028152_14413824.pth new file mode 100644 index 0000000000000000000000000000000000000000..e2b0e5b095db762e19b3ac3e44dc01e0869a4dbc --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000028152_14413824.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:97bf25f1617adae5c1e12da3723fa555d1e36fec30df0dec897e535c946b16c2 +size 42708258 diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000035248_18046976.pth b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000035248_18046976.pth new file mode 100644 index 0000000000000000000000000000000000000000..4dc5c6300b58e478734ddfa5ad5e754e5bdd3cd9 --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000035248_18046976.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:b2ddef1858d940edc6856dd837dba0478982d344dca9afcab6a19be4ba3984ed +size 42708258 diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000041632_21315584.pth b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000041632_21315584.pth new file mode 100644 index 0000000000000000000000000000000000000000..af382bda29003eaaa0cb79496b27cf737b4184c0 --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000041632_21315584.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:566d924a5ba63e6017a84800bedfc9d17201b2d0279a94c6c8814b8fbf94fa31 +size 42708258 diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000047808_24477696.pth b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000047808_24477696.pth new file mode 100644 index 0000000000000000000000000000000000000000..8db1c72d0654f0e6f9d3812506ef912bf08bda8e --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000047808_24477696.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:7b71994e80525ebb7eeef3f43cf3a73d1fd9fcdb42d37cb2bb5be695f6274bec +size 42708258 diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000048840_25006080.pth b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000048840_25006080.pth new file mode 100644 index 0000000000000000000000000000000000000000..a5cfc140daae2fc97fb7dd53b9e298aaa90fb9ec --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/checkpoint_p0/checkpoint_000048840_25006080.pth @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:5191257da4631110d2bedea4568a9bdc5e0f1a02d772743eab817cef11e815c0 +size 42708258 diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/config.json b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/config.json new file mode 100644 index 0000000000000000000000000000000000000000..6aabbd823e86f9dba907fe19eccdce1fd7a55e27 --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/config.json @@ -0,0 +1,263 @@ +{ + "help": false, + "algo": "APPO", + "env": "doom_deadly_corridor", + "experiment": "deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14", + "train_dir": "results/checkpoints_factor_sweeps/deadly_corridor/context_window", + "restart_behavior": "resume", + "device": "gpu", + "seed": 14, + "num_policies": 1, + "async_rl": true, + "serial_mode": false, + "batched_sampling": false, + "num_batches_to_accumulate": 2, + "worker_num_splits": 2, + "policy_workers_per_policy": 1, + "max_policy_lag": 1000, + "num_workers": 32, + "num_envs_per_worker": 4, + "batch_size": 1024, + "num_batches_per_epoch": 2, + "num_epochs": 2, + "rollout": 128, + "recurrence": 128, + "shuffle_minibatches": false, + "gamma": 0.99, + "reward_scale": 1.0, + "reward_clip": 1000.0, + "value_bootstrap": false, + "normalize_returns": true, + "exploration_loss_coeff": 0.001, + "value_loss_coeff": 0.5, + "kl_loss_coeff": 0.0, + "exploration_loss": "symmetric_kl", + "gae_lambda": 0.95, + "ppo_clip_ratio": 0.1, + "ppo_clip_value": 0.2, + "with_vtrace": false, + "vtrace_rho": 1.0, + "vtrace_c": 1.0, + "optimizer": "adam", + "adam_eps": 1e-06, + "adam_beta1": 0.9, + "adam_beta2": 0.999, + "max_grad_norm": 4.0, + "learning_rate": 0.0001, + "lr_schedule": "constant", + "lr_schedule_kl_threshold": 0.008, + "lr_adaptive_min": 1e-06, + "lr_adaptive_max": 0.01, + "obs_subtract_mean": 0.0, + "obs_scale": 255.0, + "normalize_input": true, + "normalize_input_keys": null, + "decorrelate_experience_max_seconds": 0, + "decorrelate_envs_on_one_worker": true, + "actor_worker_gpus": [], + "set_workers_cpu_affinity": true, + "force_envs_single_thread": false, + "default_niceness": 0, + "log_to_file": true, + "experiment_summaries_interval": 1, + "flush_summaries_interval": 30, + "stats_avg": 100, + "summaries_use_frameskip": true, + "heartbeat_interval": 20, + "heartbeat_reporting_interval": 600, + "train_for_env_steps": 25000000, + "train_for_seconds": 10000000000, + "save_every_sec": 600, + "keep_checkpoints": 5, + "load_checkpoint_kind": "latest", + "save_milestones_sec": -1, + "save_best_every_sec": 5, + "save_best_metric": "reward", + "save_best_after": 100000, + "benchmark": false, + "encoder_mlp_layers": [ + 512, + 512 + ], + "encoder_conv_architecture": "convnet_simple", + "encoder_conv_mlp_layers": [ + 512 + ], + "use_rnn": true, + "rnn_size": 512, + "rnn_type": "gru", + "rnn_num_layers": 1, + "decoder_mlp_layers": [], + "nonlinearity": "elu", + "policy_initialization": "orthogonal", + "policy_init_gain": 1.0, + "actor_critic_share_weights": true, + "adaptive_stddev": true, + "continuous_tanh_scale": 0.0, + "initial_stddev": 1.0, + "use_env_info_cache": false, + "env_gpu_actions": false, + "env_gpu_observations": true, + "env_frameskip": 1, + "env_framestack": 1, + "pixel_format": "CHW", + "use_record_episode_statistics": false, + "with_wandb": true, + "wandb_user": null, + "wandb_project": "latency-sensitive-bench", + "wandb_group": "deadly-corridor-fs16-uniform_u2_6", + "wandb_job_type": "sample_factory", + "wandb_tags": [ + "factor_sweep", + "deadly-corridor", + "frame_stack", + "uniform", + "uniform_u2_6", + "fs16", + "seed14" + ], + "with_pbt": false, + "pbt_mix_policies_in_one_env": true, + "pbt_period_env_steps": 5000000, + "pbt_start_mutation": 20000000, + "pbt_replace_fraction": 0.3, + "pbt_mutation_rate": 0.15, + "pbt_replace_reward_gap": 0.1, + "pbt_replace_reward_gap_absolute": 1e-06, + "pbt_optimize_gamma": false, + "pbt_target_objective": "true_objective", + "pbt_perturb_min": 1.1, + "pbt_perturb_max": 1.5, + "fps": 35, + "eval_env_frameskip": 1, + "no_render": false, + "save_video": false, + "video_frames": 1000000000.0, + "video_name": null, + "max_num_frames": 1000000000.0, + "max_num_episodes": 1000000000.0, + "push_to_hub": false, + "hf_repository": null, + "policy_index": 0, + "eval_deterministic": true, + "train_script": null, + "enjoy_script": null, + "num_agents": -1, + "num_humans": 0, + "num_bots": -1, + "start_bot_difficulty": null, + "timelimit": null, + "res_w": 128, + "res_h": 72, + "wide_aspect_ratio": false, + "record_to": null, + "mode": "train", + "env_fps": 35.0, + "obs_fps": 8.75, + "latency_type": "uniform_distribution", + "fixed_latency_ms": null, + "mean_latency_ms": null, + "std_latency_ms": null, + "min_latency_ms": 57.142857142857146, + "max_latency_ms": 171.42857142857144, + "latency_seed": 14, + "add_latency_info": false, + "max_pending_actions": null, + "hold_policy": "hold", + "ordering_policy": "latest_ready", + "eval_episodes": 100, + "eval_parallel_envs": 32, + "eval_latency_raw_frame_values": "0,1,2,3,4,5,10,15,40", + "eval_max_steps": 30000, + "eval_raw_reward": true, + "disable_reward_scaling": true, + "frame_stack": 16, + "max_episode_steps": 0, + "simulator": "cpu", + "envpool_batch_size": 1, + "episode_metrics_path": "results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/episode_metrics.jsonl", + "vizdoom_init_max_parallel": 10, + "vizdoom_init_lock_timeout_sec": 5.0, + "vizdoom_init_lock_max_wait_sec": 60.0, + "vizdoom_init_retry_jitter_sec": 0.25, + "command_line": "--mode train --algo APPO --env doom_deadly_corridor --experiment deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14 --train_dir results/checkpoints_factor_sweeps/deadly_corridor/context_window --restart_behavior resume --device gpu --seed 14 --episode_metrics_path results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/episode_metrics.jsonl --train_for_env_steps 25000000 --num_workers 32 --num_envs_per_worker 4 --num_policies 1 --batch_size 1024 --rollout 128 --recurrence 128 --num_epochs 2 --num_batches_per_epoch 2 --worker_num_splits 2 --learning_rate 0.0001 --gamma 0.99 --gae_lambda 0.95 --ppo_clip_ratio 0.1 --ppo_clip_value 0.2 --exploration_loss symmetric_kl --exploration_loss_coeff 0.001 --value_loss_coeff 0.5 --max_grad_norm 4.0 --rnn_type gru --rnn_size 512 --save_every_sec 600 --keep_checkpoints 5 --stats_avg 100 --experiment_summaries_interval 1 --async_rl True --use_rnn True --normalize_returns True --normalize_input True --latency-type uniform_distribution --min-latency-ms 57.142857142857146 --max-latency-ms 171.42857142857144 --latency-seed 14 --add-latency-info False --eval-episodes 100 --eval-parallel-envs 32 --eval-max-steps 30000 --eval-deterministic True --eval-raw-reward --with_wandb True --wandb_project latency-sensitive-bench --wandb_group deadly-corridor-fs16-uniform_u2_6 --wandb_job_type sample_factory --wandb_tags factor_sweep deadly-corridor frame_stack uniform uniform_u2_6 fs16 seed14 --env-fps 35 --obs-fps 8.75 --res_w 128 --res_h 72 --wide_aspect_ratio False --frame_stack 16 --simulator cpu --disable-reward-scaling True --hold-policy hold --ordering-policy latest_ready", + "cli_args": { + "algo": "APPO", + "env": "doom_deadly_corridor", + "experiment": "deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14", + "train_dir": "results/checkpoints_factor_sweeps/deadly_corridor/context_window", + "restart_behavior": "resume", + "device": "gpu", + "seed": 14, + "num_policies": 1, + "async_rl": true, + "worker_num_splits": 2, + "num_workers": 32, + "num_envs_per_worker": 4, + "batch_size": 1024, + "num_batches_per_epoch": 2, + "num_epochs": 2, + "rollout": 128, + "recurrence": 128, + "gamma": 0.99, + "normalize_returns": true, + "exploration_loss_coeff": 0.001, + "value_loss_coeff": 0.5, + "exploration_loss": "symmetric_kl", + "gae_lambda": 0.95, + "ppo_clip_ratio": 0.1, + "ppo_clip_value": 0.2, + "max_grad_norm": 4.0, + "learning_rate": 0.0001, + "normalize_input": true, + "experiment_summaries_interval": 1, + "stats_avg": 100, + "train_for_env_steps": 25000000, + "save_every_sec": 600, + "keep_checkpoints": 5, + "use_rnn": true, + "rnn_size": 512, + "rnn_type": "gru", + "with_wandb": true, + "wandb_project": "latency-sensitive-bench", + "wandb_group": "deadly-corridor-fs16-uniform_u2_6", + "wandb_job_type": "sample_factory", + "wandb_tags": [ + "factor_sweep", + "deadly-corridor", + "frame_stack", + "uniform", + "uniform_u2_6", + "fs16", + "seed14" + ], + "eval_deterministic": true, + "res_w": 128, + "res_h": 72, + "wide_aspect_ratio": false, + "mode": "train", + "env_fps": 35.0, + "obs_fps": 8.75, + "latency_type": "uniform_distribution", + "min_latency_ms": 57.142857142857146, + "max_latency_ms": 171.42857142857144, + "latency_seed": 14, + "add_latency_info": false, + "hold_policy": "hold", + "ordering_policy": "latest_ready", + "eval_episodes": 100, + "eval_parallel_envs": 32, + "eval_max_steps": 30000, + "eval_raw_reward": true, + "disable_reward_scaling": true, + "frame_stack": 16, + "simulator": "cpu", + "episode_metrics_path": "results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/episode_metrics.jsonl", + "env_frameskip": 1, + "eval_env_frameskip": 1 + }, + "git_hash": "eb3a2e1efbd2aa03a60d7f44f5e18d8fdd0f5a2d", + "git_repo_name": "git@github.com:ZihanWang314/latency-sensitive-bench.git", + "output_dir": "outputs/factor_sweeps/deadly_corridor/context_window/train/frame_stack/uniform_u2_6/fs16/seed_14", + "wandb_unique_id": "deadly-corridor-fs16-uniform_u2_6-s14" +} \ No newline at end of file diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/episode_metrics.jsonl b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/episode_metrics.jsonl new file mode 100644 index 0000000000000000000000000000000000000000..be3bac887a3d62b64ea9f826d0de5b84a7f4a52c --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/episode_metrics.jsonl @@ -0,0 +1,3 @@ +version https://git-lfs.github.com/spec/v1 +oid sha256:3cc058640eddb2aaba9e64c1f89da903dc273dcbdc4b88209fc54ed574624454 +size 159218913 diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/git.diff b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/git.diff new file mode 100644 index 0000000000000000000000000000000000000000..29108e5b29266817ecd22d4ca51bcbe8f6aaa23b --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/git.diff @@ -0,0 +1,7 @@ +diff --git a/starVLA b/starVLA +index ab3380d..9d8c567 160000 +--- a/starVLA ++++ b/starVLA +@@ -1 +1 @@ +-Subproject commit ab3380dfbd1de9649c15d154cc41b97788674537 ++Subproject commit 9d8c567188a3aa2a825296016cf17f3977101d8f diff --git a/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/sf_log.txt b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/sf_log.txt new file mode 100644 index 0000000000000000000000000000000000000000..4e4c2ee2d22b5b7e86c6f38ad428acc43653d98d --- /dev/null +++ b/factor_sweeps/deadly_corridor/context_window/train/factor_sweep:deadly_corridor:frame_stack:uniform_u2_6:fs16:obs8p75:stride4:seed14/sf_log.txt @@ -0,0 +1,7815 @@ +[2026-06-06 23:58:58,403][343476] Saving configuration to results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/config.json... +[2026-06-06 23:58:58,470][343476] Rollout worker 0 uses device cpu +[2026-06-06 23:58:58,472][343476] Rollout worker 1 uses device cpu +[2026-06-06 23:58:58,473][343476] Rollout worker 2 uses device cpu +[2026-06-06 23:58:58,473][343476] Rollout worker 3 uses device cpu +[2026-06-06 23:58:58,474][343476] Rollout worker 4 uses device cpu +[2026-06-06 23:58:58,474][343476] Rollout worker 5 uses device cpu +[2026-06-06 23:58:58,474][343476] Rollout worker 6 uses device cpu +[2026-06-06 23:58:58,475][343476] Rollout worker 7 uses device cpu +[2026-06-06 23:58:58,475][343476] Rollout worker 8 uses device cpu +[2026-06-06 23:58:58,475][343476] Rollout worker 9 uses device cpu +[2026-06-06 23:58:58,475][343476] Rollout worker 10 uses device cpu +[2026-06-06 23:58:58,476][343476] Rollout worker 11 uses device cpu +[2026-06-06 23:58:58,476][343476] Rollout worker 12 uses device cpu +[2026-06-06 23:58:58,477][343476] Rollout worker 13 uses device cpu +[2026-06-06 23:58:58,477][343476] Rollout worker 14 uses device cpu +[2026-06-06 23:58:58,477][343476] Rollout worker 15 uses device cpu +[2026-06-06 23:58:58,477][343476] Rollout worker 16 uses device cpu +[2026-06-06 23:58:58,478][343476] Rollout worker 17 uses device cpu +[2026-06-06 23:58:58,478][343476] Rollout worker 18 uses device cpu +[2026-06-06 23:58:58,478][343476] Rollout worker 19 uses device cpu +[2026-06-06 23:58:58,478][343476] Rollout worker 20 uses device cpu +[2026-06-06 23:58:58,479][343476] Rollout worker 21 uses device cpu +[2026-06-06 23:58:58,479][343476] Rollout worker 22 uses device cpu +[2026-06-06 23:58:58,480][343476] Rollout worker 23 uses device cpu +[2026-06-06 23:58:58,480][343476] Rollout worker 24 uses device cpu +[2026-06-06 23:58:58,480][343476] Rollout worker 25 uses device cpu +[2026-06-06 23:58:58,481][343476] Rollout worker 26 uses device cpu +[2026-06-06 23:58:58,481][343476] Rollout worker 27 uses device cpu +[2026-06-06 23:58:58,481][343476] Rollout worker 28 uses device cpu +[2026-06-06 23:58:58,482][343476] Rollout worker 29 uses device cpu +[2026-06-06 23:58:58,482][343476] Rollout worker 30 uses device cpu +[2026-06-06 23:58:58,482][343476] Rollout worker 31 uses device cpu +[2026-06-06 23:59:06,490][343476] Using GPUs [0] for process 0 (actually maps to GPUs [0]) +[2026-06-06 23:59:06,491][343476] InferenceWorker_p0-w0: min num requests: 10 +[2026-06-06 23:59:06,907][343476] Starting all processes... +[2026-06-06 23:59:06,907][343476] Starting process learner_proc0 +[2026-06-06 23:59:09,048][343476] Starting all processes... +[2026-06-06 23:59:09,058][343476] Starting process inference_proc0-0 +[2026-06-06 23:59:09,059][343476] Starting process rollout_proc0 +[2026-06-06 23:59:09,059][343476] Starting process rollout_proc1 +[2026-06-06 23:59:09,074][344304] Using GPUs [0] for process 0 (actually maps to GPUs [0]) +[2026-06-06 23:59:09,075][344304] Set environment var CUDA_VISIBLE_DEVICES to '0' (GPU indices [0]) for learning process 0 +[2026-06-06 23:59:09,060][343476] Starting process rollout_proc2 +[2026-06-06 23:59:09,061][343476] Starting process rollout_proc3 +[2026-06-06 23:59:09,061][343476] Starting process rollout_proc4 +[2026-06-06 23:59:09,071][343476] Starting process rollout_proc5 +[2026-06-06 23:59:09,072][343476] Starting process rollout_proc6 +[2026-06-06 23:59:09,073][343476] Starting process rollout_proc7 +[2026-06-06 23:59:09,074][343476] Starting process rollout_proc8 +[2026-06-06 23:59:09,076][343476] Starting process rollout_proc9 +[2026-06-06 23:59:09,077][343476] Starting process rollout_proc10 +[2026-06-06 23:59:09,096][343476] Starting process rollout_proc11 +[2026-06-06 23:59:09,096][343476] Starting process rollout_proc12 +[2026-06-06 23:59:09,100][343476] Starting process rollout_proc13 +[2026-06-06 23:59:09,101][343476] Starting process rollout_proc14 +[2026-06-06 23:59:09,284][344304] Num visible devices: 1 +[2026-06-06 23:59:09,286][344304] Setting fixed seed 14 +[2026-06-06 23:59:09,290][344304] Using GPUs [0] for process 0 (actually maps to GPUs [0]) +[2026-06-06 23:59:09,290][344304] Initializing actor-critic model on device cuda:0 +[2026-06-06 23:59:09,291][344304] RunningMeanStd input shape: (48, 72, 128) +[2026-06-06 23:59:09,341][344304] RunningMeanStd input shape: (1,) +[2026-06-06 23:59:09,361][344304] ConvEncoder: input_channels=48 +[2026-06-06 23:59:09,469][344304] Conv encoder output size: 512 +[2026-06-06 23:59:09,469][344304] Policy head output size: 512 +[2026-06-06 23:59:09,480][344304] Created Actor Critic model with architecture: +[2026-06-06 23:59:09,481][344304] ActorCriticSharedWeights( + (obs_normalizer): ObservationNormalizer( + (running_mean_std): RunningMeanStdDictInPlace( + (running_mean_std): ModuleDict( + (obs): RunningMeanStdInPlace() + ) + ) + ) + (returns_normalizer): RecursiveScriptModule(original_name=RunningMeanStdInPlace) + (encoder): VizdoomEncoder( + (basic_encoder): ConvEncoder( + (enc): RecursiveScriptModule( + original_name=ConvEncoderImpl + (conv_head): RecursiveScriptModule( + original_name=Sequential + (0): RecursiveScriptModule(original_name=Conv2d) + (1): RecursiveScriptModule(original_name=ELU) + (2): RecursiveScriptModule(original_name=Conv2d) + (3): RecursiveScriptModule(original_name=ELU) + (4): RecursiveScriptModule(original_name=Conv2d) + (5): RecursiveScriptModule(original_name=ELU) + ) + (mlp_layers): RecursiveScriptModule( + original_name=Sequential + (0): RecursiveScriptModule(original_name=Linear) + (1): RecursiveScriptModule(original_name=ELU) + ) + ) + ) + ) + (core): ModelCoreRNN( + (core): GRU(512, 512) + ) + (decoder): MlpDecoder( + (mlp): Identity() + ) + (critic_linear): Linear(in_features=512, out_features=1, bias=True) + (action_parameterization): ActionParameterizationDefault( + (distribution_linear): Linear(in_features=512, out_features=11, bias=True) + ) +) +[2026-06-06 23:59:09,891][344304] Using optimizer +[2026-06-06 23:59:11,320][343476] Starting process rollout_proc15 +[2026-06-06 23:59:11,322][344387] Using GPUs [0] for process 0 (actually maps to GPUs [0]) +[2026-06-06 23:59:11,322][344387] Set environment var CUDA_VISIBLE_DEVICES to '0' (GPU indices [0]) for inference process 0 +[2026-06-06 23:59:11,331][343476] Starting process rollout_proc16 +[2026-06-06 23:59:11,332][344389] Worker 0 uses CPU cores [0, 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11] +[2026-06-06 23:59:11,527][343476] Starting process rollout_proc17 +[2026-06-06 23:59:11,529][344398] Worker 9 uses CPU cores [108, 109, 110, 111, 112, 113, 114, 115, 116, 117, 118, 119] +[2026-06-06 23:59:11,534][344387] Num visible devices: 1 +[2026-06-06 23:59:11,660][343476] Starting process rollout_proc18 +[2026-06-06 23:59:11,662][344388] Worker 1 uses CPU cores [12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 23] +[2026-06-06 23:59:11,703][343476] Starting process rollout_proc19 +[2026-06-06 23:59:11,706][344396] Worker 6 uses CPU cores [72, 73, 74, 75, 76, 77, 78, 79, 80, 81, 82, 83] +[2026-06-06 23:59:11,720][343476] Starting process rollout_proc20 +[2026-06-06 23:59:11,721][344395] Worker 7 uses CPU cores [84, 85, 86, 87, 88, 89, 90, 91, 92, 93, 94, 95] +[2026-06-06 23:59:11,787][343476] Starting process rollout_proc21 +[2026-06-06 23:59:11,788][344399] Worker 10 uses CPU cores [120, 121, 122, 123, 124, 125, 126, 127, 128, 129, 130, 131] +[2026-06-06 23:59:11,797][344401] Worker 14 uses CPU cores [168, 169, 170, 171, 172, 173, 174, 175, 176, 177, 178, 179] +[2026-06-06 23:59:11,799][343476] Starting process rollout_proc22 +[2026-06-06 23:59:11,805][344394] Worker 5 uses CPU cores [60, 61, 62, 63, 64, 65, 66, 67, 68, 69, 70, 71] +[2026-06-06 23:59:11,803][343476] Starting process rollout_proc23 +[2026-06-06 23:59:11,855][343476] Starting process rollout_proc24 +[2026-06-06 23:59:11,857][344393] Worker 3 uses CPU cores [36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47] +[2026-06-06 23:59:11,879][343476] Starting process rollout_proc25 +[2026-06-06 23:59:11,881][344403] Worker 12 uses CPU cores [144, 145, 146, 147, 148, 149, 150, 151, 152, 153, 154, 155] +[2026-06-06 23:59:11,892][344397] Worker 4 uses CPU cores [48, 49, 50, 51, 52, 53, 54, 55, 56, 57, 58, 59] +[2026-06-06 23:59:11,894][343476] Starting process rollout_proc26 +[2026-06-06 23:59:11,925][343476] Starting process rollout_proc27 +[2026-06-06 23:59:11,928][344390] Worker 2 uses CPU cores [24, 25, 26, 27, 28, 29, 30, 31, 32, 33, 34, 35] +[2026-06-06 23:59:11,927][343476] Starting process rollout_proc28 +[2026-06-06 23:59:11,929][344402] Worker 13 uses CPU cores [156, 157, 158, 159, 160, 161, 162, 163, 164, 165, 166, 167] +[2026-06-06 23:59:11,997][343476] Starting process rollout_proc29 +[2026-06-06 23:59:11,999][344400] Worker 11 uses CPU cores [132, 133, 134, 135, 136, 137, 138, 139, 140, 141, 142, 143] +[2026-06-06 23:59:12,076][344304] No checkpoints found +[2026-06-06 23:59:12,077][344304] Did not load from checkpoint, starting from scratch! +[2026-06-06 23:59:12,077][344304] Initialized policy 0 weights for model version 0 +[2026-06-06 23:59:12,080][344304] LearnerWorker_p0 finished initialization! +[2026-06-06 23:59:12,081][344304] Using GPUs [0] for process 0 (actually maps to GPUs [0]) +[2026-06-06 23:59:12,084][343476] Starting process rollout_proc30 +[2026-06-06 23:59:12,087][344392] Worker 8 uses CPU cores [96, 97, 98, 99, 100, 101, 102, 103, 104, 105, 106, 107] +[2026-06-06 23:59:12,402][344387] RunningMeanStd input shape: (48, 72, 128) +[2026-06-06 23:59:12,442][344387] RunningMeanStd input shape: (1,) +[2026-06-06 23:59:12,461][344387] ConvEncoder: input_channels=48 +[2026-06-06 23:59:12,604][344387] Conv encoder output size: 512 +[2026-06-06 23:59:12,605][344387] Policy head output size: 512 +[2026-06-06 23:59:13,585][343476] Starting process rollout_proc31 +[2026-06-06 23:59:13,587][345415] Worker 15 uses CPU cores [180, 181, 182, 183, 184, 185, 186, 187, 188, 189, 190, 191] +[2026-06-06 23:59:13,736][345416] Worker 16 uses CPU cores [192, 193, 194, 195, 196, 197, 198, 199, 200, 201, 202, 203] +[2026-06-06 23:59:13,789][345418] Worker 17 uses CPU cores [204, 205, 206, 207, 208, 209, 210, 211, 212, 213, 214, 215] +[2026-06-06 23:59:14,033][345421] Worker 20 uses CPU cores [240, 241, 242, 243, 244, 245, 246, 247, 248, 249, 250, 251] +[2026-06-06 23:59:14,055][345463] Worker 26 uses CPU cores [312, 313, 314, 315, 316, 317, 318, 319, 320, 321, 322, 323] +[2026-06-06 23:59:14,172][345419] Worker 18 uses CPU cores [216, 217, 218, 219, 220, 221, 222, 223, 224, 225, 226, 227] +[2026-06-06 23:59:14,222][345425] Worker 24 uses CPU cores [288, 289, 290, 291, 292, 293, 294, 295, 296, 297, 298, 299] +[2026-06-06 23:59:14,259][345424] Worker 23 uses CPU cores [276, 277, 278, 279, 280, 281, 282, 283, 284, 285, 286, 287] +[2026-06-06 23:59:14,365][345426] Worker 25 uses CPU cores [300, 301, 302, 303, 304, 305, 306, 307, 308, 309, 310, 311] +[2026-06-06 23:59:14,380][345554] Worker 27 uses CPU cores [324, 325, 326, 327, 328, 329, 330, 331, 332, 333, 334, 335] +[2026-06-06 23:59:14,384][345557] Worker 30 uses CPU cores [360, 361, 362, 363, 364, 365, 366, 367, 368, 369, 370, 371] +[2026-06-06 23:59:14,388][345555] Worker 28 uses CPU cores [336, 337, 338, 339, 340, 341, 342, 343, 344, 345, 346, 347] +[2026-06-06 23:59:14,467][345556] Worker 29 uses CPU cores [348, 349, 350, 351, 352, 353, 354, 355, 356, 357, 358, 359] +[2026-06-06 23:59:14,507][345422] Worker 21 uses CPU cores [252, 253, 254, 255, 256, 257, 258, 259, 260, 261, 262, 263] +[2026-06-06 23:59:14,574][345420] Worker 19 uses CPU cores [228, 229, 230, 231, 232, 233, 234, 235, 236, 237, 238, 239] +[2026-06-06 23:59:14,603][345423] Worker 22 uses CPU cores [264, 265, 266, 267, 268, 269, 270, 271, 272, 273, 274, 275] +[2026-06-06 23:59:15,762][346442] Worker 31 uses CPU cores [372, 373, 374, 375, 376, 377, 378, 379, 380, 381, 382, 383] +[2026-06-06 23:59:15,767][343476] Inference worker 0-0 is ready! +[2026-06-06 23:59:15,768][343476] All inference workers are ready! Signal rollout workers to start! +[2026-06-06 23:59:15,771][343476] Fps is (10 sec: nan, 60 sec: nan, 300 sec: nan). Total num frames: 0. Throughput: 0: nan. Samples: 0. Policy #0 lag: (min: -1.0, avg: -1.0, max: -1.0) +[2026-06-06 23:59:15,773][343476] Fps is (10 sec: 0.0, 60 sec: 0.0, 300 sec: 0.0). Total num frames: 0. Throughput: 0: 0.0. Samples: 0. Policy #0 lag: (min: -1.0, avg: -1.0, max: -1.0) +[2026-06-06 23:59:15,797][346442] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,804][344398] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,809][345426] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,813][345415] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,816][345424] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,816][345423] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,817][345425] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,817][344393] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,818][344402] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,819][344392] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,819][344399] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,820][344397] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,821][345422] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,822][345554] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,823][345418] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,824][345555] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,825][345463] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,826][344388] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,826][344395] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,826][344400] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,826][344396] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,826][344390] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,827][345557] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,827][344401] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,827][344394] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,827][345420] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,828][344389] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,828][345556] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,828][345421] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,828][345419] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,829][345416] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:15,830][344403] Doom resolution: 160x120, resize resolution: (128, 72) +[2026-06-06 23:59:16,646][346442] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,737][344393] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,830][345415] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,833][345420] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,841][345424] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,853][345556] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,856][345463] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,858][345423] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,857][345554] Decorrelating experience for 0 frames... +[2026-06-06 23:59:16,941][344392] Decorrelating experience for 0 frames... +[2026-06-06 23:59:17,009][344403] Decorrelating experience for 0 frames... +[2026-06-06 23:59:17,128][344400] Decorrelating experience for 0 frames... +[2026-06-06 23:59:17,432][344393] Decorrelating experience for 128 frames... +[2026-06-06 23:59:17,619][345424] Decorrelating experience for 128 frames... +[2026-06-06 23:59:17,627][345556] Decorrelating experience for 128 frames... +[2026-06-06 23:59:17,631][345418] Decorrelating experience for 0 frames... +[2026-06-06 23:59:17,653][344399] Decorrelating experience for 0 frames... +[2026-06-06 23:59:17,653][345415] Decorrelating experience for 128 frames... +[2026-06-06 23:59:17,666][344394] Decorrelating experience for 0 frames... +[2026-06-06 23:59:17,675][345554] Decorrelating experience for 128 frames... +[2026-06-06 23:59:17,723][345426] Decorrelating experience for 0 frames... +[2026-06-06 23:59:17,793][345416] Decorrelating experience for 0 frames... +[2026-06-06 23:59:18,253][345420] Decorrelating experience for 128 frames... +[2026-06-06 23:59:18,279][344389] Decorrelating experience for 0 frames... +[2026-06-06 23:59:18,379][344400] Decorrelating experience for 128 frames... +[2026-06-06 23:59:18,385][345419] Decorrelating experience for 0 frames... +[2026-06-06 23:59:18,395][345422] Decorrelating experience for 0 frames... +[2026-06-06 23:59:18,397][344397] Decorrelating experience for 0 frames... +[2026-06-06 23:59:18,402][345421] Decorrelating experience for 0 frames... +[2026-06-06 23:59:18,409][344393] Decorrelating experience for 256 frames... +[2026-06-06 23:59:18,430][345424] Decorrelating experience for 256 frames... +[2026-06-06 23:59:18,606][344402] Decorrelating experience for 0 frames... +[2026-06-06 23:59:18,946][345425] Decorrelating experience for 0 frames... +[2026-06-06 23:59:19,014][344403] Decorrelating experience for 128 frames... +[2026-06-06 23:59:19,136][344397] Decorrelating experience for 128 frames... +[2026-06-06 23:59:19,180][345421] Decorrelating experience for 128 frames... +[2026-06-06 23:59:19,180][345422] Decorrelating experience for 128 frames... +[2026-06-06 23:59:19,195][345415] Decorrelating experience for 256 frames... +[2026-06-06 23:59:19,196][344396] Decorrelating experience for 0 frames... +[2026-06-06 23:59:19,215][344401] Decorrelating experience for 0 frames... +[2026-06-06 23:59:19,218][345554] Decorrelating experience for 256 frames... +[2026-06-06 23:59:19,378][345420] Decorrelating experience for 256 frames... +[2026-06-06 23:59:19,384][344402] Decorrelating experience for 128 frames... +[2026-06-06 23:59:19,634][344390] Decorrelating experience for 0 frames... +[2026-06-06 23:59:19,797][344399] Decorrelating experience for 128 frames... +[2026-06-06 23:59:19,863][344389] Decorrelating experience for 128 frames... +[2026-06-06 23:59:19,969][345557] Decorrelating experience for 0 frames... +[2026-06-06 23:59:19,980][344393] Decorrelating experience for 384 frames... +[2026-06-06 23:59:20,005][344394] Decorrelating experience for 128 frames... +[2026-06-06 23:59:20,039][344398] Decorrelating experience for 0 frames... +[2026-06-06 23:59:20,057][345555] Decorrelating experience for 0 frames... +[2026-06-06 23:59:20,082][344401] Decorrelating experience for 128 frames... +[2026-06-06 23:59:20,098][344397] Decorrelating experience for 256 frames... +[2026-06-06 23:59:20,146][344388] Decorrelating experience for 0 frames... +[2026-06-06 23:59:20,191][346442] Decorrelating experience for 128 frames... +[2026-06-06 23:59:20,257][343476] Fps is (10 sec: 0.0, 60 sec: 0.0, 300 sec: 0.0). Total num frames: 0. Throughput: 0: 0.0. Samples: 0. Policy #0 lag: (min: -1.0, avg: -1.0, max: -1.0) +[2026-06-06 23:59:20,299][345424] Decorrelating experience for 384 frames... +[2026-06-06 23:59:20,448][345420] Decorrelating experience for 384 frames... +[2026-06-06 23:59:20,490][345419] Decorrelating experience for 128 frames... +[2026-06-06 23:59:20,635][345415] Decorrelating experience for 384 frames... +[2026-06-06 23:59:20,691][344402] Decorrelating experience for 256 frames... +[2026-06-06 23:59:20,803][344390] Decorrelating experience for 128 frames... +[2026-06-06 23:59:20,806][345557] Decorrelating experience for 128 frames... +[2026-06-06 23:59:20,878][344398] Decorrelating experience for 128 frames... +[2026-06-06 23:59:20,906][345554] Decorrelating experience for 384 frames... +[2026-06-06 23:59:20,909][344395] Another process currently holds the lock /tmp/sf2_root/doom_000.lockfile, attempt: 1, max_wait_sec=60.000 +[2026-06-06 23:59:20,920][344399] Decorrelating experience for 256 frames... +[2026-06-06 23:59:20,937][345555] Decorrelating experience for 128 frames... +[2026-06-06 23:59:21,061][344389] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,115][345426] Decorrelating experience for 128 frames... +[2026-06-06 23:59:21,145][345423] Decorrelating experience for 128 frames... +[2026-06-06 23:59:21,145][345418] Decorrelating experience for 128 frames... +[2026-06-06 23:59:21,227][345416] Decorrelating experience for 128 frames... +[2026-06-06 23:59:21,361][344388] Decorrelating experience for 128 frames... +[2026-06-06 23:59:21,382][344401] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,420][344403] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,462][344394] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,606][344395] Decorrelating experience for 0 frames... +[2026-06-06 23:59:21,641][345425] Decorrelating experience for 128 frames... +[2026-06-06 23:59:21,675][346442] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,757][344397] Decorrelating experience for 384 frames... +[2026-06-06 23:59:21,791][344400] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,821][345555] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,833][345557] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,871][345419] Decorrelating experience for 256 frames... +[2026-06-06 23:59:21,886][345463] Another process currently holds the lock /tmp/sf2_root/doom_001.lockfile, attempt: 1, max_wait_sec=60.000 +[2026-06-06 23:59:21,990][344392] Another process currently holds the lock /tmp/sf2_root/doom_001.lockfile, attempt: 1, max_wait_sec=60.000 +[2026-06-06 23:59:21,995][345418] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,054][344390] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,080][344399] Decorrelating experience for 384 frames... +[2026-06-06 23:59:22,148][344398] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,166][344396] Decorrelating experience for 128 frames... +[2026-06-06 23:59:22,249][345556] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,269][345416] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,309][345423] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,373][344394] Decorrelating experience for 384 frames... +[2026-06-06 23:59:22,417][344388] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,541][345426] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,594][344402] Decorrelating experience for 384 frames... +[2026-06-06 23:59:22,635][344401] Decorrelating experience for 384 frames... +[2026-06-06 23:59:22,703][345421] Decorrelating experience for 256 frames... +[2026-06-06 23:59:22,711][344392] Decorrelating experience for 128 frames... +[2026-06-06 23:59:22,800][344395] Decorrelating experience for 128 frames... +[2026-06-06 23:59:22,891][345419] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,037][344396] Decorrelating experience for 256 frames... +[2026-06-06 23:59:23,181][345555] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,197][346442] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,223][345422] Decorrelating experience for 256 frames... +[2026-06-06 23:59:23,266][345418] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,356][345463] Decorrelating experience for 128 frames... +[2026-06-06 23:59:23,364][344389] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,405][345556] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,411][345423] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,613][344390] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,642][345557] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,788][345421] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,792][345416] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,826][344403] Decorrelating experience for 384 frames... +[2026-06-06 23:59:23,833][344398] Decorrelating experience for 384 frames... +[2026-06-06 23:59:24,051][344388] Decorrelating experience for 384 frames... +[2026-06-06 23:59:24,189][345422] Decorrelating experience for 384 frames... +[2026-06-06 23:59:24,272][345463] Decorrelating experience for 256 frames... +[2026-06-06 23:59:24,332][344395] Decorrelating experience for 256 frames... +[2026-06-06 23:59:24,356][345425] Decorrelating experience for 256 frames... +[2026-06-06 23:59:24,435][345426] Decorrelating experience for 384 frames... +[2026-06-06 23:59:24,805][344392] Decorrelating experience for 256 frames... +[2026-06-06 23:59:24,819][344396] Decorrelating experience for 384 frames... +[2026-06-06 23:59:25,197][344400] Decorrelating experience for 384 frames... +[2026-06-06 23:59:25,257][343476] Fps is (10 sec: 0.0, 60 sec: 0.0, 300 sec: 0.0). Total num frames: 0. Throughput: 0: 3.8. Samples: 36. Policy #0 lag: (min: -1.0, avg: -1.0, max: -1.0) +[2026-06-06 23:59:25,258][343476] Avg episode reward: [(0, '-80.095')] +[2026-06-06 23:59:25,286][344395] Decorrelating experience for 384 frames... +[2026-06-06 23:59:25,413][345463] Decorrelating experience for 384 frames... +[2026-06-06 23:59:25,458][345425] Decorrelating experience for 384 frames... +[2026-06-06 23:59:26,057][344392] Decorrelating experience for 384 frames... +[2026-06-06 23:59:26,479][343476] Heartbeat connected on Batcher_0 +[2026-06-06 23:59:26,483][343476] Heartbeat connected on LearnerWorker_p0 +[2026-06-06 23:59:26,499][343476] Heartbeat connected on RolloutWorker_w0 +[2026-06-06 23:59:26,506][343476] Heartbeat connected on RolloutWorker_w1 +[2026-06-06 23:59:26,514][343476] Heartbeat connected on RolloutWorker_w2 +[2026-06-06 23:59:26,521][343476] Heartbeat connected on RolloutWorker_w3 +[2026-06-06 23:59:26,529][343476] Heartbeat connected on RolloutWorker_w4 +[2026-06-06 23:59:26,536][343476] Heartbeat connected on RolloutWorker_w5 +[2026-06-06 23:59:26,543][343476] Heartbeat connected on RolloutWorker_w6 +[2026-06-06 23:59:26,550][343476] Heartbeat connected on RolloutWorker_w7 +[2026-06-06 23:59:26,565][343476] Heartbeat connected on RolloutWorker_w9 +[2026-06-06 23:59:26,572][343476] Heartbeat connected on RolloutWorker_w10 +[2026-06-06 23:59:26,579][343476] Heartbeat connected on RolloutWorker_w11 +[2026-06-06 23:59:26,584][343476] Heartbeat connected on RolloutWorker_w12 +[2026-06-06 23:59:26,590][343476] Heartbeat connected on RolloutWorker_w13 +[2026-06-06 23:59:26,595][343476] Heartbeat connected on RolloutWorker_w14 +[2026-06-06 23:59:26,601][343476] Heartbeat connected on RolloutWorker_w15 +[2026-06-06 23:59:26,605][343476] Heartbeat connected on RolloutWorker_w16 +[2026-06-06 23:59:26,610][343476] Heartbeat connected on RolloutWorker_w17 +[2026-06-06 23:59:26,615][343476] Heartbeat connected on RolloutWorker_w18 +[2026-06-06 23:59:26,618][343476] Heartbeat connected on RolloutWorker_w19 +[2026-06-06 23:59:26,623][343476] Heartbeat connected on RolloutWorker_w20 +[2026-06-06 23:59:26,628][343476] Heartbeat connected on RolloutWorker_w21 +[2026-06-06 23:59:26,632][343476] Heartbeat connected on RolloutWorker_w22 +[2026-06-06 23:59:26,637][343476] Heartbeat connected on RolloutWorker_w23 +[2026-06-06 23:59:26,643][343476] Heartbeat connected on RolloutWorker_w24 +[2026-06-06 23:59:26,647][343476] Heartbeat connected on RolloutWorker_w25 +[2026-06-06 23:59:26,651][343476] Heartbeat connected on RolloutWorker_w26 +[2026-06-06 23:59:26,655][343476] Heartbeat connected on RolloutWorker_w27 +[2026-06-06 23:59:26,660][343476] Heartbeat connected on RolloutWorker_w28 +[2026-06-06 23:59:26,665][343476] Heartbeat connected on RolloutWorker_w29 +[2026-06-06 23:59:26,670][343476] Heartbeat connected on RolloutWorker_w30 +[2026-06-06 23:59:26,673][343476] Heartbeat connected on RolloutWorker_w31 +[2026-06-06 23:59:26,925][343476] Heartbeat connected on InferenceWorker_p0-w0 +[2026-06-06 23:59:26,974][343476] Heartbeat connected on RolloutWorker_w8 +[2026-06-06 23:59:30,257][343476] Fps is (10 sec: 0.0, 60 sec: 0.0, 300 sec: 0.0). Total num frames: 0. Throughput: 0: 171.7. Samples: 2488. Policy #0 lag: (min: -1.0, avg: -1.0, max: -1.0) +[2026-06-06 23:59:30,260][343476] Avg episode reward: [(0, '-72.754')] +[2026-06-06 23:59:34,285][344304] Signal inference workers to stop experience collection... +[2026-06-06 23:59:34,320][344387] InferenceWorker_p0-w0: stopping experience collection +[2026-06-06 23:59:35,257][343476] Fps is (10 sec: 0.0, 60 sec: 0.0, 300 sec: 0.0). Total num frames: 0. Throughput: 0: 774.4. Samples: 15090. Policy #0 lag: (min: -1.0, avg: -1.0, max: -1.0) +[2026-06-06 23:59:35,258][343476] Avg episode reward: [(0, '-49.017')] +[2026-06-06 23:59:35,744][344304] Signal inference workers to resume experience collection... +[2026-06-06 23:59:35,745][344387] InferenceWorker_p0-w0: resuming experience collection +[2026-06-06 23:59:39,156][344387] Updated weights for policy 0, policy_version 26 (0.0048) +[2026-06-06 23:59:40,257][343476] Fps is (10 sec: 1638.5, 60 sec: 669.1, 300 sec: 669.1). Total num frames: 16384. Throughput: 0: 809.6. Samples: 19824. Policy #0 lag: (min: 11.0, avg: 18.5, max: 19.0) +[2026-06-06 23:59:40,258][343476] Avg episode reward: [(0, '-40.842')] +[2026-06-06 23:59:44,794][344387] Updated weights for policy 0, policy_version 38 (0.0013) +[2026-06-06 23:59:45,258][343476] Fps is (10 sec: 2047.9, 60 sec: 694.5, 300 sec: 694.5). Total num frames: 20480. Throughput: 0: 947.0. Samples: 27924. Policy #0 lag: (min: 0.0, avg: 10.2, max: 32.0) +[2026-06-06 23:59:45,263][343476] Avg episode reward: [(0, '-49.233')] +[2026-06-06 23:59:46,940][344387] Updated weights for policy 0, policy_version 56 (0.0010) +[2026-06-06 23:59:50,258][343476] Fps is (10 sec: 1638.3, 60 sec: 950.2, 300 sec: 950.2). Total num frames: 32768. Throughput: 0: 1139.3. Samples: 39292. Policy #0 lag: (min: 11.0, avg: 20.8, max: 43.0) +[2026-06-06 23:59:50,260][343476] Avg episode reward: [(0, '-32.382')] +[2026-06-06 23:59:52,887][344387] Updated weights for policy 0, policy_version 72 (0.0012) +[2026-06-06 23:59:55,257][343476] Fps is (10 sec: 2662.5, 60 sec: 1192.9, 300 sec: 1192.9). Total num frames: 47104. Throughput: 0: 1298.8. Samples: 51286. Policy #0 lag: (min: 7.0, avg: 17.6, max: 39.0) +[2026-06-06 23:59:55,260][343476] Avg episode reward: [(0, '-37.499')] +[2026-06-06 23:59:55,580][344387] Updated weights for policy 0, policy_version 95 (0.0009) +[2026-06-07 00:00:00,257][343476] Fps is (10 sec: 2252.9, 60 sec: 1243.0, 300 sec: 1243.0). Total num frames: 55296. Throughput: 0: 1376.4. Samples: 61228. Policy #0 lag: (min: 3.0, avg: 11.8, max: 35.0) +[2026-06-07 00:00:00,259][343476] Avg episode reward: [(0, '4.941')] +[2026-06-07 00:00:00,580][344387] Updated weights for policy 0, policy_version 112 (0.0010) +[2026-06-07 00:00:05,178][344387] Updated weights for policy 0, policy_version 136 (0.0009) +[2026-06-07 00:00:05,258][343476] Fps is (10 sec: 2252.8, 60 sec: 1407.1, 300 sec: 1407.1). Total num frames: 69632. Throughput: 0: 1737.9. Samples: 78206. Policy #0 lag: (min: 2.0, avg: 17.8, max: 34.0) +[2026-06-07 00:00:05,260][343476] Avg episode reward: [(0, '9.968')] +[2026-06-07 00:00:09,872][344387] Updated weights for policy 0, policy_version 163 (0.0009) +[2026-06-07 00:00:10,259][343476] Fps is (10 sec: 2866.9, 60 sec: 1541.1, 300 sec: 1541.1). Total num frames: 83968. Throughput: 0: 2130.8. Samples: 95926. Policy #0 lag: (min: 1.0, avg: 15.2, max: 33.0) +[2026-06-07 00:00:10,265][343476] Avg episode reward: [(0, '18.331')] +[2026-06-07 00:00:12,435][344387] Updated weights for policy 0, policy_version 184 (0.0010) +[2026-06-07 00:00:15,257][343476] Fps is (10 sec: 2867.2, 60 sec: 1652.6, 300 sec: 1652.5). Total num frames: 98304. Throughput: 0: 2264.5. Samples: 104392. Policy #0 lag: (min: 19.0, avg: 29.1, max: 51.0) +[2026-06-07 00:00:15,260][343476] Avg episode reward: [(0, '55.570')] +[2026-06-07 00:00:15,793][344387] Updated weights for policy 0, policy_version 198 (0.0008) +[2026-06-07 00:00:17,323][344387] Updated weights for policy 0, policy_version 214 (0.0012) +[2026-06-07 00:00:20,258][343476] Fps is (10 sec: 3072.1, 60 sec: 1911.5, 300 sec: 1778.5). Total num frames: 114688. Throughput: 0: 2354.4. Samples: 121040. Policy #0 lag: (min: 14.0, avg: 27.5, max: 51.0) +[2026-06-07 00:00:20,263][343476] Avg episode reward: [(0, '70.226')] +[2026-06-07 00:00:20,270][344304] Saving new best policy, reward=70.226! +[2026-06-07 00:00:21,329][344387] Updated weights for policy 0, policy_version 225 (0.0011) +[2026-06-07 00:00:23,163][344387] Updated weights for policy 0, policy_version 239 (0.0009) +[2026-06-07 00:00:25,258][343476] Fps is (10 sec: 3072.0, 60 sec: 2150.4, 300 sec: 1856.8). Total num frames: 129024. Throughput: 0: 2565.4. Samples: 135270. Policy #0 lag: (min: 15.0, avg: 24.8, max: 46.0) +[2026-06-07 00:00:25,260][343476] Avg episode reward: [(0, '66.012')] +[2026-06-07 00:00:25,286][344387] Updated weights for policy 0, policy_version 256 (0.0008) +[2026-06-07 00:00:29,828][344387] Updated weights for policy 0, policy_version 273 (0.0009) +[2026-06-07 00:00:30,258][343476] Fps is (10 sec: 2867.2, 60 sec: 2389.3, 300 sec: 1924.6). Total num frames: 143360. Throughput: 0: 2587.6. Samples: 144366. Policy #0 lag: (min: 2.0, avg: 13.5, max: 34.0) +[2026-06-07 00:00:30,263][343476] Avg episode reward: [(0, '112.891')] +[2026-06-07 00:00:30,394][344304] Saving new best policy, reward=112.891! +[2026-06-07 00:00:31,022][344387] Updated weights for policy 0, policy_version 287 (0.0010) +[2026-06-07 00:00:34,847][344304] Signal inference workers to stop experience collection... (50 times) +[2026-06-07 00:00:34,880][344387] InferenceWorker_p0-w0: stopping experience collection (50 times) +[2026-06-07 00:00:34,989][344304] Signal inference workers to resume experience collection... (50 times) +[2026-06-07 00:00:34,990][344387] InferenceWorker_p0-w0: resuming experience collection (50 times) +[2026-06-07 00:00:34,993][344387] Updated weights for policy 0, policy_version 300 (0.0011) +[2026-06-07 00:00:35,257][343476] Fps is (10 sec: 2457.6, 60 sec: 2560.0, 300 sec: 1932.4). Total num frames: 153600. Throughput: 0: 2733.3. Samples: 162290. Policy #0 lag: (min: 3.0, avg: 14.3, max: 35.0) +[2026-06-07 00:00:35,261][343476] Avg episode reward: [(0, '121.341')] +[2026-06-07 00:00:35,773][344304] Saving new best policy, reward=121.341! +[2026-06-07 00:00:36,869][344387] Updated weights for policy 0, policy_version 318 (0.0010) +[2026-06-07 00:00:40,090][344387] Updated weights for policy 0, policy_version 328 (0.0009) +[2026-06-07 00:00:40,258][343476] Fps is (10 sec: 2457.7, 60 sec: 2525.8, 300 sec: 1987.7). Total num frames: 167936. Throughput: 0: 2852.8. Samples: 179664. Policy #0 lag: (min: 0.0, avg: 13.7, max: 32.0) +[2026-06-07 00:00:40,260][343476] Avg episode reward: [(0, '162.676')] +[2026-06-07 00:00:40,516][344304] Saving new best policy, reward=162.676! +[2026-06-07 00:00:42,045][344387] Updated weights for policy 0, policy_version 347 (0.0008) +[2026-06-07 00:00:45,258][343476] Fps is (10 sec: 2662.3, 60 sec: 2662.4, 300 sec: 2014.0). Total num frames: 180224. Throughput: 0: 2796.2. Samples: 187060. Policy #0 lag: (min: 15.0, avg: 26.7, max: 49.0) +[2026-06-07 00:00:45,263][343476] Avg episode reward: [(0, '148.459')] +[2026-06-07 00:00:46,040][344387] Updated weights for policy 0, policy_version 357 (0.0010) +[2026-06-07 00:00:48,221][344387] Updated weights for policy 0, policy_version 373 (0.0014) +[2026-06-07 00:00:50,257][343476] Fps is (10 sec: 2867.3, 60 sec: 2730.7, 300 sec: 2080.8). Total num frames: 196608. Throughput: 0: 2742.8. Samples: 201632. Policy #0 lag: (min: 15.0, avg: 26.0, max: 47.0) +[2026-06-07 00:00:50,259][343476] Avg episode reward: [(0, '159.384')] +[2026-06-07 00:00:51,571][344387] Updated weights for policy 0, policy_version 385 (0.0010) +[2026-06-07 00:00:52,710][344387] Updated weights for policy 0, policy_version 396 (0.0010) +[2026-06-07 00:00:54,689][344387] Updated weights for policy 0, policy_version 414 (0.0011) +[2026-06-07 00:00:55,258][343476] Fps is (10 sec: 3276.9, 60 sec: 2764.8, 300 sec: 2140.9). Total num frames: 212992. Throughput: 0: 2738.3. Samples: 219148. Policy #0 lag: (min: 15.0, avg: 28.5, max: 47.0) +[2026-06-07 00:00:55,262][343476] Avg episode reward: [(0, '195.952')] +[2026-06-07 00:00:55,276][344304] Saving new best policy, reward=195.952! +[2026-06-07 00:00:58,415][344387] Updated weights for policy 0, policy_version 428 (0.0010) +[2026-06-07 00:01:00,258][343476] Fps is (10 sec: 3071.9, 60 sec: 2867.2, 300 sec: 2175.7). Total num frames: 227328. Throughput: 0: 2758.1. Samples: 228506. Policy #0 lag: (min: 14.0, avg: 25.6, max: 45.0) +[2026-06-07 00:01:00,259][343476] Avg episode reward: [(0, '184.940')] +[2026-06-07 00:01:00,617][344387] Updated weights for policy 0, policy_version 445 (0.0010) +[2026-06-07 00:01:03,622][344387] Updated weights for policy 0, policy_version 456 (0.0009) +[2026-06-07 00:01:05,258][343476] Fps is (10 sec: 2867.4, 60 sec: 2867.2, 300 sec: 2207.3). Total num frames: 241664. Throughput: 0: 2780.4. Samples: 246156. Policy #0 lag: (min: 3.0, avg: 14.7, max: 35.0) +[2026-06-07 00:01:05,262][343476] Avg episode reward: [(0, '231.252')] +[2026-06-07 00:01:05,371][344387] Updated weights for policy 0, policy_version 474 (0.0011) +[2026-06-07 00:01:05,432][344304] Saving new best policy, reward=231.252! +[2026-06-07 00:01:08,745][344387] Updated weights for policy 0, policy_version 484 (0.0010) +[2026-06-07 00:01:10,258][343476] Fps is (10 sec: 2457.5, 60 sec: 2799.0, 300 sec: 2200.3). Total num frames: 251904. Throughput: 0: 2823.7. Samples: 262336. Policy #0 lag: (min: 0.0, avg: 13.3, max: 32.0) +[2026-06-07 00:01:10,261][343476] Avg episode reward: [(0, '250.494')] +[2026-06-07 00:01:10,307][344387] Updated weights for policy 0, policy_version 494 (0.0010) +[2026-06-07 00:01:10,709][344304] Saving new best policy, reward=250.494! +[2026-06-07 00:01:12,760][344387] Updated weights for policy 0, policy_version 509 (0.0009) +[2026-06-07 00:01:15,257][343476] Fps is (10 sec: 2252.8, 60 sec: 2764.8, 300 sec: 2211.1). Total num frames: 264192. Throughput: 0: 2787.8. Samples: 269814. Policy #0 lag: (min: 0.0, avg: 12.2, max: 32.0) +[2026-06-07 00:01:15,259][343476] Avg episode reward: [(0, '203.030')] +[2026-06-07 00:01:15,764][344387] Updated weights for policy 0, policy_version 521 (0.0009) +[2026-06-07 00:01:17,242][344387] Updated weights for policy 0, policy_version 540 (0.0009) +[2026-06-07 00:01:20,258][343476] Fps is (10 sec: 2867.2, 60 sec: 2764.8, 300 sec: 2253.9). Total num frames: 280576. Throughput: 0: 2798.2. Samples: 288208. Policy #0 lag: (min: 2.0, avg: 15.7, max: 34.0) +[2026-06-07 00:01:20,261][343476] Avg episode reward: [(0, '276.470')] +[2026-06-07 00:01:20,269][344304] Saving new best policy, reward=276.470! +[2026-06-07 00:01:20,885][344387] Updated weights for policy 0, policy_version 552 (0.0009) +[2026-06-07 00:01:22,606][344387] Updated weights for policy 0, policy_version 571 (0.0009) +[2026-06-07 00:01:25,257][343476] Fps is (10 sec: 3072.0, 60 sec: 2764.8, 300 sec: 2277.6). Total num frames: 294912. Throughput: 0: 2799.3. Samples: 305632. Policy #0 lag: (min: 15.0, avg: 28.4, max: 47.0) +[2026-06-07 00:01:25,259][343476] Avg episode reward: [(0, '252.835')] +[2026-06-07 00:01:26,355][344387] Updated weights for policy 0, policy_version 581 (0.0009) +[2026-06-07 00:01:28,171][344304] Signal inference workers to stop experience collection... (100 times) +[2026-06-07 00:01:28,276][344387] InferenceWorker_p0-w0: stopping experience collection (100 times) +[2026-06-07 00:01:28,306][344304] Signal inference workers to resume experience collection... (100 times) +[2026-06-07 00:01:28,306][344387] InferenceWorker_p0-w0: resuming experience collection (100 times) +[2026-06-07 00:01:28,308][344387] Updated weights for policy 0, policy_version 600 (0.0011) +[2026-06-07 00:01:30,258][343476] Fps is (10 sec: 3071.9, 60 sec: 2798.9, 300 sec: 2314.7). Total num frames: 311296. Throughput: 0: 2802.2. Samples: 313160. Policy #0 lag: (min: 10.0, avg: 24.3, max: 46.0) +[2026-06-07 00:01:30,260][343476] Avg episode reward: [(0, '229.556')] +[2026-06-07 00:01:32,338][344387] Updated weights for policy 0, policy_version 610 (0.0011) +[2026-06-07 00:01:34,653][344387] Updated weights for policy 0, policy_version 625 (0.0010) +[2026-06-07 00:01:35,257][343476] Fps is (10 sec: 2867.1, 60 sec: 2833.1, 300 sec: 2319.8). Total num frames: 323584. Throughput: 0: 2808.4. Samples: 328010. Policy #0 lag: (min: 11.0, avg: 24.2, max: 43.0) +[2026-06-07 00:01:35,260][343476] Avg episode reward: [(0, '252.962')] +[2026-06-07 00:01:36,708][344387] Updated weights for policy 0, policy_version 639 (0.0008) +[2026-06-07 00:01:39,857][344387] Updated weights for policy 0, policy_version 652 (0.0012) +[2026-06-07 00:01:40,257][343476] Fps is (10 sec: 2252.9, 60 sec: 2764.8, 300 sec: 2310.4). Total num frames: 333824. Throughput: 0: 2815.8. Samples: 345858. Policy #0 lag: (min: 3.0, avg: 14.5, max: 35.0) +[2026-06-07 00:01:40,259][343476] Avg episode reward: [(0, '271.030')] +[2026-06-07 00:01:42,211][344387] Updated weights for policy 0, policy_version 670 (0.0009) +[2026-06-07 00:01:44,617][344387] Updated weights for policy 0, policy_version 680 (0.0008) +[2026-06-07 00:01:45,258][343476] Fps is (10 sec: 2662.4, 60 sec: 2833.1, 300 sec: 2342.7). Total num frames: 350208. Throughput: 0: 2789.3. Samples: 354024. Policy #0 lag: (min: 2.0, avg: 17.3, max: 34.0) +[2026-06-07 00:01:45,265][343476] Avg episode reward: [(0, '278.005')] +[2026-06-07 00:01:45,723][344304] Saving new best policy, reward=278.005! +[2026-06-07 00:01:46,360][344387] Updated weights for policy 0, policy_version 699 (0.0008) +[2026-06-07 00:01:49,720][344387] Updated weights for policy 0, policy_version 712 (0.0008) +[2026-06-07 00:01:50,257][343476] Fps is (10 sec: 3276.8, 60 sec: 2833.1, 300 sec: 2373.0). Total num frames: 366592. Throughput: 0: 2841.0. Samples: 374002. Policy #0 lag: (min: 7.0, avg: 17.7, max: 37.0) +[2026-06-07 00:01:50,259][343476] Avg episode reward: [(0, '328.221')] +[2026-06-07 00:01:50,635][344304] Saving new best policy, reward=328.221! +[2026-06-07 00:01:51,852][344387] Updated weights for policy 0, policy_version 731 (0.0009) +[2026-06-07 00:01:54,656][344387] Updated weights for policy 0, policy_version 741 (0.0010) +[2026-06-07 00:01:55,259][343476] Fps is (10 sec: 3071.8, 60 sec: 2798.9, 300 sec: 2388.5). Total num frames: 380928. Throughput: 0: 2892.8. Samples: 392512. Policy #0 lag: (min: 0.0, avg: 17.6, max: 32.0) +[2026-06-07 00:01:55,265][343476] Avg episode reward: [(0, '288.051')] +[2026-06-07 00:01:56,277][344387] Updated weights for policy 0, policy_version 756 (0.0011) +[2026-06-07 00:01:59,447][344387] Updated weights for policy 0, policy_version 769 (0.0010) +[2026-06-07 00:02:00,257][343476] Fps is (10 sec: 2867.2, 60 sec: 2798.9, 300 sec: 2403.0). Total num frames: 395264. Throughput: 0: 2911.6. Samples: 400836. Policy #0 lag: (min: 3.0, avg: 16.1, max: 35.0) +[2026-06-07 00:02:00,261][343476] Avg episode reward: [(0, '258.961')] +[2026-06-07 00:02:01,779][344387] Updated weights for policy 0, policy_version 788 (0.0169) +[2026-06-07 00:02:03,832][344387] Updated weights for policy 0, policy_version 800 (0.0009) +[2026-06-07 00:02:05,258][343476] Fps is (10 sec: 2867.4, 60 sec: 2798.9, 300 sec: 2416.7). Total num frames: 409600. Throughput: 0: 2892.2. Samples: 418356. Policy #0 lag: (min: 9.0, avg: 24.0, max: 44.0) +[2026-06-07 00:02:05,270][343476] Avg episode reward: [(0, '330.229')] +[2026-06-07 00:02:05,329][344304] Saving new best policy, reward=330.229! +[2026-06-07 00:02:06,387][344387] Updated weights for policy 0, policy_version 812 (0.0008) +[2026-06-07 00:02:07,858][344387] Updated weights for policy 0, policy_version 827 (0.0011) +[2026-06-07 00:02:10,257][343476] Fps is (10 sec: 3072.0, 60 sec: 2901.4, 300 sec: 2441.4). Total num frames: 425984. Throughput: 0: 2896.8. Samples: 435986. Policy #0 lag: (min: 3.0, avg: 21.2, max: 35.0) +[2026-06-07 00:02:10,259][343476] Avg episode reward: [(0, '343.280')] +[2026-06-07 00:02:10,265][344304] Saving new best policy, reward=343.280! +[2026-06-07 00:02:11,565][344387] Updated weights for policy 0, policy_version 837 (0.0008) +[2026-06-07 00:02:13,580][344387] Updated weights for policy 0, policy_version 858 (0.0214) +[2026-06-07 00:02:15,258][343476] Fps is (10 sec: 3276.7, 60 sec: 2969.6, 300 sec: 2464.6). Total num frames: 442368. Throughput: 0: 2940.6. Samples: 445486. Policy #0 lag: (min: 11.0, avg: 20.2, max: 41.0) +[2026-06-07 00:02:15,261][343476] Avg episode reward: [(0, '301.303')] +[2026-06-07 00:02:16,333][344387] Updated weights for policy 0, policy_version 868 (0.0009) +[2026-06-07 00:02:18,627][344387] Updated weights for policy 0, policy_version 884 (0.0010) +[2026-06-07 00:02:20,257][343476] Fps is (10 sec: 3072.0, 60 sec: 2935.5, 300 sec: 2475.5). Total num frames: 456704. Throughput: 0: 2989.7. Samples: 462544. Policy #0 lag: (min: 14.0, avg: 28.6, max: 47.0) +[2026-06-07 00:02:20,260][343476] Avg episode reward: [(0, '297.300')] +[2026-06-07 00:02:20,702][344387] Updated weights for policy 0, policy_version 896 (0.0012) +[2026-06-07 00:02:23,587][344387] Updated weights for policy 0, policy_version 912 (0.0009) +[2026-06-07 00:02:23,812][344304] Signal inference workers to stop experience collection... (150 times) +[2026-06-07 00:02:23,844][344387] InferenceWorker_p0-w0: stopping experience collection (150 times) +[2026-06-07 00:02:23,929][344304] Signal inference workers to resume experience collection... (150 times) +[2026-06-07 00:02:23,930][344387] InferenceWorker_p0-w0: resuming experience collection (150 times) +[2026-06-07 00:02:25,257][343476] Fps is (10 sec: 3072.1, 60 sec: 2969.6, 300 sec: 2496.7). Total num frames: 473088. Throughput: 0: 2979.6. Samples: 479940. Policy #0 lag: (min: 3.0, avg: 16.5, max: 35.0) +[2026-06-07 00:02:25,260][343476] Avg episode reward: [(0, '373.626')] +[2026-06-07 00:02:25,273][344304] Saving new best policy, reward=373.626! +[2026-06-07 00:02:25,949][344387] Updated weights for policy 0, policy_version 926 (0.0009) +[2026-06-07 00:02:28,866][344387] Updated weights for policy 0, policy_version 940 (0.0009) +[2026-06-07 00:02:30,258][343476] Fps is (10 sec: 3072.0, 60 sec: 2935.5, 300 sec: 2506.2). Total num frames: 487424. Throughput: 0: 3029.9. Samples: 490370. Policy #0 lag: (min: 11.0, avg: 21.1, max: 43.0) +[2026-06-07 00:02:30,261][343476] Avg episode reward: [(0, '309.525')] +[2026-06-07 00:02:30,389][344387] Updated weights for policy 0, policy_version 956 (0.0009) +[2026-06-07 00:02:33,758][344387] Updated weights for policy 0, policy_version 969 (0.0009) +[2026-06-07 00:02:35,258][343476] Fps is (10 sec: 3071.8, 60 sec: 3003.7, 300 sec: 2525.5). Total num frames: 503808. Throughput: 0: 2993.4. Samples: 508708. Policy #0 lag: (min: 3.0, avg: 18.8, max: 35.0) +[2026-06-07 00:02:35,261][343476] Avg episode reward: [(0, '313.660')] +[2026-06-07 00:02:36,733][344387] Updated weights for policy 0, policy_version 989 (0.0011) +[2026-06-07 00:02:39,319][344387] Updated weights for policy 0, policy_version 1001 (0.0011) +[2026-06-07 00:02:40,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3072.0, 300 sec: 2533.9). Total num frames: 518144. Throughput: 0: 2969.5. Samples: 526140. Policy #0 lag: (min: 3.0, avg: 16.1, max: 35.0) +[2026-06-07 00:02:40,260][343476] Avg episode reward: [(0, '366.558')] +[2026-06-07 00:02:40,807][344387] Updated weights for policy 0, policy_version 1019 (0.0009) +[2026-06-07 00:02:43,950][344387] Updated weights for policy 0, policy_version 1029 (0.0008) +[2026-06-07 00:02:44,982][344387] Updated weights for policy 0, policy_version 1040 (0.0009) +[2026-06-07 00:02:45,259][343476] Fps is (10 sec: 2867.1, 60 sec: 3037.8, 300 sec: 2541.8). Total num frames: 532480. Throughput: 0: 2988.4. Samples: 535314. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 00:02:45,266][343476] Avg episode reward: [(0, '374.716')] +[2026-06-07 00:02:45,814][344304] Saving new best policy, reward=374.716! +[2026-06-07 00:02:47,674][344387] Updated weights for policy 0, policy_version 1053 (0.0010) +[2026-06-07 00:02:49,951][344387] Updated weights for policy 0, policy_version 1063 (0.0008) +[2026-06-07 00:02:50,257][343476] Fps is (10 sec: 2662.5, 60 sec: 2969.6, 300 sec: 2539.9). Total num frames: 544768. Throughput: 0: 2994.3. Samples: 553098. Policy #0 lag: (min: 3.0, avg: 16.3, max: 35.0) +[2026-06-07 00:02:50,259][343476] Avg episode reward: [(0, '337.603')] +[2026-06-07 00:02:51,758][344387] Updated weights for policy 0, policy_version 1082 (0.0010) +[2026-06-07 00:02:54,691][344387] Updated weights for policy 0, policy_version 1092 (0.0009) +[2026-06-07 00:02:55,257][343476] Fps is (10 sec: 2662.6, 60 sec: 2969.6, 300 sec: 2547.3). Total num frames: 559104. Throughput: 0: 2991.7. Samples: 570612. Policy #0 lag: (min: 3.0, avg: 19.8, max: 35.0) +[2026-06-07 00:02:55,260][343476] Avg episode reward: [(0, '379.182')] +[2026-06-07 00:02:55,644][344304] Saving new best policy, reward=379.182! +[2026-06-07 00:02:57,135][344387] Updated weights for policy 0, policy_version 1109 (0.0010) +[2026-06-07 00:03:00,069][344387] Updated weights for policy 0, policy_version 1121 (0.0008) +[2026-06-07 00:03:00,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3003.7, 300 sec: 2563.6). Total num frames: 575488. Throughput: 0: 2953.2. Samples: 578376. Policy #0 lag: (min: 3.0, avg: 16.3, max: 35.0) +[2026-06-07 00:03:00,259][343476] Avg episode reward: [(0, '387.301')] +[2026-06-07 00:03:00,266][344304] Saving new best policy, reward=387.301! +[2026-06-07 00:03:02,034][344387] Updated weights for policy 0, policy_version 1133 (0.0008) +[2026-06-07 00:03:05,258][343476] Fps is (10 sec: 2867.0, 60 sec: 2969.6, 300 sec: 2561.3). Total num frames: 587776. Throughput: 0: 2957.2. Samples: 595620. Policy #0 lag: (min: 11.0, avg: 27.4, max: 43.0) +[2026-06-07 00:03:05,260][343476] Avg episode reward: [(0, '381.297')] +[2026-06-07 00:03:05,300][344387] Updated weights for policy 0, policy_version 1149 (0.0011) +[2026-06-07 00:03:09,029][344387] Updated weights for policy 0, policy_version 1160 (0.0014) +[2026-06-07 00:03:10,257][343476] Fps is (10 sec: 2252.8, 60 sec: 2867.2, 300 sec: 2550.3). Total num frames: 598016. Throughput: 0: 2809.6. Samples: 606370. Policy #0 lag: (min: 2.0, avg: 18.5, max: 34.0) +[2026-06-07 00:03:10,259][343476] Avg episode reward: [(0, '357.408')] +[2026-06-07 00:03:10,502][344387] Updated weights for policy 0, policy_version 1171 (0.0015) +[2026-06-07 00:03:14,342][344387] Updated weights for policy 0, policy_version 1181 (0.0013) +[2026-06-07 00:03:15,257][343476] Fps is (10 sec: 1843.3, 60 sec: 2730.7, 300 sec: 2531.3). Total num frames: 606208. Throughput: 0: 2696.2. Samples: 611698. Policy #0 lag: (min: 1.0, avg: 16.3, max: 33.0) +[2026-06-07 00:03:15,258][343476] Avg episode reward: [(0, '336.982')] +[2026-06-07 00:03:17,959][344387] Updated weights for policy 0, policy_version 1191 (0.0013) +[2026-06-07 00:03:19,328][344387] Updated weights for policy 0, policy_version 1202 (0.0012) +[2026-06-07 00:03:20,257][343476] Fps is (10 sec: 2048.0, 60 sec: 2696.5, 300 sec: 2529.8). Total num frames: 618496. Throughput: 0: 2540.4. Samples: 623024. Policy #0 lag: (min: 3.0, avg: 14.5, max: 35.0) +[2026-06-07 00:03:20,258][343476] Avg episode reward: [(0, '354.783')] +[2026-06-07 00:03:20,415][344387] Updated weights for policy 0, policy_version 1212 (0.0013) +[2026-06-07 00:03:25,257][343476] Fps is (10 sec: 1638.4, 60 sec: 2491.7, 300 sec: 2495.5). Total num frames: 622592. Throughput: 0: 2405.2. Samples: 634372. Policy #0 lag: (min: 3.0, avg: 18.5, max: 35.0) +[2026-06-07 00:03:25,258][343476] Avg episode reward: [(0, '361.695')] +[2026-06-07 00:03:26,542][344387] Updated weights for policy 0, policy_version 1222 (0.0012) +[2026-06-07 00:03:27,530][344387] Updated weights for policy 0, policy_version 1232 (0.0012) +[2026-06-07 00:03:28,797][344387] Updated weights for policy 0, policy_version 1242 (0.0011) +[2026-06-07 00:03:30,258][343476] Fps is (10 sec: 1843.1, 60 sec: 2491.7, 300 sec: 2502.8). Total num frames: 636928. Throughput: 0: 2327.9. Samples: 640068. Policy #0 lag: (min: 3.0, avg: 14.4, max: 36.0) +[2026-06-07 00:03:30,266][343476] Avg episode reward: [(0, '404.258')] +[2026-06-07 00:03:30,274][344304] Saving new best policy, reward=404.258! +[2026-06-07 00:03:35,196][344387] Updated weights for policy 0, policy_version 1254 (0.0013) +[2026-06-07 00:03:35,257][343476] Fps is (10 sec: 1843.2, 60 sec: 2287.0, 300 sec: 2470.4). Total num frames: 641024. Throughput: 0: 2181.6. Samples: 651268. Policy #0 lag: (min: 3.0, avg: 18.3, max: 35.0) +[2026-06-07 00:03:35,259][343476] Avg episode reward: [(0, '337.247')] +[2026-06-07 00:03:36,426][344387] Updated weights for policy 0, policy_version 1265 (0.0013) +[2026-06-07 00:03:37,319][344387] Updated weights for policy 0, policy_version 1275 (0.0011) +[2026-06-07 00:03:40,257][343476] Fps is (10 sec: 1843.2, 60 sec: 2286.9, 300 sec: 2477.9). Total num frames: 655360. Throughput: 0: 2083.9. Samples: 664388. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 00:03:40,261][343476] Avg episode reward: [(0, '346.331')] +[2026-06-07 00:03:42,158][344387] Updated weights for policy 0, policy_version 1285 (0.0011) +[2026-06-07 00:03:43,433][344387] Updated weights for policy 0, policy_version 1297 (0.0010) +[2026-06-07 00:03:43,570][344304] Signal inference workers to stop experience collection... (200 times) +[2026-06-07 00:03:43,598][344387] InferenceWorker_p0-w0: stopping experience collection (200 times) +[2026-06-07 00:03:43,678][344304] Signal inference workers to resume experience collection... (200 times) +[2026-06-07 00:03:43,679][344387] InferenceWorker_p0-w0: resuming experience collection (200 times) +[2026-06-07 00:03:45,257][343476] Fps is (10 sec: 2867.3, 60 sec: 2287.0, 300 sec: 2485.1). Total num frames: 669696. Throughput: 0: 2081.9. Samples: 672060. Policy #0 lag: (min: 5.0, avg: 16.0, max: 36.0) +[2026-06-07 00:03:45,259][343476] Avg episode reward: [(0, '409.140')] +[2026-06-07 00:03:45,266][344304] Saving new best policy, reward=409.140! +[2026-06-07 00:03:46,604][344387] Updated weights for policy 0, policy_version 1309 (0.0010) +[2026-06-07 00:03:49,348][344387] Updated weights for policy 0, policy_version 1319 (0.0011) +[2026-06-07 00:03:50,258][343476] Fps is (10 sec: 2252.7, 60 sec: 2218.6, 300 sec: 2469.7). Total num frames: 677888. Throughput: 0: 2000.9. Samples: 685662. Policy #0 lag: (min: 4.0, avg: 16.4, max: 37.0) +[2026-06-07 00:03:50,261][343476] Avg episode reward: [(0, '394.946')] +[2026-06-07 00:03:51,016][344387] Updated weights for policy 0, policy_version 1334 (0.0014) +[2026-06-07 00:03:53,664][344387] Updated weights for policy 0, policy_version 1344 (0.0013) +[2026-06-07 00:03:55,257][343476] Fps is (10 sec: 1843.2, 60 sec: 2150.4, 300 sec: 2462.1). Total num frames: 688128. Throughput: 0: 2080.3. Samples: 699982. Policy #0 lag: (min: 3.0, avg: 19.1, max: 35.0) +[2026-06-07 00:03:55,260][343476] Avg episode reward: [(0, '382.779')] +[2026-06-07 00:03:57,105][344387] Updated weights for policy 0, policy_version 1360 (0.0010) +[2026-06-07 00:03:59,822][344387] Updated weights for policy 0, policy_version 1374 (0.0011) +[2026-06-07 00:04:00,257][343476] Fps is (10 sec: 2662.5, 60 sec: 2150.4, 300 sec: 2476.4). Total num frames: 704512. Throughput: 0: 2129.4. Samples: 707522. Policy #0 lag: (min: 7.0, avg: 25.9, max: 37.0) +[2026-06-07 00:04:00,260][343476] Avg episode reward: [(0, '454.645')] +[2026-06-07 00:04:00,266][344304] Saving new best policy, reward=454.645! +[2026-06-07 00:04:02,579][344387] Updated weights for policy 0, policy_version 1386 (0.0008) +[2026-06-07 00:04:03,925][344387] Updated weights for policy 0, policy_version 1403 (0.0010) +[2026-06-07 00:04:05,257][343476] Fps is (10 sec: 3072.0, 60 sec: 2184.6, 300 sec: 2483.2). Total num frames: 718848. Throughput: 0: 2259.7. Samples: 724710. Policy #0 lag: (min: 10.0, avg: 19.2, max: 42.0) +[2026-06-07 00:04:05,259][343476] Avg episode reward: [(0, '368.141')] +[2026-06-07 00:04:07,470][344387] Updated weights for policy 0, policy_version 1413 (0.0009) +[2026-06-07 00:04:08,810][344387] Updated weights for policy 0, policy_version 1429 (0.0012) +[2026-06-07 00:04:10,258][343476] Fps is (10 sec: 3072.0, 60 sec: 2286.9, 300 sec: 2496.7). Total num frames: 735232. Throughput: 0: 2399.4. Samples: 742344. Policy #0 lag: (min: 1.0, avg: 15.5, max: 33.0) +[2026-06-07 00:04:10,263][343476] Avg episode reward: [(0, '449.306')] +[2026-06-07 00:04:11,221][344387] Updated weights for policy 0, policy_version 1439 (0.0010) +[2026-06-07 00:04:14,045][344387] Updated weights for policy 0, policy_version 1452 (0.0008) +[2026-06-07 00:04:15,258][343476] Fps is (10 sec: 2867.1, 60 sec: 2355.2, 300 sec: 2534.0). Total num frames: 747520. Throughput: 0: 2486.7. Samples: 751970. Policy #0 lag: (min: 8.0, avg: 16.9, max: 40.0) +[2026-06-07 00:04:15,263][343476] Avg episode reward: [(0, '445.243')] +[2026-06-07 00:04:17,826][344387] Updated weights for policy 0, policy_version 1470 (0.0012) +[2026-06-07 00:04:20,257][343476] Fps is (10 sec: 2048.1, 60 sec: 2286.9, 300 sec: 2561.7). Total num frames: 755712. Throughput: 0: 2527.5. Samples: 765006. Policy #0 lag: (min: 1.0, avg: 19.7, max: 33.0) +[2026-06-07 00:04:20,258][343476] Avg episode reward: [(0, '431.935')] +[2026-06-07 00:04:21,128][344387] Updated weights for policy 0, policy_version 1480 (0.0018) +[2026-06-07 00:04:22,779][344387] Updated weights for policy 0, policy_version 1492 (0.0015) +[2026-06-07 00:04:25,257][343476] Fps is (10 sec: 2048.1, 60 sec: 2423.5, 300 sec: 2603.4). Total num frames: 768000. Throughput: 0: 2471.0. Samples: 775584. Policy #0 lag: (min: 1.0, avg: 17.4, max: 33.0) +[2026-06-07 00:04:25,259][343476] Avg episode reward: [(0, '393.380')] +[2026-06-07 00:04:26,952][344387] Updated weights for policy 0, policy_version 1503 (0.0012) +[2026-06-07 00:04:30,257][343476] Fps is (10 sec: 1638.4, 60 sec: 2252.8, 300 sec: 2617.3). Total num frames: 772096. Throughput: 0: 2428.5. Samples: 781344. Policy #0 lag: (min: 0.0, avg: 27.4, max: 48.0) +[2026-06-07 00:04:30,259][343476] Avg episode reward: [(0, '345.015')] +[2026-06-07 00:04:30,686][344387] Updated weights for policy 0, policy_version 1514 (0.0014) +[2026-06-07 00:04:31,623][344387] Updated weights for policy 0, policy_version 1524 (0.0013) +[2026-06-07 00:04:35,257][343476] Fps is (10 sec: 1638.4, 60 sec: 2389.3, 300 sec: 2603.4). Total num frames: 784384. Throughput: 0: 2349.5. Samples: 791390. Policy #0 lag: (min: 1.0, avg: 12.8, max: 33.0) +[2026-06-07 00:04:35,261][343476] Avg episode reward: [(0, '408.668')] +[2026-06-07 00:04:36,347][344387] Updated weights for policy 0, policy_version 1534 (0.0013) +[2026-06-07 00:04:39,375][344387] Updated weights for policy 0, policy_version 1544 (0.0012) +[2026-06-07 00:04:40,257][343476] Fps is (10 sec: 2048.0, 60 sec: 2286.9, 300 sec: 2617.3). Total num frames: 792576. Throughput: 0: 2288.7. Samples: 802972. Policy #0 lag: (min: 5.0, avg: 16.2, max: 39.0) +[2026-06-07 00:04:40,259][343476] Avg episode reward: [(0, '392.288')] +[2026-06-07 00:04:40,652][344387] Updated weights for policy 0, policy_version 1554 (0.0012) +[2026-06-07 00:04:43,121][344387] Updated weights for policy 0, policy_version 1565 (0.0008) +[2026-06-07 00:04:45,001][344387] Updated weights for policy 0, policy_version 1577 (0.0007) +[2026-06-07 00:04:45,258][343476] Fps is (10 sec: 2457.5, 60 sec: 2321.0, 300 sec: 2631.2). Total num frames: 808960. Throughput: 0: 2325.9. Samples: 812188. Policy #0 lag: (min: 4.0, avg: 25.4, max: 36.0) +[2026-06-07 00:04:45,262][343476] Avg episode reward: [(0, '346.665')] +[2026-06-07 00:04:46,531][344387] Updated weights for policy 0, policy_version 1594 (0.0009) +[2026-06-07 00:04:48,916][344387] Updated weights for policy 0, policy_version 1604 (0.0008) +[2026-06-07 00:04:50,257][343476] Fps is (10 sec: 3276.8, 60 sec: 2457.6, 300 sec: 2638.1). Total num frames: 825344. Throughput: 0: 2381.2. Samples: 831866. Policy #0 lag: (min: 6.0, avg: 17.8, max: 38.0) +[2026-06-07 00:04:50,260][343476] Avg episode reward: [(0, '443.879')] +[2026-06-07 00:04:50,984][344387] Updated weights for policy 0, policy_version 1622 (0.0010) +[2026-06-07 00:04:53,382][344387] Updated weights for policy 0, policy_version 1632 (0.0007) +[2026-06-07 00:04:55,258][343476] Fps is (10 sec: 3276.9, 60 sec: 2560.0, 300 sec: 2665.9). Total num frames: 841728. Throughput: 0: 2431.6. Samples: 851766. Policy #0 lag: (min: 2.0, avg: 26.7, max: 40.0) +[2026-06-07 00:04:55,262][343476] Avg episode reward: [(0, '423.516')] +[2026-06-07 00:04:55,496][344387] Updated weights for policy 0, policy_version 1648 (0.0009) +[2026-06-07 00:04:56,650][344387] Updated weights for policy 0, policy_version 1660 (0.0009) +[2026-06-07 00:04:59,715][344304] Signal inference workers to stop experience collection... (250 times) +[2026-06-07 00:04:59,716][344304] Signal inference workers to resume experience collection... (250 times) +[2026-06-07 00:04:59,731][344387] InferenceWorker_p0-w0: stopping experience collection (250 times) +[2026-06-07 00:04:59,732][344387] InferenceWorker_p0-w0: resuming experience collection (250 times) +[2026-06-07 00:05:00,087][344387] Updated weights for policy 0, policy_version 1672 (0.0009) +[2026-06-07 00:05:00,257][343476] Fps is (10 sec: 3071.9, 60 sec: 2525.9, 300 sec: 2665.9). Total num frames: 856064. Throughput: 0: 2390.9. Samples: 859562. Policy #0 lag: (min: 4.0, avg: 17.6, max: 39.0) +[2026-06-07 00:05:00,264][343476] Avg episode reward: [(0, '438.545')] +[2026-06-07 00:05:01,422][344387] Updated weights for policy 0, policy_version 1687 (0.0009) +[2026-06-07 00:05:04,897][344387] Updated weights for policy 0, policy_version 1697 (0.0009) +[2026-06-07 00:05:05,257][343476] Fps is (10 sec: 2867.2, 60 sec: 2525.9, 300 sec: 2665.9). Total num frames: 870400. Throughput: 0: 2519.8. Samples: 878396. Policy #0 lag: (min: 1.0, avg: 14.0, max: 33.0) +[2026-06-07 00:05:05,260][343476] Avg episode reward: [(0, '505.072')] +[2026-06-07 00:05:05,582][344304] Saving new best policy, reward=505.072! +[2026-06-07 00:05:06,735][344387] Updated weights for policy 0, policy_version 1713 (0.0009) +[2026-06-07 00:05:07,697][344387] Updated weights for policy 0, policy_version 1724 (0.0008) +[2026-06-07 00:05:10,257][343476] Fps is (10 sec: 2867.3, 60 sec: 2491.7, 300 sec: 2665.9). Total num frames: 884736. Throughput: 0: 2678.5. Samples: 896116. Policy #0 lag: (min: 4.0, avg: 26.1, max: 35.0) +[2026-06-07 00:05:10,259][343476] Avg episode reward: [(0, '418.423')] +[2026-06-07 00:05:11,061][344387] Updated weights for policy 0, policy_version 1736 (0.0008) +[2026-06-07 00:05:12,408][344387] Updated weights for policy 0, policy_version 1752 (0.0010) +[2026-06-07 00:05:15,258][343476] Fps is (10 sec: 2867.1, 60 sec: 2525.9, 300 sec: 2658.9). Total num frames: 899072. Throughput: 0: 2736.2. Samples: 904474. Policy #0 lag: (min: 6.0, avg: 17.9, max: 39.0) +[2026-06-07 00:05:15,261][343476] Avg episode reward: [(0, '431.961')] +[2026-06-07 00:05:16,934][344387] Updated weights for policy 0, policy_version 1768 (0.0010) +[2026-06-07 00:05:19,046][344387] Updated weights for policy 0, policy_version 1787 (0.0010) +[2026-06-07 00:05:20,259][343476] Fps is (10 sec: 3071.5, 60 sec: 2662.3, 300 sec: 2665.9). Total num frames: 915456. Throughput: 0: 2908.0. Samples: 922254. Policy #0 lag: (min: 15.0, avg: 26.4, max: 43.0) +[2026-06-07 00:05:20,262][343476] Avg episode reward: [(0, '432.387')] +[2026-06-07 00:05:21,950][344387] Updated weights for policy 0, policy_version 1797 (0.0009) +[2026-06-07 00:05:24,161][344387] Updated weights for policy 0, policy_version 1817 (0.0009) +[2026-06-07 00:05:25,258][343476] Fps is (10 sec: 3276.7, 60 sec: 2730.6, 300 sec: 2672.8). Total num frames: 931840. Throughput: 0: 3059.6. Samples: 940656. Policy #0 lag: (min: 9.0, avg: 21.0, max: 43.0) +[2026-06-07 00:05:25,261][343476] Avg episode reward: [(0, '433.742')] +[2026-06-07 00:05:28,133][344387] Updated weights for policy 0, policy_version 1833 (0.0010) +[2026-06-07 00:05:30,167][344387] Updated weights for policy 0, policy_version 1852 (0.0048) +[2026-06-07 00:05:30,257][343476] Fps is (10 sec: 3277.3, 60 sec: 2935.5, 300 sec: 2693.6). Total num frames: 948224. Throughput: 0: 3092.1. Samples: 951332. Policy #0 lag: (min: 15.0, avg: 24.8, max: 43.0) +[2026-06-07 00:05:30,261][343476] Avg episode reward: [(0, '465.220')] +[2026-06-07 00:05:34,935][344387] Updated weights for policy 0, policy_version 1863 (0.0011) +[2026-06-07 00:05:35,257][343476] Fps is (10 sec: 2252.9, 60 sec: 2833.1, 300 sec: 2665.9). Total num frames: 954368. Throughput: 0: 2898.5. Samples: 962298. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:05:35,259][343476] Avg episode reward: [(0, '496.705')] +[2026-06-07 00:05:36,175][344387] Updated weights for policy 0, policy_version 1874 (0.0012) +[2026-06-07 00:05:40,221][344387] Updated weights for policy 0, policy_version 1885 (0.0013) +[2026-06-07 00:05:40,257][343476] Fps is (10 sec: 1638.4, 60 sec: 2867.2, 300 sec: 2658.9). Total num frames: 964608. Throughput: 0: 2763.4. Samples: 976118. Policy #0 lag: (min: 1.0, avg: 22.7, max: 45.0) +[2026-06-07 00:05:40,259][343476] Avg episode reward: [(0, '483.392')] +[2026-06-07 00:05:42,392][344387] Updated weights for policy 0, policy_version 1895 (0.0011) +[2026-06-07 00:05:44,019][344387] Updated weights for policy 0, policy_version 1912 (0.0011) +[2026-06-07 00:05:45,258][343476] Fps is (10 sec: 2662.3, 60 sec: 2867.2, 300 sec: 2658.9). Total num frames: 980992. Throughput: 0: 2743.6. Samples: 983024. Policy #0 lag: (min: 3.0, avg: 14.0, max: 35.0) +[2026-06-07 00:05:45,260][343476] Avg episode reward: [(0, '492.516')] +[2026-06-07 00:05:48,031][344387] Updated weights for policy 0, policy_version 1922 (0.0009) +[2026-06-07 00:05:50,193][344387] Updated weights for policy 0, policy_version 1938 (0.0015) +[2026-06-07 00:05:50,257][343476] Fps is (10 sec: 2867.2, 60 sec: 2798.9, 300 sec: 2645.0). Total num frames: 993280. Throughput: 0: 2663.6. Samples: 998260. Policy #0 lag: (min: 0.0, avg: 22.6, max: 36.0) +[2026-06-07 00:05:50,260][343476] Avg episode reward: [(0, '553.365')] +[2026-06-07 00:05:50,491][344304] Saving new best policy, reward=553.365! +[2026-06-07 00:05:53,445][344387] Updated weights for policy 0, policy_version 1949 (0.0012) +[2026-06-07 00:05:55,259][344387] Updated weights for policy 0, policy_version 1960 (0.0011) +[2026-06-07 00:05:55,264][343476] Fps is (10 sec: 2251.3, 60 sec: 2696.2, 300 sec: 2631.1). Total num frames: 1003520. Throughput: 0: 2623.2. Samples: 1014178. Policy #0 lag: (min: 3.0, avg: 16.0, max: 39.0) +[2026-06-07 00:05:55,267][343476] Avg episode reward: [(0, '451.742')] +[2026-06-07 00:05:57,144][344387] Updated weights for policy 0, policy_version 1977 (0.0009) +[2026-06-07 00:06:00,258][343476] Fps is (10 sec: 2252.7, 60 sec: 2662.4, 300 sec: 2624.2). Total num frames: 1015808. Throughput: 0: 2600.4. Samples: 1021490. Policy #0 lag: (min: 3.0, avg: 16.8, max: 35.0) +[2026-06-07 00:06:00,261][343476] Avg episode reward: [(0, '472.857')] +[2026-06-07 00:06:00,572][344387] Updated weights for policy 0, policy_version 1987 (0.0009) +[2026-06-07 00:06:02,579][344304] Signal inference workers to stop experience collection... (300 times) +[2026-06-07 00:06:02,611][344387] InferenceWorker_p0-w0: stopping experience collection (300 times) +[2026-06-07 00:06:02,613][344387] Updated weights for policy 0, policy_version 2001 (0.0010) +[2026-06-07 00:06:02,733][344304] Signal inference workers to resume experience collection... (300 times) +[2026-06-07 00:06:02,734][344387] InferenceWorker_p0-w0: resuming experience collection (300 times) +[2026-06-07 00:06:05,258][343476] Fps is (10 sec: 2664.0, 60 sec: 2662.4, 300 sec: 2638.1). Total num frames: 1030144. Throughput: 0: 2548.0. Samples: 1036910. Policy #0 lag: (min: 3.0, avg: 25.0, max: 35.0) +[2026-06-07 00:06:05,264][343476] Avg episode reward: [(0, '512.599')] +[2026-06-07 00:06:05,682][344387] Updated weights for policy 0, policy_version 2013 (0.0009) +[2026-06-07 00:06:07,128][344387] Updated weights for policy 0, policy_version 2024 (0.0008) +[2026-06-07 00:06:08,774][344387] Updated weights for policy 0, policy_version 2042 (0.0009) +[2026-06-07 00:06:10,257][343476] Fps is (10 sec: 3072.0, 60 sec: 2696.5, 300 sec: 2652.0). Total num frames: 1046528. Throughput: 0: 2568.7. Samples: 1056248. Policy #0 lag: (min: 7.0, avg: 17.9, max: 39.0) +[2026-06-07 00:06:10,260][343476] Avg episode reward: [(0, '617.115')] +[2026-06-07 00:06:10,266][344304] Saving new best policy, reward=617.115! +[2026-06-07 00:06:11,223][344387] Updated weights for policy 0, policy_version 2052 (0.0008) +[2026-06-07 00:06:12,900][344387] Updated weights for policy 0, policy_version 2070 (0.0009) +[2026-06-07 00:06:15,258][343476] Fps is (10 sec: 3276.9, 60 sec: 2730.7, 300 sec: 2652.0). Total num frames: 1062912. Throughput: 0: 2551.0. Samples: 1066130. Policy #0 lag: (min: 3.0, avg: 16.5, max: 35.0) +[2026-06-07 00:06:15,264][343476] Avg episode reward: [(0, '551.233')] +[2026-06-07 00:06:15,885][344387] Updated weights for policy 0, policy_version 2081 (0.0009) +[2026-06-07 00:06:17,707][344387] Updated weights for policy 0, policy_version 2103 (0.0009) +[2026-06-07 00:06:20,258][343476] Fps is (10 sec: 3481.5, 60 sec: 2764.8, 300 sec: 2665.9). Total num frames: 1081344. Throughput: 0: 2792.5. Samples: 1087960. Policy #0 lag: (min: 6.0, avg: 25.9, max: 38.0) +[2026-06-07 00:06:20,262][343476] Avg episode reward: [(0, '558.180')] +[2026-06-07 00:06:20,312][344387] Updated weights for policy 0, policy_version 2113 (0.0009) +[2026-06-07 00:06:22,364][344387] Updated weights for policy 0, policy_version 2133 (0.0008) +[2026-06-07 00:06:23,953][344387] Updated weights for policy 0, policy_version 2143 (0.0007) +[2026-06-07 00:06:25,259][343476] Fps is (10 sec: 3686.2, 60 sec: 2798.9, 300 sec: 2672.8). Total num frames: 1099776. Throughput: 0: 2998.9. Samples: 1111072. Policy #0 lag: (min: 3.0, avg: 18.2, max: 35.0) +[2026-06-07 00:06:25,263][343476] Avg episode reward: [(0, '544.937')] +[2026-06-07 00:06:25,932][344387] Updated weights for policy 0, policy_version 2161 (0.0010) +[2026-06-07 00:06:26,911][344387] Updated weights for policy 0, policy_version 2172 (0.0008) +[2026-06-07 00:06:29,031][344387] Updated weights for policy 0, policy_version 2184 (0.0007) +[2026-06-07 00:06:30,000][344387] Updated weights for policy 0, policy_version 2198 (0.0011) +[2026-06-07 00:06:30,258][343476] Fps is (10 sec: 4505.7, 60 sec: 2969.6, 300 sec: 2721.4). Total num frames: 1126400. Throughput: 0: 3119.4. Samples: 1123396. Policy #0 lag: (min: 3.0, avg: 16.9, max: 35.0) +[2026-06-07 00:06:30,260][343476] Avg episode reward: [(0, '493.955')] +[2026-06-07 00:06:32,534][344387] Updated weights for policy 0, policy_version 2209 (0.0009) +[2026-06-07 00:06:34,043][344387] Updated weights for policy 0, policy_version 2229 (0.0008) +[2026-06-07 00:06:35,258][343476] Fps is (10 sec: 4505.8, 60 sec: 3174.4, 300 sec: 2749.2). Total num frames: 1144832. Throughput: 0: 3340.5. Samples: 1148584. Policy #0 lag: (min: 1.0, avg: 14.8, max: 33.0) +[2026-06-07 00:06:35,261][343476] Avg episode reward: [(0, '561.505')] +[2026-06-07 00:06:35,723][344387] Updated weights for policy 0, policy_version 2239 (0.0007) +[2026-06-07 00:06:37,241][344387] Updated weights for policy 0, policy_version 2249 (0.0007) +[2026-06-07 00:06:38,013][344387] Updated weights for policy 0, policy_version 2261 (0.0008) +[2026-06-07 00:06:39,639][344387] Updated weights for policy 0, policy_version 2271 (0.0007) +[2026-06-07 00:06:40,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3310.9, 300 sec: 2756.1). Total num frames: 1163264. Throughput: 0: 3547.8. Samples: 1173808. Policy #0 lag: (min: 3.0, avg: 18.1, max: 35.0) +[2026-06-07 00:06:40,265][343476] Avg episode reward: [(0, '484.366')] +[2026-06-07 00:06:41,067][344387] Updated weights for policy 0, policy_version 2281 (0.0007) +[2026-06-07 00:06:42,094][344387] Updated weights for policy 0, policy_version 2293 (0.0016) +[2026-06-07 00:06:43,877][344387] Updated weights for policy 0, policy_version 2304 (0.0008) +[2026-06-07 00:06:45,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3379.2, 300 sec: 2770.0). Total num frames: 1183744. Throughput: 0: 3637.4. Samples: 1185174. Policy #0 lag: (min: 3.0, avg: 18.7, max: 35.0) +[2026-06-07 00:06:45,260][343476] Avg episode reward: [(0, '510.404')] +[2026-06-07 00:06:45,830][344387] Updated weights for policy 0, policy_version 2317 (0.0008) +[2026-06-07 00:06:46,970][344387] Updated weights for policy 0, policy_version 2332 (0.0008) +[2026-06-07 00:06:49,056][344387] Updated weights for policy 0, policy_version 2342 (0.0008) +[2026-06-07 00:06:50,257][343476] Fps is (10 sec: 4301.0, 60 sec: 3549.9, 300 sec: 2797.8). Total num frames: 1206272. Throughput: 0: 3836.3. Samples: 1209542. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 00:06:50,259][343476] Avg episode reward: [(0, '631.983')] +[2026-06-07 00:06:50,315][344387] Updated weights for policy 0, policy_version 2358 (0.0008) +[2026-06-07 00:06:50,345][344304] Saving new best policy, reward=631.983! +[2026-06-07 00:06:52,058][344387] Updated weights for policy 0, policy_version 2368 (0.0007) +[2026-06-07 00:06:54,373][344387] Updated weights for policy 0, policy_version 2385 (0.0008) +[2026-06-07 00:06:55,258][343476] Fps is (10 sec: 4095.9, 60 sec: 3686.8, 300 sec: 2811.7). Total num frames: 1224704. Throughput: 0: 3906.9. Samples: 1232058. Policy #0 lag: (min: 3.0, avg: 19.0, max: 35.0) +[2026-06-07 00:06:55,260][343476] Avg episode reward: [(0, '519.349')] +[2026-06-07 00:06:56,030][344387] Updated weights for policy 0, policy_version 2397 (0.0007) +[2026-06-07 00:06:57,317][344387] Updated weights for policy 0, policy_version 2407 (0.0006) +[2026-06-07 00:06:59,103][344387] Updated weights for policy 0, policy_version 2425 (0.0007) +[2026-06-07 00:07:00,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3822.9, 300 sec: 2832.5). Total num frames: 1245184. Throughput: 0: 3984.2. Samples: 1245418. Policy #0 lag: (min: 3.0, avg: 22.0, max: 39.0) +[2026-06-07 00:07:00,260][343476] Avg episode reward: [(0, '493.002')] +[2026-06-07 00:07:00,809][344387] Updated weights for policy 0, policy_version 2435 (0.0007) +[2026-06-07 00:07:01,972][344387] Updated weights for policy 0, policy_version 2445 (0.0007) +[2026-06-07 00:07:02,935][344387] Updated weights for policy 0, policy_version 2457 (0.0008) +[2026-06-07 00:07:04,822][344387] Updated weights for policy 0, policy_version 2467 (0.0008) +[2026-06-07 00:07:05,258][343476] Fps is (10 sec: 3891.2, 60 sec: 3891.2, 300 sec: 2839.4). Total num frames: 1263616. Throughput: 0: 4036.2. Samples: 1269590. Policy #0 lag: (min: 6.0, avg: 25.4, max: 38.0) +[2026-06-07 00:07:05,264][343476] Avg episode reward: [(0, '553.654')] +[2026-06-07 00:07:07,033][344304] Signal inference workers to stop experience collection... (350 times) +[2026-06-07 00:07:07,034][344304] Signal inference workers to resume experience collection... (350 times) +[2026-06-07 00:07:07,074][344387] InferenceWorker_p0-w0: stopping experience collection (350 times) +[2026-06-07 00:07:07,074][344387] InferenceWorker_p0-w0: resuming experience collection (350 times) +[2026-06-07 00:07:07,381][344387] Updated weights for policy 0, policy_version 2488 (0.0008) +[2026-06-07 00:07:09,946][344387] Updated weights for policy 0, policy_version 2499 (0.0011) +[2026-06-07 00:07:10,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3891.2, 300 sec: 2839.4). Total num frames: 1280000. Throughput: 0: 3965.4. Samples: 1289512. Policy #0 lag: (min: 5.0, avg: 22.1, max: 32.0) +[2026-06-07 00:07:10,261][343476] Avg episode reward: [(0, '555.080')] +[2026-06-07 00:07:11,843][344387] Updated weights for policy 0, policy_version 2512 (0.0011) +[2026-06-07 00:07:13,120][344387] Updated weights for policy 0, policy_version 2523 (0.0010) +[2026-06-07 00:07:15,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3857.1, 300 sec: 2839.4). Total num frames: 1294336. Throughput: 0: 3880.9. Samples: 1298036. Policy #0 lag: (min: 3.0, avg: 19.3, max: 39.0) +[2026-06-07 00:07:15,260][343476] Avg episode reward: [(0, '506.203')] +[2026-06-07 00:07:17,056][344387] Updated weights for policy 0, policy_version 2540 (0.0009) +[2026-06-07 00:07:18,242][344387] Updated weights for policy 0, policy_version 2555 (0.0117) +[2026-06-07 00:07:20,030][344387] Updated weights for policy 0, policy_version 2565 (0.0008) +[2026-06-07 00:07:20,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3891.2, 300 sec: 2853.3). Total num frames: 1314816. Throughput: 0: 3789.1. Samples: 1319092. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 00:07:20,259][343476] Avg episode reward: [(0, '510.971')] +[2026-06-07 00:07:21,861][344387] Updated weights for policy 0, policy_version 2581 (0.0007) +[2026-06-07 00:07:23,187][344387] Updated weights for policy 0, policy_version 2593 (0.0007) +[2026-06-07 00:07:25,082][344387] Updated weights for policy 0, policy_version 2612 (0.0008) +[2026-06-07 00:07:25,258][343476] Fps is (10 sec: 4505.3, 60 sec: 3993.6, 300 sec: 2888.0). Total num frames: 1339392. Throughput: 0: 3826.4. Samples: 1345998. Policy #0 lag: (min: 1.0, avg: 17.0, max: 33.0) +[2026-06-07 00:07:25,261][343476] Avg episode reward: [(0, '615.721')] +[2026-06-07 00:07:27,645][344387] Updated weights for policy 0, policy_version 2624 (0.0013) +[2026-06-07 00:07:29,982][344387] Updated weights for policy 0, policy_version 2634 (0.0011) +[2026-06-07 00:07:30,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3720.6, 300 sec: 2867.2). Total num frames: 1349632. Throughput: 0: 3748.3. Samples: 1353848. Policy #0 lag: (min: 3.0, avg: 19.1, max: 35.0) +[2026-06-07 00:07:30,259][343476] Avg episode reward: [(0, '665.901')] +[2026-06-07 00:07:30,393][344304] Saving new best policy, reward=665.901! +[2026-06-07 00:07:31,147][344387] Updated weights for policy 0, policy_version 2645 (0.0010) +[2026-06-07 00:07:33,851][344387] Updated weights for policy 0, policy_version 2655 (0.0010) +[2026-06-07 00:07:35,257][343476] Fps is (10 sec: 2457.7, 60 sec: 3652.3, 300 sec: 2867.2). Total num frames: 1363968. Throughput: 0: 3561.5. Samples: 1369808. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 00:07:35,260][343476] Avg episode reward: [(0, '596.028')] +[2026-06-07 00:07:35,604][344387] Updated weights for policy 0, policy_version 2665 (0.0009) +[2026-06-07 00:07:36,839][344387] Updated weights for policy 0, policy_version 2677 (0.0011) +[2026-06-07 00:07:39,557][344387] Updated weights for policy 0, policy_version 2687 (0.0010) +[2026-06-07 00:07:40,262][343476] Fps is (10 sec: 2865.9, 60 sec: 3583.8, 300 sec: 2867.2). Total num frames: 1378304. Throughput: 0: 3439.5. Samples: 1386848. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 00:07:40,265][343476] Avg episode reward: [(0, '632.109')] +[2026-06-07 00:07:41,284][344387] Updated weights for policy 0, policy_version 2697 (0.0010) +[2026-06-07 00:07:42,445][344387] Updated weights for policy 0, policy_version 2710 (0.0007) +[2026-06-07 00:07:44,516][344387] Updated weights for policy 0, policy_version 2721 (0.0008) +[2026-06-07 00:07:45,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3549.9, 300 sec: 2888.0). Total num frames: 1396736. Throughput: 0: 3377.1. Samples: 1397386. Policy #0 lag: (min: 5.0, avg: 17.5, max: 37.0) +[2026-06-07 00:07:45,259][343476] Avg episode reward: [(0, '686.173')] +[2026-06-07 00:07:45,264][344304] Saving new best policy, reward=686.173! +[2026-06-07 00:07:45,814][344387] Updated weights for policy 0, policy_version 2731 (0.0008) +[2026-06-07 00:07:47,216][344387] Updated weights for policy 0, policy_version 2742 (0.0010) +[2026-06-07 00:07:49,143][344387] Updated weights for policy 0, policy_version 2752 (0.0009) +[2026-06-07 00:07:50,258][343476] Fps is (10 sec: 3278.2, 60 sec: 3413.3, 300 sec: 2888.0). Total num frames: 1411072. Throughput: 0: 3296.5. Samples: 1417932. Policy #0 lag: (min: 4.0, avg: 19.3, max: 36.0) +[2026-06-07 00:07:50,266][343476] Avg episode reward: [(0, '611.160')] +[2026-06-07 00:07:50,869][344387] Updated weights for policy 0, policy_version 2762 (0.0009) +[2026-06-07 00:07:52,020][344387] Updated weights for policy 0, policy_version 2772 (0.0012) +[2026-06-07 00:07:54,466][344387] Updated weights for policy 0, policy_version 2782 (0.0008) +[2026-06-07 00:07:55,257][343476] Fps is (10 sec: 3071.9, 60 sec: 3379.2, 300 sec: 2888.0). Total num frames: 1427456. Throughput: 0: 3261.4. Samples: 1436274. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 00:07:55,261][343476] Avg episode reward: [(0, '652.875')] +[2026-06-07 00:07:55,483][344387] Updated weights for policy 0, policy_version 2792 (0.0008) +[2026-06-07 00:07:56,715][344387] Updated weights for policy 0, policy_version 2802 (0.0008) +[2026-06-07 00:07:58,036][344387] Updated weights for policy 0, policy_version 2812 (0.0007) +[2026-06-07 00:07:59,988][344387] Updated weights for policy 0, policy_version 2824 (0.0010) +[2026-06-07 00:08:00,260][343476] Fps is (10 sec: 3481.1, 60 sec: 3345.0, 300 sec: 2908.8). Total num frames: 1445888. Throughput: 0: 3331.3. Samples: 1447948. Policy #0 lag: (min: 5.0, avg: 22.8, max: 38.0) +[2026-06-07 00:08:00,272][343476] Avg episode reward: [(0, '653.979')] +[2026-06-07 00:08:01,461][344387] Updated weights for policy 0, policy_version 2834 (0.0008) +[2026-06-07 00:08:03,563][344387] Updated weights for policy 0, policy_version 2845 (0.0010) +[2026-06-07 00:08:04,923][344387] Updated weights for policy 0, policy_version 2856 (0.0010) +[2026-06-07 00:08:05,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3311.0, 300 sec: 2929.7). Total num frames: 1462272. Throughput: 0: 3311.7. Samples: 1468116. Policy #0 lag: (min: 4.0, avg: 20.5, max: 36.0) +[2026-06-07 00:08:05,259][343476] Avg episode reward: [(0, '677.813')] +[2026-06-07 00:08:06,328][344387] Updated weights for policy 0, policy_version 2866 (0.0011) +[2026-06-07 00:08:08,332][344387] Updated weights for policy 0, policy_version 2877 (0.0010) +[2026-06-07 00:08:09,380][344387] Updated weights for policy 0, policy_version 2887 (0.0008) +[2026-06-07 00:08:10,258][343476] Fps is (10 sec: 3686.8, 60 sec: 3379.2, 300 sec: 2971.3). Total num frames: 1482752. Throughput: 0: 3191.4. Samples: 1489608. Policy #0 lag: (min: 4.0, avg: 18.3, max: 36.0) +[2026-06-07 00:08:10,264][343476] Avg episode reward: [(0, '669.732')] +[2026-06-07 00:08:10,595][344387] Updated weights for policy 0, policy_version 2897 (0.0007) +[2026-06-07 00:08:12,019][344387] Updated weights for policy 0, policy_version 2907 (0.0008) +[2026-06-07 00:08:13,765][344387] Updated weights for policy 0, policy_version 2917 (0.0007) +[2026-06-07 00:08:14,617][344387] Updated weights for policy 0, policy_version 2927 (0.0008) +[2026-06-07 00:08:15,257][343476] Fps is (10 sec: 3891.1, 60 sec: 3447.5, 300 sec: 2992.2). Total num frames: 1501184. Throughput: 0: 3265.9. Samples: 1500814. Policy #0 lag: (min: 3.0, avg: 18.8, max: 35.0) +[2026-06-07 00:08:15,260][343476] Avg episode reward: [(0, '552.152')] +[2026-06-07 00:08:16,526][344387] Updated weights for policy 0, policy_version 2937 (0.0007) +[2026-06-07 00:08:17,483][344387] Updated weights for policy 0, policy_version 2948 (0.0009) +[2026-06-07 00:08:20,000][344387] Updated weights for policy 0, policy_version 2961 (0.0011) +[2026-06-07 00:08:20,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3379.2, 300 sec: 3033.8). Total num frames: 1517568. Throughput: 0: 3372.7. Samples: 1521578. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:08:20,261][343476] Avg episode reward: [(0, '651.385')] +[2026-06-07 00:08:21,562][344387] Updated weights for policy 0, policy_version 2971 (0.0009) +[2026-06-07 00:08:23,705][344387] Updated weights for policy 0, policy_version 2984 (0.0009) +[2026-06-07 00:08:25,095][344387] Updated weights for policy 0, policy_version 2994 (0.0009) +[2026-06-07 00:08:25,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3242.7, 300 sec: 3040.8). Total num frames: 1533952. Throughput: 0: 3424.4. Samples: 1540932. Policy #0 lag: (min: 1.0, avg: 17.3, max: 36.0) +[2026-06-07 00:08:25,260][343476] Avg episode reward: [(0, '559.613')] +[2026-06-07 00:08:26,595][344387] Updated weights for policy 0, policy_version 3004 (0.0009) +[2026-06-07 00:08:28,225][344387] Updated weights for policy 0, policy_version 3014 (0.0008) +[2026-06-07 00:08:29,603][344387] Updated weights for policy 0, policy_version 3025 (0.0009) +[2026-06-07 00:08:30,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3345.0, 300 sec: 3082.4). Total num frames: 1550336. Throughput: 0: 3437.5. Samples: 1552076. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:08:30,260][343476] Avg episode reward: [(0, '647.789')] +[2026-06-07 00:08:31,042][344387] Updated weights for policy 0, policy_version 3036 (0.0010) +[2026-06-07 00:08:32,751][344387] Updated weights for policy 0, policy_version 3048 (0.0010) +[2026-06-07 00:08:34,302][344387] Updated weights for policy 0, policy_version 3059 (0.0009) +[2026-06-07 00:08:35,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3413.3, 300 sec: 3096.3). Total num frames: 1568768. Throughput: 0: 3452.8. Samples: 1573308. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:08:35,261][343476] Avg episode reward: [(0, '524.009')] +[2026-06-07 00:08:36,054][344387] Updated weights for policy 0, policy_version 3069 (0.0008) +[2026-06-07 00:08:37,084][344387] Updated weights for policy 0, policy_version 3079 (0.0007) +[2026-06-07 00:08:38,370][344387] Updated weights for policy 0, policy_version 3089 (0.0009) +[2026-06-07 00:08:39,604][344387] Updated weights for policy 0, policy_version 3099 (0.0007) +[2026-06-07 00:08:40,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3481.8, 300 sec: 3110.2). Total num frames: 1587200. Throughput: 0: 3565.8. Samples: 1596738. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 00:08:40,260][343476] Avg episode reward: [(0, '751.608')] +[2026-06-07 00:08:40,268][344304] Saving new best policy, reward=751.608! +[2026-06-07 00:08:41,927][344387] Updated weights for policy 0, policy_version 3112 (0.0008) +[2026-06-07 00:08:43,067][344387] Updated weights for policy 0, policy_version 3124 (0.0010) +[2026-06-07 00:08:45,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3447.4, 300 sec: 3138.0). Total num frames: 1603584. Throughput: 0: 3539.7. Samples: 1607232. Policy #0 lag: (min: 3.0, avg: 21.0, max: 35.0) +[2026-06-07 00:08:45,261][343476] Avg episode reward: [(0, '718.913')] +[2026-06-07 00:08:45,265][344387] Updated weights for policy 0, policy_version 3134 (0.0010) +[2026-06-07 00:08:46,590][344387] Updated weights for policy 0, policy_version 3146 (0.0007) +[2026-06-07 00:08:47,967][344387] Updated weights for policy 0, policy_version 3157 (0.0010) +[2026-06-07 00:08:49,998][344387] Updated weights for policy 0, policy_version 3170 (0.0012) +[2026-06-07 00:08:50,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3549.9, 300 sec: 3172.7). Total num frames: 1624064. Throughput: 0: 3576.7. Samples: 1629070. Policy #0 lag: (min: 4.0, avg: 20.5, max: 36.0) +[2026-06-07 00:08:50,264][343476] Avg episode reward: [(0, '609.808')] +[2026-06-07 00:08:51,472][344387] Updated weights for policy 0, policy_version 3183 (0.0011) +[2026-06-07 00:08:53,220][344387] Updated weights for policy 0, policy_version 3193 (0.0007) +[2026-06-07 00:08:54,521][344387] Updated weights for policy 0, policy_version 3204 (0.0013) +[2026-06-07 00:08:55,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3549.8, 300 sec: 3172.7). Total num frames: 1640448. Throughput: 0: 3571.5. Samples: 1650326. Policy #0 lag: (min: 3.0, avg: 21.6, max: 43.0) +[2026-06-07 00:08:55,261][343476] Avg episode reward: [(0, '692.392')] +[2026-06-07 00:08:55,401][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000003208_1642496.pth... +[2026-06-07 00:08:56,027][344387] Updated weights for policy 0, policy_version 3214 (0.0013) +[2026-06-07 00:08:57,189][344387] Updated weights for policy 0, policy_version 3224 (0.0008) +[2026-06-07 00:08:59,276][344387] Updated weights for policy 0, policy_version 3234 (0.0008) +[2026-06-07 00:09:00,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3550.0, 300 sec: 3186.5). Total num frames: 1658880. Throughput: 0: 3553.7. Samples: 1660730. Policy #0 lag: (min: 2.0, avg: 19.8, max: 38.0) +[2026-06-07 00:09:00,262][343476] Avg episode reward: [(0, '560.245')] +[2026-06-07 00:09:00,779][344387] Updated weights for policy 0, policy_version 3246 (0.0010) +[2026-06-07 00:09:01,894][344387] Updated weights for policy 0, policy_version 3256 (0.0008) +[2026-06-07 00:09:03,742][344387] Updated weights for policy 0, policy_version 3266 (0.0007) +[2026-06-07 00:09:05,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3584.0, 300 sec: 3193.5). Total num frames: 1677312. Throughput: 0: 3565.0. Samples: 1682002. Policy #0 lag: (min: 1.0, avg: 16.7, max: 33.0) +[2026-06-07 00:09:05,264][343476] Avg episode reward: [(0, '620.731')] +[2026-06-07 00:09:05,337][344387] Updated weights for policy 0, policy_version 3278 (0.0008) +[2026-06-07 00:09:07,456][344387] Updated weights for policy 0, policy_version 3289 (0.0009) +[2026-06-07 00:09:09,142][344387] Updated weights for policy 0, policy_version 3300 (0.0009) +[2026-06-07 00:09:10,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3481.6, 300 sec: 3200.4). Total num frames: 1691648. Throughput: 0: 3553.2. Samples: 1700824. Policy #0 lag: (min: 3.0, avg: 18.3, max: 35.0) +[2026-06-07 00:09:10,260][343476] Avg episode reward: [(0, '598.640')] +[2026-06-07 00:09:10,845][344387] Updated weights for policy 0, policy_version 3312 (0.0008) +[2026-06-07 00:09:12,905][344387] Updated weights for policy 0, policy_version 3323 (0.0011) +[2026-06-07 00:09:15,237][344387] Updated weights for policy 0, policy_version 3337 (0.0011) +[2026-06-07 00:09:15,258][343476] Fps is (10 sec: 3071.8, 60 sec: 3447.4, 300 sec: 3228.2). Total num frames: 1708032. Throughput: 0: 3515.1. Samples: 1710256. Policy #0 lag: (min: 3.0, avg: 17.9, max: 35.0) +[2026-06-07 00:09:15,262][343476] Avg episode reward: [(0, '720.343')] +[2026-06-07 00:09:16,192][344387] Updated weights for policy 0, policy_version 3347 (0.0010) +[2026-06-07 00:09:18,421][344387] Updated weights for policy 0, policy_version 3358 (0.0012) +[2026-06-07 00:09:19,882][344387] Updated weights for policy 0, policy_version 3370 (0.0011) +[2026-06-07 00:09:20,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3481.6, 300 sec: 3249.0). Total num frames: 1726464. Throughput: 0: 3508.9. Samples: 1731206. Policy #0 lag: (min: 1.0, avg: 17.0, max: 37.0) +[2026-06-07 00:09:20,260][343476] Avg episode reward: [(0, '624.445')] +[2026-06-07 00:09:21,388][344387] Updated weights for policy 0, policy_version 3381 (0.0009) +[2026-06-07 00:09:23,005][344387] Updated weights for policy 0, policy_version 3392 (0.0008) +[2026-06-07 00:09:24,326][344387] Updated weights for policy 0, policy_version 3403 (0.0010) +[2026-06-07 00:09:25,261][343476] Fps is (10 sec: 3685.4, 60 sec: 3515.6, 300 sec: 3297.6). Total num frames: 1744896. Throughput: 0: 3476.7. Samples: 1753202. Policy #0 lag: (min: 3.0, avg: 17.7, max: 35.0) +[2026-06-07 00:09:25,265][343476] Avg episode reward: [(0, '691.033')] +[2026-06-07 00:09:25,881][344387] Updated weights for policy 0, policy_version 3415 (0.0011) +[2026-06-07 00:09:28,215][344387] Updated weights for policy 0, policy_version 3427 (0.0010) +[2026-06-07 00:09:30,048][344387] Updated weights for policy 0, policy_version 3440 (0.0013) +[2026-06-07 00:09:30,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3515.7, 300 sec: 3311.5). Total num frames: 1761280. Throughput: 0: 3447.9. Samples: 1762386. Policy #0 lag: (min: 3.0, avg: 17.0, max: 35.0) +[2026-06-07 00:09:30,259][343476] Avg episode reward: [(0, '670.177')] +[2026-06-07 00:09:31,856][344387] Updated weights for policy 0, policy_version 3452 (0.0009) +[2026-06-07 00:09:33,908][344387] Updated weights for policy 0, policy_version 3462 (0.0009) +[2026-06-07 00:09:35,165][344387] Updated weights for policy 0, policy_version 3473 (0.0012) +[2026-06-07 00:09:35,258][343476] Fps is (10 sec: 3482.8, 60 sec: 3515.7, 300 sec: 3346.2). Total num frames: 1779712. Throughput: 0: 3409.8. Samples: 1782510. Policy #0 lag: (min: 3.0, avg: 17.4, max: 35.0) +[2026-06-07 00:09:35,262][343476] Avg episode reward: [(0, '662.972')] +[2026-06-07 00:09:36,592][344387] Updated weights for policy 0, policy_version 3484 (0.0013) +[2026-06-07 00:09:38,490][344387] Updated weights for policy 0, policy_version 3494 (0.0008) +[2026-06-07 00:09:39,293][344387] Updated weights for policy 0, policy_version 3504 (0.0007) +[2026-06-07 00:09:40,258][343476] Fps is (10 sec: 3686.1, 60 sec: 3515.7, 300 sec: 3353.2). Total num frames: 1798144. Throughput: 0: 3421.6. Samples: 1804300. Policy #0 lag: (min: 1.0, avg: 15.1, max: 33.0) +[2026-06-07 00:09:40,267][343476] Avg episode reward: [(0, '638.094')] +[2026-06-07 00:09:40,908][344387] Updated weights for policy 0, policy_version 3514 (0.0008) +[2026-06-07 00:09:42,783][344387] Updated weights for policy 0, policy_version 3526 (0.0009) +[2026-06-07 00:09:44,038][344387] Updated weights for policy 0, policy_version 3538 (0.0008) +[2026-06-07 00:09:45,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3515.7, 300 sec: 3353.2). Total num frames: 1814528. Throughput: 0: 3441.6. Samples: 1815602. Policy #0 lag: (min: 3.0, avg: 16.7, max: 35.0) +[2026-06-07 00:09:45,260][343476] Avg episode reward: [(0, '680.985')] +[2026-06-07 00:09:45,473][344387] Updated weights for policy 0, policy_version 3548 (0.0007) +[2026-06-07 00:09:47,574][344387] Updated weights for policy 0, policy_version 3560 (0.0010) +[2026-06-07 00:09:48,379][344387] Updated weights for policy 0, policy_version 3570 (0.0008) +[2026-06-07 00:09:49,829][344387] Updated weights for policy 0, policy_version 3580 (0.0008) +[2026-06-07 00:09:50,258][343476] Fps is (10 sec: 3481.8, 60 sec: 3481.6, 300 sec: 3360.1). Total num frames: 1832960. Throughput: 0: 3464.3. Samples: 1837896. Policy #0 lag: (min: 0.0, avg: 16.5, max: 32.0) +[2026-06-07 00:09:50,263][343476] Avg episode reward: [(0, '606.672')] +[2026-06-07 00:09:51,635][344387] Updated weights for policy 0, policy_version 3591 (0.0008) +[2026-06-07 00:09:52,710][344387] Updated weights for policy 0, policy_version 3601 (0.0008) +[2026-06-07 00:09:54,016][344387] Updated weights for policy 0, policy_version 3611 (0.0007) +[2026-06-07 00:09:55,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3549.9, 300 sec: 3380.9). Total num frames: 1853440. Throughput: 0: 3559.4. Samples: 1860996. Policy #0 lag: (min: 7.0, avg: 19.4, max: 39.0) +[2026-06-07 00:09:55,259][343476] Avg episode reward: [(0, '722.667')] +[2026-06-07 00:09:56,122][344387] Updated weights for policy 0, policy_version 3622 (0.0011) +[2026-06-07 00:09:57,030][344387] Updated weights for policy 0, policy_version 3635 (0.0010) +[2026-06-07 00:09:59,132][344387] Updated weights for policy 0, policy_version 3646 (0.0008) +[2026-06-07 00:10:00,073][344387] Updated weights for policy 0, policy_version 3656 (0.0009) +[2026-06-07 00:10:00,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3549.9, 300 sec: 3394.8). Total num frames: 1871872. Throughput: 0: 3597.4. Samples: 1872136. Policy #0 lag: (min: 3.0, avg: 19.4, max: 39.0) +[2026-06-07 00:10:00,260][343476] Avg episode reward: [(0, '653.520')] +[2026-06-07 00:10:01,101][344387] Updated weights for policy 0, policy_version 3666 (0.0008) +[2026-06-07 00:10:02,365][344387] Updated weights for policy 0, policy_version 3676 (0.0008) +[2026-06-07 00:10:04,280][344387] Updated weights for policy 0, policy_version 3686 (0.0009) +[2026-06-07 00:10:04,800][344304] Signal inference workers to stop experience collection... (400 times) +[2026-06-07 00:10:04,828][344387] InferenceWorker_p0-w0: stopping experience collection (400 times) +[2026-06-07 00:10:04,861][344304] Signal inference workers to resume experience collection... (400 times) +[2026-06-07 00:10:04,862][344387] InferenceWorker_p0-w0: resuming experience collection (400 times) +[2026-06-07 00:10:05,258][343476] Fps is (10 sec: 3891.2, 60 sec: 3584.0, 300 sec: 3415.6). Total num frames: 1892352. Throughput: 0: 3660.1. Samples: 1895910. Policy #0 lag: (min: 0.0, avg: 16.4, max: 36.0) +[2026-06-07 00:10:05,263][343476] Avg episode reward: [(0, '697.554')] +[2026-06-07 00:10:05,299][344387] Updated weights for policy 0, policy_version 3697 (0.0009) +[2026-06-07 00:10:06,523][344387] Updated weights for policy 0, policy_version 3707 (0.0007) +[2026-06-07 00:10:08,181][344387] Updated weights for policy 0, policy_version 3717 (0.0009) +[2026-06-07 00:10:08,874][344387] Updated weights for policy 0, policy_version 3727 (0.0008) +[2026-06-07 00:10:10,258][343476] Fps is (10 sec: 4095.8, 60 sec: 3686.4, 300 sec: 3436.5). Total num frames: 1912832. Throughput: 0: 3718.9. Samples: 1920540. Policy #0 lag: (min: 3.0, avg: 18.1, max: 35.0) +[2026-06-07 00:10:10,262][343476] Avg episode reward: [(0, '826.933')] +[2026-06-07 00:10:10,267][344304] Saving new best policy, reward=826.933! +[2026-06-07 00:10:10,442][344387] Updated weights for policy 0, policy_version 3737 (0.0009) +[2026-06-07 00:10:11,816][344387] Updated weights for policy 0, policy_version 3748 (0.0008) +[2026-06-07 00:10:12,989][344387] Updated weights for policy 0, policy_version 3760 (0.0008) +[2026-06-07 00:10:14,377][344387] Updated weights for policy 0, policy_version 3770 (0.0007) +[2026-06-07 00:10:15,258][343476] Fps is (10 sec: 4095.8, 60 sec: 3754.7, 300 sec: 3450.4). Total num frames: 1933312. Throughput: 0: 3786.4. Samples: 1932774. Policy #0 lag: (min: 8.0, avg: 20.6, max: 37.0) +[2026-06-07 00:10:15,261][343476] Avg episode reward: [(0, '793.784')] +[2026-06-07 00:10:15,562][344387] Updated weights for policy 0, policy_version 3780 (0.0007) +[2026-06-07 00:10:16,854][344387] Updated weights for policy 0, policy_version 3790 (0.0008) +[2026-06-07 00:10:17,795][344387] Updated weights for policy 0, policy_version 3800 (0.0007) +[2026-06-07 00:10:19,405][344387] Updated weights for policy 0, policy_version 3810 (0.0007) +[2026-06-07 00:10:20,257][343476] Fps is (10 sec: 4096.1, 60 sec: 3788.8, 300 sec: 3464.2). Total num frames: 1953792. Throughput: 0: 3913.2. Samples: 1958604. Policy #0 lag: (min: 2.0, avg: 23.1, max: 46.0) +[2026-06-07 00:10:20,260][343476] Avg episode reward: [(0, '787.589')] +[2026-06-07 00:10:20,340][344387] Updated weights for policy 0, policy_version 3820 (0.0007) +[2026-06-07 00:10:21,591][344387] Updated weights for policy 0, policy_version 3830 (0.0009) +[2026-06-07 00:10:23,040][344387] Updated weights for policy 0, policy_version 3840 (0.0007) +[2026-06-07 00:10:24,257][344387] Updated weights for policy 0, policy_version 3850 (0.0007) +[2026-06-07 00:10:25,259][343476] Fps is (10 sec: 4300.2, 60 sec: 3857.2, 300 sec: 3485.0). Total num frames: 1976320. Throughput: 0: 3978.4. Samples: 1983330. Policy #0 lag: (min: 1.0, avg: 19.0, max: 33.0) +[2026-06-07 00:10:25,263][343476] Avg episode reward: [(0, '685.839')] +[2026-06-07 00:10:25,492][344387] Updated weights for policy 0, policy_version 3861 (0.0009) +[2026-06-07 00:10:28,046][344387] Updated weights for policy 0, policy_version 3873 (0.0009) +[2026-06-07 00:10:28,970][344387] Updated weights for policy 0, policy_version 3884 (0.0010) +[2026-06-07 00:10:30,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3857.1, 300 sec: 3519.8). Total num frames: 1992704. Throughput: 0: 3946.8. Samples: 1993206. Policy #0 lag: (min: 2.0, avg: 19.5, max: 34.0) +[2026-06-07 00:10:30,259][343476] Avg episode reward: [(0, '801.318')] +[2026-06-07 00:10:30,289][344387] Updated weights for policy 0, policy_version 3896 (0.0010) +[2026-06-07 00:10:32,296][344387] Updated weights for policy 0, policy_version 3906 (0.0009) +[2026-06-07 00:10:33,070][344387] Updated weights for policy 0, policy_version 3916 (0.0007) +[2026-06-07 00:10:34,475][344387] Updated weights for policy 0, policy_version 3928 (0.0009) +[2026-06-07 00:10:35,258][343476] Fps is (10 sec: 3687.1, 60 sec: 3891.2, 300 sec: 3554.5). Total num frames: 2013184. Throughput: 0: 3973.4. Samples: 2016700. Policy #0 lag: (min: 3.0, avg: 17.4, max: 35.0) +[2026-06-07 00:10:35,261][343476] Avg episode reward: [(0, '699.285')] +[2026-06-07 00:10:36,363][344387] Updated weights for policy 0, policy_version 3938 (0.0007) +[2026-06-07 00:10:37,197][344387] Updated weights for policy 0, policy_version 3948 (0.0008) +[2026-06-07 00:10:38,858][344387] Updated weights for policy 0, policy_version 3961 (0.0008) +[2026-06-07 00:10:40,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3891.2, 300 sec: 3561.4). Total num frames: 2031616. Throughput: 0: 3998.3. Samples: 2040918. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 00:10:40,262][343476] Avg episode reward: [(0, '741.125')] +[2026-06-07 00:10:40,383][344387] Updated weights for policy 0, policy_version 3971 (0.0009) +[2026-06-07 00:10:41,530][344387] Updated weights for policy 0, policy_version 3981 (0.0008) +[2026-06-07 00:10:43,162][344387] Updated weights for policy 0, policy_version 3992 (0.0009) +[2026-06-07 00:10:45,042][344387] Updated weights for policy 0, policy_version 4002 (0.0008) +[2026-06-07 00:10:45,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3925.3, 300 sec: 3582.3). Total num frames: 2050048. Throughput: 0: 3992.0. Samples: 2051778. Policy #0 lag: (min: 3.0, avg: 21.4, max: 39.0) +[2026-06-07 00:10:45,265][343476] Avg episode reward: [(0, '675.448')] +[2026-06-07 00:10:45,860][344387] Updated weights for policy 0, policy_version 4012 (0.0008) +[2026-06-07 00:10:47,411][344387] Updated weights for policy 0, policy_version 4025 (0.0010) +[2026-06-07 00:10:48,917][344387] Updated weights for policy 0, policy_version 4035 (0.0008) +[2026-06-07 00:10:49,901][344387] Updated weights for policy 0, policy_version 4045 (0.0007) +[2026-06-07 00:10:50,257][343476] Fps is (10 sec: 4096.1, 60 sec: 3993.6, 300 sec: 3624.0). Total num frames: 2072576. Throughput: 0: 3996.4. Samples: 2075746. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:10:50,261][343476] Avg episode reward: [(0, '731.740')] +[2026-06-07 00:10:51,238][344387] Updated weights for policy 0, policy_version 4055 (0.0006) +[2026-06-07 00:10:52,443][344387] Updated weights for policy 0, policy_version 4065 (0.0007) +[2026-06-07 00:10:53,686][344387] Updated weights for policy 0, policy_version 4077 (0.0008) +[2026-06-07 00:10:55,077][344387] Updated weights for policy 0, policy_version 4087 (0.0007) +[2026-06-07 00:10:55,257][343476] Fps is (10 sec: 4301.0, 60 sec: 3993.6, 300 sec: 3651.7). Total num frames: 2093056. Throughput: 0: 4006.3. Samples: 2100824. Policy #0 lag: (min: 5.0, avg: 20.5, max: 39.0) +[2026-06-07 00:10:55,260][343476] Avg episode reward: [(0, '739.778')] +[2026-06-07 00:10:56,385][344387] Updated weights for policy 0, policy_version 4097 (0.0007) +[2026-06-07 00:10:57,326][344387] Updated weights for policy 0, policy_version 4107 (0.0008) +[2026-06-07 00:10:58,776][344387] Updated weights for policy 0, policy_version 4117 (0.0008) +[2026-06-07 00:11:00,257][343476] Fps is (10 sec: 3891.1, 60 sec: 3993.6, 300 sec: 3665.6). Total num frames: 2111488. Throughput: 0: 4017.0. Samples: 2113538. Policy #0 lag: (min: 0.0, avg: 17.4, max: 36.0) +[2026-06-07 00:11:00,260][343476] Avg episode reward: [(0, '697.684')] +[2026-06-07 00:11:00,423][344387] Updated weights for policy 0, policy_version 4131 (0.0008) +[2026-06-07 00:11:01,746][344387] Updated weights for policy 0, policy_version 4144 (0.0008) +[2026-06-07 00:11:03,208][344387] Updated weights for policy 0, policy_version 4154 (0.0008) +[2026-06-07 00:11:04,291][344387] Updated weights for policy 0, policy_version 4164 (0.0007) +[2026-06-07 00:11:05,247][344387] Updated weights for policy 0, policy_version 4174 (0.0007) +[2026-06-07 00:11:05,258][343476] Fps is (10 sec: 4300.8, 60 sec: 4061.9, 300 sec: 3693.3). Total num frames: 2136064. Throughput: 0: 4014.1. Samples: 2139240. Policy #0 lag: (min: 1.0, avg: 17.9, max: 33.0) +[2026-06-07 00:11:05,262][343476] Avg episode reward: [(0, '711.083')] +[2026-06-07 00:11:07,250][344387] Updated weights for policy 0, policy_version 4187 (0.0008) +[2026-06-07 00:11:08,846][344387] Updated weights for policy 0, policy_version 4200 (0.0010) +[2026-06-07 00:11:10,259][343476] Fps is (10 sec: 4300.3, 60 sec: 4027.7, 300 sec: 3700.3). Total num frames: 2154496. Throughput: 0: 3977.7. Samples: 2162324. Policy #0 lag: (min: 3.0, avg: 17.9, max: 35.0) +[2026-06-07 00:11:10,262][343476] Avg episode reward: [(0, '756.446')] +[2026-06-07 00:11:10,934][344387] Updated weights for policy 0, policy_version 4212 (0.0010) +[2026-06-07 00:11:12,279][344387] Updated weights for policy 0, policy_version 4222 (0.0008) +[2026-06-07 00:11:13,475][344387] Updated weights for policy 0, policy_version 4234 (0.0009) +[2026-06-07 00:11:15,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3959.5, 300 sec: 3693.3). Total num frames: 2170880. Throughput: 0: 4023.3. Samples: 2174256. Policy #0 lag: (min: 3.0, avg: 20.5, max: 36.0) +[2026-06-07 00:11:15,260][343476] Avg episode reward: [(0, '727.512')] +[2026-06-07 00:11:15,476][344387] Updated weights for policy 0, policy_version 4247 (0.0008) +[2026-06-07 00:11:17,684][344387] Updated weights for policy 0, policy_version 4257 (0.0010) +[2026-06-07 00:11:18,614][344387] Updated weights for policy 0, policy_version 4271 (0.0009) +[2026-06-07 00:11:20,263][343476] Fps is (10 sec: 3685.1, 60 sec: 3959.2, 300 sec: 3700.2). Total num frames: 2191360. Throughput: 0: 3980.5. Samples: 2195840. Policy #0 lag: (min: 3.0, avg: 20.8, max: 38.0) +[2026-06-07 00:11:20,268][343476] Avg episode reward: [(0, '734.690')] +[2026-06-07 00:11:20,281][344387] Updated weights for policy 0, policy_version 4284 (0.0007) +[2026-06-07 00:11:22,164][344387] Updated weights for policy 0, policy_version 4300 (0.0010) +[2026-06-07 00:11:23,669][344387] Updated weights for policy 0, policy_version 4312 (0.0008) +[2026-06-07 00:11:25,258][343476] Fps is (10 sec: 4095.5, 60 sec: 3925.4, 300 sec: 3679.4). Total num frames: 2211840. Throughput: 0: 4003.0. Samples: 2221056. Policy #0 lag: (min: 3.0, avg: 19.1, max: 37.0) +[2026-06-07 00:11:25,261][343476] Avg episode reward: [(0, '806.562')] +[2026-06-07 00:11:25,385][344387] Updated weights for policy 0, policy_version 4322 (0.0008) +[2026-06-07 00:11:26,012][344387] Updated weights for policy 0, policy_version 4332 (0.0008) +[2026-06-07 00:11:27,926][344387] Updated weights for policy 0, policy_version 4345 (0.0008) +[2026-06-07 00:11:29,728][344387] Updated weights for policy 0, policy_version 4357 (0.0008) +[2026-06-07 00:11:30,258][343476] Fps is (10 sec: 4302.6, 60 sec: 4027.7, 300 sec: 3693.3). Total num frames: 2234368. Throughput: 0: 4041.6. Samples: 2233652. Policy #0 lag: (min: 1.0, avg: 20.5, max: 41.0) +[2026-06-07 00:11:30,266][343476] Avg episode reward: [(0, '882.677')] +[2026-06-07 00:11:30,397][344304] Saving new best policy, reward=882.677! +[2026-06-07 00:11:31,254][344387] Updated weights for policy 0, policy_version 4372 (0.0007) +[2026-06-07 00:11:32,715][344387] Updated weights for policy 0, policy_version 4382 (0.0007) +[2026-06-07 00:11:34,052][344387] Updated weights for policy 0, policy_version 4396 (0.0008) +[2026-06-07 00:11:35,257][343476] Fps is (10 sec: 4096.3, 60 sec: 3993.6, 300 sec: 3693.3). Total num frames: 2252800. Throughput: 0: 4057.6. Samples: 2258340. Policy #0 lag: (min: 3.0, avg: 20.4, max: 39.0) +[2026-06-07 00:11:35,261][343476] Avg episode reward: [(0, '746.142')] +[2026-06-07 00:11:35,469][344387] Updated weights for policy 0, policy_version 4408 (0.0009) +[2026-06-07 00:11:37,439][344387] Updated weights for policy 0, policy_version 4421 (0.0008) +[2026-06-07 00:11:38,573][344387] Updated weights for policy 0, policy_version 4431 (0.0007) +[2026-06-07 00:11:39,843][344387] Updated weights for policy 0, policy_version 4443 (0.0008) +[2026-06-07 00:11:40,258][343476] Fps is (10 sec: 4096.0, 60 sec: 4061.8, 300 sec: 3700.3). Total num frames: 2275328. Throughput: 0: 4047.2. Samples: 2282952. Policy #0 lag: (min: 3.0, avg: 21.6, max: 35.0) +[2026-06-07 00:11:40,263][343476] Avg episode reward: [(0, '839.793')] +[2026-06-07 00:11:41,462][344387] Updated weights for policy 0, policy_version 4454 (0.0008) +[2026-06-07 00:11:42,862][344387] Updated weights for policy 0, policy_version 4464 (0.0007) +[2026-06-07 00:11:44,012][344387] Updated weights for policy 0, policy_version 4476 (0.0007) +[2026-06-07 00:11:45,258][343476] Fps is (10 sec: 4096.0, 60 sec: 4061.9, 300 sec: 3686.4). Total num frames: 2293760. Throughput: 0: 4034.2. Samples: 2295076. Policy #0 lag: (min: 1.0, avg: 16.6, max: 33.0) +[2026-06-07 00:11:45,261][343476] Avg episode reward: [(0, '820.416')] +[2026-06-07 00:11:45,983][344387] Updated weights for policy 0, policy_version 4489 (0.0008) +[2026-06-07 00:11:47,631][344387] Updated weights for policy 0, policy_version 4503 (0.0008) +[2026-06-07 00:11:49,244][344387] Updated weights for policy 0, policy_version 4513 (0.0008) +[2026-06-07 00:11:49,946][344387] Updated weights for policy 0, policy_version 4523 (0.0008) +[2026-06-07 00:11:50,258][343476] Fps is (10 sec: 4096.1, 60 sec: 4061.8, 300 sec: 3700.3). Total num frames: 2316288. Throughput: 0: 3999.7. Samples: 2319230. Policy #0 lag: (min: 7.0, avg: 20.7, max: 39.0) +[2026-06-07 00:11:50,263][343476] Avg episode reward: [(0, '892.459')] +[2026-06-07 00:11:50,272][344304] Saving new best policy, reward=892.459! +[2026-06-07 00:11:51,580][344387] Updated weights for policy 0, policy_version 4536 (0.0010) +[2026-06-07 00:11:53,281][344387] Updated weights for policy 0, policy_version 4546 (0.0009) +[2026-06-07 00:11:54,087][344387] Updated weights for policy 0, policy_version 4556 (0.0007) +[2026-06-07 00:11:55,259][343476] Fps is (10 sec: 3890.7, 60 sec: 3993.5, 300 sec: 3686.4). Total num frames: 2332672. Throughput: 0: 4021.2. Samples: 2343278. Policy #0 lag: (min: 3.0, avg: 17.6, max: 35.0) +[2026-06-07 00:11:55,264][343476] Avg episode reward: [(0, '640.222')] +[2026-06-07 00:11:55,813][344387] Updated weights for policy 0, policy_version 4568 (0.0009) +[2026-06-07 00:11:57,856][344387] Updated weights for policy 0, policy_version 4581 (0.0008) +[2026-06-07 00:11:59,529][344304] Signal inference workers to stop experience collection... (450 times) +[2026-06-07 00:11:59,548][344387] InferenceWorker_p0-w0: stopping experience collection (450 times) +[2026-06-07 00:11:59,597][344304] Signal inference workers to resume experience collection... (450 times) +[2026-06-07 00:11:59,598][344387] InferenceWorker_p0-w0: resuming experience collection (450 times) +[2026-06-07 00:11:59,662][344387] Updated weights for policy 0, policy_version 4593 (0.0009) +[2026-06-07 00:12:00,258][343476] Fps is (10 sec: 3891.4, 60 sec: 4061.9, 300 sec: 3700.3). Total num frames: 2355200. Throughput: 0: 4014.3. Samples: 2354902. Policy #0 lag: (min: 0.0, avg: 18.8, max: 36.0) +[2026-06-07 00:12:00,264][343476] Avg episode reward: [(0, '725.644')] +[2026-06-07 00:12:00,516][344387] Updated weights for policy 0, policy_version 4603 (0.0008) +[2026-06-07 00:12:02,461][344387] Updated weights for policy 0, policy_version 4616 (0.0009) +[2026-06-07 00:12:03,914][344387] Updated weights for policy 0, policy_version 4628 (0.0008) +[2026-06-07 00:12:05,258][343476] Fps is (10 sec: 4096.4, 60 sec: 3959.5, 300 sec: 3707.2). Total num frames: 2373632. Throughput: 0: 4059.2. Samples: 2378484. Policy #0 lag: (min: 3.0, avg: 18.8, max: 35.0) +[2026-06-07 00:12:05,260][343476] Avg episode reward: [(0, '828.548')] +[2026-06-07 00:12:05,491][344387] Updated weights for policy 0, policy_version 4638 (0.0008) +[2026-06-07 00:12:06,800][344387] Updated weights for policy 0, policy_version 4651 (0.0008) +[2026-06-07 00:12:08,495][344387] Updated weights for policy 0, policy_version 4664 (0.0010) +[2026-06-07 00:12:10,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3925.4, 300 sec: 3714.2). Total num frames: 2390016. Throughput: 0: 3965.0. Samples: 2399478. Policy #0 lag: (min: 6.0, avg: 21.5, max: 38.0) +[2026-06-07 00:12:10,261][343476] Avg episode reward: [(0, '893.903')] +[2026-06-07 00:12:10,327][344304] Saving new best policy, reward=893.903! +[2026-06-07 00:12:11,239][344387] Updated weights for policy 0, policy_version 4676 (0.0009) +[2026-06-07 00:12:14,037][344387] Updated weights for policy 0, policy_version 4688 (0.0009) +[2026-06-07 00:12:15,135][344387] Updated weights for policy 0, policy_version 4700 (0.0012) +[2026-06-07 00:12:15,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3925.3, 300 sec: 3700.3). Total num frames: 2406400. Throughput: 0: 3873.1. Samples: 2407940. Policy #0 lag: (min: 0.0, avg: 18.1, max: 36.0) +[2026-06-07 00:12:15,262][343476] Avg episode reward: [(0, '896.335')] +[2026-06-07 00:12:15,268][344304] Saving new best policy, reward=896.335! +[2026-06-07 00:12:17,940][344387] Updated weights for policy 0, policy_version 4714 (0.0011) +[2026-06-07 00:12:20,258][343476] Fps is (10 sec: 2662.4, 60 sec: 3755.0, 300 sec: 3651.7). Total num frames: 2416640. Throughput: 0: 3679.7. Samples: 2423926. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:12:20,263][343476] Avg episode reward: [(0, '856.890')] +[2026-06-07 00:12:20,618][344387] Updated weights for policy 0, policy_version 4727 (0.0011) +[2026-06-07 00:12:23,072][344387] Updated weights for policy 0, policy_version 4740 (0.0010) +[2026-06-07 00:12:25,258][343476] Fps is (10 sec: 2457.4, 60 sec: 3652.3, 300 sec: 3665.6). Total num frames: 2430976. Throughput: 0: 3508.8. Samples: 2440848. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 00:12:25,261][343476] Avg episode reward: [(0, '901.975')] +[2026-06-07 00:12:25,276][344304] Saving new best policy, reward=901.975! +[2026-06-07 00:12:25,678][344387] Updated weights for policy 0, policy_version 4750 (0.0009) +[2026-06-07 00:12:27,335][344387] Updated weights for policy 0, policy_version 4763 (0.0009) +[2026-06-07 00:12:29,138][344387] Updated weights for policy 0, policy_version 4774 (0.0009) +[2026-06-07 00:12:30,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3549.9, 300 sec: 3672.5). Total num frames: 2447360. Throughput: 0: 3424.3. Samples: 2449168. Policy #0 lag: (min: 3.0, avg: 17.4, max: 35.0) +[2026-06-07 00:12:30,260][343476] Avg episode reward: [(0, '802.584')] +[2026-06-07 00:12:32,093][344387] Updated weights for policy 0, policy_version 4785 (0.0011) +[2026-06-07 00:12:33,193][344387] Updated weights for policy 0, policy_version 4795 (0.0010) +[2026-06-07 00:12:35,104][344387] Updated weights for policy 0, policy_version 4807 (0.0011) +[2026-06-07 00:12:35,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3481.6, 300 sec: 3672.6). Total num frames: 2461696. Throughput: 0: 3251.3. Samples: 2465536. Policy #0 lag: (min: 3.0, avg: 15.5, max: 35.0) +[2026-06-07 00:12:35,260][343476] Avg episode reward: [(0, '849.695')] +[2026-06-07 00:12:37,959][344387] Updated weights for policy 0, policy_version 4819 (0.0010) +[2026-06-07 00:12:40,109][344387] Updated weights for policy 0, policy_version 4832 (0.0009) +[2026-06-07 00:12:40,257][343476] Fps is (10 sec: 2662.5, 60 sec: 3311.0, 300 sec: 3651.7). Total num frames: 2473984. Throughput: 0: 3078.9. Samples: 2481826. Policy #0 lag: (min: 0.0, avg: 16.9, max: 32.0) +[2026-06-07 00:12:40,268][343476] Avg episode reward: [(0, '837.642')] +[2026-06-07 00:12:41,570][344387] Updated weights for policy 0, policy_version 4843 (0.0008) +[2026-06-07 00:12:44,334][344387] Updated weights for policy 0, policy_version 4856 (0.0010) +[2026-06-07 00:12:45,257][343476] Fps is (10 sec: 2662.4, 60 sec: 3242.7, 300 sec: 3651.7). Total num frames: 2488320. Throughput: 0: 3019.0. Samples: 2490756. Policy #0 lag: (min: 3.0, avg: 15.4, max: 35.0) +[2026-06-07 00:12:45,260][343476] Avg episode reward: [(0, '878.918')] +[2026-06-07 00:12:46,636][344387] Updated weights for policy 0, policy_version 4867 (0.0008) +[2026-06-07 00:12:49,185][344387] Updated weights for policy 0, policy_version 4877 (0.0009) +[2026-06-07 00:12:50,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3106.2, 300 sec: 3644.7). Total num frames: 2502656. Throughput: 0: 2861.7. Samples: 2507260. Policy #0 lag: (min: 1.0, avg: 13.8, max: 33.0) +[2026-06-07 00:12:50,259][343476] Avg episode reward: [(0, '718.449')] +[2026-06-07 00:12:50,958][344387] Updated weights for policy 0, policy_version 4890 (0.0011) +[2026-06-07 00:12:52,770][344387] Updated weights for policy 0, policy_version 4901 (0.0009) +[2026-06-07 00:12:55,160][344387] Updated weights for policy 0, policy_version 4911 (0.0012) +[2026-06-07 00:12:55,257][343476] Fps is (10 sec: 2662.5, 60 sec: 3037.9, 300 sec: 3623.9). Total num frames: 2514944. Throughput: 0: 2765.1. Samples: 2523904. Policy #0 lag: (min: 0.0, avg: 17.9, max: 33.0) +[2026-06-07 00:12:55,260][343476] Avg episode reward: [(0, '991.273')] +[2026-06-07 00:12:55,280][344304] Saving new best policy, reward=991.273! +[2026-06-07 00:12:57,506][344387] Updated weights for policy 0, policy_version 4925 (0.0010) +[2026-06-07 00:12:58,580][344387] Updated weights for policy 0, policy_version 4936 (0.0011) +[2026-06-07 00:13:00,259][343476] Fps is (10 sec: 2662.0, 60 sec: 2901.3, 300 sec: 3617.0). Total num frames: 2529280. Throughput: 0: 2769.0. Samples: 2532548. Policy #0 lag: (min: 0.0, avg: 17.9, max: 33.0) +[2026-06-07 00:13:00,264][343476] Avg episode reward: [(0, '823.728')] +[2026-06-07 00:13:01,288][344387] Updated weights for policy 0, policy_version 4946 (0.0011) +[2026-06-07 00:13:03,323][344387] Updated weights for policy 0, policy_version 4957 (0.0011) +[2026-06-07 00:13:04,365][344387] Updated weights for policy 0, policy_version 4967 (0.0009) +[2026-06-07 00:13:05,258][343476] Fps is (10 sec: 3072.0, 60 sec: 2867.2, 300 sec: 3603.1). Total num frames: 2545664. Throughput: 0: 2793.7. Samples: 2549640. Policy #0 lag: (min: 3.0, avg: 16.1, max: 35.0) +[2026-06-07 00:13:05,260][343476] Avg episode reward: [(0, '808.324')] +[2026-06-07 00:13:07,088][344387] Updated weights for policy 0, policy_version 4978 (0.0008) +[2026-06-07 00:13:08,206][344387] Updated weights for policy 0, policy_version 4988 (0.0011) +[2026-06-07 00:13:09,939][344387] Updated weights for policy 0, policy_version 4998 (0.0009) +[2026-06-07 00:13:10,258][343476] Fps is (10 sec: 3072.3, 60 sec: 2833.1, 300 sec: 3589.2). Total num frames: 2560000. Throughput: 0: 2800.9. Samples: 2566886. Policy #0 lag: (min: 0.0, avg: 17.7, max: 33.0) +[2026-06-07 00:13:10,262][343476] Avg episode reward: [(0, '850.753')] +[2026-06-07 00:13:12,241][344387] Updated weights for policy 0, policy_version 5008 (0.0009) +[2026-06-07 00:13:14,125][344387] Updated weights for policy 0, policy_version 5020 (0.0009) +[2026-06-07 00:13:15,258][343476] Fps is (10 sec: 2662.3, 60 sec: 2764.8, 300 sec: 3575.3). Total num frames: 2572288. Throughput: 0: 2804.4. Samples: 2575368. Policy #0 lag: (min: 3.0, avg: 16.0, max: 35.0) +[2026-06-07 00:13:15,261][343476] Avg episode reward: [(0, '875.157')] +[2026-06-07 00:13:15,691][344387] Updated weights for policy 0, policy_version 5031 (0.0013) +[2026-06-07 00:13:18,174][344387] Updated weights for policy 0, policy_version 5043 (0.0010) +[2026-06-07 00:13:20,257][343476] Fps is (10 sec: 2662.5, 60 sec: 2833.1, 300 sec: 3568.4). Total num frames: 2586624. Throughput: 0: 2833.5. Samples: 2593044. Policy #0 lag: (min: 0.0, avg: 17.7, max: 32.0) +[2026-06-07 00:13:20,261][343476] Avg episode reward: [(0, '641.704')] +[2026-06-07 00:13:20,394][344387] Updated weights for policy 0, policy_version 5053 (0.0010) +[2026-06-07 00:13:21,467][344387] Updated weights for policy 0, policy_version 5064 (0.0012) +[2026-06-07 00:13:24,173][344387] Updated weights for policy 0, policy_version 5074 (0.0011) +[2026-06-07 00:13:25,258][343476] Fps is (10 sec: 2867.3, 60 sec: 2833.1, 300 sec: 3561.4). Total num frames: 2600960. Throughput: 0: 2842.3. Samples: 2609730. Policy #0 lag: (min: 3.0, avg: 15.9, max: 35.0) +[2026-06-07 00:13:25,263][343476] Avg episode reward: [(0, '1026.352')] +[2026-06-07 00:13:25,271][344304] Saving new best policy, reward=1026.352! +[2026-06-07 00:13:26,117][344387] Updated weights for policy 0, policy_version 5085 (0.0013) +[2026-06-07 00:13:27,243][344387] Updated weights for policy 0, policy_version 5095 (0.0012) +[2026-06-07 00:13:29,922][344387] Updated weights for policy 0, policy_version 5105 (0.0010) +[2026-06-07 00:13:30,257][343476] Fps is (10 sec: 2867.3, 60 sec: 2799.0, 300 sec: 3547.6). Total num frames: 2615296. Throughput: 0: 2826.9. Samples: 2617964. Policy #0 lag: (min: 3.0, avg: 16.3, max: 35.0) +[2026-06-07 00:13:30,261][343476] Avg episode reward: [(0, '897.568')] +[2026-06-07 00:13:31,592][344387] Updated weights for policy 0, policy_version 5115 (0.0009) +[2026-06-07 00:13:32,803][344387] Updated weights for policy 0, policy_version 5125 (0.0009) +[2026-06-07 00:13:35,097][344387] Updated weights for policy 0, policy_version 5135 (0.0010) +[2026-06-07 00:13:35,257][343476] Fps is (10 sec: 2867.3, 60 sec: 2798.9, 300 sec: 3533.7). Total num frames: 2629632. Throughput: 0: 2856.3. Samples: 2635792. Policy #0 lag: (min: 3.0, avg: 16.3, max: 35.0) +[2026-06-07 00:13:35,259][343476] Avg episode reward: [(0, '838.855')] +[2026-06-07 00:13:37,116][344387] Updated weights for policy 0, policy_version 5145 (0.0009) +[2026-06-07 00:13:38,394][344387] Updated weights for policy 0, policy_version 5156 (0.0010) +[2026-06-07 00:13:40,258][343476] Fps is (10 sec: 2867.1, 60 sec: 2833.1, 300 sec: 3526.7). Total num frames: 2643968. Throughput: 0: 2873.0. Samples: 2653190. Policy #0 lag: (min: 3.0, avg: 16.3, max: 35.0) +[2026-06-07 00:13:40,261][343476] Avg episode reward: [(0, '897.018')] +[2026-06-07 00:13:40,815][344387] Updated weights for policy 0, policy_version 5168 (0.0012) +[2026-06-07 00:13:42,046][344387] Updated weights for policy 0, policy_version 5179 (0.0009) +[2026-06-07 00:13:43,467][344387] Updated weights for policy 0, policy_version 5193 (0.0009) +[2026-06-07 00:13:45,257][343476] Fps is (10 sec: 3481.6, 60 sec: 2935.5, 300 sec: 3526.7). Total num frames: 2664448. Throughput: 0: 2937.9. Samples: 2664750. Policy #0 lag: (min: 3.0, avg: 16.2, max: 35.0) +[2026-06-07 00:13:45,260][343476] Avg episode reward: [(0, '903.424')] +[2026-06-07 00:13:45,360][344387] Updated weights for policy 0, policy_version 5205 (0.0007) +[2026-06-07 00:13:46,670][344387] Updated weights for policy 0, policy_version 5215 (0.0008) +[2026-06-07 00:13:47,640][344387] Updated weights for policy 0, policy_version 5228 (0.0010) +[2026-06-07 00:13:49,687][344387] Updated weights for policy 0, policy_version 5238 (0.0009) +[2026-06-07 00:13:50,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3003.7, 300 sec: 3533.7). Total num frames: 2682880. Throughput: 0: 3073.6. Samples: 2687952. Policy #0 lag: (min: 3.0, avg: 19.6, max: 39.0) +[2026-06-07 00:13:50,259][343476] Avg episode reward: [(0, '811.647')] +[2026-06-07 00:13:51,152][344387] Updated weights for policy 0, policy_version 5248 (0.0007) +[2026-06-07 00:13:53,600][344387] Updated weights for policy 0, policy_version 5264 (0.0012) +[2026-06-07 00:13:55,033][344387] Updated weights for policy 0, policy_version 5274 (0.0007) +[2026-06-07 00:13:55,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3106.1, 300 sec: 3533.7). Total num frames: 2701312. Throughput: 0: 3185.1. Samples: 2710214. Policy #0 lag: (min: 2.0, avg: 17.5, max: 36.0) +[2026-06-07 00:13:55,261][343476] Avg episode reward: [(0, '958.688')] +[2026-06-07 00:13:56,119][344387] Updated weights for policy 0, policy_version 5287 (0.0008) +[2026-06-07 00:13:58,382][344387] Updated weights for policy 0, policy_version 5297 (0.0008) +[2026-06-07 00:13:59,492][344387] Updated weights for policy 0, policy_version 5307 (0.0008) +[2026-06-07 00:14:00,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3174.5, 300 sec: 3533.7). Total num frames: 2719744. Throughput: 0: 3221.9. Samples: 2720354. Policy #0 lag: (min: 0.0, avg: 19.3, max: 32.0) +[2026-06-07 00:14:00,262][343476] Avg episode reward: [(0, '878.257')] +[2026-06-07 00:14:00,457][344387] Updated weights for policy 0, policy_version 5319 (0.0009) +[2026-06-07 00:14:02,343][344387] Updated weights for policy 0, policy_version 5329 (0.0009) +[2026-06-07 00:14:03,609][344387] Updated weights for policy 0, policy_version 5340 (0.0011) +[2026-06-07 00:14:05,022][344387] Updated weights for policy 0, policy_version 5352 (0.0009) +[2026-06-07 00:14:05,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3242.7, 300 sec: 3554.5). Total num frames: 2740224. Throughput: 0: 3361.3. Samples: 2744304. Policy #0 lag: (min: 3.0, avg: 17.6, max: 35.0) +[2026-06-07 00:14:05,259][343476] Avg episode reward: [(0, '832.109')] +[2026-06-07 00:14:07,170][344387] Updated weights for policy 0, policy_version 5363 (0.0009) +[2026-06-07 00:14:09,420][344387] Updated weights for policy 0, policy_version 5376 (0.0008) +[2026-06-07 00:14:10,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3311.0, 300 sec: 3561.4). Total num frames: 2758656. Throughput: 0: 3442.9. Samples: 2764660. Policy #0 lag: (min: 2.0, avg: 17.8, max: 38.0) +[2026-06-07 00:14:10,260][343476] Avg episode reward: [(0, '870.325')] +[2026-06-07 00:14:11,505][344387] Updated weights for policy 0, policy_version 5389 (0.0010) +[2026-06-07 00:14:12,317][344387] Updated weights for policy 0, policy_version 5399 (0.0008) +[2026-06-07 00:14:14,379][344387] Updated weights for policy 0, policy_version 5412 (0.0008) +[2026-06-07 00:14:15,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3379.2, 300 sec: 3554.5). Total num frames: 2775040. Throughput: 0: 3492.2. Samples: 2775112. Policy #0 lag: (min: 7.0, avg: 20.8, max: 41.0) +[2026-06-07 00:14:15,260][343476] Avg episode reward: [(0, '751.072')] +[2026-06-07 00:14:16,282][344387] Updated weights for policy 0, policy_version 5426 (0.0008) +[2026-06-07 00:14:17,521][344387] Updated weights for policy 0, policy_version 5436 (0.0008) +[2026-06-07 00:14:19,317][344387] Updated weights for policy 0, policy_version 5451 (0.0010) +[2026-06-07 00:14:20,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3413.3, 300 sec: 3547.6). Total num frames: 2791424. Throughput: 0: 3573.2. Samples: 2796586. Policy #0 lag: (min: 7.0, avg: 20.8, max: 41.0) +[2026-06-07 00:14:20,260][343476] Avg episode reward: [(0, '923.969')] +[2026-06-07 00:14:21,303][344387] Updated weights for policy 0, policy_version 5461 (0.0010) +[2026-06-07 00:14:23,563][344387] Updated weights for policy 0, policy_version 5477 (0.0009) +[2026-06-07 00:14:25,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3447.5, 300 sec: 3547.6). Total num frames: 2807808. Throughput: 0: 3657.8. Samples: 2817790. Policy #0 lag: (min: 2.0, avg: 22.1, max: 42.0) +[2026-06-07 00:14:25,260][343476] Avg episode reward: [(0, '936.454')] +[2026-06-07 00:14:25,304][344387] Updated weights for policy 0, policy_version 5488 (0.0009) +[2026-06-07 00:14:26,945][344387] Updated weights for policy 0, policy_version 5498 (0.0007) +[2026-06-07 00:14:28,333][344387] Updated weights for policy 0, policy_version 5512 (0.0009) +[2026-06-07 00:14:30,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3481.6, 300 sec: 3540.6). Total num frames: 2824192. Throughput: 0: 3632.3. Samples: 2828206. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:14:30,261][343476] Avg episode reward: [(0, '927.929')] +[2026-06-07 00:14:30,522][344304] Signal inference workers to stop experience collection... (500 times) +[2026-06-07 00:14:30,550][344387] InferenceWorker_p0-w0: stopping experience collection (500 times) +[2026-06-07 00:14:30,619][344304] Signal inference workers to resume experience collection... (500 times) +[2026-06-07 00:14:30,620][344387] InferenceWorker_p0-w0: resuming experience collection (500 times) +[2026-06-07 00:14:31,040][344387] Updated weights for policy 0, policy_version 5525 (0.0010) +[2026-06-07 00:14:33,083][344387] Updated weights for policy 0, policy_version 5537 (0.0008) +[2026-06-07 00:14:34,892][344387] Updated weights for policy 0, policy_version 5549 (0.0009) +[2026-06-07 00:14:35,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3584.0, 300 sec: 3547.6). Total num frames: 2844672. Throughput: 0: 3558.5. Samples: 2848086. Policy #0 lag: (min: 4.0, avg: 19.5, max: 34.0) +[2026-06-07 00:14:35,260][343476] Avg episode reward: [(0, '943.963')] +[2026-06-07 00:14:35,726][344387] Updated weights for policy 0, policy_version 5559 (0.0008) +[2026-06-07 00:14:38,170][344387] Updated weights for policy 0, policy_version 5573 (0.0009) +[2026-06-07 00:14:39,858][344387] Updated weights for policy 0, policy_version 5585 (0.0009) +[2026-06-07 00:14:40,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3618.1, 300 sec: 3547.5). Total num frames: 2861056. Throughput: 0: 3538.0. Samples: 2869422. Policy #0 lag: (min: 1.0, avg: 15.6, max: 33.0) +[2026-06-07 00:14:40,260][343476] Avg episode reward: [(0, '1103.262')] +[2026-06-07 00:14:40,269][344304] Saving new best policy, reward=1103.262! +[2026-06-07 00:14:41,139][344387] Updated weights for policy 0, policy_version 5595 (0.0008) +[2026-06-07 00:14:42,412][344387] Updated weights for policy 0, policy_version 5605 (0.0008) +[2026-06-07 00:14:44,014][344387] Updated weights for policy 0, policy_version 5615 (0.0008) +[2026-06-07 00:14:45,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3584.0, 300 sec: 3547.6). Total num frames: 2879488. Throughput: 0: 3552.0. Samples: 2880194. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 00:14:45,261][343476] Avg episode reward: [(0, '977.070')] +[2026-06-07 00:14:45,552][344387] Updated weights for policy 0, policy_version 5625 (0.0009) +[2026-06-07 00:14:47,205][344387] Updated weights for policy 0, policy_version 5640 (0.0008) +[2026-06-07 00:14:49,151][344387] Updated weights for policy 0, policy_version 5652 (0.0009) +[2026-06-07 00:14:50,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3549.8, 300 sec: 3533.7). Total num frames: 2895872. Throughput: 0: 3493.9. Samples: 2901528. Policy #0 lag: (min: 3.0, avg: 20.0, max: 38.0) +[2026-06-07 00:14:50,261][343476] Avg episode reward: [(0, '959.611')] +[2026-06-07 00:14:51,275][344387] Updated weights for policy 0, policy_version 5665 (0.0011) +[2026-06-07 00:14:52,175][344387] Updated weights for policy 0, policy_version 5676 (0.0008) +[2026-06-07 00:14:54,284][344387] Updated weights for policy 0, policy_version 5686 (0.0008) +[2026-06-07 00:14:55,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3549.9, 300 sec: 3533.7). Total num frames: 2914304. Throughput: 0: 3513.2. Samples: 2922754. Policy #0 lag: (min: 3.0, avg: 20.0, max: 38.0) +[2026-06-07 00:14:55,266][343476] Avg episode reward: [(0, '947.158')] +[2026-06-07 00:14:56,085][344387] Updated weights for policy 0, policy_version 5698 (0.0008) +[2026-06-07 00:14:58,234][344387] Updated weights for policy 0, policy_version 5710 (0.0009) +[2026-06-07 00:14:59,836][344387] Updated weights for policy 0, policy_version 5721 (0.0008) +[2026-06-07 00:15:00,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3515.8, 300 sec: 3519.8). Total num frames: 2930688. Throughput: 0: 3495.8. Samples: 2932424. Policy #0 lag: (min: 2.0, avg: 18.2, max: 36.0) +[2026-06-07 00:15:00,259][343476] Avg episode reward: [(0, '1038.631')] +[2026-06-07 00:15:01,124][344387] Updated weights for policy 0, policy_version 5733 (0.0009) +[2026-06-07 00:15:02,534][344387] Updated weights for policy 0, policy_version 5744 (0.0010) +[2026-06-07 00:15:04,187][344387] Updated weights for policy 0, policy_version 5754 (0.0009) +[2026-06-07 00:15:05,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3515.7, 300 sec: 3519.8). Total num frames: 2951168. Throughput: 0: 3518.6. Samples: 2954924. Policy #0 lag: (min: 7.0, avg: 23.0, max: 39.0) +[2026-06-07 00:15:05,259][343476] Avg episode reward: [(0, '898.623')] +[2026-06-07 00:15:05,572][344387] Updated weights for policy 0, policy_version 5766 (0.0009) +[2026-06-07 00:15:07,058][344387] Updated weights for policy 0, policy_version 5776 (0.0009) +[2026-06-07 00:15:08,847][344387] Updated weights for policy 0, policy_version 5786 (0.0008) +[2026-06-07 00:15:09,701][344387] Updated weights for policy 0, policy_version 5796 (0.0008) +[2026-06-07 00:15:10,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3515.7, 300 sec: 3512.8). Total num frames: 2969600. Throughput: 0: 3526.4. Samples: 2976478. Policy #0 lag: (min: 1.0, avg: 16.2, max: 33.0) +[2026-06-07 00:15:10,261][343476] Avg episode reward: [(0, '842.764')] +[2026-06-07 00:15:11,512][344387] Updated weights for policy 0, policy_version 5806 (0.0010) +[2026-06-07 00:15:12,375][344387] Updated weights for policy 0, policy_version 5816 (0.0008) +[2026-06-07 00:15:14,645][344387] Updated weights for policy 0, policy_version 5830 (0.0010) +[2026-06-07 00:15:15,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3549.8, 300 sec: 3505.9). Total num frames: 2988032. Throughput: 0: 3541.7. Samples: 2987580. Policy #0 lag: (min: 3.0, avg: 18.1, max: 35.0) +[2026-06-07 00:15:15,262][343476] Avg episode reward: [(0, '897.478')] +[2026-06-07 00:15:16,055][344387] Updated weights for policy 0, policy_version 5840 (0.0009) +[2026-06-07 00:15:17,883][344387] Updated weights for policy 0, policy_version 5850 (0.0008) +[2026-06-07 00:15:19,357][344387] Updated weights for policy 0, policy_version 5864 (0.0010) +[2026-06-07 00:15:20,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3549.9, 300 sec: 3485.1). Total num frames: 3004416. Throughput: 0: 3578.1. Samples: 3009102. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 00:15:20,260][343476] Avg episode reward: [(0, '1020.884')] +[2026-06-07 00:15:20,919][344387] Updated weights for policy 0, policy_version 5874 (0.0008) +[2026-06-07 00:15:22,332][344387] Updated weights for policy 0, policy_version 5884 (0.0008) +[2026-06-07 00:15:24,117][344387] Updated weights for policy 0, policy_version 5898 (0.0009) +[2026-06-07 00:15:25,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3549.9, 300 sec: 3485.1). Total num frames: 3020800. Throughput: 0: 3573.3. Samples: 3030218. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 00:15:25,260][343476] Avg episode reward: [(0, '1037.987')] +[2026-06-07 00:15:25,700][344387] Updated weights for policy 0, policy_version 5908 (0.0007) +[2026-06-07 00:15:27,684][344387] Updated weights for policy 0, policy_version 5921 (0.0008) +[2026-06-07 00:15:29,655][344387] Updated weights for policy 0, policy_version 5934 (0.0008) +[2026-06-07 00:15:30,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3618.1, 300 sec: 3485.1). Total num frames: 3041280. Throughput: 0: 3584.7. Samples: 3041506. Policy #0 lag: (min: 0.0, avg: 19.0, max: 40.0) +[2026-06-07 00:15:30,261][343476] Avg episode reward: [(0, '1053.578')] +[2026-06-07 00:15:30,458][344387] Updated weights for policy 0, policy_version 5944 (0.0008) +[2026-06-07 00:15:32,118][344387] Updated weights for policy 0, policy_version 5956 (0.0009) +[2026-06-07 00:15:34,230][344387] Updated weights for policy 0, policy_version 5968 (0.0009) +[2026-06-07 00:15:35,258][343476] Fps is (10 sec: 3890.9, 60 sec: 3584.0, 300 sec: 3485.1). Total num frames: 3059712. Throughput: 0: 3605.8. Samples: 3063792. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:15:35,262][343476] Avg episode reward: [(0, '925.225')] +[2026-06-07 00:15:35,894][344387] Updated weights for policy 0, policy_version 5978 (0.0008) +[2026-06-07 00:15:37,073][344387] Updated weights for policy 0, policy_version 5990 (0.0009) +[2026-06-07 00:15:38,568][344387] Updated weights for policy 0, policy_version 6000 (0.0008) +[2026-06-07 00:15:40,200][344387] Updated weights for policy 0, policy_version 6010 (0.0008) +[2026-06-07 00:15:40,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3618.1, 300 sec: 3485.1). Total num frames: 3078144. Throughput: 0: 3630.2. Samples: 3086116. Policy #0 lag: (min: 7.0, avg: 20.9, max: 39.0) +[2026-06-07 00:15:40,261][343476] Avg episode reward: [(0, '1030.538')] +[2026-06-07 00:15:41,839][344387] Updated weights for policy 0, policy_version 6024 (0.0010) +[2026-06-07 00:15:43,542][344387] Updated weights for policy 0, policy_version 6034 (0.0007) +[2026-06-07 00:15:45,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3584.0, 300 sec: 3464.2). Total num frames: 3094528. Throughput: 0: 3647.9. Samples: 3096578. Policy #0 lag: (min: 3.0, avg: 18.3, max: 35.0) +[2026-06-07 00:15:45,260][343476] Avg episode reward: [(0, '1087.535')] +[2026-06-07 00:15:45,637][344387] Updated weights for policy 0, policy_version 6045 (0.0009) +[2026-06-07 00:15:46,491][344387] Updated weights for policy 0, policy_version 6057 (0.0009) +[2026-06-07 00:15:48,064][344387] Updated weights for policy 0, policy_version 6067 (0.0008) +[2026-06-07 00:15:50,242][344387] Updated weights for policy 0, policy_version 6078 (0.0009) +[2026-06-07 00:15:50,257][343476] Fps is (10 sec: 3277.0, 60 sec: 3584.0, 300 sec: 3450.4). Total num frames: 3110912. Throughput: 0: 3621.4. Samples: 3117886. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:15:50,259][343476] Avg episode reward: [(0, '972.335')] +[2026-06-07 00:15:51,066][344387] Updated weights for policy 0, policy_version 6088 (0.0007) +[2026-06-07 00:15:53,168][344387] Updated weights for policy 0, policy_version 6099 (0.0010) +[2026-06-07 00:15:55,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3549.9, 300 sec: 3443.4). Total num frames: 3127296. Throughput: 0: 3579.3. Samples: 3137544. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:15:55,262][343476] Avg episode reward: [(0, '936.498')] +[2026-06-07 00:15:55,266][344387] Updated weights for policy 0, policy_version 6109 (0.0009) +[2026-06-07 00:15:56,307][344387] Updated weights for policy 0, policy_version 6121 (0.0008) +[2026-06-07 00:15:58,160][344387] Updated weights for policy 0, policy_version 6133 (0.0010) +[2026-06-07 00:16:00,031][344387] Updated weights for policy 0, policy_version 6145 (0.0008) +[2026-06-07 00:16:00,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3618.1, 300 sec: 3429.5). Total num frames: 3147776. Throughput: 0: 3567.1. Samples: 3148100. Policy #0 lag: (min: 7.0, avg: 20.0, max: 39.0) +[2026-06-07 00:16:00,259][343476] Avg episode reward: [(0, '1076.991')] +[2026-06-07 00:16:01,022][344387] Updated weights for policy 0, policy_version 6156 (0.0008) +[2026-06-07 00:16:03,136][344387] Updated weights for policy 0, policy_version 6167 (0.0010) +[2026-06-07 00:16:05,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3515.7, 300 sec: 3415.7). Total num frames: 3162112. Throughput: 0: 3531.2. Samples: 3168004. Policy #0 lag: (min: 3.0, avg: 18.1, max: 35.0) +[2026-06-07 00:16:05,261][343476] Avg episode reward: [(0, '857.199')] +[2026-06-07 00:16:05,283][344387] Updated weights for policy 0, policy_version 6179 (0.0009) +[2026-06-07 00:16:07,351][344387] Updated weights for policy 0, policy_version 6190 (0.0010) +[2026-06-07 00:16:09,151][344387] Updated weights for policy 0, policy_version 6201 (0.0011) +[2026-06-07 00:16:10,258][343476] Fps is (10 sec: 3277.0, 60 sec: 3515.8, 300 sec: 3422.6). Total num frames: 3180544. Throughput: 0: 3517.1. Samples: 3188486. Policy #0 lag: (min: 6.0, avg: 21.1, max: 38.0) +[2026-06-07 00:16:10,261][343476] Avg episode reward: [(0, '968.970')] +[2026-06-07 00:16:10,459][344387] Updated weights for policy 0, policy_version 6213 (0.0009) +[2026-06-07 00:16:12,262][344387] Updated weights for policy 0, policy_version 6223 (0.0009) +[2026-06-07 00:16:14,242][344387] Updated weights for policy 0, policy_version 6233 (0.0009) +[2026-06-07 00:16:15,094][344387] Updated weights for policy 0, policy_version 6244 (0.0009) +[2026-06-07 00:16:15,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3481.6, 300 sec: 3408.8). Total num frames: 3196928. Throughput: 0: 3476.7. Samples: 3197958. Policy #0 lag: (min: 0.0, avg: 19.2, max: 35.0) +[2026-06-07 00:16:15,263][343476] Avg episode reward: [(0, '949.661')] +[2026-06-07 00:16:17,284][344387] Updated weights for policy 0, policy_version 6255 (0.0010) +[2026-06-07 00:16:19,174][344387] Updated weights for policy 0, policy_version 6265 (0.0009) +[2026-06-07 00:16:20,120][344387] Updated weights for policy 0, policy_version 6275 (0.0008) +[2026-06-07 00:16:20,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3481.6, 300 sec: 3394.8). Total num frames: 3213312. Throughput: 0: 3428.9. Samples: 3218092. Policy #0 lag: (min: 6.0, avg: 20.0, max: 38.0) +[2026-06-07 00:16:20,261][343476] Avg episode reward: [(0, '1039.687')] +[2026-06-07 00:16:22,033][344387] Updated weights for policy 0, policy_version 6285 (0.0008) +[2026-06-07 00:16:22,782][344387] Updated weights for policy 0, policy_version 6295 (0.0007) +[2026-06-07 00:16:24,795][344387] Updated weights for policy 0, policy_version 6306 (0.0008) +[2026-06-07 00:16:25,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3481.6, 300 sec: 3374.0). Total num frames: 3229696. Throughput: 0: 3385.3. Samples: 3238454. Policy #0 lag: (min: 6.0, avg: 20.0, max: 38.0) +[2026-06-07 00:16:25,262][343476] Avg episode reward: [(0, '998.917')] +[2026-06-07 00:16:26,688][344387] Updated weights for policy 0, policy_version 6317 (0.0008) +[2026-06-07 00:16:28,393][344387] Updated weights for policy 0, policy_version 6330 (0.0009) +[2026-06-07 00:16:29,514][344387] Updated weights for policy 0, policy_version 6342 (0.0009) +[2026-06-07 00:16:30,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3481.6, 300 sec: 3380.9). Total num frames: 3250176. Throughput: 0: 3400.6. Samples: 3249604. Policy #0 lag: (min: 0.0, avg: 20.3, max: 37.0) +[2026-06-07 00:16:30,260][343476] Avg episode reward: [(0, '1113.983')] +[2026-06-07 00:16:30,266][344304] Saving new best policy, reward=1113.983! +[2026-06-07 00:16:31,328][344304] Signal inference workers to stop experience collection... (550 times) +[2026-06-07 00:16:31,339][344304] Signal inference workers to resume experience collection... (550 times) +[2026-06-07 00:16:31,353][344387] InferenceWorker_p0-w0: stopping experience collection (550 times) +[2026-06-07 00:16:31,355][344387] Updated weights for policy 0, policy_version 6352 (0.0007) +[2026-06-07 00:16:31,376][344387] InferenceWorker_p0-w0: resuming experience collection (550 times) +[2026-06-07 00:16:32,831][344387] Updated weights for policy 0, policy_version 6362 (0.0011) +[2026-06-07 00:16:34,216][344387] Updated weights for policy 0, policy_version 6373 (0.0009) +[2026-06-07 00:16:35,257][343476] Fps is (10 sec: 3686.6, 60 sec: 3447.5, 300 sec: 3360.1). Total num frames: 3266560. Throughput: 0: 3402.9. Samples: 3271018. Policy #0 lag: (min: 1.0, avg: 17.1, max: 33.0) +[2026-06-07 00:16:35,260][343476] Avg episode reward: [(0, '877.286')] +[2026-06-07 00:16:35,867][344387] Updated weights for policy 0, policy_version 6383 (0.0010) +[2026-06-07 00:16:37,399][344387] Updated weights for policy 0, policy_version 6393 (0.0008) +[2026-06-07 00:16:38,322][344387] Updated weights for policy 0, policy_version 6403 (0.0008) +[2026-06-07 00:16:40,115][344387] Updated weights for policy 0, policy_version 6413 (0.0010) +[2026-06-07 00:16:40,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3447.5, 300 sec: 3360.1). Total num frames: 3284992. Throughput: 0: 3458.2. Samples: 3293162. Policy #0 lag: (min: 6.0, avg: 20.2, max: 38.0) +[2026-06-07 00:16:40,261][343476] Avg episode reward: [(0, '1137.836')] +[2026-06-07 00:16:40,269][344304] Saving new best policy, reward=1137.836! +[2026-06-07 00:16:41,075][344387] Updated weights for policy 0, policy_version 6424 (0.0009) +[2026-06-07 00:16:43,082][344387] Updated weights for policy 0, policy_version 6435 (0.0008) +[2026-06-07 00:16:44,787][344387] Updated weights for policy 0, policy_version 6447 (0.0009) +[2026-06-07 00:16:45,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3481.6, 300 sec: 3346.2). Total num frames: 3303424. Throughput: 0: 3448.5. Samples: 3303284. Policy #0 lag: (min: 3.0, avg: 19.6, max: 35.0) +[2026-06-07 00:16:45,263][343476] Avg episode reward: [(0, '1143.684')] +[2026-06-07 00:16:45,270][344304] Saving new best policy, reward=1143.684! +[2026-06-07 00:16:46,168][344387] Updated weights for policy 0, policy_version 6457 (0.0007) +[2026-06-07 00:16:47,752][344387] Updated weights for policy 0, policy_version 6472 (0.0008) +[2026-06-07 00:16:49,215][344387] Updated weights for policy 0, policy_version 6482 (0.0007) +[2026-06-07 00:16:50,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3515.7, 300 sec: 3353.2). Total num frames: 3321856. Throughput: 0: 3529.8. Samples: 3326846. Policy #0 lag: (min: 3.0, avg: 19.6, max: 35.0) +[2026-06-07 00:16:50,263][343476] Avg episode reward: [(0, '1042.492')] +[2026-06-07 00:16:50,647][344387] Updated weights for policy 0, policy_version 6492 (0.0008) +[2026-06-07 00:16:52,290][344387] Updated weights for policy 0, policy_version 6507 (0.0010) +[2026-06-07 00:16:54,344][344387] Updated weights for policy 0, policy_version 6517 (0.0010) +[2026-06-07 00:16:55,257][343476] Fps is (10 sec: 3686.6, 60 sec: 3549.9, 300 sec: 3339.3). Total num frames: 3340288. Throughput: 0: 3543.7. Samples: 3347954. Policy #0 lag: (min: 3.0, avg: 18.1, max: 35.0) +[2026-06-07 00:16:55,260][343476] Avg episode reward: [(0, '988.682')] +[2026-06-07 00:16:56,178][344387] Updated weights for policy 0, policy_version 6527 (0.0010) +[2026-06-07 00:16:57,508][344387] Updated weights for policy 0, policy_version 6539 (0.0008) +[2026-06-07 00:16:59,768][344387] Updated weights for policy 0, policy_version 6550 (0.0011) +[2026-06-07 00:17:00,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3447.5, 300 sec: 3325.4). Total num frames: 3354624. Throughput: 0: 3528.8. Samples: 3356750. Policy #0 lag: (min: 5.0, avg: 20.0, max: 39.0) +[2026-06-07 00:17:00,259][343476] Avg episode reward: [(0, '879.030')] +[2026-06-07 00:17:01,254][344387] Updated weights for policy 0, policy_version 6560 (0.0011) +[2026-06-07 00:17:03,374][344387] Updated weights for policy 0, policy_version 6575 (0.0008) +[2026-06-07 00:17:04,746][344387] Updated weights for policy 0, policy_version 6585 (0.0008) +[2026-06-07 00:17:05,258][343476] Fps is (10 sec: 3276.5, 60 sec: 3515.7, 300 sec: 3332.3). Total num frames: 3373056. Throughput: 0: 3543.5. Samples: 3377552. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:17:05,262][343476] Avg episode reward: [(0, '1191.959')] +[2026-06-07 00:17:05,270][344304] Saving new best policy, reward=1191.959! +[2026-06-07 00:17:06,330][344387] Updated weights for policy 0, policy_version 6595 (0.0008) +[2026-06-07 00:17:07,643][344387] Updated weights for policy 0, policy_version 6606 (0.0008) +[2026-06-07 00:17:08,582][344387] Updated weights for policy 0, policy_version 6616 (0.0007) +[2026-06-07 00:17:10,259][343476] Fps is (10 sec: 3686.2, 60 sec: 3515.7, 300 sec: 3339.3). Total num frames: 3391488. Throughput: 0: 3603.5. Samples: 3400610. Policy #0 lag: (min: 3.0, avg: 18.4, max: 35.0) +[2026-06-07 00:17:10,265][343476] Avg episode reward: [(0, '1160.129')] +[2026-06-07 00:17:10,804][344387] Updated weights for policy 0, policy_version 6629 (0.0008) +[2026-06-07 00:17:12,267][344387] Updated weights for policy 0, policy_version 6641 (0.0008) +[2026-06-07 00:17:13,414][344387] Updated weights for policy 0, policy_version 6651 (0.0008) +[2026-06-07 00:17:14,790][344387] Updated weights for policy 0, policy_version 6661 (0.0008) +[2026-06-07 00:17:15,258][343476] Fps is (10 sec: 4096.2, 60 sec: 3618.1, 300 sec: 3380.9). Total num frames: 3414016. Throughput: 0: 3612.3. Samples: 3412158. Policy #0 lag: (min: 3.0, avg: 18.4, max: 35.0) +[2026-06-07 00:17:15,261][343476] Avg episode reward: [(0, '1117.234')] +[2026-06-07 00:17:16,252][344387] Updated weights for policy 0, policy_version 6671 (0.0009) +[2026-06-07 00:17:17,499][344387] Updated weights for policy 0, policy_version 6681 (0.0007) +[2026-06-07 00:17:18,771][344387] Updated weights for policy 0, policy_version 6691 (0.0008) +[2026-06-07 00:17:20,162][344387] Updated weights for policy 0, policy_version 6701 (0.0008) +[2026-06-07 00:17:20,258][343476] Fps is (10 sec: 4096.2, 60 sec: 3652.3, 300 sec: 3394.8). Total num frames: 3432448. Throughput: 0: 3664.5. Samples: 3435920. Policy #0 lag: (min: 2.0, avg: 22.6, max: 42.0) +[2026-06-07 00:17:20,262][343476] Avg episode reward: [(0, '1028.634')] +[2026-06-07 00:17:21,093][344387] Updated weights for policy 0, policy_version 6711 (0.0009) +[2026-06-07 00:17:22,876][344387] Updated weights for policy 0, policy_version 6721 (0.0008) +[2026-06-07 00:17:23,615][344387] Updated weights for policy 0, policy_version 6731 (0.0008) +[2026-06-07 00:17:25,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3686.4, 300 sec: 3401.8). Total num frames: 3450880. Throughput: 0: 3675.7. Samples: 3458570. Policy #0 lag: (min: 0.0, avg: 17.4, max: 33.0) +[2026-06-07 00:17:25,261][343476] Avg episode reward: [(0, '1159.818')] +[2026-06-07 00:17:25,652][344387] Updated weights for policy 0, policy_version 6741 (0.0010) +[2026-06-07 00:17:27,171][344387] Updated weights for policy 0, policy_version 6751 (0.0011) +[2026-06-07 00:17:28,757][344387] Updated weights for policy 0, policy_version 6761 (0.0010) +[2026-06-07 00:17:29,934][344387] Updated weights for policy 0, policy_version 6771 (0.0008) +[2026-06-07 00:17:30,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3618.1, 300 sec: 3408.7). Total num frames: 3467264. Throughput: 0: 3662.8. Samples: 3468106. Policy #0 lag: (min: 1.0, avg: 17.3, max: 36.0) +[2026-06-07 00:17:30,260][343476] Avg episode reward: [(0, '838.117')] +[2026-06-07 00:17:31,809][344387] Updated weights for policy 0, policy_version 6781 (0.0010) +[2026-06-07 00:17:33,186][344387] Updated weights for policy 0, policy_version 6795 (0.0010) +[2026-06-07 00:17:34,968][344387] Updated weights for policy 0, policy_version 6805 (0.0009) +[2026-06-07 00:17:35,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3652.3, 300 sec: 3429.5). Total num frames: 3485696. Throughput: 0: 3624.1. Samples: 3489928. Policy #0 lag: (min: 2.0, avg: 22.5, max: 38.0) +[2026-06-07 00:17:35,265][343476] Avg episode reward: [(0, '837.851')] +[2026-06-07 00:17:36,675][344387] Updated weights for policy 0, policy_version 6815 (0.0012) +[2026-06-07 00:17:37,973][344387] Updated weights for policy 0, policy_version 6827 (0.0009) +[2026-06-07 00:17:39,437][344387] Updated weights for policy 0, policy_version 6837 (0.0008) +[2026-06-07 00:17:40,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3618.1, 300 sec: 3436.5). Total num frames: 3502080. Throughput: 0: 3627.6. Samples: 3511194. Policy #0 lag: (min: 2.0, avg: 22.5, max: 38.0) +[2026-06-07 00:17:40,262][343476] Avg episode reward: [(0, '1141.036')] +[2026-06-07 00:17:40,897][344387] Updated weights for policy 0, policy_version 6847 (0.0009) +[2026-06-07 00:17:42,794][344387] Updated weights for policy 0, policy_version 6861 (0.0008) +[2026-06-07 00:17:43,937][344387] Updated weights for policy 0, policy_version 6871 (0.0009) +[2026-06-07 00:17:45,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3618.2, 300 sec: 3450.4). Total num frames: 3520512. Throughput: 0: 3686.4. Samples: 3522638. Policy #0 lag: (min: 1.0, avg: 15.2, max: 33.0) +[2026-06-07 00:17:45,259][343476] Avg episode reward: [(0, '936.691')] +[2026-06-07 00:17:46,070][344387] Updated weights for policy 0, policy_version 6881 (0.0011) +[2026-06-07 00:17:46,964][344387] Updated weights for policy 0, policy_version 6891 (0.0012) +[2026-06-07 00:17:48,983][344387] Updated weights for policy 0, policy_version 6901 (0.0009) +[2026-06-07 00:17:50,258][343476] Fps is (10 sec: 3481.3, 60 sec: 3584.0, 300 sec: 3464.2). Total num frames: 3536896. Throughput: 0: 3676.7. Samples: 3543004. Policy #0 lag: (min: 1.0, avg: 19.0, max: 37.0) +[2026-06-07 00:17:50,262][343476] Avg episode reward: [(0, '985.151')] +[2026-06-07 00:17:50,286][344387] Updated weights for policy 0, policy_version 6911 (0.0008) +[2026-06-07 00:17:51,468][344387] Updated weights for policy 0, policy_version 6921 (0.0009) +[2026-06-07 00:17:52,694][344387] Updated weights for policy 0, policy_version 6931 (0.0008) +[2026-06-07 00:17:54,664][344387] Updated weights for policy 0, policy_version 6941 (0.0008) +[2026-06-07 00:17:55,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3584.0, 300 sec: 3478.1). Total num frames: 3555328. Throughput: 0: 3654.2. Samples: 3565046. Policy #0 lag: (min: 3.0, avg: 18.5, max: 35.0) +[2026-06-07 00:17:55,259][343476] Avg episode reward: [(0, '1035.941')] +[2026-06-07 00:17:56,079][344387] Updated weights for policy 0, policy_version 6954 (0.0013) +[2026-06-07 00:17:57,295][344387] Updated weights for policy 0, policy_version 6964 (0.0008) +[2026-06-07 00:17:59,674][344387] Updated weights for policy 0, policy_version 6975 (0.0011) +[2026-06-07 00:18:00,257][343476] Fps is (10 sec: 3481.9, 60 sec: 3618.1, 300 sec: 3478.1). Total num frames: 3571712. Throughput: 0: 3627.6. Samples: 3575400. Policy #0 lag: (min: 3.0, avg: 18.5, max: 35.0) +[2026-06-07 00:18:00,260][343476] Avg episode reward: [(0, '1180.555')] +[2026-06-07 00:18:01,270][344387] Updated weights for policy 0, policy_version 6985 (0.0010) +[2026-06-07 00:18:02,520][344387] Updated weights for policy 0, policy_version 6995 (0.0010) +[2026-06-07 00:18:04,447][344387] Updated weights for policy 0, policy_version 7005 (0.0008) +[2026-06-07 00:18:05,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3618.2, 300 sec: 3492.0). Total num frames: 3590144. Throughput: 0: 3525.6. Samples: 3594574. Policy #0 lag: (min: 3.0, avg: 19.3, max: 36.0) +[2026-06-07 00:18:05,268][343476] Avg episode reward: [(0, '1174.583')] +[2026-06-07 00:18:05,507][344387] Updated weights for policy 0, policy_version 7015 (0.0008) +[2026-06-07 00:18:06,783][344387] Updated weights for policy 0, policy_version 7025 (0.0008) +[2026-06-07 00:18:08,281][344387] Updated weights for policy 0, policy_version 7036 (0.0008) +[2026-06-07 00:18:10,087][344387] Updated weights for policy 0, policy_version 7048 (0.0012) +[2026-06-07 00:18:10,259][343476] Fps is (10 sec: 3686.2, 60 sec: 3618.1, 300 sec: 3512.8). Total num frames: 3608576. Throughput: 0: 3507.7. Samples: 3616416. Policy #0 lag: (min: 1.0, avg: 17.7, max: 33.0) +[2026-06-07 00:18:10,264][343476] Avg episode reward: [(0, '1087.846')] +[2026-06-07 00:18:11,503][344387] Updated weights for policy 0, policy_version 7058 (0.0008) +[2026-06-07 00:18:13,033][344387] Updated weights for policy 0, policy_version 7068 (0.0008) +[2026-06-07 00:18:14,476][344387] Updated weights for policy 0, policy_version 7080 (0.0010) +[2026-06-07 00:18:15,257][343476] Fps is (10 sec: 3686.6, 60 sec: 3549.9, 300 sec: 3526.7). Total num frames: 3627008. Throughput: 0: 3542.1. Samples: 3627502. Policy #0 lag: (min: 3.0, avg: 17.2, max: 35.0) +[2026-06-07 00:18:15,260][343476] Avg episode reward: [(0, '1111.841')] +[2026-06-07 00:18:15,903][344387] Updated weights for policy 0, policy_version 7090 (0.0011) +[2026-06-07 00:18:17,826][344387] Updated weights for policy 0, policy_version 7101 (0.0010) +[2026-06-07 00:18:18,852][344387] Updated weights for policy 0, policy_version 7112 (0.0009) +[2026-06-07 00:18:20,141][344387] Updated weights for policy 0, policy_version 7122 (0.0008) +[2026-06-07 00:18:20,258][343476] Fps is (10 sec: 3891.2, 60 sec: 3584.0, 300 sec: 3547.5). Total num frames: 3647488. Throughput: 0: 3546.0. Samples: 3649500. Policy #0 lag: (min: 3.0, avg: 17.2, max: 35.0) +[2026-06-07 00:18:20,262][343476] Avg episode reward: [(0, '1076.212')] +[2026-06-07 00:18:21,696][344387] Updated weights for policy 0, policy_version 7132 (0.0009) +[2026-06-07 00:18:23,511][344387] Updated weights for policy 0, policy_version 7143 (0.0011) +[2026-06-07 00:18:24,782][344387] Updated weights for policy 0, policy_version 7153 (0.0009) +[2026-06-07 00:18:25,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3549.9, 300 sec: 3554.5). Total num frames: 3663872. Throughput: 0: 3551.5. Samples: 3671012. Policy #0 lag: (min: 3.0, avg: 19.8, max: 35.0) +[2026-06-07 00:18:25,259][343476] Avg episode reward: [(0, '1138.193')] +[2026-06-07 00:18:26,464][344387] Updated weights for policy 0, policy_version 7163 (0.0008) +[2026-06-07 00:18:27,790][344387] Updated weights for policy 0, policy_version 7174 (0.0009) +[2026-06-07 00:18:29,649][344387] Updated weights for policy 0, policy_version 7186 (0.0011) +[2026-06-07 00:18:30,257][343476] Fps is (10 sec: 3277.0, 60 sec: 3549.9, 300 sec: 3561.4). Total num frames: 3680256. Throughput: 0: 3554.8. Samples: 3682602. Policy #0 lag: (min: 3.0, avg: 17.1, max: 35.0) +[2026-06-07 00:18:30,260][343476] Avg episode reward: [(0, '1170.855')] +[2026-06-07 00:18:32,498][344387] Updated weights for policy 0, policy_version 7198 (0.0012) +[2026-06-07 00:18:34,330][344387] Updated weights for policy 0, policy_version 7210 (0.0011) +[2026-06-07 00:18:35,257][343476] Fps is (10 sec: 2867.2, 60 sec: 3447.5, 300 sec: 3554.5). Total num frames: 3692544. Throughput: 0: 3457.3. Samples: 3698578. Policy #0 lag: (min: 4.0, avg: 19.1, max: 38.0) +[2026-06-07 00:18:35,260][343476] Avg episode reward: [(0, '1145.519')] +[2026-06-07 00:18:36,878][344387] Updated weights for policy 0, policy_version 7222 (0.0012) +[2026-06-07 00:18:40,008][344387] Updated weights for policy 0, policy_version 7234 (0.0012) +[2026-06-07 00:18:40,257][343476] Fps is (10 sec: 2457.5, 60 sec: 3379.2, 300 sec: 3526.7). Total num frames: 3704832. Throughput: 0: 3302.7. Samples: 3713668. Policy #0 lag: (min: 4.0, avg: 19.1, max: 38.0) +[2026-06-07 00:18:40,260][343476] Avg episode reward: [(0, '1154.571')] +[2026-06-07 00:18:41,807][344387] Updated weights for policy 0, policy_version 7245 (0.0011) +[2026-06-07 00:18:44,969][344387] Updated weights for policy 0, policy_version 7257 (0.0010) +[2026-06-07 00:18:45,257][343476] Fps is (10 sec: 2457.6, 60 sec: 3276.8, 300 sec: 3505.9). Total num frames: 3717120. Throughput: 0: 3243.2. Samples: 3721342. Policy #0 lag: (min: 4.0, avg: 19.3, max: 36.0) +[2026-06-07 00:18:45,262][343476] Avg episode reward: [(0, '1196.888')] +[2026-06-07 00:18:45,272][344304] Saving new best policy, reward=1196.888! +[2026-06-07 00:18:47,651][344387] Updated weights for policy 0, policy_version 7269 (0.0010) +[2026-06-07 00:18:48,895][344387] Updated weights for policy 0, policy_version 7280 (0.0007) +[2026-06-07 00:18:50,258][343476] Fps is (10 sec: 2662.3, 60 sec: 3242.7, 300 sec: 3492.0). Total num frames: 3731456. Throughput: 0: 3152.8. Samples: 3736450. Policy #0 lag: (min: 3.0, avg: 15.8, max: 35.0) +[2026-06-07 00:18:50,264][343476] Avg episode reward: [(0, '1076.589')] +[2026-06-07 00:18:50,361][344387] Updated weights for policy 0, policy_version 7290 (0.0008) +[2026-06-07 00:18:51,457][344387] Updated weights for policy 0, policy_version 7300 (0.0006) +[2026-06-07 00:18:52,354][344387] Updated weights for policy 0, policy_version 7312 (0.0008) +[2026-06-07 00:18:54,179][344387] Updated weights for policy 0, policy_version 7322 (0.0009) +[2026-06-07 00:18:55,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3276.8, 300 sec: 3499.0). Total num frames: 3751936. Throughput: 0: 3208.4. Samples: 3760792. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 00:18:55,260][343476] Avg episode reward: [(0, '994.504')] +[2026-06-07 00:18:55,266][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000007328_3751936.pth... +[2026-06-07 00:18:55,711][344387] Updated weights for policy 0, policy_version 7332 (0.0010) +[2026-06-07 00:18:57,451][344387] Updated weights for policy 0, policy_version 7342 (0.0010) +[2026-06-07 00:18:59,800][344387] Updated weights for policy 0, policy_version 7354 (0.0011) +[2026-06-07 00:19:00,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3242.7, 300 sec: 3478.1). Total num frames: 3766272. Throughput: 0: 3153.3. Samples: 3769402. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 00:19:00,259][343476] Avg episode reward: [(0, '1113.696')] +[2026-06-07 00:19:01,746][344387] Updated weights for policy 0, policy_version 7365 (0.0012) +[2026-06-07 00:19:03,372][344387] Updated weights for policy 0, policy_version 7377 (0.0010) +[2026-06-07 00:19:05,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3174.4, 300 sec: 3464.2). Total num frames: 3780608. Throughput: 0: 3055.3. Samples: 3786988. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 00:19:05,261][343476] Avg episode reward: [(0, '1088.721')] +[2026-06-07 00:19:05,643][344387] Updated weights for policy 0, policy_version 7387 (0.0011) +[2026-06-07 00:19:07,736][344387] Updated weights for policy 0, policy_version 7399 (0.0008) +[2026-06-07 00:19:09,346][344387] Updated weights for policy 0, policy_version 7410 (0.0011) +[2026-06-07 00:19:10,259][343476] Fps is (10 sec: 2867.0, 60 sec: 3106.1, 300 sec: 3457.3). Total num frames: 3794944. Throughput: 0: 2945.5. Samples: 3803560. Policy #0 lag: (min: 4.0, avg: 19.1, max: 36.0) +[2026-06-07 00:19:10,265][343476] Avg episode reward: [(0, '1260.275')] +[2026-06-07 00:19:10,277][344304] Saving new best policy, reward=1260.275! +[2026-06-07 00:19:11,498][344387] Updated weights for policy 0, policy_version 7420 (0.0009) +[2026-06-07 00:19:13,225][344387] Updated weights for policy 0, policy_version 7430 (0.0009) +[2026-06-07 00:19:14,592][344387] Updated weights for policy 0, policy_version 7440 (0.0010) +[2026-06-07 00:19:15,257][343476] Fps is (10 sec: 3071.9, 60 sec: 3072.0, 300 sec: 3457.3). Total num frames: 3811328. Throughput: 0: 2882.5. Samples: 3812318. Policy #0 lag: (min: 3.0, avg: 19.8, max: 35.0) +[2026-06-07 00:19:15,259][343476] Avg episode reward: [(0, '1073.199')] +[2026-06-07 00:19:17,245][344387] Updated weights for policy 0, policy_version 7450 (0.0009) +[2026-06-07 00:19:19,083][344387] Updated weights for policy 0, policy_version 7461 (0.0010) +[2026-06-07 00:19:20,149][344387] Updated weights for policy 0, policy_version 7474 (0.0012) +[2026-06-07 00:19:20,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3003.7, 300 sec: 3457.3). Total num frames: 3827712. Throughput: 0: 2929.7. Samples: 3830414. Policy #0 lag: (min: 3.0, avg: 19.8, max: 35.0) +[2026-06-07 00:19:20,260][343476] Avg episode reward: [(0, '1131.974')] +[2026-06-07 00:19:21,488][344387] Updated weights for policy 0, policy_version 7484 (0.0008) +[2026-06-07 00:19:22,883][344387] Updated weights for policy 0, policy_version 7494 (0.0008) +[2026-06-07 00:19:24,260][344387] Updated weights for policy 0, policy_version 7506 (0.0010) +[2026-06-07 00:19:25,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3037.9, 300 sec: 3464.2). Total num frames: 3846144. Throughput: 0: 3127.4. Samples: 3854402. Policy #0 lag: (min: 3.0, avg: 18.8, max: 35.0) +[2026-06-07 00:19:25,259][343476] Avg episode reward: [(0, '1244.771')] +[2026-06-07 00:19:25,608][344387] Updated weights for policy 0, policy_version 7516 (0.0008) +[2026-06-07 00:19:27,333][344387] Updated weights for policy 0, policy_version 7530 (0.0009) +[2026-06-07 00:19:28,317][344387] Updated weights for policy 0, policy_version 7540 (0.0007) +[2026-06-07 00:19:30,012][344387] Updated weights for policy 0, policy_version 7550 (0.0008) +[2026-06-07 00:19:30,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3106.1, 300 sec: 3464.2). Total num frames: 3866624. Throughput: 0: 3220.0. Samples: 3866242. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 00:19:30,261][343476] Avg episode reward: [(0, '1123.716')] +[2026-06-07 00:19:30,829][344387] Updated weights for policy 0, policy_version 7560 (0.0009) +[2026-06-07 00:19:32,140][344387] Updated weights for policy 0, policy_version 7570 (0.0008) +[2026-06-07 00:19:33,455][344387] Updated weights for policy 0, policy_version 7580 (0.0007) +[2026-06-07 00:19:34,555][344387] Updated weights for policy 0, policy_version 7590 (0.0007) +[2026-06-07 00:19:35,257][343476] Fps is (10 sec: 4300.7, 60 sec: 3276.8, 300 sec: 3485.1). Total num frames: 3889152. Throughput: 0: 3450.7. Samples: 3891732. Policy #0 lag: (min: 4.0, avg: 18.1, max: 36.0) +[2026-06-07 00:19:35,260][343476] Avg episode reward: [(0, '1175.226')] +[2026-06-07 00:19:35,685][344387] Updated weights for policy 0, policy_version 7600 (0.0007) +[2026-06-07 00:19:37,228][344387] Updated weights for policy 0, policy_version 7610 (0.0007) +[2026-06-07 00:19:38,055][344387] Updated weights for policy 0, policy_version 7620 (0.0007) +[2026-06-07 00:19:39,799][344387] Updated weights for policy 0, policy_version 7632 (0.0008) +[2026-06-07 00:19:40,257][343476] Fps is (10 sec: 4300.9, 60 sec: 3413.3, 300 sec: 3492.0). Total num frames: 3909632. Throughput: 0: 3487.9. Samples: 3917746. Policy #0 lag: (min: 4.0, avg: 18.1, max: 36.0) +[2026-06-07 00:19:40,260][343476] Avg episode reward: [(0, '1377.494')] +[2026-06-07 00:19:40,267][344304] Saving new best policy, reward=1377.494! +[2026-06-07 00:19:41,057][344387] Updated weights for policy 0, policy_version 7643 (0.0007) +[2026-06-07 00:19:42,442][344387] Updated weights for policy 0, policy_version 7653 (0.0007) +[2026-06-07 00:19:43,319][344387] Updated weights for policy 0, policy_version 7664 (0.0008) +[2026-06-07 00:19:44,805][344387] Updated weights for policy 0, policy_version 7674 (0.0007) +[2026-06-07 00:19:45,257][343476] Fps is (10 sec: 4300.9, 60 sec: 3584.0, 300 sec: 3512.8). Total num frames: 3932160. Throughput: 0: 3576.4. Samples: 3930340. Policy #0 lag: (min: 3.0, avg: 19.2, max: 35.0) +[2026-06-07 00:19:45,259][343476] Avg episode reward: [(0, '1015.529')] +[2026-06-07 00:19:45,652][344387] Updated weights for policy 0, policy_version 7684 (0.0008) +[2026-06-07 00:19:47,010][344387] Updated weights for policy 0, policy_version 7694 (0.0009) +[2026-06-07 00:19:48,008][344387] Updated weights for policy 0, policy_version 7704 (0.0010) +[2026-06-07 00:19:50,204][344387] Updated weights for policy 0, policy_version 7717 (0.0009) +[2026-06-07 00:19:50,257][343476] Fps is (10 sec: 4096.0, 60 sec: 3652.3, 300 sec: 3512.8). Total num frames: 3950592. Throughput: 0: 3756.6. Samples: 3956036. Policy #0 lag: (min: 3.0, avg: 20.4, max: 35.0) +[2026-06-07 00:19:50,259][343476] Avg episode reward: [(0, '1285.754')] +[2026-06-07 00:19:51,004][344387] Updated weights for policy 0, policy_version 7727 (0.0008) +[2026-06-07 00:19:53,287][344387] Updated weights for policy 0, policy_version 7737 (0.0008) +[2026-06-07 00:19:53,627][344304] Signal inference workers to stop experience collection... (600 times) +[2026-06-07 00:19:53,651][344387] InferenceWorker_p0-w0: stopping experience collection (600 times) +[2026-06-07 00:19:53,732][344304] Signal inference workers to resume experience collection... (600 times) +[2026-06-07 00:19:53,733][344387] InferenceWorker_p0-w0: resuming experience collection (600 times) +[2026-06-07 00:19:54,529][344387] Updated weights for policy 0, policy_version 7754 (0.0008) +[2026-06-07 00:19:55,258][343476] Fps is (10 sec: 4095.8, 60 sec: 3686.4, 300 sec: 3533.7). Total num frames: 3973120. Throughput: 0: 3938.8. Samples: 3980804. Policy #0 lag: (min: 4.0, avg: 20.7, max: 36.0) +[2026-06-07 00:19:55,260][343476] Avg episode reward: [(0, '1032.503')] +[2026-06-07 00:19:55,481][344387] Updated weights for policy 0, policy_version 7764 (0.0007) +[2026-06-07 00:19:56,987][344387] Updated weights for policy 0, policy_version 7774 (0.0007) +[2026-06-07 00:19:57,968][344387] Updated weights for policy 0, policy_version 7784 (0.0007) +[2026-06-07 00:19:59,329][344387] Updated weights for policy 0, policy_version 7794 (0.0007) +[2026-06-07 00:20:00,257][343476] Fps is (10 sec: 4300.8, 60 sec: 3788.8, 300 sec: 3533.7). Total num frames: 3993600. Throughput: 0: 4023.7. Samples: 3993382. Policy #0 lag: (min: 4.0, avg: 20.7, max: 36.0) +[2026-06-07 00:20:00,259][343476] Avg episode reward: [(0, '1090.620')] +[2026-06-07 00:20:00,900][344387] Updated weights for policy 0, policy_version 7806 (0.0008) +[2026-06-07 00:20:01,707][344387] Updated weights for policy 0, policy_version 7816 (0.0008) +[2026-06-07 00:20:03,227][344387] Updated weights for policy 0, policy_version 7826 (0.0007) +[2026-06-07 00:20:04,815][344387] Updated weights for policy 0, policy_version 7839 (0.0007) +[2026-06-07 00:20:05,257][343476] Fps is (10 sec: 4096.1, 60 sec: 3891.2, 300 sec: 3540.6). Total num frames: 4014080. Throughput: 0: 4186.6. Samples: 4018812. Policy #0 lag: (min: 3.0, avg: 20.6, max: 39.0) +[2026-06-07 00:20:05,260][343476] Avg episode reward: [(0, '1127.673')] +[2026-06-07 00:20:06,129][344387] Updated weights for policy 0, policy_version 7850 (0.0007) +[2026-06-07 00:20:07,163][344387] Updated weights for policy 0, policy_version 7860 (0.0007) +[2026-06-07 00:20:08,999][344387] Updated weights for policy 0, policy_version 7872 (0.0010) +[2026-06-07 00:20:10,257][344387] Updated weights for policy 0, policy_version 7882 (0.0008) +[2026-06-07 00:20:10,257][343476] Fps is (10 sec: 4095.9, 60 sec: 3993.6, 300 sec: 3547.6). Total num frames: 4034560. Throughput: 0: 4188.7. Samples: 4042896. Policy #0 lag: (min: 3.0, avg: 18.8, max: 35.0) +[2026-06-07 00:20:10,260][343476] Avg episode reward: [(0, '1232.619')] +[2026-06-07 00:20:11,379][344387] Updated weights for policy 0, policy_version 7892 (0.0006) +[2026-06-07 00:20:12,940][344387] Updated weights for policy 0, policy_version 7904 (0.0009) +[2026-06-07 00:20:14,727][344387] Updated weights for policy 0, policy_version 7920 (0.0007) +[2026-06-07 00:20:15,257][343476] Fps is (10 sec: 4096.0, 60 sec: 4061.9, 300 sec: 3561.4). Total num frames: 4055040. Throughput: 0: 4217.2. Samples: 4056016. Policy #0 lag: (min: 3.0, avg: 18.8, max: 35.0) +[2026-06-07 00:20:15,260][343476] Avg episode reward: [(0, '1210.626')] +[2026-06-07 00:20:16,641][344387] Updated weights for policy 0, policy_version 7930 (0.0008) +[2026-06-07 00:20:17,838][344387] Updated weights for policy 0, policy_version 7943 (0.0007) +[2026-06-07 00:20:19,144][344387] Updated weights for policy 0, policy_version 7953 (0.0008) +[2026-06-07 00:20:20,258][343476] Fps is (10 sec: 4096.0, 60 sec: 4130.1, 300 sec: 3575.3). Total num frames: 4075520. Throughput: 0: 4187.5. Samples: 4080170. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 00:20:20,261][343476] Avg episode reward: [(0, '1190.134')] +[2026-06-07 00:20:20,691][344387] Updated weights for policy 0, policy_version 7964 (0.0008) +[2026-06-07 00:20:21,753][344387] Updated weights for policy 0, policy_version 7975 (0.0008) +[2026-06-07 00:20:23,076][344387] Updated weights for policy 0, policy_version 7986 (0.0007) +[2026-06-07 00:20:24,574][344387] Updated weights for policy 0, policy_version 7997 (0.0007) +[2026-06-07 00:20:25,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4198.4, 300 sec: 3582.3). Total num frames: 4098048. Throughput: 0: 4171.6. Samples: 4105468. Policy #0 lag: (min: 3.0, avg: 21.5, max: 35.0) +[2026-06-07 00:20:25,262][343476] Avg episode reward: [(0, '1076.565')] +[2026-06-07 00:20:25,486][344387] Updated weights for policy 0, policy_version 8007 (0.0007) +[2026-06-07 00:20:26,890][344387] Updated weights for policy 0, policy_version 8019 (0.0009) +[2026-06-07 00:20:28,326][344387] Updated weights for policy 0, policy_version 8029 (0.0008) +[2026-06-07 00:20:29,214][344387] Updated weights for policy 0, policy_version 8039 (0.0007) +[2026-06-07 00:20:30,257][343476] Fps is (10 sec: 4505.6, 60 sec: 4232.5, 300 sec: 3596.2). Total num frames: 4120576. Throughput: 0: 4187.7. Samples: 4118790. Policy #0 lag: (min: 3.0, avg: 21.4, max: 39.0) +[2026-06-07 00:20:30,260][343476] Avg episode reward: [(0, '1019.750')] +[2026-06-07 00:20:30,470][344387] Updated weights for policy 0, policy_version 8049 (0.0007) +[2026-06-07 00:20:31,741][344387] Updated weights for policy 0, policy_version 8059 (0.0007) +[2026-06-07 00:20:32,809][344387] Updated weights for policy 0, policy_version 8069 (0.0007) +[2026-06-07 00:20:34,338][344387] Updated weights for policy 0, policy_version 8081 (0.0012) +[2026-06-07 00:20:35,258][343476] Fps is (10 sec: 4095.9, 60 sec: 4164.3, 300 sec: 3596.2). Total num frames: 4139008. Throughput: 0: 4183.7. Samples: 4144306. Policy #0 lag: (min: 3.0, avg: 21.4, max: 39.0) +[2026-06-07 00:20:35,262][343476] Avg episode reward: [(0, '1199.276')] +[2026-06-07 00:20:36,399][344387] Updated weights for policy 0, policy_version 8093 (0.0010) +[2026-06-07 00:20:37,142][344387] Updated weights for policy 0, policy_version 8103 (0.0009) +[2026-06-07 00:20:38,455][344387] Updated weights for policy 0, policy_version 8113 (0.0008) +[2026-06-07 00:20:40,051][344387] Updated weights for policy 0, policy_version 8123 (0.0009) +[2026-06-07 00:20:40,257][343476] Fps is (10 sec: 3891.3, 60 sec: 4164.3, 300 sec: 3610.0). Total num frames: 4159488. Throughput: 0: 4162.0. Samples: 4168092. Policy #0 lag: (min: 3.0, avg: 19.0, max: 35.0) +[2026-06-07 00:20:40,259][343476] Avg episode reward: [(0, '1252.483')] +[2026-06-07 00:20:41,094][344387] Updated weights for policy 0, policy_version 8133 (0.0007) +[2026-06-07 00:20:42,124][344387] Updated weights for policy 0, policy_version 8143 (0.0007) +[2026-06-07 00:20:43,808][344387] Updated weights for policy 0, policy_version 8153 (0.0008) +[2026-06-07 00:20:44,611][344387] Updated weights for policy 0, policy_version 8163 (0.0007) +[2026-06-07 00:20:45,257][343476] Fps is (10 sec: 4301.0, 60 sec: 4164.3, 300 sec: 3630.9). Total num frames: 4182016. Throughput: 0: 4162.5. Samples: 4180696. Policy #0 lag: (min: 0.0, avg: 16.3, max: 36.0) +[2026-06-07 00:20:45,259][343476] Avg episode reward: [(0, '1239.911')] +[2026-06-07 00:20:45,940][344387] Updated weights for policy 0, policy_version 8175 (0.0008) +[2026-06-07 00:20:47,764][344387] Updated weights for policy 0, policy_version 8185 (0.0008) +[2026-06-07 00:20:48,386][344387] Updated weights for policy 0, policy_version 8195 (0.0007) +[2026-06-07 00:20:49,696][344387] Updated weights for policy 0, policy_version 8205 (0.0007) +[2026-06-07 00:20:50,258][343476] Fps is (10 sec: 4505.4, 60 sec: 4232.5, 300 sec: 3651.7). Total num frames: 4204544. Throughput: 0: 4166.0. Samples: 4206284. Policy #0 lag: (min: 0.0, avg: 16.3, max: 36.0) +[2026-06-07 00:20:50,260][343476] Avg episode reward: [(0, '1235.981')] +[2026-06-07 00:20:51,239][344387] Updated weights for policy 0, policy_version 8215 (0.0008) +[2026-06-07 00:20:52,595][344387] Updated weights for policy 0, policy_version 8226 (0.0008) +[2026-06-07 00:20:53,894][344387] Updated weights for policy 0, policy_version 8236 (0.0009) +[2026-06-07 00:20:55,258][343476] Fps is (10 sec: 3891.0, 60 sec: 4130.1, 300 sec: 3637.8). Total num frames: 4220928. Throughput: 0: 4141.6. Samples: 4229270. Policy #0 lag: (min: 3.0, avg: 20.5, max: 37.0) +[2026-06-07 00:20:55,263][343476] Avg episode reward: [(0, '1040.331')] +[2026-06-07 00:20:55,748][344387] Updated weights for policy 0, policy_version 8248 (0.0008) +[2026-06-07 00:20:57,178][344387] Updated weights for policy 0, policy_version 8261 (0.0008) +[2026-06-07 00:20:58,455][344387] Updated weights for policy 0, policy_version 8273 (0.0010) +[2026-06-07 00:21:00,258][343476] Fps is (10 sec: 3481.6, 60 sec: 4096.0, 300 sec: 3651.7). Total num frames: 4239360. Throughput: 0: 4122.0. Samples: 4241506. Policy #0 lag: (min: 4.0, avg: 21.4, max: 39.0) +[2026-06-07 00:21:00,259][343476] Avg episode reward: [(0, '1231.189')] +[2026-06-07 00:21:00,306][344387] Updated weights for policy 0, policy_version 8283 (0.0009) +[2026-06-07 00:21:02,234][344387] Updated weights for policy 0, policy_version 8297 (0.0009) +[2026-06-07 00:21:03,896][344387] Updated weights for policy 0, policy_version 8310 (0.0008) +[2026-06-07 00:21:05,215][344387] Updated weights for policy 0, policy_version 8323 (0.0009) +[2026-06-07 00:21:05,258][343476] Fps is (10 sec: 4096.0, 60 sec: 4130.1, 300 sec: 3665.6). Total num frames: 4261888. Throughput: 0: 4106.6. Samples: 4264968. Policy #0 lag: (min: 4.0, avg: 21.4, max: 39.0) +[2026-06-07 00:21:05,261][343476] Avg episode reward: [(0, '1275.959')] +[2026-06-07 00:21:06,613][344387] Updated weights for policy 0, policy_version 8333 (0.0009) +[2026-06-07 00:21:08,080][344387] Updated weights for policy 0, policy_version 8343 (0.0007) +[2026-06-07 00:21:09,335][344387] Updated weights for policy 0, policy_version 8353 (0.0008) +[2026-06-07 00:21:10,258][343476] Fps is (10 sec: 4096.1, 60 sec: 4096.0, 300 sec: 3672.5). Total num frames: 4280320. Throughput: 0: 4059.4. Samples: 4288142. Policy #0 lag: (min: 3.0, avg: 21.2, max: 35.0) +[2026-06-07 00:21:10,262][343476] Avg episode reward: [(0, '1354.956')] +[2026-06-07 00:21:10,544][344387] Updated weights for policy 0, policy_version 8363 (0.0007) +[2026-06-07 00:21:12,354][344387] Updated weights for policy 0, policy_version 8375 (0.0009) +[2026-06-07 00:21:13,608][344387] Updated weights for policy 0, policy_version 8386 (0.0008) +[2026-06-07 00:21:14,765][344387] Updated weights for policy 0, policy_version 8396 (0.0009) +[2026-06-07 00:21:15,258][343476] Fps is (10 sec: 3686.5, 60 sec: 4061.9, 300 sec: 3679.5). Total num frames: 4298752. Throughput: 0: 4020.4. Samples: 4299706. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 00:21:15,263][343476] Avg episode reward: [(0, '1320.131')] +[2026-06-07 00:21:16,641][344387] Updated weights for policy 0, policy_version 8406 (0.0007) +[2026-06-07 00:21:17,777][344387] Updated weights for policy 0, policy_version 8418 (0.0009) +[2026-06-07 00:21:18,893][344387] Updated weights for policy 0, policy_version 8428 (0.0007) +[2026-06-07 00:21:20,257][343476] Fps is (10 sec: 3891.3, 60 sec: 4061.9, 300 sec: 3693.3). Total num frames: 4319232. Throughput: 0: 3986.1. Samples: 4323678. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 00:21:20,260][343476] Avg episode reward: [(0, '1137.622')] +[2026-06-07 00:21:20,643][344387] Updated weights for policy 0, policy_version 8438 (0.0008) +[2026-06-07 00:21:21,538][344387] Updated weights for policy 0, policy_version 8448 (0.0007) +[2026-06-07 00:21:22,903][344387] Updated weights for policy 0, policy_version 8458 (0.0007) +[2026-06-07 00:21:24,591][344387] Updated weights for policy 0, policy_version 8470 (0.0008) +[2026-06-07 00:21:25,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3993.6, 300 sec: 3686.4). Total num frames: 4337664. Throughput: 0: 4004.0. Samples: 4348270. Policy #0 lag: (min: 2.0, avg: 21.9, max: 40.0) +[2026-06-07 00:21:25,260][343476] Avg episode reward: [(0, '1237.307')] +[2026-06-07 00:21:25,873][344387] Updated weights for policy 0, policy_version 8483 (0.0008) +[2026-06-07 00:21:27,534][344387] Updated weights for policy 0, policy_version 8496 (0.0009) +[2026-06-07 00:21:29,112][344387] Updated weights for policy 0, policy_version 8506 (0.0007) +[2026-06-07 00:21:29,988][344387] Updated weights for policy 0, policy_version 8516 (0.0007) +[2026-06-07 00:21:30,257][343476] Fps is (10 sec: 4096.0, 60 sec: 3993.6, 300 sec: 3707.2). Total num frames: 4360192. Throughput: 0: 3995.1. Samples: 4360476. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:21:30,259][343476] Avg episode reward: [(0, '1220.431')] +[2026-06-07 00:21:31,628][344387] Updated weights for policy 0, policy_version 8528 (0.0008) +[2026-06-07 00:21:32,995][344387] Updated weights for policy 0, policy_version 8538 (0.0008) +[2026-06-07 00:21:34,144][344387] Updated weights for policy 0, policy_version 8548 (0.0008) +[2026-06-07 00:21:35,152][344387] Updated weights for policy 0, policy_version 8558 (0.0008) +[2026-06-07 00:21:35,259][343476] Fps is (10 sec: 4505.0, 60 sec: 4061.8, 300 sec: 3721.1). Total num frames: 4382720. Throughput: 0: 3974.5. Samples: 4385138. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:21:35,264][343476] Avg episode reward: [(0, '1259.012')] +[2026-06-07 00:21:36,496][344387] Updated weights for policy 0, policy_version 8568 (0.0007) +[2026-06-07 00:21:37,814][344387] Updated weights for policy 0, policy_version 8578 (0.0007) +[2026-06-07 00:21:38,717][344387] Updated weights for policy 0, policy_version 8588 (0.0007) +[2026-06-07 00:21:40,257][343476] Fps is (10 sec: 4096.0, 60 sec: 4027.7, 300 sec: 3721.1). Total num frames: 4401152. Throughput: 0: 4026.0. Samples: 4410438. Policy #0 lag: (min: 2.0, avg: 21.2, max: 42.0) +[2026-06-07 00:21:40,260][343476] Avg episode reward: [(0, '1217.522')] +[2026-06-07 00:21:40,306][344387] Updated weights for policy 0, policy_version 8598 (0.0008) +[2026-06-07 00:21:41,275][344387] Updated weights for policy 0, policy_version 8608 (0.0008) +[2026-06-07 00:21:42,920][344387] Updated weights for policy 0, policy_version 8621 (0.0009) +[2026-06-07 00:21:44,354][344387] Updated weights for policy 0, policy_version 8631 (0.0007) +[2026-06-07 00:21:45,257][343476] Fps is (10 sec: 4096.5, 60 sec: 4027.7, 300 sec: 3735.0). Total num frames: 4423680. Throughput: 0: 4034.5. Samples: 4423056. Policy #0 lag: (min: 2.0, avg: 21.8, max: 38.0) +[2026-06-07 00:21:45,260][343476] Avg episode reward: [(0, '1069.641')] +[2026-06-07 00:21:45,708][344304] Signal inference workers to stop experience collection... (650 times) +[2026-06-07 00:21:45,726][344387] InferenceWorker_p0-w0: stopping experience collection (650 times) +[2026-06-07 00:21:45,798][344304] Signal inference workers to resume experience collection... (650 times) +[2026-06-07 00:21:45,799][344387] InferenceWorker_p0-w0: resuming experience collection (650 times) +[2026-06-07 00:21:45,801][344387] Updated weights for policy 0, policy_version 8644 (0.0008) +[2026-06-07 00:21:47,294][344387] Updated weights for policy 0, policy_version 8657 (0.0007) +[2026-06-07 00:21:48,740][344387] Updated weights for policy 0, policy_version 8667 (0.0007) +[2026-06-07 00:21:49,995][344387] Updated weights for policy 0, policy_version 8679 (0.0007) +[2026-06-07 00:21:50,258][343476] Fps is (10 sec: 4300.5, 60 sec: 3993.6, 300 sec: 3741.9). Total num frames: 4444160. Throughput: 0: 4056.9. Samples: 4447528. Policy #0 lag: (min: 2.0, avg: 21.8, max: 38.0) +[2026-06-07 00:21:50,261][343476] Avg episode reward: [(0, '1126.736')] +[2026-06-07 00:21:51,351][344387] Updated weights for policy 0, policy_version 8691 (0.0008) +[2026-06-07 00:21:53,152][344387] Updated weights for policy 0, policy_version 8701 (0.0008) +[2026-06-07 00:21:54,614][344387] Updated weights for policy 0, policy_version 8713 (0.0013) +[2026-06-07 00:21:55,258][343476] Fps is (10 sec: 4095.7, 60 sec: 4061.8, 300 sec: 3762.8). Total num frames: 4464640. Throughput: 0: 4088.4. Samples: 4472124. Policy #0 lag: (min: 3.0, avg: 18.5, max: 35.0) +[2026-06-07 00:21:55,261][343476] Avg episode reward: [(0, '1259.464')] +[2026-06-07 00:21:55,434][344387] Updated weights for policy 0, policy_version 8723 (0.0009) +[2026-06-07 00:21:57,075][344387] Updated weights for policy 0, policy_version 8733 (0.0008) +[2026-06-07 00:21:57,980][344387] Updated weights for policy 0, policy_version 8743 (0.0008) +[2026-06-07 00:21:59,161][344387] Updated weights for policy 0, policy_version 8753 (0.0007) +[2026-06-07 00:22:00,258][343476] Fps is (10 sec: 3891.3, 60 sec: 4061.9, 300 sec: 3762.8). Total num frames: 4483072. Throughput: 0: 4112.2. Samples: 4484754. Policy #0 lag: (min: 3.0, avg: 18.5, max: 35.0) +[2026-06-07 00:22:00,261][343476] Avg episode reward: [(0, '1403.189')] +[2026-06-07 00:22:00,461][344304] Saving new best policy, reward=1403.189! +[2026-06-07 00:22:00,973][344387] Updated weights for policy 0, policy_version 8768 (0.0008) +[2026-06-07 00:22:02,276][344387] Updated weights for policy 0, policy_version 8778 (0.0007) +[2026-06-07 00:22:02,997][344387] Updated weights for policy 0, policy_version 8788 (0.0008) +[2026-06-07 00:22:04,617][344387] Updated weights for policy 0, policy_version 8798 (0.0008) +[2026-06-07 00:22:05,258][343476] Fps is (10 sec: 4301.0, 60 sec: 4096.0, 300 sec: 3783.6). Total num frames: 4507648. Throughput: 0: 4162.4. Samples: 4510986. Policy #0 lag: (min: 2.0, avg: 21.5, max: 38.0) +[2026-06-07 00:22:05,263][343476] Avg episode reward: [(0, '1198.814')] +[2026-06-07 00:22:05,588][344387] Updated weights for policy 0, policy_version 8808 (0.0008) +[2026-06-07 00:22:06,689][344387] Updated weights for policy 0, policy_version 8819 (0.0008) +[2026-06-07 00:22:08,238][344387] Updated weights for policy 0, policy_version 8829 (0.0007) +[2026-06-07 00:22:09,275][344387] Updated weights for policy 0, policy_version 8839 (0.0006) +[2026-06-07 00:22:10,258][343476] Fps is (10 sec: 4505.5, 60 sec: 4130.1, 300 sec: 3776.7). Total num frames: 4528128. Throughput: 0: 4187.8. Samples: 4536722. Policy #0 lag: (min: 3.0, avg: 18.0, max: 35.0) +[2026-06-07 00:22:10,261][343476] Avg episode reward: [(0, '1247.661')] +[2026-06-07 00:22:10,491][344387] Updated weights for policy 0, policy_version 8850 (0.0007) +[2026-06-07 00:22:12,756][344387] Updated weights for policy 0, policy_version 8865 (0.0008) +[2026-06-07 00:22:13,904][344387] Updated weights for policy 0, policy_version 8875 (0.0007) +[2026-06-07 00:22:15,257][343476] Fps is (10 sec: 4096.1, 60 sec: 4164.3, 300 sec: 3783.6). Total num frames: 4548608. Throughput: 0: 4184.4. Samples: 4548774. Policy #0 lag: (min: 3.0, avg: 18.0, max: 35.0) +[2026-06-07 00:22:15,260][343476] Avg episode reward: [(0, '1400.724')] +[2026-06-07 00:22:15,785][344387] Updated weights for policy 0, policy_version 8890 (0.0007) +[2026-06-07 00:22:16,672][344387] Updated weights for policy 0, policy_version 8900 (0.0007) +[2026-06-07 00:22:18,456][344387] Updated weights for policy 0, policy_version 8913 (0.0007) +[2026-06-07 00:22:19,490][344387] Updated weights for policy 0, policy_version 8924 (0.0009) +[2026-06-07 00:22:20,258][343476] Fps is (10 sec: 4300.9, 60 sec: 4198.4, 300 sec: 3797.5). Total num frames: 4571136. Throughput: 0: 4226.9. Samples: 4575346. Policy #0 lag: (min: 3.0, avg: 18.1, max: 35.0) +[2026-06-07 00:22:20,263][343476] Avg episode reward: [(0, '1344.360')] +[2026-06-07 00:22:20,569][344387] Updated weights for policy 0, policy_version 8934 (0.0008) +[2026-06-07 00:22:21,849][344387] Updated weights for policy 0, policy_version 8944 (0.0007) +[2026-06-07 00:22:23,239][344387] Updated weights for policy 0, policy_version 8955 (0.0009) +[2026-06-07 00:22:24,219][344387] Updated weights for policy 0, policy_version 8965 (0.0008) +[2026-06-07 00:22:25,257][343476] Fps is (10 sec: 4505.6, 60 sec: 4266.7, 300 sec: 3818.3). Total num frames: 4593664. Throughput: 0: 4256.3. Samples: 4601972. Policy #0 lag: (min: 3.0, avg: 18.9, max: 39.0) +[2026-06-07 00:22:25,260][343476] Avg episode reward: [(0, '1097.493')] +[2026-06-07 00:22:25,272][344387] Updated weights for policy 0, policy_version 8975 (0.0007) +[2026-06-07 00:22:27,094][344387] Updated weights for policy 0, policy_version 8985 (0.0007) +[2026-06-07 00:22:28,016][344387] Updated weights for policy 0, policy_version 8995 (0.0009) +[2026-06-07 00:22:29,467][344387] Updated weights for policy 0, policy_version 9005 (0.0008) +[2026-06-07 00:22:30,258][343476] Fps is (10 sec: 4300.8, 60 sec: 4232.5, 300 sec: 3825.2). Total num frames: 4614144. Throughput: 0: 4233.7. Samples: 4613574. Policy #0 lag: (min: 3.0, avg: 18.9, max: 39.0) +[2026-06-07 00:22:30,261][343476] Avg episode reward: [(0, '1033.730')] +[2026-06-07 00:22:31,412][344387] Updated weights for policy 0, policy_version 9017 (0.0008) +[2026-06-07 00:22:32,471][344387] Updated weights for policy 0, policy_version 9029 (0.0008) +[2026-06-07 00:22:33,478][344387] Updated weights for policy 0, policy_version 9039 (0.0008) +[2026-06-07 00:22:35,257][343476] Fps is (10 sec: 3891.3, 60 sec: 4164.4, 300 sec: 3832.2). Total num frames: 4632576. Throughput: 0: 4242.6. Samples: 4638444. Policy #0 lag: (min: 1.0, avg: 17.9, max: 37.0) +[2026-06-07 00:22:35,259][343476] Avg episode reward: [(0, '1319.144')] +[2026-06-07 00:22:35,464][344387] Updated weights for policy 0, policy_version 9053 (0.0008) +[2026-06-07 00:22:36,465][344387] Updated weights for policy 0, policy_version 9063 (0.0008) +[2026-06-07 00:22:37,914][344387] Updated weights for policy 0, policy_version 9073 (0.0007) +[2026-06-07 00:22:39,544][344387] Updated weights for policy 0, policy_version 9087 (0.0008) +[2026-06-07 00:22:40,258][343476] Fps is (10 sec: 4095.9, 60 sec: 4232.5, 300 sec: 3846.1). Total num frames: 4655104. Throughput: 0: 4229.0. Samples: 4662428. Policy #0 lag: (min: 3.0, avg: 16.2, max: 35.0) +[2026-06-07 00:22:40,261][343476] Avg episode reward: [(0, '1142.363')] +[2026-06-07 00:22:41,140][344387] Updated weights for policy 0, policy_version 9098 (0.0008) +[2026-06-07 00:22:42,214][344387] Updated weights for policy 0, policy_version 9108 (0.0007) +[2026-06-07 00:22:43,615][344387] Updated weights for policy 0, policy_version 9119 (0.0009) +[2026-06-07 00:22:45,030][344387] Updated weights for policy 0, policy_version 9129 (0.0007) +[2026-06-07 00:22:45,257][343476] Fps is (10 sec: 4300.7, 60 sec: 4198.4, 300 sec: 3860.0). Total num frames: 4675584. Throughput: 0: 4215.8. Samples: 4674462. Policy #0 lag: (min: 3.0, avg: 16.2, max: 35.0) +[2026-06-07 00:22:45,259][343476] Avg episode reward: [(0, '1324.935')] +[2026-06-07 00:22:47,478][344387] Updated weights for policy 0, policy_version 9142 (0.0009) +[2026-06-07 00:22:48,060][344387] Updated weights for policy 0, policy_version 9152 (0.0007) +[2026-06-07 00:22:49,631][344387] Updated weights for policy 0, policy_version 9162 (0.0007) +[2026-06-07 00:22:50,257][343476] Fps is (10 sec: 3891.4, 60 sec: 4164.3, 300 sec: 3860.0). Total num frames: 4694016. Throughput: 0: 4131.9. Samples: 4696918. Policy #0 lag: (min: 3.0, avg: 15.6, max: 35.0) +[2026-06-07 00:22:50,259][343476] Avg episode reward: [(0, '1242.958')] +[2026-06-07 00:22:50,640][344387] Updated weights for policy 0, policy_version 9172 (0.0007) +[2026-06-07 00:22:52,705][344387] Updated weights for policy 0, policy_version 9186 (0.0010) +[2026-06-07 00:22:53,792][344387] Updated weights for policy 0, policy_version 9196 (0.0007) +[2026-06-07 00:22:55,257][343476] Fps is (10 sec: 3686.4, 60 sec: 4130.2, 300 sec: 3866.9). Total num frames: 4712448. Throughput: 0: 4095.1. Samples: 4720998. Policy #0 lag: (min: 3.0, avg: 15.6, max: 35.0) +[2026-06-07 00:22:55,265][343476] Avg episode reward: [(0, '1315.159')] +[2026-06-07 00:22:55,830][344387] Updated weights for policy 0, policy_version 9206 (0.0008) +[2026-06-07 00:22:56,609][344387] Updated weights for policy 0, policy_version 9218 (0.0008) +[2026-06-07 00:22:57,604][344387] Updated weights for policy 0, policy_version 9228 (0.0008) +[2026-06-07 00:22:59,536][344387] Updated weights for policy 0, policy_version 9238 (0.0009) +[2026-06-07 00:23:00,257][343476] Fps is (10 sec: 3891.2, 60 sec: 4164.3, 300 sec: 3873.9). Total num frames: 4732928. Throughput: 0: 4102.9. Samples: 4733406. Policy #0 lag: (min: 0.0, avg: 16.4, max: 36.0) +[2026-06-07 00:23:00,259][343476] Avg episode reward: [(0, '1282.496')] +[2026-06-07 00:23:00,501][344387] Updated weights for policy 0, policy_version 9249 (0.0008) +[2026-06-07 00:23:01,582][344387] Updated weights for policy 0, policy_version 9259 (0.0007) +[2026-06-07 00:23:03,603][344387] Updated weights for policy 0, policy_version 9269 (0.0008) +[2026-06-07 00:23:04,394][344387] Updated weights for policy 0, policy_version 9279 (0.0009) +[2026-06-07 00:23:05,257][343476] Fps is (10 sec: 4096.0, 60 sec: 4096.0, 300 sec: 3880.8). Total num frames: 4753408. Throughput: 0: 4058.3. Samples: 4757968. Policy #0 lag: (min: 3.0, avg: 16.2, max: 35.0) +[2026-06-07 00:23:05,260][343476] Avg episode reward: [(0, '1240.936')] +[2026-06-07 00:23:05,759][344387] Updated weights for policy 0, policy_version 9289 (0.0008) +[2026-06-07 00:23:06,834][344387] Updated weights for policy 0, policy_version 9299 (0.0009) +[2026-06-07 00:23:08,596][344387] Updated weights for policy 0, policy_version 9309 (0.0010) +[2026-06-07 00:23:09,507][344387] Updated weights for policy 0, policy_version 9319 (0.0009) +[2026-06-07 00:23:10,258][343476] Fps is (10 sec: 4095.8, 60 sec: 4096.0, 300 sec: 3887.7). Total num frames: 4773888. Throughput: 0: 3982.3. Samples: 4781176. Policy #0 lag: (min: 3.0, avg: 16.2, max: 35.0) +[2026-06-07 00:23:10,264][343476] Avg episode reward: [(0, '1288.499')] +[2026-06-07 00:23:11,018][344387] Updated weights for policy 0, policy_version 9329 (0.0008) +[2026-06-07 00:23:12,842][344387] Updated weights for policy 0, policy_version 9342 (0.0008) +[2026-06-07 00:23:13,724][344387] Updated weights for policy 0, policy_version 9352 (0.0008) +[2026-06-07 00:23:15,239][344387] Updated weights for policy 0, policy_version 9362 (0.0007) +[2026-06-07 00:23:15,257][343476] Fps is (10 sec: 3891.1, 60 sec: 4061.9, 300 sec: 3880.8). Total num frames: 4792320. Throughput: 0: 3984.9. Samples: 4792896. Policy #0 lag: (min: 0.0, avg: 16.6, max: 36.0) +[2026-06-07 00:23:15,260][343476] Avg episode reward: [(0, '1356.517')] +[2026-06-07 00:23:16,477][344387] Updated weights for policy 0, policy_version 9372 (0.0008) +[2026-06-07 00:23:18,124][344387] Updated weights for policy 0, policy_version 9384 (0.0010) +[2026-06-07 00:23:19,072][344387] Updated weights for policy 0, policy_version 9394 (0.0007) +[2026-06-07 00:23:20,181][344304] Signal inference workers to stop experience collection... (700 times) +[2026-06-07 00:23:20,208][344387] InferenceWorker_p0-w0: stopping experience collection (700 times) +[2026-06-07 00:23:20,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3993.6, 300 sec: 3887.7). Total num frames: 4810752. Throughput: 0: 3980.5. Samples: 4817570. Policy #0 lag: (min: 0.0, avg: 16.6, max: 36.0) +[2026-06-07 00:23:20,261][343476] Avg episode reward: [(0, '1254.329')] +[2026-06-07 00:23:20,296][344304] Signal inference workers to resume experience collection... (700 times) +[2026-06-07 00:23:20,297][344387] InferenceWorker_p0-w0: resuming experience collection (700 times) +[2026-06-07 00:23:21,112][344387] Updated weights for policy 0, policy_version 9410 (0.0007) +[2026-06-07 00:23:22,041][344387] Updated weights for policy 0, policy_version 9420 (0.0008) +[2026-06-07 00:23:24,043][344387] Updated weights for policy 0, policy_version 9432 (0.0008) +[2026-06-07 00:23:24,995][344387] Updated weights for policy 0, policy_version 9443 (0.0007) +[2026-06-07 00:23:25,259][343476] Fps is (10 sec: 4300.6, 60 sec: 4027.7, 300 sec: 3915.5). Total num frames: 4835328. Throughput: 0: 4006.4. Samples: 4842716. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 00:23:25,266][343476] Avg episode reward: [(0, '1213.179')] +[2026-06-07 00:23:26,496][344387] Updated weights for policy 0, policy_version 9453 (0.0007) +[2026-06-07 00:23:28,103][344387] Updated weights for policy 0, policy_version 9466 (0.0008) +[2026-06-07 00:23:29,497][344387] Updated weights for policy 0, policy_version 9477 (0.0012) +[2026-06-07 00:23:30,258][343476] Fps is (10 sec: 4505.5, 60 sec: 4027.7, 300 sec: 3943.3). Total num frames: 4855808. Throughput: 0: 4029.9. Samples: 4855808. Policy #0 lag: (min: 3.0, avg: 16.9, max: 35.0) +[2026-06-07 00:23:30,262][343476] Avg episode reward: [(0, '1244.391')] +[2026-06-07 00:23:30,652][344387] Updated weights for policy 0, policy_version 9488 (0.0010) +[2026-06-07 00:23:32,033][344387] Updated weights for policy 0, policy_version 9500 (0.0007) +[2026-06-07 00:23:33,148][344387] Updated weights for policy 0, policy_version 9510 (0.0007) +[2026-06-07 00:23:33,972][344387] Updated weights for policy 0, policy_version 9520 (0.0007) +[2026-06-07 00:23:35,258][343476] Fps is (10 sec: 4096.0, 60 sec: 4061.8, 300 sec: 3971.0). Total num frames: 4876288. Throughput: 0: 4109.7. Samples: 4881858. Policy #0 lag: (min: 3.0, avg: 16.9, max: 35.0) +[2026-06-07 00:23:35,260][343476] Avg episode reward: [(0, '1281.259')] +[2026-06-07 00:23:35,838][344387] Updated weights for policy 0, policy_version 9531 (0.0009) +[2026-06-07 00:23:37,760][344387] Updated weights for policy 0, policy_version 9542 (0.0011) +[2026-06-07 00:23:39,734][344387] Updated weights for policy 0, policy_version 9553 (0.0011) +[2026-06-07 00:23:40,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3959.5, 300 sec: 3984.9). Total num frames: 4892672. Throughput: 0: 4012.9. Samples: 4901580. Policy #0 lag: (min: 5.0, avg: 19.6, max: 39.0) +[2026-06-07 00:23:40,260][343476] Avg episode reward: [(0, '1208.438')] +[2026-06-07 00:23:40,860][344387] Updated weights for policy 0, policy_version 9563 (0.0009) +[2026-06-07 00:23:42,243][344387] Updated weights for policy 0, policy_version 9573 (0.0008) +[2026-06-07 00:23:43,389][344387] Updated weights for policy 0, policy_version 9583 (0.0008) +[2026-06-07 00:23:45,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3891.2, 300 sec: 3991.9). Total num frames: 4909056. Throughput: 0: 3992.5. Samples: 4913068. Policy #0 lag: (min: 3.0, avg: 20.6, max: 39.0) +[2026-06-07 00:23:45,259][343476] Avg episode reward: [(0, '1399.438')] +[2026-06-07 00:23:45,423][344387] Updated weights for policy 0, policy_version 9595 (0.0009) +[2026-06-07 00:23:46,934][344387] Updated weights for policy 0, policy_version 9605 (0.0010) +[2026-06-07 00:23:48,125][344387] Updated weights for policy 0, policy_version 9615 (0.0006) +[2026-06-07 00:23:49,827][344387] Updated weights for policy 0, policy_version 9625 (0.0007) +[2026-06-07 00:23:50,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3925.3, 300 sec: 3991.9). Total num frames: 4929536. Throughput: 0: 3921.9. Samples: 4934454. Policy #0 lag: (min: 3.0, avg: 20.6, max: 39.0) +[2026-06-07 00:23:50,260][343476] Avg episode reward: [(0, '1242.402')] +[2026-06-07 00:23:50,962][344387] Updated weights for policy 0, policy_version 9635 (0.0008) +[2026-06-07 00:23:52,613][344387] Updated weights for policy 0, policy_version 9645 (0.0009) +[2026-06-07 00:23:54,073][344387] Updated weights for policy 0, policy_version 9655 (0.0008) +[2026-06-07 00:23:55,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3891.2, 300 sec: 3998.8). Total num frames: 4945920. Throughput: 0: 3875.9. Samples: 4955590. Policy #0 lag: (min: 3.0, avg: 19.6, max: 35.0) +[2026-06-07 00:23:55,260][343476] Avg episode reward: [(0, '1320.469')] +[2026-06-07 00:23:55,590][344387] Updated weights for policy 0, policy_version 9668 (0.0009) +[2026-06-07 00:23:57,220][344387] Updated weights for policy 0, policy_version 9678 (0.0008) +[2026-06-07 00:23:58,731][344387] Updated weights for policy 0, policy_version 9688 (0.0008) +[2026-06-07 00:24:00,007][344387] Updated weights for policy 0, policy_version 9698 (0.0012) +[2026-06-07 00:24:00,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3891.2, 300 sec: 4019.6). Total num frames: 4966400. Throughput: 0: 3865.8. Samples: 4966858. Policy #0 lag: (min: 6.0, avg: 20.8, max: 39.0) +[2026-06-07 00:24:00,261][343476] Avg episode reward: [(0, '1241.960')] +[2026-06-07 00:24:01,452][344387] Updated weights for policy 0, policy_version 9708 (0.0008) +[2026-06-07 00:24:02,990][344387] Updated weights for policy 0, policy_version 9718 (0.0008) +[2026-06-07 00:24:03,923][344387] Updated weights for policy 0, policy_version 9728 (0.0007) +[2026-06-07 00:24:05,258][343476] Fps is (10 sec: 3890.9, 60 sec: 3857.0, 300 sec: 4033.5). Total num frames: 4984832. Throughput: 0: 3811.3. Samples: 4989080. Policy #0 lag: (min: 6.0, avg: 20.8, max: 39.0) +[2026-06-07 00:24:05,261][343476] Avg episode reward: [(0, '1154.081')] +[2026-06-07 00:24:05,366][344387] Updated weights for policy 0, policy_version 9738 (0.0007) +[2026-06-07 00:24:06,600][344387] Updated weights for policy 0, policy_version 9748 (0.0008) +[2026-06-07 00:24:08,129][344387] Updated weights for policy 0, policy_version 9758 (0.0010) +[2026-06-07 00:24:08,924][344387] Updated weights for policy 0, policy_version 9768 (0.0007) +[2026-06-07 00:24:10,257][343476] Fps is (10 sec: 3891.5, 60 sec: 3857.1, 300 sec: 4047.4). Total num frames: 5005312. Throughput: 0: 3774.0. Samples: 5012544. Policy #0 lag: (min: 3.0, avg: 19.1, max: 35.0) +[2026-06-07 00:24:10,260][343476] Avg episode reward: [(0, '1265.809')] +[2026-06-07 00:24:10,769][344387] Updated weights for policy 0, policy_version 9778 (0.0008) +[2026-06-07 00:24:11,747][344387] Updated weights for policy 0, policy_version 9788 (0.0009) +[2026-06-07 00:24:13,107][344387] Updated weights for policy 0, policy_version 9798 (0.0008) +[2026-06-07 00:24:14,501][344387] Updated weights for policy 0, policy_version 9808 (0.0008) +[2026-06-07 00:24:15,258][343476] Fps is (10 sec: 3891.5, 60 sec: 3857.1, 300 sec: 4054.3). Total num frames: 5023744. Throughput: 0: 3744.5. Samples: 5024310. Policy #0 lag: (min: 3.0, avg: 19.1, max: 35.0) +[2026-06-07 00:24:15,260][343476] Avg episode reward: [(0, '1259.068')] +[2026-06-07 00:24:16,052][344387] Updated weights for policy 0, policy_version 9818 (0.0007) +[2026-06-07 00:24:17,400][344387] Updated weights for policy 0, policy_version 9828 (0.0011) +[2026-06-07 00:24:19,023][344387] Updated weights for policy 0, policy_version 9838 (0.0009) +[2026-06-07 00:24:20,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3823.0, 300 sec: 4047.4). Total num frames: 5040128. Throughput: 0: 3633.2. Samples: 5045352. Policy #0 lag: (min: 0.0, avg: 16.9, max: 36.0) +[2026-06-07 00:24:20,258][343476] Avg episode reward: [(0, '1086.480')] +[2026-06-07 00:24:20,432][344387] Updated weights for policy 0, policy_version 9848 (0.0008) +[2026-06-07 00:24:21,818][344387] Updated weights for policy 0, policy_version 9858 (0.0007) +[2026-06-07 00:24:23,028][344387] Updated weights for policy 0, policy_version 9868 (0.0008) +[2026-06-07 00:24:25,077][344387] Updated weights for policy 0, policy_version 9878 (0.0008) +[2026-06-07 00:24:25,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3720.6, 300 sec: 4040.5). Total num frames: 5058560. Throughput: 0: 3684.6. Samples: 5067386. Policy #0 lag: (min: 3.0, avg: 18.7, max: 35.0) +[2026-06-07 00:24:25,260][343476] Avg episode reward: [(0, '1176.713')] +[2026-06-07 00:24:26,234][344387] Updated weights for policy 0, policy_version 9888 (0.0007) +[2026-06-07 00:24:27,722][344387] Updated weights for policy 0, policy_version 9898 (0.0008) +[2026-06-07 00:24:29,238][344387] Updated weights for policy 0, policy_version 9908 (0.0009) +[2026-06-07 00:24:30,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3652.3, 300 sec: 4019.6). Total num frames: 5074944. Throughput: 0: 3653.8. Samples: 5077488. Policy #0 lag: (min: 3.0, avg: 18.7, max: 35.0) +[2026-06-07 00:24:30,259][343476] Avg episode reward: [(0, '1249.354')] +[2026-06-07 00:24:30,615][344387] Updated weights for policy 0, policy_version 9918 (0.0012) +[2026-06-07 00:24:31,738][344387] Updated weights for policy 0, policy_version 9928 (0.0008) +[2026-06-07 00:24:34,000][344387] Updated weights for policy 0, policy_version 9938 (0.0009) +[2026-06-07 00:24:35,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3618.1, 300 sec: 4012.7). Total num frames: 5093376. Throughput: 0: 3645.7. Samples: 5098512. Policy #0 lag: (min: 3.0, avg: 20.7, max: 35.0) +[2026-06-07 00:24:35,259][343476] Avg episode reward: [(0, '1170.400')] +[2026-06-07 00:24:35,491][344387] Updated weights for policy 0, policy_version 9949 (0.0009) +[2026-06-07 00:24:36,592][344387] Updated weights for policy 0, policy_version 9959 (0.0007) +[2026-06-07 00:24:38,717][344387] Updated weights for policy 0, policy_version 9969 (0.0008) +[2026-06-07 00:24:39,922][344387] Updated weights for policy 0, policy_version 9979 (0.0010) +[2026-06-07 00:24:40,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3618.2, 300 sec: 3991.9). Total num frames: 5109760. Throughput: 0: 3626.5. Samples: 5118780. Policy #0 lag: (min: 3.0, avg: 20.7, max: 35.0) +[2026-06-07 00:24:40,259][343476] Avg episode reward: [(0, '1392.912')] +[2026-06-07 00:24:41,378][344387] Updated weights for policy 0, policy_version 9989 (0.0011) +[2026-06-07 00:24:43,019][344387] Updated weights for policy 0, policy_version 9999 (0.0008) +[2026-06-07 00:24:45,150][344387] Updated weights for policy 0, policy_version 10009 (0.0011) +[2026-06-07 00:24:45,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3584.0, 300 sec: 3978.0). Total num frames: 5124096. Throughput: 0: 3587.2. Samples: 5128280. Policy #0 lag: (min: 3.0, avg: 21.1, max: 35.0) +[2026-06-07 00:24:45,261][343476] Avg episode reward: [(0, '1361.536')] +[2026-06-07 00:24:46,101][344387] Updated weights for policy 0, policy_version 10019 (0.0009) +[2026-06-07 00:24:47,987][344387] Updated weights for policy 0, policy_version 10029 (0.0008) +[2026-06-07 00:24:49,671][344387] Updated weights for policy 0, policy_version 10039 (0.0009) +[2026-06-07 00:24:50,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3549.9, 300 sec: 3964.1). Total num frames: 5142528. Throughput: 0: 3527.4. Samples: 5147808. Policy #0 lag: (min: 3.0, avg: 18.2, max: 36.0) +[2026-06-07 00:24:50,260][343476] Avg episode reward: [(0, '1205.302')] +[2026-06-07 00:24:51,015][344387] Updated weights for policy 0, policy_version 10049 (0.0008) +[2026-06-07 00:24:52,390][344387] Updated weights for policy 0, policy_version 10059 (0.0010) +[2026-06-07 00:24:54,892][344387] Updated weights for policy 0, policy_version 10069 (0.0009) +[2026-06-07 00:24:55,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3515.7, 300 sec: 3943.3). Total num frames: 5156864. Throughput: 0: 3420.7. Samples: 5166476. Policy #0 lag: (min: 3.0, avg: 18.2, max: 36.0) +[2026-06-07 00:24:55,259][343476] Avg episode reward: [(0, '1309.583')] +[2026-06-07 00:24:55,863][344387] Updated weights for policy 0, policy_version 10079 (0.0010) +[2026-06-07 00:24:58,005][344387] Updated weights for policy 0, policy_version 10089 (0.0013) +[2026-06-07 00:25:00,258][343476] Fps is (10 sec: 2662.4, 60 sec: 3379.2, 300 sec: 3915.5). Total num frames: 5169152. Throughput: 0: 3332.6. Samples: 5174276. Policy #0 lag: (min: 1.0, avg: 19.4, max: 33.0) +[2026-06-07 00:25:00,260][343476] Avg episode reward: [(0, '1408.849')] +[2026-06-07 00:25:00,268][344304] Saving new best policy, reward=1408.849! +[2026-06-07 00:25:00,862][344387] Updated weights for policy 0, policy_version 10099 (0.0013) +[2026-06-07 00:25:02,755][344387] Updated weights for policy 0, policy_version 10109 (0.0010) +[2026-06-07 00:25:04,262][344387] Updated weights for policy 0, policy_version 10119 (0.0010) +[2026-06-07 00:25:05,257][343476] Fps is (10 sec: 2662.4, 60 sec: 3311.0, 300 sec: 3894.7). Total num frames: 5183488. Throughput: 0: 3179.3. Samples: 5188418. Policy #0 lag: (min: 1.0, avg: 19.4, max: 33.0) +[2026-06-07 00:25:05,261][343476] Avg episode reward: [(0, '1263.448')] +[2026-06-07 00:25:07,664][344387] Updated weights for policy 0, policy_version 10129 (0.0010) +[2026-06-07 00:25:08,942][344387] Updated weights for policy 0, policy_version 10139 (0.0011) +[2026-06-07 00:25:10,257][343476] Fps is (10 sec: 2662.4, 60 sec: 3174.4, 300 sec: 3866.9). Total num frames: 5195776. Throughput: 0: 3006.5. Samples: 5202676. Policy #0 lag: (min: 3.0, avg: 19.2, max: 35.0) +[2026-06-07 00:25:10,260][343476] Avg episode reward: [(0, '1379.357')] +[2026-06-07 00:25:11,064][344387] Updated weights for policy 0, policy_version 10149 (0.0013) +[2026-06-07 00:25:13,155][344387] Updated weights for policy 0, policy_version 10159 (0.0011) +[2026-06-07 00:25:15,257][343476] Fps is (10 sec: 2048.0, 60 sec: 3003.7, 300 sec: 3825.3). Total num frames: 5203968. Throughput: 0: 2939.8. Samples: 5209780. Policy #0 lag: (min: 1.0, avg: 15.3, max: 33.0) +[2026-06-07 00:25:15,260][343476] Avg episode reward: [(0, '1296.755')] +[2026-06-07 00:25:16,068][344387] Updated weights for policy 0, policy_version 10170 (0.0015) +[2026-06-07 00:25:17,567][344387] Updated weights for policy 0, policy_version 10180 (0.0014) +[2026-06-07 00:25:20,257][343476] Fps is (10 sec: 2048.0, 60 sec: 2935.5, 300 sec: 3790.5). Total num frames: 5216256. Throughput: 0: 2761.3. Samples: 5222770. Policy #0 lag: (min: 1.0, avg: 15.3, max: 33.0) +[2026-06-07 00:25:20,259][343476] Avg episode reward: [(0, '1257.632')] +[2026-06-07 00:25:20,719][344387] Updated weights for policy 0, policy_version 10190 (0.0013) +[2026-06-07 00:25:22,952][344387] Updated weights for policy 0, policy_version 10200 (0.0011) +[2026-06-07 00:25:24,511][344387] Updated weights for policy 0, policy_version 10210 (0.0011) +[2026-06-07 00:25:25,257][343476] Fps is (10 sec: 2457.6, 60 sec: 2833.1, 300 sec: 3755.8). Total num frames: 5228544. Throughput: 0: 2623.7. Samples: 5236848. Policy #0 lag: (min: 3.0, avg: 17.4, max: 35.0) +[2026-06-07 00:25:25,259][343476] Avg episode reward: [(0, '1306.162')] +[2026-06-07 00:25:26,717][344387] Updated weights for policy 0, policy_version 10220 (0.0015) +[2026-06-07 00:25:29,807][344387] Updated weights for policy 0, policy_version 10230 (0.0012) +[2026-06-07 00:25:30,258][343476] Fps is (10 sec: 2252.6, 60 sec: 2730.6, 300 sec: 3728.1). Total num frames: 5238784. Throughput: 0: 2550.6. Samples: 5243056. Policy #0 lag: (min: 3.0, avg: 17.4, max: 35.0) +[2026-06-07 00:25:30,260][343476] Avg episode reward: [(0, '1367.482')] +[2026-06-07 00:25:30,985][344387] Updated weights for policy 0, policy_version 10240 (0.0012) +[2026-06-07 00:25:33,128][344387] Updated weights for policy 0, policy_version 10250 (0.0011) +[2026-06-07 00:25:35,257][343476] Fps is (10 sec: 2252.8, 60 sec: 2628.3, 300 sec: 3700.3). Total num frames: 5251072. Throughput: 0: 2464.8. Samples: 5258724. Policy #0 lag: (min: 6.0, avg: 21.5, max: 38.0) +[2026-06-07 00:25:35,260][343476] Avg episode reward: [(0, '1247.915')] +[2026-06-07 00:25:35,832][344387] Updated weights for policy 0, policy_version 10260 (0.0014) +[2026-06-07 00:25:37,918][344387] Updated weights for policy 0, policy_version 10270 (0.0011) +[2026-06-07 00:25:39,200][344387] Updated weights for policy 0, policy_version 10280 (0.0010) +[2026-06-07 00:25:40,257][343476] Fps is (10 sec: 2662.5, 60 sec: 2594.1, 300 sec: 3672.5). Total num frames: 5265408. Throughput: 0: 2370.7. Samples: 5273156. Policy #0 lag: (min: 3.0, avg: 20.8, max: 35.0) +[2026-06-07 00:25:40,260][343476] Avg episode reward: [(0, '1224.120')] +[2026-06-07 00:25:41,979][344387] Updated weights for policy 0, policy_version 10290 (0.0010) +[2026-06-07 00:25:42,947][344387] Updated weights for policy 0, policy_version 10300 (0.0010) +[2026-06-07 00:25:44,645][344387] Updated weights for policy 0, policy_version 10310 (0.0009) +[2026-06-07 00:25:45,257][343476] Fps is (10 sec: 2867.3, 60 sec: 2594.2, 300 sec: 3644.8). Total num frames: 5279744. Throughput: 0: 2405.9. Samples: 5282542. Policy #0 lag: (min: 3.0, avg: 20.8, max: 35.0) +[2026-06-07 00:25:45,261][343476] Avg episode reward: [(0, '1323.072')] +[2026-06-07 00:25:46,349][344387] Updated weights for policy 0, policy_version 10320 (0.0009) +[2026-06-07 00:25:49,198][344387] Updated weights for policy 0, policy_version 10333 (0.0012) +[2026-06-07 00:25:50,258][343476] Fps is (10 sec: 2867.1, 60 sec: 2525.8, 300 sec: 3637.8). Total num frames: 5294080. Throughput: 0: 2465.2. Samples: 5299356. Policy #0 lag: (min: 7.0, avg: 18.1, max: 39.0) +[2026-06-07 00:25:50,261][343476] Avg episode reward: [(0, '1241.851')] +[2026-06-07 00:25:50,641][344387] Updated weights for policy 0, policy_version 10343 (0.0011) +[2026-06-07 00:25:54,249][344387] Updated weights for policy 0, policy_version 10353 (0.0012) +[2026-06-07 00:25:55,257][343476] Fps is (10 sec: 2457.6, 60 sec: 2457.6, 300 sec: 3610.0). Total num frames: 5304320. Throughput: 0: 2471.1. Samples: 5313876. Policy #0 lag: (min: 7.0, avg: 18.1, max: 39.0) +[2026-06-07 00:25:55,260][343476] Avg episode reward: [(0, '1204.511')] +[2026-06-07 00:25:55,746][344387] Updated weights for policy 0, policy_version 10363 (0.0012) +[2026-06-07 00:25:57,725][344387] Updated weights for policy 0, policy_version 10373 (0.0012) +[2026-06-07 00:25:59,757][344387] Updated weights for policy 0, policy_version 10384 (0.0009) +[2026-06-07 00:26:00,257][343476] Fps is (10 sec: 2252.9, 60 sec: 2457.6, 300 sec: 3575.3). Total num frames: 5316608. Throughput: 0: 2455.4. Samples: 5320272. Policy #0 lag: (min: 2.0, avg: 19.5, max: 38.0) +[2026-06-07 00:26:00,259][343476] Avg episode reward: [(0, '1373.552')] +[2026-06-07 00:26:01,648][344387] Updated weights for policy 0, policy_version 10394 (0.0009) +[2026-06-07 00:26:02,974][344387] Updated weights for policy 0, policy_version 10405 (0.0011) +[2026-06-07 00:26:04,524][344387] Updated weights for policy 0, policy_version 10415 (0.0009) +[2026-06-07 00:26:05,257][343476] Fps is (10 sec: 2867.3, 60 sec: 2491.7, 300 sec: 3568.4). Total num frames: 5332992. Throughput: 0: 2595.2. Samples: 5339552. Policy #0 lag: (min: 2.0, avg: 19.5, max: 38.0) +[2026-06-07 00:26:05,260][343476] Avg episode reward: [(0, '1312.984')] +[2026-06-07 00:26:06,531][344387] Updated weights for policy 0, policy_version 10425 (0.0009) +[2026-06-07 00:26:07,602][344387] Updated weights for policy 0, policy_version 10436 (0.0012) +[2026-06-07 00:26:09,920][344387] Updated weights for policy 0, policy_version 10446 (0.0010) +[2026-06-07 00:26:10,257][343476] Fps is (10 sec: 3276.9, 60 sec: 2560.0, 300 sec: 3561.4). Total num frames: 5349376. Throughput: 0: 2698.1. Samples: 5358260. Policy #0 lag: (min: 3.0, avg: 18.3, max: 35.0) +[2026-06-07 00:26:10,260][343476] Avg episode reward: [(0, '1311.311')] +[2026-06-07 00:26:11,660][344387] Updated weights for policy 0, policy_version 10456 (0.0008) +[2026-06-07 00:26:13,084][344387] Updated weights for policy 0, policy_version 10466 (0.0011) +[2026-06-07 00:26:14,553][344387] Updated weights for policy 0, policy_version 10476 (0.0008) +[2026-06-07 00:26:15,257][343476] Fps is (10 sec: 3072.0, 60 sec: 2662.4, 300 sec: 3540.6). Total num frames: 5363712. Throughput: 0: 2750.1. Samples: 5366806. Policy #0 lag: (min: 3.0, avg: 21.7, max: 37.0) +[2026-06-07 00:26:15,259][343476] Avg episode reward: [(0, '1217.352')] +[2026-06-07 00:26:16,680][344387] Updated weights for policy 0, policy_version 10486 (0.0009) +[2026-06-07 00:26:17,830][344387] Updated weights for policy 0, policy_version 10496 (0.0008) +[2026-06-07 00:26:19,245][344387] Updated weights for policy 0, policy_version 10506 (0.0009) +[2026-06-07 00:26:20,257][343476] Fps is (10 sec: 3276.8, 60 sec: 2764.8, 300 sec: 3540.6). Total num frames: 5382144. Throughput: 0: 2851.4. Samples: 5387036. Policy #0 lag: (min: 3.0, avg: 21.7, max: 37.0) +[2026-06-07 00:26:20,260][343476] Avg episode reward: [(0, '1358.795')] +[2026-06-07 00:26:21,275][344387] Updated weights for policy 0, policy_version 10516 (0.0008) +[2026-06-07 00:26:22,458][344387] Updated weights for policy 0, policy_version 10526 (0.0012) +[2026-06-07 00:26:23,428][344387] Updated weights for policy 0, policy_version 10536 (0.0008) +[2026-06-07 00:26:25,257][343476] Fps is (10 sec: 3481.5, 60 sec: 2833.1, 300 sec: 3519.8). Total num frames: 5398528. Throughput: 0: 2976.2. Samples: 5407086. Policy #0 lag: (min: 5.0, avg: 22.7, max: 40.0) +[2026-06-07 00:26:25,261][343476] Avg episode reward: [(0, '982.818')] +[2026-06-07 00:26:26,018][344387] Updated weights for policy 0, policy_version 10546 (0.0009) +[2026-06-07 00:26:27,022][344387] Updated weights for policy 0, policy_version 10556 (0.0008) +[2026-06-07 00:26:28,412][344387] Updated weights for policy 0, policy_version 10566 (0.0007) +[2026-06-07 00:26:30,003][344387] Updated weights for policy 0, policy_version 10576 (0.0010) +[2026-06-07 00:26:30,257][343476] Fps is (10 sec: 3276.8, 60 sec: 2935.5, 300 sec: 3499.0). Total num frames: 5414912. Throughput: 0: 2981.3. Samples: 5416700. Policy #0 lag: (min: 5.0, avg: 22.7, max: 40.0) +[2026-06-07 00:26:30,259][343476] Avg episode reward: [(0, '1241.366')] +[2026-06-07 00:26:32,348][344387] Updated weights for policy 0, policy_version 10588 (0.0008) +[2026-06-07 00:26:33,304][344387] Updated weights for policy 0, policy_version 10598 (0.0007) +[2026-06-07 00:26:35,066][344387] Updated weights for policy 0, policy_version 10608 (0.0008) +[2026-06-07 00:26:35,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3003.7, 300 sec: 3492.0). Total num frames: 5431296. Throughput: 0: 3052.6. Samples: 5436724. Policy #0 lag: (min: 3.0, avg: 18.0, max: 38.0) +[2026-06-07 00:26:35,261][343476] Avg episode reward: [(0, '1175.332')] +[2026-06-07 00:26:36,758][344387] Updated weights for policy 0, policy_version 10618 (0.0009) +[2026-06-07 00:26:37,913][344387] Updated weights for policy 0, policy_version 10628 (0.0008) +[2026-06-07 00:26:39,769][344387] Updated weights for policy 0, policy_version 10638 (0.0009) +[2026-06-07 00:26:40,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3037.9, 300 sec: 3471.2). Total num frames: 5447680. Throughput: 0: 3174.1. Samples: 5456708. Policy #0 lag: (min: 3.0, avg: 18.0, max: 38.0) +[2026-06-07 00:26:40,259][343476] Avg episode reward: [(0, '1169.439')] +[2026-06-07 00:26:41,159][344304] Signal inference workers to stop experience collection... (750 times) +[2026-06-07 00:26:41,170][344304] Signal inference workers to resume experience collection... (750 times) +[2026-06-07 00:26:41,185][344387] InferenceWorker_p0-w0: stopping experience collection (750 times) +[2026-06-07 00:26:41,208][344387] InferenceWorker_p0-w0: resuming experience collection (750 times) +[2026-06-07 00:26:41,614][344387] Updated weights for policy 0, policy_version 10648 (0.0008) +[2026-06-07 00:26:42,691][344387] Updated weights for policy 0, policy_version 10658 (0.0008) +[2026-06-07 00:26:43,888][344387] Updated weights for policy 0, policy_version 10668 (0.0008) +[2026-06-07 00:26:45,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3072.0, 300 sec: 3457.3). Total num frames: 5464064. Throughput: 0: 3248.4. Samples: 5466452. Policy #0 lag: (min: 1.0, avg: 16.7, max: 37.0) +[2026-06-07 00:26:45,264][343476] Avg episode reward: [(0, '1256.789')] +[2026-06-07 00:26:46,150][344387] Updated weights for policy 0, policy_version 10678 (0.0009) +[2026-06-07 00:26:47,368][344387] Updated weights for policy 0, policy_version 10688 (0.0009) +[2026-06-07 00:26:48,854][344387] Updated weights for policy 0, policy_version 10698 (0.0009) +[2026-06-07 00:26:50,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3106.2, 300 sec: 3443.4). Total num frames: 5480448. Throughput: 0: 3261.1. Samples: 5486300. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 00:26:50,258][343476] Avg episode reward: [(0, '1344.683')] +[2026-06-07 00:26:51,068][344387] Updated weights for policy 0, policy_version 10708 (0.0010) +[2026-06-07 00:26:52,525][344387] Updated weights for policy 0, policy_version 10718 (0.0008) +[2026-06-07 00:26:54,318][344387] Updated weights for policy 0, policy_version 10729 (0.0009) +[2026-06-07 00:26:55,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3208.5, 300 sec: 3436.5). Total num frames: 5496832. Throughput: 0: 3249.8. Samples: 5504500. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 00:26:55,259][343476] Avg episode reward: [(0, '1227.198')] +[2026-06-07 00:26:56,180][344387] Updated weights for policy 0, policy_version 10739 (0.0008) +[2026-06-07 00:26:57,661][344387] Updated weights for policy 0, policy_version 10749 (0.0009) +[2026-06-07 00:26:58,427][344387] Updated weights for policy 0, policy_version 10760 (0.0008) +[2026-06-07 00:27:00,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3276.8, 300 sec: 3408.7). Total num frames: 5513216. Throughput: 0: 3294.5. Samples: 5515060. Policy #0 lag: (min: 5.0, avg: 22.5, max: 35.0) +[2026-06-07 00:27:00,259][343476] Avg episode reward: [(0, '1397.088')] +[2026-06-07 00:27:01,833][344387] Updated weights for policy 0, policy_version 10770 (0.0010) +[2026-06-07 00:27:03,025][344387] Updated weights for policy 0, policy_version 10780 (0.0013) +[2026-06-07 00:27:04,720][344387] Updated weights for policy 0, policy_version 10791 (0.0011) +[2026-06-07 00:27:05,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3208.5, 300 sec: 3380.9). Total num frames: 5525504. Throughput: 0: 3183.6. Samples: 5530296. Policy #0 lag: (min: 5.0, avg: 22.5, max: 35.0) +[2026-06-07 00:27:05,258][343476] Avg episode reward: [(0, '1398.054')] +[2026-06-07 00:27:07,250][344387] Updated weights for policy 0, policy_version 10801 (0.0008) +[2026-06-07 00:27:09,455][344387] Updated weights for policy 0, policy_version 10822 (0.0009) +[2026-06-07 00:27:10,257][343476] Fps is (10 sec: 2867.1, 60 sec: 3208.5, 300 sec: 3367.1). Total num frames: 5541888. Throughput: 0: 3194.0. Samples: 5550814. Policy #0 lag: (min: 0.0, avg: 17.0, max: 36.0) +[2026-06-07 00:27:10,261][343476] Avg episode reward: [(0, '1386.798')] +[2026-06-07 00:27:10,944][344387] Updated weights for policy 0, policy_version 10832 (0.0009) +[2026-06-07 00:27:12,846][344387] Updated weights for policy 0, policy_version 10842 (0.0011) +[2026-06-07 00:27:14,287][344387] Updated weights for policy 0, policy_version 10854 (0.0009) +[2026-06-07 00:27:15,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3276.8, 300 sec: 3353.2). Total num frames: 5560320. Throughput: 0: 3212.7. Samples: 5561274. Policy #0 lag: (min: 0.0, avg: 17.0, max: 36.0) +[2026-06-07 00:27:15,261][343476] Avg episode reward: [(0, '1244.416')] +[2026-06-07 00:27:16,007][344387] Updated weights for policy 0, policy_version 10864 (0.0007) +[2026-06-07 00:27:17,930][344387] Updated weights for policy 0, policy_version 10876 (0.0008) +[2026-06-07 00:27:19,614][344387] Updated weights for policy 0, policy_version 10890 (0.0008) +[2026-06-07 00:27:20,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3242.7, 300 sec: 3332.3). Total num frames: 5576704. Throughput: 0: 3236.7. Samples: 5582372. Policy #0 lag: (min: 3.0, avg: 20.2, max: 35.0) +[2026-06-07 00:27:20,261][343476] Avg episode reward: [(0, '1473.136')] +[2026-06-07 00:27:20,368][344304] Saving new best policy, reward=1473.136! +[2026-06-07 00:27:21,333][344387] Updated weights for policy 0, policy_version 10900 (0.0008) +[2026-06-07 00:27:23,415][344387] Updated weights for policy 0, policy_version 10917 (0.0008) +[2026-06-07 00:27:25,038][344387] Updated weights for policy 0, policy_version 10927 (0.0007) +[2026-06-07 00:27:25,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3276.8, 300 sec: 3325.4). Total num frames: 5595136. Throughput: 0: 3277.5. Samples: 5604196. Policy #0 lag: (min: 3.0, avg: 21.3, max: 35.0) +[2026-06-07 00:27:25,259][343476] Avg episode reward: [(0, '1325.046')] +[2026-06-07 00:27:27,501][344387] Updated weights for policy 0, policy_version 10941 (0.0008) +[2026-06-07 00:27:28,835][344387] Updated weights for policy 0, policy_version 10956 (0.0009) +[2026-06-07 00:27:30,258][343476] Fps is (10 sec: 3481.3, 60 sec: 3276.7, 300 sec: 3318.4). Total num frames: 5611520. Throughput: 0: 3298.9. Samples: 5614906. Policy #0 lag: (min: 3.0, avg: 21.3, max: 35.0) +[2026-06-07 00:27:30,262][343476] Avg episode reward: [(0, '1196.304')] +[2026-06-07 00:27:31,509][344387] Updated weights for policy 0, policy_version 10968 (0.0007) +[2026-06-07 00:27:33,636][344387] Updated weights for policy 0, policy_version 10986 (0.0008) +[2026-06-07 00:27:35,153][344387] Updated weights for policy 0, policy_version 10996 (0.0008) +[2026-06-07 00:27:35,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3311.0, 300 sec: 3304.6). Total num frames: 5629952. Throughput: 0: 3310.0. Samples: 5635252. Policy #0 lag: (min: 3.0, avg: 24.0, max: 39.0) +[2026-06-07 00:27:35,260][343476] Avg episode reward: [(0, '1350.368')] +[2026-06-07 00:27:37,562][344387] Updated weights for policy 0, policy_version 11014 (0.0011) +[2026-06-07 00:27:39,936][344387] Updated weights for policy 0, policy_version 11024 (0.0015) +[2026-06-07 00:27:40,259][343476] Fps is (10 sec: 3276.8, 60 sec: 3276.7, 300 sec: 3283.7). Total num frames: 5644288. Throughput: 0: 3303.1. Samples: 5653144. Policy #0 lag: (min: 3.0, avg: 24.0, max: 39.0) +[2026-06-07 00:27:40,264][343476] Avg episode reward: [(0, '1316.166')] +[2026-06-07 00:27:42,495][344387] Updated weights for policy 0, policy_version 11035 (0.0015) +[2026-06-07 00:27:44,299][344387] Updated weights for policy 0, policy_version 11047 (0.0013) +[2026-06-07 00:27:45,257][343476] Fps is (10 sec: 2662.5, 60 sec: 3208.6, 300 sec: 3262.9). Total num frames: 5656576. Throughput: 0: 3223.9. Samples: 5660134. Policy #0 lag: (min: 7.0, avg: 20.3, max: 39.0) +[2026-06-07 00:27:45,259][343476] Avg episode reward: [(0, '1285.175')] +[2026-06-07 00:27:47,609][344387] Updated weights for policy 0, policy_version 11057 (0.0010) +[2026-06-07 00:27:49,386][344387] Updated weights for policy 0, policy_version 11069 (0.0011) +[2026-06-07 00:27:50,258][343476] Fps is (10 sec: 2867.3, 60 sec: 3208.5, 300 sec: 3256.0). Total num frames: 5672960. Throughput: 0: 3242.1. Samples: 5676194. Policy #0 lag: (min: 7.0, avg: 20.3, max: 39.0) +[2026-06-07 00:27:50,264][343476] Avg episode reward: [(0, '1374.515')] +[2026-06-07 00:27:51,172][344387] Updated weights for policy 0, policy_version 11083 (0.0010) +[2026-06-07 00:27:53,634][344387] Updated weights for policy 0, policy_version 11093 (0.0009) +[2026-06-07 00:27:55,247][344387] Updated weights for policy 0, policy_version 11109 (0.0008) +[2026-06-07 00:27:55,258][343476] Fps is (10 sec: 3071.8, 60 sec: 3174.4, 300 sec: 3235.1). Total num frames: 5687296. Throughput: 0: 3216.1. Samples: 5695542. Policy #0 lag: (min: 3.0, avg: 23.0, max: 35.0) +[2026-06-07 00:27:55,261][343476] Avg episode reward: [(0, '1184.645')] +[2026-06-07 00:27:57,207][344387] Updated weights for policy 0, policy_version 11119 (0.0009) +[2026-06-07 00:27:59,290][344387] Updated weights for policy 0, policy_version 11133 (0.0008) +[2026-06-07 00:28:00,257][343476] Fps is (10 sec: 3072.2, 60 sec: 3174.4, 300 sec: 3221.3). Total num frames: 5703680. Throughput: 0: 3209.0. Samples: 5705680. Policy #0 lag: (min: 4.0, avg: 20.9, max: 37.0) +[2026-06-07 00:28:00,260][343476] Avg episode reward: [(0, '1352.780')] +[2026-06-07 00:28:01,228][344387] Updated weights for policy 0, policy_version 11146 (0.0008) +[2026-06-07 00:28:03,127][344387] Updated weights for policy 0, policy_version 11156 (0.0008) +[2026-06-07 00:28:03,905][344304] Signal inference workers to stop experience collection... (800 times) +[2026-06-07 00:28:03,933][344387] InferenceWorker_p0-w0: stopping experience collection (800 times) +[2026-06-07 00:28:04,027][344304] Signal inference workers to resume experience collection... (800 times) +[2026-06-07 00:28:04,029][344387] InferenceWorker_p0-w0: resuming experience collection (800 times) +[2026-06-07 00:28:05,199][344387] Updated weights for policy 0, policy_version 11174 (0.0062) +[2026-06-07 00:28:05,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3276.8, 300 sec: 3214.3). Total num frames: 5722112. Throughput: 0: 3179.7. Samples: 5725458. Policy #0 lag: (min: 4.0, avg: 20.9, max: 37.0) +[2026-06-07 00:28:05,262][343476] Avg episode reward: [(0, '1245.312')] +[2026-06-07 00:28:07,487][344387] Updated weights for policy 0, policy_version 11184 (0.0008) +[2026-06-07 00:28:09,770][344387] Updated weights for policy 0, policy_version 11197 (0.0007) +[2026-06-07 00:28:10,258][343476] Fps is (10 sec: 3071.7, 60 sec: 3208.5, 300 sec: 3193.5). Total num frames: 5734400. Throughput: 0: 3123.3. Samples: 5744748. Policy #0 lag: (min: 5.0, avg: 19.1, max: 37.0) +[2026-06-07 00:28:10,267][343476] Avg episode reward: [(0, '1279.188')] +[2026-06-07 00:28:11,358][344387] Updated weights for policy 0, policy_version 11212 (0.0008) +[2026-06-07 00:28:13,812][344387] Updated weights for policy 0, policy_version 11224 (0.0009) +[2026-06-07 00:28:15,110][344387] Updated weights for policy 0, policy_version 11237 (0.0010) +[2026-06-07 00:28:15,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3242.7, 300 sec: 3200.4). Total num frames: 5754880. Throughput: 0: 3107.3. Samples: 5754734. Policy #0 lag: (min: 5.0, avg: 19.1, max: 37.0) +[2026-06-07 00:28:15,261][343476] Avg episode reward: [(0, '1359.100')] +[2026-06-07 00:28:17,485][344387] Updated weights for policy 0, policy_version 11247 (0.0008) +[2026-06-07 00:28:19,151][344387] Updated weights for policy 0, policy_version 11260 (0.0010) +[2026-06-07 00:28:20,258][343476] Fps is (10 sec: 3686.6, 60 sec: 3242.7, 300 sec: 3172.7). Total num frames: 5771264. Throughput: 0: 3100.1. Samples: 5774756. Policy #0 lag: (min: 3.0, avg: 19.1, max: 39.0) +[2026-06-07 00:28:20,261][343476] Avg episode reward: [(0, '1264.653')] +[2026-06-07 00:28:21,074][344387] Updated weights for policy 0, policy_version 11273 (0.0008) +[2026-06-07 00:28:23,735][344387] Updated weights for policy 0, policy_version 11285 (0.0008) +[2026-06-07 00:28:25,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3140.3, 300 sec: 3144.9). Total num frames: 5783552. Throughput: 0: 3128.9. Samples: 5793942. Policy #0 lag: (min: 3.0, avg: 19.1, max: 39.0) +[2026-06-07 00:28:25,260][343476] Avg episode reward: [(0, '1168.448')] +[2026-06-07 00:28:25,702][344387] Updated weights for policy 0, policy_version 11303 (0.0008) +[2026-06-07 00:28:27,912][344387] Updated weights for policy 0, policy_version 11313 (0.0007) +[2026-06-07 00:28:29,608][344387] Updated weights for policy 0, policy_version 11328 (0.0010) +[2026-06-07 00:28:30,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3208.6, 300 sec: 3144.9). Total num frames: 5804032. Throughput: 0: 3205.5. Samples: 5804384. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 00:28:30,268][343476] Avg episode reward: [(0, '1233.017')] +[2026-06-07 00:28:31,217][344387] Updated weights for policy 0, policy_version 11340 (0.0009) +[2026-06-07 00:28:33,934][344387] Updated weights for policy 0, policy_version 11352 (0.0011) +[2026-06-07 00:28:35,090][344387] Updated weights for policy 0, policy_version 11364 (0.0010) +[2026-06-07 00:28:35,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3140.3, 300 sec: 3138.0). Total num frames: 5818368. Throughput: 0: 3269.0. Samples: 5823298. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 00:28:35,260][343476] Avg episode reward: [(0, '1212.728')] +[2026-06-07 00:28:37,553][344387] Updated weights for policy 0, policy_version 11374 (0.0007) +[2026-06-07 00:28:39,110][344387] Updated weights for policy 0, policy_version 11385 (0.0007) +[2026-06-07 00:28:40,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3208.6, 300 sec: 3144.9). Total num frames: 5836800. Throughput: 0: 3274.4. Samples: 5842890. Policy #0 lag: (min: 3.0, avg: 21.8, max: 35.0) +[2026-06-07 00:28:40,262][343476] Avg episode reward: [(0, '1380.945')] +[2026-06-07 00:28:41,293][344387] Updated weights for policy 0, policy_version 11401 (0.0011) +[2026-06-07 00:28:43,164][344387] Updated weights for policy 0, policy_version 11411 (0.0009) +[2026-06-07 00:28:45,121][344387] Updated weights for policy 0, policy_version 11429 (0.0008) +[2026-06-07 00:28:45,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3276.8, 300 sec: 3131.0). Total num frames: 5853184. Throughput: 0: 3271.6. Samples: 5852902. Policy #0 lag: (min: 10.0, avg: 25.9, max: 43.0) +[2026-06-07 00:28:45,259][343476] Avg episode reward: [(0, '1396.205')] +[2026-06-07 00:28:47,364][344387] Updated weights for policy 0, policy_version 11439 (0.0008) +[2026-06-07 00:28:48,956][344387] Updated weights for policy 0, policy_version 11452 (0.0010) +[2026-06-07 00:28:50,090][344387] Updated weights for policy 0, policy_version 11464 (0.0009) +[2026-06-07 00:28:50,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3276.8, 300 sec: 3131.0). Total num frames: 5869568. Throughput: 0: 3279.6. Samples: 5873038. Policy #0 lag: (min: 10.0, avg: 25.9, max: 43.0) +[2026-06-07 00:28:50,262][343476] Avg episode reward: [(0, '1242.875')] +[2026-06-07 00:28:53,128][344387] Updated weights for policy 0, policy_version 11476 (0.0010) +[2026-06-07 00:28:53,433][344304] Signal inference workers to stop experience collection... (850 times) +[2026-06-07 00:28:53,464][344387] InferenceWorker_p0-w0: stopping experience collection (850 times) +[2026-06-07 00:28:53,593][344304] Signal inference workers to resume experience collection... (850 times) +[2026-06-07 00:28:53,594][344387] InferenceWorker_p0-w0: resuming experience collection (850 times) +[2026-06-07 00:28:55,094][344387] Updated weights for policy 0, policy_version 11494 (0.0010) +[2026-06-07 00:28:55,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3310.9, 300 sec: 3117.1). Total num frames: 5885952. Throughput: 0: 3287.8. Samples: 5892700. Policy #0 lag: (min: 7.0, avg: 22.4, max: 43.0) +[2026-06-07 00:28:55,262][343476] Avg episode reward: [(0, '1093.310')] +[2026-06-07 00:28:55,269][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000011496_5885952.pth... +[2026-06-07 00:28:57,174][344387] Updated weights for policy 0, policy_version 11504 (0.0008) +[2026-06-07 00:28:58,996][344387] Updated weights for policy 0, policy_version 11516 (0.0008) +[2026-06-07 00:29:00,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3276.8, 300 sec: 3103.2). Total num frames: 5900288. Throughput: 0: 3299.8. Samples: 5903226. Policy #0 lag: (min: 7.0, avg: 22.4, max: 43.0) +[2026-06-07 00:29:00,260][343476] Avg episode reward: [(0, '1282.404')] +[2026-06-07 00:29:00,928][344387] Updated weights for policy 0, policy_version 11530 (0.0010) +[2026-06-07 00:29:03,139][344387] Updated weights for policy 0, policy_version 11540 (0.0009) +[2026-06-07 00:29:05,008][344387] Updated weights for policy 0, policy_version 11556 (0.0008) +[2026-06-07 00:29:05,257][343476] Fps is (10 sec: 3277.0, 60 sec: 3276.8, 300 sec: 3096.3). Total num frames: 5918720. Throughput: 0: 3281.2. Samples: 5922408. Policy #0 lag: (min: 6.0, avg: 20.3, max: 39.0) +[2026-06-07 00:29:05,260][343476] Avg episode reward: [(0, '1232.071')] +[2026-06-07 00:29:07,001][344387] Updated weights for policy 0, policy_version 11566 (0.0007) +[2026-06-07 00:29:08,629][344387] Updated weights for policy 0, policy_version 11577 (0.0007) +[2026-06-07 00:29:10,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3345.1, 300 sec: 3089.4). Total num frames: 5935104. Throughput: 0: 3310.0. Samples: 5942892. Policy #0 lag: (min: 6.0, avg: 20.3, max: 39.0) +[2026-06-07 00:29:10,262][343476] Avg episode reward: [(0, '1213.398')] +[2026-06-07 00:29:10,658][344387] Updated weights for policy 0, policy_version 11593 (0.0008) +[2026-06-07 00:29:12,200][344387] Updated weights for policy 0, policy_version 11603 (0.0008) +[2026-06-07 00:29:13,624][344387] Updated weights for policy 0, policy_version 11615 (0.0008) +[2026-06-07 00:29:15,005][344387] Updated weights for policy 0, policy_version 11625 (0.0008) +[2026-06-07 00:29:15,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3310.9, 300 sec: 3096.3). Total num frames: 5953536. Throughput: 0: 3328.6. Samples: 5954170. Policy #0 lag: (min: 4.0, avg: 18.8, max: 36.0) +[2026-06-07 00:29:15,265][343476] Avg episode reward: [(0, '1256.306')] +[2026-06-07 00:29:16,626][344387] Updated weights for policy 0, policy_version 11635 (0.0008) +[2026-06-07 00:29:18,334][344387] Updated weights for policy 0, policy_version 11648 (0.0008) +[2026-06-07 00:29:19,624][344387] Updated weights for policy 0, policy_version 11660 (0.0009) +[2026-06-07 00:29:20,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3310.9, 300 sec: 3089.4). Total num frames: 5969920. Throughput: 0: 3394.5. Samples: 5976050. Policy #0 lag: (min: 4.0, avg: 18.8, max: 36.0) +[2026-06-07 00:29:20,259][343476] Avg episode reward: [(0, '1211.885')] +[2026-06-07 00:29:21,606][344387] Updated weights for policy 0, policy_version 11670 (0.0008) +[2026-06-07 00:29:23,222][344387] Updated weights for policy 0, policy_version 11684 (0.0009) +[2026-06-07 00:29:25,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3379.2, 300 sec: 3089.4). Total num frames: 5986304. Throughput: 0: 3419.8. Samples: 5996782. Policy #0 lag: (min: 6.0, avg: 21.1, max: 38.0) +[2026-06-07 00:29:25,260][343476] Avg episode reward: [(0, '1206.161')] +[2026-06-07 00:29:25,266][344387] Updated weights for policy 0, policy_version 11694 (0.0007) +[2026-06-07 00:29:26,351][344387] Updated weights for policy 0, policy_version 11704 (0.0009) +[2026-06-07 00:29:28,304][344387] Updated weights for policy 0, policy_version 11720 (0.0008) +[2026-06-07 00:29:30,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3345.1, 300 sec: 3089.4). Total num frames: 6004736. Throughput: 0: 3432.4. Samples: 6007360. Policy #0 lag: (min: 6.0, avg: 21.1, max: 38.0) +[2026-06-07 00:29:30,261][343476] Avg episode reward: [(0, '1436.289')] +[2026-06-07 00:29:30,617][344387] Updated weights for policy 0, policy_version 11730 (0.0008) +[2026-06-07 00:29:33,007][344387] Updated weights for policy 0, policy_version 11748 (0.0008) +[2026-06-07 00:29:34,877][344387] Updated weights for policy 0, policy_version 11758 (0.0008) +[2026-06-07 00:29:35,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3379.2, 300 sec: 3089.4). Total num frames: 6021120. Throughput: 0: 3429.0. Samples: 6027342. Policy #0 lag: (min: 5.0, avg: 20.2, max: 38.0) +[2026-06-07 00:29:35,259][343476] Avg episode reward: [(0, '1334.818')] +[2026-06-07 00:29:36,039][344387] Updated weights for policy 0, policy_version 11768 (0.0009) +[2026-06-07 00:29:38,360][344387] Updated weights for policy 0, policy_version 11784 (0.0012) +[2026-06-07 00:29:40,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3345.1, 300 sec: 3096.3). Total num frames: 6037504. Throughput: 0: 3428.4. Samples: 6046976. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 00:29:40,260][343476] Avg episode reward: [(0, '1336.200')] +[2026-06-07 00:29:40,537][344387] Updated weights for policy 0, policy_version 11794 (0.0008) +[2026-06-07 00:29:42,036][344387] Updated weights for policy 0, policy_version 11806 (0.0009) +[2026-06-07 00:29:43,737][344387] Updated weights for policy 0, policy_version 11818 (0.0008) +[2026-06-07 00:29:45,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3345.1, 300 sec: 3089.4). Total num frames: 6053888. Throughput: 0: 3418.4. Samples: 6057054. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 00:29:45,259][343476] Avg episode reward: [(0, '1260.282')] +[2026-06-07 00:29:45,360][344387] Updated weights for policy 0, policy_version 11828 (0.0008) +[2026-06-07 00:29:47,474][344304] Signal inference workers to stop experience collection... (900 times) +[2026-06-07 00:29:47,513][344387] InferenceWorker_p0-w0: stopping experience collection (900 times) +[2026-06-07 00:29:47,651][344304] Signal inference workers to resume experience collection... (900 times) +[2026-06-07 00:29:47,652][344387] InferenceWorker_p0-w0: resuming experience collection (900 times) +[2026-06-07 00:29:47,776][344387] Updated weights for policy 0, policy_version 11845 (0.0010) +[2026-06-07 00:29:49,705][344387] Updated weights for policy 0, policy_version 11855 (0.0008) +[2026-06-07 00:29:50,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3345.1, 300 sec: 3096.3). Total num frames: 6070272. Throughput: 0: 3437.4. Samples: 6077090. Policy #0 lag: (min: 5.0, avg: 22.6, max: 38.0) +[2026-06-07 00:29:50,261][343476] Avg episode reward: [(0, '1243.571')] +[2026-06-07 00:29:51,627][344387] Updated weights for policy 0, policy_version 11865 (0.0008) +[2026-06-07 00:29:52,727][344387] Updated weights for policy 0, policy_version 11878 (0.0008) +[2026-06-07 00:29:54,874][344387] Updated weights for policy 0, policy_version 11888 (0.0008) +[2026-06-07 00:29:55,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3345.1, 300 sec: 3110.2). Total num frames: 6086656. Throughput: 0: 3410.9. Samples: 6096384. Policy #0 lag: (min: 5.0, avg: 22.6, max: 38.0) +[2026-06-07 00:29:55,260][343476] Avg episode reward: [(0, '1396.448')] +[2026-06-07 00:29:57,043][344387] Updated weights for policy 0, policy_version 11900 (0.0008) +[2026-06-07 00:29:59,214][344387] Updated weights for policy 0, policy_version 11913 (0.0008) +[2026-06-07 00:30:00,258][343476] Fps is (10 sec: 3072.1, 60 sec: 3345.1, 300 sec: 3110.2). Total num frames: 6100992. Throughput: 0: 3374.5. Samples: 6106020. Policy #0 lag: (min: 3.0, avg: 23.4, max: 42.0) +[2026-06-07 00:30:00,264][343476] Avg episode reward: [(0, '1338.904')] +[2026-06-07 00:30:01,053][344387] Updated weights for policy 0, policy_version 11923 (0.0008) +[2026-06-07 00:30:03,161][344387] Updated weights for policy 0, policy_version 11937 (0.0010) +[2026-06-07 00:30:04,900][344387] Updated weights for policy 0, policy_version 11948 (0.0010) +[2026-06-07 00:30:05,259][343476] Fps is (10 sec: 3071.6, 60 sec: 3310.8, 300 sec: 3124.1). Total num frames: 6117376. Throughput: 0: 3261.4. Samples: 6122816. Policy #0 lag: (min: 3.0, avg: 23.4, max: 42.0) +[2026-06-07 00:30:05,265][343476] Avg episode reward: [(0, '1250.987')] +[2026-06-07 00:30:07,130][344387] Updated weights for policy 0, policy_version 11958 (0.0010) +[2026-06-07 00:30:08,834][344387] Updated weights for policy 0, policy_version 11969 (0.0009) +[2026-06-07 00:30:10,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3310.9, 300 sec: 3151.8). Total num frames: 6133760. Throughput: 0: 3217.6. Samples: 6141574. Policy #0 lag: (min: 5.0, avg: 21.8, max: 42.0) +[2026-06-07 00:30:10,260][343476] Avg episode reward: [(0, '1551.650')] +[2026-06-07 00:30:10,266][344304] Saving new best policy, reward=1551.650! +[2026-06-07 00:30:10,879][344387] Updated weights for policy 0, policy_version 11981 (0.0008) +[2026-06-07 00:30:12,189][344387] Updated weights for policy 0, policy_version 11991 (0.0007) +[2026-06-07 00:30:13,860][344387] Updated weights for policy 0, policy_version 12005 (0.0010) +[2026-06-07 00:30:15,258][343476] Fps is (10 sec: 3277.3, 60 sec: 3276.8, 300 sec: 3165.7). Total num frames: 6150144. Throughput: 0: 3217.5. Samples: 6152146. Policy #0 lag: (min: 5.0, avg: 21.8, max: 42.0) +[2026-06-07 00:30:15,264][343476] Avg episode reward: [(0, '1171.302')] +[2026-06-07 00:30:15,752][344387] Updated weights for policy 0, policy_version 12015 (0.0009) +[2026-06-07 00:30:17,637][344387] Updated weights for policy 0, policy_version 12025 (0.0008) +[2026-06-07 00:30:18,924][344387] Updated weights for policy 0, policy_version 12040 (0.0010) +[2026-06-07 00:30:20,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3276.8, 300 sec: 3179.6). Total num frames: 6166528. Throughput: 0: 3212.2. Samples: 6171892. Policy #0 lag: (min: 10.0, avg: 22.6, max: 39.0) +[2026-06-07 00:30:20,260][343476] Avg episode reward: [(0, '1162.362')] +[2026-06-07 00:30:21,240][344387] Updated weights for policy 0, policy_version 12050 (0.0008) +[2026-06-07 00:30:23,103][344387] Updated weights for policy 0, policy_version 12064 (0.0010) +[2026-06-07 00:30:24,937][344387] Updated weights for policy 0, policy_version 12076 (0.0009) +[2026-06-07 00:30:25,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3276.8, 300 sec: 3200.4). Total num frames: 6182912. Throughput: 0: 3224.4. Samples: 6192074. Policy #0 lag: (min: 10.0, avg: 22.6, max: 39.0) +[2026-06-07 00:30:25,260][343476] Avg episode reward: [(0, '1560.076')] +[2026-06-07 00:30:25,268][344304] Saving new best policy, reward=1560.076! +[2026-06-07 00:30:26,756][344387] Updated weights for policy 0, policy_version 12086 (0.0008) +[2026-06-07 00:30:28,532][344387] Updated weights for policy 0, policy_version 12102 (0.0008) +[2026-06-07 00:30:30,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3242.7, 300 sec: 3214.3). Total num frames: 6199296. Throughput: 0: 3236.9. Samples: 6202716. Policy #0 lag: (min: 7.0, avg: 22.7, max: 42.0) +[2026-06-07 00:30:30,259][343476] Avg episode reward: [(0, '1444.820')] +[2026-06-07 00:30:30,636][344387] Updated weights for policy 0, policy_version 12112 (0.0010) +[2026-06-07 00:30:32,390][344387] Updated weights for policy 0, policy_version 12122 (0.0008) +[2026-06-07 00:30:33,659][344387] Updated weights for policy 0, policy_version 12134 (0.0009) +[2026-06-07 00:30:35,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3242.6, 300 sec: 3221.3). Total num frames: 6215680. Throughput: 0: 3210.0. Samples: 6221538. Policy #0 lag: (min: 7.0, avg: 22.7, max: 42.0) +[2026-06-07 00:30:35,260][343476] Avg episode reward: [(0, '1406.993')] +[2026-06-07 00:30:35,471][344387] Updated weights for policy 0, policy_version 12144 (0.0008) +[2026-06-07 00:30:37,569][344387] Updated weights for policy 0, policy_version 12154 (0.0008) +[2026-06-07 00:30:38,928][344387] Updated weights for policy 0, policy_version 12168 (0.0008) +[2026-06-07 00:30:40,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3242.7, 300 sec: 3228.2). Total num frames: 6232064. Throughput: 0: 3212.9. Samples: 6240966. Policy #0 lag: (min: 7.0, avg: 20.9, max: 39.0) +[2026-06-07 00:30:40,259][343476] Avg episode reward: [(0, '1305.850')] +[2026-06-07 00:30:41,195][344387] Updated weights for policy 0, policy_version 12178 (0.0007) +[2026-06-07 00:30:42,479][344387] Updated weights for policy 0, policy_version 12188 (0.0008) +[2026-06-07 00:30:45,011][344387] Updated weights for policy 0, policy_version 12202 (0.0009) +[2026-06-07 00:30:45,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3242.7, 300 sec: 3235.1). Total num frames: 6248448. Throughput: 0: 3222.8. Samples: 6251048. Policy #0 lag: (min: 7.0, avg: 20.9, max: 39.0) +[2026-06-07 00:30:45,259][343476] Avg episode reward: [(0, '1046.884')] +[2026-06-07 00:30:46,411][344387] Updated weights for policy 0, policy_version 12212 (0.0008) +[2026-06-07 00:30:48,530][344387] Updated weights for policy 0, policy_version 12224 (0.0012) +[2026-06-07 00:30:50,243][344387] Updated weights for policy 0, policy_version 12234 (0.0009) +[2026-06-07 00:30:50,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3208.5, 300 sec: 3249.0). Total num frames: 6262784. Throughput: 0: 3269.3. Samples: 6269928. Policy #0 lag: (min: 5.0, avg: 19.6, max: 38.0) +[2026-06-07 00:30:50,262][343476] Avg episode reward: [(0, '1327.518')] +[2026-06-07 00:30:51,754][344387] Updated weights for policy 0, policy_version 12244 (0.0011) +[2026-06-07 00:30:53,979][344387] Updated weights for policy 0, policy_version 12256 (0.0011) +[2026-06-07 00:30:55,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3208.6, 300 sec: 3262.9). Total num frames: 6279168. Throughput: 0: 3240.6. Samples: 6287400. Policy #0 lag: (min: 5.0, avg: 19.6, max: 38.0) +[2026-06-07 00:30:55,259][343476] Avg episode reward: [(0, '1384.575')] +[2026-06-07 00:30:55,590][344387] Updated weights for policy 0, policy_version 12267 (0.0008) +[2026-06-07 00:30:57,556][344387] Updated weights for policy 0, policy_version 12277 (0.0009) +[2026-06-07 00:30:59,232][344387] Updated weights for policy 0, policy_version 12288 (0.0009) +[2026-06-07 00:31:00,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3242.7, 300 sec: 3262.9). Total num frames: 6295552. Throughput: 0: 3246.6. Samples: 6298244. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 00:31:00,263][343476] Avg episode reward: [(0, '1347.220')] +[2026-06-07 00:31:00,582][344387] Updated weights for policy 0, policy_version 12299 (0.0008) +[2026-06-07 00:31:02,705][344387] Updated weights for policy 0, policy_version 12309 (0.0009) +[2026-06-07 00:31:04,488][344387] Updated weights for policy 0, policy_version 12325 (0.0010) +[2026-06-07 00:31:05,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3242.7, 300 sec: 3262.9). Total num frames: 6311936. Throughput: 0: 3245.5. Samples: 6317940. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 00:31:05,259][343476] Avg episode reward: [(0, '1530.214')] +[2026-06-07 00:31:06,227][344387] Updated weights for policy 0, policy_version 12335 (0.0008) +[2026-06-07 00:31:07,869][344387] Updated weights for policy 0, policy_version 12345 (0.0008) +[2026-06-07 00:31:08,625][344304] Signal inference workers to stop experience collection... (950 times) +[2026-06-07 00:31:08,643][344387] InferenceWorker_p0-w0: stopping experience collection (950 times) +[2026-06-07 00:31:08,741][344304] Signal inference workers to resume experience collection... (950 times) +[2026-06-07 00:31:08,742][344387] InferenceWorker_p0-w0: resuming experience collection (950 times) +[2026-06-07 00:31:09,322][344387] Updated weights for policy 0, policy_version 12358 (0.0009) +[2026-06-07 00:31:10,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3242.7, 300 sec: 3269.9). Total num frames: 6328320. Throughput: 0: 3240.4. Samples: 6337892. Policy #0 lag: (min: 6.0, avg: 20.6, max: 37.0) +[2026-06-07 00:31:10,260][343476] Avg episode reward: [(0, '1409.768')] +[2026-06-07 00:31:11,011][344387] Updated weights for policy 0, policy_version 12368 (0.0010) +[2026-06-07 00:31:13,313][344387] Updated weights for policy 0, policy_version 12378 (0.0012) +[2026-06-07 00:31:14,874][344387] Updated weights for policy 0, policy_version 12391 (0.0013) +[2026-06-07 00:31:15,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3242.7, 300 sec: 3262.9). Total num frames: 6344704. Throughput: 0: 3192.9. Samples: 6346398. Policy #0 lag: (min: 6.0, avg: 20.6, max: 37.0) +[2026-06-07 00:31:15,259][343476] Avg episode reward: [(0, '1269.370')] +[2026-06-07 00:31:17,618][344387] Updated weights for policy 0, policy_version 12401 (0.0011) +[2026-06-07 00:31:19,097][344387] Updated weights for policy 0, policy_version 12411 (0.0009) +[2026-06-07 00:31:20,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3174.4, 300 sec: 3249.0). Total num frames: 6356992. Throughput: 0: 3147.0. Samples: 6363150. Policy #0 lag: (min: 8.0, avg: 24.8, max: 44.0) +[2026-06-07 00:31:20,258][343476] Avg episode reward: [(0, '1259.227')] +[2026-06-07 00:31:22,235][344387] Updated weights for policy 0, policy_version 12425 (0.0010) +[2026-06-07 00:31:23,792][344387] Updated weights for policy 0, policy_version 12435 (0.0011) +[2026-06-07 00:31:25,257][343476] Fps is (10 sec: 2457.6, 60 sec: 3106.1, 300 sec: 3235.1). Total num frames: 6369280. Throughput: 0: 3067.9. Samples: 6379022. Policy #0 lag: (min: 8.0, avg: 24.8, max: 44.0) +[2026-06-07 00:31:25,258][343476] Avg episode reward: [(0, '1229.402')] +[2026-06-07 00:31:26,248][344387] Updated weights for policy 0, policy_version 12445 (0.0010) +[2026-06-07 00:31:28,179][344387] Updated weights for policy 0, policy_version 12459 (0.0009) +[2026-06-07 00:31:30,258][343476] Fps is (10 sec: 2662.2, 60 sec: 3072.0, 300 sec: 3228.2). Total num frames: 6383616. Throughput: 0: 3035.9. Samples: 6387664. Policy #0 lag: (min: 3.0, avg: 19.8, max: 35.0) +[2026-06-07 00:31:30,260][343476] Avg episode reward: [(0, '1436.310')] +[2026-06-07 00:31:30,356][344387] Updated weights for policy 0, policy_version 12469 (0.0008) +[2026-06-07 00:31:31,934][344387] Updated weights for policy 0, policy_version 12484 (0.0009) +[2026-06-07 00:31:33,606][344387] Updated weights for policy 0, policy_version 12494 (0.0007) +[2026-06-07 00:31:35,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3106.1, 300 sec: 3235.1). Total num frames: 6402048. Throughput: 0: 3076.3. Samples: 6408362. Policy #0 lag: (min: 3.0, avg: 19.8, max: 35.0) +[2026-06-07 00:31:35,265][343476] Avg episode reward: [(0, '1398.660')] +[2026-06-07 00:31:35,323][344387] Updated weights for policy 0, policy_version 12507 (0.0008) +[2026-06-07 00:31:37,610][344387] Updated weights for policy 0, policy_version 12522 (0.0008) +[2026-06-07 00:31:38,807][344387] Updated weights for policy 0, policy_version 12532 (0.0007) +[2026-06-07 00:31:40,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3140.3, 300 sec: 3242.1). Total num frames: 6420480. Throughput: 0: 3163.5. Samples: 6429758. Policy #0 lag: (min: 3.0, avg: 21.0, max: 43.0) +[2026-06-07 00:31:40,259][343476] Avg episode reward: [(0, '1484.326')] +[2026-06-07 00:31:40,740][344387] Updated weights for policy 0, policy_version 12544 (0.0008) +[2026-06-07 00:31:42,275][344387] Updated weights for policy 0, policy_version 12556 (0.0009) +[2026-06-07 00:31:44,631][344387] Updated weights for policy 0, policy_version 12569 (0.0008) +[2026-06-07 00:31:45,258][343476] Fps is (10 sec: 3481.8, 60 sec: 3140.3, 300 sec: 3242.1). Total num frames: 6436864. Throughput: 0: 3142.8. Samples: 6439668. Policy #0 lag: (min: 3.0, avg: 21.0, max: 43.0) +[2026-06-07 00:31:45,262][343476] Avg episode reward: [(0, '1339.758')] +[2026-06-07 00:31:46,322][344387] Updated weights for policy 0, policy_version 12582 (0.0008) +[2026-06-07 00:31:48,475][344387] Updated weights for policy 0, policy_version 12592 (0.0008) +[2026-06-07 00:31:49,884][344387] Updated weights for policy 0, policy_version 12603 (0.0009) +[2026-06-07 00:31:50,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3174.4, 300 sec: 3242.1). Total num frames: 6453248. Throughput: 0: 3135.7. Samples: 6459046. Policy #0 lag: (min: 7.0, avg: 22.4, max: 39.0) +[2026-06-07 00:31:50,261][343476] Avg episode reward: [(0, '1394.231')] +[2026-06-07 00:31:52,356][344387] Updated weights for policy 0, policy_version 12618 (0.0008) +[2026-06-07 00:31:53,691][344387] Updated weights for policy 0, policy_version 12628 (0.0010) +[2026-06-07 00:31:55,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3174.4, 300 sec: 3242.1). Total num frames: 6469632. Throughput: 0: 3126.1. Samples: 6478564. Policy #0 lag: (min: 7.0, avg: 22.4, max: 39.0) +[2026-06-07 00:31:55,261][343476] Avg episode reward: [(0, '1305.476')] +[2026-06-07 00:31:55,979][344387] Updated weights for policy 0, policy_version 12641 (0.0011) +[2026-06-07 00:31:58,126][344387] Updated weights for policy 0, policy_version 12653 (0.0007) +[2026-06-07 00:31:59,621][344387] Updated weights for policy 0, policy_version 12665 (0.0009) +[2026-06-07 00:32:00,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3174.4, 300 sec: 3256.0). Total num frames: 6486016. Throughput: 0: 3155.5. Samples: 6488398. Policy #0 lag: (min: 7.0, avg: 21.9, max: 39.0) +[2026-06-07 00:32:00,261][343476] Avg episode reward: [(0, '1346.016')] +[2026-06-07 00:32:01,268][344387] Updated weights for policy 0, policy_version 12679 (0.0010) +[2026-06-07 00:32:03,479][344387] Updated weights for policy 0, policy_version 12689 (0.0008) +[2026-06-07 00:32:05,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3174.4, 300 sec: 3256.0). Total num frames: 6502400. Throughput: 0: 3229.9. Samples: 6508496. Policy #0 lag: (min: 7.0, avg: 21.9, max: 39.0) +[2026-06-07 00:32:05,265][343476] Avg episode reward: [(0, '1464.708')] +[2026-06-07 00:32:05,383][344387] Updated weights for policy 0, policy_version 12701 (0.0009) +[2026-06-07 00:32:06,358][344387] Updated weights for policy 0, policy_version 12712 (0.0009) +[2026-06-07 00:32:08,606][344387] Updated weights for policy 0, policy_version 12722 (0.0007) +[2026-06-07 00:32:10,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3174.4, 300 sec: 3249.0). Total num frames: 6518784. Throughput: 0: 3325.2. Samples: 6528658. Policy #0 lag: (min: 5.0, avg: 21.5, max: 39.0) +[2026-06-07 00:32:10,260][343476] Avg episode reward: [(0, '1192.035')] +[2026-06-07 00:32:10,324][344387] Updated weights for policy 0, policy_version 12735 (0.0008) +[2026-06-07 00:32:12,194][344387] Updated weights for policy 0, policy_version 12747 (0.0008) +[2026-06-07 00:32:14,189][344387] Updated weights for policy 0, policy_version 12757 (0.0008) +[2026-06-07 00:32:15,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3208.5, 300 sec: 3256.0). Total num frames: 6537216. Throughput: 0: 3353.6. Samples: 6538574. Policy #0 lag: (min: 5.0, avg: 21.5, max: 39.0) +[2026-06-07 00:32:15,260][343476] Avg episode reward: [(0, '1441.197')] +[2026-06-07 00:32:15,696][344387] Updated weights for policy 0, policy_version 12769 (0.0010) +[2026-06-07 00:32:17,755][344387] Updated weights for policy 0, policy_version 12781 (0.0009) +[2026-06-07 00:32:18,122][344304] Signal inference workers to stop experience collection... (1000 times) +[2026-06-07 00:32:18,124][344304] Signal inference workers to resume experience collection... (1000 times) +[2026-06-07 00:32:18,155][344387] InferenceWorker_p0-w0: stopping experience collection (1000 times) +[2026-06-07 00:32:18,155][344387] InferenceWorker_p0-w0: resuming experience collection (1000 times) +[2026-06-07 00:32:19,353][344387] Updated weights for policy 0, policy_version 12792 (0.0008) +[2026-06-07 00:32:20,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3242.7, 300 sec: 3242.1). Total num frames: 6551552. Throughput: 0: 3343.1. Samples: 6558802. Policy #0 lag: (min: 5.0, avg: 21.4, max: 38.0) +[2026-06-07 00:32:20,261][343476] Avg episode reward: [(0, '1411.649')] +[2026-06-07 00:32:20,894][344387] Updated weights for policy 0, policy_version 12806 (0.0009) +[2026-06-07 00:32:22,820][344387] Updated weights for policy 0, policy_version 12816 (0.0008) +[2026-06-07 00:32:24,661][344387] Updated weights for policy 0, policy_version 12828 (0.0009) +[2026-06-07 00:32:25,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3345.0, 300 sec: 3249.0). Total num frames: 6569984. Throughput: 0: 3303.2. Samples: 6578402. Policy #0 lag: (min: 5.0, avg: 21.4, max: 38.0) +[2026-06-07 00:32:25,262][343476] Avg episode reward: [(0, '1259.683')] +[2026-06-07 00:32:25,845][344387] Updated weights for policy 0, policy_version 12840 (0.0009) +[2026-06-07 00:32:28,123][344387] Updated weights for policy 0, policy_version 12850 (0.0008) +[2026-06-07 00:32:29,372][344387] Updated weights for policy 0, policy_version 12860 (0.0012) +[2026-06-07 00:32:30,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3379.2, 300 sec: 3242.1). Total num frames: 6586368. Throughput: 0: 3312.3. Samples: 6588722. Policy #0 lag: (min: 3.0, avg: 21.6, max: 39.0) +[2026-06-07 00:32:30,264][343476] Avg episode reward: [(0, '1405.565')] +[2026-06-07 00:32:30,783][344387] Updated weights for policy 0, policy_version 12872 (0.0008) +[2026-06-07 00:32:33,230][344387] Updated weights for policy 0, policy_version 12882 (0.0009) +[2026-06-07 00:32:34,176][344387] Updated weights for policy 0, policy_version 12892 (0.0009) +[2026-06-07 00:32:35,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3345.1, 300 sec: 3249.0). Total num frames: 6602752. Throughput: 0: 3321.5. Samples: 6608514. Policy #0 lag: (min: 3.0, avg: 21.6, max: 39.0) +[2026-06-07 00:32:35,260][343476] Avg episode reward: [(0, '1198.488')] +[2026-06-07 00:32:35,765][344387] Updated weights for policy 0, policy_version 12904 (0.0009) +[2026-06-07 00:32:37,991][344387] Updated weights for policy 0, policy_version 12914 (0.0009) +[2026-06-07 00:32:39,874][344387] Updated weights for policy 0, policy_version 12927 (0.0008) +[2026-06-07 00:32:40,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3311.0, 300 sec: 3262.9). Total num frames: 6619136. Throughput: 0: 3345.9. Samples: 6629130. Policy #0 lag: (min: 1.0, avg: 19.1, max: 33.0) +[2026-06-07 00:32:40,261][343476] Avg episode reward: [(0, '1445.940')] +[2026-06-07 00:32:41,220][344387] Updated weights for policy 0, policy_version 12938 (0.0007) +[2026-06-07 00:32:43,391][344387] Updated weights for policy 0, policy_version 12949 (0.0008) +[2026-06-07 00:32:44,626][344387] Updated weights for policy 0, policy_version 12962 (0.0008) +[2026-06-07 00:32:45,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3379.2, 300 sec: 3276.8). Total num frames: 6639616. Throughput: 0: 3369.1. Samples: 6640008. Policy #0 lag: (min: 7.0, avg: 25.1, max: 42.0) +[2026-06-07 00:32:45,260][343476] Avg episode reward: [(0, '1384.034')] +[2026-06-07 00:32:45,890][344387] Updated weights for policy 0, policy_version 12972 (0.0010) +[2026-06-07 00:32:48,262][344387] Updated weights for policy 0, policy_version 12984 (0.0007) +[2026-06-07 00:32:50,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3345.1, 300 sec: 3276.8). Total num frames: 6653952. Throughput: 0: 3404.3. Samples: 6661690. Policy #0 lag: (min: 7.0, avg: 25.1, max: 42.0) +[2026-06-07 00:32:50,261][343476] Avg episode reward: [(0, '1370.638')] +[2026-06-07 00:32:50,370][344387] Updated weights for policy 0, policy_version 13000 (0.0008) +[2026-06-07 00:32:51,996][344387] Updated weights for policy 0, policy_version 13010 (0.0008) +[2026-06-07 00:32:54,128][344387] Updated weights for policy 0, policy_version 13026 (0.0008) +[2026-06-07 00:32:55,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3413.3, 300 sec: 3290.7). Total num frames: 6674432. Throughput: 0: 3401.4. Samples: 6681722. Policy #0 lag: (min: 3.0, avg: 23.8, max: 42.0) +[2026-06-07 00:32:55,260][343476] Avg episode reward: [(0, '1440.874')] +[2026-06-07 00:32:55,940][344387] Updated weights for policy 0, policy_version 13037 (0.0008) +[2026-06-07 00:32:58,074][344387] Updated weights for policy 0, policy_version 13049 (0.0007) +[2026-06-07 00:32:59,447][344387] Updated weights for policy 0, policy_version 13064 (0.0009) +[2026-06-07 00:33:00,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3413.3, 300 sec: 3283.7). Total num frames: 6690816. Throughput: 0: 3421.8. Samples: 6692554. Policy #0 lag: (min: 3.0, avg: 23.8, max: 42.0) +[2026-06-07 00:33:00,260][343476] Avg episode reward: [(0, '1609.702')] +[2026-06-07 00:33:00,267][344304] Saving new best policy, reward=1609.702! +[2026-06-07 00:33:01,550][344387] Updated weights for policy 0, policy_version 13074 (0.0007) +[2026-06-07 00:33:02,934][344387] Updated weights for policy 0, policy_version 13087 (0.0007) +[2026-06-07 00:33:04,225][344387] Updated weights for policy 0, policy_version 13097 (0.0007) +[2026-06-07 00:33:05,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3447.5, 300 sec: 3304.6). Total num frames: 6709248. Throughput: 0: 3441.6. Samples: 6713674. Policy #0 lag: (min: 3.0, avg: 21.1, max: 39.0) +[2026-06-07 00:33:05,259][343476] Avg episode reward: [(0, '1427.993')] +[2026-06-07 00:33:06,208][344387] Updated weights for policy 0, policy_version 13108 (0.0008) +[2026-06-07 00:33:07,888][344387] Updated weights for policy 0, policy_version 13123 (0.0007) +[2026-06-07 00:33:09,616][344387] Updated weights for policy 0, policy_version 13133 (0.0008) +[2026-06-07 00:33:10,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3447.5, 300 sec: 3290.7). Total num frames: 6725632. Throughput: 0: 3502.3. Samples: 6736004. Policy #0 lag: (min: 3.0, avg: 21.1, max: 39.0) +[2026-06-07 00:33:10,260][343476] Avg episode reward: [(0, '1279.907')] +[2026-06-07 00:33:11,160][344387] Updated weights for policy 0, policy_version 13145 (0.0009) +[2026-06-07 00:33:11,484][344304] Signal inference workers to stop experience collection... (1050 times) +[2026-06-07 00:33:11,492][344304] Signal inference workers to resume experience collection... (1050 times) +[2026-06-07 00:33:11,508][344387] InferenceWorker_p0-w0: stopping experience collection (1050 times) +[2026-06-07 00:33:11,527][344387] InferenceWorker_p0-w0: resuming experience collection (1050 times) +[2026-06-07 00:33:12,634][344387] Updated weights for policy 0, policy_version 13157 (0.0008) +[2026-06-07 00:33:14,066][344387] Updated weights for policy 0, policy_version 13167 (0.0007) +[2026-06-07 00:33:15,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3447.5, 300 sec: 3297.6). Total num frames: 6744064. Throughput: 0: 3517.5. Samples: 6747006. Policy #0 lag: (min: 3.0, avg: 21.1, max: 39.0) +[2026-06-07 00:33:15,259][343476] Avg episode reward: [(0, '1394.900')] +[2026-06-07 00:33:16,737][344387] Updated weights for policy 0, policy_version 13184 (0.0010) +[2026-06-07 00:33:18,077][344387] Updated weights for policy 0, policy_version 13196 (0.0009) +[2026-06-07 00:33:20,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3481.6, 300 sec: 3311.5). Total num frames: 6760448. Throughput: 0: 3559.8. Samples: 6768708. Policy #0 lag: (min: 6.0, avg: 20.5, max: 38.0) +[2026-06-07 00:33:20,262][343476] Avg episode reward: [(0, '1254.235')] +[2026-06-07 00:33:20,929][344387] Updated weights for policy 0, policy_version 13214 (0.0008) +[2026-06-07 00:33:22,392][344387] Updated weights for policy 0, policy_version 13225 (0.0008) +[2026-06-07 00:33:24,691][344387] Updated weights for policy 0, policy_version 13236 (0.0008) +[2026-06-07 00:33:25,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3447.5, 300 sec: 3297.6). Total num frames: 6776832. Throughput: 0: 3567.0. Samples: 6789644. Policy #0 lag: (min: 6.0, avg: 20.5, max: 38.0) +[2026-06-07 00:33:25,259][343476] Avg episode reward: [(0, '1446.040')] +[2026-06-07 00:33:26,850][344387] Updated weights for policy 0, policy_version 13252 (0.0010) +[2026-06-07 00:33:28,328][344387] Updated weights for policy 0, policy_version 13263 (0.0008) +[2026-06-07 00:33:30,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3481.6, 300 sec: 3311.5). Total num frames: 6795264. Throughput: 0: 3527.7. Samples: 6798756. Policy #0 lag: (min: 10.0, avg: 20.9, max: 42.0) +[2026-06-07 00:33:30,260][343476] Avg episode reward: [(0, '1242.107')] +[2026-06-07 00:33:30,722][344387] Updated weights for policy 0, policy_version 13279 (0.0010) +[2026-06-07 00:33:32,223][344387] Updated weights for policy 0, policy_version 13289 (0.0008) +[2026-06-07 00:33:34,130][344387] Updated weights for policy 0, policy_version 13301 (0.0008) +[2026-06-07 00:33:35,157][344387] Updated weights for policy 0, policy_version 13311 (0.0008) +[2026-06-07 00:33:35,258][343476] Fps is (10 sec: 3890.9, 60 sec: 3549.9, 300 sec: 3318.5). Total num frames: 6815744. Throughput: 0: 3518.2. Samples: 6820010. Policy #0 lag: (min: 10.0, avg: 20.9, max: 42.0) +[2026-06-07 00:33:35,261][343476] Avg episode reward: [(0, '1291.140')] +[2026-06-07 00:33:36,704][344387] Updated weights for policy 0, policy_version 13321 (0.0008) +[2026-06-07 00:33:38,239][344387] Updated weights for policy 0, policy_version 13332 (0.0007) +[2026-06-07 00:33:39,483][344387] Updated weights for policy 0, policy_version 13342 (0.0007) +[2026-06-07 00:33:40,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3584.0, 300 sec: 3325.4). Total num frames: 6834176. Throughput: 0: 3564.0. Samples: 6842104. Policy #0 lag: (min: 1.0, avg: 19.7, max: 34.0) +[2026-06-07 00:33:40,265][343476] Avg episode reward: [(0, '1538.728')] +[2026-06-07 00:33:40,601][344387] Updated weights for policy 0, policy_version 13352 (0.0008) +[2026-06-07 00:33:42,670][344387] Updated weights for policy 0, policy_version 13362 (0.0009) +[2026-06-07 00:33:44,361][344387] Updated weights for policy 0, policy_version 13375 (0.0008) +[2026-06-07 00:33:45,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3515.7, 300 sec: 3325.4). Total num frames: 6850560. Throughput: 0: 3573.2. Samples: 6853348. Policy #0 lag: (min: 1.0, avg: 19.7, max: 34.0) +[2026-06-07 00:33:45,258][343476] Avg episode reward: [(0, '1407.639')] +[2026-06-07 00:33:45,914][344387] Updated weights for policy 0, policy_version 13386 (0.0008) +[2026-06-07 00:33:47,548][344387] Updated weights for policy 0, policy_version 13396 (0.0009) +[2026-06-07 00:33:49,248][344387] Updated weights for policy 0, policy_version 13408 (0.0009) +[2026-06-07 00:33:50,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3549.9, 300 sec: 3325.4). Total num frames: 6866944. Throughput: 0: 3562.7. Samples: 6873996. Policy #0 lag: (min: 8.0, avg: 22.7, max: 38.0) +[2026-06-07 00:33:50,260][343476] Avg episode reward: [(0, '1361.671')] +[2026-06-07 00:33:51,305][344387] Updated weights for policy 0, policy_version 13420 (0.0011) +[2026-06-07 00:33:52,860][344387] Updated weights for policy 0, policy_version 13432 (0.0009) +[2026-06-07 00:33:55,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3481.6, 300 sec: 3332.3). Total num frames: 6883328. Throughput: 0: 3497.8. Samples: 6893402. Policy #0 lag: (min: 8.0, avg: 22.7, max: 38.0) +[2026-06-07 00:33:55,259][343476] Avg episode reward: [(0, '1340.407')] +[2026-06-07 00:33:55,471][344387] Updated weights for policy 0, policy_version 13445 (0.0008) +[2026-06-07 00:33:57,395][344387] Updated weights for policy 0, policy_version 13457 (0.0008) +[2026-06-07 00:33:58,909][344387] Updated weights for policy 0, policy_version 13471 (0.0009) +[2026-06-07 00:34:00,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3481.6, 300 sec: 3325.4). Total num frames: 6899712. Throughput: 0: 3471.5. Samples: 6903226. Policy #0 lag: (min: 10.0, avg: 25.8, max: 42.0) +[2026-06-07 00:34:00,260][343476] Avg episode reward: [(0, '1447.273')] +[2026-06-07 00:34:00,436][344387] Updated weights for policy 0, policy_version 13482 (0.0008) +[2026-06-07 00:34:02,439][344387] Updated weights for policy 0, policy_version 13492 (0.0010) +[2026-06-07 00:34:03,852][344387] Updated weights for policy 0, policy_version 13502 (0.0009) +[2026-06-07 00:34:05,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3481.6, 300 sec: 3332.3). Total num frames: 6918144. Throughput: 0: 3426.9. Samples: 6922918. Policy #0 lag: (min: 10.0, avg: 25.8, max: 42.0) +[2026-06-07 00:34:05,260][343476] Avg episode reward: [(0, '1357.189')] +[2026-06-07 00:34:05,278][344387] Updated weights for policy 0, policy_version 13512 (0.0009) +[2026-06-07 00:34:07,347][344304] Signal inference workers to stop experience collection... (1100 times) +[2026-06-07 00:34:07,382][344387] InferenceWorker_p0-w0: stopping experience collection (1100 times) +[2026-06-07 00:34:07,478][344304] Signal inference workers to resume experience collection... (1100 times) +[2026-06-07 00:34:07,479][344387] InferenceWorker_p0-w0: resuming experience collection (1100 times) +[2026-06-07 00:34:07,481][344387] Updated weights for policy 0, policy_version 13524 (0.0008) +[2026-06-07 00:34:08,878][344387] Updated weights for policy 0, policy_version 13536 (0.0008) +[2026-06-07 00:34:10,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3481.6, 300 sec: 3325.4). Total num frames: 6934528. Throughput: 0: 3410.6. Samples: 6943122. Policy #0 lag: (min: 4.0, avg: 23.0, max: 42.0) +[2026-06-07 00:34:10,259][343476] Avg episode reward: [(0, '1417.024')] +[2026-06-07 00:34:10,945][344387] Updated weights for policy 0, policy_version 13549 (0.0007) +[2026-06-07 00:34:13,081][344387] Updated weights for policy 0, policy_version 13561 (0.0009) +[2026-06-07 00:34:14,231][344387] Updated weights for policy 0, policy_version 13571 (0.0009) +[2026-06-07 00:34:15,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3447.5, 300 sec: 3325.4). Total num frames: 6950912. Throughput: 0: 3429.8. Samples: 6953096. Policy #0 lag: (min: 4.0, avg: 23.0, max: 42.0) +[2026-06-07 00:34:15,259][343476] Avg episode reward: [(0, '1427.158')] +[2026-06-07 00:34:15,959][344387] Updated weights for policy 0, policy_version 13583 (0.0008) +[2026-06-07 00:34:18,343][344387] Updated weights for policy 0, policy_version 13595 (0.0011) +[2026-06-07 00:34:19,674][344387] Updated weights for policy 0, policy_version 13605 (0.0009) +[2026-06-07 00:34:20,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3481.6, 300 sec: 3332.3). Total num frames: 6969344. Throughput: 0: 3410.0. Samples: 6973458. Policy #0 lag: (min: 1.0, avg: 17.5, max: 33.0) +[2026-06-07 00:34:20,258][343476] Avg episode reward: [(0, '1326.737')] +[2026-06-07 00:34:20,970][344387] Updated weights for policy 0, policy_version 13615 (0.0009) +[2026-06-07 00:34:23,581][344387] Updated weights for policy 0, policy_version 13629 (0.0009) +[2026-06-07 00:34:25,107][344387] Updated weights for policy 0, policy_version 13641 (0.0008) +[2026-06-07 00:34:25,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3447.5, 300 sec: 3318.5). Total num frames: 6983680. Throughput: 0: 3369.7. Samples: 6993740. Policy #0 lag: (min: 1.0, avg: 17.5, max: 33.0) +[2026-06-07 00:34:25,261][343476] Avg episode reward: [(0, '1504.584')] +[2026-06-07 00:34:27,029][344387] Updated weights for policy 0, policy_version 13653 (0.0008) +[2026-06-07 00:34:28,664][344387] Updated weights for policy 0, policy_version 13665 (0.0007) +[2026-06-07 00:34:30,034][344387] Updated weights for policy 0, policy_version 13676 (0.0008) +[2026-06-07 00:34:30,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3447.5, 300 sec: 3325.4). Total num frames: 7002112. Throughput: 0: 3350.9. Samples: 7004140. Policy #0 lag: (min: 7.0, avg: 23.5, max: 39.0) +[2026-06-07 00:34:30,264][343476] Avg episode reward: [(0, '1164.502')] +[2026-06-07 00:34:31,408][344387] Updated weights for policy 0, policy_version 13688 (0.0008) +[2026-06-07 00:34:33,053][344387] Updated weights for policy 0, policy_version 13699 (0.0008) +[2026-06-07 00:34:34,826][344387] Updated weights for policy 0, policy_version 13711 (0.0009) +[2026-06-07 00:34:35,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3413.3, 300 sec: 3332.3). Total num frames: 7020544. Throughput: 0: 3383.2. Samples: 7026242. Policy #0 lag: (min: 7.0, avg: 23.5, max: 39.0) +[2026-06-07 00:34:35,261][343476] Avg episode reward: [(0, '1384.472')] +[2026-06-07 00:34:36,739][344387] Updated weights for policy 0, policy_version 13723 (0.0009) +[2026-06-07 00:34:38,373][344387] Updated weights for policy 0, policy_version 13733 (0.0008) +[2026-06-07 00:34:39,700][344387] Updated weights for policy 0, policy_version 13743 (0.0010) +[2026-06-07 00:34:40,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3379.2, 300 sec: 3332.3). Total num frames: 7036928. Throughput: 0: 3384.7. Samples: 7045716. Policy #0 lag: (min: 7.0, avg: 23.4, max: 42.0) +[2026-06-07 00:34:40,260][343476] Avg episode reward: [(0, '1150.758')] +[2026-06-07 00:34:41,724][344387] Updated weights for policy 0, policy_version 13755 (0.0010) +[2026-06-07 00:34:43,241][344387] Updated weights for policy 0, policy_version 13767 (0.0009) +[2026-06-07 00:34:44,872][344387] Updated weights for policy 0, policy_version 13777 (0.0008) +[2026-06-07 00:34:45,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3413.3, 300 sec: 3339.3). Total num frames: 7055360. Throughput: 0: 3415.4. Samples: 7056920. Policy #0 lag: (min: 7.0, avg: 23.4, max: 42.0) +[2026-06-07 00:34:45,264][343476] Avg episode reward: [(0, '1295.855')] +[2026-06-07 00:34:46,449][344387] Updated weights for policy 0, policy_version 13787 (0.0008) +[2026-06-07 00:34:48,091][344387] Updated weights for policy 0, policy_version 13799 (0.0010) +[2026-06-07 00:34:50,083][344387] Updated weights for policy 0, policy_version 13812 (0.0010) +[2026-06-07 00:34:50,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3413.3, 300 sec: 3339.3). Total num frames: 7071744. Throughput: 0: 3423.2. Samples: 7076960. Policy #0 lag: (min: 5.0, avg: 19.4, max: 37.0) +[2026-06-07 00:34:50,259][343476] Avg episode reward: [(0, '1318.919')] +[2026-06-07 00:34:51,720][344387] Updated weights for policy 0, policy_version 13822 (0.0008) +[2026-06-07 00:34:53,362][344387] Updated weights for policy 0, policy_version 13834 (0.0009) +[2026-06-07 00:34:54,671][344387] Updated weights for policy 0, policy_version 13844 (0.0008) +[2026-06-07 00:34:55,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3447.4, 300 sec: 3353.2). Total num frames: 7090176. Throughput: 0: 3439.4. Samples: 7097898. Policy #0 lag: (min: 5.0, avg: 19.4, max: 37.0) +[2026-06-07 00:34:55,261][343476] Avg episode reward: [(0, '1426.307')] +[2026-06-07 00:34:56,278][344387] Updated weights for policy 0, policy_version 13854 (0.0008) +[2026-06-07 00:34:57,830][344387] Updated weights for policy 0, policy_version 13867 (0.0008) +[2026-06-07 00:34:59,353][344387] Updated weights for policy 0, policy_version 13877 (0.0007) +[2026-06-07 00:35:00,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3447.5, 300 sec: 3353.2). Total num frames: 7106560. Throughput: 0: 3469.2. Samples: 7109212. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 00:35:00,260][343476] Avg episode reward: [(0, '1459.893')] +[2026-06-07 00:35:00,911][344387] Updated weights for policy 0, policy_version 13888 (0.0008) +[2026-06-07 00:35:02,541][344387] Updated weights for policy 0, policy_version 13900 (0.0008) +[2026-06-07 00:35:04,030][344387] Updated weights for policy 0, policy_version 13910 (0.0008) +[2026-06-07 00:35:05,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3447.5, 300 sec: 3360.1). Total num frames: 7124992. Throughput: 0: 3485.6. Samples: 7130310. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 00:35:05,259][343476] Avg episode reward: [(0, '1460.463')] +[2026-06-07 00:35:05,499][344387] Updated weights for policy 0, policy_version 13920 (0.0008) +[2026-06-07 00:35:08,125][344387] Updated weights for policy 0, policy_version 13934 (0.0008) +[2026-06-07 00:35:09,740][344387] Updated weights for policy 0, policy_version 13948 (0.0010) +[2026-06-07 00:35:10,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3481.6, 300 sec: 3367.1). Total num frames: 7143424. Throughput: 0: 3527.6. Samples: 7152484. Policy #0 lag: (min: 8.0, avg: 21.9, max: 36.0) +[2026-06-07 00:35:10,267][343476] Avg episode reward: [(0, '1515.760')] +[2026-06-07 00:35:11,849][344387] Updated weights for policy 0, policy_version 13963 (0.0008) +[2026-06-07 00:35:13,224][344304] Signal inference workers to stop experience collection... (1150 times) +[2026-06-07 00:35:13,255][344387] InferenceWorker_p0-w0: stopping experience collection (1150 times) +[2026-06-07 00:35:13,359][344304] Signal inference workers to resume experience collection... (1150 times) +[2026-06-07 00:35:13,360][344387] InferenceWorker_p0-w0: resuming experience collection (1150 times) +[2026-06-07 00:35:14,096][344387] Updated weights for policy 0, policy_version 13977 (0.0008) +[2026-06-07 00:35:15,254][344387] Updated weights for policy 0, policy_version 13987 (0.0008) +[2026-06-07 00:35:15,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3481.6, 300 sec: 3367.1). Total num frames: 7159808. Throughput: 0: 3538.3. Samples: 7163364. Policy #0 lag: (min: 8.0, avg: 21.9, max: 36.0) +[2026-06-07 00:35:15,260][343476] Avg episode reward: [(0, '1205.051')] +[2026-06-07 00:35:17,228][344387] Updated weights for policy 0, policy_version 13998 (0.0008) +[2026-06-07 00:35:18,621][344387] Updated weights for policy 0, policy_version 14009 (0.0008) +[2026-06-07 00:35:20,242][344387] Updated weights for policy 0, policy_version 14019 (0.0008) +[2026-06-07 00:35:20,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3447.5, 300 sec: 3367.1). Total num frames: 7176192. Throughput: 0: 3504.6. Samples: 7183946. Policy #0 lag: (min: 1.0, avg: 18.5, max: 37.0) +[2026-06-07 00:35:20,262][343476] Avg episode reward: [(0, '1304.814')] +[2026-06-07 00:35:22,719][344387] Updated weights for policy 0, policy_version 14036 (0.0009) +[2026-06-07 00:35:24,026][344387] Updated weights for policy 0, policy_version 14048 (0.0008) +[2026-06-07 00:35:25,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3515.7, 300 sec: 3374.0). Total num frames: 7194624. Throughput: 0: 3537.0. Samples: 7204882. Policy #0 lag: (min: 1.0, avg: 18.5, max: 37.0) +[2026-06-07 00:35:25,261][343476] Avg episode reward: [(0, '1314.758')] +[2026-06-07 00:35:25,675][344387] Updated weights for policy 0, policy_version 14060 (0.0009) +[2026-06-07 00:35:27,608][344387] Updated weights for policy 0, policy_version 14072 (0.0008) +[2026-06-07 00:35:29,959][344387] Updated weights for policy 0, policy_version 14084 (0.0008) +[2026-06-07 00:35:30,258][343476] Fps is (10 sec: 3481.3, 60 sec: 3481.6, 300 sec: 3374.0). Total num frames: 7211008. Throughput: 0: 3511.4. Samples: 7214936. Policy #0 lag: (min: 1.0, avg: 17.3, max: 33.0) +[2026-06-07 00:35:30,262][343476] Avg episode reward: [(0, '1410.123')] +[2026-06-07 00:35:31,459][344387] Updated weights for policy 0, policy_version 14096 (0.0011) +[2026-06-07 00:35:33,370][344387] Updated weights for policy 0, policy_version 14110 (0.0010) +[2026-06-07 00:35:35,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3481.6, 300 sec: 3380.9). Total num frames: 7229440. Throughput: 0: 3544.0. Samples: 7236440. Policy #0 lag: (min: 1.0, avg: 17.3, max: 33.0) +[2026-06-07 00:35:35,259][343476] Avg episode reward: [(0, '1373.577')] +[2026-06-07 00:35:35,326][344387] Updated weights for policy 0, policy_version 14123 (0.0009) +[2026-06-07 00:35:36,350][344387] Updated weights for policy 0, policy_version 14134 (0.0008) +[2026-06-07 00:35:37,567][344387] Updated weights for policy 0, policy_version 14144 (0.0006) +[2026-06-07 00:35:39,554][344387] Updated weights for policy 0, policy_version 14154 (0.0008) +[2026-06-07 00:35:40,258][343476] Fps is (10 sec: 3891.4, 60 sec: 3549.8, 300 sec: 3394.8). Total num frames: 7249920. Throughput: 0: 3583.4. Samples: 7259150. Policy #0 lag: (min: 1.0, avg: 17.3, max: 33.0) +[2026-06-07 00:35:40,261][343476] Avg episode reward: [(0, '1294.713')] +[2026-06-07 00:35:40,709][344387] Updated weights for policy 0, policy_version 14167 (0.0008) +[2026-06-07 00:35:42,841][344387] Updated weights for policy 0, policy_version 14179 (0.0007) +[2026-06-07 00:35:44,428][344387] Updated weights for policy 0, policy_version 14189 (0.0007) +[2026-06-07 00:35:45,259][343476] Fps is (10 sec: 4095.7, 60 sec: 3584.0, 300 sec: 3415.6). Total num frames: 7270400. Throughput: 0: 3581.5. Samples: 7270380. Policy #0 lag: (min: 9.0, avg: 23.1, max: 45.0) +[2026-06-07 00:35:45,265][343476] Avg episode reward: [(0, '1526.335')] +[2026-06-07 00:35:46,554][344387] Updated weights for policy 0, policy_version 14205 (0.0010) +[2026-06-07 00:35:47,948][344387] Updated weights for policy 0, policy_version 14216 (0.0007) +[2026-06-07 00:35:50,043][344387] Updated weights for policy 0, policy_version 14229 (0.0008) +[2026-06-07 00:35:50,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3584.0, 300 sec: 3415.6). Total num frames: 7286784. Throughput: 0: 3580.1. Samples: 7291416. Policy #0 lag: (min: 9.0, avg: 23.1, max: 45.0) +[2026-06-07 00:35:50,260][343476] Avg episode reward: [(0, '1333.567')] +[2026-06-07 00:35:51,711][344387] Updated weights for policy 0, policy_version 14240 (0.0010) +[2026-06-07 00:35:53,752][344387] Updated weights for policy 0, policy_version 14250 (0.0010) +[2026-06-07 00:35:55,178][344387] Updated weights for policy 0, policy_version 14264 (0.0011) +[2026-06-07 00:35:55,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3549.9, 300 sec: 3415.6). Total num frames: 7303168. Throughput: 0: 3513.0. Samples: 7310568. Policy #0 lag: (min: 3.0, avg: 21.0, max: 35.0) +[2026-06-07 00:35:55,260][343476] Avg episode reward: [(0, '1451.516')] +[2026-06-07 00:35:57,783][344387] Updated weights for policy 0, policy_version 14276 (0.0011) +[2026-06-07 00:35:59,610][344387] Updated weights for policy 0, policy_version 14288 (0.0008) +[2026-06-07 00:36:00,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3515.7, 300 sec: 3408.7). Total num frames: 7317504. Throughput: 0: 3479.2. Samples: 7319926. Policy #0 lag: (min: 3.0, avg: 21.0, max: 35.0) +[2026-06-07 00:36:00,258][343476] Avg episode reward: [(0, '1337.261')] +[2026-06-07 00:36:01,424][344387] Updated weights for policy 0, policy_version 14302 (0.0008) +[2026-06-07 00:36:03,350][344387] Updated weights for policy 0, policy_version 14313 (0.0008) +[2026-06-07 00:36:04,000][344304] Signal inference workers to stop experience collection... (1200 times) +[2026-06-07 00:36:04,032][344387] InferenceWorker_p0-w0: stopping experience collection (1200 times) +[2026-06-07 00:36:04,112][344304] Signal inference workers to resume experience collection... (1200 times) +[2026-06-07 00:36:04,113][344387] InferenceWorker_p0-w0: resuming experience collection (1200 times) +[2026-06-07 00:36:04,758][344387] Updated weights for policy 0, policy_version 14327 (0.0010) +[2026-06-07 00:36:05,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3515.7, 300 sec: 3415.6). Total num frames: 7335936. Throughput: 0: 3494.9. Samples: 7341218. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 00:36:05,264][343476] Avg episode reward: [(0, '1390.733')] +[2026-06-07 00:36:07,064][344387] Updated weights for policy 0, policy_version 14338 (0.0008) +[2026-06-07 00:36:08,965][344387] Updated weights for policy 0, policy_version 14352 (0.0009) +[2026-06-07 00:36:10,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3481.6, 300 sec: 3415.6). Total num frames: 7352320. Throughput: 0: 3491.4. Samples: 7361994. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 00:36:10,260][343476] Avg episode reward: [(0, '1298.117')] +[2026-06-07 00:36:10,610][344387] Updated weights for policy 0, policy_version 14366 (0.0009) +[2026-06-07 00:36:12,653][344387] Updated weights for policy 0, policy_version 14377 (0.0008) +[2026-06-07 00:36:13,853][344387] Updated weights for policy 0, policy_version 14391 (0.0010) +[2026-06-07 00:36:15,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3549.9, 300 sec: 3443.4). Total num frames: 7372800. Throughput: 0: 3535.7. Samples: 7374042. Policy #0 lag: (min: 10.0, avg: 22.9, max: 43.0) +[2026-06-07 00:36:15,261][343476] Avg episode reward: [(0, '1251.891')] +[2026-06-07 00:36:16,275][344387] Updated weights for policy 0, policy_version 14404 (0.0008) +[2026-06-07 00:36:18,364][344387] Updated weights for policy 0, policy_version 14416 (0.0008) +[2026-06-07 00:36:20,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3481.6, 300 sec: 3443.4). Total num frames: 7385088. Throughput: 0: 3463.1. Samples: 7392278. Policy #0 lag: (min: 10.0, avg: 22.9, max: 43.0) +[2026-06-07 00:36:20,260][343476] Avg episode reward: [(0, '1569.809')] +[2026-06-07 00:36:20,491][344387] Updated weights for policy 0, policy_version 14428 (0.0012) +[2026-06-07 00:36:22,343][344387] Updated weights for policy 0, policy_version 14438 (0.0010) +[2026-06-07 00:36:24,608][344387] Updated weights for policy 0, policy_version 14449 (0.0012) +[2026-06-07 00:36:25,257][343476] Fps is (10 sec: 2867.2, 60 sec: 3447.5, 300 sec: 3450.4). Total num frames: 7401472. Throughput: 0: 3323.6. Samples: 7408712. Policy #0 lag: (min: 8.0, avg: 19.5, max: 40.0) +[2026-06-07 00:36:25,260][343476] Avg episode reward: [(0, '1412.455')] +[2026-06-07 00:36:26,573][344387] Updated weights for policy 0, policy_version 14460 (0.0012) +[2026-06-07 00:36:28,295][344387] Updated weights for policy 0, policy_version 14470 (0.0012) +[2026-06-07 00:36:30,257][343476] Fps is (10 sec: 2867.2, 60 sec: 3379.2, 300 sec: 3429.5). Total num frames: 7413760. Throughput: 0: 3257.5. Samples: 7416966. Policy #0 lag: (min: 8.0, avg: 19.5, max: 40.0) +[2026-06-07 00:36:30,261][343476] Avg episode reward: [(0, '1565.959')] +[2026-06-07 00:36:30,451][344387] Updated weights for policy 0, policy_version 14482 (0.0011) +[2026-06-07 00:36:32,673][344387] Updated weights for policy 0, policy_version 14494 (0.0011) +[2026-06-07 00:36:34,198][344387] Updated weights for policy 0, policy_version 14504 (0.0009) +[2026-06-07 00:36:35,257][343476] Fps is (10 sec: 2457.6, 60 sec: 3276.8, 300 sec: 3408.7). Total num frames: 7426048. Throughput: 0: 3160.0. Samples: 7433614. Policy #0 lag: (min: 8.0, avg: 19.5, max: 40.0) +[2026-06-07 00:36:35,260][343476] Avg episode reward: [(0, '1402.936')] +[2026-06-07 00:36:36,532][344387] Updated weights for policy 0, policy_version 14519 (0.0009) +[2026-06-07 00:36:38,708][344387] Updated weights for policy 0, policy_version 14532 (0.0009) +[2026-06-07 00:36:40,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3242.7, 300 sec: 3415.6). Total num frames: 7444480. Throughput: 0: 3219.0. Samples: 7455422. Policy #0 lag: (min: 7.0, avg: 22.2, max: 39.0) +[2026-06-07 00:36:40,261][343476] Avg episode reward: [(0, '1465.919')] +[2026-06-07 00:36:40,308][344387] Updated weights for policy 0, policy_version 14542 (0.0008) +[2026-06-07 00:36:42,094][344387] Updated weights for policy 0, policy_version 14557 (0.0008) +[2026-06-07 00:36:43,369][344387] Updated weights for policy 0, policy_version 14567 (0.0009) +[2026-06-07 00:36:45,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3208.6, 300 sec: 3422.6). Total num frames: 7462912. Throughput: 0: 3239.6. Samples: 7465710. Policy #0 lag: (min: 7.0, avg: 22.2, max: 39.0) +[2026-06-07 00:36:45,261][343476] Avg episode reward: [(0, '1444.414')] +[2026-06-07 00:36:45,536][344387] Updated weights for policy 0, policy_version 14581 (0.0008) +[2026-06-07 00:36:47,424][344387] Updated weights for policy 0, policy_version 14594 (0.0008) +[2026-06-07 00:36:48,924][344387] Updated weights for policy 0, policy_version 14604 (0.0007) +[2026-06-07 00:36:50,258][343476] Fps is (10 sec: 3891.3, 60 sec: 3276.8, 300 sec: 3436.5). Total num frames: 7483392. Throughput: 0: 3264.1. Samples: 7488102. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 00:36:50,260][343476] Avg episode reward: [(0, '1380.164')] +[2026-06-07 00:36:50,937][344387] Updated weights for policy 0, policy_version 14618 (0.0010) +[2026-06-07 00:36:52,427][344387] Updated weights for policy 0, policy_version 14629 (0.0010) +[2026-06-07 00:36:54,591][344387] Updated weights for policy 0, policy_version 14642 (0.0008) +[2026-06-07 00:36:55,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3276.8, 300 sec: 3436.5). Total num frames: 7499776. Throughput: 0: 3258.5. Samples: 7508628. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 00:36:55,260][343476] Avg episode reward: [(0, '1420.133')] +[2026-06-07 00:36:55,907][344387] Updated weights for policy 0, policy_version 14655 (0.0012) +[2026-06-07 00:36:58,016][344387] Updated weights for policy 0, policy_version 14665 (0.0010) +[2026-06-07 00:36:59,466][344387] Updated weights for policy 0, policy_version 14678 (0.0008) +[2026-06-07 00:37:00,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3310.9, 300 sec: 3436.5). Total num frames: 7516160. Throughput: 0: 3224.6. Samples: 7519148. Policy #0 lag: (min: 3.0, avg: 21.5, max: 36.0) +[2026-06-07 00:37:00,261][343476] Avg episode reward: [(0, '1361.186')] +[2026-06-07 00:37:00,279][344304] Signal inference workers to stop experience collection... (1250 times) +[2026-06-07 00:37:00,306][344387] InferenceWorker_p0-w0: stopping experience collection (1250 times) +[2026-06-07 00:37:00,390][344304] Signal inference workers to resume experience collection... (1250 times) +[2026-06-07 00:37:00,390][344387] InferenceWorker_p0-w0: resuming experience collection (1250 times) +[2026-06-07 00:37:01,126][344387] Updated weights for policy 0, policy_version 14690 (0.0007) +[2026-06-07 00:37:02,802][344387] Updated weights for policy 0, policy_version 14700 (0.0008) +[2026-06-07 00:37:04,082][344387] Updated weights for policy 0, policy_version 14712 (0.0007) +[2026-06-07 00:37:05,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3345.1, 300 sec: 3450.4). Total num frames: 7536640. Throughput: 0: 3298.1. Samples: 7540696. Policy #0 lag: (min: 3.0, avg: 21.5, max: 36.0) +[2026-06-07 00:37:05,262][343476] Avg episode reward: [(0, '1459.678')] +[2026-06-07 00:37:06,675][344387] Updated weights for policy 0, policy_version 14726 (0.0010) +[2026-06-07 00:37:08,459][344387] Updated weights for policy 0, policy_version 14740 (0.0008) +[2026-06-07 00:37:09,793][344387] Updated weights for policy 0, policy_version 14751 (0.0008) +[2026-06-07 00:37:10,260][343476] Fps is (10 sec: 3685.7, 60 sec: 3345.0, 300 sec: 3443.4). Total num frames: 7553024. Throughput: 0: 3390.8. Samples: 7561306. Policy #0 lag: (min: 7.0, avg: 22.9, max: 40.0) +[2026-06-07 00:37:10,269][343476] Avg episode reward: [(0, '1262.954')] +[2026-06-07 00:37:12,046][344387] Updated weights for policy 0, policy_version 14761 (0.0007) +[2026-06-07 00:37:13,762][344387] Updated weights for policy 0, policy_version 14775 (0.0007) +[2026-06-07 00:37:15,017][344387] Updated weights for policy 0, policy_version 14786 (0.0007) +[2026-06-07 00:37:15,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3310.9, 300 sec: 3457.3). Total num frames: 7571456. Throughput: 0: 3453.6. Samples: 7572378. Policy #0 lag: (min: 7.0, avg: 22.9, max: 40.0) +[2026-06-07 00:37:15,260][343476] Avg episode reward: [(0, '1389.586')] +[2026-06-07 00:37:17,214][344387] Updated weights for policy 0, policy_version 14800 (0.0008) +[2026-06-07 00:37:18,902][344387] Updated weights for policy 0, policy_version 14812 (0.0010) +[2026-06-07 00:37:20,214][344387] Updated weights for policy 0, policy_version 14822 (0.0009) +[2026-06-07 00:37:20,257][343476] Fps is (10 sec: 3482.3, 60 sec: 3379.2, 300 sec: 3450.4). Total num frames: 7587840. Throughput: 0: 3562.4. Samples: 7593922. Policy #0 lag: (min: 3.0, avg: 22.3, max: 38.0) +[2026-06-07 00:37:20,259][343476] Avg episode reward: [(0, '1367.414')] +[2026-06-07 00:37:22,295][344387] Updated weights for policy 0, policy_version 14836 (0.0008) +[2026-06-07 00:37:24,091][344387] Updated weights for policy 0, policy_version 14848 (0.0009) +[2026-06-07 00:37:25,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3379.2, 300 sec: 3450.4). Total num frames: 7604224. Throughput: 0: 3520.5. Samples: 7613844. Policy #0 lag: (min: 3.0, avg: 22.3, max: 38.0) +[2026-06-07 00:37:25,261][343476] Avg episode reward: [(0, '1361.673')] +[2026-06-07 00:37:26,455][344387] Updated weights for policy 0, policy_version 14860 (0.0009) +[2026-06-07 00:37:28,088][344387] Updated weights for policy 0, policy_version 14872 (0.0009) +[2026-06-07 00:37:29,691][344387] Updated weights for policy 0, policy_version 14884 (0.0009) +[2026-06-07 00:37:30,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3447.5, 300 sec: 3450.4). Total num frames: 7620608. Throughput: 0: 3505.9. Samples: 7623474. Policy #0 lag: (min: 3.0, avg: 22.3, max: 38.0) +[2026-06-07 00:37:30,260][343476] Avg episode reward: [(0, '1293.681')] +[2026-06-07 00:37:31,828][344387] Updated weights for policy 0, policy_version 14896 (0.0009) +[2026-06-07 00:37:33,617][344387] Updated weights for policy 0, policy_version 14906 (0.0008) +[2026-06-07 00:37:34,958][344387] Updated weights for policy 0, policy_version 14917 (0.0009) +[2026-06-07 00:37:35,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3549.8, 300 sec: 3457.3). Total num frames: 7639040. Throughput: 0: 3452.4. Samples: 7643462. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:37:35,264][343476] Avg episode reward: [(0, '1298.835')] +[2026-06-07 00:37:36,801][344387] Updated weights for policy 0, policy_version 14930 (0.0009) +[2026-06-07 00:37:39,012][344387] Updated weights for policy 0, policy_version 14942 (0.0008) +[2026-06-07 00:37:40,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3515.8, 300 sec: 3443.4). Total num frames: 7655424. Throughput: 0: 3448.6. Samples: 7663816. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:37:40,259][343476] Avg episode reward: [(0, '1359.066')] +[2026-06-07 00:37:41,011][344387] Updated weights for policy 0, policy_version 14953 (0.0008) +[2026-06-07 00:37:42,655][344387] Updated weights for policy 0, policy_version 14966 (0.0008) +[2026-06-07 00:37:44,365][344387] Updated weights for policy 0, policy_version 14978 (0.0010) +[2026-06-07 00:37:45,258][343476] Fps is (10 sec: 3277.0, 60 sec: 3481.6, 300 sec: 3450.4). Total num frames: 7671808. Throughput: 0: 3433.5. Samples: 7673654. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 00:37:45,261][343476] Avg episode reward: [(0, '1383.105')] +[2026-06-07 00:37:46,370][344387] Updated weights for policy 0, policy_version 14990 (0.0009) +[2026-06-07 00:37:47,982][344387] Updated weights for policy 0, policy_version 15000 (0.0008) +[2026-06-07 00:37:49,569][344387] Updated weights for policy 0, policy_version 15012 (0.0011) +[2026-06-07 00:37:50,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3413.3, 300 sec: 3436.5). Total num frames: 7688192. Throughput: 0: 3376.2. Samples: 7692622. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 00:37:50,261][343476] Avg episode reward: [(0, '1524.440')] +[2026-06-07 00:37:52,197][344387] Updated weights for policy 0, policy_version 15026 (0.0008) +[2026-06-07 00:37:53,816][344387] Updated weights for policy 0, policy_version 15038 (0.0010) +[2026-06-07 00:37:55,094][344387] Updated weights for policy 0, policy_version 15048 (0.0007) +[2026-06-07 00:37:55,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3413.3, 300 sec: 3436.5). Total num frames: 7704576. Throughput: 0: 3358.7. Samples: 7712442. Policy #0 lag: (min: 7.0, avg: 23.6, max: 40.0) +[2026-06-07 00:37:55,261][343476] Avg episode reward: [(0, '1495.465')] +[2026-06-07 00:37:57,396][344387] Updated weights for policy 0, policy_version 15060 (0.0013) +[2026-06-07 00:37:59,668][344387] Updated weights for policy 0, policy_version 15072 (0.0011) +[2026-06-07 00:38:00,258][343476] Fps is (10 sec: 2867.2, 60 sec: 3345.1, 300 sec: 3415.6). Total num frames: 7716864. Throughput: 0: 3285.3. Samples: 7720218. Policy #0 lag: (min: 7.0, avg: 23.6, max: 40.0) +[2026-06-07 00:38:00,260][343476] Avg episode reward: [(0, '1432.781')] +[2026-06-07 00:38:02,193][344387] Updated weights for policy 0, policy_version 15084 (0.0008) +[2026-06-07 00:38:03,734][344387] Updated weights for policy 0, policy_version 15095 (0.0010) +[2026-06-07 00:38:04,403][344304] Signal inference workers to stop experience collection... (1300 times) +[2026-06-07 00:38:04,436][344387] InferenceWorker_p0-w0: stopping experience collection (1300 times) +[2026-06-07 00:38:04,526][344304] Signal inference workers to resume experience collection... (1300 times) +[2026-06-07 00:38:04,527][344387] InferenceWorker_p0-w0: resuming experience collection (1300 times) +[2026-06-07 00:38:05,258][343476] Fps is (10 sec: 2867.2, 60 sec: 3276.8, 300 sec: 3415.6). Total num frames: 7733248. Throughput: 0: 3225.4. Samples: 7739064. Policy #0 lag: (min: 7.0, avg: 23.6, max: 40.0) +[2026-06-07 00:38:05,261][343476] Avg episode reward: [(0, '1470.973')] +[2026-06-07 00:38:05,383][344387] Updated weights for policy 0, policy_version 15107 (0.0009) +[2026-06-07 00:38:08,022][344387] Updated weights for policy 0, policy_version 15121 (0.0009) +[2026-06-07 00:38:09,444][344387] Updated weights for policy 0, policy_version 15133 (0.0009) +[2026-06-07 00:38:10,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3276.9, 300 sec: 3408.7). Total num frames: 7749632. Throughput: 0: 3220.2. Samples: 7758752. Policy #0 lag: (min: 4.0, avg: 21.8, max: 35.0) +[2026-06-07 00:38:10,262][343476] Avg episode reward: [(0, '1172.512')] +[2026-06-07 00:38:10,827][344387] Updated weights for policy 0, policy_version 15143 (0.0008) +[2026-06-07 00:38:12,715][344387] Updated weights for policy 0, policy_version 15154 (0.0010) +[2026-06-07 00:38:14,518][344387] Updated weights for policy 0, policy_version 15166 (0.0008) +[2026-06-07 00:38:15,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3242.7, 300 sec: 3408.7). Total num frames: 7766016. Throughput: 0: 3224.3. Samples: 7768566. Policy #0 lag: (min: 4.0, avg: 21.8, max: 35.0) +[2026-06-07 00:38:15,260][343476] Avg episode reward: [(0, '1401.570')] +[2026-06-07 00:38:15,919][344387] Updated weights for policy 0, policy_version 15176 (0.0008) +[2026-06-07 00:38:17,900][344387] Updated weights for policy 0, policy_version 15188 (0.0009) +[2026-06-07 00:38:19,908][344387] Updated weights for policy 0, policy_version 15200 (0.0010) +[2026-06-07 00:38:20,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3242.7, 300 sec: 3408.7). Total num frames: 7782400. Throughput: 0: 3205.3. Samples: 7787702. Policy #0 lag: (min: 0.0, avg: 16.7, max: 32.0) +[2026-06-07 00:38:20,261][343476] Avg episode reward: [(0, '1485.501')] +[2026-06-07 00:38:22,302][344387] Updated weights for policy 0, policy_version 15210 (0.0008) +[2026-06-07 00:38:23,780][344387] Updated weights for policy 0, policy_version 15222 (0.0010) +[2026-06-07 00:38:25,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3242.7, 300 sec: 3401.8). Total num frames: 7798784. Throughput: 0: 3195.3. Samples: 7807604. Policy #0 lag: (min: 0.0, avg: 16.7, max: 32.0) +[2026-06-07 00:38:25,259][344387] Updated weights for policy 0, policy_version 15234 (0.0009) +[2026-06-07 00:38:25,259][343476] Avg episode reward: [(0, '1493.828')] +[2026-06-07 00:38:27,666][344387] Updated weights for policy 0, policy_version 15246 (0.0007) +[2026-06-07 00:38:29,326][344387] Updated weights for policy 0, policy_version 15257 (0.0008) +[2026-06-07 00:38:30,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3276.8, 300 sec: 3394.8). Total num frames: 7817216. Throughput: 0: 3197.4. Samples: 7817538. Policy #0 lag: (min: 3.0, avg: 20.0, max: 35.0) +[2026-06-07 00:38:30,260][343476] Avg episode reward: [(0, '1207.568')] +[2026-06-07 00:38:30,689][344387] Updated weights for policy 0, policy_version 15269 (0.0007) +[2026-06-07 00:38:32,614][344387] Updated weights for policy 0, policy_version 15282 (0.0007) +[2026-06-07 00:38:34,375][344387] Updated weights for policy 0, policy_version 15294 (0.0007) +[2026-06-07 00:38:35,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3242.7, 300 sec: 3387.9). Total num frames: 7833600. Throughput: 0: 3274.0. Samples: 7839950. Policy #0 lag: (min: 3.0, avg: 20.0, max: 35.0) +[2026-06-07 00:38:35,263][343476] Avg episode reward: [(0, '1536.330')] +[2026-06-07 00:38:36,407][344387] Updated weights for policy 0, policy_version 15305 (0.0010) +[2026-06-07 00:38:37,988][344387] Updated weights for policy 0, policy_version 15318 (0.0007) +[2026-06-07 00:38:39,506][344387] Updated weights for policy 0, policy_version 15330 (0.0008) +[2026-06-07 00:38:40,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3242.7, 300 sec: 3387.9). Total num frames: 7849984. Throughput: 0: 3267.5. Samples: 7859480. Policy #0 lag: (min: 3.0, avg: 20.0, max: 35.0) +[2026-06-07 00:38:40,260][343476] Avg episode reward: [(0, '1270.632')] +[2026-06-07 00:38:41,741][344387] Updated weights for policy 0, policy_version 15344 (0.0007) +[2026-06-07 00:38:43,251][344387] Updated weights for policy 0, policy_version 15356 (0.0008) +[2026-06-07 00:38:44,757][344387] Updated weights for policy 0, policy_version 15366 (0.0008) +[2026-06-07 00:38:45,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3276.8, 300 sec: 3394.8). Total num frames: 7868416. Throughput: 0: 3351.6. Samples: 7871040. Policy #0 lag: (min: 3.0, avg: 20.7, max: 38.0) +[2026-06-07 00:38:45,268][343476] Avg episode reward: [(0, '1441.563')] +[2026-06-07 00:38:46,355][344387] Updated weights for policy 0, policy_version 15379 (0.0007) +[2026-06-07 00:38:47,742][344387] Updated weights for policy 0, policy_version 15389 (0.0007) +[2026-06-07 00:38:49,290][344387] Updated weights for policy 0, policy_version 15399 (0.0008) +[2026-06-07 00:38:50,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3310.9, 300 sec: 3401.8). Total num frames: 7886848. Throughput: 0: 3421.5. Samples: 7893030. Policy #0 lag: (min: 3.0, avg: 20.7, max: 38.0) +[2026-06-07 00:38:50,260][343476] Avg episode reward: [(0, '1378.958')] +[2026-06-07 00:38:51,676][344387] Updated weights for policy 0, policy_version 15413 (0.0007) +[2026-06-07 00:38:52,954][344387] Updated weights for policy 0, policy_version 15428 (0.0008) +[2026-06-07 00:38:55,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3310.9, 300 sec: 3401.8). Total num frames: 7903232. Throughput: 0: 3457.2. Samples: 7914328. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:38:55,259][343476] Avg episode reward: [(0, '1244.486')] +[2026-06-07 00:38:55,399][344387] Updated weights for policy 0, policy_version 15441 (0.0010) +[2026-06-07 00:38:55,520][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000015444_7907328.pth... +[2026-06-07 00:38:57,012][344387] Updated weights for policy 0, policy_version 15451 (0.0011) +[2026-06-07 00:38:59,666][344387] Updated weights for policy 0, policy_version 15461 (0.0009) +[2026-06-07 00:39:00,258][343476] Fps is (10 sec: 3072.0, 60 sec: 3345.1, 300 sec: 3387.9). Total num frames: 7917568. Throughput: 0: 3407.6. Samples: 7921908. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:39:00,260][343476] Avg episode reward: [(0, '1418.330')] +[2026-06-07 00:39:01,330][344387] Updated weights for policy 0, policy_version 15473 (0.0012) +[2026-06-07 00:39:02,827][344304] Signal inference workers to stop experience collection... (1350 times) +[2026-06-07 00:39:02,866][344387] InferenceWorker_p0-w0: stopping experience collection (1350 times) +[2026-06-07 00:39:02,914][344304] Signal inference workers to resume experience collection... (1350 times) +[2026-06-07 00:39:02,915][344387] InferenceWorker_p0-w0: resuming experience collection (1350 times) +[2026-06-07 00:39:03,425][344387] Updated weights for policy 0, policy_version 15484 (0.0011) +[2026-06-07 00:39:05,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3311.0, 300 sec: 3380.9). Total num frames: 7931904. Throughput: 0: 3339.1. Samples: 7937960. Policy #0 lag: (min: 7.0, avg: 20.3, max: 39.0) +[2026-06-07 00:39:05,259][343476] Avg episode reward: [(0, '1465.983')] +[2026-06-07 00:39:06,069][344387] Updated weights for policy 0, policy_version 15494 (0.0011) +[2026-06-07 00:39:07,956][344387] Updated weights for policy 0, policy_version 15508 (0.0011) +[2026-06-07 00:39:10,069][344387] Updated weights for policy 0, policy_version 15521 (0.0009) +[2026-06-07 00:39:10,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3310.9, 300 sec: 3380.9). Total num frames: 7948288. Throughput: 0: 3278.4. Samples: 7955132. Policy #0 lag: (min: 7.0, avg: 20.3, max: 39.0) +[2026-06-07 00:39:10,264][343476] Avg episode reward: [(0, '1411.395')] +[2026-06-07 00:39:12,643][344387] Updated weights for policy 0, policy_version 15533 (0.0008) +[2026-06-07 00:39:14,277][344387] Updated weights for policy 0, policy_version 15547 (0.0008) +[2026-06-07 00:39:15,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3276.8, 300 sec: 3367.0). Total num frames: 7962624. Throughput: 0: 3296.8. Samples: 7965894. Policy #0 lag: (min: 6.0, avg: 23.9, max: 39.0) +[2026-06-07 00:39:15,260][343476] Avg episode reward: [(0, '1474.146')] +[2026-06-07 00:39:16,611][344387] Updated weights for policy 0, policy_version 15557 (0.0010) +[2026-06-07 00:39:18,287][344387] Updated weights for policy 0, policy_version 15570 (0.0010) +[2026-06-07 00:39:20,258][343476] Fps is (10 sec: 2867.3, 60 sec: 3242.7, 300 sec: 3367.1). Total num frames: 7976960. Throughput: 0: 3157.6. Samples: 7982044. Policy #0 lag: (min: 6.0, avg: 23.9, max: 39.0) +[2026-06-07 00:39:20,263][343476] Avg episode reward: [(0, '1316.784')] +[2026-06-07 00:39:20,626][344387] Updated weights for policy 0, policy_version 15581 (0.0008) +[2026-06-07 00:39:22,193][344387] Updated weights for policy 0, policy_version 15591 (0.0008) +[2026-06-07 00:39:24,967][344387] Updated weights for policy 0, policy_version 15605 (0.0009) +[2026-06-07 00:39:25,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3208.5, 300 sec: 3353.2). Total num frames: 7991296. Throughput: 0: 3157.1. Samples: 8001550. Policy #0 lag: (min: 6.0, avg: 23.9, max: 39.0) +[2026-06-07 00:39:25,259][343476] Avg episode reward: [(0, '1362.142')] +[2026-06-07 00:39:26,282][344387] Updated weights for policy 0, policy_version 15619 (0.0008) +[2026-06-07 00:39:28,776][344387] Updated weights for policy 0, policy_version 15630 (0.0007) +[2026-06-07 00:39:30,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3174.4, 300 sec: 3346.2). Total num frames: 8007680. Throughput: 0: 3132.6. Samples: 8012004. Policy #0 lag: (min: 5.0, avg: 20.9, max: 35.0) +[2026-06-07 00:39:30,261][343476] Avg episode reward: [(0, '1501.663')] +[2026-06-07 00:39:30,577][344387] Updated weights for policy 0, policy_version 15645 (0.0008) +[2026-06-07 00:39:31,771][344387] Updated weights for policy 0, policy_version 15656 (0.0008) +[2026-06-07 00:39:34,037][344387] Updated weights for policy 0, policy_version 15669 (0.0009) +[2026-06-07 00:39:35,076][344387] Updated weights for policy 0, policy_version 15680 (0.0010) +[2026-06-07 00:39:35,258][343476] Fps is (10 sec: 3686.1, 60 sec: 3242.6, 300 sec: 3360.1). Total num frames: 8028160. Throughput: 0: 3097.9. Samples: 8032436. Policy #0 lag: (min: 5.0, avg: 20.9, max: 35.0) +[2026-06-07 00:39:35,261][343476] Avg episode reward: [(0, '1485.766')] +[2026-06-07 00:39:37,538][344387] Updated weights for policy 0, policy_version 15690 (0.0007) +[2026-06-07 00:39:39,641][344387] Updated weights for policy 0, policy_version 15708 (0.0007) +[2026-06-07 00:39:40,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3242.7, 300 sec: 3353.2). Total num frames: 8044544. Throughput: 0: 3094.2. Samples: 8053568. Policy #0 lag: (min: 3.0, avg: 18.7, max: 35.0) +[2026-06-07 00:39:40,259][343476] Avg episode reward: [(0, '1513.450')] +[2026-06-07 00:39:41,165][344387] Updated weights for policy 0, policy_version 15718 (0.0009) +[2026-06-07 00:39:43,187][344387] Updated weights for policy 0, policy_version 15732 (0.0009) +[2026-06-07 00:39:44,918][344387] Updated weights for policy 0, policy_version 15746 (0.0008) +[2026-06-07 00:39:45,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3242.7, 300 sec: 3360.1). Total num frames: 8062976. Throughput: 0: 3163.3. Samples: 8064258. Policy #0 lag: (min: 3.0, avg: 18.7, max: 35.0) +[2026-06-07 00:39:45,260][343476] Avg episode reward: [(0, '1370.903')] +[2026-06-07 00:39:47,094][344387] Updated weights for policy 0, policy_version 15756 (0.0010) +[2026-06-07 00:39:48,533][344387] Updated weights for policy 0, policy_version 15766 (0.0009) +[2026-06-07 00:39:50,013][344387] Updated weights for policy 0, policy_version 15776 (0.0009) +[2026-06-07 00:39:50,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3174.4, 300 sec: 3346.2). Total num frames: 8077312. Throughput: 0: 3214.0. Samples: 8082590. Policy #0 lag: (min: 3.0, avg: 22.2, max: 40.0) +[2026-06-07 00:39:50,261][343476] Avg episode reward: [(0, '1445.233')] +[2026-06-07 00:39:52,971][344387] Updated weights for policy 0, policy_version 15788 (0.0012) +[2026-06-07 00:39:54,308][344387] Updated weights for policy 0, policy_version 15800 (0.0009) +[2026-06-07 00:39:55,258][343476] Fps is (10 sec: 2867.2, 60 sec: 3140.3, 300 sec: 3339.3). Total num frames: 8091648. Throughput: 0: 3226.1. Samples: 8100304. Policy #0 lag: (min: 3.0, avg: 22.2, max: 40.0) +[2026-06-07 00:39:55,262][343476] Avg episode reward: [(0, '1432.349')] +[2026-06-07 00:39:56,142][344387] Updated weights for policy 0, policy_version 15812 (0.0009) +[2026-06-07 00:39:58,135][344387] Updated weights for policy 0, policy_version 15822 (0.0010) +[2026-06-07 00:39:59,192][344387] Updated weights for policy 0, policy_version 15832 (0.0009) +[2026-06-07 00:40:00,258][343476] Fps is (10 sec: 3071.8, 60 sec: 3174.4, 300 sec: 3332.3). Total num frames: 8108032. Throughput: 0: 3204.0. Samples: 8110074. Policy #0 lag: (min: 3.0, avg: 22.2, max: 40.0) +[2026-06-07 00:40:00,262][343476] Avg episode reward: [(0, '1679.347')] +[2026-06-07 00:40:00,692][344304] Saving new best policy, reward=1679.347! +[2026-06-07 00:40:01,023][344387] Updated weights for policy 0, policy_version 15844 (0.0010) +[2026-06-07 00:40:03,485][344387] Updated weights for policy 0, policy_version 15858 (0.0009) +[2026-06-07 00:40:04,962][344387] Updated weights for policy 0, policy_version 15868 (0.0009) +[2026-06-07 00:40:05,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3208.5, 300 sec: 3325.4). Total num frames: 8124416. Throughput: 0: 3286.1. Samples: 8129922. Policy #0 lag: (min: 7.0, avg: 22.6, max: 39.0) +[2026-06-07 00:40:05,263][343476] Avg episode reward: [(0, '1281.502')] +[2026-06-07 00:40:05,815][344304] Signal inference workers to stop experience collection... (1400 times) +[2026-06-07 00:40:05,861][344387] InferenceWorker_p0-w0: stopping experience collection (1400 times) +[2026-06-07 00:40:06,006][344304] Signal inference workers to resume experience collection... (1400 times) +[2026-06-07 00:40:06,008][344387] InferenceWorker_p0-w0: resuming experience collection (1400 times) +[2026-06-07 00:40:07,259][344387] Updated weights for policy 0, policy_version 15880 (0.0014) +[2026-06-07 00:40:09,605][344387] Updated weights for policy 0, policy_version 15893 (0.0010) +[2026-06-07 00:40:10,258][343476] Fps is (10 sec: 3072.1, 60 sec: 3174.4, 300 sec: 3318.5). Total num frames: 8138752. Throughput: 0: 3262.3. Samples: 8148354. Policy #0 lag: (min: 7.0, avg: 22.6, max: 39.0) +[2026-06-07 00:40:10,260][343476] Avg episode reward: [(0, '1422.512')] +[2026-06-07 00:40:11,375][344387] Updated weights for policy 0, policy_version 15904 (0.0010) +[2026-06-07 00:40:13,578][344387] Updated weights for policy 0, policy_version 15914 (0.0008) +[2026-06-07 00:40:14,685][344387] Updated weights for policy 0, policy_version 15925 (0.0010) +[2026-06-07 00:40:15,257][343476] Fps is (10 sec: 3072.3, 60 sec: 3208.6, 300 sec: 3318.5). Total num frames: 8155136. Throughput: 0: 3230.0. Samples: 8157354. Policy #0 lag: (min: 3.0, avg: 22.1, max: 43.0) +[2026-06-07 00:40:15,259][343476] Avg episode reward: [(0, '1527.463')] +[2026-06-07 00:40:16,579][344387] Updated weights for policy 0, policy_version 15936 (0.0010) +[2026-06-07 00:40:18,533][344387] Updated weights for policy 0, policy_version 15946 (0.0008) +[2026-06-07 00:40:19,908][344387] Updated weights for policy 0, policy_version 15958 (0.0012) +[2026-06-07 00:40:20,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3242.7, 300 sec: 3311.5). Total num frames: 8171520. Throughput: 0: 3216.4. Samples: 8177170. Policy #0 lag: (min: 3.0, avg: 22.1, max: 43.0) +[2026-06-07 00:40:20,259][343476] Avg episode reward: [(0, '1300.700')] +[2026-06-07 00:40:22,406][344387] Updated weights for policy 0, policy_version 15970 (0.0011) +[2026-06-07 00:40:24,973][344387] Updated weights for policy 0, policy_version 15980 (0.0011) +[2026-06-07 00:40:25,257][343476] Fps is (10 sec: 2867.2, 60 sec: 3208.5, 300 sec: 3297.6). Total num frames: 8183808. Throughput: 0: 3078.2. Samples: 8192088. Policy #0 lag: (min: 3.0, avg: 18.2, max: 35.0) +[2026-06-07 00:40:25,260][343476] Avg episode reward: [(0, '1423.509')] +[2026-06-07 00:40:26,407][344387] Updated weights for policy 0, policy_version 15990 (0.0010) +[2026-06-07 00:40:29,062][344387] Updated weights for policy 0, policy_version 16002 (0.0012) +[2026-06-07 00:40:30,257][343476] Fps is (10 sec: 2252.8, 60 sec: 3106.1, 300 sec: 3269.9). Total num frames: 8194048. Throughput: 0: 3006.1. Samples: 8199530. Policy #0 lag: (min: 3.0, avg: 18.2, max: 35.0) +[2026-06-07 00:40:30,259][343476] Avg episode reward: [(0, '1449.399')] +[2026-06-07 00:40:31,311][344387] Updated weights for policy 0, policy_version 16012 (0.0009) +[2026-06-07 00:40:33,045][344387] Updated weights for policy 0, policy_version 16023 (0.0013) +[2026-06-07 00:40:35,257][343476] Fps is (10 sec: 2252.8, 60 sec: 2969.6, 300 sec: 3242.1). Total num frames: 8206336. Throughput: 0: 2927.5. Samples: 8214326. Policy #0 lag: (min: 3.0, avg: 18.2, max: 35.0) +[2026-06-07 00:40:35,259][343476] Avg episode reward: [(0, '1385.549')] +[2026-06-07 00:40:35,634][344387] Updated weights for policy 0, policy_version 16035 (0.0011) +[2026-06-07 00:40:38,135][344387] Updated weights for policy 0, policy_version 16046 (0.0010) +[2026-06-07 00:40:39,468][344387] Updated weights for policy 0, policy_version 16056 (0.0010) +[2026-06-07 00:40:40,257][343476] Fps is (10 sec: 2662.4, 60 sec: 2935.5, 300 sec: 3221.3). Total num frames: 8220672. Throughput: 0: 2867.0. Samples: 8229318. Policy #0 lag: (min: 3.0, avg: 20.9, max: 42.0) +[2026-06-07 00:40:40,259][343476] Avg episode reward: [(0, '1459.291')] +[2026-06-07 00:40:42,293][344387] Updated weights for policy 0, policy_version 16068 (0.0011) +[2026-06-07 00:40:44,663][344387] Updated weights for policy 0, policy_version 16078 (0.0010) +[2026-06-07 00:40:45,257][343476] Fps is (10 sec: 2867.2, 60 sec: 2867.2, 300 sec: 3214.3). Total num frames: 8235008. Throughput: 0: 2819.4. Samples: 8236944. Policy #0 lag: (min: 3.0, avg: 20.9, max: 42.0) +[2026-06-07 00:40:45,259][343476] Avg episode reward: [(0, '1393.067')] +[2026-06-07 00:40:46,005][344387] Updated weights for policy 0, policy_version 16088 (0.0010) +[2026-06-07 00:40:48,549][344387] Updated weights for policy 0, policy_version 16099 (0.0011) +[2026-06-07 00:40:50,257][343476] Fps is (10 sec: 2457.6, 60 sec: 2798.9, 300 sec: 3193.5). Total num frames: 8245248. Throughput: 0: 2724.4. Samples: 8252518. Policy #0 lag: (min: 6.0, avg: 20.9, max: 38.0) +[2026-06-07 00:40:50,260][343476] Avg episode reward: [(0, '1290.821')] +[2026-06-07 00:40:50,949][344387] Updated weights for policy 0, policy_version 16109 (0.0011) +[2026-06-07 00:40:52,185][344387] Updated weights for policy 0, policy_version 16119 (0.0011) +[2026-06-07 00:40:54,565][344387] Updated weights for policy 0, policy_version 16131 (0.0012) +[2026-06-07 00:40:55,257][343476] Fps is (10 sec: 2457.6, 60 sec: 2798.9, 300 sec: 3193.5). Total num frames: 8259584. Throughput: 0: 2671.9. Samples: 8268588. Policy #0 lag: (min: 6.0, avg: 20.9, max: 38.0) +[2026-06-07 00:40:55,261][343476] Avg episode reward: [(0, '1496.741')] +[2026-06-07 00:40:57,034][344387] Updated weights for policy 0, policy_version 16141 (0.0010) +[2026-06-07 00:40:58,262][344387] Updated weights for policy 0, policy_version 16151 (0.0011) +[2026-06-07 00:41:00,257][343476] Fps is (10 sec: 2662.4, 60 sec: 2730.7, 300 sec: 3172.7). Total num frames: 8271872. Throughput: 0: 2657.9. Samples: 8276960. Policy #0 lag: (min: 6.0, avg: 20.9, max: 38.0) +[2026-06-07 00:41:00,260][343476] Avg episode reward: [(0, '1403.315')] +[2026-06-07 00:41:00,729][344387] Updated weights for policy 0, policy_version 16163 (0.0010) +[2026-06-07 00:41:03,292][344387] Updated weights for policy 0, policy_version 16174 (0.0011) +[2026-06-07 00:41:04,494][344387] Updated weights for policy 0, policy_version 16184 (0.0011) +[2026-06-07 00:41:05,257][343476] Fps is (10 sec: 2662.3, 60 sec: 2696.6, 300 sec: 3165.7). Total num frames: 8286208. Throughput: 0: 2570.5. Samples: 8292844. Policy #0 lag: (min: 3.0, avg: 19.9, max: 35.0) +[2026-06-07 00:41:05,260][343476] Avg episode reward: [(0, '1421.974')] +[2026-06-07 00:41:06,839][344387] Updated weights for policy 0, policy_version 16196 (0.0009) +[2026-06-07 00:41:09,746][344387] Updated weights for policy 0, policy_version 16209 (0.0011) +[2026-06-07 00:41:10,258][343476] Fps is (10 sec: 2867.2, 60 sec: 2696.6, 300 sec: 3144.9). Total num frames: 8300544. Throughput: 0: 2604.5. Samples: 8309290. Policy #0 lag: (min: 3.0, avg: 19.9, max: 35.0) +[2026-06-07 00:41:10,261][343476] Avg episode reward: [(0, '1426.273')] +[2026-06-07 00:41:11,267][344387] Updated weights for policy 0, policy_version 16219 (0.0009) +[2026-06-07 00:41:13,775][344387] Updated weights for policy 0, policy_version 16231 (0.0010) +[2026-06-07 00:41:15,257][343476] Fps is (10 sec: 2662.5, 60 sec: 2628.3, 300 sec: 3144.9). Total num frames: 8312832. Throughput: 0: 2604.5. Samples: 8316734. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 00:41:15,258][343476] Avg episode reward: [(0, '1536.466')] +[2026-06-07 00:41:16,166][344387] Updated weights for policy 0, policy_version 16247 (0.0010) +[2026-06-07 00:41:17,856][344387] Updated weights for policy 0, policy_version 16259 (0.0010) +[2026-06-07 00:41:20,061][344387] Updated weights for policy 0, policy_version 16269 (0.0012) +[2026-06-07 00:41:20,258][343476] Fps is (10 sec: 2867.1, 60 sec: 2628.3, 300 sec: 3144.9). Total num frames: 8329216. Throughput: 0: 2725.7. Samples: 8336982. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 00:41:20,260][343476] Avg episode reward: [(0, '1343.669')] +[2026-06-07 00:41:21,207][344387] Updated weights for policy 0, policy_version 16279 (0.0011) +[2026-06-07 00:41:22,999][344387] Updated weights for policy 0, policy_version 16291 (0.0008) +[2026-06-07 00:41:25,013][344387] Updated weights for policy 0, policy_version 16301 (0.0007) +[2026-06-07 00:41:25,257][343476] Fps is (10 sec: 3481.5, 60 sec: 2730.7, 300 sec: 3165.7). Total num frames: 8347648. Throughput: 0: 2836.6. Samples: 8356964. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:41:25,261][343476] Avg episode reward: [(0, '1425.698')] +[2026-06-07 00:41:26,399][344387] Updated weights for policy 0, policy_version 16313 (0.0008) +[2026-06-07 00:41:28,128][344387] Updated weights for policy 0, policy_version 16325 (0.0009) +[2026-06-07 00:41:29,754][344387] Updated weights for policy 0, policy_version 16337 (0.0010) +[2026-06-07 00:41:30,257][343476] Fps is (10 sec: 3686.5, 60 sec: 2867.2, 300 sec: 3186.5). Total num frames: 8366080. Throughput: 0: 2904.0. Samples: 8367622. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:41:30,268][343476] Avg episode reward: [(0, '1452.496')] +[2026-06-07 00:41:31,116][344387] Updated weights for policy 0, policy_version 16347 (0.0008) +[2026-06-07 00:41:32,663][344387] Updated weights for policy 0, policy_version 16358 (0.0007) +[2026-06-07 00:41:34,226][344387] Updated weights for policy 0, policy_version 16370 (0.0008) +[2026-06-07 00:41:35,257][343476] Fps is (10 sec: 3686.5, 60 sec: 2969.6, 300 sec: 3186.6). Total num frames: 8384512. Throughput: 0: 3049.9. Samples: 8389764. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:41:35,259][343476] Avg episode reward: [(0, '1328.344')] +[2026-06-07 00:41:35,589][344387] Updated weights for policy 0, policy_version 16380 (0.0010) +[2026-06-07 00:41:37,176][344387] Updated weights for policy 0, policy_version 16391 (0.0008) +[2026-06-07 00:41:38,847][344387] Updated weights for policy 0, policy_version 16403 (0.0007) +[2026-06-07 00:41:40,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3037.9, 300 sec: 3186.5). Total num frames: 8402944. Throughput: 0: 3157.7. Samples: 8410686. Policy #0 lag: (min: 7.0, avg: 21.8, max: 39.0) +[2026-06-07 00:41:40,261][343476] Avg episode reward: [(0, '1395.743')] +[2026-06-07 00:41:40,848][344387] Updated weights for policy 0, policy_version 16413 (0.0010) +[2026-06-07 00:41:41,835][344387] Updated weights for policy 0, policy_version 16424 (0.0007) +[2026-06-07 00:41:43,239][344387] Updated weights for policy 0, policy_version 16436 (0.0008) +[2026-06-07 00:41:45,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3072.0, 300 sec: 3172.7). Total num frames: 8419328. Throughput: 0: 3231.4. Samples: 8422376. Policy #0 lag: (min: 7.0, avg: 21.8, max: 39.0) +[2026-06-07 00:41:45,262][343476] Avg episode reward: [(0, '1501.194')] +[2026-06-07 00:41:45,586][344387] Updated weights for policy 0, policy_version 16448 (0.0008) +[2026-06-07 00:41:47,544][344304] Signal inference workers to stop experience collection... (1450 times) +[2026-06-07 00:41:47,609][344387] InferenceWorker_p0-w0: stopping experience collection (1450 times) +[2026-06-07 00:41:47,666][344304] Signal inference workers to resume experience collection... (1450 times) +[2026-06-07 00:41:47,667][344387] InferenceWorker_p0-w0: resuming experience collection (1450 times) +[2026-06-07 00:41:48,245][344387] Updated weights for policy 0, policy_version 16464 (0.0009) +[2026-06-07 00:41:49,803][344387] Updated weights for policy 0, policy_version 16477 (0.0009) +[2026-06-07 00:41:50,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3208.5, 300 sec: 3179.6). Total num frames: 8437760. Throughput: 0: 3360.3. Samples: 8444058. Policy #0 lag: (min: 11.0, avg: 23.8, max: 39.0) +[2026-06-07 00:41:50,264][343476] Avg episode reward: [(0, '1454.472')] +[2026-06-07 00:41:52,080][344387] Updated weights for policy 0, policy_version 16488 (0.0008) +[2026-06-07 00:41:53,837][344387] Updated weights for policy 0, policy_version 16503 (0.0205) +[2026-06-07 00:41:55,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3208.5, 300 sec: 3172.7). Total num frames: 8452096. Throughput: 0: 3369.0. Samples: 8460898. Policy #0 lag: (min: 11.0, avg: 23.8, max: 39.0) +[2026-06-07 00:41:55,260][343476] Avg episode reward: [(0, '1511.550')] +[2026-06-07 00:41:55,994][344387] Updated weights for policy 0, policy_version 16514 (0.0013) +[2026-06-07 00:41:59,082][344387] Updated weights for policy 0, policy_version 16529 (0.0013) +[2026-06-07 00:42:00,258][343476] Fps is (10 sec: 2867.3, 60 sec: 3242.7, 300 sec: 3151.8). Total num frames: 8466432. Throughput: 0: 3396.4. Samples: 8469574. Policy #0 lag: (min: 11.0, avg: 23.8, max: 39.0) +[2026-06-07 00:42:00,260][343476] Avg episode reward: [(0, '1528.806')] +[2026-06-07 00:42:00,532][344387] Updated weights for policy 0, policy_version 16539 (0.0008) +[2026-06-07 00:42:03,324][344387] Updated weights for policy 0, policy_version 16549 (0.0009) +[2026-06-07 00:42:04,443][344387] Updated weights for policy 0, policy_version 16562 (0.0010) +[2026-06-07 00:42:05,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3276.8, 300 sec: 3151.9). Total num frames: 8482816. Throughput: 0: 3349.6. Samples: 8487712. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 00:42:05,260][343476] Avg episode reward: [(0, '1529.076')] +[2026-06-07 00:42:05,728][344387] Updated weights for policy 0, policy_version 16572 (0.0011) +[2026-06-07 00:42:08,944][344387] Updated weights for policy 0, policy_version 16585 (0.0009) +[2026-06-07 00:42:10,168][344387] Updated weights for policy 0, policy_version 16598 (0.0010) +[2026-06-07 00:42:10,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3310.9, 300 sec: 3144.9). Total num frames: 8499200. Throughput: 0: 3306.9. Samples: 8505774. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 00:42:10,261][343476] Avg episode reward: [(0, '1540.034')] +[2026-06-07 00:42:12,308][344387] Updated weights for policy 0, policy_version 16608 (0.0010) +[2026-06-07 00:42:14,838][344387] Updated weights for policy 0, policy_version 16624 (0.0009) +[2026-06-07 00:42:15,258][343476] Fps is (10 sec: 2867.1, 60 sec: 3310.9, 300 sec: 3131.0). Total num frames: 8511488. Throughput: 0: 3288.6. Samples: 8515610. Policy #0 lag: (min: 6.0, avg: 21.1, max: 35.0) +[2026-06-07 00:42:15,261][343476] Avg episode reward: [(0, '1317.469')] +[2026-06-07 00:42:16,203][344387] Updated weights for policy 0, policy_version 16634 (0.0008) +[2026-06-07 00:42:17,556][344387] Updated weights for policy 0, policy_version 16644 (0.0010) +[2026-06-07 00:42:20,169][344387] Updated weights for policy 0, policy_version 16659 (0.0009) +[2026-06-07 00:42:20,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3345.1, 300 sec: 3138.0). Total num frames: 8529920. Throughput: 0: 3229.5. Samples: 8535094. Policy #0 lag: (min: 6.0, avg: 21.1, max: 35.0) +[2026-06-07 00:42:20,261][343476] Avg episode reward: [(0, '1436.640')] +[2026-06-07 00:42:22,017][344387] Updated weights for policy 0, policy_version 16669 (0.0009) +[2026-06-07 00:42:24,436][344387] Updated weights for policy 0, policy_version 16684 (0.0008) +[2026-06-07 00:42:25,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3310.9, 300 sec: 3138.0). Total num frames: 8546304. Throughput: 0: 3188.1. Samples: 8554152. Policy #0 lag: (min: 11.0, avg: 22.0, max: 43.0) +[2026-06-07 00:42:25,259][343476] Avg episode reward: [(0, '1369.953')] +[2026-06-07 00:42:26,379][344387] Updated weights for policy 0, policy_version 16697 (0.0008) +[2026-06-07 00:42:27,576][344387] Updated weights for policy 0, policy_version 16707 (0.0009) +[2026-06-07 00:42:29,943][344387] Updated weights for policy 0, policy_version 16721 (0.0009) +[2026-06-07 00:42:30,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3276.8, 300 sec: 3131.0). Total num frames: 8562688. Throughput: 0: 3161.6. Samples: 8564646. Policy #0 lag: (min: 11.0, avg: 22.0, max: 43.0) +[2026-06-07 00:42:30,259][343476] Avg episode reward: [(0, '1404.594')] +[2026-06-07 00:42:31,300][344387] Updated weights for policy 0, policy_version 16731 (0.0008) +[2026-06-07 00:42:33,974][344387] Updated weights for policy 0, policy_version 16741 (0.0008) +[2026-06-07 00:42:35,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3208.5, 300 sec: 3124.1). Total num frames: 8577024. Throughput: 0: 3131.6. Samples: 8584978. Policy #0 lag: (min: 11.0, avg: 22.0, max: 43.0) +[2026-06-07 00:42:35,258][343476] Avg episode reward: [(0, '1313.955')] +[2026-06-07 00:42:36,661][344387] Updated weights for policy 0, policy_version 16761 (0.0008) +[2026-06-07 00:42:38,888][344387] Updated weights for policy 0, policy_version 16776 (0.0008) +[2026-06-07 00:42:40,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3174.4, 300 sec: 3124.1). Total num frames: 8593408. Throughput: 0: 3202.1. Samples: 8604992. Policy #0 lag: (min: 10.0, avg: 25.0, max: 38.0) +[2026-06-07 00:42:40,261][343476] Avg episode reward: [(0, '1522.715')] +[2026-06-07 00:42:40,750][344387] Updated weights for policy 0, policy_version 16791 (0.0008) +[2026-06-07 00:42:42,042][344387] Updated weights for policy 0, policy_version 16802 (0.0008) +[2026-06-07 00:42:44,156][344304] Signal inference workers to stop experience collection... (1500 times) +[2026-06-07 00:42:44,185][344387] InferenceWorker_p0-w0: stopping experience collection (1500 times) +[2026-06-07 00:42:44,298][344304] Signal inference workers to resume experience collection... (1500 times) +[2026-06-07 00:42:44,299][344387] InferenceWorker_p0-w0: resuming experience collection (1500 times) +[2026-06-07 00:42:44,408][344387] Updated weights for policy 0, policy_version 16817 (0.0009) +[2026-06-07 00:42:45,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3242.7, 300 sec: 3138.0). Total num frames: 8613888. Throughput: 0: 3237.5. Samples: 8615262. Policy #0 lag: (min: 10.0, avg: 25.0, max: 38.0) +[2026-06-07 00:42:45,259][343476] Avg episode reward: [(0, '1223.618')] +[2026-06-07 00:42:45,698][344387] Updated weights for policy 0, policy_version 16827 (0.0007) +[2026-06-07 00:42:48,633][344387] Updated weights for policy 0, policy_version 16840 (0.0010) +[2026-06-07 00:42:50,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3174.4, 300 sec: 3131.0). Total num frames: 8628224. Throughput: 0: 3277.0. Samples: 8635174. Policy #0 lag: (min: 11.0, avg: 20.5, max: 43.0) +[2026-06-07 00:42:50,258][343476] Avg episode reward: [(0, '1492.863')] +[2026-06-07 00:42:50,635][344387] Updated weights for policy 0, policy_version 16855 (0.0009) +[2026-06-07 00:42:51,841][344387] Updated weights for policy 0, policy_version 16867 (0.0009) +[2026-06-07 00:42:54,143][344387] Updated weights for policy 0, policy_version 16881 (0.0008) +[2026-06-07 00:42:55,258][343476] Fps is (10 sec: 3276.5, 60 sec: 3242.6, 300 sec: 3151.8). Total num frames: 8646656. Throughput: 0: 3328.2. Samples: 8655546. Policy #0 lag: (min: 11.0, avg: 20.5, max: 43.0) +[2026-06-07 00:42:55,263][343476] Avg episode reward: [(0, '1394.118')] +[2026-06-07 00:42:55,338][344387] Updated weights for policy 0, policy_version 16891 (0.0009) +[2026-06-07 00:42:57,949][344387] Updated weights for policy 0, policy_version 16904 (0.0011) +[2026-06-07 00:43:00,100][344387] Updated weights for policy 0, policy_version 16922 (0.0009) +[2026-06-07 00:43:00,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3310.9, 300 sec: 3158.8). Total num frames: 8665088. Throughput: 0: 3357.1. Samples: 8666678. Policy #0 lag: (min: 11.0, avg: 20.5, max: 43.0) +[2026-06-07 00:43:00,261][343476] Avg episode reward: [(0, '1442.104')] +[2026-06-07 00:43:01,510][344387] Updated weights for policy 0, policy_version 16932 (0.0010) +[2026-06-07 00:43:03,486][344387] Updated weights for policy 0, policy_version 16942 (0.0009) +[2026-06-07 00:43:04,447][344387] Updated weights for policy 0, policy_version 16952 (0.0008) +[2026-06-07 00:43:05,257][343476] Fps is (10 sec: 3481.9, 60 sec: 3310.9, 300 sec: 3158.8). Total num frames: 8681472. Throughput: 0: 3338.3. Samples: 8685314. Policy #0 lag: (min: 3.0, avg: 19.1, max: 35.0) +[2026-06-07 00:43:05,260][343476] Avg episode reward: [(0, '1395.226')] +[2026-06-07 00:43:06,371][344387] Updated weights for policy 0, policy_version 16962 (0.0011) +[2026-06-07 00:43:08,277][344387] Updated weights for policy 0, policy_version 16972 (0.0013) +[2026-06-07 00:43:10,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3276.8, 300 sec: 3151.8). Total num frames: 8695808. Throughput: 0: 3336.9. Samples: 8704312. Policy #0 lag: (min: 3.0, avg: 19.1, max: 35.0) +[2026-06-07 00:43:10,261][343476] Avg episode reward: [(0, '1412.967')] +[2026-06-07 00:43:10,583][344387] Updated weights for policy 0, policy_version 16986 (0.0008) +[2026-06-07 00:43:11,876][344387] Updated weights for policy 0, policy_version 16996 (0.0010) +[2026-06-07 00:43:13,897][344387] Updated weights for policy 0, policy_version 17006 (0.0009) +[2026-06-07 00:43:15,247][344387] Updated weights for policy 0, policy_version 17016 (0.0012) +[2026-06-07 00:43:15,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3345.1, 300 sec: 3151.8). Total num frames: 8712192. Throughput: 0: 3308.6. Samples: 8713534. Policy #0 lag: (min: 3.0, avg: 22.3, max: 43.0) +[2026-06-07 00:43:15,260][343476] Avg episode reward: [(0, '1379.470')] +[2026-06-07 00:43:17,092][344387] Updated weights for policy 0, policy_version 17028 (0.0008) +[2026-06-07 00:43:19,021][344387] Updated weights for policy 0, policy_version 17038 (0.0009) +[2026-06-07 00:43:19,943][344387] Updated weights for policy 0, policy_version 17048 (0.0007) +[2026-06-07 00:43:20,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3310.9, 300 sec: 3151.8). Total num frames: 8728576. Throughput: 0: 3280.7. Samples: 8732612. Policy #0 lag: (min: 3.0, avg: 22.3, max: 43.0) +[2026-06-07 00:43:20,262][343476] Avg episode reward: [(0, '1492.793')] +[2026-06-07 00:43:21,570][344387] Updated weights for policy 0, policy_version 17059 (0.0007) +[2026-06-07 00:43:23,409][344387] Updated weights for policy 0, policy_version 17070 (0.0009) +[2026-06-07 00:43:24,311][344387] Updated weights for policy 0, policy_version 17080 (0.0008) +[2026-06-07 00:43:25,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3345.1, 300 sec: 3151.8). Total num frames: 8747008. Throughput: 0: 3330.4. Samples: 8754858. Policy #0 lag: (min: 3.0, avg: 22.3, max: 43.0) +[2026-06-07 00:43:25,261][343476] Avg episode reward: [(0, '1320.343')] +[2026-06-07 00:43:26,200][344387] Updated weights for policy 0, policy_version 17092 (0.0007) +[2026-06-07 00:43:29,645][344387] Updated weights for policy 0, policy_version 17109 (0.0163) +[2026-06-07 00:43:30,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3345.1, 300 sec: 3151.8). Total num frames: 8763392. Throughput: 0: 3349.9. Samples: 8766008. Policy #0 lag: (min: 1.0, avg: 16.5, max: 33.0) +[2026-06-07 00:43:30,260][343476] Avg episode reward: [(0, '1567.984')] +[2026-06-07 00:43:30,894][344387] Updated weights for policy 0, policy_version 17121 (0.0009) +[2026-06-07 00:43:33,187][344387] Updated weights for policy 0, policy_version 17136 (0.0008) +[2026-06-07 00:43:34,445][344387] Updated weights for policy 0, policy_version 17148 (0.0007) +[2026-06-07 00:43:35,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3379.2, 300 sec: 3151.8). Total num frames: 8779776. Throughput: 0: 3363.0. Samples: 8786508. Policy #0 lag: (min: 1.0, avg: 16.5, max: 33.0) +[2026-06-07 00:43:35,259][343476] Avg episode reward: [(0, '1399.452')] +[2026-06-07 00:43:36,581][344387] Updated weights for policy 0, policy_version 17160 (0.0007) +[2026-06-07 00:43:38,463][344387] Updated weights for policy 0, policy_version 17174 (0.0009) +[2026-06-07 00:43:40,258][344387] Updated weights for policy 0, policy_version 17185 (0.0007) +[2026-06-07 00:43:40,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3413.3, 300 sec: 3151.8). Total num frames: 8798208. Throughput: 0: 3376.3. Samples: 8807478. Policy #0 lag: (min: 1.0, avg: 19.7, max: 37.0) +[2026-06-07 00:43:40,262][343476] Avg episode reward: [(0, '1522.672')] +[2026-06-07 00:43:41,994][344387] Updated weights for policy 0, policy_version 17197 (0.0008) +[2026-06-07 00:43:43,751][344387] Updated weights for policy 0, policy_version 17209 (0.0007) +[2026-06-07 00:43:45,234][344387] Updated weights for policy 0, policy_version 17219 (0.0007) +[2026-06-07 00:43:45,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3345.1, 300 sec: 3144.9). Total num frames: 8814592. Throughput: 0: 3352.1. Samples: 8817522. Policy #0 lag: (min: 1.0, avg: 19.7, max: 37.0) +[2026-06-07 00:43:45,261][343476] Avg episode reward: [(0, '1340.645')] +[2026-06-07 00:43:46,662][344387] Updated weights for policy 0, policy_version 17231 (0.0008) +[2026-06-07 00:43:48,374][344387] Updated weights for policy 0, policy_version 17241 (0.0007) +[2026-06-07 00:43:49,826][344387] Updated weights for policy 0, policy_version 17251 (0.0008) +[2026-06-07 00:43:50,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3413.3, 300 sec: 3151.8). Total num frames: 8833024. Throughput: 0: 3414.5. Samples: 8838968. Policy #0 lag: (min: 1.0, avg: 19.7, max: 37.0) +[2026-06-07 00:43:50,258][343476] Avg episode reward: [(0, '1475.767')] +[2026-06-07 00:43:51,451][344387] Updated weights for policy 0, policy_version 17263 (0.0011) +[2026-06-07 00:43:53,213][344387] Updated weights for policy 0, policy_version 17273 (0.0010) +[2026-06-07 00:43:54,713][344387] Updated weights for policy 0, policy_version 17283 (0.0007) +[2026-06-07 00:43:55,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3379.2, 300 sec: 3158.8). Total num frames: 8849408. Throughput: 0: 3449.0. Samples: 8859516. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 00:43:55,259][343476] Avg episode reward: [(0, '1510.477')] +[2026-06-07 00:43:56,337][344387] Updated weights for policy 0, policy_version 17295 (0.0010) +[2026-06-07 00:43:57,825][344304] Signal inference workers to stop experience collection... (1550 times) +[2026-06-07 00:43:57,826][344304] Signal inference workers to resume experience collection... (1550 times) +[2026-06-07 00:43:57,853][344387] InferenceWorker_p0-w0: stopping experience collection (1550 times) +[2026-06-07 00:43:57,853][344387] InferenceWorker_p0-w0: resuming experience collection (1550 times) +[2026-06-07 00:43:57,902][344387] Updated weights for policy 0, policy_version 17305 (0.0009) +[2026-06-07 00:43:59,623][344387] Updated weights for policy 0, policy_version 17315 (0.0007) +[2026-06-07 00:44:00,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3379.2, 300 sec: 3172.7). Total num frames: 8867840. Throughput: 0: 3465.7. Samples: 8869490. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 00:44:00,260][343476] Avg episode reward: [(0, '1506.586')] +[2026-06-07 00:44:01,045][344387] Updated weights for policy 0, policy_version 17327 (0.0008) +[2026-06-07 00:44:02,791][344387] Updated weights for policy 0, policy_version 17339 (0.0008) +[2026-06-07 00:44:04,780][344387] Updated weights for policy 0, policy_version 17349 (0.0007) +[2026-06-07 00:44:05,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3379.2, 300 sec: 3172.7). Total num frames: 8884224. Throughput: 0: 3511.3. Samples: 8890618. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 00:44:05,260][343476] Avg episode reward: [(0, '1546.798')] +[2026-06-07 00:44:06,104][344387] Updated weights for policy 0, policy_version 17361 (0.0008) +[2026-06-07 00:44:08,090][344387] Updated weights for policy 0, policy_version 17373 (0.0008) +[2026-06-07 00:44:09,636][344387] Updated weights for policy 0, policy_version 17383 (0.0008) +[2026-06-07 00:44:10,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3413.3, 300 sec: 3179.6). Total num frames: 8900608. Throughput: 0: 3476.3. Samples: 8911292. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 00:44:10,260][343476] Avg episode reward: [(0, '1468.520')] +[2026-06-07 00:44:11,022][344387] Updated weights for policy 0, policy_version 17396 (0.0009) +[2026-06-07 00:44:13,128][344387] Updated weights for policy 0, policy_version 17408 (0.0008) +[2026-06-07 00:44:15,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3413.3, 300 sec: 3186.6). Total num frames: 8916992. Throughput: 0: 3451.7. Samples: 8921336. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 00:44:15,262][343476] Avg episode reward: [(0, '1631.486')] +[2026-06-07 00:44:15,323][344387] Updated weights for policy 0, policy_version 17418 (0.0007) +[2026-06-07 00:44:17,227][344387] Updated weights for policy 0, policy_version 17434 (0.0010) +[2026-06-07 00:44:19,014][344387] Updated weights for policy 0, policy_version 17444 (0.0008) +[2026-06-07 00:44:20,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3447.5, 300 sec: 3200.4). Total num frames: 8935424. Throughput: 0: 3429.0. Samples: 8940814. Policy #0 lag: (min: 3.0, avg: 22.0, max: 35.0) +[2026-06-07 00:44:20,259][343476] Avg episode reward: [(0, '1500.158')] +[2026-06-07 00:44:20,902][344387] Updated weights for policy 0, policy_version 17460 (0.0009) +[2026-06-07 00:44:22,951][344387] Updated weights for policy 0, policy_version 17472 (0.0008) +[2026-06-07 00:44:25,076][344387] Updated weights for policy 0, policy_version 17484 (0.0009) +[2026-06-07 00:44:25,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3413.3, 300 sec: 3200.4). Total num frames: 8951808. Throughput: 0: 3429.0. Samples: 8961784. Policy #0 lag: (min: 3.0, avg: 22.0, max: 35.0) +[2026-06-07 00:44:25,261][343476] Avg episode reward: [(0, '1505.533')] +[2026-06-07 00:44:27,069][344387] Updated weights for policy 0, policy_version 17498 (0.0009) +[2026-06-07 00:44:28,586][344387] Updated weights for policy 0, policy_version 17508 (0.0008) +[2026-06-07 00:44:30,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3413.3, 300 sec: 3186.6). Total num frames: 8968192. Throughput: 0: 3414.8. Samples: 8971188. Policy #0 lag: (min: 3.0, avg: 22.0, max: 35.0) +[2026-06-07 00:44:30,259][343476] Avg episode reward: [(0, '1481.051')] +[2026-06-07 00:44:30,751][344387] Updated weights for policy 0, policy_version 17522 (0.0010) +[2026-06-07 00:44:32,636][344387] Updated weights for policy 0, policy_version 17534 (0.0008) +[2026-06-07 00:44:34,257][344387] Updated weights for policy 0, policy_version 17544 (0.0009) +[2026-06-07 00:44:35,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3413.3, 300 sec: 3186.5). Total num frames: 8984576. Throughput: 0: 3379.9. Samples: 8991066. Policy #0 lag: (min: 7.0, avg: 21.8, max: 41.0) +[2026-06-07 00:44:35,260][343476] Avg episode reward: [(0, '1322.280')] +[2026-06-07 00:44:36,960][344387] Updated weights for policy 0, policy_version 17560 (0.0011) +[2026-06-07 00:44:38,724][344387] Updated weights for policy 0, policy_version 17570 (0.0008) +[2026-06-07 00:44:40,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3379.2, 300 sec: 3179.6). Total num frames: 9000960. Throughput: 0: 3361.6. Samples: 9010786. Policy #0 lag: (min: 7.0, avg: 21.8, max: 41.0) +[2026-06-07 00:44:40,259][343476] Avg episode reward: [(0, '1332.305')] +[2026-06-07 00:44:40,580][344387] Updated weights for policy 0, policy_version 17584 (0.0011) +[2026-06-07 00:44:42,715][344387] Updated weights for policy 0, policy_version 17596 (0.0012) +[2026-06-07 00:44:44,402][344387] Updated weights for policy 0, policy_version 17606 (0.0009) +[2026-06-07 00:44:45,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3345.1, 300 sec: 3179.6). Total num frames: 9015296. Throughput: 0: 3339.9. Samples: 9019784. Policy #0 lag: (min: 4.0, avg: 20.0, max: 33.0) +[2026-06-07 00:44:45,260][343476] Avg episode reward: [(0, '1457.345')] +[2026-06-07 00:44:45,907][344387] Updated weights for policy 0, policy_version 17618 (0.0009) +[2026-06-07 00:44:48,135][344387] Updated weights for policy 0, policy_version 17629 (0.0010) +[2026-06-07 00:44:50,258][343476] Fps is (10 sec: 2867.2, 60 sec: 3276.8, 300 sec: 3179.6). Total num frames: 9029632. Throughput: 0: 3258.5. Samples: 9037250. Policy #0 lag: (min: 4.0, avg: 20.0, max: 33.0) +[2026-06-07 00:44:50,260][343476] Avg episode reward: [(0, '1440.212')] +[2026-06-07 00:44:50,301][344387] Updated weights for policy 0, policy_version 17639 (0.0010) +[2026-06-07 00:44:51,553][344387] Updated weights for policy 0, policy_version 17651 (0.0008) +[2026-06-07 00:44:53,870][344387] Updated weights for policy 0, policy_version 17661 (0.0008) +[2026-06-07 00:44:55,258][343476] Fps is (10 sec: 3071.8, 60 sec: 3276.8, 300 sec: 3179.6). Total num frames: 9046016. Throughput: 0: 3188.7. Samples: 9054784. Policy #0 lag: (min: 4.0, avg: 20.0, max: 33.0) +[2026-06-07 00:44:55,260][343476] Avg episode reward: [(0, '1466.108')] +[2026-06-07 00:44:55,876][344387] Updated weights for policy 0, policy_version 17671 (0.0010) +[2026-06-07 00:44:58,532][344387] Updated weights for policy 0, policy_version 17685 (0.0009) +[2026-06-07 00:45:00,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3208.5, 300 sec: 3172.7). Total num frames: 9060352. Throughput: 0: 3167.7. Samples: 9063882. Policy #0 lag: (min: 4.0, avg: 19.1, max: 38.0) +[2026-06-07 00:45:00,259][343476] Avg episode reward: [(0, '1410.352')] +[2026-06-07 00:45:00,458][344387] Updated weights for policy 0, policy_version 17697 (0.0009) +[2026-06-07 00:45:02,487][344387] Updated weights for policy 0, policy_version 17709 (0.0010) +[2026-06-07 00:45:04,230][344387] Updated weights for policy 0, policy_version 17723 (0.0011) +[2026-06-07 00:45:05,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3208.5, 300 sec: 3179.6). Total num frames: 9076736. Throughput: 0: 3155.1. Samples: 9082794. Policy #0 lag: (min: 4.0, avg: 19.1, max: 38.0) +[2026-06-07 00:45:05,260][343476] Avg episode reward: [(0, '1318.702')] +[2026-06-07 00:45:06,240][344387] Updated weights for policy 0, policy_version 17733 (0.0008) +[2026-06-07 00:45:07,576][344387] Updated weights for policy 0, policy_version 17744 (0.0014) +[2026-06-07 00:45:09,895][344387] Updated weights for policy 0, policy_version 17758 (0.0011) +[2026-06-07 00:45:10,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3208.5, 300 sec: 3179.6). Total num frames: 9093120. Throughput: 0: 3107.2. Samples: 9101606. Policy #0 lag: (min: 8.0, avg: 22.5, max: 40.0) +[2026-06-07 00:45:10,259][343476] Avg episode reward: [(0, '1519.622')] +[2026-06-07 00:45:11,887][344387] Updated weights for policy 0, policy_version 17768 (0.0013) +[2026-06-07 00:45:13,055][344304] Signal inference workers to stop experience collection... (1600 times) +[2026-06-07 00:45:13,078][344387] InferenceWorker_p0-w0: stopping experience collection (1600 times) +[2026-06-07 00:45:13,201][344304] Signal inference workers to resume experience collection... (1600 times) +[2026-06-07 00:45:13,202][344387] InferenceWorker_p0-w0: resuming experience collection (1600 times) +[2026-06-07 00:45:13,458][344387] Updated weights for policy 0, policy_version 17780 (0.0009) +[2026-06-07 00:45:15,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3174.4, 300 sec: 3172.7). Total num frames: 9107456. Throughput: 0: 3084.0. Samples: 9109966. Policy #0 lag: (min: 8.0, avg: 22.5, max: 40.0) +[2026-06-07 00:45:15,260][343476] Avg episode reward: [(0, '1428.870')] +[2026-06-07 00:45:16,599][344387] Updated weights for policy 0, policy_version 17793 (0.0010) +[2026-06-07 00:45:18,317][344387] Updated weights for policy 0, policy_version 17804 (0.0010) +[2026-06-07 00:45:20,257][343476] Fps is (10 sec: 2662.4, 60 sec: 3072.0, 300 sec: 3172.7). Total num frames: 9119744. Throughput: 0: 3039.8. Samples: 9127858. Policy #0 lag: (min: 8.0, avg: 22.5, max: 40.0) +[2026-06-07 00:45:20,259][343476] Avg episode reward: [(0, '1495.884')] +[2026-06-07 00:45:20,431][344387] Updated weights for policy 0, policy_version 17818 (0.0010) +[2026-06-07 00:45:22,112][344387] Updated weights for policy 0, policy_version 17828 (0.0008) +[2026-06-07 00:45:23,930][344387] Updated weights for policy 0, policy_version 17840 (0.0012) +[2026-06-07 00:45:25,258][343476] Fps is (10 sec: 2867.2, 60 sec: 3072.0, 300 sec: 3193.5). Total num frames: 9136128. Throughput: 0: 3003.9. Samples: 9145962. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:45:25,264][343476] Avg episode reward: [(0, '1375.048')] +[2026-06-07 00:45:25,799][344387] Updated weights for policy 0, policy_version 17851 (0.0011) +[2026-06-07 00:45:28,283][344387] Updated weights for policy 0, policy_version 17861 (0.0010) +[2026-06-07 00:45:29,766][344387] Updated weights for policy 0, policy_version 17876 (0.0010) +[2026-06-07 00:45:30,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3072.0, 300 sec: 3207.4). Total num frames: 9152512. Throughput: 0: 2998.7. Samples: 9154724. Policy #0 lag: (min: 3.0, avg: 20.3, max: 35.0) +[2026-06-07 00:45:30,260][343476] Avg episode reward: [(0, '1387.773')] +[2026-06-07 00:45:32,013][344387] Updated weights for policy 0, policy_version 17887 (0.0009) +[2026-06-07 00:45:33,895][344387] Updated weights for policy 0, policy_version 17897 (0.0012) +[2026-06-07 00:45:35,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3072.0, 300 sec: 3214.3). Total num frames: 9168896. Throughput: 0: 3036.2. Samples: 9173880. Policy #0 lag: (min: 8.0, avg: 21.8, max: 37.0) +[2026-06-07 00:45:35,262][343476] Avg episode reward: [(0, '1530.032')] +[2026-06-07 00:45:36,182][344387] Updated weights for policy 0, policy_version 17912 (0.0010) +[2026-06-07 00:45:37,929][344387] Updated weights for policy 0, policy_version 17923 (0.0012) +[2026-06-07 00:45:40,051][344387] Updated weights for policy 0, policy_version 17933 (0.0008) +[2026-06-07 00:45:40,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3037.9, 300 sec: 3214.3). Total num frames: 9183232. Throughput: 0: 3044.2. Samples: 9191774. Policy #0 lag: (min: 8.0, avg: 21.8, max: 37.0) +[2026-06-07 00:45:40,261][343476] Avg episode reward: [(0, '1514.774')] +[2026-06-07 00:45:41,602][344387] Updated weights for policy 0, policy_version 17945 (0.0010) +[2026-06-07 00:45:43,362][344387] Updated weights for policy 0, policy_version 17955 (0.0013) +[2026-06-07 00:45:45,112][344387] Updated weights for policy 0, policy_version 17965 (0.0008) +[2026-06-07 00:45:45,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3072.0, 300 sec: 3235.1). Total num frames: 9199616. Throughput: 0: 3048.3. Samples: 9201058. Policy #0 lag: (min: 8.0, avg: 21.8, max: 37.0) +[2026-06-07 00:45:45,259][343476] Avg episode reward: [(0, '1284.707')] +[2026-06-07 00:45:46,750][344387] Updated weights for policy 0, policy_version 17977 (0.0008) +[2026-06-07 00:45:47,993][344387] Updated weights for policy 0, policy_version 17987 (0.0008) +[2026-06-07 00:45:49,725][344387] Updated weights for policy 0, policy_version 17997 (0.0008) +[2026-06-07 00:45:50,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3140.3, 300 sec: 3249.0). Total num frames: 9218048. Throughput: 0: 3095.2. Samples: 9222076. Policy #0 lag: (min: 3.0, avg: 20.4, max: 35.0) +[2026-06-07 00:45:50,260][343476] Avg episode reward: [(0, '1571.749')] +[2026-06-07 00:45:51,379][344387] Updated weights for policy 0, policy_version 18009 (0.0009) +[2026-06-07 00:45:52,896][344387] Updated weights for policy 0, policy_version 18019 (0.0008) +[2026-06-07 00:45:54,783][344387] Updated weights for policy 0, policy_version 18029 (0.0008) +[2026-06-07 00:45:55,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3140.3, 300 sec: 3262.9). Total num frames: 9234432. Throughput: 0: 3122.1. Samples: 9242100. Policy #0 lag: (min: 3.0, avg: 20.4, max: 35.0) +[2026-06-07 00:45:55,259][343476] Avg episode reward: [(0, '1335.629')] +[2026-06-07 00:45:56,512][344387] Updated weights for policy 0, policy_version 18043 (0.0009) +[2026-06-07 00:45:59,241][344387] Updated weights for policy 0, policy_version 18053 (0.0011) +[2026-06-07 00:46:00,257][343476] Fps is (10 sec: 2867.2, 60 sec: 3106.1, 300 sec: 3256.0). Total num frames: 9246720. Throughput: 0: 3129.7. Samples: 9250804. Policy #0 lag: (min: 3.0, avg: 20.4, max: 35.0) +[2026-06-07 00:46:00,261][343476] Avg episode reward: [(0, '1495.217')] +[2026-06-07 00:46:00,979][344387] Updated weights for policy 0, policy_version 18068 (0.0009) +[2026-06-07 00:46:03,075][344387] Updated weights for policy 0, policy_version 18079 (0.0009) +[2026-06-07 00:46:04,803][344387] Updated weights for policy 0, policy_version 18089 (0.0008) +[2026-06-07 00:46:05,258][343476] Fps is (10 sec: 2866.9, 60 sec: 3106.1, 300 sec: 3262.9). Total num frames: 9263104. Throughput: 0: 3131.5. Samples: 9268778. Policy #0 lag: (min: 4.0, avg: 18.7, max: 36.0) +[2026-06-07 00:46:05,261][343476] Avg episode reward: [(0, '1456.938')] +[2026-06-07 00:46:06,985][344387] Updated weights for policy 0, policy_version 18101 (0.0010) +[2026-06-07 00:46:08,822][344387] Updated weights for policy 0, policy_version 18114 (0.0011) +[2026-06-07 00:46:10,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3037.9, 300 sec: 3262.9). Total num frames: 9275392. Throughput: 0: 3137.0. Samples: 9287126. Policy #0 lag: (min: 4.0, avg: 18.7, max: 36.0) +[2026-06-07 00:46:10,259][343476] Avg episode reward: [(0, '1409.074')] +[2026-06-07 00:46:11,151][344387] Updated weights for policy 0, policy_version 18125 (0.0009) +[2026-06-07 00:46:12,700][344387] Updated weights for policy 0, policy_version 18137 (0.0009) +[2026-06-07 00:46:14,398][344387] Updated weights for policy 0, policy_version 18147 (0.0011) +[2026-06-07 00:46:15,257][343476] Fps is (10 sec: 2867.4, 60 sec: 3072.0, 300 sec: 3262.9). Total num frames: 9291776. Throughput: 0: 3140.5. Samples: 9296048. Policy #0 lag: (min: 3.0, avg: 21.1, max: 35.0) +[2026-06-07 00:46:15,259][343476] Avg episode reward: [(0, '1363.042')] +[2026-06-07 00:46:16,931][344387] Updated weights for policy 0, policy_version 18157 (0.0009) +[2026-06-07 00:46:18,808][344387] Updated weights for policy 0, policy_version 18169 (0.0012) +[2026-06-07 00:46:20,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3106.1, 300 sec: 3249.0). Total num frames: 9306112. Throughput: 0: 3070.1. Samples: 9312034. Policy #0 lag: (min: 3.0, avg: 21.1, max: 35.0) +[2026-06-07 00:46:20,260][343476] Avg episode reward: [(0, '1485.205')] +[2026-06-07 00:46:20,612][344387] Updated weights for policy 0, policy_version 18179 (0.0009) +[2026-06-07 00:46:23,312][344387] Updated weights for policy 0, policy_version 18189 (0.0011) +[2026-06-07 00:46:24,919][344387] Updated weights for policy 0, policy_version 18200 (0.0010) +[2026-06-07 00:46:25,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3072.0, 300 sec: 3235.1). Total num frames: 9320448. Throughput: 0: 3025.2. Samples: 9327906. Policy #0 lag: (min: 3.0, avg: 21.1, max: 35.0) +[2026-06-07 00:46:25,259][343476] Avg episode reward: [(0, '1710.055')] +[2026-06-07 00:46:25,265][344304] Saving new best policy, reward=1710.055! +[2026-06-07 00:46:26,572][344387] Updated weights for policy 0, policy_version 18210 (0.0011) +[2026-06-07 00:46:28,242][344387] Updated weights for policy 0, policy_version 18220 (0.0010) +[2026-06-07 00:46:30,085][344387] Updated weights for policy 0, policy_version 18234 (0.0011) +[2026-06-07 00:46:30,257][343476] Fps is (10 sec: 3072.0, 60 sec: 3072.0, 300 sec: 3228.2). Total num frames: 9336832. Throughput: 0: 3039.7. Samples: 9337844. Policy #0 lag: (min: 1.0, avg: 18.2, max: 33.0) +[2026-06-07 00:46:30,259][343476] Avg episode reward: [(0, '1473.365')] +[2026-06-07 00:46:31,589][344387] Updated weights for policy 0, policy_version 18244 (0.0009) +[2026-06-07 00:46:33,586][344387] Updated weights for policy 0, policy_version 18256 (0.0010) +[2026-06-07 00:46:35,206][344387] Updated weights for policy 0, policy_version 18268 (0.0010) +[2026-06-07 00:46:35,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3072.0, 300 sec: 3221.3). Total num frames: 9353216. Throughput: 0: 3003.0. Samples: 9357210. Policy #0 lag: (min: 1.0, avg: 18.2, max: 33.0) +[2026-06-07 00:46:35,259][343476] Avg episode reward: [(0, '1521.822')] +[2026-06-07 00:46:37,707][344387] Updated weights for policy 0, policy_version 18279 (0.0011) +[2026-06-07 00:46:39,323][344387] Updated weights for policy 0, policy_version 18291 (0.0009) +[2026-06-07 00:46:40,257][343476] Fps is (10 sec: 2867.1, 60 sec: 3037.9, 300 sec: 3207.4). Total num frames: 9365504. Throughput: 0: 2973.0. Samples: 9375886. Policy #0 lag: (min: 6.0, avg: 22.2, max: 38.0) +[2026-06-07 00:46:40,260][343476] Avg episode reward: [(0, '1386.234')] +[2026-06-07 00:46:41,311][344387] Updated weights for policy 0, policy_version 18302 (0.0008) +[2026-06-07 00:46:41,604][344304] Signal inference workers to stop experience collection... (1650 times) +[2026-06-07 00:46:41,634][344387] InferenceWorker_p0-w0: stopping experience collection (1650 times) +[2026-06-07 00:46:41,639][344304] Signal inference workers to resume experience collection... (1650 times) +[2026-06-07 00:46:41,659][344387] InferenceWorker_p0-w0: resuming experience collection (1650 times) +[2026-06-07 00:46:43,000][344387] Updated weights for policy 0, policy_version 18312 (0.0010) +[2026-06-07 00:46:44,280][344387] Updated weights for policy 0, policy_version 18324 (0.0011) +[2026-06-07 00:46:45,258][343476] Fps is (10 sec: 2867.0, 60 sec: 3037.8, 300 sec: 3200.4). Total num frames: 9381888. Throughput: 0: 3016.0. Samples: 9386524. Policy #0 lag: (min: 6.0, avg: 22.2, max: 38.0) +[2026-06-07 00:46:45,262][343476] Avg episode reward: [(0, '1259.831')] +[2026-06-07 00:46:46,765][344387] Updated weights for policy 0, policy_version 18335 (0.0008) +[2026-06-07 00:46:48,594][344387] Updated weights for policy 0, policy_version 18347 (0.0009) +[2026-06-07 00:46:50,257][343476] Fps is (10 sec: 3277.0, 60 sec: 3003.8, 300 sec: 3207.4). Total num frames: 9398272. Throughput: 0: 3007.2. Samples: 9404098. Policy #0 lag: (min: 6.0, avg: 22.2, max: 38.0) +[2026-06-07 00:46:50,259][343476] Avg episode reward: [(0, '1508.111')] +[2026-06-07 00:46:51,397][344387] Updated weights for policy 0, policy_version 18361 (0.0012) +[2026-06-07 00:46:52,766][344387] Updated weights for policy 0, policy_version 18371 (0.0008) +[2026-06-07 00:46:54,677][344387] Updated weights for policy 0, policy_version 18384 (0.0008) +[2026-06-07 00:46:55,257][343476] Fps is (10 sec: 3277.1, 60 sec: 3003.7, 300 sec: 3214.3). Total num frames: 9414656. Throughput: 0: 3010.0. Samples: 9422574. Policy #0 lag: (min: 5.0, avg: 22.6, max: 42.0) +[2026-06-07 00:46:55,260][343476] Avg episode reward: [(0, '1421.518')] +[2026-06-07 00:46:56,131][344387] Updated weights for policy 0, policy_version 18396 (0.0010) +[2026-06-07 00:46:58,655][344387] Updated weights for policy 0, policy_version 18408 (0.0010) +[2026-06-07 00:46:59,818][344387] Updated weights for policy 0, policy_version 18420 (0.0013) +[2026-06-07 00:47:00,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3072.0, 300 sec: 3214.3). Total num frames: 9431040. Throughput: 0: 3043.7. Samples: 9433016. Policy #0 lag: (min: 5.0, avg: 22.6, max: 42.0) +[2026-06-07 00:47:00,260][343476] Avg episode reward: [(0, '1423.626')] +[2026-06-07 00:47:02,620][344387] Updated weights for policy 0, policy_version 18432 (0.0010) +[2026-06-07 00:47:04,319][344387] Updated weights for policy 0, policy_version 18442 (0.0012) +[2026-06-07 00:47:05,257][343476] Fps is (10 sec: 2867.2, 60 sec: 3003.8, 300 sec: 3200.4). Total num frames: 9443328. Throughput: 0: 3082.9. Samples: 9450766. Policy #0 lag: (min: 5.0, avg: 22.6, max: 42.0) +[2026-06-07 00:47:05,259][343476] Avg episode reward: [(0, '1447.844')] +[2026-06-07 00:47:06,325][344387] Updated weights for policy 0, policy_version 18456 (0.0009) +[2026-06-07 00:47:08,311][344387] Updated weights for policy 0, policy_version 18466 (0.0008) +[2026-06-07 00:47:09,610][344387] Updated weights for policy 0, policy_version 18476 (0.0008) +[2026-06-07 00:47:10,257][343476] Fps is (10 sec: 2867.2, 60 sec: 3072.0, 300 sec: 3214.3). Total num frames: 9459712. Throughput: 0: 3159.6. Samples: 9470088. Policy #0 lag: (min: 3.0, avg: 19.5, max: 36.0) +[2026-06-07 00:47:10,259][343476] Avg episode reward: [(0, '1529.584')] +[2026-06-07 00:47:11,927][344387] Updated weights for policy 0, policy_version 18489 (0.0010) +[2026-06-07 00:47:13,480][344387] Updated weights for policy 0, policy_version 18499 (0.0007) +[2026-06-07 00:47:15,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3072.0, 300 sec: 3207.4). Total num frames: 9476096. Throughput: 0: 3158.0. Samples: 9479954. Policy #0 lag: (min: 3.0, avg: 19.5, max: 36.0) +[2026-06-07 00:47:15,261][343476] Avg episode reward: [(0, '1517.683')] +[2026-06-07 00:47:15,448][344387] Updated weights for policy 0, policy_version 18512 (0.0011) +[2026-06-07 00:47:16,806][344387] Updated weights for policy 0, policy_version 18523 (0.0008) +[2026-06-07 00:47:18,555][344387] Updated weights for policy 0, policy_version 18533 (0.0007) +[2026-06-07 00:47:20,151][344387] Updated weights for policy 0, policy_version 18545 (0.0009) +[2026-06-07 00:47:20,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3140.3, 300 sec: 3214.3). Total num frames: 9494528. Throughput: 0: 3185.4. Samples: 9500554. Policy #0 lag: (min: 3.0, avg: 21.1, max: 39.0) +[2026-06-07 00:47:20,260][343476] Avg episode reward: [(0, '1512.832')] +[2026-06-07 00:47:22,329][344387] Updated weights for policy 0, policy_version 18557 (0.0010) +[2026-06-07 00:47:23,723][344387] Updated weights for policy 0, policy_version 18567 (0.0008) +[2026-06-07 00:47:24,873][344387] Updated weights for policy 0, policy_version 18577 (0.0009) +[2026-06-07 00:47:25,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3208.5, 300 sec: 3221.3). Total num frames: 9512960. Throughput: 0: 3226.9. Samples: 9521094. Policy #0 lag: (min: 3.0, avg: 21.1, max: 39.0) +[2026-06-07 00:47:25,266][343476] Avg episode reward: [(0, '1341.732')] +[2026-06-07 00:47:27,190][344387] Updated weights for policy 0, policy_version 18589 (0.0012) +[2026-06-07 00:47:28,883][344387] Updated weights for policy 0, policy_version 18600 (0.0010) +[2026-06-07 00:47:29,918][344387] Updated weights for policy 0, policy_version 18611 (0.0010) +[2026-06-07 00:47:30,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3208.5, 300 sec: 3228.2). Total num frames: 9529344. Throughput: 0: 3203.8. Samples: 9530694. Policy #0 lag: (min: 3.0, avg: 21.1, max: 39.0) +[2026-06-07 00:47:30,259][343476] Avg episode reward: [(0, '1477.785')] +[2026-06-07 00:47:32,630][344387] Updated weights for policy 0, policy_version 18621 (0.0009) +[2026-06-07 00:47:34,415][344387] Updated weights for policy 0, policy_version 18633 (0.0009) +[2026-06-07 00:47:35,258][343476] Fps is (10 sec: 3072.0, 60 sec: 3174.4, 300 sec: 3221.3). Total num frames: 9543680. Throughput: 0: 3213.2. Samples: 9548692. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 00:47:35,261][343476] Avg episode reward: [(0, '1529.114')] +[2026-06-07 00:47:35,487][344387] Updated weights for policy 0, policy_version 18643 (0.0007) +[2026-06-07 00:47:37,619][344387] Updated weights for policy 0, policy_version 18655 (0.0009) +[2026-06-07 00:47:39,309][344387] Updated weights for policy 0, policy_version 18668 (0.0010) +[2026-06-07 00:47:40,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3242.7, 300 sec: 3207.4). Total num frames: 9560064. Throughput: 0: 3256.2. Samples: 9569102. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 00:47:40,259][343476] Avg episode reward: [(0, '1308.258')] +[2026-06-07 00:47:41,432][344387] Updated weights for policy 0, policy_version 18681 (0.0009) +[2026-06-07 00:47:43,698][344387] Updated weights for policy 0, policy_version 18693 (0.0009) +[2026-06-07 00:47:45,117][344387] Updated weights for policy 0, policy_version 18706 (0.0009) +[2026-06-07 00:47:45,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3276.8, 300 sec: 3221.3). Total num frames: 9578496. Throughput: 0: 3266.4. Samples: 9580006. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 00:47:45,261][343476] Avg episode reward: [(0, '1420.678')] +[2026-06-07 00:47:47,231][344387] Updated weights for policy 0, policy_version 18719 (0.0009) +[2026-06-07 00:47:49,242][344387] Updated weights for policy 0, policy_version 18733 (0.0010) +[2026-06-07 00:47:50,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3276.8, 300 sec: 3214.3). Total num frames: 9594880. Throughput: 0: 3309.9. Samples: 9599712. Policy #0 lag: (min: 4.0, avg: 22.7, max: 36.0) +[2026-06-07 00:47:50,262][343476] Avg episode reward: [(0, '1614.091')] +[2026-06-07 00:47:50,735][344387] Updated weights for policy 0, policy_version 18745 (0.0007) +[2026-06-07 00:47:53,109][344304] Signal inference workers to stop experience collection... (1700 times) +[2026-06-07 00:47:53,133][344387] InferenceWorker_p0-w0: stopping experience collection (1700 times) +[2026-06-07 00:47:53,248][344304] Signal inference workers to resume experience collection... (1700 times) +[2026-06-07 00:47:53,249][344387] InferenceWorker_p0-w0: resuming experience collection (1700 times) +[2026-06-07 00:47:53,855][344387] Updated weights for policy 0, policy_version 18760 (0.0009) +[2026-06-07 00:47:55,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3242.7, 300 sec: 3200.4). Total num frames: 9609216. Throughput: 0: 3344.3. Samples: 9620580. Policy #0 lag: (min: 4.0, avg: 22.7, max: 36.0) +[2026-06-07 00:47:55,260][343476] Avg episode reward: [(0, '1763.102')] +[2026-06-07 00:47:55,622][344304] Saving new best policy, reward=1763.102! +[2026-06-07 00:47:56,467][344387] Updated weights for policy 0, policy_version 18779 (0.0008) +[2026-06-07 00:47:58,579][344387] Updated weights for policy 0, policy_version 18793 (0.0009) +[2026-06-07 00:47:59,955][344387] Updated weights for policy 0, policy_version 18804 (0.0010) +[2026-06-07 00:48:00,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3276.8, 300 sec: 3207.4). Total num frames: 9627648. Throughput: 0: 3346.7. Samples: 9630558. Policy #0 lag: (min: 1.0, avg: 23.1, max: 41.0) +[2026-06-07 00:48:00,261][343476] Avg episode reward: [(0, '1626.022')] +[2026-06-07 00:48:02,623][344387] Updated weights for policy 0, policy_version 18814 (0.0011) +[2026-06-07 00:48:04,728][344387] Updated weights for policy 0, policy_version 18827 (0.0009) +[2026-06-07 00:48:05,258][343476] Fps is (10 sec: 3071.9, 60 sec: 3276.8, 300 sec: 3200.4). Total num frames: 9639936. Throughput: 0: 3245.3. Samples: 9646594. Policy #0 lag: (min: 1.0, avg: 23.1, max: 41.0) +[2026-06-07 00:48:05,261][343476] Avg episode reward: [(0, '1409.460')] +[2026-06-07 00:48:06,218][344387] Updated weights for policy 0, policy_version 18838 (0.0008) +[2026-06-07 00:48:07,951][344387] Updated weights for policy 0, policy_version 18848 (0.0008) +[2026-06-07 00:48:10,060][344387] Updated weights for policy 0, policy_version 18862 (0.0008) +[2026-06-07 00:48:10,257][343476] Fps is (10 sec: 2867.3, 60 sec: 3276.8, 300 sec: 3200.4). Total num frames: 9656320. Throughput: 0: 3234.9. Samples: 9666664. Policy #0 lag: (min: 1.0, avg: 23.1, max: 41.0) +[2026-06-07 00:48:10,261][343476] Avg episode reward: [(0, '1479.057')] +[2026-06-07 00:48:11,449][344387] Updated weights for policy 0, policy_version 18874 (0.0010) +[2026-06-07 00:48:14,124][344387] Updated weights for policy 0, policy_version 18886 (0.0008) +[2026-06-07 00:48:15,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3310.9, 300 sec: 3207.4). Total num frames: 9674752. Throughput: 0: 3255.2. Samples: 9677178. Policy #0 lag: (min: 2.0, avg: 24.2, max: 39.0) +[2026-06-07 00:48:15,260][343476] Avg episode reward: [(0, '1363.690')] +[2026-06-07 00:48:15,316][344387] Updated weights for policy 0, policy_version 18898 (0.0009) +[2026-06-07 00:48:16,394][344387] Updated weights for policy 0, policy_version 18908 (0.0007) +[2026-06-07 00:48:19,391][344387] Updated weights for policy 0, policy_version 18921 (0.0007) +[2026-06-07 00:48:20,258][343476] Fps is (10 sec: 3481.3, 60 sec: 3276.8, 300 sec: 3200.4). Total num frames: 9691136. Throughput: 0: 3317.7. Samples: 9697992. Policy #0 lag: (min: 2.0, avg: 24.2, max: 39.0) +[2026-06-07 00:48:20,263][343476] Avg episode reward: [(0, '1487.710')] +[2026-06-07 00:48:21,506][344387] Updated weights for policy 0, policy_version 18938 (0.0009) +[2026-06-07 00:48:23,062][344387] Updated weights for policy 0, policy_version 18948 (0.0007) +[2026-06-07 00:48:24,238][344387] Updated weights for policy 0, policy_version 18958 (0.0007) +[2026-06-07 00:48:25,211][344387] Updated weights for policy 0, policy_version 18968 (0.0009) +[2026-06-07 00:48:25,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3310.9, 300 sec: 3214.3). Total num frames: 9711616. Throughput: 0: 3321.4. Samples: 9718566. Policy #0 lag: (min: 2.0, avg: 24.2, max: 39.0) +[2026-06-07 00:48:25,262][343476] Avg episode reward: [(0, '1494.565')] +[2026-06-07 00:48:28,053][344387] Updated weights for policy 0, policy_version 18981 (0.0007) +[2026-06-07 00:48:29,605][344387] Updated weights for policy 0, policy_version 18993 (0.0008) +[2026-06-07 00:48:30,257][343476] Fps is (10 sec: 3481.9, 60 sec: 3276.8, 300 sec: 3207.4). Total num frames: 9725952. Throughput: 0: 3315.7. Samples: 9729212. Policy #0 lag: (min: 2.0, avg: 23.5, max: 45.0) +[2026-06-07 00:48:30,259][343476] Avg episode reward: [(0, '1465.292')] +[2026-06-07 00:48:30,548][344387] Updated weights for policy 0, policy_version 19004 (0.0010) +[2026-06-07 00:48:33,318][344387] Updated weights for policy 0, policy_version 19014 (0.0011) +[2026-06-07 00:48:34,420][344387] Updated weights for policy 0, policy_version 19024 (0.0014) +[2026-06-07 00:48:35,257][343476] Fps is (10 sec: 3072.2, 60 sec: 3310.9, 300 sec: 3200.4). Total num frames: 9742336. Throughput: 0: 3279.7. Samples: 9747296. Policy #0 lag: (min: 2.0, avg: 23.5, max: 45.0) +[2026-06-07 00:48:35,260][343476] Avg episode reward: [(0, '1564.960')] +[2026-06-07 00:48:36,380][344387] Updated weights for policy 0, policy_version 19034 (0.0011) +[2026-06-07 00:48:39,150][344387] Updated weights for policy 0, policy_version 19044 (0.0011) +[2026-06-07 00:48:40,258][343476] Fps is (10 sec: 2662.4, 60 sec: 3208.5, 300 sec: 3179.6). Total num frames: 9752576. Throughput: 0: 3158.4. Samples: 9762710. Policy #0 lag: (min: 2.0, avg: 23.5, max: 45.0) +[2026-06-07 00:48:40,261][343476] Avg episode reward: [(0, '1479.206')] +[2026-06-07 00:48:41,238][344387] Updated weights for policy 0, policy_version 19056 (0.0011) +[2026-06-07 00:48:42,363][344387] Updated weights for policy 0, policy_version 19066 (0.0008) +[2026-06-07 00:48:44,848][344387] Updated weights for policy 0, policy_version 19077 (0.0014) +[2026-06-07 00:48:45,257][343476] Fps is (10 sec: 2662.4, 60 sec: 3174.4, 300 sec: 3172.7). Total num frames: 9768960. Throughput: 0: 3147.3. Samples: 9772186. Policy #0 lag: (min: 1.0, avg: 16.2, max: 34.0) +[2026-06-07 00:48:45,259][343476] Avg episode reward: [(0, '1468.225')] +[2026-06-07 00:48:46,250][344387] Updated weights for policy 0, policy_version 19088 (0.0009) +[2026-06-07 00:48:47,672][344387] Updated weights for policy 0, policy_version 19098 (0.0010) +[2026-06-07 00:48:50,258][343476] Fps is (10 sec: 2867.2, 60 sec: 3106.1, 300 sec: 3158.8). Total num frames: 9781248. Throughput: 0: 3192.6. Samples: 9790262. Policy #0 lag: (min: 1.0, avg: 16.2, max: 34.0) +[2026-06-07 00:48:50,262][343476] Avg episode reward: [(0, '1564.732')] +[2026-06-07 00:48:50,614][344387] Updated weights for policy 0, policy_version 19109 (0.0008) +[2026-06-07 00:48:52,675][344387] Updated weights for policy 0, policy_version 19124 (0.0010) +[2026-06-07 00:48:54,168][344387] Updated weights for policy 0, policy_version 19136 (0.0010) +[2026-06-07 00:48:55,258][343476] Fps is (10 sec: 3071.7, 60 sec: 3174.4, 300 sec: 3158.8). Total num frames: 9799680. Throughput: 0: 3178.8. Samples: 9809712. Policy #0 lag: (min: 8.0, avg: 23.5, max: 36.0) +[2026-06-07 00:48:55,264][343476] Avg episode reward: [(0, '1475.055')] +[2026-06-07 00:48:55,272][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000019140_9799680.pth... +[2026-06-07 00:48:55,931][344387] Updated weights for policy 0, policy_version 19146 (0.0008) +[2026-06-07 00:48:57,322][344387] Updated weights for policy 0, policy_version 19157 (0.0009) +[2026-06-07 00:48:58,895][344387] Updated weights for policy 0, policy_version 19167 (0.0008) +[2026-06-07 00:49:00,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3140.3, 300 sec: 3158.8). Total num frames: 9816064. Throughput: 0: 3161.6. Samples: 9819450. Policy #0 lag: (min: 8.0, avg: 23.5, max: 36.0) +[2026-06-07 00:49:00,258][343476] Avg episode reward: [(0, '1256.815')] +[2026-06-07 00:49:00,668][344304] Signal inference workers to stop experience collection... (1750 times) +[2026-06-07 00:49:00,698][344387] InferenceWorker_p0-w0: stopping experience collection (1750 times) +[2026-06-07 00:49:00,776][344304] Signal inference workers to resume experience collection... (1750 times) +[2026-06-07 00:49:00,776][344387] InferenceWorker_p0-w0: resuming experience collection (1750 times) +[2026-06-07 00:49:01,295][344387] Updated weights for policy 0, policy_version 19180 (0.0009) +[2026-06-07 00:49:02,476][344387] Updated weights for policy 0, policy_version 19192 (0.0009) +[2026-06-07 00:49:04,785][344387] Updated weights for policy 0, policy_version 19202 (0.0009) +[2026-06-07 00:49:05,258][343476] Fps is (10 sec: 3277.0, 60 sec: 3208.5, 300 sec: 3158.8). Total num frames: 9832448. Throughput: 0: 3138.4. Samples: 9839218. Policy #0 lag: (min: 8.0, avg: 23.5, max: 36.0) +[2026-06-07 00:49:05,261][343476] Avg episode reward: [(0, '1532.097')] +[2026-06-07 00:49:06,642][344387] Updated weights for policy 0, policy_version 19216 (0.0010) +[2026-06-07 00:49:07,776][344387] Updated weights for policy 0, policy_version 19226 (0.0008) +[2026-06-07 00:49:09,626][344387] Updated weights for policy 0, policy_version 19236 (0.0009) +[2026-06-07 00:49:10,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3208.5, 300 sec: 3158.8). Total num frames: 9848832. Throughput: 0: 3141.0. Samples: 9859910. Policy #0 lag: (min: 3.0, avg: 23.7, max: 41.0) +[2026-06-07 00:49:10,259][343476] Avg episode reward: [(0, '1438.673')] +[2026-06-07 00:49:11,395][344387] Updated weights for policy 0, policy_version 19248 (0.0008) +[2026-06-07 00:49:12,624][344387] Updated weights for policy 0, policy_version 19259 (0.0008) +[2026-06-07 00:49:15,209][344387] Updated weights for policy 0, policy_version 19269 (0.0008) +[2026-06-07 00:49:15,259][343476] Fps is (10 sec: 3276.5, 60 sec: 3174.3, 300 sec: 3151.8). Total num frames: 9865216. Throughput: 0: 3119.9. Samples: 9869612. Policy #0 lag: (min: 3.0, avg: 23.7, max: 41.0) +[2026-06-07 00:49:15,264][343476] Avg episode reward: [(0, '1452.667')] +[2026-06-07 00:49:16,778][344387] Updated weights for policy 0, policy_version 19282 (0.0011) +[2026-06-07 00:49:18,331][344387] Updated weights for policy 0, policy_version 19293 (0.0010) +[2026-06-07 00:49:20,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3174.5, 300 sec: 3151.8). Total num frames: 9881600. Throughput: 0: 3173.2. Samples: 9890090. Policy #0 lag: (min: 3.0, avg: 23.7, max: 41.0) +[2026-06-07 00:49:20,258][343476] Avg episode reward: [(0, '1470.329')] +[2026-06-07 00:49:20,325][344387] Updated weights for policy 0, policy_version 19304 (0.0008) +[2026-06-07 00:49:22,754][344387] Updated weights for policy 0, policy_version 19322 (0.0011) +[2026-06-07 00:49:24,588][344387] Updated weights for policy 0, policy_version 19332 (0.0008) +[2026-06-07 00:49:25,257][343476] Fps is (10 sec: 3277.3, 60 sec: 3106.2, 300 sec: 3151.8). Total num frames: 9897984. Throughput: 0: 3260.2. Samples: 9909416. Policy #0 lag: (min: 9.0, avg: 21.2, max: 38.0) +[2026-06-07 00:49:25,261][343476] Avg episode reward: [(0, '1539.383')] +[2026-06-07 00:49:27,563][344387] Updated weights for policy 0, policy_version 19349 (0.0010) +[2026-06-07 00:49:29,620][344387] Updated weights for policy 0, policy_version 19361 (0.0009) +[2026-06-07 00:49:30,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3140.2, 300 sec: 3151.8). Total num frames: 9914368. Throughput: 0: 3254.1. Samples: 9918622. Policy #0 lag: (min: 9.0, avg: 21.2, max: 38.0) +[2026-06-07 00:49:30,262][343476] Avg episode reward: [(0, '1410.774')] +[2026-06-07 00:49:30,564][344387] Updated weights for policy 0, policy_version 19371 (0.0009) +[2026-06-07 00:49:32,445][344387] Updated weights for policy 0, policy_version 19384 (0.0012) +[2026-06-07 00:49:34,907][344387] Updated weights for policy 0, policy_version 19394 (0.0009) +[2026-06-07 00:49:35,258][343476] Fps is (10 sec: 3276.6, 60 sec: 3140.2, 300 sec: 3151.8). Total num frames: 9930752. Throughput: 0: 3276.2. Samples: 9937692. Policy #0 lag: (min: 9.0, avg: 21.2, max: 38.0) +[2026-06-07 00:49:35,262][343476] Avg episode reward: [(0, '1507.554')] +[2026-06-07 00:49:36,306][344387] Updated weights for policy 0, policy_version 19404 (0.0009) +[2026-06-07 00:49:37,896][344387] Updated weights for policy 0, policy_version 19417 (0.0008) +[2026-06-07 00:49:40,258][343476] Fps is (10 sec: 3072.0, 60 sec: 3208.5, 300 sec: 3151.8). Total num frames: 9945088. Throughput: 0: 3257.6. Samples: 9956304. Policy #0 lag: (min: 3.0, avg: 19.3, max: 39.0) +[2026-06-07 00:49:40,260][343476] Avg episode reward: [(0, '1472.772')] +[2026-06-07 00:49:40,269][344387] Updated weights for policy 0, policy_version 19427 (0.0008) +[2026-06-07 00:49:41,823][344387] Updated weights for policy 0, policy_version 19437 (0.0009) +[2026-06-07 00:49:43,467][344387] Updated weights for policy 0, policy_version 19450 (0.0010) +[2026-06-07 00:49:45,257][343476] Fps is (10 sec: 3072.1, 60 sec: 3208.5, 300 sec: 3158.8). Total num frames: 9961472. Throughput: 0: 3244.9. Samples: 9965470. Policy #0 lag: (min: 3.0, avg: 19.3, max: 39.0) +[2026-06-07 00:49:45,259][343476] Avg episode reward: [(0, '1381.296')] +[2026-06-07 00:49:45,429][344387] Updated weights for policy 0, policy_version 19460 (0.0008) +[2026-06-07 00:49:47,338][344387] Updated weights for policy 0, policy_version 19472 (0.0010) +[2026-06-07 00:49:48,514][344387] Updated weights for policy 0, policy_version 19483 (0.0010) +[2026-06-07 00:49:50,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3276.8, 300 sec: 3158.8). Total num frames: 9977856. Throughput: 0: 3218.8. Samples: 9984066. Policy #0 lag: (min: 3.0, avg: 20.8, max: 36.0) +[2026-06-07 00:49:50,260][343476] Avg episode reward: [(0, '1536.166')] +[2026-06-07 00:49:50,850][344387] Updated weights for policy 0, policy_version 19493 (0.0007) +[2026-06-07 00:49:52,743][344387] Updated weights for policy 0, policy_version 19508 (0.0009) +[2026-06-07 00:49:54,879][344387] Updated weights for policy 0, policy_version 19521 (0.0008) +[2026-06-07 00:49:55,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3276.8, 300 sec: 3172.7). Total num frames: 9996288. Throughput: 0: 3249.2. Samples: 10006124. Policy #0 lag: (min: 3.0, avg: 20.8, max: 36.0) +[2026-06-07 00:49:55,259][343476] Avg episode reward: [(0, '1462.276')] +[2026-06-07 00:49:56,596][344387] Updated weights for policy 0, policy_version 19533 (0.0008) +[2026-06-07 00:49:58,045][344387] Updated weights for policy 0, policy_version 19547 (0.0008) +[2026-06-07 00:50:00,212][344387] Updated weights for policy 0, policy_version 19557 (0.0009) +[2026-06-07 00:50:00,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3276.8, 300 sec: 3172.7). Total num frames: 10012672. Throughput: 0: 3257.5. Samples: 10016198. Policy #0 lag: (min: 3.0, avg: 20.8, max: 36.0) +[2026-06-07 00:50:00,261][343476] Avg episode reward: [(0, '1416.979')] +[2026-06-07 00:50:00,423][344304] Signal inference workers to stop experience collection... (1800 times) +[2026-06-07 00:50:00,465][344387] InferenceWorker_p0-w0: stopping experience collection (1800 times) +[2026-06-07 00:50:00,522][344304] Signal inference workers to resume experience collection... (1800 times) +[2026-06-07 00:50:00,523][344387] InferenceWorker_p0-w0: resuming experience collection (1800 times) +[2026-06-07 00:50:01,593][344387] Updated weights for policy 0, policy_version 19570 (0.0011) +[2026-06-07 00:50:03,546][344387] Updated weights for policy 0, policy_version 19582 (0.0008) +[2026-06-07 00:50:05,153][344387] Updated weights for policy 0, policy_version 19592 (0.0007) +[2026-06-07 00:50:05,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3310.9, 300 sec: 3179.6). Total num frames: 10031104. Throughput: 0: 3279.6. Samples: 10037674. Policy #0 lag: (min: 4.0, avg: 19.6, max: 33.0) +[2026-06-07 00:50:05,260][343476] Avg episode reward: [(0, '1632.342')] +[2026-06-07 00:50:08,261][344387] Updated weights for policy 0, policy_version 19612 (0.0009) +[2026-06-07 00:50:10,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3310.9, 300 sec: 3186.5). Total num frames: 10047488. Throughput: 0: 3315.5. Samples: 10058616. Policy #0 lag: (min: 4.0, avg: 19.6, max: 33.0) +[2026-06-07 00:50:10,262][343476] Avg episode reward: [(0, '1653.469')] +[2026-06-07 00:50:10,620][344387] Updated weights for policy 0, policy_version 19628 (0.0009) +[2026-06-07 00:50:12,937][344387] Updated weights for policy 0, policy_version 19645 (0.0009) +[2026-06-07 00:50:14,550][344387] Updated weights for policy 0, policy_version 19656 (0.0008) +[2026-06-07 00:50:15,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3345.1, 300 sec: 3207.4). Total num frames: 10065920. Throughput: 0: 3331.8. Samples: 10068554. Policy #0 lag: (min: 4.0, avg: 19.6, max: 33.0) +[2026-06-07 00:50:15,265][343476] Avg episode reward: [(0, '1484.377')] +[2026-06-07 00:50:16,603][344387] Updated weights for policy 0, policy_version 19672 (0.0008) +[2026-06-07 00:50:18,062][344387] Updated weights for policy 0, policy_version 19682 (0.0007) +[2026-06-07 00:50:19,203][344387] Updated weights for policy 0, policy_version 19692 (0.0009) +[2026-06-07 00:50:20,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3379.2, 300 sec: 3214.3). Total num frames: 10084352. Throughput: 0: 3399.9. Samples: 10090686. Policy #0 lag: (min: 1.0, avg: 23.4, max: 44.0) +[2026-06-07 00:50:20,262][343476] Avg episode reward: [(0, '1373.214')] +[2026-06-07 00:50:20,564][344387] Updated weights for policy 0, policy_version 19703 (0.0008) +[2026-06-07 00:50:22,576][344387] Updated weights for policy 0, policy_version 19715 (0.0008) +[2026-06-07 00:50:24,417][344387] Updated weights for policy 0, policy_version 19729 (0.0008) +[2026-06-07 00:50:25,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3413.3, 300 sec: 3221.3). Total num frames: 10102784. Throughput: 0: 3478.9. Samples: 10112856. Policy #0 lag: (min: 1.0, avg: 23.4, max: 44.0) +[2026-06-07 00:50:25,263][343476] Avg episode reward: [(0, '1338.052')] +[2026-06-07 00:50:26,195][344387] Updated weights for policy 0, policy_version 19741 (0.0008) +[2026-06-07 00:50:27,706][344387] Updated weights for policy 0, policy_version 19751 (0.0007) +[2026-06-07 00:50:29,068][344387] Updated weights for policy 0, policy_version 19762 (0.0008) +[2026-06-07 00:50:30,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3481.6, 300 sec: 3235.1). Total num frames: 10123264. Throughput: 0: 3519.5. Samples: 10123848. Policy #0 lag: (min: 1.0, avg: 23.4, max: 44.0) +[2026-06-07 00:50:30,261][343476] Avg episode reward: [(0, '1387.866')] +[2026-06-07 00:50:30,684][344387] Updated weights for policy 0, policy_version 19774 (0.0008) +[2026-06-07 00:50:32,335][344387] Updated weights for policy 0, policy_version 19784 (0.0007) +[2026-06-07 00:50:33,410][344387] Updated weights for policy 0, policy_version 19796 (0.0007) +[2026-06-07 00:50:35,259][343476] Fps is (10 sec: 3686.2, 60 sec: 3481.6, 300 sec: 3242.1). Total num frames: 10139648. Throughput: 0: 3597.4. Samples: 10145952. Policy #0 lag: (min: 3.0, avg: 21.5, max: 37.0) +[2026-06-07 00:50:35,264][343476] Avg episode reward: [(0, '1577.107')] +[2026-06-07 00:50:35,630][344387] Updated weights for policy 0, policy_version 19809 (0.0007) +[2026-06-07 00:50:36,812][344387] Updated weights for policy 0, policy_version 19820 (0.0007) +[2026-06-07 00:50:38,617][344387] Updated weights for policy 0, policy_version 19833 (0.0009) +[2026-06-07 00:50:39,848][344387] Updated weights for policy 0, policy_version 19843 (0.0008) +[2026-06-07 00:50:40,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3584.0, 300 sec: 3256.0). Total num frames: 10160128. Throughput: 0: 3616.3. Samples: 10168858. Policy #0 lag: (min: 3.0, avg: 21.5, max: 37.0) +[2026-06-07 00:50:40,261][343476] Avg episode reward: [(0, '1706.198')] +[2026-06-07 00:50:41,742][344387] Updated weights for policy 0, policy_version 19853 (0.0007) +[2026-06-07 00:50:43,099][344387] Updated weights for policy 0, policy_version 19865 (0.0007) +[2026-06-07 00:50:44,134][344387] Updated weights for policy 0, policy_version 19875 (0.0008) +[2026-06-07 00:50:45,258][343476] Fps is (10 sec: 3891.5, 60 sec: 3618.1, 300 sec: 3256.0). Total num frames: 10178560. Throughput: 0: 3635.8. Samples: 10179808. Policy #0 lag: (min: 3.0, avg: 21.5, max: 37.0) +[2026-06-07 00:50:45,263][343476] Avg episode reward: [(0, '1311.607')] +[2026-06-07 00:50:46,115][344387] Updated weights for policy 0, policy_version 19885 (0.0007) +[2026-06-07 00:50:47,608][344387] Updated weights for policy 0, policy_version 19897 (0.0011) +[2026-06-07 00:50:48,497][344304] Signal inference workers to stop experience collection... (1850 times) +[2026-06-07 00:50:48,521][344304] Signal inference workers to resume experience collection... (1850 times) +[2026-06-07 00:50:48,537][344387] InferenceWorker_p0-w0: stopping experience collection (1850 times) +[2026-06-07 00:50:48,563][344387] InferenceWorker_p0-w0: resuming experience collection (1850 times) +[2026-06-07 00:50:48,726][344387] Updated weights for policy 0, policy_version 19907 (0.0008) +[2026-06-07 00:50:50,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3652.3, 300 sec: 3262.9). Total num frames: 10196992. Throughput: 0: 3641.6. Samples: 10201546. Policy #0 lag: (min: 6.0, avg: 20.8, max: 38.0) +[2026-06-07 00:50:50,260][343476] Avg episode reward: [(0, '1638.904')] +[2026-06-07 00:50:51,151][344387] Updated weights for policy 0, policy_version 19917 (0.0008) +[2026-06-07 00:50:52,974][344387] Updated weights for policy 0, policy_version 19933 (0.0008) +[2026-06-07 00:50:54,281][344387] Updated weights for policy 0, policy_version 19943 (0.0008) +[2026-06-07 00:50:55,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3618.1, 300 sec: 3276.8). Total num frames: 10213376. Throughput: 0: 3639.4. Samples: 10222386. Policy #0 lag: (min: 6.0, avg: 20.8, max: 38.0) +[2026-06-07 00:50:55,258][343476] Avg episode reward: [(0, '1564.284')] +[2026-06-07 00:50:56,134][344387] Updated weights for policy 0, policy_version 19953 (0.0007) +[2026-06-07 00:50:57,749][344387] Updated weights for policy 0, policy_version 19966 (0.0008) +[2026-06-07 00:50:59,233][344387] Updated weights for policy 0, policy_version 19977 (0.0008) +[2026-06-07 00:51:00,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3618.1, 300 sec: 3276.8). Total num frames: 10229760. Throughput: 0: 3659.5. Samples: 10233230. Policy #0 lag: (min: 4.0, avg: 21.9, max: 38.0) +[2026-06-07 00:51:00,259][343476] Avg episode reward: [(0, '1371.198')] +[2026-06-07 00:51:01,457][344387] Updated weights for policy 0, policy_version 19993 (0.0008) +[2026-06-07 00:51:02,786][344387] Updated weights for policy 0, policy_version 20004 (0.0006) +[2026-06-07 00:51:04,365][344387] Updated weights for policy 0, policy_version 20014 (0.0007) +[2026-06-07 00:51:05,257][343476] Fps is (10 sec: 3891.1, 60 sec: 3686.4, 300 sec: 3311.5). Total num frames: 10252288. Throughput: 0: 3682.5. Samples: 10256396. Policy #0 lag: (min: 4.0, avg: 21.9, max: 38.0) +[2026-06-07 00:51:05,259][343476] Avg episode reward: [(0, '1578.089')] +[2026-06-07 00:51:05,488][344387] Updated weights for policy 0, policy_version 20025 (0.0007) +[2026-06-07 00:51:06,544][344387] Updated weights for policy 0, policy_version 20036 (0.0007) +[2026-06-07 00:51:08,780][344387] Updated weights for policy 0, policy_version 20049 (0.0007) +[2026-06-07 00:51:10,173][344387] Updated weights for policy 0, policy_version 20063 (0.0009) +[2026-06-07 00:51:10,257][343476] Fps is (10 sec: 4300.9, 60 sec: 3754.7, 300 sec: 3325.4). Total num frames: 10272768. Throughput: 0: 3740.2. Samples: 10281164. Policy #0 lag: (min: 4.0, avg: 21.9, max: 38.0) +[2026-06-07 00:51:10,261][343476] Avg episode reward: [(0, '1653.400')] +[2026-06-07 00:51:11,582][344387] Updated weights for policy 0, policy_version 20074 (0.0008) +[2026-06-07 00:51:13,232][344387] Updated weights for policy 0, policy_version 20085 (0.0007) +[2026-06-07 00:51:14,977][344387] Updated weights for policy 0, policy_version 20099 (0.0009) +[2026-06-07 00:51:15,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3754.7, 300 sec: 3339.3). Total num frames: 10291200. Throughput: 0: 3748.1. Samples: 10292512. Policy #0 lag: (min: 6.0, avg: 22.0, max: 42.0) +[2026-06-07 00:51:15,259][343476] Avg episode reward: [(0, '1484.905')] +[2026-06-07 00:51:16,443][344387] Updated weights for policy 0, policy_version 20111 (0.0008) +[2026-06-07 00:51:18,152][344387] Updated weights for policy 0, policy_version 20121 (0.0007) +[2026-06-07 00:51:19,362][344387] Updated weights for policy 0, policy_version 20133 (0.0007) +[2026-06-07 00:51:20,258][343476] Fps is (10 sec: 3891.0, 60 sec: 3788.8, 300 sec: 3360.1). Total num frames: 10311680. Throughput: 0: 3795.0. Samples: 10316726. Policy #0 lag: (min: 6.0, avg: 22.0, max: 42.0) +[2026-06-07 00:51:20,262][343476] Avg episode reward: [(0, '1414.644')] +[2026-06-07 00:51:20,596][344387] Updated weights for policy 0, policy_version 20144 (0.0007) +[2026-06-07 00:51:22,300][344387] Updated weights for policy 0, policy_version 20157 (0.0009) +[2026-06-07 00:51:23,691][344387] Updated weights for policy 0, policy_version 20169 (0.0007) +[2026-06-07 00:51:25,188][344387] Updated weights for policy 0, policy_version 20181 (0.0009) +[2026-06-07 00:51:25,257][343476] Fps is (10 sec: 4095.9, 60 sec: 3822.9, 300 sec: 3374.0). Total num frames: 10332160. Throughput: 0: 3838.5. Samples: 10341592. Policy #0 lag: (min: 6.0, avg: 22.0, max: 42.0) +[2026-06-07 00:51:25,259][343476] Avg episode reward: [(0, '1436.854')] +[2026-06-07 00:51:26,913][344387] Updated weights for policy 0, policy_version 20193 (0.0007) +[2026-06-07 00:51:28,472][344387] Updated weights for policy 0, policy_version 20206 (0.0007) +[2026-06-07 00:51:29,401][344387] Updated weights for policy 0, policy_version 20216 (0.0007) +[2026-06-07 00:51:30,258][343476] Fps is (10 sec: 3891.3, 60 sec: 3788.8, 300 sec: 3380.9). Total num frames: 10350592. Throughput: 0: 3847.5. Samples: 10352948. Policy #0 lag: (min: 4.0, avg: 20.4, max: 36.0) +[2026-06-07 00:51:30,262][343476] Avg episode reward: [(0, '1576.531')] +[2026-06-07 00:51:31,442][344387] Updated weights for policy 0, policy_version 20229 (0.0007) +[2026-06-07 00:51:32,770][344387] Updated weights for policy 0, policy_version 20239 (0.0007) +[2026-06-07 00:51:33,194][344304] Signal inference workers to stop experience collection... (1900 times) +[2026-06-07 00:51:33,195][344304] Signal inference workers to resume experience collection... (1900 times) +[2026-06-07 00:51:33,227][344387] InferenceWorker_p0-w0: stopping experience collection (1900 times) +[2026-06-07 00:51:33,228][344387] InferenceWorker_p0-w0: resuming experience collection (1900 times) +[2026-06-07 00:51:34,469][344387] Updated weights for policy 0, policy_version 20249 (0.0008) +[2026-06-07 00:51:35,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3857.1, 300 sec: 3408.7). Total num frames: 10371072. Throughput: 0: 3903.1. Samples: 10377184. Policy #0 lag: (min: 4.0, avg: 20.4, max: 36.0) +[2026-06-07 00:51:35,258][343476] Avg episode reward: [(0, '1542.331')] +[2026-06-07 00:51:36,069][344387] Updated weights for policy 0, policy_version 20261 (0.0009) +[2026-06-07 00:51:37,426][344387] Updated weights for policy 0, policy_version 20273 (0.0009) +[2026-06-07 00:51:39,012][344387] Updated weights for policy 0, policy_version 20284 (0.0008) +[2026-06-07 00:51:40,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3822.9, 300 sec: 3415.7). Total num frames: 10389504. Throughput: 0: 3927.6. Samples: 10399130. Policy #0 lag: (min: 4.0, avg: 20.4, max: 36.0) +[2026-06-07 00:51:40,260][343476] Avg episode reward: [(0, '1515.680')] +[2026-06-07 00:51:40,614][344387] Updated weights for policy 0, policy_version 20296 (0.0009) +[2026-06-07 00:51:42,000][344387] Updated weights for policy 0, policy_version 20306 (0.0011) +[2026-06-07 00:51:43,669][344387] Updated weights for policy 0, policy_version 20317 (0.0009) +[2026-06-07 00:51:45,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3788.8, 300 sec: 3415.6). Total num frames: 10405888. Throughput: 0: 3922.1. Samples: 10409724. Policy #0 lag: (min: 4.0, avg: 21.7, max: 39.0) +[2026-06-07 00:51:45,260][343476] Avg episode reward: [(0, '1415.590')] +[2026-06-07 00:51:45,436][344387] Updated weights for policy 0, policy_version 20329 (0.0008) +[2026-06-07 00:51:46,906][344387] Updated weights for policy 0, policy_version 20342 (0.0008) +[2026-06-07 00:51:48,248][344387] Updated weights for policy 0, policy_version 20352 (0.0009) +[2026-06-07 00:51:49,852][344387] Updated weights for policy 0, policy_version 20363 (0.0008) +[2026-06-07 00:51:50,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3822.9, 300 sec: 3429.5). Total num frames: 10426368. Throughput: 0: 3890.6. Samples: 10431474. Policy #0 lag: (min: 4.0, avg: 21.7, max: 39.0) +[2026-06-07 00:51:50,262][343476] Avg episode reward: [(0, '1576.215')] +[2026-06-07 00:51:51,408][344387] Updated weights for policy 0, policy_version 20375 (0.0007) +[2026-06-07 00:51:53,367][344387] Updated weights for policy 0, policy_version 20388 (0.0007) +[2026-06-07 00:51:54,537][344387] Updated weights for policy 0, policy_version 20398 (0.0008) +[2026-06-07 00:51:55,257][343476] Fps is (10 sec: 4096.0, 60 sec: 3891.2, 300 sec: 3443.4). Total num frames: 10446848. Throughput: 0: 3860.7. Samples: 10454894. Policy #0 lag: (min: 4.0, avg: 21.7, max: 39.0) +[2026-06-07 00:51:55,262][343476] Avg episode reward: [(0, '1334.334')] +[2026-06-07 00:51:56,373][344387] Updated weights for policy 0, policy_version 20410 (0.0007) +[2026-06-07 00:51:57,683][344387] Updated weights for policy 0, policy_version 20422 (0.0010) +[2026-06-07 00:51:58,726][344387] Updated weights for policy 0, policy_version 20432 (0.0008) +[2026-06-07 00:52:00,258][343476] Fps is (10 sec: 3891.2, 60 sec: 3925.3, 300 sec: 3464.2). Total num frames: 10465280. Throughput: 0: 3863.6. Samples: 10466376. Policy #0 lag: (min: 3.0, avg: 19.6, max: 35.0) +[2026-06-07 00:52:00,262][343476] Avg episode reward: [(0, '1530.391')] +[2026-06-07 00:52:00,990][344387] Updated weights for policy 0, policy_version 20444 (0.0008) +[2026-06-07 00:52:02,415][344387] Updated weights for policy 0, policy_version 20457 (0.0009) +[2026-06-07 00:52:03,902][344387] Updated weights for policy 0, policy_version 20469 (0.0008) +[2026-06-07 00:52:05,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3857.1, 300 sec: 3471.2). Total num frames: 10483712. Throughput: 0: 3841.2. Samples: 10489578. Policy #0 lag: (min: 3.0, avg: 19.6, max: 35.0) +[2026-06-07 00:52:05,260][343476] Avg episode reward: [(0, '1646.413')] +[2026-06-07 00:52:05,533][344387] Updated weights for policy 0, policy_version 20479 (0.0007) +[2026-06-07 00:52:06,697][344387] Updated weights for policy 0, policy_version 20491 (0.0008) +[2026-06-07 00:52:08,274][344387] Updated weights for policy 0, policy_version 20503 (0.0007) +[2026-06-07 00:52:10,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3822.9, 300 sec: 3478.1). Total num frames: 10502144. Throughput: 0: 3817.8. Samples: 10513394. Policy #0 lag: (min: 3.0, avg: 19.6, max: 35.0) +[2026-06-07 00:52:10,259][343476] Avg episode reward: [(0, '1474.043')] +[2026-06-07 00:52:10,443][344387] Updated weights for policy 0, policy_version 20517 (0.0007) +[2026-06-07 00:52:12,151][344387] Updated weights for policy 0, policy_version 20529 (0.0009) +[2026-06-07 00:52:14,177][344387] Updated weights for policy 0, policy_version 20541 (0.0009) +[2026-06-07 00:52:15,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3857.1, 300 sec: 3485.1). Total num frames: 10522624. Throughput: 0: 3793.6. Samples: 10523658. Policy #0 lag: (min: 7.0, avg: 23.6, max: 43.0) +[2026-06-07 00:52:15,260][343476] Avg episode reward: [(0, '1332.196')] +[2026-06-07 00:52:15,354][344387] Updated weights for policy 0, policy_version 20555 (0.0008) +[2026-06-07 00:52:17,914][344387] Updated weights for policy 0, policy_version 20569 (0.0007) +[2026-06-07 00:52:19,347][344387] Updated weights for policy 0, policy_version 20581 (0.0008) +[2026-06-07 00:52:20,257][343476] Fps is (10 sec: 3891.1, 60 sec: 3823.0, 300 sec: 3485.1). Total num frames: 10541056. Throughput: 0: 3753.7. Samples: 10546104. Policy #0 lag: (min: 7.0, avg: 23.6, max: 43.0) +[2026-06-07 00:52:20,260][343476] Avg episode reward: [(0, '1471.578')] +[2026-06-07 00:52:20,911][344387] Updated weights for policy 0, policy_version 20592 (0.0007) +[2026-06-07 00:52:21,198][344304] Signal inference workers to stop experience collection... (1950 times) +[2026-06-07 00:52:21,221][344387] InferenceWorker_p0-w0: stopping experience collection (1950 times) +[2026-06-07 00:52:21,341][344304] Signal inference workers to resume experience collection... (1950 times) +[2026-06-07 00:52:21,343][344387] InferenceWorker_p0-w0: resuming experience collection (1950 times) +[2026-06-07 00:52:22,416][344387] Updated weights for policy 0, policy_version 20604 (0.0009) +[2026-06-07 00:52:24,342][344387] Updated weights for policy 0, policy_version 20617 (0.0007) +[2026-06-07 00:52:25,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3754.7, 300 sec: 3485.1). Total num frames: 10557440. Throughput: 0: 3764.0. Samples: 10568508. Policy #0 lag: (min: 7.0, avg: 23.6, max: 43.0) +[2026-06-07 00:52:25,258][343476] Avg episode reward: [(0, '1554.713')] +[2026-06-07 00:52:25,846][344387] Updated weights for policy 0, policy_version 20630 (0.0008) +[2026-06-07 00:52:27,952][344387] Updated weights for policy 0, policy_version 20642 (0.0009) +[2026-06-07 00:52:29,494][344387] Updated weights for policy 0, policy_version 20653 (0.0007) +[2026-06-07 00:52:30,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3788.8, 300 sec: 3505.9). Total num frames: 10577920. Throughput: 0: 3768.3. Samples: 10579298. Policy #0 lag: (min: 3.0, avg: 21.6, max: 39.0) +[2026-06-07 00:52:30,260][343476] Avg episode reward: [(0, '1553.389')] +[2026-06-07 00:52:31,100][344387] Updated weights for policy 0, policy_version 20665 (0.0007) +[2026-06-07 00:52:32,489][344387] Updated weights for policy 0, policy_version 20678 (0.0007) +[2026-06-07 00:52:34,403][344387] Updated weights for policy 0, policy_version 20692 (0.0008) +[2026-06-07 00:52:35,258][343476] Fps is (10 sec: 3890.9, 60 sec: 3754.6, 300 sec: 3512.8). Total num frames: 10596352. Throughput: 0: 3794.4. Samples: 10602224. Policy #0 lag: (min: 3.0, avg: 21.6, max: 39.0) +[2026-06-07 00:52:35,262][343476] Avg episode reward: [(0, '1476.995')] +[2026-06-07 00:52:36,436][344387] Updated weights for policy 0, policy_version 20704 (0.0007) +[2026-06-07 00:52:37,747][344387] Updated weights for policy 0, policy_version 20715 (0.0008) +[2026-06-07 00:52:39,259][344387] Updated weights for policy 0, policy_version 20727 (0.0007) +[2026-06-07 00:52:40,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3754.7, 300 sec: 3512.8). Total num frames: 10614784. Throughput: 0: 3761.7. Samples: 10624172. Policy #0 lag: (min: 3.0, avg: 22.0, max: 39.0) +[2026-06-07 00:52:40,259][343476] Avg episode reward: [(0, '1617.915')] +[2026-06-07 00:52:40,832][344387] Updated weights for policy 0, policy_version 20739 (0.0007) +[2026-06-07 00:52:42,754][344387] Updated weights for policy 0, policy_version 20749 (0.0007) +[2026-06-07 00:52:44,180][344387] Updated weights for policy 0, policy_version 20761 (0.0008) +[2026-06-07 00:52:45,257][343476] Fps is (10 sec: 3686.6, 60 sec: 3788.8, 300 sec: 3519.8). Total num frames: 10633216. Throughput: 0: 3770.8. Samples: 10636060. Policy #0 lag: (min: 3.0, avg: 22.0, max: 39.0) +[2026-06-07 00:52:45,258][343476] Avg episode reward: [(0, '1501.258')] +[2026-06-07 00:52:45,767][344387] Updated weights for policy 0, policy_version 20775 (0.0008) +[2026-06-07 00:52:47,576][344387] Updated weights for policy 0, policy_version 20787 (0.0008) +[2026-06-07 00:52:49,399][344387] Updated weights for policy 0, policy_version 20797 (0.0010) +[2026-06-07 00:52:50,259][343476] Fps is (10 sec: 3686.2, 60 sec: 3754.6, 300 sec: 3533.7). Total num frames: 10651648. Throughput: 0: 3733.4. Samples: 10657582. Policy #0 lag: (min: 3.0, avg: 22.0, max: 39.0) +[2026-06-07 00:52:50,264][343476] Avg episode reward: [(0, '1572.357')] +[2026-06-07 00:52:50,938][344387] Updated weights for policy 0, policy_version 20810 (0.0008) +[2026-06-07 00:52:52,277][344387] Updated weights for policy 0, policy_version 20822 (0.0008) +[2026-06-07 00:52:54,119][344387] Updated weights for policy 0, policy_version 20835 (0.0008) +[2026-06-07 00:52:55,257][343476] Fps is (10 sec: 3686.2, 60 sec: 3720.5, 300 sec: 3533.7). Total num frames: 10670080. Throughput: 0: 3702.1. Samples: 10679990. Policy #0 lag: (min: 2.0, avg: 20.7, max: 40.0) +[2026-06-07 00:52:55,260][343476] Avg episode reward: [(0, '1473.757')] +[2026-06-07 00:52:55,903][344387] Updated weights for policy 0, policy_version 20845 (0.0007) +[2026-06-07 00:52:57,520][344387] Updated weights for policy 0, policy_version 20857 (0.0008) +[2026-06-07 00:52:58,964][344387] Updated weights for policy 0, policy_version 20870 (0.0009) +[2026-06-07 00:53:00,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3720.5, 300 sec: 3554.5). Total num frames: 10688512. Throughput: 0: 3728.0. Samples: 10691420. Policy #0 lag: (min: 2.0, avg: 20.7, max: 40.0) +[2026-06-07 00:53:00,263][343476] Avg episode reward: [(0, '1570.779')] +[2026-06-07 00:53:01,243][344387] Updated weights for policy 0, policy_version 20885 (0.0009) +[2026-06-07 00:53:02,776][344387] Updated weights for policy 0, policy_version 20898 (0.0009) +[2026-06-07 00:53:04,312][344387] Updated weights for policy 0, policy_version 20908 (0.0007) +[2026-06-07 00:53:05,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3754.7, 300 sec: 3568.4). Total num frames: 10708992. Throughput: 0: 3722.9. Samples: 10713634. Policy #0 lag: (min: 2.0, avg: 20.7, max: 40.0) +[2026-06-07 00:53:05,266][343476] Avg episode reward: [(0, '1582.233')] +[2026-06-07 00:53:05,608][344387] Updated weights for policy 0, policy_version 20920 (0.0008) +[2026-06-07 00:53:07,668][344387] Updated weights for policy 0, policy_version 20933 (0.0008) +[2026-06-07 00:53:09,403][344387] Updated weights for policy 0, policy_version 20945 (0.0008) +[2026-06-07 00:53:10,258][343476] Fps is (10 sec: 3891.5, 60 sec: 3754.7, 300 sec: 3568.4). Total num frames: 10727424. Throughput: 0: 3711.8. Samples: 10735538. Policy #0 lag: (min: 5.0, avg: 21.1, max: 39.0) +[2026-06-07 00:53:10,262][343476] Avg episode reward: [(0, '1428.118')] +[2026-06-07 00:53:11,425][344387] Updated weights for policy 0, policy_version 20957 (0.0007) +[2026-06-07 00:53:11,430][344304] Signal inference workers to stop experience collection... (2000 times) +[2026-06-07 00:53:11,458][344387] InferenceWorker_p0-w0: stopping experience collection (2000 times) +[2026-06-07 00:53:11,519][344304] Signal inference workers to resume experience collection... (2000 times) +[2026-06-07 00:53:11,520][344387] InferenceWorker_p0-w0: resuming experience collection (2000 times) +[2026-06-07 00:53:12,868][344387] Updated weights for policy 0, policy_version 20969 (0.0007) +[2026-06-07 00:53:14,427][344387] Updated weights for policy 0, policy_version 20981 (0.0008) +[2026-06-07 00:53:15,258][343476] Fps is (10 sec: 3481.3, 60 sec: 3686.4, 300 sec: 3568.4). Total num frames: 10743808. Throughput: 0: 3725.4. Samples: 10746942. Policy #0 lag: (min: 5.0, avg: 21.1, max: 39.0) +[2026-06-07 00:53:15,261][343476] Avg episode reward: [(0, '1454.840')] +[2026-06-07 00:53:16,104][344387] Updated weights for policy 0, policy_version 20994 (0.0007) +[2026-06-07 00:53:17,619][344387] Updated weights for policy 0, policy_version 21004 (0.0007) +[2026-06-07 00:53:19,053][344387] Updated weights for policy 0, policy_version 21015 (0.0009) +[2026-06-07 00:53:20,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3686.4, 300 sec: 3561.4). Total num frames: 10762240. Throughput: 0: 3695.1. Samples: 10768502. Policy #0 lag: (min: 5.0, avg: 21.1, max: 39.0) +[2026-06-07 00:53:20,260][343476] Avg episode reward: [(0, '1452.856')] +[2026-06-07 00:53:20,658][344387] Updated weights for policy 0, policy_version 21028 (0.0007) +[2026-06-07 00:53:22,695][344387] Updated weights for policy 0, policy_version 21040 (0.0008) +[2026-06-07 00:53:24,343][344387] Updated weights for policy 0, policy_version 21052 (0.0008) +[2026-06-07 00:53:25,258][343476] Fps is (10 sec: 3891.3, 60 sec: 3754.6, 300 sec: 3582.3). Total num frames: 10782720. Throughput: 0: 3708.1. Samples: 10791038. Policy #0 lag: (min: 3.0, avg: 22.2, max: 41.0) +[2026-06-07 00:53:25,262][343476] Avg episode reward: [(0, '1569.517')] +[2026-06-07 00:53:25,586][344387] Updated weights for policy 0, policy_version 21063 (0.0007) +[2026-06-07 00:53:27,182][344387] Updated weights for policy 0, policy_version 21074 (0.0009) +[2026-06-07 00:53:29,153][344387] Updated weights for policy 0, policy_version 21088 (0.0007) +[2026-06-07 00:53:30,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3720.5, 300 sec: 3589.2). Total num frames: 10801152. Throughput: 0: 3696.6. Samples: 10802406. Policy #0 lag: (min: 3.0, avg: 22.2, max: 41.0) +[2026-06-07 00:53:30,259][343476] Avg episode reward: [(0, '1410.462')] +[2026-06-07 00:53:30,648][344387] Updated weights for policy 0, policy_version 21098 (0.0007) +[2026-06-07 00:53:32,337][344387] Updated weights for policy 0, policy_version 21110 (0.0008) +[2026-06-07 00:53:34,195][344387] Updated weights for policy 0, policy_version 21124 (0.0010) +[2026-06-07 00:53:35,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3720.5, 300 sec: 3617.0). Total num frames: 10819584. Throughput: 0: 3720.2. Samples: 10824988. Policy #0 lag: (min: 3.0, avg: 22.2, max: 41.0) +[2026-06-07 00:53:35,259][343476] Avg episode reward: [(0, '1609.660')] +[2026-06-07 00:53:35,764][344387] Updated weights for policy 0, policy_version 21136 (0.0008) +[2026-06-07 00:53:37,492][344387] Updated weights for policy 0, policy_version 21148 (0.0008) +[2026-06-07 00:53:39,514][344387] Updated weights for policy 0, policy_version 21161 (0.0011) +[2026-06-07 00:53:40,263][343476] Fps is (10 sec: 3684.5, 60 sec: 3720.2, 300 sec: 3623.9). Total num frames: 10838016. Throughput: 0: 3709.4. Samples: 10846932. Policy #0 lag: (min: 10.0, avg: 24.4, max: 43.0) +[2026-06-07 00:53:40,269][343476] Avg episode reward: [(0, '1492.628')] +[2026-06-07 00:53:41,099][344387] Updated weights for policy 0, policy_version 21173 (0.0008) +[2026-06-07 00:53:42,396][344387] Updated weights for policy 0, policy_version 21184 (0.0009) +[2026-06-07 00:53:43,984][344387] Updated weights for policy 0, policy_version 21194 (0.0009) +[2026-06-07 00:53:45,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3720.5, 300 sec: 3644.7). Total num frames: 10856448. Throughput: 0: 3703.1. Samples: 10858058. Policy #0 lag: (min: 10.0, avg: 24.4, max: 43.0) +[2026-06-07 00:53:45,260][343476] Avg episode reward: [(0, '1444.790')] +[2026-06-07 00:53:45,860][344387] Updated weights for policy 0, policy_version 21206 (0.0011) +[2026-06-07 00:53:47,143][344387] Updated weights for policy 0, policy_version 21217 (0.0008) +[2026-06-07 00:53:48,632][344387] Updated weights for policy 0, policy_version 21227 (0.0007) +[2026-06-07 00:53:50,179][344387] Updated weights for policy 0, policy_version 21239 (0.0007) +[2026-06-07 00:53:50,257][343476] Fps is (10 sec: 3688.2, 60 sec: 3720.6, 300 sec: 3644.8). Total num frames: 10874880. Throughput: 0: 3688.4. Samples: 10879612. Policy #0 lag: (min: 10.0, avg: 24.4, max: 43.0) +[2026-06-07 00:53:50,260][343476] Avg episode reward: [(0, '1648.647')] +[2026-06-07 00:53:51,632][344387] Updated weights for policy 0, policy_version 21250 (0.0008) +[2026-06-07 00:53:53,580][344387] Updated weights for policy 0, policy_version 21260 (0.0009) +[2026-06-07 00:53:55,143][344387] Updated weights for policy 0, policy_version 21271 (0.0008) +[2026-06-07 00:53:55,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3686.4, 300 sec: 3644.7). Total num frames: 10891264. Throughput: 0: 3650.2. Samples: 10899798. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:53:55,262][343476] Avg episode reward: [(0, '1513.981')] +[2026-06-07 00:53:56,395][344387] Updated weights for policy 0, policy_version 21281 (0.0008) +[2026-06-07 00:53:58,606][344387] Updated weights for policy 0, policy_version 21292 (0.0010) +[2026-06-07 00:54:00,032][344387] Updated weights for policy 0, policy_version 21304 (0.0009) +[2026-06-07 00:54:00,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3652.3, 300 sec: 3644.7). Total num frames: 10907648. Throughput: 0: 3628.1. Samples: 10910204. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:54:00,261][343476] Avg episode reward: [(0, '1481.126')] +[2026-06-07 00:54:01,447][344387] Updated weights for policy 0, policy_version 21315 (0.0007) +[2026-06-07 00:54:03,578][344387] Updated weights for policy 0, policy_version 21329 (0.0009) +[2026-06-07 00:54:05,224][344387] Updated weights for policy 0, policy_version 21341 (0.0008) +[2026-06-07 00:54:05,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3618.1, 300 sec: 3651.7). Total num frames: 10926080. Throughput: 0: 3619.5. Samples: 10931380. Policy #0 lag: (min: 3.0, avg: 19.5, max: 35.0) +[2026-06-07 00:54:05,259][343476] Avg episode reward: [(0, '1449.807')] +[2026-06-07 00:54:06,493][344387] Updated weights for policy 0, policy_version 21351 (0.0010) +[2026-06-07 00:54:08,787][344387] Updated weights for policy 0, policy_version 21364 (0.0009) +[2026-06-07 00:54:10,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3584.0, 300 sec: 3651.7). Total num frames: 10942464. Throughput: 0: 3578.0. Samples: 10952046. Policy #0 lag: (min: 7.0, avg: 20.6, max: 39.0) +[2026-06-07 00:54:10,261][343476] Avg episode reward: [(0, '1462.164')] +[2026-06-07 00:54:10,324][344387] Updated weights for policy 0, policy_version 21376 (0.0010) +[2026-06-07 00:54:12,765][344387] Updated weights for policy 0, policy_version 21388 (0.0009) +[2026-06-07 00:54:13,829][344387] Updated weights for policy 0, policy_version 21399 (0.0008) +[2026-06-07 00:54:14,637][344304] Signal inference workers to stop experience collection... (2050 times) +[2026-06-07 00:54:14,651][344387] InferenceWorker_p0-w0: stopping experience collection (2050 times) +[2026-06-07 00:54:14,766][344304] Signal inference workers to resume experience collection... (2050 times) +[2026-06-07 00:54:14,767][344387] InferenceWorker_p0-w0: resuming experience collection (2050 times) +[2026-06-07 00:54:15,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3618.2, 300 sec: 3658.6). Total num frames: 10960896. Throughput: 0: 3563.5. Samples: 10962764. Policy #0 lag: (min: 7.0, avg: 20.6, max: 39.0) +[2026-06-07 00:54:15,259][343476] Avg episode reward: [(0, '1483.870')] +[2026-06-07 00:54:15,324][344387] Updated weights for policy 0, policy_version 21411 (0.0007) +[2026-06-07 00:54:17,510][344387] Updated weights for policy 0, policy_version 21423 (0.0009) +[2026-06-07 00:54:19,386][344387] Updated weights for policy 0, policy_version 21433 (0.0009) +[2026-06-07 00:54:20,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3618.1, 300 sec: 3665.6). Total num frames: 10979328. Throughput: 0: 3519.4. Samples: 10983360. Policy #0 lag: (min: 7.0, avg: 20.6, max: 39.0) +[2026-06-07 00:54:20,259][343476] Avg episode reward: [(0, '1551.522')] +[2026-06-07 00:54:20,992][344387] Updated weights for policy 0, policy_version 21446 (0.0009) +[2026-06-07 00:54:22,593][344387] Updated weights for policy 0, policy_version 21458 (0.0008) +[2026-06-07 00:54:24,149][344387] Updated weights for policy 0, policy_version 21470 (0.0007) +[2026-06-07 00:54:25,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3549.9, 300 sec: 3665.6). Total num frames: 10995712. Throughput: 0: 3509.2. Samples: 11004830. Policy #0 lag: (min: 1.0, avg: 20.8, max: 39.0) +[2026-06-07 00:54:25,260][343476] Avg episode reward: [(0, '1592.864')] +[2026-06-07 00:54:25,537][344387] Updated weights for policy 0, policy_version 21480 (0.0007) +[2026-06-07 00:54:27,616][344387] Updated weights for policy 0, policy_version 21494 (0.0008) +[2026-06-07 00:54:28,924][344387] Updated weights for policy 0, policy_version 21506 (0.0008) +[2026-06-07 00:54:30,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3549.9, 300 sec: 3672.5). Total num frames: 11014144. Throughput: 0: 3513.1. Samples: 11016146. Policy #0 lag: (min: 1.0, avg: 20.8, max: 39.0) +[2026-06-07 00:54:30,259][343476] Avg episode reward: [(0, '1445.781')] +[2026-06-07 00:54:31,242][344387] Updated weights for policy 0, policy_version 21520 (0.0010) +[2026-06-07 00:54:32,633][344387] Updated weights for policy 0, policy_version 21530 (0.0008) +[2026-06-07 00:54:33,523][344387] Updated weights for policy 0, policy_version 21540 (0.0009) +[2026-06-07 00:54:35,257][343476] Fps is (10 sec: 3481.6, 60 sec: 3515.8, 300 sec: 3679.5). Total num frames: 11030528. Throughput: 0: 3517.5. Samples: 11037898. Policy #0 lag: (min: 1.0, avg: 20.8, max: 39.0) +[2026-06-07 00:54:35,259][343476] Avg episode reward: [(0, '1627.454')] +[2026-06-07 00:54:35,857][344387] Updated weights for policy 0, policy_version 21553 (0.0008) +[2026-06-07 00:54:37,096][344387] Updated weights for policy 0, policy_version 21563 (0.0008) +[2026-06-07 00:54:38,725][344387] Updated weights for policy 0, policy_version 21575 (0.0006) +[2026-06-07 00:54:40,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3550.2, 300 sec: 3693.3). Total num frames: 11051008. Throughput: 0: 3580.0. Samples: 11060894. Policy #0 lag: (min: 7.0, avg: 23.5, max: 41.0) +[2026-06-07 00:54:40,259][343476] Avg episode reward: [(0, '1440.013')] +[2026-06-07 00:54:40,401][344387] Updated weights for policy 0, policy_version 21587 (0.0007) +[2026-06-07 00:54:41,963][344387] Updated weights for policy 0, policy_version 21597 (0.0007) +[2026-06-07 00:54:43,778][344387] Updated weights for policy 0, policy_version 21609 (0.0008) +[2026-06-07 00:54:45,215][344387] Updated weights for policy 0, policy_version 21623 (0.0007) +[2026-06-07 00:54:45,258][343476] Fps is (10 sec: 4095.9, 60 sec: 3584.0, 300 sec: 3707.2). Total num frames: 11071488. Throughput: 0: 3602.8. Samples: 11072330. Policy #0 lag: (min: 7.0, avg: 23.5, max: 41.0) +[2026-06-07 00:54:45,260][343476] Avg episode reward: [(0, '1540.391')] +[2026-06-07 00:54:46,512][344387] Updated weights for policy 0, policy_version 21634 (0.0008) +[2026-06-07 00:54:48,871][344387] Updated weights for policy 0, policy_version 21648 (0.0007) +[2026-06-07 00:54:50,233][344387] Updated weights for policy 0, policy_version 21658 (0.0007) +[2026-06-07 00:54:50,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3549.9, 300 sec: 3700.3). Total num frames: 11087872. Throughput: 0: 3636.7. Samples: 11095032. Policy #0 lag: (min: 7.0, avg: 23.5, max: 41.0) +[2026-06-07 00:54:50,260][343476] Avg episode reward: [(0, '1521.028')] +[2026-06-07 00:54:51,449][344387] Updated weights for policy 0, policy_version 21669 (0.0008) +[2026-06-07 00:54:53,520][344387] Updated weights for policy 0, policy_version 21684 (0.0008) +[2026-06-07 00:54:54,771][344387] Updated weights for policy 0, policy_version 21694 (0.0006) +[2026-06-07 00:54:55,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3618.2, 300 sec: 3714.2). Total num frames: 11108352. Throughput: 0: 3681.3. Samples: 11117706. Policy #0 lag: (min: 4.0, avg: 19.6, max: 36.0) +[2026-06-07 00:54:55,259][343476] Avg episode reward: [(0, '1593.641')] +[2026-06-07 00:54:55,955][344387] Updated weights for policy 0, policy_version 21704 (0.0006) +[2026-06-07 00:54:57,594][344387] Updated weights for policy 0, policy_version 21717 (0.0008) +[2026-06-07 00:54:58,723][344387] Updated weights for policy 0, policy_version 21727 (0.0006) +[2026-06-07 00:55:00,257][343476] Fps is (10 sec: 4095.9, 60 sec: 3686.4, 300 sec: 3721.1). Total num frames: 11128832. Throughput: 0: 3715.2. Samples: 11129948. Policy #0 lag: (min: 4.0, avg: 19.6, max: 36.0) +[2026-06-07 00:55:00,260][343476] Avg episode reward: [(0, '1452.308')] +[2026-06-07 00:55:00,403][344387] Updated weights for policy 0, policy_version 21737 (0.0007) +[2026-06-07 00:55:01,596][344387] Updated weights for policy 0, policy_version 21751 (0.0008) +[2026-06-07 00:55:03,420][344387] Updated weights for policy 0, policy_version 21761 (0.0008) +[2026-06-07 00:55:04,853][344387] Updated weights for policy 0, policy_version 21773 (0.0008) +[2026-06-07 00:55:05,258][343476] Fps is (10 sec: 4095.9, 60 sec: 3720.5, 300 sec: 3735.0). Total num frames: 11149312. Throughput: 0: 3816.9. Samples: 11155120. Policy #0 lag: (min: 4.0, avg: 19.6, max: 36.0) +[2026-06-07 00:55:05,260][343476] Avg episode reward: [(0, '1420.380')] +[2026-06-07 00:55:05,475][344304] Signal inference workers to stop experience collection... (2100 times) +[2026-06-07 00:55:05,498][344387] InferenceWorker_p0-w0: stopping experience collection (2100 times) +[2026-06-07 00:55:05,540][344304] Signal inference workers to resume experience collection... (2100 times) +[2026-06-07 00:55:05,540][344387] InferenceWorker_p0-w0: resuming experience collection (2100 times) +[2026-06-07 00:55:05,759][344387] Updated weights for policy 0, policy_version 21784 (0.0007) +[2026-06-07 00:55:07,429][344387] Updated weights for policy 0, policy_version 21794 (0.0006) +[2026-06-07 00:55:09,764][344387] Updated weights for policy 0, policy_version 21809 (0.0008) +[2026-06-07 00:55:10,258][343476] Fps is (10 sec: 3891.0, 60 sec: 3754.6, 300 sec: 3735.0). Total num frames: 11167744. Throughput: 0: 3855.4. Samples: 11178326. Policy #0 lag: (min: 3.0, avg: 19.2, max: 39.0) +[2026-06-07 00:55:10,262][343476] Avg episode reward: [(0, '1394.739')] +[2026-06-07 00:55:11,022][344387] Updated weights for policy 0, policy_version 21821 (0.0007) +[2026-06-07 00:55:12,954][344387] Updated weights for policy 0, policy_version 21833 (0.0007) +[2026-06-07 00:55:14,176][344387] Updated weights for policy 0, policy_version 21848 (0.0008) +[2026-06-07 00:55:15,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3788.8, 300 sec: 3741.9). Total num frames: 11188224. Throughput: 0: 3865.3. Samples: 11190084. Policy #0 lag: (min: 3.0, avg: 19.2, max: 39.0) +[2026-06-07 00:55:15,260][343476] Avg episode reward: [(0, '1731.193')] +[2026-06-07 00:55:15,819][344387] Updated weights for policy 0, policy_version 21858 (0.0007) +[2026-06-07 00:55:17,895][344387] Updated weights for policy 0, policy_version 21874 (0.0008) +[2026-06-07 00:55:19,065][344387] Updated weights for policy 0, policy_version 21884 (0.0007) +[2026-06-07 00:55:20,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3788.8, 300 sec: 3741.9). Total num frames: 11206656. Throughput: 0: 3877.7. Samples: 11212396. Policy #0 lag: (min: 3.0, avg: 19.2, max: 39.0) +[2026-06-07 00:55:20,259][343476] Avg episode reward: [(0, '1516.682')] +[2026-06-07 00:55:21,219][344387] Updated weights for policy 0, policy_version 21896 (0.0007) +[2026-06-07 00:55:22,528][344387] Updated weights for policy 0, policy_version 21909 (0.0007) +[2026-06-07 00:55:23,919][344387] Updated weights for policy 0, policy_version 21919 (0.0007) +[2026-06-07 00:55:25,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3822.9, 300 sec: 3735.0). Total num frames: 11225088. Throughput: 0: 3893.4. Samples: 11236096. Policy #0 lag: (min: 3.0, avg: 20.7, max: 35.0) +[2026-06-07 00:55:25,258][343476] Avg episode reward: [(0, '1482.955')] +[2026-06-07 00:55:26,229][344387] Updated weights for policy 0, policy_version 21933 (0.0007) +[2026-06-07 00:55:27,623][344387] Updated weights for policy 0, policy_version 21946 (0.0007) +[2026-06-07 00:55:28,883][344387] Updated weights for policy 0, policy_version 21956 (0.0007) +[2026-06-07 00:55:30,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3822.9, 300 sec: 3741.9). Total num frames: 11243520. Throughput: 0: 3875.2. Samples: 11246714. Policy #0 lag: (min: 3.0, avg: 20.7, max: 35.0) +[2026-06-07 00:55:30,263][343476] Avg episode reward: [(0, '1600.343')] +[2026-06-07 00:55:31,240][344387] Updated weights for policy 0, policy_version 21972 (0.0008) +[2026-06-07 00:55:33,232][344387] Updated weights for policy 0, policy_version 21984 (0.0010) +[2026-06-07 00:55:35,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3857.0, 300 sec: 3735.0). Total num frames: 11261952. Throughput: 0: 3861.2. Samples: 11268788. Policy #0 lag: (min: 3.0, avg: 20.7, max: 35.0) +[2026-06-07 00:55:35,261][343476] Avg episode reward: [(0, '1590.234')] +[2026-06-07 00:55:35,271][344387] Updated weights for policy 0, policy_version 21997 (0.0008) +[2026-06-07 00:55:36,565][344387] Updated weights for policy 0, policy_version 22009 (0.0008) +[2026-06-07 00:55:38,841][344387] Updated weights for policy 0, policy_version 22021 (0.0007) +[2026-06-07 00:55:40,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3822.9, 300 sec: 3735.0). Total num frames: 11280384. Throughput: 0: 3847.2. Samples: 11290828. Policy #0 lag: (min: 5.0, avg: 19.4, max: 37.0) +[2026-06-07 00:55:40,259][343476] Avg episode reward: [(0, '1562.764')] +[2026-06-07 00:55:40,581][344387] Updated weights for policy 0, policy_version 22038 (0.0008) +[2026-06-07 00:55:42,334][344387] Updated weights for policy 0, policy_version 22049 (0.0007) +[2026-06-07 00:55:43,986][344387] Updated weights for policy 0, policy_version 22063 (0.0008) +[2026-06-07 00:55:45,258][343476] Fps is (10 sec: 3891.3, 60 sec: 3822.9, 300 sec: 3741.9). Total num frames: 11300864. Throughput: 0: 3822.2. Samples: 11301946. Policy #0 lag: (min: 5.0, avg: 19.4, max: 37.0) +[2026-06-07 00:55:45,261][343476] Avg episode reward: [(0, '1578.207')] +[2026-06-07 00:55:45,303][344387] Updated weights for policy 0, policy_version 22073 (0.0008) +[2026-06-07 00:55:47,666][344387] Updated weights for policy 0, policy_version 22085 (0.0007) +[2026-06-07 00:55:48,792][344387] Updated weights for policy 0, policy_version 22099 (0.0008) +[2026-06-07 00:55:50,258][343476] Fps is (10 sec: 3891.2, 60 sec: 3857.1, 300 sec: 3748.9). Total num frames: 11319296. Throughput: 0: 3737.2. Samples: 11323294. Policy #0 lag: (min: 5.0, avg: 19.4, max: 37.0) +[2026-06-07 00:55:50,262][343476] Avg episode reward: [(0, '1613.044')] +[2026-06-07 00:55:51,163][344387] Updated weights for policy 0, policy_version 22109 (0.0009) +[2026-06-07 00:55:53,535][344304] Signal inference workers to stop experience collection... (2150 times) +[2026-06-07 00:55:53,547][344387] Updated weights for policy 0, policy_version 22125 (0.0008) +[2026-06-07 00:55:53,557][344387] InferenceWorker_p0-w0: stopping experience collection (2150 times) +[2026-06-07 00:55:53,661][344304] Signal inference workers to resume experience collection... (2150 times) +[2026-06-07 00:55:53,662][344387] InferenceWorker_p0-w0: resuming experience collection (2150 times) +[2026-06-07 00:55:55,257][343476] Fps is (10 sec: 3481.8, 60 sec: 3788.8, 300 sec: 3748.9). Total num frames: 11335680. Throughput: 0: 3709.9. Samples: 11345266. Policy #0 lag: (min: 9.0, avg: 22.8, max: 33.0) +[2026-06-07 00:55:55,259][343476] Avg episode reward: [(0, '1691.304')] +[2026-06-07 00:55:55,438][344387] Updated weights for policy 0, policy_version 22141 (0.0007) +[2026-06-07 00:55:57,105][344387] Updated weights for policy 0, policy_version 22156 (0.0008) +[2026-06-07 00:55:58,233][344387] Updated weights for policy 0, policy_version 22166 (0.0007) +[2026-06-07 00:55:59,964][344387] Updated weights for policy 0, policy_version 22177 (0.0007) +[2026-06-07 00:56:00,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3788.8, 300 sec: 3741.9). Total num frames: 11356160. Throughput: 0: 3701.3. Samples: 11356644. Policy #0 lag: (min: 9.0, avg: 22.8, max: 33.0) +[2026-06-07 00:56:00,263][343476] Avg episode reward: [(0, '1585.942')] +[2026-06-07 00:56:01,377][344387] Updated weights for policy 0, policy_version 22190 (0.0007) +[2026-06-07 00:56:02,258][344387] Updated weights for policy 0, policy_version 22200 (0.0008) +[2026-06-07 00:56:04,516][344387] Updated weights for policy 0, policy_version 22211 (0.0007) +[2026-06-07 00:56:05,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3720.5, 300 sec: 3728.1). Total num frames: 11372544. Throughput: 0: 3723.7. Samples: 11379960. Policy #0 lag: (min: 9.0, avg: 22.8, max: 33.0) +[2026-06-07 00:56:05,259][343476] Avg episode reward: [(0, '1571.918')] +[2026-06-07 00:56:07,030][344387] Updated weights for policy 0, policy_version 22228 (0.0007) +[2026-06-07 00:56:08,681][344387] Updated weights for policy 0, policy_version 22238 (0.0007) +[2026-06-07 00:56:10,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3754.7, 300 sec: 3735.0). Total num frames: 11393024. Throughput: 0: 3697.1. Samples: 11402468. Policy #0 lag: (min: 4.0, avg: 21.4, max: 36.0) +[2026-06-07 00:56:10,261][343476] Avg episode reward: [(0, '1582.295')] +[2026-06-07 00:56:10,546][344387] Updated weights for policy 0, policy_version 22253 (0.0007) +[2026-06-07 00:56:11,949][344387] Updated weights for policy 0, policy_version 22265 (0.0008) +[2026-06-07 00:56:13,588][344387] Updated weights for policy 0, policy_version 22275 (0.0009) +[2026-06-07 00:56:15,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3720.5, 300 sec: 3728.1). Total num frames: 11411456. Throughput: 0: 3699.1. Samples: 11413174. Policy #0 lag: (min: 4.0, avg: 21.4, max: 36.0) +[2026-06-07 00:56:15,260][343476] Avg episode reward: [(0, '1363.320')] +[2026-06-07 00:56:15,277][344387] Updated weights for policy 0, policy_version 22290 (0.0008) +[2026-06-07 00:56:16,600][344387] Updated weights for policy 0, policy_version 22300 (0.0007) +[2026-06-07 00:56:18,809][344387] Updated weights for policy 0, policy_version 22313 (0.0007) +[2026-06-07 00:56:20,032][344387] Updated weights for policy 0, policy_version 22327 (0.0008) +[2026-06-07 00:56:20,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3754.7, 300 sec: 3728.1). Total num frames: 11431936. Throughput: 0: 3712.5. Samples: 11435846. Policy #0 lag: (min: 4.0, avg: 21.4, max: 36.0) +[2026-06-07 00:56:20,259][343476] Avg episode reward: [(0, '1373.054')] +[2026-06-07 00:56:22,063][344387] Updated weights for policy 0, policy_version 22337 (0.0007) +[2026-06-07 00:56:23,506][344387] Updated weights for policy 0, policy_version 22352 (0.0009) +[2026-06-07 00:56:25,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3720.5, 300 sec: 3721.1). Total num frames: 11448320. Throughput: 0: 3685.5. Samples: 11456678. Policy #0 lag: (min: 4.0, avg: 21.4, max: 36.0) +[2026-06-07 00:56:25,260][343476] Avg episode reward: [(0, '1656.884')] +[2026-06-07 00:56:25,669][344387] Updated weights for policy 0, policy_version 22362 (0.0010) +[2026-06-07 00:56:27,581][344387] Updated weights for policy 0, policy_version 22372 (0.0009) +[2026-06-07 00:56:29,236][344387] Updated weights for policy 0, policy_version 22385 (0.0009) +[2026-06-07 00:56:30,258][343476] Fps is (10 sec: 3276.4, 60 sec: 3686.4, 300 sec: 3707.2). Total num frames: 11464704. Throughput: 0: 3652.4. Samples: 11466306. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 00:56:30,262][343476] Avg episode reward: [(0, '1456.681')] +[2026-06-07 00:56:30,713][344387] Updated weights for policy 0, policy_version 22395 (0.0009) +[2026-06-07 00:56:33,548][344387] Updated weights for policy 0, policy_version 22409 (0.0012) +[2026-06-07 00:56:35,216][344387] Updated weights for policy 0, policy_version 22421 (0.0008) +[2026-06-07 00:56:35,258][343476] Fps is (10 sec: 3071.8, 60 sec: 3618.1, 300 sec: 3693.3). Total num frames: 11479040. Throughput: 0: 3572.4. Samples: 11484056. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 00:56:35,261][343476] Avg episode reward: [(0, '1644.976')] +[2026-06-07 00:56:37,457][344387] Updated weights for policy 0, policy_version 22431 (0.0009) +[2026-06-07 00:56:39,118][344387] Updated weights for policy 0, policy_version 22446 (0.0008) +[2026-06-07 00:56:40,066][344387] Updated weights for policy 0, policy_version 22456 (0.0007) +[2026-06-07 00:56:40,257][343476] Fps is (10 sec: 3277.1, 60 sec: 3618.1, 300 sec: 3700.3). Total num frames: 11497472. Throughput: 0: 3541.0. Samples: 11504612. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 00:56:40,260][343476] Avg episode reward: [(0, '1417.370')] +[2026-06-07 00:56:42,193][344387] Updated weights for policy 0, policy_version 22466 (0.0008) +[2026-06-07 00:56:43,355][344387] Updated weights for policy 0, policy_version 22480 (0.0009) +[2026-06-07 00:56:45,133][344387] Updated weights for policy 0, policy_version 22490 (0.0009) +[2026-06-07 00:56:45,257][343476] Fps is (10 sec: 3686.7, 60 sec: 3584.0, 300 sec: 3693.3). Total num frames: 11515904. Throughput: 0: 3551.5. Samples: 11516460. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:56:45,259][343476] Avg episode reward: [(0, '1662.674')] +[2026-06-07 00:56:46,815][344387] Updated weights for policy 0, policy_version 22501 (0.0007) +[2026-06-07 00:56:48,391][344387] Updated weights for policy 0, policy_version 22514 (0.0010) +[2026-06-07 00:56:48,609][344304] Signal inference workers to stop experience collection... (2200 times) +[2026-06-07 00:56:48,628][344304] Signal inference workers to resume experience collection... (2200 times) +[2026-06-07 00:56:48,639][344387] InferenceWorker_p0-w0: stopping experience collection (2200 times) +[2026-06-07 00:56:48,657][344387] InferenceWorker_p0-w0: resuming experience collection (2200 times) +[2026-06-07 00:56:49,532][344387] Updated weights for policy 0, policy_version 22524 (0.0007) +[2026-06-07 00:56:50,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3549.9, 300 sec: 3679.5). Total num frames: 11532288. Throughput: 0: 3515.6. Samples: 11538162. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:56:50,260][343476] Avg episode reward: [(0, '1498.424')] +[2026-06-07 00:56:51,593][344387] Updated weights for policy 0, policy_version 22536 (0.0008) +[2026-06-07 00:56:53,056][344387] Updated weights for policy 0, policy_version 22548 (0.0009) +[2026-06-07 00:56:54,918][344387] Updated weights for policy 0, policy_version 22558 (0.0008) +[2026-06-07 00:56:55,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3584.0, 300 sec: 3679.5). Total num frames: 11550720. Throughput: 0: 3518.2. Samples: 11560790. Policy #0 lag: (min: 3.0, avg: 18.9, max: 35.0) +[2026-06-07 00:56:55,263][343476] Avg episode reward: [(0, '1604.832')] +[2026-06-07 00:56:56,654][344387] Updated weights for policy 0, policy_version 22573 (0.0008) +[2026-06-07 00:56:57,646][344387] Updated weights for policy 0, policy_version 22583 (0.0007) +[2026-06-07 00:56:59,930][344387] Updated weights for policy 0, policy_version 22593 (0.0009) +[2026-06-07 00:57:00,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3549.8, 300 sec: 3679.5). Total num frames: 11569152. Throughput: 0: 3522.3. Samples: 11571678. Policy #0 lag: (min: 3.0, avg: 22.4, max: 35.0) +[2026-06-07 00:57:00,262][343476] Avg episode reward: [(0, '1468.936')] +[2026-06-07 00:57:01,656][344387] Updated weights for policy 0, policy_version 22609 (0.0008) +[2026-06-07 00:57:02,860][344387] Updated weights for policy 0, policy_version 22619 (0.0007) +[2026-06-07 00:57:04,791][344387] Updated weights for policy 0, policy_version 22632 (0.0008) +[2026-06-07 00:57:05,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3618.1, 300 sec: 3686.4). Total num frames: 11589632. Throughput: 0: 3535.0. Samples: 11594922. Policy #0 lag: (min: 3.0, avg: 22.4, max: 35.0) +[2026-06-07 00:57:05,260][343476] Avg episode reward: [(0, '1620.369')] +[2026-06-07 00:57:06,101][344387] Updated weights for policy 0, policy_version 22644 (0.0006) +[2026-06-07 00:57:07,791][344387] Updated weights for policy 0, policy_version 22654 (0.0007) +[2026-06-07 00:57:09,653][344387] Updated weights for policy 0, policy_version 22670 (0.0008) +[2026-06-07 00:57:10,258][343476] Fps is (10 sec: 4096.0, 60 sec: 3618.1, 300 sec: 3686.4). Total num frames: 11610112. Throughput: 0: 3553.2. Samples: 11616570. Policy #0 lag: (min: 3.0, avg: 22.4, max: 35.0) +[2026-06-07 00:57:10,261][343476] Avg episode reward: [(0, '1493.748')] +[2026-06-07 00:57:10,820][344387] Updated weights for policy 0, policy_version 22680 (0.0007) +[2026-06-07 00:57:13,893][344387] Updated weights for policy 0, policy_version 22696 (0.0007) +[2026-06-07 00:57:15,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3549.8, 300 sec: 3672.5). Total num frames: 11624448. Throughput: 0: 3604.1. Samples: 11628490. Policy #0 lag: (min: 4.0, avg: 17.2, max: 36.0) +[2026-06-07 00:57:15,260][343476] Avg episode reward: [(0, '1597.038')] +[2026-06-07 00:57:15,557][344387] Updated weights for policy 0, policy_version 22710 (0.0007) +[2026-06-07 00:57:16,735][344387] Updated weights for policy 0, policy_version 22720 (0.0006) +[2026-06-07 00:57:18,760][344387] Updated weights for policy 0, policy_version 22736 (0.0008) +[2026-06-07 00:57:20,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3549.9, 300 sec: 3686.4). Total num frames: 11644928. Throughput: 0: 3687.5. Samples: 11649990. Policy #0 lag: (min: 4.0, avg: 17.2, max: 36.0) +[2026-06-07 00:57:20,261][343476] Avg episode reward: [(0, '1397.904')] +[2026-06-07 00:57:20,336][344387] Updated weights for policy 0, policy_version 22746 (0.0007) +[2026-06-07 00:57:22,004][344387] Updated weights for policy 0, policy_version 22760 (0.0007) +[2026-06-07 00:57:23,137][344387] Updated weights for policy 0, policy_version 22772 (0.0007) +[2026-06-07 00:57:24,936][344387] Updated weights for policy 0, policy_version 22782 (0.0007) +[2026-06-07 00:57:25,258][343476] Fps is (10 sec: 4096.1, 60 sec: 3618.1, 300 sec: 3686.4). Total num frames: 11665408. Throughput: 0: 3778.7. Samples: 11674654. Policy #0 lag: (min: 4.0, avg: 17.2, max: 36.0) +[2026-06-07 00:57:25,260][343476] Avg episode reward: [(0, '1444.557')] +[2026-06-07 00:57:26,467][344387] Updated weights for policy 0, policy_version 22794 (0.0007) +[2026-06-07 00:57:27,846][344387] Updated weights for policy 0, policy_version 22805 (0.0008) +[2026-06-07 00:57:29,174][344387] Updated weights for policy 0, policy_version 22815 (0.0007) +[2026-06-07 00:57:30,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3652.3, 300 sec: 3686.4). Total num frames: 11683840. Throughput: 0: 3763.8. Samples: 11685830. Policy #0 lag: (min: 1.0, avg: 17.4, max: 33.0) +[2026-06-07 00:57:30,261][343476] Avg episode reward: [(0, '1522.955')] +[2026-06-07 00:57:30,832][344387] Updated weights for policy 0, policy_version 22829 (0.0009) +[2026-06-07 00:57:32,131][344387] Updated weights for policy 0, policy_version 22839 (0.0007) +[2026-06-07 00:57:33,988][344387] Updated weights for policy 0, policy_version 22849 (0.0007) +[2026-06-07 00:57:35,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3720.5, 300 sec: 3686.4). Total num frames: 11702272. Throughput: 0: 3804.4. Samples: 11709360. Policy #0 lag: (min: 1.0, avg: 17.4, max: 33.0) +[2026-06-07 00:57:35,263][343476] Avg episode reward: [(0, '1526.164')] +[2026-06-07 00:57:35,909][344387] Updated weights for policy 0, policy_version 22864 (0.0009) +[2026-06-07 00:57:37,393][344387] Updated weights for policy 0, policy_version 22874 (0.0008) +[2026-06-07 00:57:39,096][344387] Updated weights for policy 0, policy_version 22888 (0.0010) +[2026-06-07 00:57:39,947][344304] Signal inference workers to stop experience collection... (2250 times) +[2026-06-07 00:57:39,976][344387] InferenceWorker_p0-w0: stopping experience collection (2250 times) +[2026-06-07 00:57:40,022][344304] Signal inference workers to resume experience collection... (2250 times) +[2026-06-07 00:57:40,022][344387] InferenceWorker_p0-w0: resuming experience collection (2250 times) +[2026-06-07 00:57:40,205][344387] Updated weights for policy 0, policy_version 22899 (0.0009) +[2026-06-07 00:57:40,257][343476] Fps is (10 sec: 4095.9, 60 sec: 3788.8, 300 sec: 3700.3). Total num frames: 11724800. Throughput: 0: 3782.5. Samples: 11731002. Policy #0 lag: (min: 1.0, avg: 17.4, max: 33.0) +[2026-06-07 00:57:40,260][343476] Avg episode reward: [(0, '1542.137')] +[2026-06-07 00:57:42,412][344387] Updated weights for policy 0, policy_version 22909 (0.0007) +[2026-06-07 00:57:44,551][344387] Updated weights for policy 0, policy_version 22925 (0.0008) +[2026-06-07 00:57:45,258][343476] Fps is (10 sec: 3891.4, 60 sec: 3754.7, 300 sec: 3693.4). Total num frames: 11741184. Throughput: 0: 3801.2. Samples: 11742732. Policy #0 lag: (min: 10.0, avg: 22.0, max: 42.0) +[2026-06-07 00:57:45,260][343476] Avg episode reward: [(0, '1683.336')] +[2026-06-07 00:57:46,348][344387] Updated weights for policy 0, policy_version 22937 (0.0007) +[2026-06-07 00:57:48,169][344387] Updated weights for policy 0, policy_version 22949 (0.0008) +[2026-06-07 00:57:49,711][344387] Updated weights for policy 0, policy_version 22965 (0.0008) +[2026-06-07 00:57:50,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3788.8, 300 sec: 3693.3). Total num frames: 11759616. Throughput: 0: 3764.7. Samples: 11764334. Policy #0 lag: (min: 10.0, avg: 22.0, max: 42.0) +[2026-06-07 00:57:50,260][343476] Avg episode reward: [(0, '1531.192')] +[2026-06-07 00:57:51,918][344387] Updated weights for policy 0, policy_version 22976 (0.0030) +[2026-06-07 00:57:53,736][344387] Updated weights for policy 0, policy_version 22991 (0.0008) +[2026-06-07 00:57:55,215][344387] Updated weights for policy 0, policy_version 23003 (0.0007) +[2026-06-07 00:57:55,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3788.8, 300 sec: 3693.4). Total num frames: 11778048. Throughput: 0: 3767.8. Samples: 11786122. Policy #0 lag: (min: 10.0, avg: 22.0, max: 42.0) +[2026-06-07 00:57:55,259][343476] Avg episode reward: [(0, '1700.764')] +[2026-06-07 00:57:57,262][344387] Updated weights for policy 0, policy_version 23016 (0.0007) +[2026-06-07 00:57:59,101][344387] Updated weights for policy 0, policy_version 23031 (0.0008) +[2026-06-07 00:58:00,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3754.7, 300 sec: 3679.5). Total num frames: 11794432. Throughput: 0: 3763.8. Samples: 11797860. Policy #0 lag: (min: 10.0, avg: 22.0, max: 42.0) +[2026-06-07 00:58:00,261][343476] Avg episode reward: [(0, '1536.623')] +[2026-06-07 00:58:01,106][344387] Updated weights for policy 0, policy_version 23044 (0.0007) +[2026-06-07 00:58:02,614][344387] Updated weights for policy 0, policy_version 23057 (0.0008) +[2026-06-07 00:58:04,129][344387] Updated weights for policy 0, policy_version 23067 (0.0007) +[2026-06-07 00:58:05,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3720.5, 300 sec: 3679.5). Total num frames: 11812864. Throughput: 0: 3766.5. Samples: 11819482. Policy #0 lag: (min: 3.0, avg: 22.1, max: 39.0) +[2026-06-07 00:58:05,263][343476] Avg episode reward: [(0, '1591.881')] +[2026-06-07 00:58:06,322][344387] Updated weights for policy 0, policy_version 23081 (0.0008) +[2026-06-07 00:58:07,705][344387] Updated weights for policy 0, policy_version 23093 (0.0007) +[2026-06-07 00:58:09,219][344387] Updated weights for policy 0, policy_version 23103 (0.0007) +[2026-06-07 00:58:10,258][343476] Fps is (10 sec: 3686.4, 60 sec: 3686.4, 300 sec: 3686.4). Total num frames: 11831296. Throughput: 0: 3721.0. Samples: 11842100. Policy #0 lag: (min: 3.0, avg: 22.1, max: 39.0) +[2026-06-07 00:58:10,263][343476] Avg episode reward: [(0, '1549.732')] +[2026-06-07 00:58:10,985][344387] Updated weights for policy 0, policy_version 23118 (0.0008) +[2026-06-07 00:58:12,310][344387] Updated weights for policy 0, policy_version 23128 (0.0008) +[2026-06-07 00:58:14,074][344387] Updated weights for policy 0, policy_version 23140 (0.0007) +[2026-06-07 00:58:15,246][344387] Updated weights for policy 0, policy_version 23152 (0.0009) +[2026-06-07 00:58:15,257][343476] Fps is (10 sec: 4096.1, 60 sec: 3822.9, 300 sec: 3700.3). Total num frames: 11853824. Throughput: 0: 3725.9. Samples: 11853498. Policy #0 lag: (min: 3.0, avg: 22.1, max: 39.0) +[2026-06-07 00:58:15,260][343476] Avg episode reward: [(0, '1512.408')] +[2026-06-07 00:58:17,291][344387] Updated weights for policy 0, policy_version 23162 (0.0011) +[2026-06-07 00:58:18,904][344387] Updated weights for policy 0, policy_version 23173 (0.0009) +[2026-06-07 00:58:19,811][344387] Updated weights for policy 0, policy_version 23184 (0.0008) +[2026-06-07 00:58:20,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3754.6, 300 sec: 3686.4). Total num frames: 11870208. Throughput: 0: 3680.9. Samples: 11875000. Policy #0 lag: (min: 3.0, avg: 21.2, max: 39.0) +[2026-06-07 00:58:20,265][343476] Avg episode reward: [(0, '1518.359')] +[2026-06-07 00:58:21,699][344387] Updated weights for policy 0, policy_version 23194 (0.0007) +[2026-06-07 00:58:23,210][344387] Updated weights for policy 0, policy_version 23206 (0.0008) +[2026-06-07 00:58:24,780][344387] Updated weights for policy 0, policy_version 23217 (0.0008) +[2026-06-07 00:58:25,258][343476] Fps is (10 sec: 3481.5, 60 sec: 3720.5, 300 sec: 3686.4). Total num frames: 11888640. Throughput: 0: 3699.8. Samples: 11897496. Policy #0 lag: (min: 3.0, avg: 21.2, max: 39.0) +[2026-06-07 00:58:25,260][343476] Avg episode reward: [(0, '1609.672')] +[2026-06-07 00:58:26,084][344387] Updated weights for policy 0, policy_version 23227 (0.0008) +[2026-06-07 00:58:27,545][344387] Updated weights for policy 0, policy_version 23239 (0.0008) +[2026-06-07 00:58:29,288][344387] Updated weights for policy 0, policy_version 23251 (0.0007) +[2026-06-07 00:58:30,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3720.5, 300 sec: 3686.4). Total num frames: 11907072. Throughput: 0: 3696.5. Samples: 11909074. Policy #0 lag: (min: 3.0, avg: 21.2, max: 39.0) +[2026-06-07 00:58:30,261][343476] Avg episode reward: [(0, '1513.501')] +[2026-06-07 00:58:30,823][344387] Updated weights for policy 0, policy_version 23261 (0.0008) +[2026-06-07 00:58:32,028][344387] Updated weights for policy 0, policy_version 23271 (0.0012) +[2026-06-07 00:58:33,657][344387] Updated weights for policy 0, policy_version 23281 (0.0009) +[2026-06-07 00:58:35,149][344387] Updated weights for policy 0, policy_version 23291 (0.0009) +[2026-06-07 00:58:35,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3720.6, 300 sec: 3686.5). Total num frames: 11925504. Throughput: 0: 3686.6. Samples: 11930230. Policy #0 lag: (min: 4.0, avg: 22.1, max: 39.0) +[2026-06-07 00:58:35,260][343476] Avg episode reward: [(0, '1647.591')] +[2026-06-07 00:58:36,738][344304] Signal inference workers to stop experience collection... (2300 times) +[2026-06-07 00:58:36,744][344304] Signal inference workers to resume experience collection... (2300 times) +[2026-06-07 00:58:36,774][344387] InferenceWorker_p0-w0: stopping experience collection (2300 times) +[2026-06-07 00:58:36,774][344387] InferenceWorker_p0-w0: resuming experience collection (2300 times) +[2026-06-07 00:58:36,867][344387] Updated weights for policy 0, policy_version 23301 (0.0011) +[2026-06-07 00:58:37,932][344387] Updated weights for policy 0, policy_version 23311 (0.0011) +[2026-06-07 00:58:40,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3584.0, 300 sec: 3672.5). Total num frames: 11939840. Throughput: 0: 3640.2. Samples: 11949932. Policy #0 lag: (min: 4.0, avg: 22.1, max: 39.0) +[2026-06-07 00:58:40,261][343476] Avg episode reward: [(0, '1560.834')] +[2026-06-07 00:58:40,276][344387] Updated weights for policy 0, policy_version 23321 (0.0011) +[2026-06-07 00:58:41,505][344387] Updated weights for policy 0, policy_version 23331 (0.0009) +[2026-06-07 00:58:42,685][344387] Updated weights for policy 0, policy_version 23342 (0.0009) +[2026-06-07 00:58:44,542][344387] Updated weights for policy 0, policy_version 23352 (0.0009) +[2026-06-07 00:58:45,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3618.1, 300 sec: 3672.5). Total num frames: 11958272. Throughput: 0: 3607.7. Samples: 11960204. Policy #0 lag: (min: 4.0, avg: 22.1, max: 39.0) +[2026-06-07 00:58:45,259][343476] Avg episode reward: [(0, '1505.876')] +[2026-06-07 00:58:46,289][344387] Updated weights for policy 0, policy_version 23362 (0.0010) +[2026-06-07 00:58:47,674][344387] Updated weights for policy 0, policy_version 23373 (0.0011) +[2026-06-07 00:58:49,343][344387] Updated weights for policy 0, policy_version 23383 (0.0008) +[2026-06-07 00:58:50,257][343476] Fps is (10 sec: 3481.5, 60 sec: 3584.0, 300 sec: 3672.5). Total num frames: 11974656. Throughput: 0: 3568.0. Samples: 11980040. Policy #0 lag: (min: 1.0, avg: 20.7, max: 37.0) +[2026-06-07 00:58:50,260][343476] Avg episode reward: [(0, '1492.732')] +[2026-06-07 00:58:51,222][344387] Updated weights for policy 0, policy_version 23393 (0.0010) +[2026-06-07 00:58:52,229][344387] Updated weights for policy 0, policy_version 23404 (0.0009) +[2026-06-07 00:58:54,269][344387] Updated weights for policy 0, policy_version 23415 (0.0010) +[2026-06-07 00:58:55,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3549.9, 300 sec: 3672.5). Total num frames: 11991040. Throughput: 0: 3508.9. Samples: 12000002. Policy #0 lag: (min: 1.0, avg: 20.7, max: 37.0) +[2026-06-07 00:58:55,260][343476] Avg episode reward: [(0, '1708.178')] +[2026-06-07 00:58:55,266][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000023420_11991040.pth... +[2026-06-07 00:58:55,313][344304] Removing results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000003208_1642496.pth +[2026-06-07 00:58:56,115][344387] Updated weights for policy 0, policy_version 23425 (0.0010) +[2026-06-07 00:58:57,312][344387] Updated weights for policy 0, policy_version 23435 (0.0009) +[2026-06-07 00:58:58,981][344387] Updated weights for policy 0, policy_version 23445 (0.0008) +[2026-06-07 00:59:00,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3549.9, 300 sec: 3665.6). Total num frames: 12007424. Throughput: 0: 3485.1. Samples: 12010328. Policy #0 lag: (min: 1.0, avg: 20.7, max: 37.0) +[2026-06-07 00:59:00,259][343476] Avg episode reward: [(0, '1463.078')] +[2026-06-07 00:59:01,026][344387] Updated weights for policy 0, policy_version 23457 (0.0008) +[2026-06-07 00:59:02,216][344387] Updated weights for policy 0, policy_version 23467 (0.0009) +[2026-06-07 00:59:04,046][344387] Updated weights for policy 0, policy_version 23477 (0.0012) +[2026-06-07 00:59:05,258][343476] Fps is (10 sec: 3276.9, 60 sec: 3515.8, 300 sec: 3665.6). Total num frames: 12023808. Throughput: 0: 3441.6. Samples: 12029872. Policy #0 lag: (min: 6.0, avg: 21.4, max: 38.0) +[2026-06-07 00:59:05,263][343476] Avg episode reward: [(0, '1461.039')] +[2026-06-07 00:59:05,772][344387] Updated weights for policy 0, policy_version 23488 (0.0009) +[2026-06-07 00:59:06,855][344387] Updated weights for policy 0, policy_version 23498 (0.0009) +[2026-06-07 00:59:07,982][344387] Updated weights for policy 0, policy_version 23508 (0.0007) +[2026-06-07 00:59:10,243][344387] Updated weights for policy 0, policy_version 23518 (0.0009) +[2026-06-07 00:59:10,257][343476] Fps is (10 sec: 3276.7, 60 sec: 3481.6, 300 sec: 3658.6). Total num frames: 12040192. Throughput: 0: 3405.1. Samples: 12050726. Policy #0 lag: (min: 6.0, avg: 21.4, max: 38.0) +[2026-06-07 00:59:10,261][343476] Avg episode reward: [(0, '1723.343')] +[2026-06-07 00:59:11,554][344387] Updated weights for policy 0, policy_version 23530 (0.0008) +[2026-06-07 00:59:12,478][344387] Updated weights for policy 0, policy_version 23540 (0.0008) +[2026-06-07 00:59:14,542][344387] Updated weights for policy 0, policy_version 23550 (0.0009) +[2026-06-07 00:59:15,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3447.5, 300 sec: 3665.6). Total num frames: 12060672. Throughput: 0: 3393.1. Samples: 12061766. Policy #0 lag: (min: 6.0, avg: 21.4, max: 38.0) +[2026-06-07 00:59:15,264][343476] Avg episode reward: [(0, '1356.947')] +[2026-06-07 00:59:16,044][344387] Updated weights for policy 0, policy_version 23562 (0.0009) +[2026-06-07 00:59:17,110][344387] Updated weights for policy 0, policy_version 23572 (0.0008) +[2026-06-07 00:59:18,878][344387] Updated weights for policy 0, policy_version 23582 (0.0007) +[2026-06-07 00:59:20,258][343476] Fps is (10 sec: 3890.9, 60 sec: 3481.6, 300 sec: 3672.5). Total num frames: 12079104. Throughput: 0: 3432.1. Samples: 12084678. Policy #0 lag: (min: 6.0, avg: 21.4, max: 38.0) +[2026-06-07 00:59:20,262][343476] Avg episode reward: [(0, '1518.969')] +[2026-06-07 00:59:20,355][344387] Updated weights for policy 0, policy_version 23595 (0.0010) +[2026-06-07 00:59:21,994][344387] Updated weights for policy 0, policy_version 23606 (0.0008) +[2026-06-07 00:59:23,427][344387] Updated weights for policy 0, policy_version 23616 (0.0009) +[2026-06-07 00:59:25,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3447.5, 300 sec: 3665.6). Total num frames: 12095488. Throughput: 0: 3466.9. Samples: 12105944. Policy #0 lag: (min: 3.0, avg: 23.0, max: 43.0) +[2026-06-07 00:59:25,260][343476] Avg episode reward: [(0, '1522.358')] +[2026-06-07 00:59:25,484][344387] Updated weights for policy 0, policy_version 23629 (0.0007) +[2026-06-07 00:59:26,731][344387] Updated weights for policy 0, policy_version 23639 (0.0007) +[2026-06-07 00:59:28,596][344387] Updated weights for policy 0, policy_version 23650 (0.0007) +[2026-06-07 00:59:30,257][343476] Fps is (10 sec: 3686.7, 60 sec: 3481.6, 300 sec: 3679.5). Total num frames: 12115968. Throughput: 0: 3476.1. Samples: 12116630. Policy #0 lag: (min: 3.0, avg: 23.0, max: 43.0) +[2026-06-07 00:59:30,258][343476] Avg episode reward: [(0, '1728.587')] +[2026-06-07 00:59:30,337][344387] Updated weights for policy 0, policy_version 23665 (0.0010) +[2026-06-07 00:59:31,904][344387] Updated weights for policy 0, policy_version 23675 (0.0007) +[2026-06-07 00:59:33,695][344387] Updated weights for policy 0, policy_version 23685 (0.0007) +[2026-06-07 00:59:34,910][344387] Updated weights for policy 0, policy_version 23698 (0.0009) +[2026-06-07 00:59:35,258][343476] Fps is (10 sec: 3891.0, 60 sec: 3481.6, 300 sec: 3672.5). Total num frames: 12134400. Throughput: 0: 3535.2. Samples: 12139124. Policy #0 lag: (min: 3.0, avg: 23.0, max: 43.0) +[2026-06-07 00:59:35,263][343476] Avg episode reward: [(0, '1501.206')] +[2026-06-07 00:59:36,336][344387] Updated weights for policy 0, policy_version 23708 (0.0006) +[2026-06-07 00:59:38,349][344387] Updated weights for policy 0, policy_version 23722 (0.0009) +[2026-06-07 00:59:39,384][344387] Updated weights for policy 0, policy_version 23732 (0.0011) +[2026-06-07 00:59:40,258][343476] Fps is (10 sec: 3481.6, 60 sec: 3515.7, 300 sec: 3658.6). Total num frames: 12150784. Throughput: 0: 3556.4. Samples: 12160042. Policy #0 lag: (min: 3.0, avg: 21.2, max: 38.0) +[2026-06-07 00:59:40,259][343476] Avg episode reward: [(0, '1754.058')] +[2026-06-07 00:59:41,673][344387] Updated weights for policy 0, policy_version 23742 (0.0010) +[2026-06-07 00:59:43,059][344387] Updated weights for policy 0, policy_version 23752 (0.0011) +[2026-06-07 00:59:44,534][344387] Updated weights for policy 0, policy_version 23763 (0.0008) +[2026-06-07 00:59:45,258][343476] Fps is (10 sec: 3276.8, 60 sec: 3481.6, 300 sec: 3658.6). Total num frames: 12167168. Throughput: 0: 3546.7. Samples: 12169930. Policy #0 lag: (min: 3.0, avg: 21.2, max: 38.0) +[2026-06-07 00:59:45,260][343476] Avg episode reward: [(0, '1554.672')] +[2026-06-07 00:59:46,755][344387] Updated weights for policy 0, policy_version 23773 (0.0010) +[2026-06-07 00:59:48,250][344387] Updated weights for policy 0, policy_version 23783 (0.0011) +[2026-06-07 00:59:49,789][344387] Updated weights for policy 0, policy_version 23795 (0.0011) +[2026-06-07 00:59:50,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3481.6, 300 sec: 3644.7). Total num frames: 12183552. Throughput: 0: 3532.4. Samples: 12188832. Policy #0 lag: (min: 3.0, avg: 21.2, max: 38.0) +[2026-06-07 00:59:50,261][343476] Avg episode reward: [(0, '1399.700')] +[2026-06-07 00:59:51,809][344387] Updated weights for policy 0, policy_version 23805 (0.0008) +[2026-06-07 00:59:53,063][344387] Updated weights for policy 0, policy_version 23815 (0.0008) +[2026-06-07 00:59:54,385][344387] Updated weights for policy 0, policy_version 23827 (0.0008) +[2026-06-07 00:59:55,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3481.6, 300 sec: 3630.9). Total num frames: 12199936. Throughput: 0: 3528.7. Samples: 12209516. Policy #0 lag: (min: 3.0, avg: 18.8, max: 37.0) +[2026-06-07 00:59:55,260][343476] Avg episode reward: [(0, '1651.744')] +[2026-06-07 00:59:56,270][344387] Updated weights for policy 0, policy_version 23837 (0.0009) +[2026-06-07 00:59:57,699][344304] Signal inference workers to stop experience collection... (2350 times) +[2026-06-07 00:59:57,730][344387] InferenceWorker_p0-w0: stopping experience collection (2350 times) +[2026-06-07 00:59:57,821][344304] Signal inference workers to resume experience collection... (2350 times) +[2026-06-07 00:59:57,822][344387] InferenceWorker_p0-w0: resuming experience collection (2350 times) +[2026-06-07 00:59:58,063][344387] Updated weights for policy 0, policy_version 23849 (0.0010) +[2026-06-07 00:59:59,748][344387] Updated weights for policy 0, policy_version 23861 (0.0007) +[2026-06-07 01:00:00,258][343476] Fps is (10 sec: 3481.8, 60 sec: 3515.7, 300 sec: 3623.9). Total num frames: 12218368. Throughput: 0: 3541.8. Samples: 12221144. Policy #0 lag: (min: 3.0, avg: 18.8, max: 37.0) +[2026-06-07 01:00:00,263][343476] Avg episode reward: [(0, '1424.789')] +[2026-06-07 01:00:01,073][344387] Updated weights for policy 0, policy_version 23871 (0.0008) +[2026-06-07 01:00:02,761][344387] Updated weights for policy 0, policy_version 23884 (0.0009) +[2026-06-07 01:00:04,326][344387] Updated weights for policy 0, policy_version 23894 (0.0007) +[2026-06-07 01:00:05,257][343476] Fps is (10 sec: 3686.5, 60 sec: 3549.9, 300 sec: 3623.9). Total num frames: 12236800. Throughput: 0: 3494.7. Samples: 12241936. Policy #0 lag: (min: 3.0, avg: 18.8, max: 37.0) +[2026-06-07 01:00:05,260][343476] Avg episode reward: [(0, '1583.068')] +[2026-06-07 01:00:05,899][344387] Updated weights for policy 0, policy_version 23906 (0.0007) +[2026-06-07 01:00:07,712][344387] Updated weights for policy 0, policy_version 23921 (0.0008) +[2026-06-07 01:00:09,122][344387] Updated weights for policy 0, policy_version 23931 (0.0007) +[2026-06-07 01:00:10,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3618.1, 300 sec: 3623.9). Total num frames: 12257280. Throughput: 0: 3543.5. Samples: 12265402. Policy #0 lag: (min: 3.0, avg: 19.3, max: 36.0) +[2026-06-07 01:00:10,259][343476] Avg episode reward: [(0, '1610.943')] +[2026-06-07 01:00:11,009][344387] Updated weights for policy 0, policy_version 23942 (0.0007) +[2026-06-07 01:00:11,998][344387] Updated weights for policy 0, policy_version 23954 (0.0008) +[2026-06-07 01:00:13,293][344387] Updated weights for policy 0, policy_version 23964 (0.0007) +[2026-06-07 01:00:15,180][344387] Updated weights for policy 0, policy_version 23977 (0.0008) +[2026-06-07 01:00:15,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3584.0, 300 sec: 3623.9). Total num frames: 12275712. Throughput: 0: 3567.7. Samples: 12277178. Policy #0 lag: (min: 3.0, avg: 19.3, max: 36.0) +[2026-06-07 01:00:15,259][343476] Avg episode reward: [(0, '1687.782')] +[2026-06-07 01:00:16,290][344387] Updated weights for policy 0, policy_version 23987 (0.0009) +[2026-06-07 01:00:18,023][344387] Updated weights for policy 0, policy_version 23997 (0.0007) +[2026-06-07 01:00:19,376][344387] Updated weights for policy 0, policy_version 24008 (0.0007) +[2026-06-07 01:00:20,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3618.2, 300 sec: 3630.9). Total num frames: 12296192. Throughput: 0: 3590.5. Samples: 12300692. Policy #0 lag: (min: 3.0, avg: 19.3, max: 36.0) +[2026-06-07 01:00:20,259][343476] Avg episode reward: [(0, '1505.528')] +[2026-06-07 01:00:20,408][344387] Updated weights for policy 0, policy_version 24019 (0.0008) +[2026-06-07 01:00:22,315][344387] Updated weights for policy 0, policy_version 24029 (0.0008) +[2026-06-07 01:00:24,342][344387] Updated weights for policy 0, policy_version 24045 (0.0008) +[2026-06-07 01:00:25,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3652.3, 300 sec: 3630.9). Total num frames: 12314624. Throughput: 0: 3611.5. Samples: 12322558. Policy #0 lag: (min: 3.0, avg: 19.3, max: 36.0) +[2026-06-07 01:00:25,260][343476] Avg episode reward: [(0, '1385.952')] +[2026-06-07 01:00:25,746][344387] Updated weights for policy 0, policy_version 24055 (0.0008) +[2026-06-07 01:00:27,225][344387] Updated weights for policy 0, policy_version 24067 (0.0007) +[2026-06-07 01:00:29,158][344387] Updated weights for policy 0, policy_version 24082 (0.0008) +[2026-06-07 01:00:30,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3618.1, 300 sec: 3630.9). Total num frames: 12333056. Throughput: 0: 3652.4. Samples: 12334284. Policy #0 lag: (min: 6.0, avg: 21.9, max: 38.0) +[2026-06-07 01:00:30,259][343476] Avg episode reward: [(0, '1519.300')] +[2026-06-07 01:00:31,163][344387] Updated weights for policy 0, policy_version 24093 (0.0008) +[2026-06-07 01:00:33,010][344387] Updated weights for policy 0, policy_version 24110 (0.0008) +[2026-06-07 01:00:34,499][344387] Updated weights for policy 0, policy_version 24120 (0.0007) +[2026-06-07 01:00:35,257][343476] Fps is (10 sec: 3686.6, 60 sec: 3618.2, 300 sec: 3630.9). Total num frames: 12351488. Throughput: 0: 3723.6. Samples: 12356392. Policy #0 lag: (min: 6.0, avg: 21.9, max: 38.0) +[2026-06-07 01:00:35,259][343476] Avg episode reward: [(0, '1582.487')] +[2026-06-07 01:00:35,811][344387] Updated weights for policy 0, policy_version 24132 (0.0006) +[2026-06-07 01:00:37,215][344387] Updated weights for policy 0, policy_version 24143 (0.0007) +[2026-06-07 01:00:38,928][344387] Updated weights for policy 0, policy_version 24153 (0.0007) +[2026-06-07 01:00:39,669][344387] Updated weights for policy 0, policy_version 24163 (0.0007) +[2026-06-07 01:00:40,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3686.4, 300 sec: 3630.9). Total num frames: 12371968. Throughput: 0: 3822.6. Samples: 12381534. Policy #0 lag: (min: 6.0, avg: 21.9, max: 38.0) +[2026-06-07 01:00:40,262][343476] Avg episode reward: [(0, '1547.366')] +[2026-06-07 01:00:41,521][344387] Updated weights for policy 0, policy_version 24179 (0.0008) +[2026-06-07 01:00:43,638][344387] Updated weights for policy 0, policy_version 24190 (0.0008) +[2026-06-07 01:00:45,207][344387] Updated weights for policy 0, policy_version 24202 (0.0007) +[2026-06-07 01:00:45,257][343476] Fps is (10 sec: 3891.0, 60 sec: 3720.6, 300 sec: 3630.9). Total num frames: 12390400. Throughput: 0: 3808.4. Samples: 12392522. Policy #0 lag: (min: 0.0, avg: 18.2, max: 32.0) +[2026-06-07 01:00:45,260][343476] Avg episode reward: [(0, '1538.959')] +[2026-06-07 01:00:45,517][344304] Signal inference workers to stop experience collection... (2400 times) +[2026-06-07 01:00:45,534][344387] InferenceWorker_p0-w0: stopping experience collection (2400 times) +[2026-06-07 01:00:45,621][344304] Signal inference workers to resume experience collection... (2400 times) +[2026-06-07 01:00:45,622][344387] InferenceWorker_p0-w0: resuming experience collection (2400 times) +[2026-06-07 01:00:46,963][344387] Updated weights for policy 0, policy_version 24215 (0.0007) +[2026-06-07 01:00:48,225][344387] Updated weights for policy 0, policy_version 24227 (0.0007) +[2026-06-07 01:00:49,949][344387] Updated weights for policy 0, policy_version 24242 (0.0007) +[2026-06-07 01:00:50,258][343476] Fps is (10 sec: 4096.0, 60 sec: 3822.9, 300 sec: 3651.7). Total num frames: 12412928. Throughput: 0: 3871.8. Samples: 12416170. Policy #0 lag: (min: 0.0, avg: 18.2, max: 32.0) +[2026-06-07 01:00:50,261][343476] Avg episode reward: [(0, '1402.204')] +[2026-06-07 01:00:52,026][344387] Updated weights for policy 0, policy_version 24253 (0.0007) +[2026-06-07 01:00:53,348][344387] Updated weights for policy 0, policy_version 24264 (0.0009) +[2026-06-07 01:00:55,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3823.0, 300 sec: 3637.8). Total num frames: 12429312. Throughput: 0: 3828.0. Samples: 12437664. Policy #0 lag: (min: 0.0, avg: 18.2, max: 32.0) +[2026-06-07 01:00:55,260][343476] Avg episode reward: [(0, '1473.603')] +[2026-06-07 01:00:55,753][344387] Updated weights for policy 0, policy_version 24277 (0.0010) +[2026-06-07 01:00:56,980][344387] Updated weights for policy 0, policy_version 24289 (0.0008) +[2026-06-07 01:00:58,719][344387] Updated weights for policy 0, policy_version 24306 (0.0007) +[2026-06-07 01:01:00,257][343476] Fps is (10 sec: 3481.7, 60 sec: 3822.9, 300 sec: 3644.7). Total num frames: 12447744. Throughput: 0: 3841.6. Samples: 12450052. Policy #0 lag: (min: 2.0, avg: 21.7, max: 34.0) +[2026-06-07 01:01:00,260][343476] Avg episode reward: [(0, '1567.010')] +[2026-06-07 01:01:00,536][344387] Updated weights for policy 0, policy_version 24316 (0.0007) +[2026-06-07 01:01:01,869][344387] Updated weights for policy 0, policy_version 24328 (0.0007) +[2026-06-07 01:01:04,137][344387] Updated weights for policy 0, policy_version 24342 (0.0008) +[2026-06-07 01:01:05,026][344387] Updated weights for policy 0, policy_version 24352 (0.0007) +[2026-06-07 01:01:05,258][343476] Fps is (10 sec: 3891.1, 60 sec: 3857.0, 300 sec: 3644.7). Total num frames: 12468224. Throughput: 0: 3829.5. Samples: 12473024. Policy #0 lag: (min: 2.0, avg: 21.7, max: 34.0) +[2026-06-07 01:01:05,261][343476] Avg episode reward: [(0, '1595.913')] +[2026-06-07 01:01:07,037][344387] Updated weights for policy 0, policy_version 24369 (0.0007) +[2026-06-07 01:01:08,779][344387] Updated weights for policy 0, policy_version 24379 (0.0006) +[2026-06-07 01:01:09,920][344387] Updated weights for policy 0, policy_version 24389 (0.0007) +[2026-06-07 01:01:10,258][343476] Fps is (10 sec: 4095.9, 60 sec: 3857.0, 300 sec: 3651.7). Total num frames: 12488704. Throughput: 0: 3878.1. Samples: 12497074. Policy #0 lag: (min: 2.0, avg: 21.7, max: 34.0) +[2026-06-07 01:01:10,262][343476] Avg episode reward: [(0, '1664.706')] +[2026-06-07 01:01:11,047][344387] Updated weights for policy 0, policy_version 24403 (0.0008) +[2026-06-07 01:01:13,195][344387] Updated weights for policy 0, policy_version 24413 (0.0007) +[2026-06-07 01:01:14,620][344387] Updated weights for policy 0, policy_version 24425 (0.0007) +[2026-06-07 01:01:15,257][343476] Fps is (10 sec: 4096.2, 60 sec: 3891.2, 300 sec: 3651.7). Total num frames: 12509184. Throughput: 0: 3880.0. Samples: 12508886. Policy #0 lag: (min: 2.0, avg: 21.7, max: 34.0) +[2026-06-07 01:01:15,260][343476] Avg episode reward: [(0, '1674.064')] +[2026-06-07 01:01:16,259][344387] Updated weights for policy 0, policy_version 24437 (0.0007) +[2026-06-07 01:01:17,833][344387] Updated weights for policy 0, policy_version 24450 (0.0007) +[2026-06-07 01:01:19,064][344387] Updated weights for policy 0, policy_version 24463 (0.0008) +[2026-06-07 01:01:20,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3857.0, 300 sec: 3658.6). Total num frames: 12527616. Throughput: 0: 3914.3. Samples: 12532536. Policy #0 lag: (min: 3.0, avg: 19.3, max: 35.0) +[2026-06-07 01:01:20,260][343476] Avg episode reward: [(0, '1742.699')] +[2026-06-07 01:01:21,162][344387] Updated weights for policy 0, policy_version 24473 (0.0006) +[2026-06-07 01:01:22,983][344387] Updated weights for policy 0, policy_version 24489 (0.0007) +[2026-06-07 01:01:24,650][344387] Updated weights for policy 0, policy_version 24501 (0.0007) +[2026-06-07 01:01:25,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3857.1, 300 sec: 3665.6). Total num frames: 12546048. Throughput: 0: 3890.6. Samples: 12556612. Policy #0 lag: (min: 3.0, avg: 19.3, max: 35.0) +[2026-06-07 01:01:25,261][343476] Avg episode reward: [(0, '1633.393')] +[2026-06-07 01:01:25,609][344387] Updated weights for policy 0, policy_version 24512 (0.0007) +[2026-06-07 01:01:27,374][344387] Updated weights for policy 0, policy_version 24526 (0.0008) +[2026-06-07 01:01:28,773][344387] Updated weights for policy 0, policy_version 24536 (0.0007) +[2026-06-07 01:01:30,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3891.2, 300 sec: 3686.4). Total num frames: 12566528. Throughput: 0: 3905.3. Samples: 12568260. Policy #0 lag: (min: 3.0, avg: 19.3, max: 35.0) +[2026-06-07 01:01:30,259][343476] Avg episode reward: [(0, '1534.005')] +[2026-06-07 01:01:30,807][344387] Updated weights for policy 0, policy_version 24549 (0.0008) +[2026-06-07 01:01:30,945][344304] Signal inference workers to stop experience collection... (2450 times) +[2026-06-07 01:01:30,958][344387] InferenceWorker_p0-w0: stopping experience collection (2450 times) +[2026-06-07 01:01:31,020][344304] Signal inference workers to resume experience collection... (2450 times) +[2026-06-07 01:01:31,021][344387] InferenceWorker_p0-w0: resuming experience collection (2450 times) +[2026-06-07 01:01:32,125][344387] Updated weights for policy 0, policy_version 24561 (0.0018) +[2026-06-07 01:01:33,304][344387] Updated weights for policy 0, policy_version 24571 (0.0006) +[2026-06-07 01:01:35,036][344387] Updated weights for policy 0, policy_version 24584 (0.0007) +[2026-06-07 01:01:35,258][343476] Fps is (10 sec: 4095.9, 60 sec: 3925.3, 300 sec: 3693.3). Total num frames: 12587008. Throughput: 0: 3923.9. Samples: 12592746. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:01:35,262][343476] Avg episode reward: [(0, '1529.450')] +[2026-06-07 01:01:36,476][344387] Updated weights for policy 0, policy_version 24596 (0.0008) +[2026-06-07 01:01:37,786][344387] Updated weights for policy 0, policy_version 24606 (0.0007) +[2026-06-07 01:01:39,794][344387] Updated weights for policy 0, policy_version 24621 (0.0007) +[2026-06-07 01:01:40,257][343476] Fps is (10 sec: 4096.1, 60 sec: 3925.4, 300 sec: 3700.3). Total num frames: 12607488. Throughput: 0: 3950.6. Samples: 12615440. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:01:40,259][343476] Avg episode reward: [(0, '1606.657')] +[2026-06-07 01:01:41,266][344387] Updated weights for policy 0, policy_version 24632 (0.0008) +[2026-06-07 01:01:43,407][344387] Updated weights for policy 0, policy_version 24644 (0.0008) +[2026-06-07 01:01:45,199][344387] Updated weights for policy 0, policy_version 24658 (0.0007) +[2026-06-07 01:01:45,258][343476] Fps is (10 sec: 3891.2, 60 sec: 3925.3, 300 sec: 3707.2). Total num frames: 12625920. Throughput: 0: 3940.4. Samples: 12627370. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:01:45,261][343476] Avg episode reward: [(0, '1583.390')] +[2026-06-07 01:01:46,205][344387] Updated weights for policy 0, policy_version 24668 (0.0006) +[2026-06-07 01:01:48,436][344387] Updated weights for policy 0, policy_version 24684 (0.0010) +[2026-06-07 01:01:49,996][344387] Updated weights for policy 0, policy_version 24694 (0.0008) +[2026-06-07 01:01:50,258][343476] Fps is (10 sec: 3686.2, 60 sec: 3857.1, 300 sec: 3707.2). Total num frames: 12644352. Throughput: 0: 3907.2. Samples: 12648848. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:01:50,261][343476] Avg episode reward: [(0, '1632.823')] +[2026-06-07 01:01:50,992][344387] Updated weights for policy 0, policy_version 24704 (0.0009) +[2026-06-07 01:01:53,043][344387] Updated weights for policy 0, policy_version 24719 (0.0009) +[2026-06-07 01:01:55,041][344387] Updated weights for policy 0, policy_version 24729 (0.0009) +[2026-06-07 01:01:55,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3891.2, 300 sec: 3707.2). Total num frames: 12662784. Throughput: 0: 3861.2. Samples: 12670828. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:01:55,263][343476] Avg episode reward: [(0, '1434.894')] +[2026-06-07 01:01:56,791][344387] Updated weights for policy 0, policy_version 24740 (0.0009) +[2026-06-07 01:01:59,049][344387] Updated weights for policy 0, policy_version 24756 (0.0009) +[2026-06-07 01:02:00,124][344387] Updated weights for policy 0, policy_version 24766 (0.0007) +[2026-06-07 01:02:00,258][343476] Fps is (10 sec: 3686.5, 60 sec: 3891.2, 300 sec: 3700.3). Total num frames: 12681216. Throughput: 0: 3825.4. Samples: 12681030. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:02:00,260][343476] Avg episode reward: [(0, '1542.844')] +[2026-06-07 01:02:01,874][344387] Updated weights for policy 0, policy_version 24777 (0.0008) +[2026-06-07 01:02:03,587][344387] Updated weights for policy 0, policy_version 24791 (0.0008) +[2026-06-07 01:02:05,258][343476] Fps is (10 sec: 3481.7, 60 sec: 3823.0, 300 sec: 3686.4). Total num frames: 12697600. Throughput: 0: 3800.5. Samples: 12703560. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:02:05,265][343476] Avg episode reward: [(0, '1462.244')] +[2026-06-07 01:02:05,546][344387] Updated weights for policy 0, policy_version 24801 (0.0007) +[2026-06-07 01:02:06,752][344387] Updated weights for policy 0, policy_version 24816 (0.0008) +[2026-06-07 01:02:08,485][344387] Updated weights for policy 0, policy_version 24827 (0.0008) +[2026-06-07 01:02:10,258][343476] Fps is (10 sec: 3481.4, 60 sec: 3788.8, 300 sec: 3700.3). Total num frames: 12716032. Throughput: 0: 3764.3. Samples: 12726010. Policy #0 lag: (min: 15.0, avg: 25.9, max: 44.0) +[2026-06-07 01:02:10,262][343476] Avg episode reward: [(0, '1657.032')] +[2026-06-07 01:02:10,554][344387] Updated weights for policy 0, policy_version 24840 (0.0007) +[2026-06-07 01:02:12,501][344387] Updated weights for policy 0, policy_version 24854 (0.0010) +[2026-06-07 01:02:13,552][344387] Updated weights for policy 0, policy_version 24864 (0.0007) +[2026-06-07 01:02:15,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3754.6, 300 sec: 3693.3). Total num frames: 12734464. Throughput: 0: 3733.1. Samples: 12736250. Policy #0 lag: (min: 15.0, avg: 25.9, max: 44.0) +[2026-06-07 01:02:15,262][343476] Avg episode reward: [(0, '1722.341')] +[2026-06-07 01:02:15,666][344387] Updated weights for policy 0, policy_version 24879 (0.0008) +[2026-06-07 01:02:17,460][344387] Updated weights for policy 0, policy_version 24891 (0.0008) +[2026-06-07 01:02:19,320][344387] Updated weights for policy 0, policy_version 24904 (0.0007) +[2026-06-07 01:02:20,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3788.8, 300 sec: 3693.3). Total num frames: 12754944. Throughput: 0: 3703.7. Samples: 12759410. Policy #0 lag: (min: 15.0, avg: 25.9, max: 44.0) +[2026-06-07 01:02:20,260][343476] Avg episode reward: [(0, '1539.758')] +[2026-06-07 01:02:21,080][344387] Updated weights for policy 0, policy_version 24916 (0.0008) +[2026-06-07 01:02:22,241][344387] Updated weights for policy 0, policy_version 24926 (0.0007) +[2026-06-07 01:02:23,886][344387] Updated weights for policy 0, policy_version 24937 (0.0009) +[2026-06-07 01:02:25,257][343476] Fps is (10 sec: 3686.4, 60 sec: 3754.7, 300 sec: 3686.4). Total num frames: 12771328. Throughput: 0: 3658.9. Samples: 12780092. Policy #0 lag: (min: 7.0, avg: 20.2, max: 39.0) +[2026-06-07 01:02:25,260][343476] Avg episode reward: [(0, '1619.925')] +[2026-06-07 01:02:25,761][344304] Signal inference workers to stop experience collection... (2500 times) +[2026-06-07 01:02:25,778][344304] Signal inference workers to resume experience collection... (2500 times) +[2026-06-07 01:02:25,794][344387] InferenceWorker_p0-w0: stopping experience collection (2500 times) +[2026-06-07 01:02:25,814][344387] InferenceWorker_p0-w0: resuming experience collection (2500 times) +[2026-06-07 01:02:25,892][344387] Updated weights for policy 0, policy_version 24949 (0.0012) +[2026-06-07 01:02:27,127][344387] Updated weights for policy 0, policy_version 24959 (0.0009) +[2026-06-07 01:02:28,825][344387] Updated weights for policy 0, policy_version 24971 (0.0011) +[2026-06-07 01:02:30,257][343476] Fps is (10 sec: 3276.9, 60 sec: 3686.4, 300 sec: 3679.5). Total num frames: 12787712. Throughput: 0: 3628.8. Samples: 12790664. Policy #0 lag: (min: 7.0, avg: 20.2, max: 39.0) +[2026-06-07 01:02:30,260][343476] Avg episode reward: [(0, '1587.629')] +[2026-06-07 01:02:30,983][344387] Updated weights for policy 0, policy_version 24981 (0.0008) +[2026-06-07 01:02:32,508][344387] Updated weights for policy 0, policy_version 24992 (0.0009) +[2026-06-07 01:02:34,779][344387] Updated weights for policy 0, policy_version 25006 (0.0010) +[2026-06-07 01:02:35,257][343476] Fps is (10 sec: 3277.0, 60 sec: 3618.2, 300 sec: 3658.6). Total num frames: 12804096. Throughput: 0: 3552.3. Samples: 12808698. Policy #0 lag: (min: 7.0, avg: 20.2, max: 39.0) +[2026-06-07 01:02:35,261][343476] Avg episode reward: [(0, '1525.826')] +[2026-06-07 01:02:36,374][344387] Updated weights for policy 0, policy_version 25016 (0.0010) +[2026-06-07 01:02:38,687][344387] Updated weights for policy 0, policy_version 25028 (0.0009) +[2026-06-07 01:02:39,803][344387] Updated weights for policy 0, policy_version 25039 (0.0011) +[2026-06-07 01:02:40,257][343476] Fps is (10 sec: 3276.8, 60 sec: 3549.9, 300 sec: 3658.6). Total num frames: 12820480. Throughput: 0: 3490.6. Samples: 12827904. Policy #0 lag: (min: 7.0, avg: 20.2, max: 39.0) +[2026-06-07 01:02:40,260][343476] Avg episode reward: [(0, '1545.863')] +[2026-06-07 01:02:41,950][344387] Updated weights for policy 0, policy_version 25049 (0.0007) +[2026-06-07 01:02:44,013][344387] Updated weights for policy 0, policy_version 25065 (0.0009) +[2026-06-07 01:02:45,258][343476] Fps is (10 sec: 3276.7, 60 sec: 3515.8, 300 sec: 3651.7). Total num frames: 12836864. Throughput: 0: 3529.9. Samples: 12839876. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:02:45,260][343476] Avg episode reward: [(0, '1623.592')] +[2026-06-07 01:02:45,588][344387] Updated weights for policy 0, policy_version 25080 (0.0009) +[2026-06-07 01:02:47,919][344387] Updated weights for policy 0, policy_version 25094 (0.0009) +[2026-06-07 01:02:49,781][344387] Updated weights for policy 0, policy_version 25108 (0.0009) +[2026-06-07 01:02:50,257][343476] Fps is (10 sec: 3686.3, 60 sec: 3549.9, 300 sec: 3658.6). Total num frames: 12857344. Throughput: 0: 3516.1. Samples: 12861784. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:02:50,260][343476] Avg episode reward: [(0, '1687.860')] +[2026-06-07 01:02:50,868][344387] Updated weights for policy 0, policy_version 25119 (0.0007) +[2026-06-07 01:02:53,193][344387] Updated weights for policy 0, policy_version 25135 (0.0007) +[2026-06-07 01:02:54,788][344387] Updated weights for policy 0, policy_version 25145 (0.0007) +[2026-06-07 01:02:55,258][343476] Fps is (10 sec: 4096.0, 60 sec: 3584.0, 300 sec: 3672.5). Total num frames: 12877824. Throughput: 0: 3541.3. Samples: 12885366. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:02:55,263][343476] Avg episode reward: [(0, '1585.578')] +[2026-06-07 01:02:56,509][344387] Updated weights for policy 0, policy_version 25158 (0.0008) +[2026-06-07 01:02:58,442][344387] Updated weights for policy 0, policy_version 25172 (0.0011) +[2026-06-07 01:02:59,701][344387] Updated weights for policy 0, policy_version 25184 (0.0007) +[2026-06-07 01:03:00,258][343476] Fps is (10 sec: 3686.3, 60 sec: 3549.9, 300 sec: 3665.6). Total num frames: 12894208. Throughput: 0: 3557.5. Samples: 12896340. Policy #0 lag: (min: 4.0, avg: 20.3, max: 40.0) +[2026-06-07 01:03:00,261][343476] Avg episode reward: [(0, '1476.577')] +[2026-06-07 01:03:01,550][344387] Updated weights for policy 0, policy_version 25197 (0.0007) +[2026-06-07 01:03:02,602][344387] Updated weights for policy 0, policy_version 25207 (0.0008) +[2026-06-07 01:03:04,797][344387] Updated weights for policy 0, policy_version 25221 (0.0008) +[2026-06-07 01:03:05,263][343476] Fps is (10 sec: 3891.2, 60 sec: 3652.3, 300 sec: 3679.5). Total num frames: 12916736. Throughput: 0: 3568.4. Samples: 12919988. Policy #0 lag: (min: 4.0, avg: 20.3, max: 40.0) +[2026-06-07 01:03:05,291][343476] Avg episode reward: [(0, '1393.361')] +[2026-06-07 01:03:05,687][344387] Updated weights for policy 0, policy_version 25232 (0.0007) +[2026-06-07 01:03:07,445][344387] Updated weights for policy 0, policy_version 25244 (0.0007) +[2026-06-07 01:03:09,006][344387] Updated weights for policy 0, policy_version 25256 (0.0007) +[2026-06-07 01:03:10,258][343476] Fps is (10 sec: 4095.9, 60 sec: 3652.3, 300 sec: 3665.6). Total num frames: 12935168. Throughput: 0: 3649.9. Samples: 12944338. Policy #0 lag: (min: 4.0, avg: 20.3, max: 40.0) +[2026-06-07 01:03:10,260][343476] Avg episode reward: [(0, '1580.819')] +[2026-06-07 01:03:10,261][344387] Updated weights for policy 0, policy_version 25266 (0.0006) +[2026-06-07 01:03:11,486][344387] Updated weights for policy 0, policy_version 25278 (0.0007) +[2026-06-07 01:03:12,959][344387] Updated weights for policy 0, policy_version 25289 (0.0007) +[2026-06-07 01:03:14,137][344387] Updated weights for policy 0, policy_version 25299 (0.0008) +[2026-06-07 01:03:15,257][343476] Fps is (10 sec: 3891.3, 60 sec: 3686.4, 300 sec: 3679.5). Total num frames: 12955648. Throughput: 0: 3707.7. Samples: 12957510. Policy #0 lag: (min: 4.0, avg: 20.3, max: 40.0) +[2026-06-07 01:03:15,259][343476] Avg episode reward: [(0, '1491.924')] +[2026-06-07 01:03:16,112][344387] Updated weights for policy 0, policy_version 25313 (0.0008) +[2026-06-07 01:03:17,231][344387] Updated weights for policy 0, policy_version 25325 (0.0008) +[2026-06-07 01:03:18,664][344387] Updated weights for policy 0, policy_version 25336 (0.0007) +[2026-06-07 01:03:20,258][343476] Fps is (10 sec: 4096.1, 60 sec: 3686.4, 300 sec: 3686.4). Total num frames: 12976128. Throughput: 0: 3872.6. Samples: 12982966. Policy #0 lag: (min: 4.0, avg: 17.6, max: 36.0) +[2026-06-07 01:03:20,262][343476] Avg episode reward: [(0, '1337.487')] +[2026-06-07 01:03:20,625][344387] Updated weights for policy 0, policy_version 25349 (0.0007) +[2026-06-07 01:03:21,966][344387] Updated weights for policy 0, policy_version 25361 (0.0007) +[2026-06-07 01:03:22,671][344304] Signal inference workers to stop experience collection... (2550 times) +[2026-06-07 01:03:22,695][344387] InferenceWorker_p0-w0: stopping experience collection (2550 times) +[2026-06-07 01:03:22,791][344304] Signal inference workers to resume experience collection... (2550 times) +[2026-06-07 01:03:22,792][344387] InferenceWorker_p0-w0: resuming experience collection (2550 times) +[2026-06-07 01:03:23,344][344387] Updated weights for policy 0, policy_version 25375 (0.0008) +[2026-06-07 01:03:25,257][343476] Fps is (10 sec: 4300.8, 60 sec: 3788.8, 300 sec: 3700.3). Total num frames: 12998656. Throughput: 0: 3983.1. Samples: 13007144. Policy #0 lag: (min: 4.0, avg: 17.6, max: 36.0) +[2026-06-07 01:03:25,259][343476] Avg episode reward: [(0, '1655.866')] +[2026-06-07 01:03:25,373][344387] Updated weights for policy 0, policy_version 25389 (0.0007) +[2026-06-07 01:03:26,923][344387] Updated weights for policy 0, policy_version 25401 (0.0006) +[2026-06-07 01:03:28,741][344387] Updated weights for policy 0, policy_version 25416 (0.0006) +[2026-06-07 01:03:30,125][344387] Updated weights for policy 0, policy_version 25426 (0.0007) +[2026-06-07 01:03:30,258][343476] Fps is (10 sec: 4300.8, 60 sec: 3857.0, 300 sec: 3707.2). Total num frames: 13019136. Throughput: 0: 3990.5. Samples: 13019448. Policy #0 lag: (min: 4.0, avg: 17.6, max: 36.0) +[2026-06-07 01:03:30,261][343476] Avg episode reward: [(0, '1676.895')] +[2026-06-07 01:03:31,141][344387] Updated weights for policy 0, policy_version 25436 (0.0006) +[2026-06-07 01:03:32,952][344387] Updated weights for policy 0, policy_version 25449 (0.0008) +[2026-06-07 01:03:34,319][344387] Updated weights for policy 0, policy_version 25459 (0.0007) +[2026-06-07 01:03:35,257][343476] Fps is (10 sec: 3891.2, 60 sec: 3891.2, 300 sec: 3721.1). Total num frames: 13037568. Throughput: 0: 4036.8. Samples: 13043440. Policy #0 lag: (min: 3.0, avg: 17.9, max: 35.0) +[2026-06-07 01:03:35,259][343476] Avg episode reward: [(0, '1673.516')] +[2026-06-07 01:03:35,386][344387] Updated weights for policy 0, policy_version 25470 (0.0008) +[2026-06-07 01:03:37,027][344387] Updated weights for policy 0, policy_version 25482 (0.0007) +[2026-06-07 01:03:38,429][344387] Updated weights for policy 0, policy_version 25492 (0.0007) +[2026-06-07 01:03:39,604][344387] Updated weights for policy 0, policy_version 25503 (0.0006) +[2026-06-07 01:03:40,257][343476] Fps is (10 sec: 3891.4, 60 sec: 3959.5, 300 sec: 3728.1). Total num frames: 13058048. Throughput: 0: 4042.8. Samples: 13067290. Policy #0 lag: (min: 3.0, avg: 17.9, max: 35.0) +[2026-06-07 01:03:40,261][343476] Avg episode reward: [(0, '1637.377')] +[2026-06-07 01:03:41,248][344387] Updated weights for policy 0, policy_version 25516 (0.0007) +[2026-06-07 01:03:42,640][344387] Updated weights for policy 0, policy_version 25526 (0.0006) +[2026-06-07 01:03:44,175][344387] Updated weights for policy 0, policy_version 25537 (0.0006) +[2026-06-07 01:03:45,257][343476] Fps is (10 sec: 4096.1, 60 sec: 4027.8, 300 sec: 3741.9). Total num frames: 13078528. Throughput: 0: 4089.2. Samples: 13080354. Policy #0 lag: (min: 3.0, avg: 17.9, max: 35.0) +[2026-06-07 01:03:45,259][343476] Avg episode reward: [(0, '1645.872')] +[2026-06-07 01:03:45,271][344387] Updated weights for policy 0, policy_version 25548 (0.0009) +[2026-06-07 01:03:46,623][344387] Updated weights for policy 0, policy_version 25558 (0.0006) +[2026-06-07 01:03:47,452][344387] Updated weights for policy 0, policy_version 25568 (0.0006) +[2026-06-07 01:03:49,239][344387] Updated weights for policy 0, policy_version 25580 (0.0007) +[2026-06-07 01:03:50,259][343476] Fps is (10 sec: 4300.1, 60 sec: 4061.8, 300 sec: 3762.7). Total num frames: 13101056. Throughput: 0: 4130.0. Samples: 13105842. Policy #0 lag: (min: 6.0, avg: 21.6, max: 38.0) +[2026-06-07 01:03:50,268][343476] Avg episode reward: [(0, '1543.118')] +[2026-06-07 01:03:50,404][344387] Updated weights for policy 0, policy_version 25590 (0.0006) +[2026-06-07 01:03:51,717][344387] Updated weights for policy 0, policy_version 25601 (0.0006) +[2026-06-07 01:03:53,125][344387] Updated weights for policy 0, policy_version 25613 (0.0007) +[2026-06-07 01:03:54,299][344387] Updated weights for policy 0, policy_version 25623 (0.0006) +[2026-06-07 01:03:55,257][343476] Fps is (10 sec: 4505.5, 60 sec: 4096.0, 300 sec: 3783.6). Total num frames: 13123584. Throughput: 0: 4165.7. Samples: 13131794. Policy #0 lag: (min: 6.0, avg: 21.6, max: 38.0) +[2026-06-07 01:03:55,260][343476] Avg episode reward: [(0, '1549.581')] +[2026-06-07 01:03:55,435][344387] Updated weights for policy 0, policy_version 25633 (0.0007) +[2026-06-07 01:03:56,711][344387] Updated weights for policy 0, policy_version 25645 (0.0006) +[2026-06-07 01:03:57,860][344387] Updated weights for policy 0, policy_version 25655 (0.0006) +[2026-06-07 01:03:59,008][344387] Updated weights for policy 0, policy_version 25665 (0.0007) +[2026-06-07 01:04:00,258][343476] Fps is (10 sec: 4301.5, 60 sec: 4164.3, 300 sec: 3797.5). Total num frames: 13144064. Throughput: 0: 4167.6. Samples: 13145054. Policy #0 lag: (min: 6.0, avg: 21.6, max: 38.0) +[2026-06-07 01:04:00,260][343476] Avg episode reward: [(0, '1516.741')] +[2026-06-07 01:04:00,320][344387] Updated weights for policy 0, policy_version 25676 (0.0007) +[2026-06-07 01:04:01,961][344387] Updated weights for policy 0, policy_version 25689 (0.0007) +[2026-06-07 01:04:02,922][344387] Updated weights for policy 0, policy_version 25699 (0.0006) +[2026-06-07 01:04:04,226][344387] Updated weights for policy 0, policy_version 25711 (0.0007) +[2026-06-07 01:04:05,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4164.3, 300 sec: 3818.3). Total num frames: 13166592. Throughput: 0: 4194.0. Samples: 13171694. Policy #0 lag: (min: 6.0, avg: 21.6, max: 38.0) +[2026-06-07 01:04:05,259][343476] Avg episode reward: [(0, '1538.357')] +[2026-06-07 01:04:05,683][344387] Updated weights for policy 0, policy_version 25723 (0.0006) +[2026-06-07 01:04:06,976][344387] Updated weights for policy 0, policy_version 25733 (0.0006) +[2026-06-07 01:04:07,971][344387] Updated weights for policy 0, policy_version 25744 (0.0006) +[2026-06-07 01:04:08,712][344304] Signal inference workers to stop experience collection... (2600 times) +[2026-06-07 01:04:08,741][344387] InferenceWorker_p0-w0: stopping experience collection (2600 times) +[2026-06-07 01:04:08,771][344304] Signal inference workers to resume experience collection... (2600 times) +[2026-06-07 01:04:08,772][344387] InferenceWorker_p0-w0: resuming experience collection (2600 times) +[2026-06-07 01:04:09,269][344387] Updated weights for policy 0, policy_version 25754 (0.0007) +[2026-06-07 01:04:10,258][343476] Fps is (10 sec: 4505.2, 60 sec: 4232.5, 300 sec: 3825.2). Total num frames: 13189120. Throughput: 0: 4244.6. Samples: 13198154. Policy #0 lag: (min: 5.0, avg: 20.4, max: 36.0) +[2026-06-07 01:04:10,267][343476] Avg episode reward: [(0, '1400.018')] +[2026-06-07 01:04:10,653][344387] Updated weights for policy 0, policy_version 25766 (0.0006) +[2026-06-07 01:04:11,643][344387] Updated weights for policy 0, policy_version 25776 (0.0006) +[2026-06-07 01:04:12,906][344387] Updated weights for policy 0, policy_version 25786 (0.0007) +[2026-06-07 01:04:14,307][344387] Updated weights for policy 0, policy_version 25798 (0.0006) +[2026-06-07 01:04:15,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4232.5, 300 sec: 3832.2). Total num frames: 13209600. Throughput: 0: 4263.6. Samples: 13211310. Policy #0 lag: (min: 5.0, avg: 20.4, max: 36.0) +[2026-06-07 01:04:15,259][343476] Avg episode reward: [(0, '1557.976')] +[2026-06-07 01:04:15,911][344387] Updated weights for policy 0, policy_version 25810 (0.0007) +[2026-06-07 01:04:17,798][344387] Updated weights for policy 0, policy_version 25824 (0.0006) +[2026-06-07 01:04:19,093][344387] Updated weights for policy 0, policy_version 25836 (0.0007) +[2026-06-07 01:04:20,259][344387] Updated weights for policy 0, policy_version 25846 (0.0006) +[2026-06-07 01:04:20,257][343476] Fps is (10 sec: 4301.2, 60 sec: 4266.7, 300 sec: 3853.0). Total num frames: 13232128. Throughput: 0: 4302.2. Samples: 13237040. Policy #0 lag: (min: 5.0, avg: 20.4, max: 36.0) +[2026-06-07 01:04:20,261][343476] Avg episode reward: [(0, '1544.000')] +[2026-06-07 01:04:21,857][344387] Updated weights for policy 0, policy_version 25857 (0.0006) +[2026-06-07 01:04:23,124][344387] Updated weights for policy 0, policy_version 25869 (0.0007) +[2026-06-07 01:04:24,389][344387] Updated weights for policy 0, policy_version 25880 (0.0006) +[2026-06-07 01:04:25,258][343476] Fps is (10 sec: 4300.6, 60 sec: 4232.5, 300 sec: 3853.0). Total num frames: 13252608. Throughput: 0: 4338.7. Samples: 13262536. Policy #0 lag: (min: 1.0, avg: 18.1, max: 34.0) +[2026-06-07 01:04:25,262][343476] Avg episode reward: [(0, '1685.881')] +[2026-06-07 01:04:26,098][344387] Updated weights for policy 0, policy_version 25894 (0.0008) +[2026-06-07 01:04:27,513][344387] Updated weights for policy 0, policy_version 25905 (0.0007) +[2026-06-07 01:04:28,487][344387] Updated weights for policy 0, policy_version 25915 (0.0007) +[2026-06-07 01:04:30,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4266.7, 300 sec: 3866.9). Total num frames: 13275136. Throughput: 0: 4329.7. Samples: 13275190. Policy #0 lag: (min: 1.0, avg: 18.1, max: 34.0) +[2026-06-07 01:04:30,261][343476] Avg episode reward: [(0, '1661.609')] +[2026-06-07 01:04:30,463][344387] Updated weights for policy 0, policy_version 25931 (0.0006) +[2026-06-07 01:04:31,931][344387] Updated weights for policy 0, policy_version 25942 (0.0007) +[2026-06-07 01:04:33,866][344387] Updated weights for policy 0, policy_version 25956 (0.0007) +[2026-06-07 01:04:35,257][343476] Fps is (10 sec: 4301.1, 60 sec: 4300.8, 300 sec: 3880.8). Total num frames: 13295616. Throughput: 0: 4324.3. Samples: 13300428. Policy #0 lag: (min: 1.0, avg: 18.1, max: 34.0) +[2026-06-07 01:04:35,259][343476] Avg episode reward: [(0, '1538.618')] +[2026-06-07 01:04:35,388][344387] Updated weights for policy 0, policy_version 25970 (0.0007) +[2026-06-07 01:04:36,764][344387] Updated weights for policy 0, policy_version 25980 (0.0006) +[2026-06-07 01:04:37,680][344387] Updated weights for policy 0, policy_version 25990 (0.0006) +[2026-06-07 01:04:39,046][344387] Updated weights for policy 0, policy_version 26001 (0.0007) +[2026-06-07 01:04:40,257][343476] Fps is (10 sec: 4096.0, 60 sec: 4300.8, 300 sec: 3894.7). Total num frames: 13316096. Throughput: 0: 4328.8. Samples: 13326588. Policy #0 lag: (min: 1.0, avg: 18.1, max: 34.0) +[2026-06-07 01:04:40,262][343476] Avg episode reward: [(0, '1575.993')] +[2026-06-07 01:04:40,655][344387] Updated weights for policy 0, policy_version 26012 (0.0006) +[2026-06-07 01:04:42,042][344387] Updated weights for policy 0, policy_version 26026 (0.0008) +[2026-06-07 01:04:43,418][344387] Updated weights for policy 0, policy_version 26038 (0.0006) +[2026-06-07 01:04:45,175][344387] Updated weights for policy 0, policy_version 26051 (0.0007) +[2026-06-07 01:04:45,257][343476] Fps is (10 sec: 4095.9, 60 sec: 4300.8, 300 sec: 3908.6). Total num frames: 13336576. Throughput: 0: 4310.0. Samples: 13339004. Policy #0 lag: (min: 7.0, avg: 22.2, max: 37.0) +[2026-06-07 01:04:45,259][343476] Avg episode reward: [(0, '1785.969')] +[2026-06-07 01:04:45,276][344304] Saving new best policy, reward=1785.969! +[2026-06-07 01:04:46,360][344387] Updated weights for policy 0, policy_version 26061 (0.0006) +[2026-06-07 01:04:47,292][344387] Updated weights for policy 0, policy_version 26071 (0.0006) +[2026-06-07 01:04:48,776][344387] Updated weights for policy 0, policy_version 26084 (0.0006) +[2026-06-07 01:04:49,304][344304] Signal inference workers to stop experience collection... (2650 times) +[2026-06-07 01:04:49,329][344387] InferenceWorker_p0-w0: stopping experience collection (2650 times) +[2026-06-07 01:04:49,355][344304] Signal inference workers to resume experience collection... (2650 times) +[2026-06-07 01:04:49,356][344387] InferenceWorker_p0-w0: resuming experience collection (2650 times) +[2026-06-07 01:04:50,041][344387] Updated weights for policy 0, policy_version 26094 (0.0007) +[2026-06-07 01:04:50,258][343476] Fps is (10 sec: 4505.2, 60 sec: 4335.0, 300 sec: 3936.3). Total num frames: 13361152. Throughput: 0: 4282.4. Samples: 13364406. Policy #0 lag: (min: 7.0, avg: 22.2, max: 37.0) +[2026-06-07 01:04:50,262][343476] Avg episode reward: [(0, '1622.242')] +[2026-06-07 01:04:51,080][344387] Updated weights for policy 0, policy_version 26104 (0.0006) +[2026-06-07 01:04:52,360][344387] Updated weights for policy 0, policy_version 26116 (0.0007) +[2026-06-07 01:04:53,758][344387] Updated weights for policy 0, policy_version 26127 (0.0006) +[2026-06-07 01:04:55,074][344387] Updated weights for policy 0, policy_version 26137 (0.0006) +[2026-06-07 01:04:55,257][343476] Fps is (10 sec: 4505.6, 60 sec: 4300.8, 300 sec: 3943.3). Total num frames: 13381632. Throughput: 0: 4304.3. Samples: 13391844. Policy #0 lag: (min: 7.0, avg: 22.2, max: 37.0) +[2026-06-07 01:04:55,261][343476] Avg episode reward: [(0, '1534.145')] +[2026-06-07 01:04:55,881][344387] Updated weights for policy 0, policy_version 26147 (0.0007) +[2026-06-07 01:04:57,486][344387] Updated weights for policy 0, policy_version 26159 (0.0007) +[2026-06-07 01:04:59,056][344387] Updated weights for policy 0, policy_version 26172 (0.0006) +[2026-06-07 01:05:00,183][344387] Updated weights for policy 0, policy_version 26182 (0.0006) +[2026-06-07 01:05:00,258][343476] Fps is (10 sec: 4301.1, 60 sec: 4334.9, 300 sec: 3957.1). Total num frames: 13404160. Throughput: 0: 4298.0. Samples: 13404720. Policy #0 lag: (min: 7.0, avg: 21.7, max: 39.0) +[2026-06-07 01:05:00,261][343476] Avg episode reward: [(0, '1647.248')] +[2026-06-07 01:05:01,388][344387] Updated weights for policy 0, policy_version 26192 (0.0006) +[2026-06-07 01:05:02,793][344387] Updated weights for policy 0, policy_version 26204 (0.0007) +[2026-06-07 01:05:03,845][344387] Updated weights for policy 0, policy_version 26214 (0.0006) +[2026-06-07 01:05:05,026][344387] Updated weights for policy 0, policy_version 26224 (0.0007) +[2026-06-07 01:05:05,259][343476] Fps is (10 sec: 4504.9, 60 sec: 4334.8, 300 sec: 3964.1). Total num frames: 13426688. Throughput: 0: 4305.3. Samples: 13430784. Policy #0 lag: (min: 7.0, avg: 21.7, max: 39.0) +[2026-06-07 01:05:05,262][343476] Avg episode reward: [(0, '1664.467')] +[2026-06-07 01:05:06,293][344387] Updated weights for policy 0, policy_version 26235 (0.0006) +[2026-06-07 01:05:07,493][344387] Updated weights for policy 0, policy_version 26247 (0.0006) +[2026-06-07 01:05:09,570][344387] Updated weights for policy 0, policy_version 26260 (0.0006) +[2026-06-07 01:05:10,257][343476] Fps is (10 sec: 4505.8, 60 sec: 4335.0, 300 sec: 3978.0). Total num frames: 13449216. Throughput: 0: 4329.6. Samples: 13457366. Policy #0 lag: (min: 7.0, avg: 21.7, max: 39.0) +[2026-06-07 01:05:10,259][343476] Avg episode reward: [(0, '1665.212')] +[2026-06-07 01:05:10,714][344387] Updated weights for policy 0, policy_version 26272 (0.0007) +[2026-06-07 01:05:11,798][344387] Updated weights for policy 0, policy_version 26283 (0.0007) +[2026-06-07 01:05:13,514][344387] Updated weights for policy 0, policy_version 26294 (0.0006) +[2026-06-07 01:05:14,593][344387] Updated weights for policy 0, policy_version 26306 (0.0007) +[2026-06-07 01:05:15,258][343476] Fps is (10 sec: 4506.0, 60 sec: 4369.0, 300 sec: 3984.9). Total num frames: 13471744. Throughput: 0: 4346.7. Samples: 13470794. Policy #0 lag: (min: 7.0, avg: 21.7, max: 39.0) +[2026-06-07 01:05:15,264][343476] Avg episode reward: [(0, '1577.886')] +[2026-06-07 01:05:15,671][344387] Updated weights for policy 0, policy_version 26316 (0.0006) +[2026-06-07 01:05:17,313][344387] Updated weights for policy 0, policy_version 26326 (0.0006) +[2026-06-07 01:05:18,447][344387] Updated weights for policy 0, policy_version 26338 (0.0006) +[2026-06-07 01:05:19,471][344387] Updated weights for policy 0, policy_version 26348 (0.0008) +[2026-06-07 01:05:20,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4334.9, 300 sec: 3991.9). Total num frames: 13492224. Throughput: 0: 4350.5. Samples: 13496202. Policy #0 lag: (min: 0.0, avg: 16.6, max: 34.0) +[2026-06-07 01:05:20,259][343476] Avg episode reward: [(0, '1490.869')] +[2026-06-07 01:05:21,447][344387] Updated weights for policy 0, policy_version 26361 (0.0007) +[2026-06-07 01:05:22,284][344387] Updated weights for policy 0, policy_version 26372 (0.0007) +[2026-06-07 01:05:23,539][344387] Updated weights for policy 0, policy_version 26382 (0.0007) +[2026-06-07 01:05:25,138][344387] Updated weights for policy 0, policy_version 26393 (0.0007) +[2026-06-07 01:05:25,257][343476] Fps is (10 sec: 4096.2, 60 sec: 4335.0, 300 sec: 3998.8). Total num frames: 13512704. Throughput: 0: 4353.9. Samples: 13522516. Policy #0 lag: (min: 0.0, avg: 16.6, max: 34.0) +[2026-06-07 01:05:25,259][343476] Avg episode reward: [(0, '1636.318')] +[2026-06-07 01:05:26,235][344387] Updated weights for policy 0, policy_version 26404 (0.0008) +[2026-06-07 01:05:27,561][344387] Updated weights for policy 0, policy_version 26414 (0.0007) +[2026-06-07 01:05:29,172][344387] Updated weights for policy 0, policy_version 26425 (0.0008) +[2026-06-07 01:05:30,259][344387] Updated weights for policy 0, policy_version 26436 (0.0008) +[2026-06-07 01:05:30,257][343476] Fps is (10 sec: 4095.9, 60 sec: 4300.8, 300 sec: 4005.7). Total num frames: 13533184. Throughput: 0: 4344.2. Samples: 13534494. Policy #0 lag: (min: 0.0, avg: 16.6, max: 34.0) +[2026-06-07 01:05:30,260][343476] Avg episode reward: [(0, '1663.386')] +[2026-06-07 01:05:31,602][344387] Updated weights for policy 0, policy_version 26446 (0.0008) +[2026-06-07 01:05:33,158][344387] Updated weights for policy 0, policy_version 26457 (0.0007) +[2026-06-07 01:05:34,396][344387] Updated weights for policy 0, policy_version 26469 (0.0007) +[2026-06-07 01:05:35,258][343476] Fps is (10 sec: 4300.5, 60 sec: 4334.9, 300 sec: 4012.7). Total num frames: 13555712. Throughput: 0: 4334.3. Samples: 13559448. Policy #0 lag: (min: 3.0, avg: 22.7, max: 41.0) +[2026-06-07 01:05:35,263][343476] Avg episode reward: [(0, '1547.157')] +[2026-06-07 01:05:35,885][344387] Updated weights for policy 0, policy_version 26479 (0.0008) +[2026-06-07 01:05:37,184][344387] Updated weights for policy 0, policy_version 26489 (0.0006) +[2026-06-07 01:05:37,291][344304] Signal inference workers to stop experience collection... (2700 times) +[2026-06-07 01:05:37,307][344387] InferenceWorker_p0-w0: stopping experience collection (2700 times) +[2026-06-07 01:05:37,366][344304] Signal inference workers to resume experience collection... (2700 times) +[2026-06-07 01:05:37,367][344387] InferenceWorker_p0-w0: resuming experience collection (2700 times) +[2026-06-07 01:05:38,225][344387] Updated weights for policy 0, policy_version 26502 (0.0040) +[2026-06-07 01:05:40,046][344387] Updated weights for policy 0, policy_version 26514 (0.0006) +[2026-06-07 01:05:40,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4334.9, 300 sec: 4019.6). Total num frames: 13576192. Throughput: 0: 4296.7. Samples: 13585196. Policy #0 lag: (min: 3.0, avg: 22.7, max: 41.0) +[2026-06-07 01:05:40,259][343476] Avg episode reward: [(0, '1656.683')] +[2026-06-07 01:05:41,119][344387] Updated weights for policy 0, policy_version 26524 (0.0007) +[2026-06-07 01:05:42,380][344387] Updated weights for policy 0, policy_version 26536 (0.0008) +[2026-06-07 01:05:43,896][344387] Updated weights for policy 0, policy_version 26547 (0.0006) +[2026-06-07 01:05:45,238][344387] Updated weights for policy 0, policy_version 26558 (0.0007) +[2026-06-07 01:05:45,257][343476] Fps is (10 sec: 4096.3, 60 sec: 4334.9, 300 sec: 4012.7). Total num frames: 13596672. Throughput: 0: 4287.5. Samples: 13597656. Policy #0 lag: (min: 3.0, avg: 22.7, max: 41.0) +[2026-06-07 01:05:45,259][343476] Avg episode reward: [(0, '1536.515')] +[2026-06-07 01:05:46,393][344387] Updated weights for policy 0, policy_version 26569 (0.0008) +[2026-06-07 01:05:47,676][344387] Updated weights for policy 0, policy_version 26579 (0.0006) +[2026-06-07 01:05:48,906][344387] Updated weights for policy 0, policy_version 26590 (0.0007) +[2026-06-07 01:05:49,675][344387] Updated weights for policy 0, policy_version 26600 (0.0007) +[2026-06-07 01:05:50,257][343476] Fps is (10 sec: 4505.7, 60 sec: 4335.0, 300 sec: 4040.5). Total num frames: 13621248. Throughput: 0: 4296.9. Samples: 13624136. Policy #0 lag: (min: 3.0, avg: 22.7, max: 41.0) +[2026-06-07 01:05:50,261][343476] Avg episode reward: [(0, '1702.541')] +[2026-06-07 01:05:51,422][344387] Updated weights for policy 0, policy_version 26610 (0.0007) +[2026-06-07 01:05:52,303][344387] Updated weights for policy 0, policy_version 26620 (0.0007) +[2026-06-07 01:05:53,488][344387] Updated weights for policy 0, policy_version 26632 (0.0006) +[2026-06-07 01:05:55,076][344387] Updated weights for policy 0, policy_version 26642 (0.0006) +[2026-06-07 01:05:55,257][343476] Fps is (10 sec: 4505.5, 60 sec: 4334.9, 300 sec: 4047.4). Total num frames: 13641728. Throughput: 0: 4284.2. Samples: 13650154. Policy #0 lag: (min: 7.0, avg: 21.0, max: 39.0) +[2026-06-07 01:05:55,260][343476] Avg episode reward: [(0, '1434.961')] +[2026-06-07 01:05:56,235][344387] Updated weights for policy 0, policy_version 26652 (0.0007) +[2026-06-07 01:05:57,100][344387] Updated weights for policy 0, policy_version 26663 (0.0007) +[2026-06-07 01:05:58,818][344387] Updated weights for policy 0, policy_version 26673 (0.0007) +[2026-06-07 01:06:00,089][344387] Updated weights for policy 0, policy_version 26685 (0.0007) +[2026-06-07 01:06:00,258][343476] Fps is (10 sec: 4300.7, 60 sec: 4334.9, 300 sec: 4054.3). Total num frames: 13664256. Throughput: 0: 4273.3. Samples: 13663090. Policy #0 lag: (min: 7.0, avg: 21.0, max: 39.0) +[2026-06-07 01:06:00,268][343476] Avg episode reward: [(0, '1532.498')] +[2026-06-07 01:06:01,027][344387] Updated weights for policy 0, policy_version 26696 (0.0006) +[2026-06-07 01:06:02,555][344387] Updated weights for policy 0, policy_version 26706 (0.0006) +[2026-06-07 01:06:03,849][344387] Updated weights for policy 0, policy_version 26717 (0.0006) +[2026-06-07 01:06:05,071][344387] Updated weights for policy 0, policy_version 26729 (0.0007) +[2026-06-07 01:06:05,257][343476] Fps is (10 sec: 4505.5, 60 sec: 4335.0, 300 sec: 4061.3). Total num frames: 13686784. Throughput: 0: 4295.0. Samples: 13689478. Policy #0 lag: (min: 7.0, avg: 21.0, max: 39.0) +[2026-06-07 01:06:05,260][343476] Avg episode reward: [(0, '1450.319')] +[2026-06-07 01:06:06,215][344387] Updated weights for policy 0, policy_version 26739 (0.0007) +[2026-06-07 01:06:07,972][344387] Updated weights for policy 0, policy_version 26752 (0.0008) +[2026-06-07 01:06:09,111][344387] Updated weights for policy 0, policy_version 26763 (0.0007) +[2026-06-07 01:06:10,257][343476] Fps is (10 sec: 4096.0, 60 sec: 4266.6, 300 sec: 4054.3). Total num frames: 13705216. Throughput: 0: 4263.2. Samples: 13714362. Policy #0 lag: (min: 7.0, avg: 21.0, max: 39.0) +[2026-06-07 01:06:10,260][343476] Avg episode reward: [(0, '1448.115')] +[2026-06-07 01:06:11,233][344387] Updated weights for policy 0, policy_version 26773 (0.0007) +[2026-06-07 01:06:12,471][344387] Updated weights for policy 0, policy_version 26785 (0.0008) +[2026-06-07 01:06:13,757][344387] Updated weights for policy 0, policy_version 26797 (0.0007) +[2026-06-07 01:06:15,257][343476] Fps is (10 sec: 3686.5, 60 sec: 4198.4, 300 sec: 4054.3). Total num frames: 13723648. Throughput: 0: 4246.0. Samples: 13725562. Policy #0 lag: (min: 3.0, avg: 21.1, max: 38.0) +[2026-06-07 01:06:15,260][343476] Avg episode reward: [(0, '1842.937')] +[2026-06-07 01:06:15,305][344387] Updated weights for policy 0, policy_version 26808 (0.0006) +[2026-06-07 01:06:15,633][344304] Saving new best policy, reward=1842.937! +[2026-06-07 01:06:16,581][344387] Updated weights for policy 0, policy_version 26821 (0.0007) +[2026-06-07 01:06:17,667][344387] Updated weights for policy 0, policy_version 26832 (0.0007) +[2026-06-07 01:06:19,724][344387] Updated weights for policy 0, policy_version 26845 (0.0007) +[2026-06-07 01:06:20,258][343476] Fps is (10 sec: 4300.7, 60 sec: 4266.6, 300 sec: 4075.2). Total num frames: 13748224. Throughput: 0: 4278.5. Samples: 13751978. Policy #0 lag: (min: 3.0, avg: 21.1, max: 38.0) +[2026-06-07 01:06:20,260][343476] Avg episode reward: [(0, '1696.559')] +[2026-06-07 01:06:20,622][344387] Updated weights for policy 0, policy_version 26855 (0.0007) +[2026-06-07 01:06:22,221][344387] Updated weights for policy 0, policy_version 26866 (0.0006) +[2026-06-07 01:06:22,924][344304] Signal inference workers to stop experience collection... (2750 times) +[2026-06-07 01:06:22,953][344387] InferenceWorker_p0-w0: stopping experience collection (2750 times) +[2026-06-07 01:06:23,036][344304] Signal inference workers to resume experience collection... (2750 times) +[2026-06-07 01:06:23,036][344387] InferenceWorker_p0-w0: resuming experience collection (2750 times) +[2026-06-07 01:06:23,695][344387] Updated weights for policy 0, policy_version 26879 (0.0007) +[2026-06-07 01:06:25,011][344387] Updated weights for policy 0, policy_version 26889 (0.0006) +[2026-06-07 01:06:25,257][343476] Fps is (10 sec: 4505.7, 60 sec: 4266.7, 300 sec: 4075.2). Total num frames: 13768704. Throughput: 0: 4264.6. Samples: 13777104. Policy #0 lag: (min: 3.0, avg: 21.1, max: 38.0) +[2026-06-07 01:06:25,259][343476] Avg episode reward: [(0, '1607.793')] +[2026-06-07 01:06:26,846][344387] Updated weights for policy 0, policy_version 26901 (0.0007) +[2026-06-07 01:06:27,953][344387] Updated weights for policy 0, policy_version 26913 (0.0008) +[2026-06-07 01:06:29,277][344387] Updated weights for policy 0, policy_version 26924 (0.0007) +[2026-06-07 01:06:30,257][343476] Fps is (10 sec: 4096.1, 60 sec: 4266.7, 300 sec: 4075.2). Total num frames: 13789184. Throughput: 0: 4241.6. Samples: 13788528. Policy #0 lag: (min: 3.0, avg: 22.1, max: 39.0) +[2026-06-07 01:06:30,260][343476] Avg episode reward: [(0, '1485.919')] +[2026-06-07 01:06:30,890][344387] Updated weights for policy 0, policy_version 26936 (0.0007) +[2026-06-07 01:06:31,754][344387] Updated weights for policy 0, policy_version 26947 (0.0006) +[2026-06-07 01:06:32,981][344387] Updated weights for policy 0, policy_version 26958 (0.0006) +[2026-06-07 01:06:34,684][344387] Updated weights for policy 0, policy_version 26970 (0.0007) +[2026-06-07 01:06:35,257][343476] Fps is (10 sec: 4096.0, 60 sec: 4232.6, 300 sec: 4075.2). Total num frames: 13809664. Throughput: 0: 4253.2. Samples: 13815528. Policy #0 lag: (min: 3.0, avg: 22.1, max: 39.0) +[2026-06-07 01:06:35,259][343476] Avg episode reward: [(0, '1673.233')] +[2026-06-07 01:06:35,868][344387] Updated weights for policy 0, policy_version 26981 (0.0007) +[2026-06-07 01:06:36,660][344387] Updated weights for policy 0, policy_version 26991 (0.0007) +[2026-06-07 01:06:38,584][344387] Updated weights for policy 0, policy_version 27003 (0.0007) +[2026-06-07 01:06:39,841][344387] Updated weights for policy 0, policy_version 27016 (0.0007) +[2026-06-07 01:06:40,258][343476] Fps is (10 sec: 4300.6, 60 sec: 4266.6, 300 sec: 4089.1). Total num frames: 13832192. Throughput: 0: 4239.4. Samples: 13840928. Policy #0 lag: (min: 3.0, avg: 22.1, max: 39.0) +[2026-06-07 01:06:40,261][343476] Avg episode reward: [(0, '1687.745')] +[2026-06-07 01:06:41,422][344387] Updated weights for policy 0, policy_version 27026 (0.0006) +[2026-06-07 01:06:43,058][344387] Updated weights for policy 0, policy_version 27040 (0.0027) +[2026-06-07 01:06:43,938][344387] Updated weights for policy 0, policy_version 27051 (0.0007) +[2026-06-07 01:06:45,257][343476] Fps is (10 sec: 4300.7, 60 sec: 4266.7, 300 sec: 4096.0). Total num frames: 13852672. Throughput: 0: 4249.3. Samples: 13854310. Policy #0 lag: (min: 3.0, avg: 22.1, max: 39.0) +[2026-06-07 01:06:45,259][343476] Avg episode reward: [(0, '1625.106')] +[2026-06-07 01:06:45,659][344387] Updated weights for policy 0, policy_version 27061 (0.0011) +[2026-06-07 01:06:46,648][344387] Updated weights for policy 0, policy_version 27071 (0.0006) +[2026-06-07 01:06:47,659][344387] Updated weights for policy 0, policy_version 27082 (0.0007) +[2026-06-07 01:06:49,127][344387] Updated weights for policy 0, policy_version 27092 (0.0007) +[2026-06-07 01:06:50,257][343476] Fps is (10 sec: 4301.1, 60 sec: 4232.5, 300 sec: 4109.9). Total num frames: 13875200. Throughput: 0: 4240.5. Samples: 13880298. Policy #0 lag: (min: 4.0, avg: 20.4, max: 43.0) +[2026-06-07 01:06:50,259][343476] Avg episode reward: [(0, '1653.040')] +[2026-06-07 01:06:50,438][344387] Updated weights for policy 0, policy_version 27102 (0.0006) +[2026-06-07 01:06:51,387][344387] Updated weights for policy 0, policy_version 27114 (0.0008) +[2026-06-07 01:06:53,165][344387] Updated weights for policy 0, policy_version 27125 (0.0007) +[2026-06-07 01:06:54,212][344387] Updated weights for policy 0, policy_version 27135 (0.0007) +[2026-06-07 01:06:55,227][344387] Updated weights for policy 0, policy_version 27146 (0.0007) +[2026-06-07 01:06:55,257][343476] Fps is (10 sec: 4505.6, 60 sec: 4266.7, 300 sec: 4123.8). Total num frames: 13897728. Throughput: 0: 4265.9. Samples: 13906326. Policy #0 lag: (min: 4.0, avg: 20.4, max: 43.0) +[2026-06-07 01:06:55,259][343476] Avg episode reward: [(0, '1686.987')] +[2026-06-07 01:06:56,863][344387] Updated weights for policy 0, policy_version 27158 (0.0007) +[2026-06-07 01:06:58,114][344387] Updated weights for policy 0, policy_version 27168 (0.0006) +[2026-06-07 01:06:59,149][344387] Updated weights for policy 0, policy_version 27180 (0.0007) +[2026-06-07 01:07:00,258][343476] Fps is (10 sec: 4300.7, 60 sec: 4232.5, 300 sec: 4137.7). Total num frames: 13918208. Throughput: 0: 4299.4. Samples: 13919036. Policy #0 lag: (min: 4.0, avg: 20.4, max: 43.0) +[2026-06-07 01:07:00,260][343476] Avg episode reward: [(0, '1647.031')] +[2026-06-07 01:07:00,785][344387] Updated weights for policy 0, policy_version 27192 (0.0007) +[2026-06-07 01:07:02,195][344387] Updated weights for policy 0, policy_version 27204 (0.0006) +[2026-06-07 01:07:03,324][344387] Updated weights for policy 0, policy_version 27215 (0.0006) +[2026-06-07 01:07:04,910][344387] Updated weights for policy 0, policy_version 27226 (0.0006) +[2026-06-07 01:07:05,257][343476] Fps is (10 sec: 4300.7, 60 sec: 4232.5, 300 sec: 4151.5). Total num frames: 13940736. Throughput: 0: 4291.2. Samples: 13945080. Policy #0 lag: (min: 3.0, avg: 20.2, max: 36.0) +[2026-06-07 01:07:05,260][343476] Avg episode reward: [(0, '1736.913')] +[2026-06-07 01:07:06,030][344387] Updated weights for policy 0, policy_version 27236 (0.0006) +[2026-06-07 01:07:06,964][344387] Updated weights for policy 0, policy_version 27246 (0.0007) +[2026-06-07 01:07:08,513][344387] Updated weights for policy 0, policy_version 27258 (0.0006) +[2026-06-07 01:07:09,304][344304] Signal inference workers to stop experience collection... (2800 times) +[2026-06-07 01:07:09,327][344387] InferenceWorker_p0-w0: stopping experience collection (2800 times) +[2026-06-07 01:07:09,383][344304] Signal inference workers to resume experience collection... (2800 times) +[2026-06-07 01:07:09,383][344387] InferenceWorker_p0-w0: resuming experience collection (2800 times) +[2026-06-07 01:07:09,895][344387] Updated weights for policy 0, policy_version 27270 (0.0007) +[2026-06-07 01:07:10,257][343476] Fps is (10 sec: 4505.8, 60 sec: 4300.8, 300 sec: 4165.4). Total num frames: 13963264. Throughput: 0: 4323.7. Samples: 13971670. Policy #0 lag: (min: 3.0, avg: 20.2, max: 36.0) +[2026-06-07 01:07:10,262][343476] Avg episode reward: [(0, '1675.633')] +[2026-06-07 01:07:11,437][344387] Updated weights for policy 0, policy_version 27281 (0.0007) +[2026-06-07 01:07:12,374][344387] Updated weights for policy 0, policy_version 27291 (0.0006) +[2026-06-07 01:07:13,935][344387] Updated weights for policy 0, policy_version 27304 (0.0007) +[2026-06-07 01:07:15,257][343476] Fps is (10 sec: 4301.0, 60 sec: 4335.0, 300 sec: 4165.4). Total num frames: 13983744. Throughput: 0: 4360.5. Samples: 13984750. Policy #0 lag: (min: 3.0, avg: 20.2, max: 36.0) +[2026-06-07 01:07:15,259][343476] Avg episode reward: [(0, '1663.723')] +[2026-06-07 01:07:15,308][344387] Updated weights for policy 0, policy_version 27314 (0.0007) +[2026-06-07 01:07:16,318][344387] Updated weights for policy 0, policy_version 27324 (0.0006) +[2026-06-07 01:07:17,922][344387] Updated weights for policy 0, policy_version 27337 (0.0007) +[2026-06-07 01:07:19,174][344387] Updated weights for policy 0, policy_version 27347 (0.0007) +[2026-06-07 01:07:20,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4300.8, 300 sec: 4186.3). Total num frames: 14006272. Throughput: 0: 4314.4. Samples: 14009674. Policy #0 lag: (min: 3.0, avg: 20.2, max: 36.0) +[2026-06-07 01:07:20,260][343476] Avg episode reward: [(0, '1654.839')] +[2026-06-07 01:07:20,622][344387] Updated weights for policy 0, policy_version 27357 (0.0006) +[2026-06-07 01:07:21,951][344387] Updated weights for policy 0, policy_version 27371 (0.0007) +[2026-06-07 01:07:23,654][344387] Updated weights for policy 0, policy_version 27381 (0.0006) +[2026-06-07 01:07:24,712][344387] Updated weights for policy 0, policy_version 27392 (0.0006) +[2026-06-07 01:07:25,257][343476] Fps is (10 sec: 4505.6, 60 sec: 4334.9, 300 sec: 4207.1). Total num frames: 14028800. Throughput: 0: 4337.9. Samples: 14036132. Policy #0 lag: (min: 4.0, avg: 19.7, max: 37.0) +[2026-06-07 01:07:25,259][343476] Avg episode reward: [(0, '1668.802')] +[2026-06-07 01:07:25,782][344387] Updated weights for policy 0, policy_version 27403 (0.0007) +[2026-06-07 01:07:27,061][344387] Updated weights for policy 0, policy_version 27413 (0.0006) +[2026-06-07 01:07:28,311][344387] Updated weights for policy 0, policy_version 27424 (0.0006) +[2026-06-07 01:07:29,372][344387] Updated weights for policy 0, policy_version 27434 (0.0006) +[2026-06-07 01:07:30,257][343476] Fps is (10 sec: 4300.7, 60 sec: 4334.9, 300 sec: 4221.0). Total num frames: 14049280. Throughput: 0: 4333.5. Samples: 14049316. Policy #0 lag: (min: 4.0, avg: 19.7, max: 37.0) +[2026-06-07 01:07:30,261][343476] Avg episode reward: [(0, '1587.147')] +[2026-06-07 01:07:30,739][344387] Updated weights for policy 0, policy_version 27445 (0.0006) +[2026-06-07 01:07:32,012][344387] Updated weights for policy 0, policy_version 27456 (0.0008) +[2026-06-07 01:07:33,059][344387] Updated weights for policy 0, policy_version 27466 (0.0006) +[2026-06-07 01:07:34,184][344387] Updated weights for policy 0, policy_version 27476 (0.0006) +[2026-06-07 01:07:35,257][343476] Fps is (10 sec: 4300.8, 60 sec: 4369.1, 300 sec: 4241.8). Total num frames: 14071808. Throughput: 0: 4350.2. Samples: 14076056. Policy #0 lag: (min: 4.0, avg: 19.7, max: 37.0) +[2026-06-07 01:07:35,259][343476] Avg episode reward: [(0, '1479.834')] +[2026-06-07 01:07:35,503][344387] Updated weights for policy 0, policy_version 27486 (0.0006) +[2026-06-07 01:07:36,587][344387] Updated weights for policy 0, policy_version 27497 (0.0007) +[2026-06-07 01:07:37,804][344387] Updated weights for policy 0, policy_version 27507 (0.0006) +[2026-06-07 01:07:39,137][344387] Updated weights for policy 0, policy_version 27517 (0.0006) +[2026-06-07 01:07:39,881][344387] Updated weights for policy 0, policy_version 27528 (0.0008) +[2026-06-07 01:07:40,257][343476] Fps is (10 sec: 4505.7, 60 sec: 4369.1, 300 sec: 4262.6). Total num frames: 14094336. Throughput: 0: 4357.8. Samples: 14102428. Policy #0 lag: (min: 4.0, avg: 19.7, max: 37.0) +[2026-06-07 01:07:40,260][343476] Avg episode reward: [(0, '1571.360')] +[2026-06-07 01:07:41,510][344387] Updated weights for policy 0, policy_version 27538 (0.0007) +[2026-06-07 01:07:42,601][344387] Updated weights for policy 0, policy_version 27548 (0.0006) +[2026-06-07 01:07:43,601][344387] Updated weights for policy 0, policy_version 27560 (0.0007) +[2026-06-07 01:07:45,167][344387] Updated weights for policy 0, policy_version 27571 (0.0007) +[2026-06-07 01:07:45,257][343476] Fps is (10 sec: 4505.5, 60 sec: 4403.2, 300 sec: 4269.6). Total num frames: 14116864. Throughput: 0: 4378.5. Samples: 14116068. Policy #0 lag: (min: 4.0, avg: 20.7, max: 36.0) +[2026-06-07 01:07:45,260][343476] Avg episode reward: [(0, '1662.980')] +[2026-06-07 01:07:46,555][344387] Updated weights for policy 0, policy_version 27581 (0.0007) +[2026-06-07 01:07:47,319][344387] Updated weights for policy 0, policy_version 27592 (0.0007) +[2026-06-07 01:07:48,949][344387] Updated weights for policy 0, policy_version 27604 (0.0006) +[2026-06-07 01:07:50,258][343476] Fps is (10 sec: 4300.7, 60 sec: 4369.0, 300 sec: 4269.6). Total num frames: 14137344. Throughput: 0: 4375.3. Samples: 14141968. Policy #0 lag: (min: 4.0, avg: 20.7, max: 36.0) +[2026-06-07 01:07:50,263][343476] Avg episode reward: [(0, '1796.208')] +[2026-06-07 01:07:50,543][344387] Updated weights for policy 0, policy_version 27616 (0.0007) +[2026-06-07 01:07:51,930][344387] Updated weights for policy 0, policy_version 27626 (0.0007) +[2026-06-07 01:07:53,248][344387] Updated weights for policy 0, policy_version 27637 (0.0007) +[2026-06-07 01:07:54,670][344387] Updated weights for policy 0, policy_version 27650 (0.0007) +[2026-06-07 01:07:55,258][343476] Fps is (10 sec: 4300.7, 60 sec: 4369.0, 300 sec: 4290.4). Total num frames: 14159872. Throughput: 0: 4349.8. Samples: 14167412. Policy #0 lag: (min: 4.0, avg: 20.7, max: 36.0) +[2026-06-07 01:07:55,260][343476] Avg episode reward: [(0, '1621.738')] +[2026-06-07 01:07:55,828][344387] Updated weights for policy 0, policy_version 27660 (0.0008) +[2026-06-07 01:07:57,284][344387] Updated weights for policy 0, policy_version 27670 (0.0009) +[2026-06-07 01:07:58,749][344387] Updated weights for policy 0, policy_version 27682 (0.0008) +[2026-06-07 01:08:00,140][344387] Updated weights for policy 0, policy_version 27693 (0.0007) +[2026-06-07 01:08:00,187][344304] Signal inference workers to stop experience collection... (2850 times) +[2026-06-07 01:08:00,212][344387] InferenceWorker_p0-w0: stopping experience collection (2850 times) +[2026-06-07 01:08:00,258][343476] Fps is (10 sec: 4095.8, 60 sec: 4334.9, 300 sec: 4276.5). Total num frames: 14178304. Throughput: 0: 4331.2. Samples: 14179656. Policy #0 lag: (min: 3.0, avg: 20.8, max: 35.0) +[2026-06-07 01:08:00,265][343476] Avg episode reward: [(0, '1535.040')] +[2026-06-07 01:08:00,271][344304] Signal inference workers to resume experience collection... (2850 times) +[2026-06-07 01:08:00,271][344387] InferenceWorker_p0-w0: resuming experience collection (2850 times) +[2026-06-07 01:08:01,284][344387] Updated weights for policy 0, policy_version 27704 (0.0007) +[2026-06-07 01:08:02,775][344387] Updated weights for policy 0, policy_version 27717 (0.0008) +[2026-06-07 01:08:04,020][344387] Updated weights for policy 0, policy_version 27727 (0.0007) +[2026-06-07 01:08:05,257][343476] Fps is (10 sec: 4096.3, 60 sec: 4335.0, 300 sec: 4290.4). Total num frames: 14200832. Throughput: 0: 4336.4. Samples: 14204810. Policy #0 lag: (min: 3.0, avg: 20.8, max: 35.0) +[2026-06-07 01:08:05,259][343476] Avg episode reward: [(0, '1561.014')] +[2026-06-07 01:08:05,778][344387] Updated weights for policy 0, policy_version 27737 (0.0007) +[2026-06-07 01:08:06,782][344387] Updated weights for policy 0, policy_version 27749 (0.0007) +[2026-06-07 01:08:07,744][344387] Updated weights for policy 0, policy_version 27759 (0.0006) +[2026-06-07 01:08:09,582][344387] Updated weights for policy 0, policy_version 27769 (0.0006) +[2026-06-07 01:08:10,257][343476] Fps is (10 sec: 4301.0, 60 sec: 4300.8, 300 sec: 4290.4). Total num frames: 14221312. Throughput: 0: 4334.1. Samples: 14231166. Policy #0 lag: (min: 3.0, avg: 20.8, max: 35.0) +[2026-06-07 01:08:10,259][343476] Avg episode reward: [(0, '1642.343')] +[2026-06-07 01:08:10,853][344387] Updated weights for policy 0, policy_version 27784 (0.0008) +[2026-06-07 01:08:12,477][344387] Updated weights for policy 0, policy_version 27796 (0.0008) +[2026-06-07 01:08:13,683][344387] Updated weights for policy 0, policy_version 27807 (0.0007) +[2026-06-07 01:08:14,749][344387] Updated weights for policy 0, policy_version 27817 (0.0009) +[2026-06-07 01:08:15,257][343476] Fps is (10 sec: 4505.6, 60 sec: 4369.1, 300 sec: 4304.3). Total num frames: 14245888. Throughput: 0: 4312.9. Samples: 14243394. Policy #0 lag: (min: 3.0, avg: 20.8, max: 35.0) +[2026-06-07 01:08:15,259][343476] Avg episode reward: [(0, '1636.298')] +[2026-06-07 01:08:15,864][344387] Updated weights for policy 0, policy_version 27827 (0.0006) +[2026-06-07 01:08:17,248][344387] Updated weights for policy 0, policy_version 27838 (0.0007) +[2026-06-07 01:08:18,657][344387] Updated weights for policy 0, policy_version 27850 (0.0007) +[2026-06-07 01:08:19,741][344387] Updated weights for policy 0, policy_version 27860 (0.0007) +[2026-06-07 01:08:20,257][343476] Fps is (10 sec: 4505.6, 60 sec: 4334.9, 300 sec: 4297.3). Total num frames: 14266368. Throughput: 0: 4304.8. Samples: 14269772. Policy #0 lag: (min: 6.0, avg: 20.9, max: 38.0) +[2026-06-07 01:08:20,260][343476] Avg episode reward: [(0, '1542.135')] +[2026-06-07 01:08:21,070][344387] Updated weights for policy 0, policy_version 27871 (0.0007) +[2026-06-07 01:08:22,802][344387] Updated weights for policy 0, policy_version 27885 (0.0008) +[2026-06-07 01:08:24,163][344387] Updated weights for policy 0, policy_version 27895 (0.0007) +[2026-06-07 01:08:25,258][343476] Fps is (10 sec: 4095.8, 60 sec: 4300.8, 300 sec: 4297.3). Total num frames: 14286848. Throughput: 0: 4295.0. Samples: 14295704. Policy #0 lag: (min: 6.0, avg: 20.9, max: 38.0) +[2026-06-07 01:08:25,260][343476] Avg episode reward: [(0, '1811.205')] +[2026-06-07 01:08:26,078][344387] Updated weights for policy 0, policy_version 27909 (0.0006) +[2026-06-07 01:08:27,533][344387] Updated weights for policy 0, policy_version 27923 (0.0007) +[2026-06-07 01:08:28,900][344387] Updated weights for policy 0, policy_version 27934 (0.0006) +[2026-06-07 01:08:30,258][343476] Fps is (10 sec: 4095.8, 60 sec: 4300.8, 300 sec: 4304.3). Total num frames: 14307328. Throughput: 0: 4255.3. Samples: 14307558. Policy #0 lag: (min: 6.0, avg: 20.9, max: 38.0) +[2026-06-07 01:08:30,261][343476] Avg episode reward: [(0, '1554.355')] +[2026-06-07 01:08:30,451][344387] Updated weights for policy 0, policy_version 27948 (0.0008) +[2026-06-07 01:08:31,954][344387] Updated weights for policy 0, policy_version 27958 (0.0006) +[2026-06-07 01:08:33,188][344387] Updated weights for policy 0, policy_version 27968 (0.0006) +[2026-06-07 01:08:34,385][344387] Updated weights for policy 0, policy_version 27981 (0.0008) +[2026-06-07 01:08:35,257][343476] Fps is (10 sec: 4096.2, 60 sec: 4266.7, 300 sec: 4304.3). Total num frames: 14327808. Throughput: 0: 4252.2. Samples: 14333318. Policy #0 lag: (min: 6.0, avg: 20.9, max: 38.0) +[2026-06-07 01:08:35,259][343476] Avg episode reward: [(0, '1482.676')] +[2026-06-07 01:08:36,192][344387] Updated weights for policy 0, policy_version 27993 (0.0007) +[2026-06-07 01:08:37,659][344387] Updated weights for policy 0, policy_version 28005 (0.0007) +[2026-06-07 01:08:38,544][344387] Updated weights for policy 0, policy_version 28016 (0.0007) +[2026-06-07 01:08:40,033][344387] Updated weights for policy 0, policy_version 28027 (0.0006) +[2026-06-07 01:08:40,257][343476] Fps is (10 sec: 4300.9, 60 sec: 4266.7, 300 sec: 4311.2). Total num frames: 14350336. Throughput: 0: 4246.4. Samples: 14358498. Policy #0 lag: (min: 1.0, avg: 17.0, max: 34.0) +[2026-06-07 01:08:40,261][343476] Avg episode reward: [(0, '1746.743')] +[2026-06-07 01:08:41,879][344387] Updated weights for policy 0, policy_version 28043 (0.0007) +[2026-06-07 01:08:43,466][344304] Signal inference workers to stop experience collection... (2900 times) +[2026-06-07 01:08:43,481][344387] InferenceWorker_p0-w0: stopping experience collection (2900 times) +[2026-06-07 01:08:43,496][344304] Signal inference workers to resume experience collection... (2900 times) +[2026-06-07 01:08:43,497][344387] InferenceWorker_p0-w0: resuming experience collection (2900 times) +[2026-06-07 01:08:43,649][344387] Updated weights for policy 0, policy_version 28053 (0.0007) +[2026-06-07 01:08:45,258][343476] Fps is (10 sec: 4095.9, 60 sec: 4198.4, 300 sec: 4297.3). Total num frames: 14368768. Throughput: 0: 4249.7. Samples: 14370892. Policy #0 lag: (min: 1.0, avg: 17.0, max: 34.0) +[2026-06-07 01:08:45,262][343476] Avg episode reward: [(0, '1706.175')] +[2026-06-07 01:08:45,389][344387] Updated weights for policy 0, policy_version 28068 (0.0008) +[2026-06-07 01:08:46,420][344387] Updated weights for policy 0, policy_version 28079 (0.0007) +[2026-06-07 01:08:47,935][344387] Updated weights for policy 0, policy_version 28089 (0.0007) +[2026-06-07 01:08:49,513][344387] Updated weights for policy 0, policy_version 28102 (0.0007) +[2026-06-07 01:08:50,257][343476] Fps is (10 sec: 4300.9, 60 sec: 4266.7, 300 sec: 4304.3). Total num frames: 14393344. Throughput: 0: 4257.4. Samples: 14396392. Policy #0 lag: (min: 1.0, avg: 17.0, max: 34.0) +[2026-06-07 01:08:50,261][343476] Avg episode reward: [(0, '1648.629')] +[2026-06-07 01:08:51,009][344387] Updated weights for policy 0, policy_version 28113 (0.0008) +[2026-06-07 01:08:51,784][344387] Updated weights for policy 0, policy_version 28123 (0.0007) +[2026-06-07 01:08:53,303][344387] Updated weights for policy 0, policy_version 28134 (0.0007) +[2026-06-07 01:08:54,106][344387] Updated weights for policy 0, policy_version 28144 (0.0007) +[2026-06-07 01:08:55,257][343476] Fps is (10 sec: 4300.9, 60 sec: 4198.4, 300 sec: 4297.3). Total num frames: 14411776. Throughput: 0: 4237.6. Samples: 14421860. Policy #0 lag: (min: 1.0, avg: 17.0, max: 34.0) +[2026-06-07 01:08:55,260][343476] Avg episode reward: [(0, '1397.721')] +[2026-06-07 01:08:55,302][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000028152_14413824.pth... +[2026-06-07 01:08:55,432][344304] Removing results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000007328_3751936.pth +[2026-06-07 01:08:55,622][344387] Updated weights for policy 0, policy_version 28154 (0.0008) +[2026-06-07 01:08:57,034][344387] Updated weights for policy 0, policy_version 28166 (0.0023) +[2026-06-07 01:08:57,928][344387] Updated weights for policy 0, policy_version 28176 (0.0007) +[2026-06-07 01:08:59,657][344387] Updated weights for policy 0, policy_version 28186 (0.0008) +[2026-06-07 01:09:00,257][343476] Fps is (10 sec: 3891.1, 60 sec: 4232.6, 300 sec: 4290.4). Total num frames: 14432256. Throughput: 0: 4241.8. Samples: 14434276. Policy #0 lag: (min: 4.0, avg: 21.7, max: 37.0) +[2026-06-07 01:09:00,260][343476] Avg episode reward: [(0, '1532.329')] +[2026-06-07 01:09:01,002][344387] Updated weights for policy 0, policy_version 28198 (0.0007) +[2026-06-07 01:09:02,025][344387] Updated weights for policy 0, policy_version 28208 (0.0008) +[2026-06-07 01:09:03,668][344387] Updated weights for policy 0, policy_version 28218 (0.0007) +[2026-06-07 01:09:04,787][344387] Updated weights for policy 0, policy_version 28229 (0.0008) +[2026-06-07 01:09:05,257][343476] Fps is (10 sec: 4300.7, 60 sec: 4232.5, 300 sec: 4290.4). Total num frames: 14454784. Throughput: 0: 4200.5. Samples: 14458794. Policy #0 lag: (min: 4.0, avg: 21.7, max: 37.0) +[2026-06-07 01:09:05,259][343476] Avg episode reward: [(0, '1653.097')] +[2026-06-07 01:09:05,810][344387] Updated weights for policy 0, policy_version 28239 (0.0007) +[2026-06-07 01:09:07,518][344387] Updated weights for policy 0, policy_version 28249 (0.0007) +[2026-06-07 01:09:08,530][344387] Updated weights for policy 0, policy_version 28260 (0.0007) +[2026-06-07 01:09:09,830][344387] Updated weights for policy 0, policy_version 28270 (0.0006) +[2026-06-07 01:09:10,258][343476] Fps is (10 sec: 4300.6, 60 sec: 4232.5, 300 sec: 4290.4). Total num frames: 14475264. Throughput: 0: 4177.4. Samples: 14483690. Policy #0 lag: (min: 4.0, avg: 21.7, max: 37.0) +[2026-06-07 01:09:10,260][343476] Avg episode reward: [(0, '1688.460')] +[2026-06-07 01:09:11,298][344387] Updated weights for policy 0, policy_version 28280 (0.0007) +[2026-06-07 01:09:12,616][344387] Updated weights for policy 0, policy_version 28292 (0.0007) +[2026-06-07 01:09:13,603][344387] Updated weights for policy 0, policy_version 28302 (0.0008) +[2026-06-07 01:09:15,079][344387] Updated weights for policy 0, policy_version 28312 (0.0008) +[2026-06-07 01:09:15,258][343476] Fps is (10 sec: 4095.9, 60 sec: 4164.2, 300 sec: 4283.4). Total num frames: 14495744. Throughput: 0: 4191.9. Samples: 14496196. Policy #0 lag: (min: 3.0, avg: 20.9, max: 39.0) +[2026-06-07 01:09:15,264][343476] Avg episode reward: [(0, '1648.542')] +[2026-06-07 01:09:16,365][344387] Updated weights for policy 0, policy_version 28322 (0.0007) +[2026-06-07 01:09:17,194][344387] Updated weights for policy 0, policy_version 28332 (0.0006) +[2026-06-07 01:09:18,724][344387] Updated weights for policy 0, policy_version 28342 (0.0006) +[2026-06-07 01:09:20,017][344387] Updated weights for policy 0, policy_version 28354 (0.0007) +[2026-06-07 01:09:20,257][343476] Fps is (10 sec: 4301.1, 60 sec: 4198.4, 300 sec: 4290.4). Total num frames: 14518272. Throughput: 0: 4191.6. Samples: 14521942. Policy #0 lag: (min: 3.0, avg: 20.9, max: 39.0) +[2026-06-07 01:09:20,261][343476] Avg episode reward: [(0, '1567.103')] +[2026-06-07 01:09:21,042][344387] Updated weights for policy 0, policy_version 28364 (0.0006) +[2026-06-07 01:09:22,657][344387] Updated weights for policy 0, policy_version 28376 (0.0007) +[2026-06-07 01:09:23,768][344387] Updated weights for policy 0, policy_version 28387 (0.0007) +[2026-06-07 01:09:25,257][343476] Fps is (10 sec: 4301.0, 60 sec: 4198.4, 300 sec: 4283.4). Total num frames: 14538752. Throughput: 0: 4200.4. Samples: 14547516. Policy #0 lag: (min: 3.0, avg: 20.9, max: 39.0) +[2026-06-07 01:09:25,260][343476] Avg episode reward: [(0, '1556.141')] +[2026-06-07 01:09:25,544][344387] Updated weights for policy 0, policy_version 28397 (0.0006) +[2026-06-07 01:09:26,684][344387] Updated weights for policy 0, policy_version 28408 (0.0007) +[2026-06-07 01:09:27,589][344387] Updated weights for policy 0, policy_version 28420 (0.0026) +[2026-06-07 01:09:29,404][344387] Updated weights for policy 0, policy_version 28430 (0.0006) +[2026-06-07 01:09:30,258][343476] Fps is (10 sec: 4096.0, 60 sec: 4198.4, 300 sec: 4283.4). Total num frames: 14559232. Throughput: 0: 4208.9. Samples: 14560292. Policy #0 lag: (min: 3.0, avg: 20.9, max: 39.0) +[2026-06-07 01:09:30,266][343476] Avg episode reward: [(0, '1658.051')] +[2026-06-07 01:09:30,319][344304] Signal inference workers to stop experience collection... (2950 times) +[2026-06-07 01:09:30,339][344387] InferenceWorker_p0-w0: stopping experience collection (2950 times) +[2026-06-07 01:09:30,412][344304] Signal inference workers to resume experience collection... (2950 times) +[2026-06-07 01:09:30,413][344387] InferenceWorker_p0-w0: resuming experience collection (2950 times) +[2026-06-07 01:09:30,639][344387] Updated weights for policy 0, policy_version 28441 (0.0006) +[2026-06-07 01:09:31,714][344387] Updated weights for policy 0, policy_version 28453 (0.0006) +[2026-06-07 01:09:33,170][344387] Updated weights for policy 0, policy_version 28463 (0.0006) +[2026-06-07 01:09:34,272][344387] Updated weights for policy 0, policy_version 28473 (0.0007) +[2026-06-07 01:09:35,257][343476] Fps is (10 sec: 4505.7, 60 sec: 4266.7, 300 sec: 4297.3). Total num frames: 14583808. Throughput: 0: 4238.2. Samples: 14587110. Policy #0 lag: (min: 4.0, avg: 18.7, max: 36.0) +[2026-06-07 01:09:35,259][343476] Avg episode reward: [(0, '1652.688')] +[2026-06-07 01:09:35,534][344387] Updated weights for policy 0, policy_version 28485 (0.0007) +[2026-06-07 01:09:36,949][344387] Updated weights for policy 0, policy_version 28495 (0.0006) +[2026-06-07 01:09:38,165][344387] Updated weights for policy 0, policy_version 28506 (0.0007) +[2026-06-07 01:09:39,710][344387] Updated weights for policy 0, policy_version 28520 (0.0008) +[2026-06-07 01:09:40,257][343476] Fps is (10 sec: 4505.7, 60 sec: 4232.5, 300 sec: 4297.3). Total num frames: 14604288. Throughput: 0: 4223.7. Samples: 14611926. Policy #0 lag: (min: 4.0, avg: 18.7, max: 36.0) +[2026-06-07 01:09:40,260][343476] Avg episode reward: [(0, '1511.590')] +[2026-06-07 01:09:41,658][344387] Updated weights for policy 0, policy_version 28530 (0.0006) +[2026-06-07 01:09:42,737][344387] Updated weights for policy 0, policy_version 28542 (0.0007) +[2026-06-07 01:09:44,093][344387] Updated weights for policy 0, policy_version 28555 (0.0007) +[2026-06-07 01:09:45,257][343476] Fps is (10 sec: 3891.1, 60 sec: 4232.6, 300 sec: 4276.5). Total num frames: 14622720. Throughput: 0: 4219.7. Samples: 14624162. Policy #0 lag: (min: 4.0, avg: 18.7, max: 36.0) +[2026-06-07 01:09:45,258][343476] Avg episode reward: [(0, '1610.531')] +[2026-06-07 01:09:45,915][344387] Updated weights for policy 0, policy_version 28565 (0.0007) +[2026-06-07 01:09:47,015][344387] Updated weights for policy 0, policy_version 28578 (0.0007) +[2026-06-07 01:09:48,126][344387] Updated weights for policy 0, policy_version 28588 (0.0006) +[2026-06-07 01:09:49,893][344387] Updated weights for policy 0, policy_version 28598 (0.0008) +[2026-06-07 01:09:50,258][343476] Fps is (10 sec: 3891.0, 60 sec: 4164.2, 300 sec: 4276.5). Total num frames: 14643200. Throughput: 0: 4217.2. Samples: 14648570. Policy #0 lag: (min: 4.0, avg: 18.7, max: 36.0) +[2026-06-07 01:09:50,261][343476] Avg episode reward: [(0, '1706.099')] +[2026-06-07 01:09:50,993][344387] Updated weights for policy 0, policy_version 28609 (0.0006) +[2026-06-07 01:09:52,013][344387] Updated weights for policy 0, policy_version 28619 (0.0006) +[2026-06-07 01:09:53,797][344387] Updated weights for policy 0, policy_version 28630 (0.0007) +[2026-06-07 01:09:54,766][344387] Updated weights for policy 0, policy_version 28642 (0.0006) +[2026-06-07 01:09:55,257][343476] Fps is (10 sec: 4300.9, 60 sec: 4232.6, 300 sec: 4276.5). Total num frames: 14665728. Throughput: 0: 4228.0. Samples: 14673948. Policy #0 lag: (min: 6.0, avg: 24.2, max: 39.0) +[2026-06-07 01:09:55,259][343476] Avg episode reward: [(0, '1660.933')] +[2026-06-07 01:09:55,765][344387] Updated weights for policy 0, policy_version 28652 (0.0007) +[2026-06-07 01:09:57,693][344387] Updated weights for policy 0, policy_version 28664 (0.0007) +[2026-06-07 01:09:58,687][344387] Updated weights for policy 0, policy_version 28674 (0.0007) +[2026-06-07 01:09:59,633][344387] Updated weights for policy 0, policy_version 28684 (0.0007) +[2026-06-07 01:10:00,258][343476] Fps is (10 sec: 4300.9, 60 sec: 4232.5, 300 sec: 4269.6). Total num frames: 14686208. Throughput: 0: 4235.6. Samples: 14686796. Policy #0 lag: (min: 6.0, avg: 24.2, max: 39.0) +[2026-06-07 01:10:00,263][343476] Avg episode reward: [(0, '1678.447')] +[2026-06-07 01:10:01,818][344387] Updated weights for policy 0, policy_version 28697 (0.0008) +[2026-06-07 01:10:02,846][344387] Updated weights for policy 0, policy_version 28708 (0.0009) +[2026-06-07 01:10:04,503][344387] Updated weights for policy 0, policy_version 28718 (0.0007) +[2026-06-07 01:10:05,257][343476] Fps is (10 sec: 3891.1, 60 sec: 4164.3, 300 sec: 4255.7). Total num frames: 14704640. Throughput: 0: 4191.6. Samples: 14710562. Policy #0 lag: (min: 6.0, avg: 24.2, max: 39.0) +[2026-06-07 01:10:05,259][343476] Avg episode reward: [(0, '1738.871')] +[2026-06-07 01:10:06,242][344387] Updated weights for policy 0, policy_version 28729 (0.0010) +[2026-06-07 01:10:07,536][344387] Updated weights for policy 0, policy_version 28741 (0.0010) +[2026-06-07 01:10:09,275][344387] Updated weights for policy 0, policy_version 28751 (0.0009) +[2026-06-07 01:10:10,257][343476] Fps is (10 sec: 3686.5, 60 sec: 4130.2, 300 sec: 4241.8). Total num frames: 14723072. Throughput: 0: 4122.0. Samples: 14733008. Policy #0 lag: (min: 6.0, avg: 24.2, max: 39.0) +[2026-06-07 01:10:10,259][343476] Avg episode reward: [(0, '1373.121')] +[2026-06-07 01:10:10,766][344387] Updated weights for policy 0, policy_version 28763 (0.0009) +[2026-06-07 01:10:11,951][344387] Updated weights for policy 0, policy_version 28774 (0.0008) +[2026-06-07 01:10:13,289][344387] Updated weights for policy 0, policy_version 28784 (0.0006) +[2026-06-07 01:10:14,517][344387] Updated weights for policy 0, policy_version 28795 (0.0006) +[2026-06-07 01:10:14,828][344304] Signal inference workers to stop experience collection... (3000 times) +[2026-06-07 01:10:14,853][344387] InferenceWorker_p0-w0: stopping experience collection (3000 times) +[2026-06-07 01:10:14,898][344304] Signal inference workers to resume experience collection... (3000 times) +[2026-06-07 01:10:14,899][344387] InferenceWorker_p0-w0: resuming experience collection (3000 times) +[2026-06-07 01:10:15,257][343476] Fps is (10 sec: 4300.9, 60 sec: 4198.4, 300 sec: 4255.7). Total num frames: 14747648. Throughput: 0: 4105.0. Samples: 14745016. Policy #0 lag: (min: 4.0, avg: 21.1, max: 36.0) +[2026-06-07 01:10:15,260][343476] Avg episode reward: [(0, '1542.467')] +[2026-06-07 01:10:15,509][344387] Updated weights for policy 0, policy_version 28806 (0.0006) +[2026-06-07 01:10:16,533][344387] Updated weights for policy 0, policy_version 28816 (0.0006) +[2026-06-07 01:10:17,785][344387] Updated weights for policy 0, policy_version 28828 (0.0006) +[2026-06-07 01:10:18,979][344387] Updated weights for policy 0, policy_version 28839 (0.0007) +[2026-06-07 01:10:20,258][343476] Fps is (10 sec: 4710.4, 60 sec: 4198.4, 300 sec: 4262.6). Total num frames: 14770176. Throughput: 0: 4148.6. Samples: 14773798. Policy #0 lag: (min: 4.0, avg: 21.1, max: 36.0) +[2026-06-07 01:10:20,261][343476] Avg episode reward: [(0, '1670.656')] +[2026-06-07 01:10:20,433][344387] Updated weights for policy 0, policy_version 28849 (0.0006) +[2026-06-07 01:10:21,210][344387] Updated weights for policy 0, policy_version 28860 (0.0006) +[2026-06-07 01:10:22,440][344387] Updated weights for policy 0, policy_version 28870 (0.0006) +[2026-06-07 01:10:23,512][344387] Updated weights for policy 0, policy_version 28880 (0.0006) +[2026-06-07 01:10:24,572][344387] Updated weights for policy 0, policy_version 28890 (0.0006) +[2026-06-07 01:10:25,258][343476] Fps is (10 sec: 4710.2, 60 sec: 4266.7, 300 sec: 4276.5). Total num frames: 14794752. Throughput: 0: 4238.0. Samples: 14802638. Policy #0 lag: (min: 4.0, avg: 21.1, max: 36.0) +[2026-06-07 01:10:25,261][343476] Avg episode reward: [(0, '1527.814')] +[2026-06-07 01:10:25,587][344387] Updated weights for policy 0, policy_version 28900 (0.0007) +[2026-06-07 01:10:26,879][344387] Updated weights for policy 0, policy_version 28910 (0.0005) +[2026-06-07 01:10:27,902][344387] Updated weights for policy 0, policy_version 28923 (0.0007) +[2026-06-07 01:10:29,271][344387] Updated weights for policy 0, policy_version 28934 (0.0006) +[2026-06-07 01:10:30,258][343476] Fps is (10 sec: 4709.8, 60 sec: 4300.7, 300 sec: 4276.5). Total num frames: 14817280. Throughput: 0: 4289.4. Samples: 14817190. Policy #0 lag: (min: 4.0, avg: 21.1, max: 36.0) +[2026-06-07 01:10:30,263][343476] Avg episode reward: [(0, '1528.554')] +[2026-06-07 01:10:30,440][344387] Updated weights for policy 0, policy_version 28944 (0.0005) +[2026-06-07 01:10:31,312][344387] Updated weights for policy 0, policy_version 28955 (0.0006) +[2026-06-07 01:10:32,633][344387] Updated weights for policy 0, policy_version 28965 (0.0006) +[2026-06-07 01:10:33,748][344387] Updated weights for policy 0, policy_version 28976 (0.0006) +[2026-06-07 01:10:34,639][344387] Updated weights for policy 0, policy_version 28986 (0.0006) +[2026-06-07 01:10:35,258][343476] Fps is (10 sec: 4915.2, 60 sec: 4334.9, 300 sec: 4297.3). Total num frames: 14843904. Throughput: 0: 4401.4. Samples: 14846632. Policy #0 lag: (min: 6.0, avg: 20.2, max: 38.0) +[2026-06-07 01:10:35,261][343476] Avg episode reward: [(0, '1626.484')] +[2026-06-07 01:10:35,536][344387] Updated weights for policy 0, policy_version 28996 (0.0006) +[2026-06-07 01:10:37,115][344387] Updated weights for policy 0, policy_version 29006 (0.0006) +[2026-06-07 01:10:37,758][344387] Updated weights for policy 0, policy_version 29016 (0.0007) +[2026-06-07 01:10:39,009][344387] Updated weights for policy 0, policy_version 29027 (0.0006) +[2026-06-07 01:10:40,259][343476] Fps is (10 sec: 4915.3, 60 sec: 4369.0, 300 sec: 4304.3). Total num frames: 14866432. Throughput: 0: 4465.0. Samples: 14874878. Policy #0 lag: (min: 6.0, avg: 20.2, max: 38.0) +[2026-06-07 01:10:40,263][343476] Avg episode reward: [(0, '1602.821')] +[2026-06-07 01:10:40,469][344387] Updated weights for policy 0, policy_version 29037 (0.0006) +[2026-06-07 01:10:41,455][344387] Updated weights for policy 0, policy_version 29049 (0.0006) +[2026-06-07 01:10:42,502][344387] Updated weights for policy 0, policy_version 29059 (0.0006) +[2026-06-07 01:10:44,012][344387] Updated weights for policy 0, policy_version 29071 (0.0006) +[2026-06-07 01:10:45,043][344387] Updated weights for policy 0, policy_version 29083 (0.0006) +[2026-06-07 01:10:45,257][343476] Fps is (10 sec: 4710.6, 60 sec: 4471.5, 300 sec: 4304.3). Total num frames: 14891008. Throughput: 0: 4496.6. Samples: 14889140. Policy #0 lag: (min: 6.0, avg: 20.2, max: 38.0) +[2026-06-07 01:10:45,259][343476] Avg episode reward: [(0, '1756.790')] +[2026-06-07 01:10:46,585][344387] Updated weights for policy 0, policy_version 29093 (0.0006) +[2026-06-07 01:10:47,595][344387] Updated weights for policy 0, policy_version 29103 (0.0006) +[2026-06-07 01:10:48,443][344387] Updated weights for policy 0, policy_version 29116 (0.0007) +[2026-06-07 01:10:50,257][343476] Fps is (10 sec: 4506.0, 60 sec: 4471.5, 300 sec: 4304.3). Total num frames: 14911488. Throughput: 0: 4580.0. Samples: 14916660. Policy #0 lag: (min: 6.0, avg: 20.2, max: 38.0) +[2026-06-07 01:10:50,258][343476] Avg episode reward: [(0, '1663.224')] +[2026-06-07 01:10:50,451][344387] Updated weights for policy 0, policy_version 29126 (0.0006) +[2026-06-07 01:10:52,025][344387] Updated weights for policy 0, policy_version 29141 (0.0006) +[2026-06-07 01:10:52,891][344387] Updated weights for policy 0, policy_version 29152 (0.0005) +[2026-06-07 01:10:54,467][344387] Updated weights for policy 0, policy_version 29162 (0.0006) +[2026-06-07 01:10:55,217][344387] Updated weights for policy 0, policy_version 29172 (0.0007) +[2026-06-07 01:10:55,257][343476] Fps is (10 sec: 4505.5, 60 sec: 4505.6, 300 sec: 4311.2). Total num frames: 14936064. Throughput: 0: 4687.9. Samples: 14943962. Policy #0 lag: (min: 2.0, avg: 21.4, max: 38.0) +[2026-06-07 01:10:55,260][343476] Avg episode reward: [(0, '1689.283')] +[2026-06-07 01:10:56,186][344387] Updated weights for policy 0, policy_version 29182 (0.0006) +[2026-06-07 01:10:57,362][344387] Updated weights for policy 0, policy_version 29192 (0.0006) +[2026-06-07 01:10:58,512][344387] Updated weights for policy 0, policy_version 29202 (0.0005) +[2026-06-07 01:10:59,600][344387] Updated weights for policy 0, policy_version 29215 (0.0006) +[2026-06-07 01:11:00,257][343476] Fps is (10 sec: 4710.4, 60 sec: 4539.8, 300 sec: 4311.2). Total num frames: 14958592. Throughput: 0: 4748.9. Samples: 14958716. Policy #0 lag: (min: 2.0, avg: 21.4, max: 38.0) +[2026-06-07 01:11:00,259][343476] Avg episode reward: [(0, '1559.719')] +[2026-06-07 01:11:01,148][344387] Updated weights for policy 0, policy_version 29225 (0.0005) +[2026-06-07 01:11:01,854][344304] Signal inference workers to stop experience collection... (3050 times) +[2026-06-07 01:11:01,876][344387] InferenceWorker_p0-w0: stopping experience collection (3050 times) +[2026-06-07 01:11:01,963][344304] Signal inference workers to resume experience collection... (3050 times) +[2026-06-07 01:11:01,964][344387] InferenceWorker_p0-w0: resuming experience collection (3050 times) +[2026-06-07 01:11:02,083][344387] Updated weights for policy 0, policy_version 29237 (0.0006) +[2026-06-07 01:11:03,012][344387] Updated weights for policy 0, policy_version 29247 (0.0005) +[2026-06-07 01:11:04,614][344387] Updated weights for policy 0, policy_version 29258 (0.0006) +[2026-06-07 01:11:05,257][343476] Fps is (10 sec: 4710.4, 60 sec: 4642.1, 300 sec: 4332.0). Total num frames: 14983168. Throughput: 0: 4748.0. Samples: 14987460. Policy #0 lag: (min: 2.0, avg: 21.4, max: 38.0) +[2026-06-07 01:11:05,260][343476] Avg episode reward: [(0, '1651.657')] +[2026-06-07 01:11:05,445][344387] Updated weights for policy 0, policy_version 29268 (0.0006) +[2026-06-07 01:11:06,437][344387] Updated weights for policy 0, policy_version 29278 (0.0006) +[2026-06-07 01:11:07,698][344387] Updated weights for policy 0, policy_version 29288 (0.0006) +[2026-06-07 01:11:08,651][344387] Updated weights for policy 0, policy_version 29300 (0.0006) +[2026-06-07 01:11:09,833][344387] Updated weights for policy 0, policy_version 29310 (0.0005) +[2026-06-07 01:11:10,257][343476] Fps is (10 sec: 4915.2, 60 sec: 4744.5, 300 sec: 4352.9). Total num frames: 15007744. Throughput: 0: 4748.0. Samples: 15016296. Policy #0 lag: (min: 3.0, avg: 23.3, max: 39.0) +[2026-06-07 01:11:10,259][343476] Avg episode reward: [(0, '1717.906')] +[2026-06-07 01:11:11,201][344387] Updated weights for policy 0, policy_version 29321 (0.0006) +[2026-06-07 01:11:12,173][344387] Updated weights for policy 0, policy_version 29332 (0.0005) +[2026-06-07 01:11:13,120][344387] Updated weights for policy 0, policy_version 29343 (0.0006) +[2026-06-07 01:11:14,691][344387] Updated weights for policy 0, policy_version 29355 (0.0006) +[2026-06-07 01:11:15,257][343476] Fps is (10 sec: 4915.2, 60 sec: 4744.5, 300 sec: 4352.9). Total num frames: 15032320. Throughput: 0: 4744.3. Samples: 15030678. Policy #0 lag: (min: 3.0, avg: 23.3, max: 39.0) +[2026-06-07 01:11:15,259][343476] Avg episode reward: [(0, '1537.547')] +[2026-06-07 01:11:15,842][344387] Updated weights for policy 0, policy_version 29366 (0.0006) +[2026-06-07 01:11:17,928][344387] Updated weights for policy 0, policy_version 29380 (0.0008) +[2026-06-07 01:11:19,176][344387] Updated weights for policy 0, policy_version 29393 (0.0006) +[2026-06-07 01:11:20,165][344387] Updated weights for policy 0, policy_version 29406 (0.0006) +[2026-06-07 01:11:20,257][343476] Fps is (10 sec: 4710.2, 60 sec: 4744.5, 300 sec: 4359.8). Total num frames: 15054848. Throughput: 0: 4707.6. Samples: 15058472. Policy #0 lag: (min: 3.0, avg: 23.3, max: 39.0) +[2026-06-07 01:11:20,260][343476] Avg episode reward: [(0, '1525.480')] +[2026-06-07 01:11:21,741][344387] Updated weights for policy 0, policy_version 29416 (0.0006) +[2026-06-07 01:11:23,084][344387] Updated weights for policy 0, policy_version 29429 (0.0006) +[2026-06-07 01:11:24,495][344387] Updated weights for policy 0, policy_version 29441 (0.0006) +[2026-06-07 01:11:25,258][343476] Fps is (10 sec: 4505.3, 60 sec: 4710.4, 300 sec: 4366.7). Total num frames: 15077376. Throughput: 0: 4711.1. Samples: 15086878. Policy #0 lag: (min: 3.0, avg: 23.3, max: 39.0) +[2026-06-07 01:11:25,260][343476] Avg episode reward: [(0, '1474.028')] +[2026-06-07 01:11:25,424][344387] Updated weights for policy 0, policy_version 29454 (0.0006) +[2026-06-07 01:11:25,980][344387] Updated weights for policy 0, policy_version 29464 (0.0005) +[2026-06-07 01:11:27,462][344387] Updated weights for policy 0, policy_version 29477 (0.0006) +[2026-06-07 01:11:28,376][344387] Updated weights for policy 0, policy_version 29490 (0.0005) +[2026-06-07 01:11:28,972][344387] Updated weights for policy 0, policy_version 29500 (0.0005) +[2026-06-07 01:11:30,258][343476] Fps is (10 sec: 5324.8, 60 sec: 4847.0, 300 sec: 4401.5). Total num frames: 15108096. Throughput: 0: 4789.3. Samples: 15104662. Policy #0 lag: (min: 1.0, avg: 20.3, max: 33.0) +[2026-06-07 01:11:30,261][343476] Avg episode reward: [(0, '1571.076')] +[2026-06-07 01:11:30,601][344387] Updated weights for policy 0, policy_version 29513 (0.0005) +[2026-06-07 01:11:31,320][344387] Updated weights for policy 0, policy_version 29525 (0.0006) +[2026-06-07 01:11:32,153][344387] Updated weights for policy 0, policy_version 29535 (0.0005) +[2026-06-07 01:11:33,319][344387] Updated weights for policy 0, policy_version 29548 (0.0005) +[2026-06-07 01:11:34,112][344387] Updated weights for policy 0, policy_version 29560 (0.0007) +[2026-06-07 01:11:35,259][343476] Fps is (10 sec: 6144.0, 60 sec: 4915.2, 300 sec: 4429.2). Total num frames: 15138816. Throughput: 0: 4973.3. Samples: 15140460. Policy #0 lag: (min: 1.0, avg: 20.3, max: 33.0) +[2026-06-07 01:11:35,265][343476] Avg episode reward: [(0, '1554.538')] +[2026-06-07 01:11:35,653][344387] Updated weights for policy 0, policy_version 29573 (0.0006) +[2026-06-07 01:11:36,494][344387] Updated weights for policy 0, policy_version 29586 (0.0006) +[2026-06-07 01:11:37,207][344387] Updated weights for policy 0, policy_version 29596 (0.0006) +[2026-06-07 01:11:38,251][344387] Updated weights for policy 0, policy_version 29606 (0.0005) +[2026-06-07 01:11:39,134][344387] Updated weights for policy 0, policy_version 29617 (0.0006) +[2026-06-07 01:11:39,813][344387] Updated weights for policy 0, policy_version 29627 (0.0005) +[2026-06-07 01:11:40,257][343476] Fps is (10 sec: 6144.2, 60 sec: 5051.8, 300 sec: 4463.9). Total num frames: 15169536. Throughput: 0: 5186.8. Samples: 15177368. Policy #0 lag: (min: 1.0, avg: 20.3, max: 33.0) +[2026-06-07 01:11:40,260][343476] Avg episode reward: [(0, '1655.827')] +[2026-06-07 01:11:40,891][344387] Updated weights for policy 0, policy_version 29637 (0.0005) +[2026-06-07 01:11:41,709][344304] Signal inference workers to stop experience collection... (3100 times) +[2026-06-07 01:11:41,726][344387] InferenceWorker_p0-w0: stopping experience collection (3100 times) +[2026-06-07 01:11:41,775][344304] Signal inference workers to resume experience collection... (3100 times) +[2026-06-07 01:11:41,776][344387] InferenceWorker_p0-w0: resuming experience collection (3100 times) +[2026-06-07 01:11:41,839][344387] Updated weights for policy 0, policy_version 29649 (0.0006) +[2026-06-07 01:11:42,454][344387] Updated weights for policy 0, policy_version 29659 (0.0006) +[2026-06-07 01:11:43,415][344387] Updated weights for policy 0, policy_version 29670 (0.0006) +[2026-06-07 01:11:44,412][344387] Updated weights for policy 0, policy_version 29683 (0.0006) +[2026-06-07 01:11:45,259][343476] Fps is (10 sec: 6348.4, 60 sec: 5188.1, 300 sec: 4498.6). Total num frames: 15202304. Throughput: 0: 5282.3. Samples: 15196428. Policy #0 lag: (min: 1.0, avg: 20.3, max: 33.0) +[2026-06-07 01:11:45,261][343476] Avg episode reward: [(0, '1664.977')] +[2026-06-07 01:11:45,513][344387] Updated weights for policy 0, policy_version 29693 (0.0006) +[2026-06-07 01:11:46,489][344387] Updated weights for policy 0, policy_version 29706 (0.0006) +[2026-06-07 01:11:47,252][344387] Updated weights for policy 0, policy_version 29717 (0.0006) +[2026-06-07 01:11:48,167][344387] Updated weights for policy 0, policy_version 29727 (0.0005) +[2026-06-07 01:11:49,184][344387] Updated weights for policy 0, policy_version 29740 (0.0005) +[2026-06-07 01:11:49,963][344387] Updated weights for policy 0, policy_version 29750 (0.0005) +[2026-06-07 01:11:50,257][343476] Fps is (10 sec: 6348.7, 60 sec: 5358.9, 300 sec: 4526.4). Total num frames: 15233024. Throughput: 0: 5462.8. Samples: 15233288. Policy #0 lag: (min: 5.0, avg: 19.0, max: 37.0) +[2026-06-07 01:11:50,260][343476] Avg episode reward: [(0, '1451.888')] +[2026-06-07 01:11:50,874][344387] Updated weights for policy 0, policy_version 29760 (0.0005) +[2026-06-07 01:11:51,815][344387] Updated weights for policy 0, policy_version 29770 (0.0005) +[2026-06-07 01:11:52,452][344387] Updated weights for policy 0, policy_version 29780 (0.0005) +[2026-06-07 01:11:53,412][344387] Updated weights for policy 0, policy_version 29790 (0.0006) +[2026-06-07 01:11:54,619][344387] Updated weights for policy 0, policy_version 29802 (0.0006) +[2026-06-07 01:11:55,257][343476] Fps is (10 sec: 5939.9, 60 sec: 5427.2, 300 sec: 4554.2). Total num frames: 15261696. Throughput: 0: 5638.4. Samples: 15270024. Policy #0 lag: (min: 5.0, avg: 19.0, max: 37.0) +[2026-06-07 01:11:55,259][343476] Avg episode reward: [(0, '1528.869')] +[2026-06-07 01:11:55,453][344387] Updated weights for policy 0, policy_version 29815 (0.0006) +[2026-06-07 01:11:56,676][344387] Updated weights for policy 0, policy_version 29825 (0.0005) +[2026-06-07 01:11:57,478][344387] Updated weights for policy 0, policy_version 29836 (0.0006) +[2026-06-07 01:11:58,581][344387] Updated weights for policy 0, policy_version 29849 (0.0007) +[2026-06-07 01:11:59,792][344387] Updated weights for policy 0, policy_version 29861 (0.0007) +[2026-06-07 01:12:00,257][343476] Fps is (10 sec: 5939.3, 60 sec: 5563.7, 300 sec: 4582.0). Total num frames: 15292416. Throughput: 0: 5714.0. Samples: 15287806. Policy #0 lag: (min: 5.0, avg: 19.0, max: 37.0) +[2026-06-07 01:12:00,260][343476] Avg episode reward: [(0, '1605.400')] +[2026-06-07 01:12:00,603][344387] Updated weights for policy 0, policy_version 29871 (0.0006) +[2026-06-07 01:12:01,600][344387] Updated weights for policy 0, policy_version 29882 (0.0006) +[2026-06-07 01:12:02,604][344387] Updated weights for policy 0, policy_version 29893 (0.0006) +[2026-06-07 01:12:03,264][344387] Updated weights for policy 0, policy_version 29903 (0.0005) +[2026-06-07 01:12:04,401][344387] Updated weights for policy 0, policy_version 29913 (0.0006) +[2026-06-07 01:12:05,257][343476] Fps is (10 sec: 5734.3, 60 sec: 5597.9, 300 sec: 4595.8). Total num frames: 15319040. Throughput: 0: 5850.9. Samples: 15321762. Policy #0 lag: (min: 5.0, avg: 19.0, max: 37.0) +[2026-06-07 01:12:05,259][343476] Avg episode reward: [(0, '1539.836')] +[2026-06-07 01:12:05,316][344387] Updated weights for policy 0, policy_version 29924 (0.0005) +[2026-06-07 01:12:06,217][344387] Updated weights for policy 0, policy_version 29936 (0.0006) +[2026-06-07 01:12:07,304][344387] Updated weights for policy 0, policy_version 29946 (0.0006) +[2026-06-07 01:12:08,146][344387] Updated weights for policy 0, policy_version 29958 (0.0006) +[2026-06-07 01:12:08,837][344387] Updated weights for policy 0, policy_version 29968 (0.0006) +[2026-06-07 01:12:10,009][344387] Updated weights for policy 0, policy_version 29978 (0.0005) +[2026-06-07 01:12:10,257][343476] Fps is (10 sec: 5734.4, 60 sec: 5700.3, 300 sec: 4630.6). Total num frames: 15349760. Throughput: 0: 6022.4. Samples: 15357880. Policy #0 lag: (min: 7.0, avg: 21.3, max: 39.0) +[2026-06-07 01:12:10,259][343476] Avg episode reward: [(0, '1722.754')] +[2026-06-07 01:12:10,665][344387] Updated weights for policy 0, policy_version 29988 (0.0006) +[2026-06-07 01:12:11,413][344387] Updated weights for policy 0, policy_version 29998 (0.0005) +[2026-06-07 01:12:12,106][344387] Updated weights for policy 0, policy_version 30008 (0.0005) +[2026-06-07 01:12:13,798][344387] Updated weights for policy 0, policy_version 30026 (0.0006) +[2026-06-07 01:12:14,998][344387] Updated weights for policy 0, policy_version 30039 (0.0006) +[2026-06-07 01:12:15,257][343476] Fps is (10 sec: 6144.2, 60 sec: 5802.7, 300 sec: 4658.3). Total num frames: 15380480. Throughput: 0: 6048.9. Samples: 15376862. Policy #0 lag: (min: 7.0, avg: 21.3, max: 39.0) +[2026-06-07 01:12:15,259][343476] Avg episode reward: [(0, '1652.219')] +[2026-06-07 01:12:16,626][344387] Updated weights for policy 0, policy_version 30058 (0.0006) +[2026-06-07 01:12:17,881][344387] Updated weights for policy 0, policy_version 30071 (0.0006) +[2026-06-07 01:12:19,243][344387] Updated weights for policy 0, policy_version 30086 (0.0006) +[2026-06-07 01:12:19,746][344387] Updated weights for policy 0, policy_version 30096 (0.0005) +[2026-06-07 01:12:20,257][343476] Fps is (10 sec: 5939.1, 60 sec: 5905.1, 300 sec: 4679.2). Total num frames: 15409152. Throughput: 0: 6021.7. Samples: 15411430. Policy #0 lag: (min: 7.0, avg: 21.3, max: 39.0) +[2026-06-07 01:12:20,259][343476] Avg episode reward: [(0, '1765.613')] +[2026-06-07 01:12:20,979][344387] Updated weights for policy 0, policy_version 30106 (0.0006) +[2026-06-07 01:12:21,988][344387] Updated weights for policy 0, policy_version 30120 (0.0006) +[2026-06-07 01:12:23,017][344387] Updated weights for policy 0, policy_version 30130 (0.0006) +[2026-06-07 01:12:23,980][344387] Updated weights for policy 0, policy_version 30140 (0.0006) +[2026-06-07 01:12:25,155][344387] Updated weights for policy 0, policy_version 30155 (0.0006) +[2026-06-07 01:12:25,257][343476] Fps is (10 sec: 5734.2, 60 sec: 6007.5, 300 sec: 4706.9). Total num frames: 15437824. Throughput: 0: 5969.9. Samples: 15446016. Policy #0 lag: (min: 7.0, avg: 21.3, max: 39.0) +[2026-06-07 01:12:25,260][343476] Avg episode reward: [(0, '1698.388')] +[2026-06-07 01:12:26,231][344387] Updated weights for policy 0, policy_version 30165 (0.0006) +[2026-06-07 01:12:27,213][344387] Updated weights for policy 0, policy_version 30176 (0.0006) +[2026-06-07 01:12:28,230][344387] Updated weights for policy 0, policy_version 30190 (0.0007) +[2026-06-07 01:12:28,973][344387] Updated weights for policy 0, policy_version 30200 (0.0006) +[2026-06-07 01:12:30,258][343476] Fps is (10 sec: 5734.3, 60 sec: 5973.3, 300 sec: 4727.8). Total num frames: 15466496. Throughput: 0: 5933.7. Samples: 15463436. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:12:30,262][343476] Avg episode reward: [(0, '1653.913')] +[2026-06-07 01:12:30,443][344387] Updated weights for policy 0, policy_version 30214 (0.0006) +[2026-06-07 01:12:31,433][344387] Updated weights for policy 0, policy_version 30226 (0.0006) +[2026-06-07 01:12:32,503][344387] Updated weights for policy 0, policy_version 30236 (0.0005) +[2026-06-07 01:12:32,881][344304] Signal inference workers to stop experience collection... (3150 times) +[2026-06-07 01:12:32,897][344387] InferenceWorker_p0-w0: stopping experience collection (3150 times) +[2026-06-07 01:12:32,923][344304] Signal inference workers to resume experience collection... (3150 times) +[2026-06-07 01:12:32,924][344387] InferenceWorker_p0-w0: resuming experience collection (3150 times) +[2026-06-07 01:12:33,293][344387] Updated weights for policy 0, policy_version 30248 (0.0006) +[2026-06-07 01:12:34,218][344387] Updated weights for policy 0, policy_version 30258 (0.0005) +[2026-06-07 01:12:35,180][344387] Updated weights for policy 0, policy_version 30268 (0.0006) +[2026-06-07 01:12:35,257][343476] Fps is (10 sec: 5939.4, 60 sec: 5973.4, 300 sec: 4755.5). Total num frames: 15497216. Throughput: 0: 5884.6. Samples: 15498092. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:12:35,259][343476] Avg episode reward: [(0, '1429.982')] +[2026-06-07 01:12:36,011][344387] Updated weights for policy 0, policy_version 30280 (0.0007) +[2026-06-07 01:12:36,997][344387] Updated weights for policy 0, policy_version 30290 (0.0006) +[2026-06-07 01:12:37,933][344387] Updated weights for policy 0, policy_version 30300 (0.0006) +[2026-06-07 01:12:38,762][344387] Updated weights for policy 0, policy_version 30311 (0.0006) +[2026-06-07 01:12:39,681][344387] Updated weights for policy 0, policy_version 30321 (0.0006) +[2026-06-07 01:12:40,257][343476] Fps is (10 sec: 6144.2, 60 sec: 5973.3, 300 sec: 4783.3). Total num frames: 15527936. Throughput: 0: 5875.0. Samples: 15534400. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:12:40,260][343476] Avg episode reward: [(0, '1783.797')] +[2026-06-07 01:12:40,645][344387] Updated weights for policy 0, policy_version 30331 (0.0006) +[2026-06-07 01:12:41,464][344387] Updated weights for policy 0, policy_version 30343 (0.0006) +[2026-06-07 01:12:42,344][344387] Updated weights for policy 0, policy_version 30353 (0.0006) +[2026-06-07 01:12:43,454][344387] Updated weights for policy 0, policy_version 30363 (0.0006) +[2026-06-07 01:12:44,120][344387] Updated weights for policy 0, policy_version 30373 (0.0006) +[2026-06-07 01:12:44,753][344387] Updated weights for policy 0, policy_version 30383 (0.0005) +[2026-06-07 01:12:45,257][343476] Fps is (10 sec: 6143.9, 60 sec: 5939.3, 300 sec: 4818.0). Total num frames: 15558656. Throughput: 0: 5878.9. Samples: 15552356. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:12:45,259][343476] Avg episode reward: [(0, '1638.550')] +[2026-06-07 01:12:45,895][344387] Updated weights for policy 0, policy_version 30393 (0.0006) +[2026-06-07 01:12:46,789][344387] Updated weights for policy 0, policy_version 30405 (0.0006) +[2026-06-07 01:12:47,526][344387] Updated weights for policy 0, policy_version 30415 (0.0006) +[2026-06-07 01:12:48,590][344387] Updated weights for policy 0, policy_version 30425 (0.0005) +[2026-06-07 01:12:49,474][344387] Updated weights for policy 0, policy_version 30437 (0.0005) +[2026-06-07 01:12:50,115][344387] Updated weights for policy 0, policy_version 30447 (0.0005) +[2026-06-07 01:12:50,257][343476] Fps is (10 sec: 6143.9, 60 sec: 5939.2, 300 sec: 4845.8). Total num frames: 15589376. Throughput: 0: 5944.2. Samples: 15589250. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:12:50,259][343476] Avg episode reward: [(0, '1632.394')] +[2026-06-07 01:12:51,248][344387] Updated weights for policy 0, policy_version 30457 (0.0005) +[2026-06-07 01:12:52,039][344387] Updated weights for policy 0, policy_version 30470 (0.0006) +[2026-06-07 01:12:52,780][344387] Updated weights for policy 0, policy_version 30480 (0.0005) +[2026-06-07 01:12:54,558][344387] Updated weights for policy 0, policy_version 30496 (0.0006) +[2026-06-07 01:12:55,257][343476] Fps is (10 sec: 5939.3, 60 sec: 5939.2, 300 sec: 4880.5). Total num frames: 15618048. Throughput: 0: 5953.9. Samples: 15625806. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:12:55,259][343476] Avg episode reward: [(0, '1721.422')] +[2026-06-07 01:12:55,585][344387] Updated weights for policy 0, policy_version 30512 (0.0006) +[2026-06-07 01:12:57,056][344387] Updated weights for policy 0, policy_version 30525 (0.0005) +[2026-06-07 01:12:57,633][344387] Updated weights for policy 0, policy_version 30535 (0.0005) +[2026-06-07 01:12:58,485][344387] Updated weights for policy 0, policy_version 30545 (0.0006) +[2026-06-07 01:12:59,580][344387] Updated weights for policy 0, policy_version 30555 (0.0006) +[2026-06-07 01:13:00,257][343476] Fps is (10 sec: 5939.2, 60 sec: 5939.2, 300 sec: 4908.3). Total num frames: 15648768. Throughput: 0: 5931.0. Samples: 15643758. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:13:00,260][343476] Avg episode reward: [(0, '1585.073')] +[2026-06-07 01:13:00,544][344387] Updated weights for policy 0, policy_version 30567 (0.0007) +[2026-06-07 01:13:01,569][344387] Updated weights for policy 0, policy_version 30577 (0.0006) +[2026-06-07 01:13:02,731][344387] Updated weights for policy 0, policy_version 30589 (0.0005) +[2026-06-07 01:13:03,274][344387] Updated weights for policy 0, policy_version 30599 (0.0005) +[2026-06-07 01:13:04,096][344387] Updated weights for policy 0, policy_version 30609 (0.0005) +[2026-06-07 01:13:05,134][344387] Updated weights for policy 0, policy_version 30619 (0.0006) +[2026-06-07 01:13:05,257][343476] Fps is (10 sec: 5939.1, 60 sec: 5973.4, 300 sec: 4936.0). Total num frames: 15677440. Throughput: 0: 5935.7. Samples: 15678536. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:13:05,259][343476] Avg episode reward: [(0, '1586.083')] +[2026-06-07 01:13:05,837][344387] Updated weights for policy 0, policy_version 30629 (0.0005) +[2026-06-07 01:13:06,439][344387] Updated weights for policy 0, policy_version 30639 (0.0006) +[2026-06-07 01:13:07,702][344387] Updated weights for policy 0, policy_version 30649 (0.0006) +[2026-06-07 01:13:08,290][344387] Updated weights for policy 0, policy_version 30659 (0.0006) +[2026-06-07 01:13:09,133][344387] Updated weights for policy 0, policy_version 30669 (0.0006) +[2026-06-07 01:13:09,907][344387] Updated weights for policy 0, policy_version 30679 (0.0006) +[2026-06-07 01:13:10,257][343476] Fps is (10 sec: 5939.2, 60 sec: 5973.3, 300 sec: 4956.9). Total num frames: 15708160. Throughput: 0: 5994.1. Samples: 15715752. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:13:10,261][343476] Avg episode reward: [(0, '1789.965')] +[2026-06-07 01:13:11,027][344387] Updated weights for policy 0, policy_version 30689 (0.0006) +[2026-06-07 01:13:11,633][344387] Updated weights for policy 0, policy_version 30699 (0.0006) +[2026-06-07 01:13:12,461][344387] Updated weights for policy 0, policy_version 30709 (0.0006) +[2026-06-07 01:13:13,249][344387] Updated weights for policy 0, policy_version 30719 (0.0005) +[2026-06-07 01:13:14,049][344387] Updated weights for policy 0, policy_version 30729 (0.0006) +[2026-06-07 01:13:14,637][344387] Updated weights for policy 0, policy_version 30740 (0.0005) +[2026-06-07 01:13:15,257][343476] Fps is (10 sec: 6348.8, 60 sec: 6007.5, 300 sec: 4998.5). Total num frames: 15740928. Throughput: 0: 6022.6. Samples: 15734452. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:13:15,259][343476] Avg episode reward: [(0, '1564.759')] +[2026-06-07 01:13:15,676][344387] Updated weights for policy 0, policy_version 30750 (0.0005) +[2026-06-07 01:13:16,288][344387] Updated weights for policy 0, policy_version 30760 (0.0005) +[2026-06-07 01:13:17,359][344387] Updated weights for policy 0, policy_version 30773 (0.0007) +[2026-06-07 01:13:18,256][344387] Updated weights for policy 0, policy_version 30784 (0.0005) +[2026-06-07 01:13:19,135][344387] Updated weights for policy 0, policy_version 30796 (0.0005) +[2026-06-07 01:13:19,940][344387] Updated weights for policy 0, policy_version 30808 (0.0006) +[2026-06-07 01:13:20,257][343476] Fps is (10 sec: 6553.8, 60 sec: 6075.7, 300 sec: 5040.2). Total num frames: 15773696. Throughput: 0: 6151.0. Samples: 15774886. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:13:20,259][343476] Avg episode reward: [(0, '1619.803')] +[2026-06-07 01:13:20,963][344387] Updated weights for policy 0, policy_version 30820 (0.0005) +[2026-06-07 01:13:21,725][344387] Updated weights for policy 0, policy_version 30830 (0.0005) +[2026-06-07 01:13:22,263][344387] Updated weights for policy 0, policy_version 30840 (0.0005) +[2026-06-07 01:13:23,521][344387] Updated weights for policy 0, policy_version 30853 (0.0006) +[2026-06-07 01:13:24,393][344387] Updated weights for policy 0, policy_version 30866 (0.0006) +[2026-06-07 01:13:25,252][344387] Updated weights for policy 0, policy_version 30876 (0.0006) +[2026-06-07 01:13:25,257][343476] Fps is (10 sec: 6758.5, 60 sec: 6178.2, 300 sec: 5088.8). Total num frames: 15808512. Throughput: 0: 6224.6. Samples: 15814506. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:13:25,258][343476] Avg episode reward: [(0, '1604.691')] +[2026-06-07 01:13:26,225][344387] Updated weights for policy 0, policy_version 30887 (0.0006) +[2026-06-07 01:13:27,036][344387] Updated weights for policy 0, policy_version 30897 (0.0006) +[2026-06-07 01:13:28,083][344387] Updated weights for policy 0, policy_version 30907 (0.0006) +[2026-06-07 01:13:28,842][344387] Updated weights for policy 0, policy_version 30917 (0.0006) +[2026-06-07 01:13:29,346][344387] Updated weights for policy 0, policy_version 30928 (0.0006) +[2026-06-07 01:13:30,257][343476] Fps is (10 sec: 6553.7, 60 sec: 6212.3, 300 sec: 5123.5). Total num frames: 15839232. Throughput: 0: 6231.6. Samples: 15832778. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 01:13:30,258][343476] Avg episode reward: [(0, '1681.228')] +[2026-06-07 01:13:30,811][344387] Updated weights for policy 0, policy_version 30940 (0.0006) +[2026-06-07 01:13:31,668][344387] Updated weights for policy 0, policy_version 30953 (0.0005) +[2026-06-07 01:13:32,492][344387] Updated weights for policy 0, policy_version 30966 (0.0005) +[2026-06-07 01:13:33,272][344387] Updated weights for policy 0, policy_version 30976 (0.0005) +[2026-06-07 01:13:34,247][344387] Updated weights for policy 0, policy_version 30989 (0.0005) +[2026-06-07 01:13:35,139][344387] Updated weights for policy 0, policy_version 31001 (0.0005) +[2026-06-07 01:13:35,257][343476] Fps is (10 sec: 6553.4, 60 sec: 6280.5, 300 sec: 5165.1). Total num frames: 15874048. Throughput: 0: 6307.3. Samples: 15873080. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 01:13:35,259][343476] Avg episode reward: [(0, '1697.694')] +[2026-06-07 01:13:35,787][344387] Updated weights for policy 0, policy_version 31011 (0.0005) +[2026-06-07 01:13:36,724][344387] Updated weights for policy 0, policy_version 31025 (0.0005) +[2026-06-07 01:13:37,492][344387] Updated weights for policy 0, policy_version 31035 (0.0005) +[2026-06-07 01:13:38,466][344387] Updated weights for policy 0, policy_version 31045 (0.0005) +[2026-06-07 01:13:39,068][344387] Updated weights for policy 0, policy_version 31057 (0.0005) +[2026-06-07 01:13:39,828][344387] Updated weights for policy 0, policy_version 31067 (0.0005) +[2026-06-07 01:13:40,257][343476] Fps is (10 sec: 6963.1, 60 sec: 6348.8, 300 sec: 5220.7). Total num frames: 15908864. Throughput: 0: 6442.1. Samples: 15915700. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 01:13:40,259][343476] Avg episode reward: [(0, '1689.450')] +[2026-06-07 01:13:40,658][344387] Updated weights for policy 0, policy_version 31077 (0.0005) +[2026-06-07 01:13:40,760][344304] Signal inference workers to stop experience collection... (3200 times) +[2026-06-07 01:13:40,768][344387] InferenceWorker_p0-w0: stopping experience collection (3200 times) +[2026-06-07 01:13:40,795][344304] Signal inference workers to resume experience collection... (3200 times) +[2026-06-07 01:13:40,796][344387] InferenceWorker_p0-w0: resuming experience collection (3200 times) +[2026-06-07 01:13:41,348][344387] Updated weights for policy 0, policy_version 31089 (0.0006) +[2026-06-07 01:13:41,973][344387] Updated weights for policy 0, policy_version 31099 (0.0005) +[2026-06-07 01:13:42,988][344387] Updated weights for policy 0, policy_version 31110 (0.0005) +[2026-06-07 01:13:43,800][344387] Updated weights for policy 0, policy_version 31122 (0.0005) +[2026-06-07 01:13:44,681][344387] Updated weights for policy 0, policy_version 31133 (0.0005) +[2026-06-07 01:13:45,257][343476] Fps is (10 sec: 6963.2, 60 sec: 6417.1, 300 sec: 5255.4). Total num frames: 15943680. Throughput: 0: 6519.6. Samples: 15937138. Policy #0 lag: (min: 3.0, avg: 17.8, max: 35.0) +[2026-06-07 01:13:45,258][343476] Avg episode reward: [(0, '1660.716')] +[2026-06-07 01:13:45,258][344387] Updated weights for policy 0, policy_version 31143 (0.0005) +[2026-06-07 01:13:46,017][344387] Updated weights for policy 0, policy_version 31153 (0.0005) +[2026-06-07 01:13:46,729][344387] Updated weights for policy 0, policy_version 31163 (0.0005) +[2026-06-07 01:13:47,442][344387] Updated weights for policy 0, policy_version 31173 (0.0005) +[2026-06-07 01:13:48,099][344387] Updated weights for policy 0, policy_version 31183 (0.0005) +[2026-06-07 01:13:48,971][344387] Updated weights for policy 0, policy_version 31193 (0.0005) +[2026-06-07 01:13:49,506][344387] Updated weights for policy 0, policy_version 31203 (0.0005) +[2026-06-07 01:13:50,257][343476] Fps is (10 sec: 7167.8, 60 sec: 6519.5, 300 sec: 5317.9). Total num frames: 15980544. Throughput: 0: 6695.3. Samples: 15979824. Policy #0 lag: (min: 6.0, avg: 20.6, max: 38.0) +[2026-06-07 01:13:50,259][343476] Avg episode reward: [(0, '1573.007')] +[2026-06-07 01:13:50,299][344387] Updated weights for policy 0, policy_version 31213 (0.0005) +[2026-06-07 01:13:50,866][344387] Updated weights for policy 0, policy_version 31223 (0.0006) +[2026-06-07 01:13:51,754][344387] Updated weights for policy 0, policy_version 31233 (0.0005) +[2026-06-07 01:13:52,297][344387] Updated weights for policy 0, policy_version 31243 (0.0005) +[2026-06-07 01:13:53,186][344387] Updated weights for policy 0, policy_version 31253 (0.0005) +[2026-06-07 01:13:53,925][344387] Updated weights for policy 0, policy_version 31263 (0.0005) +[2026-06-07 01:13:54,569][344387] Updated weights for policy 0, policy_version 31273 (0.0005) +[2026-06-07 01:13:55,128][344387] Updated weights for policy 0, policy_version 31283 (0.0006) +[2026-06-07 01:13:55,257][343476] Fps is (10 sec: 7372.9, 60 sec: 6656.0, 300 sec: 5373.4). Total num frames: 16017408. Throughput: 0: 6829.9. Samples: 16023094. Policy #0 lag: (min: 6.0, avg: 20.6, max: 38.0) +[2026-06-07 01:13:55,259][343476] Avg episode reward: [(0, '1531.680')] +[2026-06-07 01:13:56,038][344387] Updated weights for policy 0, policy_version 31293 (0.0005) +[2026-06-07 01:13:56,896][344387] Updated weights for policy 0, policy_version 31305 (0.0005) +[2026-06-07 01:13:57,440][344387] Updated weights for policy 0, policy_version 31315 (0.0005) +[2026-06-07 01:13:58,444][344387] Updated weights for policy 0, policy_version 31325 (0.0005) +[2026-06-07 01:13:59,327][344387] Updated weights for policy 0, policy_version 31340 (0.0005) +[2026-06-07 01:14:00,000][344387] Updated weights for policy 0, policy_version 31350 (0.0005) +[2026-06-07 01:14:00,257][343476] Fps is (10 sec: 7373.1, 60 sec: 6758.4, 300 sec: 5422.0). Total num frames: 16054272. Throughput: 0: 6898.2. Samples: 16044872. Policy #0 lag: (min: 6.0, avg: 20.6, max: 38.0) +[2026-06-07 01:14:00,258][343476] Avg episode reward: [(0, '1823.732')] +[2026-06-07 01:14:00,850][344387] Updated weights for policy 0, policy_version 31360 (0.0005) +[2026-06-07 01:14:01,527][344387] Updated weights for policy 0, policy_version 31370 (0.0005) +[2026-06-07 01:14:02,131][344387] Updated weights for policy 0, policy_version 31380 (0.0005) +[2026-06-07 01:14:03,235][344387] Updated weights for policy 0, policy_version 31390 (0.0005) +[2026-06-07 01:14:04,192][344387] Updated weights for policy 0, policy_version 31402 (0.0005) +[2026-06-07 01:14:04,733][344387] Updated weights for policy 0, policy_version 31412 (0.0005) +[2026-06-07 01:14:05,257][343476] Fps is (10 sec: 6758.3, 60 sec: 6792.5, 300 sec: 5456.7). Total num frames: 16084992. Throughput: 0: 6900.2. Samples: 16085396. Policy #0 lag: (min: 6.0, avg: 20.6, max: 38.0) +[2026-06-07 01:14:05,258][343476] Avg episode reward: [(0, '1750.291')] +[2026-06-07 01:14:05,765][344387] Updated weights for policy 0, policy_version 31422 (0.0005) +[2026-06-07 01:14:06,438][344387] Updated weights for policy 0, policy_version 31432 (0.0005) +[2026-06-07 01:14:07,430][344387] Updated weights for policy 0, policy_version 31445 (0.0006) +[2026-06-07 01:14:08,236][344387] Updated weights for policy 0, policy_version 31456 (0.0005) +[2026-06-07 01:14:09,042][344387] Updated weights for policy 0, policy_version 31466 (0.0005) +[2026-06-07 01:14:09,729][344387] Updated weights for policy 0, policy_version 31478 (0.0005) +[2026-06-07 01:14:10,257][343476] Fps is (10 sec: 6553.6, 60 sec: 6860.8, 300 sec: 5505.3). Total num frames: 16119808. Throughput: 0: 6917.4. Samples: 16125788. Policy #0 lag: (min: 3.0, avg: 19.2, max: 38.0) +[2026-06-07 01:14:10,258][343476] Avg episode reward: [(0, '1748.194')] +[2026-06-07 01:14:10,508][344387] Updated weights for policy 0, policy_version 31488 (0.0005) +[2026-06-07 01:14:11,280][344387] Updated weights for policy 0, policy_version 31498 (0.0005) +[2026-06-07 01:14:11,865][344387] Updated weights for policy 0, policy_version 31508 (0.0005) +[2026-06-07 01:14:12,666][344387] Updated weights for policy 0, policy_version 31518 (0.0005) +[2026-06-07 01:14:13,227][344387] Updated weights for policy 0, policy_version 31528 (0.0005) +[2026-06-07 01:14:14,054][344387] Updated weights for policy 0, policy_version 31540 (0.0005) +[2026-06-07 01:14:14,939][344387] Updated weights for policy 0, policy_version 31550 (0.0005) +[2026-06-07 01:14:15,257][343476] Fps is (10 sec: 6963.2, 60 sec: 6894.9, 300 sec: 5547.0). Total num frames: 16154624. Throughput: 0: 6992.9. Samples: 16147460. Policy #0 lag: (min: 3.0, avg: 19.2, max: 38.0) +[2026-06-07 01:14:15,259][343476] Avg episode reward: [(0, '1664.279')] +[2026-06-07 01:14:16,053][344387] Updated weights for policy 0, policy_version 31563 (0.0005) +[2026-06-07 01:14:16,923][344387] Updated weights for policy 0, policy_version 31576 (0.0005) +[2026-06-07 01:14:17,685][344387] Updated weights for policy 0, policy_version 31586 (0.0005) +[2026-06-07 01:14:18,317][344387] Updated weights for policy 0, policy_version 31596 (0.0005) +[2026-06-07 01:14:19,412][344387] Updated weights for policy 0, policy_version 31609 (0.0005) +[2026-06-07 01:14:20,229][344387] Updated weights for policy 0, policy_version 31622 (0.0005) +[2026-06-07 01:14:20,257][343476] Fps is (10 sec: 7167.9, 60 sec: 6963.2, 300 sec: 5602.5). Total num frames: 16191488. Throughput: 0: 7031.2. Samples: 16189484. Policy #0 lag: (min: 3.0, avg: 19.2, max: 38.0) +[2026-06-07 01:14:20,259][343476] Avg episode reward: [(0, '1595.257')] +[2026-06-07 01:14:21,075][344387] Updated weights for policy 0, policy_version 31635 (0.0005) +[2026-06-07 01:14:22,106][344387] Updated weights for policy 0, policy_version 31645 (0.0005) +[2026-06-07 01:14:22,687][344387] Updated weights for policy 0, policy_version 31656 (0.0005) +[2026-06-07 01:14:23,377][344387] Updated weights for policy 0, policy_version 31666 (0.0005) +[2026-06-07 01:14:24,093][344387] Updated weights for policy 0, policy_version 31676 (0.0005) +[2026-06-07 01:14:24,911][344387] Updated weights for policy 0, policy_version 31686 (0.0005) +[2026-06-07 01:14:25,257][343476] Fps is (10 sec: 7168.0, 60 sec: 6963.2, 300 sec: 5651.1). Total num frames: 16226304. Throughput: 0: 7030.0. Samples: 16232050. Policy #0 lag: (min: 3.0, avg: 19.2, max: 38.0) +[2026-06-07 01:14:25,260][343476] Avg episode reward: [(0, '1717.913')] +[2026-06-07 01:14:25,522][344387] Updated weights for policy 0, policy_version 31696 (0.0005) +[2026-06-07 01:14:26,301][344387] Updated weights for policy 0, policy_version 31706 (0.0005) +[2026-06-07 01:14:27,106][344387] Updated weights for policy 0, policy_version 31717 (0.0005) +[2026-06-07 01:14:27,672][344387] Updated weights for policy 0, policy_version 31727 (0.0005) +[2026-06-07 01:14:28,547][344387] Updated weights for policy 0, policy_version 31737 (0.0005) +[2026-06-07 01:14:29,191][344387] Updated weights for policy 0, policy_version 31747 (0.0005) +[2026-06-07 01:14:29,917][344387] Updated weights for policy 0, policy_version 31757 (0.0005) +[2026-06-07 01:14:30,257][343476] Fps is (10 sec: 7168.0, 60 sec: 7065.6, 300 sec: 5692.7). Total num frames: 16263168. Throughput: 0: 7032.9. Samples: 16253618. Policy #0 lag: (min: 1.0, avg: 17.2, max: 33.0) +[2026-06-07 01:14:30,259][343476] Avg episode reward: [(0, '1583.206')] +[2026-06-07 01:14:30,473][344387] Updated weights for policy 0, policy_version 31767 (0.0005) +[2026-06-07 01:14:31,489][344387] Updated weights for policy 0, policy_version 31779 (0.0005) +[2026-06-07 01:14:32,247][344387] Updated weights for policy 0, policy_version 31791 (0.0005) +[2026-06-07 01:14:33,097][344387] Updated weights for policy 0, policy_version 31801 (0.0005) +[2026-06-07 01:14:33,844][344387] Updated weights for policy 0, policy_version 31811 (0.0005) +[2026-06-07 01:14:34,536][344387] Updated weights for policy 0, policy_version 31821 (0.0005) +[2026-06-07 01:14:35,088][344387] Updated weights for policy 0, policy_version 31832 (0.0005) +[2026-06-07 01:14:35,257][343476] Fps is (10 sec: 7167.9, 60 sec: 7065.6, 300 sec: 5741.3). Total num frames: 16297984. Throughput: 0: 7041.3. Samples: 16296684. Policy #0 lag: (min: 1.0, avg: 17.2, max: 33.0) +[2026-06-07 01:14:35,259][343476] Avg episode reward: [(0, '1779.622')] +[2026-06-07 01:14:36,355][344387] Updated weights for policy 0, policy_version 31844 (0.0005) +[2026-06-07 01:14:36,906][344387] Updated weights for policy 0, policy_version 31854 (0.0005) +[2026-06-07 01:14:37,328][344387] Updated weights for policy 0, policy_version 31864 (0.0005) +[2026-06-07 01:14:38,668][344387] Updated weights for policy 0, policy_version 31876 (0.0005) +[2026-06-07 01:14:39,251][344387] Updated weights for policy 0, policy_version 31886 (0.0005) +[2026-06-07 01:14:40,257][343476] Fps is (10 sec: 6758.4, 60 sec: 7031.5, 300 sec: 5789.9). Total num frames: 16330752. Throughput: 0: 7002.2. Samples: 16338196. Policy #0 lag: (min: 1.0, avg: 17.2, max: 33.0) +[2026-06-07 01:14:40,259][343476] Avg episode reward: [(0, '1681.265')] +[2026-06-07 01:14:40,275][344387] Updated weights for policy 0, policy_version 31897 (0.0005) +[2026-06-07 01:14:40,931][344387] Updated weights for policy 0, policy_version 31907 (0.0005) +[2026-06-07 01:14:41,597][344387] Updated weights for policy 0, policy_version 31917 (0.0005) +[2026-06-07 01:14:42,702][344387] Updated weights for policy 0, policy_version 31931 (0.0005) +[2026-06-07 01:14:43,473][344387] Updated weights for policy 0, policy_version 31941 (0.0005) +[2026-06-07 01:14:44,204][344387] Updated weights for policy 0, policy_version 31955 (0.0005) +[2026-06-07 01:14:45,257][343476] Fps is (10 sec: 6758.5, 60 sec: 7031.5, 300 sec: 5838.5). Total num frames: 16365568. Throughput: 0: 6989.7. Samples: 16359410. Policy #0 lag: (min: 1.0, avg: 17.2, max: 33.0) +[2026-06-07 01:14:45,259][344387] Updated weights for policy 0, policy_version 31965 (0.0005) +[2026-06-07 01:14:45,259][343476] Avg episode reward: [(0, '1436.000')] +[2026-06-07 01:14:45,780][344304] Signal inference workers to stop experience collection... (3250 times) +[2026-06-07 01:14:45,781][344304] Signal inference workers to resume experience collection... (3250 times) +[2026-06-07 01:14:45,794][344387] InferenceWorker_p0-w0: stopping experience collection (3250 times) +[2026-06-07 01:14:45,794][344387] InferenceWorker_p0-w0: resuming experience collection (3250 times) +[2026-06-07 01:14:45,883][344387] Updated weights for policy 0, policy_version 31975 (0.0005) +[2026-06-07 01:14:46,552][344387] Updated weights for policy 0, policy_version 31986 (0.0005) +[2026-06-07 01:14:47,328][344387] Updated weights for policy 0, policy_version 31996 (0.0006) +[2026-06-07 01:14:48,212][344387] Updated weights for policy 0, policy_version 32006 (0.0005) +[2026-06-07 01:14:49,244][344387] Updated weights for policy 0, policy_version 32022 (0.0006) +[2026-06-07 01:14:50,033][344387] Updated weights for policy 0, policy_version 32032 (0.0005) +[2026-06-07 01:14:50,261][343476] Fps is (10 sec: 6960.7, 60 sec: 6996.9, 300 sec: 5880.1). Total num frames: 16400384. Throughput: 0: 7005.2. Samples: 16400654. Policy #0 lag: (min: 1.0, avg: 17.2, max: 33.0) +[2026-06-07 01:14:50,263][343476] Avg episode reward: [(0, '1498.444')] +[2026-06-07 01:14:50,796][344387] Updated weights for policy 0, policy_version 32042 (0.0006) +[2026-06-07 01:14:51,632][344387] Updated weights for policy 0, policy_version 32056 (0.0006) +[2026-06-07 01:14:52,651][344387] Updated weights for policy 0, policy_version 32066 (0.0006) +[2026-06-07 01:14:53,382][344387] Updated weights for policy 0, policy_version 32077 (0.0005) +[2026-06-07 01:14:54,033][344387] Updated weights for policy 0, policy_version 32087 (0.0005) +[2026-06-07 01:14:55,024][344387] Updated weights for policy 0, policy_version 32097 (0.0005) +[2026-06-07 01:14:55,257][343476] Fps is (10 sec: 6963.4, 60 sec: 6963.2, 300 sec: 5928.8). Total num frames: 16435200. Throughput: 0: 7033.0. Samples: 16442274. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 01:14:55,259][343476] Avg episode reward: [(0, '1643.121')] +[2026-06-07 01:14:55,524][344387] Updated weights for policy 0, policy_version 32107 (0.0005) +[2026-06-07 01:14:56,417][344387] Updated weights for policy 0, policy_version 32117 (0.0005) +[2026-06-07 01:14:56,963][344387] Updated weights for policy 0, policy_version 32127 (0.0005) +[2026-06-07 01:14:57,792][344387] Updated weights for policy 0, policy_version 32137 (0.0005) +[2026-06-07 01:14:58,329][344387] Updated weights for policy 0, policy_version 32147 (0.0005) +[2026-06-07 01:14:59,323][344387] Updated weights for policy 0, policy_version 32157 (0.0005) +[2026-06-07 01:14:59,946][344387] Updated weights for policy 0, policy_version 32167 (0.0005) +[2026-06-07 01:15:00,257][343476] Fps is (10 sec: 7170.5, 60 sec: 6963.2, 300 sec: 5991.3). Total num frames: 16472064. Throughput: 0: 7027.7. Samples: 16463706. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 01:15:00,260][343476] Avg episode reward: [(0, '1730.851')] +[2026-06-07 01:15:00,641][344387] Updated weights for policy 0, policy_version 32177 (0.0005) +[2026-06-07 01:15:01,321][344387] Updated weights for policy 0, policy_version 32187 (0.0005) +[2026-06-07 01:15:02,444][344387] Updated weights for policy 0, policy_version 32201 (0.0005) +[2026-06-07 01:15:03,060][344387] Updated weights for policy 0, policy_version 32211 (0.0005) +[2026-06-07 01:15:03,926][344387] Updated weights for policy 0, policy_version 32221 (0.0005) +[2026-06-07 01:15:04,480][344387] Updated weights for policy 0, policy_version 32231 (0.0005) +[2026-06-07 01:15:05,240][344387] Updated weights for policy 0, policy_version 32241 (0.0005) +[2026-06-07 01:15:05,257][343476] Fps is (10 sec: 7167.8, 60 sec: 7031.5, 300 sec: 6046.8). Total num frames: 16506880. Throughput: 0: 7043.5. Samples: 16506442. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 01:15:05,260][343476] Avg episode reward: [(0, '1631.931')] +[2026-06-07 01:15:05,879][344387] Updated weights for policy 0, policy_version 32251 (0.0005) +[2026-06-07 01:15:06,634][344387] Updated weights for policy 0, policy_version 32261 (0.0006) +[2026-06-07 01:15:07,242][344387] Updated weights for policy 0, policy_version 32272 (0.0005) +[2026-06-07 01:15:08,034][344387] Updated weights for policy 0, policy_version 32282 (0.0005) +[2026-06-07 01:15:08,636][344387] Updated weights for policy 0, policy_version 32292 (0.0005) +[2026-06-07 01:15:09,370][344387] Updated weights for policy 0, policy_version 32302 (0.0005) +[2026-06-07 01:15:10,019][344387] Updated weights for policy 0, policy_version 32312 (0.0005) +[2026-06-07 01:15:10,258][343476] Fps is (10 sec: 7167.7, 60 sec: 7065.5, 300 sec: 6088.5). Total num frames: 16543744. Throughput: 0: 7087.8. Samples: 16551006. Policy #0 lag: (min: 3.0, avg: 19.4, max: 35.0) +[2026-06-07 01:15:10,261][343476] Avg episode reward: [(0, '1714.423')] +[2026-06-07 01:15:10,794][344387] Updated weights for policy 0, policy_version 32322 (0.0005) +[2026-06-07 01:15:11,325][344387] Updated weights for policy 0, policy_version 32332 (0.0005) +[2026-06-07 01:15:12,202][344387] Updated weights for policy 0, policy_version 32342 (0.0005) +[2026-06-07 01:15:12,703][344387] Updated weights for policy 0, policy_version 32352 (0.0005) +[2026-06-07 01:15:13,730][344387] Updated weights for policy 0, policy_version 32365 (0.0006) +[2026-06-07 01:15:14,412][344387] Updated weights for policy 0, policy_version 32375 (0.0005) +[2026-06-07 01:15:15,176][344387] Updated weights for policy 0, policy_version 32386 (0.0005) +[2026-06-07 01:15:15,257][343476] Fps is (10 sec: 7577.7, 60 sec: 7133.9, 300 sec: 6144.0). Total num frames: 16582656. Throughput: 0: 7113.6. Samples: 16573730. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:15:15,259][343476] Avg episode reward: [(0, '1627.943')] +[2026-06-07 01:15:16,064][344387] Updated weights for policy 0, policy_version 32397 (0.0005) +[2026-06-07 01:15:16,672][344387] Updated weights for policy 0, policy_version 32407 (0.0006) +[2026-06-07 01:15:17,406][344387] Updated weights for policy 0, policy_version 32418 (0.0006) +[2026-06-07 01:15:18,154][344387] Updated weights for policy 0, policy_version 32428 (0.0005) +[2026-06-07 01:15:18,813][344387] Updated weights for policy 0, policy_version 32438 (0.0005) +[2026-06-07 01:15:19,494][344387] Updated weights for policy 0, policy_version 32448 (0.0006) +[2026-06-07 01:15:20,257][343476] Fps is (10 sec: 7373.1, 60 sec: 7099.7, 300 sec: 6178.7). Total num frames: 16617472. Throughput: 0: 7116.6. Samples: 16616932. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:15:20,258][343476] Avg episode reward: [(0, '1714.315')] +[2026-06-07 01:15:20,337][344387] Updated weights for policy 0, policy_version 32458 (0.0005) +[2026-06-07 01:15:21,556][344387] Updated weights for policy 0, policy_version 32474 (0.0006) +[2026-06-07 01:15:22,480][344387] Updated weights for policy 0, policy_version 32486 (0.0006) +[2026-06-07 01:15:23,278][344387] Updated weights for policy 0, policy_version 32496 (0.0005) +[2026-06-07 01:15:24,378][344387] Updated weights for policy 0, policy_version 32512 (0.0006) +[2026-06-07 01:15:25,258][343476] Fps is (10 sec: 6758.2, 60 sec: 7065.6, 300 sec: 6213.4). Total num frames: 16650240. Throughput: 0: 7098.0. Samples: 16657606. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:15:25,263][343476] Avg episode reward: [(0, '1465.289')] +[2026-06-07 01:15:25,449][344387] Updated weights for policy 0, policy_version 32523 (0.0006) +[2026-06-07 01:15:26,174][344387] Updated weights for policy 0, policy_version 32536 (0.0005) +[2026-06-07 01:15:27,309][344387] Updated weights for policy 0, policy_version 32548 (0.0005) +[2026-06-07 01:15:28,043][344387] Updated weights for policy 0, policy_version 32558 (0.0006) +[2026-06-07 01:15:28,634][344387] Updated weights for policy 0, policy_version 32568 (0.0005) +[2026-06-07 01:15:29,693][344387] Updated weights for policy 0, policy_version 32580 (0.0005) +[2026-06-07 01:15:30,257][343476] Fps is (10 sec: 6758.4, 60 sec: 7031.5, 300 sec: 6241.2). Total num frames: 16685056. Throughput: 0: 7072.1. Samples: 16677654. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:15:30,260][343476] Avg episode reward: [(0, '1637.989')] +[2026-06-07 01:15:30,682][344387] Updated weights for policy 0, policy_version 32592 (0.0005) +[2026-06-07 01:15:31,657][344387] Updated weights for policy 0, policy_version 32605 (0.0006) +[2026-06-07 01:15:32,252][344387] Updated weights for policy 0, policy_version 32615 (0.0005) +[2026-06-07 01:15:33,393][344387] Updated weights for policy 0, policy_version 32628 (0.0005) +[2026-06-07 01:15:33,969][344387] Updated weights for policy 0, policy_version 32638 (0.0005) +[2026-06-07 01:15:34,701][344387] Updated weights for policy 0, policy_version 32648 (0.0005) +[2026-06-07 01:15:35,257][343476] Fps is (10 sec: 6758.6, 60 sec: 6997.4, 300 sec: 6275.9). Total num frames: 16717824. Throughput: 0: 7043.5. Samples: 16717588. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 01:15:35,259][343476] Avg episode reward: [(0, '1695.983')] +[2026-06-07 01:15:35,924][344387] Updated weights for policy 0, policy_version 32661 (0.0005) +[2026-06-07 01:15:36,755][344387] Updated weights for policy 0, policy_version 32674 (0.0005) +[2026-06-07 01:15:37,369][344387] Updated weights for policy 0, policy_version 32684 (0.0006) +[2026-06-07 01:15:38,753][344387] Updated weights for policy 0, policy_version 32697 (0.0006) +[2026-06-07 01:15:39,518][344387] Updated weights for policy 0, policy_version 32709 (0.0005) +[2026-06-07 01:15:40,257][343476] Fps is (10 sec: 6553.7, 60 sec: 6997.4, 300 sec: 6303.7). Total num frames: 16750592. Throughput: 0: 7021.6. Samples: 16758248. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 01:15:40,259][343476] Avg episode reward: [(0, '1651.147')] +[2026-06-07 01:15:40,402][344387] Updated weights for policy 0, policy_version 32719 (0.0005) +[2026-06-07 01:15:41,480][344387] Updated weights for policy 0, policy_version 32733 (0.0005) +[2026-06-07 01:15:41,952][344387] Updated weights for policy 0, policy_version 32743 (0.0005) +[2026-06-07 01:15:43,017][344387] Updated weights for policy 0, policy_version 32753 (0.0005) +[2026-06-07 01:15:43,634][344387] Updated weights for policy 0, policy_version 32763 (0.0005) +[2026-06-07 01:15:44,354][344387] Updated weights for policy 0, policy_version 32775 (0.0005) +[2026-06-07 01:15:45,257][343476] Fps is (10 sec: 6758.5, 60 sec: 6997.4, 300 sec: 6352.3). Total num frames: 16785408. Throughput: 0: 6997.4. Samples: 16778586. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 01:15:45,259][343476] Avg episode reward: [(0, '1542.261')] +[2026-06-07 01:15:45,717][344387] Updated weights for policy 0, policy_version 32788 (0.0006) +[2026-06-07 01:15:46,294][344387] Updated weights for policy 0, policy_version 32800 (0.0005) +[2026-06-07 01:15:47,077][344387] Updated weights for policy 0, policy_version 32810 (0.0005) +[2026-06-07 01:15:48,057][344304] Signal inference workers to stop experience collection... (3300 times) +[2026-06-07 01:15:48,068][344387] InferenceWorker_p0-w0: stopping experience collection (3300 times) +[2026-06-07 01:15:48,145][344304] Signal inference workers to resume experience collection... (3300 times) +[2026-06-07 01:15:48,146][344387] InferenceWorker_p0-w0: resuming experience collection (3300 times) +[2026-06-07 01:15:48,246][344387] Updated weights for policy 0, policy_version 32823 (0.0006) +[2026-06-07 01:15:49,154][344387] Updated weights for policy 0, policy_version 32836 (0.0006) +[2026-06-07 01:15:49,961][344387] Updated weights for policy 0, policy_version 32846 (0.0005) +[2026-06-07 01:15:50,257][343476] Fps is (10 sec: 6758.2, 60 sec: 6963.6, 300 sec: 6380.0). Total num frames: 16818176. Throughput: 0: 6929.8. Samples: 16818284. Policy #0 lag: (min: 3.0, avg: 19.7, max: 35.0) +[2026-06-07 01:15:50,259][343476] Avg episode reward: [(0, '1560.380')] +[2026-06-07 01:15:51,013][344387] Updated weights for policy 0, policy_version 32860 (0.0006) +[2026-06-07 01:15:51,828][344387] Updated weights for policy 0, policy_version 32870 (0.0005) +[2026-06-07 01:15:52,390][344387] Updated weights for policy 0, policy_version 32880 (0.0005) +[2026-06-07 01:15:53,544][344387] Updated weights for policy 0, policy_version 32893 (0.0005) +[2026-06-07 01:15:54,310][344387] Updated weights for policy 0, policy_version 32903 (0.0005) +[2026-06-07 01:15:55,257][343476] Fps is (10 sec: 6553.5, 60 sec: 6929.1, 300 sec: 6414.8). Total num frames: 16850944. Throughput: 0: 6835.9. Samples: 16858620. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 01:15:55,259][343476] Avg episode reward: [(0, '1598.510')] +[2026-06-07 01:15:55,408][344387] Updated weights for policy 0, policy_version 32913 (0.0005) +[2026-06-07 01:15:56,041][344387] Updated weights for policy 0, policy_version 32928 (0.0006) +[2026-06-07 01:15:57,007][344387] Updated weights for policy 0, policy_version 32938 (0.0005) +[2026-06-07 01:15:57,898][344387] Updated weights for policy 0, policy_version 32948 (0.0005) +[2026-06-07 01:15:58,780][344387] Updated weights for policy 0, policy_version 32961 (0.0005) +[2026-06-07 01:15:59,474][344387] Updated weights for policy 0, policy_version 32971 (0.0005) +[2026-06-07 01:16:00,257][343476] Fps is (10 sec: 6758.5, 60 sec: 6894.9, 300 sec: 6449.5). Total num frames: 16885760. Throughput: 0: 6783.5. Samples: 16878990. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 01:16:00,259][343476] Avg episode reward: [(0, '1700.726')] +[2026-06-07 01:16:00,648][344387] Updated weights for policy 0, policy_version 32985 (0.0006) +[2026-06-07 01:16:01,234][344387] Updated weights for policy 0, policy_version 32995 (0.0005) +[2026-06-07 01:16:02,236][344387] Updated weights for policy 0, policy_version 33005 (0.0005) +[2026-06-07 01:16:02,740][344387] Updated weights for policy 0, policy_version 33015 (0.0006) +[2026-06-07 01:16:03,516][344387] Updated weights for policy 0, policy_version 33025 (0.0005) +[2026-06-07 01:16:04,146][344387] Updated weights for policy 0, policy_version 33035 (0.0006) +[2026-06-07 01:16:04,988][344387] Updated weights for policy 0, policy_version 33045 (0.0005) +[2026-06-07 01:16:05,257][343476] Fps is (10 sec: 6963.2, 60 sec: 6894.9, 300 sec: 6484.2). Total num frames: 16920576. Throughput: 0: 6739.8. Samples: 16920224. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 01:16:05,259][343476] Avg episode reward: [(0, '1698.001')] +[2026-06-07 01:16:05,536][344387] Updated weights for policy 0, policy_version 33055 (0.0005) +[2026-06-07 01:16:06,380][344387] Updated weights for policy 0, policy_version 33065 (0.0005) +[2026-06-07 01:16:07,200][344387] Updated weights for policy 0, policy_version 33075 (0.0006) +[2026-06-07 01:16:07,913][344387] Updated weights for policy 0, policy_version 33085 (0.0005) +[2026-06-07 01:16:08,525][344387] Updated weights for policy 0, policy_version 33095 (0.0005) +[2026-06-07 01:16:09,727][344387] Updated weights for policy 0, policy_version 33108 (0.0005) +[2026-06-07 01:16:10,257][343476] Fps is (10 sec: 6963.2, 60 sec: 6860.9, 300 sec: 6518.9). Total num frames: 16955392. Throughput: 0: 6759.0. Samples: 16961758. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 01:16:10,258][343476] Avg episode reward: [(0, '1668.187')] +[2026-06-07 01:16:10,409][344387] Updated weights for policy 0, policy_version 33118 (0.0006) +[2026-06-07 01:16:10,919][344387] Updated weights for policy 0, policy_version 33128 (0.0005) +[2026-06-07 01:16:12,215][344387] Updated weights for policy 0, policy_version 33141 (0.0005) +[2026-06-07 01:16:12,842][344387] Updated weights for policy 0, policy_version 33151 (0.0005) +[2026-06-07 01:16:13,692][344387] Updated weights for policy 0, policy_version 33161 (0.0005) +[2026-06-07 01:16:14,734][344387] Updated weights for policy 0, policy_version 33174 (0.0005) +[2026-06-07 01:16:15,257][343476] Fps is (10 sec: 6758.4, 60 sec: 6758.4, 300 sec: 6553.6). Total num frames: 16988160. Throughput: 0: 6756.5. Samples: 16981696. Policy #0 lag: (min: 3.0, avg: 20.5, max: 35.0) +[2026-06-07 01:16:15,259][343476] Avg episode reward: [(0, '1667.447')] +[2026-06-07 01:16:15,569][344387] Updated weights for policy 0, policy_version 33185 (0.0006) +[2026-06-07 01:16:16,291][344387] Updated weights for policy 0, policy_version 33195 (0.0006) +[2026-06-07 01:16:17,244][344387] Updated weights for policy 0, policy_version 33208 (0.0005) +[2026-06-07 01:16:18,090][344387] Updated weights for policy 0, policy_version 33218 (0.0005) +[2026-06-07 01:16:18,718][344387] Updated weights for policy 0, policy_version 33228 (0.0005) +[2026-06-07 01:16:19,650][344387] Updated weights for policy 0, policy_version 33238 (0.0005) +[2026-06-07 01:16:20,257][343476] Fps is (10 sec: 6553.7, 60 sec: 6724.3, 300 sec: 6588.3). Total num frames: 17020928. Throughput: 0: 6748.3. Samples: 17021262. Policy #0 lag: (min: 2.0, avg: 20.1, max: 38.0) +[2026-06-07 01:16:20,259][343476] Avg episode reward: [(0, '1727.841')] +[2026-06-07 01:16:20,553][344387] Updated weights for policy 0, policy_version 33252 (0.0006) +[2026-06-07 01:16:21,626][344387] Updated weights for policy 0, policy_version 33262 (0.0006) +[2026-06-07 01:16:22,144][344387] Updated weights for policy 0, policy_version 33272 (0.0005) +[2026-06-07 01:16:23,505][344387] Updated weights for policy 0, policy_version 33287 (0.0005) +[2026-06-07 01:16:24,426][344387] Updated weights for policy 0, policy_version 33297 (0.0005) +[2026-06-07 01:16:25,257][343476] Fps is (10 sec: 6553.7, 60 sec: 6724.3, 300 sec: 6595.3). Total num frames: 17053696. Throughput: 0: 6720.8. Samples: 17060686. Policy #0 lag: (min: 2.0, avg: 20.1, max: 38.0) +[2026-06-07 01:16:25,258][343476] Avg episode reward: [(0, '1628.547')] +[2026-06-07 01:16:25,299][344387] Updated weights for policy 0, policy_version 33309 (0.0005) +[2026-06-07 01:16:25,977][344387] Updated weights for policy 0, policy_version 33320 (0.0005) +[2026-06-07 01:16:26,863][344387] Updated weights for policy 0, policy_version 33330 (0.0006) +[2026-06-07 01:16:27,782][344387] Updated weights for policy 0, policy_version 33343 (0.0006) +[2026-06-07 01:16:28,709][344387] Updated weights for policy 0, policy_version 33353 (0.0005) +[2026-06-07 01:16:29,239][344387] Updated weights for policy 0, policy_version 33363 (0.0005) +[2026-06-07 01:16:30,243][344387] Updated weights for policy 0, policy_version 33376 (0.0006) +[2026-06-07 01:16:30,257][343476] Fps is (10 sec: 6758.4, 60 sec: 6724.3, 300 sec: 6609.2). Total num frames: 17088512. Throughput: 0: 6706.2. Samples: 17080366. Policy #0 lag: (min: 2.0, avg: 20.1, max: 38.0) +[2026-06-07 01:16:30,259][343476] Avg episode reward: [(0, '1761.807')] +[2026-06-07 01:16:31,209][344387] Updated weights for policy 0, policy_version 33386 (0.0005) +[2026-06-07 01:16:31,837][344387] Updated weights for policy 0, policy_version 33396 (0.0005) +[2026-06-07 01:16:33,227][344387] Updated weights for policy 0, policy_version 33411 (0.0006) +[2026-06-07 01:16:33,948][344387] Updated weights for policy 0, policy_version 33421 (0.0005) +[2026-06-07 01:16:34,962][344387] Updated weights for policy 0, policy_version 33434 (0.0005) +[2026-06-07 01:16:35,257][343476] Fps is (10 sec: 6758.3, 60 sec: 6724.3, 300 sec: 6616.1). Total num frames: 17121280. Throughput: 0: 6700.5. Samples: 17119804. Policy #0 lag: (min: 2.0, avg: 20.1, max: 38.0) +[2026-06-07 01:16:35,259][343476] Avg episode reward: [(0, '1402.828')] +[2026-06-07 01:16:35,572][344387] Updated weights for policy 0, policy_version 33444 (0.0005) +[2026-06-07 01:16:36,337][344387] Updated weights for policy 0, policy_version 33454 (0.0005) +[2026-06-07 01:16:37,369][344387] Updated weights for policy 0, policy_version 33467 (0.0005) +[2026-06-07 01:16:38,360][344387] Updated weights for policy 0, policy_version 33477 (0.0005) +[2026-06-07 01:16:39,220][344387] Updated weights for policy 0, policy_version 33490 (0.0006) +[2026-06-07 01:16:40,153][344387] Updated weights for policy 0, policy_version 33503 (0.0006) +[2026-06-07 01:16:40,257][343476] Fps is (10 sec: 6553.5, 60 sec: 6724.3, 300 sec: 6616.1). Total num frames: 17154048. Throughput: 0: 6693.5. Samples: 17159830. Policy #0 lag: (min: 3.0, avg: 17.6, max: 35.0) +[2026-06-07 01:16:40,259][343476] Avg episode reward: [(0, '1727.404')] +[2026-06-07 01:16:41,143][344387] Updated weights for policy 0, policy_version 33513 (0.0005) +[2026-06-07 01:16:41,739][344387] Updated weights for policy 0, policy_version 33523 (0.0006) +[2026-06-07 01:16:42,677][344387] Updated weights for policy 0, policy_version 33536 (0.0006) +[2026-06-07 01:16:43,644][344387] Updated weights for policy 0, policy_version 33546 (0.0006) +[2026-06-07 01:16:44,496][344387] Updated weights for policy 0, policy_version 33556 (0.0006) +[2026-06-07 01:16:45,257][343476] Fps is (10 sec: 6553.6, 60 sec: 6690.1, 300 sec: 6623.0). Total num frames: 17186816. Throughput: 0: 6674.1. Samples: 17179326. Policy #0 lag: (min: 3.0, avg: 17.6, max: 35.0) +[2026-06-07 01:16:45,258][343476] Avg episode reward: [(0, '1497.968')] +[2026-06-07 01:16:45,604][344387] Updated weights for policy 0, policy_version 33569 (0.0005) +[2026-06-07 01:16:46,376][344387] Updated weights for policy 0, policy_version 33581 (0.0005) +[2026-06-07 01:16:47,214][344387] Updated weights for policy 0, policy_version 33593 (0.0005) +[2026-06-07 01:16:48,204][344387] Updated weights for policy 0, policy_version 33603 (0.0006) +[2026-06-07 01:16:48,931][344387] Updated weights for policy 0, policy_version 33616 (0.0005) +[2026-06-07 01:16:49,766][344387] Updated weights for policy 0, policy_version 33626 (0.0005) +[2026-06-07 01:16:50,258][343476] Fps is (10 sec: 6553.2, 60 sec: 6690.1, 300 sec: 6636.9). Total num frames: 17219584. Throughput: 0: 6641.8. Samples: 17219108. Policy #0 lag: (min: 3.0, avg: 17.6, max: 35.0) +[2026-06-07 01:16:50,260][343476] Avg episode reward: [(0, '1621.346')] +[2026-06-07 01:16:50,605][344387] Updated weights for policy 0, policy_version 33636 (0.0005) +[2026-06-07 01:16:51,371][344387] Updated weights for policy 0, policy_version 33648 (0.0005) +[2026-06-07 01:16:52,259][344387] Updated weights for policy 0, policy_version 33658 (0.0005) +[2026-06-07 01:16:53,174][344387] Updated weights for policy 0, policy_version 33668 (0.0005) +[2026-06-07 01:16:54,134][344387] Updated weights for policy 0, policy_version 33681 (0.0005) +[2026-06-07 01:16:54,749][344387] Updated weights for policy 0, policy_version 33691 (0.0005) +[2026-06-07 01:16:55,257][343476] Fps is (10 sec: 6553.7, 60 sec: 6690.1, 300 sec: 6643.9). Total num frames: 17252352. Throughput: 0: 6599.0. Samples: 17258712. Policy #0 lag: (min: 3.0, avg: 17.6, max: 35.0) +[2026-06-07 01:16:55,258][343476] Avg episode reward: [(0, '1723.110')] +[2026-06-07 01:16:55,828][344387] Updated weights for policy 0, policy_version 33701 (0.0005) +[2026-06-07 01:16:56,285][344387] Updated weights for policy 0, policy_version 33712 (0.0005) +[2026-06-07 01:16:57,153][344387] Updated weights for policy 0, policy_version 33722 (0.0005) +[2026-06-07 01:16:58,265][344387] Updated weights for policy 0, policy_version 33732 (0.0005) +[2026-06-07 01:16:59,001][344387] Updated weights for policy 0, policy_version 33745 (0.0005) +[2026-06-07 01:16:59,667][344387] Updated weights for policy 0, policy_version 33755 (0.0005) +[2026-06-07 01:17:00,257][343476] Fps is (10 sec: 6554.0, 60 sec: 6656.0, 300 sec: 6664.7). Total num frames: 17285120. Throughput: 0: 6603.7. Samples: 17278862. Policy #0 lag: (min: 3.0, avg: 21.9, max: 41.0) +[2026-06-07 01:17:00,262][343476] Avg episode reward: [(0, '1530.466')] +[2026-06-07 01:17:00,711][344387] Updated weights for policy 0, policy_version 33765 (0.0005) +[2026-06-07 01:17:00,785][344304] Signal inference workers to stop experience collection... (3350 times) +[2026-06-07 01:17:00,794][344387] InferenceWorker_p0-w0: stopping experience collection (3350 times) +[2026-06-07 01:17:00,843][344304] Signal inference workers to resume experience collection... (3350 times) +[2026-06-07 01:17:00,843][344387] InferenceWorker_p0-w0: resuming experience collection (3350 times) +[2026-06-07 01:17:01,413][344387] Updated weights for policy 0, policy_version 33777 (0.0006) +[2026-06-07 01:17:02,069][344387] Updated weights for policy 0, policy_version 33787 (0.0005) +[2026-06-07 01:17:03,112][344387] Updated weights for policy 0, policy_version 33797 (0.0005) +[2026-06-07 01:17:03,941][344387] Updated weights for policy 0, policy_version 33810 (0.0005) +[2026-06-07 01:17:04,559][344387] Updated weights for policy 0, policy_version 33820 (0.0005) +[2026-06-07 01:17:05,258][343476] Fps is (10 sec: 6553.3, 60 sec: 6621.8, 300 sec: 6671.6). Total num frames: 17317888. Throughput: 0: 6605.2. Samples: 17318500. Policy #0 lag: (min: 3.0, avg: 21.9, max: 41.0) +[2026-06-07 01:17:05,261][343476] Avg episode reward: [(0, '1633.494')] +[2026-06-07 01:17:05,628][344387] Updated weights for policy 0, policy_version 33830 (0.0006) +[2026-06-07 01:17:06,378][344387] Updated weights for policy 0, policy_version 33843 (0.0005) +[2026-06-07 01:17:07,560][344387] Updated weights for policy 0, policy_version 33853 (0.0006) +[2026-06-07 01:17:08,232][344387] Updated weights for policy 0, policy_version 33864 (0.0006) +[2026-06-07 01:17:08,848][344387] Updated weights for policy 0, policy_version 33874 (0.0005) +[2026-06-07 01:17:09,796][344387] Updated weights for policy 0, policy_version 33884 (0.0005) +[2026-06-07 01:17:10,257][343476] Fps is (10 sec: 6553.6, 60 sec: 6587.7, 300 sec: 6678.6). Total num frames: 17350656. Throughput: 0: 6608.7. Samples: 17358078. Policy #0 lag: (min: 3.0, avg: 21.9, max: 41.0) +[2026-06-07 01:17:10,260][343476] Avg episode reward: [(0, '1694.777')] +[2026-06-07 01:17:10,757][344387] Updated weights for policy 0, policy_version 33897 (0.0005) +[2026-06-07 01:17:11,561][344387] Updated weights for policy 0, policy_version 33907 (0.0005) +[2026-06-07 01:17:12,528][344387] Updated weights for policy 0, policy_version 33917 (0.0005) +[2026-06-07 01:17:13,197][344387] Updated weights for policy 0, policy_version 33929 (0.0005) +[2026-06-07 01:17:14,127][344387] Updated weights for policy 0, policy_version 33939 (0.0005) +[2026-06-07 01:17:14,895][344387] Updated weights for policy 0, policy_version 33949 (0.0005) +[2026-06-07 01:17:15,257][343476] Fps is (10 sec: 6758.6, 60 sec: 6621.9, 300 sec: 6699.4). Total num frames: 17385472. Throughput: 0: 6612.1. Samples: 17377910. Policy #0 lag: (min: 3.0, avg: 21.9, max: 41.0) +[2026-06-07 01:17:15,260][343476] Avg episode reward: [(0, '1607.225')] +[2026-06-07 01:17:15,382][344387] Updated weights for policy 0, policy_version 33960 (0.0005) +[2026-06-07 01:17:16,386][344387] Updated weights for policy 0, policy_version 33970 (0.0005) +[2026-06-07 01:17:17,162][344387] Updated weights for policy 0, policy_version 33980 (0.0005) +[2026-06-07 01:17:17,740][344387] Updated weights for policy 0, policy_version 33992 (0.0005) +[2026-06-07 01:17:18,918][344387] Updated weights for policy 0, policy_version 34002 (0.0005) +[2026-06-07 01:17:19,899][344387] Updated weights for policy 0, policy_version 34017 (0.0005) +[2026-06-07 01:17:20,257][343476] Fps is (10 sec: 6963.2, 60 sec: 6656.0, 300 sec: 6720.2). Total num frames: 17420288. Throughput: 0: 6642.9. Samples: 17418734. Policy #0 lag: (min: 3.0, avg: 21.9, max: 41.0) +[2026-06-07 01:17:20,259][343476] Avg episode reward: [(0, '1548.660')] +[2026-06-07 01:17:20,573][344387] Updated weights for policy 0, policy_version 34028 (0.0005) +[2026-06-07 01:17:21,787][344387] Updated weights for policy 0, policy_version 34038 (0.0006) +[2026-06-07 01:17:23,075][344387] Updated weights for policy 0, policy_version 34057 (0.0006) +[2026-06-07 01:17:24,085][344387] Updated weights for policy 0, policy_version 34067 (0.0006) +[2026-06-07 01:17:24,971][344387] Updated weights for policy 0, policy_version 34084 (0.0006) +[2026-06-07 01:17:25,257][343476] Fps is (10 sec: 6758.5, 60 sec: 6656.0, 300 sec: 6734.1). Total num frames: 17453056. Throughput: 0: 6629.2. Samples: 17458144. Policy #0 lag: (min: 6.0, avg: 22.6, max: 38.0) +[2026-06-07 01:17:25,259][343476] Avg episode reward: [(0, '1671.328')] +[2026-06-07 01:17:26,017][344387] Updated weights for policy 0, policy_version 34094 (0.0005) +[2026-06-07 01:17:27,164][344387] Updated weights for policy 0, policy_version 34109 (0.0005) +[2026-06-07 01:17:27,642][344387] Updated weights for policy 0, policy_version 34119 (0.0005) +[2026-06-07 01:17:29,159][344387] Updated weights for policy 0, policy_version 34132 (0.0006) +[2026-06-07 01:17:29,990][344387] Updated weights for policy 0, policy_version 34146 (0.0006) +[2026-06-07 01:17:30,257][343476] Fps is (10 sec: 6553.7, 60 sec: 6621.9, 300 sec: 6741.0). Total num frames: 17485824. Throughput: 0: 6623.5. Samples: 17477384. Policy #0 lag: (min: 6.0, avg: 22.6, max: 38.0) +[2026-06-07 01:17:30,259][343476] Avg episode reward: [(0, '1525.126')] +[2026-06-07 01:17:30,563][344387] Updated weights for policy 0, policy_version 34156 (0.0006) +[2026-06-07 01:17:31,990][344387] Updated weights for policy 0, policy_version 34169 (0.0005) +[2026-06-07 01:17:32,707][344387] Updated weights for policy 0, policy_version 34182 (0.0006) +[2026-06-07 01:17:33,517][344387] Updated weights for policy 0, policy_version 34192 (0.0005) +[2026-06-07 01:17:34,443][344387] Updated weights for policy 0, policy_version 34202 (0.0005) +[2026-06-07 01:17:35,186][344387] Updated weights for policy 0, policy_version 34215 (0.0005) +[2026-06-07 01:17:35,257][343476] Fps is (10 sec: 6553.4, 60 sec: 6621.8, 300 sec: 6748.0). Total num frames: 17518592. Throughput: 0: 6618.8. Samples: 17516952. Policy #0 lag: (min: 6.0, avg: 22.6, max: 38.0) +[2026-06-07 01:17:35,260][343476] Avg episode reward: [(0, '1692.807')] +[2026-06-07 01:17:36,358][344387] Updated weights for policy 0, policy_version 34225 (0.0005) +[2026-06-07 01:17:37,241][344387] Updated weights for policy 0, policy_version 34240 (0.0006) +[2026-06-07 01:17:38,092][344387] Updated weights for policy 0, policy_version 34250 (0.0005) +[2026-06-07 01:17:38,918][344387] Updated weights for policy 0, policy_version 34260 (0.0005) +[2026-06-07 01:17:39,656][344387] Updated weights for policy 0, policy_version 34270 (0.0005) +[2026-06-07 01:17:40,160][344387] Updated weights for policy 0, policy_version 34280 (0.0006) +[2026-06-07 01:17:40,257][343476] Fps is (10 sec: 6553.5, 60 sec: 6621.9, 300 sec: 6754.9). Total num frames: 17551360. Throughput: 0: 6613.5. Samples: 17556320. Policy #0 lag: (min: 6.0, avg: 22.6, max: 38.0) +[2026-06-07 01:17:40,259][343476] Avg episode reward: [(0, '1680.135')] +[2026-06-07 01:17:41,381][344387] Updated weights for policy 0, policy_version 34290 (0.0006) +[2026-06-07 01:17:42,022][344387] Updated weights for policy 0, policy_version 34300 (0.0005) +[2026-06-07 01:17:42,708][344387] Updated weights for policy 0, policy_version 34310 (0.0005) +[2026-06-07 01:17:43,734][344387] Updated weights for policy 0, policy_version 34320 (0.0006) +[2026-06-07 01:17:44,583][344387] Updated weights for policy 0, policy_version 34330 (0.0005) +[2026-06-07 01:17:45,109][344387] Updated weights for policy 0, policy_version 34340 (0.0005) +[2026-06-07 01:17:45,257][343476] Fps is (10 sec: 6348.9, 60 sec: 6587.7, 300 sec: 6754.9). Total num frames: 17582080. Throughput: 0: 6590.6. Samples: 17575440. Policy #0 lag: (min: 0.0, avg: 20.3, max: 34.0) +[2026-06-07 01:17:45,260][343476] Avg episode reward: [(0, '1582.046')] +[2026-06-07 01:17:46,162][344387] Updated weights for policy 0, policy_version 34350 (0.0005) +[2026-06-07 01:17:47,173][344387] Updated weights for policy 0, policy_version 34361 (0.0005) +[2026-06-07 01:17:48,022][344387] Updated weights for policy 0, policy_version 34374 (0.0006) +[2026-06-07 01:17:48,924][344387] Updated weights for policy 0, policy_version 34385 (0.0006) +[2026-06-07 01:17:49,736][344387] Updated weights for policy 0, policy_version 34395 (0.0005) +[2026-06-07 01:17:50,257][343476] Fps is (10 sec: 6144.0, 60 sec: 6553.7, 300 sec: 6761.9). Total num frames: 17612800. Throughput: 0: 6569.7. Samples: 17614136. Policy #0 lag: (min: 0.0, avg: 20.3, max: 34.0) +[2026-06-07 01:17:50,259][343476] Avg episode reward: [(0, '1771.554')] +[2026-06-07 01:17:50,372][344387] Updated weights for policy 0, policy_version 34405 (0.0006) +[2026-06-07 01:17:51,136][344387] Updated weights for policy 0, policy_version 34415 (0.0005) +[2026-06-07 01:17:52,173][344387] Updated weights for policy 0, policy_version 34425 (0.0005) +[2026-06-07 01:17:52,678][344387] Updated weights for policy 0, policy_version 34435 (0.0005) +[2026-06-07 01:17:53,607][344387] Updated weights for policy 0, policy_version 34445 (0.0005) +[2026-06-07 01:17:54,280][344387] Updated weights for policy 0, policy_version 34455 (0.0005) +[2026-06-07 01:17:55,129][344387] Updated weights for policy 0, policy_version 34466 (0.0005) +[2026-06-07 01:17:55,257][343476] Fps is (10 sec: 6553.7, 60 sec: 6587.7, 300 sec: 6775.8). Total num frames: 17647616. Throughput: 0: 6573.0. Samples: 17653864. Policy #0 lag: (min: 0.0, avg: 20.3, max: 34.0) +[2026-06-07 01:17:55,259][343476] Avg episode reward: [(0, '1652.393')] +[2026-06-07 01:17:55,773][344387] Updated weights for policy 0, policy_version 34476 (0.0006) +[2026-06-07 01:17:56,679][344387] Updated weights for policy 0, policy_version 34486 (0.0005) +[2026-06-07 01:17:57,412][344387] Updated weights for policy 0, policy_version 34496 (0.0005) +[2026-06-07 01:17:58,095][344387] Updated weights for policy 0, policy_version 34506 (0.0006) +[2026-06-07 01:17:58,928][344387] Updated weights for policy 0, policy_version 34516 (0.0005) +[2026-06-07 01:17:59,792][344387] Updated weights for policy 0, policy_version 34526 (0.0005) +[2026-06-07 01:18:00,257][343476] Fps is (10 sec: 6758.5, 60 sec: 6587.7, 300 sec: 6789.6). Total num frames: 17680384. Throughput: 0: 6572.0. Samples: 17673650. Policy #0 lag: (min: 0.0, avg: 20.3, max: 34.0) +[2026-06-07 01:18:00,259][343476] Avg episode reward: [(0, '1523.152')] +[2026-06-07 01:18:00,308][344387] Updated weights for policy 0, policy_version 34536 (0.0005) +[2026-06-07 01:18:01,357][344387] Updated weights for policy 0, policy_version 34547 (0.0005) +[2026-06-07 01:18:02,286][344387] Updated weights for policy 0, policy_version 34557 (0.0005) +[2026-06-07 01:18:03,317][344387] Updated weights for policy 0, policy_version 34570 (0.0005) +[2026-06-07 01:18:04,165][344387] Updated weights for policy 0, policy_version 34581 (0.0005) +[2026-06-07 01:18:04,825][344387] Updated weights for policy 0, policy_version 34591 (0.0005) +[2026-06-07 01:18:05,257][343476] Fps is (10 sec: 6553.5, 60 sec: 6587.8, 300 sec: 6796.6). Total num frames: 17713152. Throughput: 0: 6539.6. Samples: 17713016. Policy #0 lag: (min: 0.0, avg: 20.3, max: 34.0) +[2026-06-07 01:18:05,259][343476] Avg episode reward: [(0, '1765.805')] +[2026-06-07 01:18:05,631][344387] Updated weights for policy 0, policy_version 34601 (0.0006) +[2026-06-07 01:18:06,768][344387] Updated weights for policy 0, policy_version 34614 (0.0006) +[2026-06-07 01:18:07,354][344304] Signal inference workers to stop experience collection... (3400 times) +[2026-06-07 01:18:07,363][344387] InferenceWorker_p0-w0: stopping experience collection (3400 times) +[2026-06-07 01:18:07,436][344304] Signal inference workers to resume experience collection... (3400 times) +[2026-06-07 01:18:07,437][344387] InferenceWorker_p0-w0: resuming experience collection (3400 times) +[2026-06-07 01:18:07,534][344387] Updated weights for policy 0, policy_version 34627 (0.0007) +[2026-06-07 01:18:08,655][344387] Updated weights for policy 0, policy_version 34637 (0.0006) +[2026-06-07 01:18:09,455][344387] Updated weights for policy 0, policy_version 34650 (0.0005) +[2026-06-07 01:18:10,258][343476] Fps is (10 sec: 6553.1, 60 sec: 6587.7, 300 sec: 6796.6). Total num frames: 17745920. Throughput: 0: 6535.3. Samples: 17752238. Policy #0 lag: (min: 1.0, avg: 19.9, max: 37.0) +[2026-06-07 01:18:10,261][343476] Avg episode reward: [(0, '1636.291')] +[2026-06-07 01:18:10,383][344387] Updated weights for policy 0, policy_version 34662 (0.0006) +[2026-06-07 01:18:11,428][344387] Updated weights for policy 0, policy_version 34675 (0.0006) +[2026-06-07 01:18:12,321][344387] Updated weights for policy 0, policy_version 34686 (0.0006) +[2026-06-07 01:18:13,142][344387] Updated weights for policy 0, policy_version 34699 (0.0005) +[2026-06-07 01:18:14,156][344387] Updated weights for policy 0, policy_version 34709 (0.0005) +[2026-06-07 01:18:15,014][344387] Updated weights for policy 0, policy_version 34721 (0.0005) +[2026-06-07 01:18:15,257][343476] Fps is (10 sec: 6553.6, 60 sec: 6553.6, 300 sec: 6796.6). Total num frames: 17778688. Throughput: 0: 6536.3. Samples: 17771516. Policy #0 lag: (min: 1.0, avg: 19.9, max: 37.0) +[2026-06-07 01:18:15,258][343476] Avg episode reward: [(0, '1755.961')] +[2026-06-07 01:18:16,230][344387] Updated weights for policy 0, policy_version 34733 (0.0005) +[2026-06-07 01:18:16,694][344387] Updated weights for policy 0, policy_version 34743 (0.0005) +[2026-06-07 01:18:17,505][344387] Updated weights for policy 0, policy_version 34753 (0.0005) +[2026-06-07 01:18:18,166][344387] Updated weights for policy 0, policy_version 34763 (0.0005) +[2026-06-07 01:18:19,051][344387] Updated weights for policy 0, policy_version 34774 (0.0005) +[2026-06-07 01:18:19,711][344387] Updated weights for policy 0, policy_version 34784 (0.0005) +[2026-06-07 01:18:20,257][343476] Fps is (10 sec: 6554.0, 60 sec: 6519.5, 300 sec: 6789.6). Total num frames: 17811456. Throughput: 0: 6548.5. Samples: 17811632. Policy #0 lag: (min: 1.0, avg: 19.9, max: 37.0) +[2026-06-07 01:18:20,258][343476] Avg episode reward: [(0, '1681.848')] +[2026-06-07 01:18:20,625][344387] Updated weights for policy 0, policy_version 34794 (0.0005) +[2026-06-07 01:18:21,361][344387] Updated weights for policy 0, policy_version 34804 (0.0005) +[2026-06-07 01:18:22,053][344387] Updated weights for policy 0, policy_version 34814 (0.0005) +[2026-06-07 01:18:22,758][344387] Updated weights for policy 0, policy_version 34824 (0.0005) +[2026-06-07 01:18:23,775][344387] Updated weights for policy 0, policy_version 34834 (0.0005) +[2026-06-07 01:18:24,318][344387] Updated weights for policy 0, policy_version 34844 (0.0005) +[2026-06-07 01:18:25,258][343476] Fps is (10 sec: 6553.3, 60 sec: 6519.4, 300 sec: 6796.6). Total num frames: 17844224. Throughput: 0: 6559.8. Samples: 17851512. Policy #0 lag: (min: 1.0, avg: 19.9, max: 37.0) +[2026-06-07 01:18:25,263][343476] Avg episode reward: [(0, '1712.988')] +[2026-06-07 01:18:25,466][344387] Updated weights for policy 0, policy_version 34856 (0.0005) +[2026-06-07 01:18:26,205][344387] Updated weights for policy 0, policy_version 34866 (0.0006) +[2026-06-07 01:18:26,784][344387] Updated weights for policy 0, policy_version 34876 (0.0005) +[2026-06-07 01:18:27,845][344387] Updated weights for policy 0, policy_version 34886 (0.0005) +[2026-06-07 01:18:28,397][344387] Updated weights for policy 0, policy_version 34896 (0.0005) +[2026-06-07 01:18:29,530][344387] Updated weights for policy 0, policy_version 34909 (0.0006) +[2026-06-07 01:18:30,257][343476] Fps is (10 sec: 6553.5, 60 sec: 6519.4, 300 sec: 6789.6). Total num frames: 17876992. Throughput: 0: 6579.6. Samples: 17871522. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:18:30,261][343476] Avg episode reward: [(0, '1628.603')] +[2026-06-07 01:18:30,394][344387] Updated weights for policy 0, policy_version 34919 (0.0005) +[2026-06-07 01:18:31,242][344387] Updated weights for policy 0, policy_version 34932 (0.0005) +[2026-06-07 01:18:32,084][344387] Updated weights for policy 0, policy_version 34942 (0.0005) +[2026-06-07 01:18:33,095][344387] Updated weights for policy 0, policy_version 34955 (0.0006) +[2026-06-07 01:18:33,907][344387] Updated weights for policy 0, policy_version 34968 (0.0006) +[2026-06-07 01:18:35,055][344387] Updated weights for policy 0, policy_version 34978 (0.0005) +[2026-06-07 01:18:35,258][343476] Fps is (10 sec: 6553.6, 60 sec: 6519.4, 300 sec: 6782.7). Total num frames: 17909760. Throughput: 0: 6574.2. Samples: 17909978. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:18:35,263][343476] Avg episode reward: [(0, '1847.168')] +[2026-06-07 01:18:35,270][344304] Saving new best policy, reward=1847.168! +[2026-06-07 01:18:36,019][344387] Updated weights for policy 0, policy_version 34992 (0.0005) +[2026-06-07 01:18:36,808][344387] Updated weights for policy 0, policy_version 35002 (0.0005) +[2026-06-07 01:18:37,517][344387] Updated weights for policy 0, policy_version 35012 (0.0005) +[2026-06-07 01:18:38,508][344387] Updated weights for policy 0, policy_version 35025 (0.0005) +[2026-06-07 01:18:39,280][344387] Updated weights for policy 0, policy_version 35035 (0.0005) +[2026-06-07 01:18:40,181][344387] Updated weights for policy 0, policy_version 35045 (0.0005) +[2026-06-07 01:18:40,257][343476] Fps is (10 sec: 6758.6, 60 sec: 6553.6, 300 sec: 6782.7). Total num frames: 17944576. Throughput: 0: 6597.5. Samples: 17950752. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:18:40,260][343476] Avg episode reward: [(0, '1764.465')] +[2026-06-07 01:18:40,948][344387] Updated weights for policy 0, policy_version 35058 (0.0005) +[2026-06-07 01:18:41,615][344387] Updated weights for policy 0, policy_version 35068 (0.0005) +[2026-06-07 01:18:42,566][344387] Updated weights for policy 0, policy_version 35078 (0.0006) +[2026-06-07 01:18:43,055][344387] Updated weights for policy 0, policy_version 35088 (0.0005) +[2026-06-07 01:18:43,859][344387] Updated weights for policy 0, policy_version 35098 (0.0005) +[2026-06-07 01:18:44,553][344387] Updated weights for policy 0, policy_version 35108 (0.0005) +[2026-06-07 01:18:45,258][343476] Fps is (10 sec: 6963.2, 60 sec: 6621.8, 300 sec: 6775.8). Total num frames: 17979392. Throughput: 0: 6625.6. Samples: 17971806. Policy #0 lag: (min: 3.0, avg: 17.3, max: 35.0) +[2026-06-07 01:18:45,263][343476] Avg episode reward: [(0, '1707.842')] +[2026-06-07 01:18:45,590][344387] Updated weights for policy 0, policy_version 35121 (0.0005) +[2026-06-07 01:18:46,297][344387] Updated weights for policy 0, policy_version 35131 (0.0005) +[2026-06-07 01:18:47,394][344387] Updated weights for policy 0, policy_version 35144 (0.0006) +[2026-06-07 01:18:47,975][344387] Updated weights for policy 0, policy_version 35154 (0.0005) +[2026-06-07 01:18:48,767][344387] Updated weights for policy 0, policy_version 35164 (0.0005) +[2026-06-07 01:18:49,843][344387] Updated weights for policy 0, policy_version 35177 (0.0005) +[2026-06-07 01:18:50,257][343476] Fps is (10 sec: 6963.2, 60 sec: 6690.1, 300 sec: 6768.8). Total num frames: 18014208. Throughput: 0: 6664.7. Samples: 18012928. Policy #0 lag: (min: 3.0, avg: 21.5, max: 39.0) +[2026-06-07 01:18:50,259][343476] Avg episode reward: [(0, '1794.829')] +[2026-06-07 01:18:50,448][344387] Updated weights for policy 0, policy_version 35187 (0.0005) +[2026-06-07 01:18:51,382][344387] Updated weights for policy 0, policy_version 35197 (0.0005) +[2026-06-07 01:18:52,215][344387] Updated weights for policy 0, policy_version 35210 (0.0005) +[2026-06-07 01:18:52,918][344387] Updated weights for policy 0, policy_version 35220 (0.0005) +[2026-06-07 01:18:53,828][344387] Updated weights for policy 0, policy_version 35230 (0.0005) +[2026-06-07 01:18:54,683][344387] Updated weights for policy 0, policy_version 35243 (0.0006) +[2026-06-07 01:18:55,257][343476] Fps is (10 sec: 6758.6, 60 sec: 6656.0, 300 sec: 6754.9). Total num frames: 18046976. Throughput: 0: 6688.1. Samples: 18053200. Policy #0 lag: (min: 3.0, avg: 21.5, max: 39.0) +[2026-06-07 01:18:55,259][343476] Avg episode reward: [(0, '1673.068')] +[2026-06-07 01:18:55,265][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000035248_18046976.pth... +[2026-06-07 01:18:55,370][344304] Removing results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000011496_5885952.pth +[2026-06-07 01:18:55,690][344387] Updated weights for policy 0, policy_version 35255 (0.0005) +[2026-06-07 01:18:56,729][344387] Updated weights for policy 0, policy_version 35265 (0.0005) +[2026-06-07 01:18:57,381][344387] Updated weights for policy 0, policy_version 35278 (0.0007) +[2026-06-07 01:18:58,689][344387] Updated weights for policy 0, policy_version 35289 (0.0006) +[2026-06-07 01:18:59,664][344387] Updated weights for policy 0, policy_version 35304 (0.0006) +[2026-06-07 01:19:00,257][343476] Fps is (10 sec: 6553.4, 60 sec: 6656.0, 300 sec: 6761.9). Total num frames: 18079744. Throughput: 0: 6696.8. Samples: 18072874. Policy #0 lag: (min: 3.0, avg: 21.5, max: 39.0) +[2026-06-07 01:19:00,260][343476] Avg episode reward: [(0, '1692.965')] +[2026-06-07 01:19:00,486][344387] Updated weights for policy 0, policy_version 35314 (0.0005) +[2026-06-07 01:19:01,417][344387] Updated weights for policy 0, policy_version 35325 (0.0005) +[2026-06-07 01:19:02,049][344387] Updated weights for policy 0, policy_version 35335 (0.0006) +[2026-06-07 01:19:03,040][344387] Updated weights for policy 0, policy_version 35348 (0.0005) +[2026-06-07 01:19:03,928][344387] Updated weights for policy 0, policy_version 35358 (0.0005) +[2026-06-07 01:19:04,524][344387] Updated weights for policy 0, policy_version 35368 (0.0005) +[2026-06-07 01:19:05,257][343476] Fps is (10 sec: 6553.5, 60 sec: 6656.0, 300 sec: 6754.9). Total num frames: 18112512. Throughput: 0: 6678.3. Samples: 18112154. Policy #0 lag: (min: 3.0, avg: 21.5, max: 39.0) +[2026-06-07 01:19:05,259][343476] Avg episode reward: [(0, '1685.002')] +[2026-06-07 01:19:05,602][344387] Updated weights for policy 0, policy_version 35381 (0.0005) +[2026-06-07 01:19:06,364][344387] Updated weights for policy 0, policy_version 35391 (0.0005) +[2026-06-07 01:19:07,324][344387] Updated weights for policy 0, policy_version 35401 (0.0005) +[2026-06-07 01:19:07,846][344387] Updated weights for policy 0, policy_version 35411 (0.0005) +[2026-06-07 01:19:08,603][344304] Signal inference workers to stop experience collection... (3450 times) +[2026-06-07 01:19:08,610][344304] Signal inference workers to resume experience collection... (3450 times) +[2026-06-07 01:19:08,621][344387] InferenceWorker_p0-w0: stopping experience collection (3450 times) +[2026-06-07 01:19:08,621][344387] InferenceWorker_p0-w0: resuming experience collection (3450 times) +[2026-06-07 01:19:08,676][344387] Updated weights for policy 0, policy_version 35421 (0.0005) +[2026-06-07 01:19:09,217][344387] Updated weights for policy 0, policy_version 35432 (0.0005) +[2026-06-07 01:19:10,257][343476] Fps is (10 sec: 6553.6, 60 sec: 6656.0, 300 sec: 6748.0). Total num frames: 18145280. Throughput: 0: 6698.0. Samples: 18152922. Policy #0 lag: (min: 3.0, avg: 21.5, max: 39.0) +[2026-06-07 01:19:10,260][343476] Avg episode reward: [(0, '1725.774')] +[2026-06-07 01:19:10,405][344387] Updated weights for policy 0, policy_version 35445 (0.0005) +[2026-06-07 01:19:11,106][344387] Updated weights for policy 0, policy_version 35455 (0.0005) +[2026-06-07 01:19:11,968][344387] Updated weights for policy 0, policy_version 35465 (0.0005) +[2026-06-07 01:19:12,770][344387] Updated weights for policy 0, policy_version 35478 (0.0005) +[2026-06-07 01:19:14,106][344387] Updated weights for policy 0, policy_version 35494 (0.0006) +[2026-06-07 01:19:15,018][344387] Updated weights for policy 0, policy_version 35504 (0.0006) +[2026-06-07 01:19:15,258][343476] Fps is (10 sec: 6758.1, 60 sec: 6690.1, 300 sec: 6741.0). Total num frames: 18180096. Throughput: 0: 6710.8. Samples: 18173510. Policy #0 lag: (min: 7.0, avg: 22.2, max: 39.0) +[2026-06-07 01:19:15,260][343476] Avg episode reward: [(0, '1531.704')] +[2026-06-07 01:19:15,712][344387] Updated weights for policy 0, policy_version 35515 (0.0005) +[2026-06-07 01:19:16,679][344387] Updated weights for policy 0, policy_version 35528 (0.0005) +[2026-06-07 01:19:17,715][344387] Updated weights for policy 0, policy_version 35538 (0.0005) +[2026-06-07 01:19:18,508][344387] Updated weights for policy 0, policy_version 35550 (0.0006) +[2026-06-07 01:19:19,222][344387] Updated weights for policy 0, policy_version 35560 (0.0005) +[2026-06-07 01:19:20,081][344387] Updated weights for policy 0, policy_version 35570 (0.0005) +[2026-06-07 01:19:20,257][343476] Fps is (10 sec: 6758.5, 60 sec: 6690.1, 300 sec: 6734.1). Total num frames: 18212864. Throughput: 0: 6720.9. Samples: 18212416. Policy #0 lag: (min: 7.0, avg: 22.2, max: 39.0) +[2026-06-07 01:19:20,259][343476] Avg episode reward: [(0, '1574.588')] +[2026-06-07 01:19:20,950][344387] Updated weights for policy 0, policy_version 35582 (0.0005) +[2026-06-07 01:19:21,618][344387] Updated weights for policy 0, policy_version 35592 (0.0005) +[2026-06-07 01:19:22,398][344387] Updated weights for policy 0, policy_version 35602 (0.0005) +[2026-06-07 01:19:23,027][344387] Updated weights for policy 0, policy_version 35612 (0.0005) +[2026-06-07 01:19:23,962][344387] Updated weights for policy 0, policy_version 35622 (0.0005) +[2026-06-07 01:19:24,686][344387] Updated weights for policy 0, policy_version 35632 (0.0006) +[2026-06-07 01:19:25,258][343476] Fps is (10 sec: 6758.7, 60 sec: 6724.3, 300 sec: 6727.2). Total num frames: 18247680. Throughput: 0: 6723.5. Samples: 18253308. Policy #0 lag: (min: 7.0, avg: 22.2, max: 39.0) +[2026-06-07 01:19:25,262][343476] Avg episode reward: [(0, '1573.426')] +[2026-06-07 01:19:25,579][344387] Updated weights for policy 0, policy_version 35642 (0.0005) +[2026-06-07 01:19:26,271][344387] Updated weights for policy 0, policy_version 35652 (0.0005) +[2026-06-07 01:19:27,126][344387] Updated weights for policy 0, policy_version 35662 (0.0005) +[2026-06-07 01:19:27,681][344387] Updated weights for policy 0, policy_version 35672 (0.0005) +[2026-06-07 01:19:28,678][344387] Updated weights for policy 0, policy_version 35682 (0.0005) +[2026-06-07 01:19:29,319][344387] Updated weights for policy 0, policy_version 35692 (0.0005) +[2026-06-07 01:19:30,043][344387] Updated weights for policy 0, policy_version 35704 (0.0005) +[2026-06-07 01:19:30,257][343476] Fps is (10 sec: 6758.6, 60 sec: 6724.3, 300 sec: 6720.2). Total num frames: 18280448. Throughput: 0: 6689.8. Samples: 18272842. Policy #0 lag: (min: 7.0, avg: 22.2, max: 39.0) +[2026-06-07 01:19:30,259][343476] Avg episode reward: [(0, '1588.899')] +[2026-06-07 01:19:31,081][344387] Updated weights for policy 0, policy_version 35714 (0.0005) +[2026-06-07 01:19:31,724][344387] Updated weights for policy 0, policy_version 35724 (0.0005) +[2026-06-07 01:19:32,309][344387] Updated weights for policy 0, policy_version 35734 (0.0005) +[2026-06-07 01:19:33,212][344387] Updated weights for policy 0, policy_version 35744 (0.0006) +[2026-06-07 01:19:33,886][344387] Updated weights for policy 0, policy_version 35756 (0.0005) +[2026-06-07 01:19:35,258][343476] Fps is (10 sec: 6553.5, 60 sec: 6724.3, 300 sec: 6720.2). Total num frames: 18313216. Throughput: 0: 6702.2. Samples: 18314528. Policy #0 lag: (min: 7.0, avg: 22.2, max: 39.0) +[2026-06-07 01:19:35,262][343476] Avg episode reward: [(0, '1560.923')] +[2026-06-07 01:19:35,275][344387] Updated weights for policy 0, policy_version 35769 (0.0005) +[2026-06-07 01:19:35,918][344387] Updated weights for policy 0, policy_version 35779 (0.0005) +[2026-06-07 01:19:36,949][344387] Updated weights for policy 0, policy_version 35792 (0.0005) +[2026-06-07 01:19:37,704][344387] Updated weights for policy 0, policy_version 35802 (0.0005) +[2026-06-07 01:19:38,424][344387] Updated weights for policy 0, policy_version 35812 (0.0005) +[2026-06-07 01:19:39,325][344387] Updated weights for policy 0, policy_version 35825 (0.0005) +[2026-06-07 01:19:40,068][344387] Updated weights for policy 0, policy_version 35835 (0.0005) +[2026-06-07 01:19:40,257][343476] Fps is (10 sec: 6758.2, 60 sec: 6724.2, 300 sec: 6720.2). Total num frames: 18348032. Throughput: 0: 6699.0. Samples: 18354656. Policy #0 lag: (min: 3.0, avg: 19.5, max: 39.0) +[2026-06-07 01:19:40,260][343476] Avg episode reward: [(0, '1724.965')] +[2026-06-07 01:19:40,917][344387] Updated weights for policy 0, policy_version 35845 (0.0005) +[2026-06-07 01:19:41,728][344387] Updated weights for policy 0, policy_version 35856 (0.0005) +[2026-06-07 01:19:42,495][344387] Updated weights for policy 0, policy_version 35866 (0.0005) +[2026-06-07 01:19:43,171][344387] Updated weights for policy 0, policy_version 35876 (0.0006) +[2026-06-07 01:19:44,059][344387] Updated weights for policy 0, policy_version 35886 (0.0005) +[2026-06-07 01:19:45,042][344387] Updated weights for policy 0, policy_version 35899 (0.0006) +[2026-06-07 01:19:45,257][343476] Fps is (10 sec: 6758.5, 60 sec: 6690.2, 300 sec: 6713.4). Total num frames: 18380800. Throughput: 0: 6708.4. Samples: 18374750. Policy #0 lag: (min: 3.0, avg: 19.5, max: 39.0) +[2026-06-07 01:19:45,259][343476] Avg episode reward: [(0, '1645.074')] +[2026-06-07 01:19:45,906][344387] Updated weights for policy 0, policy_version 35909 (0.0005) +[2026-06-07 01:19:46,583][344387] Updated weights for policy 0, policy_version 35919 (0.0005) +[2026-06-07 01:19:47,436][344387] Updated weights for policy 0, policy_version 35929 (0.0005) +[2026-06-07 01:19:47,993][344387] Updated weights for policy 0, policy_version 35939 (0.0006) +[2026-06-07 01:19:49,008][344387] Updated weights for policy 0, policy_version 35949 (0.0006) +[2026-06-07 01:19:50,016][344387] Updated weights for policy 0, policy_version 35961 (0.0005) +[2026-06-07 01:19:50,257][343476] Fps is (10 sec: 6553.8, 60 sec: 6656.0, 300 sec: 6706.3). Total num frames: 18413568. Throughput: 0: 6713.1. Samples: 18414242. Policy #0 lag: (min: 3.0, avg: 19.5, max: 39.0) +[2026-06-07 01:19:50,258][343476] Avg episode reward: [(0, '1685.863')] +[2026-06-07 01:19:50,992][344387] Updated weights for policy 0, policy_version 35973 (0.0006) +[2026-06-07 01:19:51,902][344387] Updated weights for policy 0, policy_version 35985 (0.0005) +[2026-06-07 01:19:52,888][344387] Updated weights for policy 0, policy_version 35998 (0.0005) +[2026-06-07 01:19:53,582][344387] Updated weights for policy 0, policy_version 36008 (0.0005) +[2026-06-07 01:19:54,413][344387] Updated weights for policy 0, policy_version 36018 (0.0005) +[2026-06-07 01:19:55,257][343476] Fps is (10 sec: 6348.8, 60 sec: 6621.9, 300 sec: 6685.5). Total num frames: 18444288. Throughput: 0: 6664.5. Samples: 18452824. Policy #0 lag: (min: 3.0, avg: 19.5, max: 39.0) +[2026-06-07 01:19:55,259][343476] Avg episode reward: [(0, '1871.581')] +[2026-06-07 01:19:55,264][344304] Saving new best policy, reward=1871.581! +[2026-06-07 01:19:55,499][344387] Updated weights for policy 0, policy_version 36031 (0.0006) +[2026-06-07 01:19:56,303][344387] Updated weights for policy 0, policy_version 36041 (0.0005) +[2026-06-07 01:19:56,914][344387] Updated weights for policy 0, policy_version 36051 (0.0005) +[2026-06-07 01:19:57,845][344387] Updated weights for policy 0, policy_version 36061 (0.0006) +[2026-06-07 01:19:58,479][344387] Updated weights for policy 0, policy_version 36071 (0.0005) +[2026-06-07 01:19:59,275][344387] Updated weights for policy 0, policy_version 36081 (0.0005) +[2026-06-07 01:20:00,257][343476] Fps is (10 sec: 6553.6, 60 sec: 6656.0, 300 sec: 6685.5). Total num frames: 18479104. Throughput: 0: 6650.3. Samples: 18472770. Policy #0 lag: (min: 5.0, avg: 20.9, max: 35.0) +[2026-06-07 01:20:00,259][343476] Avg episode reward: [(0, '1654.159')] +[2026-06-07 01:20:00,280][344387] Updated weights for policy 0, policy_version 36094 (0.0005) +[2026-06-07 01:20:00,887][344387] Updated weights for policy 0, policy_version 36104 (0.0005) +[2026-06-07 01:20:01,726][344387] Updated weights for policy 0, policy_version 36114 (0.0005) +[2026-06-07 01:20:02,216][344387] Updated weights for policy 0, policy_version 36124 (0.0005) +[2026-06-07 01:20:03,663][344387] Updated weights for policy 0, policy_version 36137 (0.0005) +[2026-06-07 01:20:04,556][344387] Updated weights for policy 0, policy_version 36150 (0.0006) +[2026-06-07 01:20:05,257][343476] Fps is (10 sec: 6758.4, 60 sec: 6656.0, 300 sec: 6671.6). Total num frames: 18511872. Throughput: 0: 6672.3. Samples: 18512670. Policy #0 lag: (min: 5.0, avg: 20.9, max: 35.0) +[2026-06-07 01:20:05,259][343476] Avg episode reward: [(0, '1613.456')] +[2026-06-07 01:20:05,651][344387] Updated weights for policy 0, policy_version 36161 (0.0006) +[2026-06-07 01:20:06,331][344387] Updated weights for policy 0, policy_version 36171 (0.0006) +[2026-06-07 01:20:07,312][344387] Updated weights for policy 0, policy_version 36186 (0.0006) +[2026-06-07 01:20:08,378][344387] Updated weights for policy 0, policy_version 36199 (0.0006) +[2026-06-07 01:20:09,393][344387] Updated weights for policy 0, policy_version 36212 (0.0005) +[2026-06-07 01:20:10,258][343476] Fps is (10 sec: 6553.3, 60 sec: 6656.0, 300 sec: 6650.8). Total num frames: 18544640. Throughput: 0: 6630.9. Samples: 18551700. Policy #0 lag: (min: 5.0, avg: 20.9, max: 35.0) +[2026-06-07 01:20:10,259][343476] Avg episode reward: [(0, '1605.682')] +[2026-06-07 01:20:10,591][344387] Updated weights for policy 0, policy_version 36222 (0.0005) +[2026-06-07 01:20:11,589][344304] Signal inference workers to stop experience collection... (3500 times) +[2026-06-07 01:20:11,611][344387] InferenceWorker_p0-w0: stopping experience collection (3500 times) +[2026-06-07 01:20:11,651][344304] Signal inference workers to resume experience collection... (3500 times) +[2026-06-07 01:20:11,652][344387] InferenceWorker_p0-w0: resuming experience collection (3500 times) +[2026-06-07 01:20:11,653][344387] Updated weights for policy 0, policy_version 36232 (0.0005) +[2026-06-07 01:20:12,353][344387] Updated weights for policy 0, policy_version 36244 (0.0005) +[2026-06-07 01:20:13,117][344387] Updated weights for policy 0, policy_version 36254 (0.0006) +[2026-06-07 01:20:14,671][344387] Updated weights for policy 0, policy_version 36265 (0.0006) +[2026-06-07 01:20:15,257][343476] Fps is (10 sec: 5939.1, 60 sec: 6519.5, 300 sec: 6623.0). Total num frames: 18571264. Throughput: 0: 6561.8. Samples: 18568124. Policy #0 lag: (min: 5.0, avg: 20.9, max: 35.0) +[2026-06-07 01:20:15,259][343476] Avg episode reward: [(0, '1564.517')] +[2026-06-07 01:20:15,478][344387] Updated weights for policy 0, policy_version 36275 (0.0005) +[2026-06-07 01:20:16,442][344387] Updated weights for policy 0, policy_version 36286 (0.0006) +[2026-06-07 01:20:17,849][344387] Updated weights for policy 0, policy_version 36297 (0.0005) +[2026-06-07 01:20:18,741][344387] Updated weights for policy 0, policy_version 36307 (0.0005) +[2026-06-07 01:20:19,530][344387] Updated weights for policy 0, policy_version 36317 (0.0006) +[2026-06-07 01:20:20,257][343476] Fps is (10 sec: 5120.1, 60 sec: 6382.9, 300 sec: 6595.3). Total num frames: 18595840. Throughput: 0: 6336.2. Samples: 18599656. Policy #0 lag: (min: 5.0, avg: 20.9, max: 35.0) +[2026-06-07 01:20:20,260][343476] Avg episode reward: [(0, '1613.655')] +[2026-06-07 01:20:20,901][344387] Updated weights for policy 0, policy_version 36328 (0.0005) +[2026-06-07 01:20:21,675][344387] Updated weights for policy 0, policy_version 36338 (0.0005) +[2026-06-07 01:20:22,609][344387] Updated weights for policy 0, policy_version 36348 (0.0005) +[2026-06-07 01:20:24,012][344387] Updated weights for policy 0, policy_version 36360 (0.0006) +[2026-06-07 01:20:25,027][344387] Updated weights for policy 0, policy_version 36370 (0.0006) +[2026-06-07 01:20:25,257][343476] Fps is (10 sec: 5120.2, 60 sec: 6246.4, 300 sec: 6567.5). Total num frames: 18622464. Throughput: 0: 6129.9. Samples: 18630500. Policy #0 lag: (min: 5.0, avg: 22.7, max: 40.0) +[2026-06-07 01:20:25,258][343476] Avg episode reward: [(0, '1635.711')] +[2026-06-07 01:20:26,101][344387] Updated weights for policy 0, policy_version 36381 (0.0006) +[2026-06-07 01:20:27,529][344387] Updated weights for policy 0, policy_version 36393 (0.0006) +[2026-06-07 01:20:28,425][344387] Updated weights for policy 0, policy_version 36403 (0.0005) +[2026-06-07 01:20:29,447][344387] Updated weights for policy 0, policy_version 36413 (0.0006) +[2026-06-07 01:20:30,257][343476] Fps is (10 sec: 4915.3, 60 sec: 6075.7, 300 sec: 6532.8). Total num frames: 18644992. Throughput: 0: 6012.4. Samples: 18645306. Policy #0 lag: (min: 5.0, avg: 22.7, max: 40.0) +[2026-06-07 01:20:30,260][343476] Avg episode reward: [(0, '1605.949')] +[2026-06-07 01:20:30,766][344387] Updated weights for policy 0, policy_version 36426 (0.0006) +[2026-06-07 01:20:31,758][344387] Updated weights for policy 0, policy_version 36436 (0.0005) +[2026-06-07 01:20:32,826][344387] Updated weights for policy 0, policy_version 36446 (0.0006) +[2026-06-07 01:20:34,107][344387] Updated weights for policy 0, policy_version 36457 (0.0006) +[2026-06-07 01:20:34,840][344387] Updated weights for policy 0, policy_version 36468 (0.0006) +[2026-06-07 01:20:35,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5973.4, 300 sec: 6511.9). Total num frames: 18671616. Throughput: 0: 5808.3. Samples: 18675614. Policy #0 lag: (min: 5.0, avg: 22.7, max: 40.0) +[2026-06-07 01:20:35,259][343476] Avg episode reward: [(0, '1665.064')] +[2026-06-07 01:20:36,142][344387] Updated weights for policy 0, policy_version 36478 (0.0006) +[2026-06-07 01:20:37,459][344387] Updated weights for policy 0, policy_version 36489 (0.0006) +[2026-06-07 01:20:38,132][344387] Updated weights for policy 0, policy_version 36499 (0.0006) +[2026-06-07 01:20:39,411][344387] Updated weights for policy 0, policy_version 36509 (0.0006) +[2026-06-07 01:20:40,258][343476] Fps is (10 sec: 4915.1, 60 sec: 5768.5, 300 sec: 6470.3). Total num frames: 18694144. Throughput: 0: 5600.4. Samples: 18704842. Policy #0 lag: (min: 5.0, avg: 22.7, max: 40.0) +[2026-06-07 01:20:40,260][343476] Avg episode reward: [(0, '1780.315')] +[2026-06-07 01:20:40,541][344387] Updated weights for policy 0, policy_version 36519 (0.0006) +[2026-06-07 01:20:41,389][344387] Updated weights for policy 0, policy_version 36530 (0.0006) +[2026-06-07 01:20:42,668][344387] Updated weights for policy 0, policy_version 36540 (0.0006) +[2026-06-07 01:20:43,676][344387] Updated weights for policy 0, policy_version 36550 (0.0006) +[2026-06-07 01:20:44,675][344387] Updated weights for policy 0, policy_version 36561 (0.0006) +[2026-06-07 01:20:45,257][343476] Fps is (10 sec: 5119.8, 60 sec: 5700.2, 300 sec: 6456.4). Total num frames: 18722816. Throughput: 0: 5495.6. Samples: 18720074. Policy #0 lag: (min: 5.0, avg: 22.7, max: 40.0) +[2026-06-07 01:20:45,259][343476] Avg episode reward: [(0, '1598.678')] +[2026-06-07 01:20:45,949][344304] Signal inference workers to stop experience collection... (3550 times) +[2026-06-07 01:20:45,964][344387] InferenceWorker_p0-w0: stopping experience collection (3550 times) +[2026-06-07 01:20:46,065][344304] Signal inference workers to resume experience collection... (3550 times) +[2026-06-07 01:20:46,065][344387] InferenceWorker_p0-w0: resuming experience collection (3550 times) +[2026-06-07 01:20:46,067][344387] Updated weights for policy 0, policy_version 36572 (0.0005) +[2026-06-07 01:20:46,998][344387] Updated weights for policy 0, policy_version 36582 (0.0005) +[2026-06-07 01:20:47,846][344387] Updated weights for policy 0, policy_version 36593 (0.0005) +[2026-06-07 01:20:49,020][344387] Updated weights for policy 0, policy_version 36603 (0.0005) +[2026-06-07 01:20:50,206][344387] Updated weights for policy 0, policy_version 36615 (0.0006) +[2026-06-07 01:20:50,257][343476] Fps is (10 sec: 5120.2, 60 sec: 5529.6, 300 sec: 6421.7). Total num frames: 18745344. Throughput: 0: 5277.9. Samples: 18750174. Policy #0 lag: (min: 6.0, avg: 24.6, max: 38.0) +[2026-06-07 01:20:50,258][343476] Avg episode reward: [(0, '1684.175')] +[2026-06-07 01:20:51,144][344387] Updated weights for policy 0, policy_version 36626 (0.0005) +[2026-06-07 01:20:52,234][344387] Updated weights for policy 0, policy_version 36636 (0.0005) +[2026-06-07 01:20:53,274][344387] Updated weights for policy 0, policy_version 36646 (0.0005) +[2026-06-07 01:20:54,019][344387] Updated weights for policy 0, policy_version 36656 (0.0006) +[2026-06-07 01:20:55,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5461.3, 300 sec: 6393.9). Total num frames: 18771968. Throughput: 0: 5093.2. Samples: 18780894. Policy #0 lag: (min: 6.0, avg: 24.6, max: 38.0) +[2026-06-07 01:20:55,261][343476] Avg episode reward: [(0, '1506.512')] +[2026-06-07 01:20:55,266][344387] Updated weights for policy 0, policy_version 36666 (0.0005) +[2026-06-07 01:20:56,296][344387] Updated weights for policy 0, policy_version 36676 (0.0005) +[2026-06-07 01:20:57,193][344387] Updated weights for policy 0, policy_version 36688 (0.0006) +[2026-06-07 01:20:58,382][344387] Updated weights for policy 0, policy_version 36698 (0.0005) +[2026-06-07 01:20:59,801][344387] Updated weights for policy 0, policy_version 36709 (0.0005) +[2026-06-07 01:21:00,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5324.8, 300 sec: 6366.2). Total num frames: 18798592. Throughput: 0: 5068.2. Samples: 18796192. Policy #0 lag: (min: 6.0, avg: 24.6, max: 38.0) +[2026-06-07 01:21:00,260][343476] Avg episode reward: [(0, '1757.081')] +[2026-06-07 01:21:00,765][344387] Updated weights for policy 0, policy_version 36721 (0.0006) +[2026-06-07 01:21:01,778][344387] Updated weights for policy 0, policy_version 36731 (0.0006) +[2026-06-07 01:21:03,126][344387] Updated weights for policy 0, policy_version 36741 (0.0006) +[2026-06-07 01:21:03,902][344387] Updated weights for policy 0, policy_version 36752 (0.0006) +[2026-06-07 01:21:05,161][344387] Updated weights for policy 0, policy_version 36763 (0.0005) +[2026-06-07 01:21:05,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5188.3, 300 sec: 6331.4). Total num frames: 18823168. Throughput: 0: 5022.1. Samples: 18825648. Policy #0 lag: (min: 6.0, avg: 24.6, max: 38.0) +[2026-06-07 01:21:05,259][343476] Avg episode reward: [(0, '1888.796')] +[2026-06-07 01:21:05,264][344304] Saving new best policy, reward=1888.796! +[2026-06-07 01:21:06,411][344387] Updated weights for policy 0, policy_version 36773 (0.0005) +[2026-06-07 01:21:07,424][344387] Updated weights for policy 0, policy_version 36785 (0.0005) +[2026-06-07 01:21:08,522][344387] Updated weights for policy 0, policy_version 36795 (0.0005) +[2026-06-07 01:21:09,913][344387] Updated weights for policy 0, policy_version 36806 (0.0006) +[2026-06-07 01:21:10,257][343476] Fps is (10 sec: 4710.4, 60 sec: 5017.6, 300 sec: 6296.7). Total num frames: 18845696. Throughput: 0: 5009.0. Samples: 18855906. Policy #0 lag: (min: 5.0, avg: 18.6, max: 39.0) +[2026-06-07 01:21:10,259][343476] Avg episode reward: [(0, '1476.951')] +[2026-06-07 01:21:10,873][344387] Updated weights for policy 0, policy_version 36818 (0.0007) +[2026-06-07 01:21:12,407][344387] Updated weights for policy 0, policy_version 36829 (0.0005) +[2026-06-07 01:21:13,523][344387] Updated weights for policy 0, policy_version 36840 (0.0007) +[2026-06-07 01:21:14,477][344387] Updated weights for policy 0, policy_version 36852 (0.0006) +[2026-06-07 01:21:15,257][343476] Fps is (10 sec: 4710.3, 60 sec: 4983.5, 300 sec: 6269.0). Total num frames: 18870272. Throughput: 0: 4993.3. Samples: 18870006. Policy #0 lag: (min: 5.0, avg: 18.6, max: 39.0) +[2026-06-07 01:21:15,260][343476] Avg episode reward: [(0, '1616.283')] +[2026-06-07 01:21:16,026][344387] Updated weights for policy 0, policy_version 36862 (0.0006) +[2026-06-07 01:21:16,697][344304] Signal inference workers to stop experience collection... (3600 times) +[2026-06-07 01:21:16,716][344387] InferenceWorker_p0-w0: stopping experience collection (3600 times) +[2026-06-07 01:21:16,784][344304] Signal inference workers to resume experience collection... (3600 times) +[2026-06-07 01:21:16,784][344387] InferenceWorker_p0-w0: resuming experience collection (3600 times) +[2026-06-07 01:21:16,970][344387] Updated weights for policy 0, policy_version 36873 (0.0006) +[2026-06-07 01:21:17,720][344387] Updated weights for policy 0, policy_version 36884 (0.0006) +[2026-06-07 01:21:19,227][344387] Updated weights for policy 0, policy_version 36894 (0.0005) +[2026-06-07 01:21:20,194][344387] Updated weights for policy 0, policy_version 36905 (0.0006) +[2026-06-07 01:21:20,257][343476] Fps is (10 sec: 4915.2, 60 sec: 4983.5, 300 sec: 6241.2). Total num frames: 18894848. Throughput: 0: 4965.7. Samples: 18899070. Policy #0 lag: (min: 5.0, avg: 18.6, max: 39.0) +[2026-06-07 01:21:20,258][343476] Avg episode reward: [(0, '1677.725')] +[2026-06-07 01:21:21,189][344387] Updated weights for policy 0, policy_version 36918 (0.0006) +[2026-06-07 01:21:22,430][344387] Updated weights for policy 0, policy_version 36928 (0.0005) +[2026-06-07 01:21:23,951][344387] Updated weights for policy 0, policy_version 36944 (0.0007) +[2026-06-07 01:21:25,121][344387] Updated weights for policy 0, policy_version 36954 (0.0005) +[2026-06-07 01:21:25,257][343476] Fps is (10 sec: 5120.0, 60 sec: 4983.4, 300 sec: 6213.4). Total num frames: 18921472. Throughput: 0: 4976.4. Samples: 18928782. Policy #0 lag: (min: 5.0, avg: 18.6, max: 39.0) +[2026-06-07 01:21:25,260][343476] Avg episode reward: [(0, '1679.716')] +[2026-06-07 01:21:26,174][344387] Updated weights for policy 0, policy_version 36964 (0.0005) +[2026-06-07 01:21:27,117][344387] Updated weights for policy 0, policy_version 36974 (0.0005) +[2026-06-07 01:21:28,379][344387] Updated weights for policy 0, policy_version 36986 (0.0006) +[2026-06-07 01:21:29,356][344387] Updated weights for policy 0, policy_version 36996 (0.0006) +[2026-06-07 01:21:30,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5017.6, 300 sec: 6185.7). Total num frames: 18946048. Throughput: 0: 4976.5. Samples: 18944014. Policy #0 lag: (min: 5.0, avg: 18.6, max: 39.0) +[2026-06-07 01:21:30,259][343476] Avg episode reward: [(0, '1626.838')] +[2026-06-07 01:21:30,499][344387] Updated weights for policy 0, policy_version 37006 (0.0006) +[2026-06-07 01:21:31,488][344387] Updated weights for policy 0, policy_version 37017 (0.0006) +[2026-06-07 01:21:32,438][344387] Updated weights for policy 0, policy_version 37027 (0.0005) +[2026-06-07 01:21:33,698][344387] Updated weights for policy 0, policy_version 37037 (0.0006) +[2026-06-07 01:21:34,778][344387] Updated weights for policy 0, policy_version 37049 (0.0006) +[2026-06-07 01:21:35,257][343476] Fps is (10 sec: 4915.4, 60 sec: 4983.5, 300 sec: 6157.9). Total num frames: 18970624. Throughput: 0: 4986.9. Samples: 18974584. Policy #0 lag: (min: 3.0, avg: 20.8, max: 37.0) +[2026-06-07 01:21:35,259][343476] Avg episode reward: [(0, '1600.793')] +[2026-06-07 01:21:35,795][344387] Updated weights for policy 0, policy_version 37060 (0.0006) +[2026-06-07 01:21:36,788][344387] Updated weights for policy 0, policy_version 37071 (0.0006) +[2026-06-07 01:21:37,818][344387] Updated weights for policy 0, policy_version 37081 (0.0005) +[2026-06-07 01:21:38,879][344387] Updated weights for policy 0, policy_version 37092 (0.0005) +[2026-06-07 01:21:39,846][344387] Updated weights for policy 0, policy_version 37102 (0.0005) +[2026-06-07 01:21:40,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5051.8, 300 sec: 6137.1). Total num frames: 18997248. Throughput: 0: 5008.3. Samples: 19006266. Policy #0 lag: (min: 3.0, avg: 20.8, max: 37.0) +[2026-06-07 01:21:40,259][343476] Avg episode reward: [(0, '1718.785')] +[2026-06-07 01:21:40,731][344387] Updated weights for policy 0, policy_version 37112 (0.0006) +[2026-06-07 01:21:41,788][344387] Updated weights for policy 0, policy_version 37123 (0.0005) +[2026-06-07 01:21:42,766][344387] Updated weights for policy 0, policy_version 37133 (0.0005) +[2026-06-07 01:21:43,637][344387] Updated weights for policy 0, policy_version 37144 (0.0005) +[2026-06-07 01:21:44,737][344387] Updated weights for policy 0, policy_version 37155 (0.0005) +[2026-06-07 01:21:45,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5051.7, 300 sec: 6123.2). Total num frames: 19025920. Throughput: 0: 5031.2. Samples: 19022598. Policy #0 lag: (min: 3.0, avg: 20.8, max: 37.0) +[2026-06-07 01:21:45,259][343476] Avg episode reward: [(0, '1582.182')] +[2026-06-07 01:21:45,807][344387] Updated weights for policy 0, policy_version 37165 (0.0005) +[2026-06-07 01:21:46,737][344387] Updated weights for policy 0, policy_version 37175 (0.0005) +[2026-06-07 01:21:47,678][344387] Updated weights for policy 0, policy_version 37187 (0.0005) +[2026-06-07 01:21:48,905][344387] Updated weights for policy 0, policy_version 37197 (0.0006) +[2026-06-07 01:21:49,823][344304] Signal inference workers to stop experience collection... (3650 times) +[2026-06-07 01:21:49,843][344387] InferenceWorker_p0-w0: stopping experience collection (3650 times) +[2026-06-07 01:21:49,910][344304] Signal inference workers to resume experience collection... (3650 times) +[2026-06-07 01:21:49,911][344387] InferenceWorker_p0-w0: resuming experience collection (3650 times) +[2026-06-07 01:21:50,025][344387] Updated weights for policy 0, policy_version 37209 (0.0006) +[2026-06-07 01:21:50,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5120.0, 300 sec: 6102.3). Total num frames: 19052544. Throughput: 0: 5102.7. Samples: 19055270. Policy #0 lag: (min: 3.0, avg: 20.8, max: 37.0) +[2026-06-07 01:21:50,258][343476] Avg episode reward: [(0, '1621.334')] +[2026-06-07 01:21:51,059][344387] Updated weights for policy 0, policy_version 37221 (0.0005) +[2026-06-07 01:21:52,280][344387] Updated weights for policy 0, policy_version 37234 (0.0006) +[2026-06-07 01:21:53,642][344387] Updated weights for policy 0, policy_version 37245 (0.0005) +[2026-06-07 01:21:54,291][344387] Updated weights for policy 0, policy_version 37256 (0.0005) +[2026-06-07 01:21:55,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5085.9, 300 sec: 6074.6). Total num frames: 19077120. Throughput: 0: 5127.5. Samples: 19086642. Policy #0 lag: (min: 3.0, avg: 20.8, max: 37.0) +[2026-06-07 01:21:55,259][343476] Avg episode reward: [(0, '1589.465')] +[2026-06-07 01:21:56,002][344387] Updated weights for policy 0, policy_version 37269 (0.0005) +[2026-06-07 01:21:57,285][344387] Updated weights for policy 0, policy_version 37281 (0.0005) +[2026-06-07 01:21:58,563][344387] Updated weights for policy 0, policy_version 37293 (0.0005) +[2026-06-07 01:21:59,678][344387] Updated weights for policy 0, policy_version 37304 (0.0005) +[2026-06-07 01:22:00,257][343476] Fps is (10 sec: 4915.1, 60 sec: 5051.7, 300 sec: 6046.8). Total num frames: 19101696. Throughput: 0: 5133.3. Samples: 19101006. Policy #0 lag: (min: 10.0, avg: 22.5, max: 42.0) +[2026-06-07 01:22:00,260][343476] Avg episode reward: [(0, '1664.166')] +[2026-06-07 01:22:00,715][344387] Updated weights for policy 0, policy_version 37317 (0.0005) +[2026-06-07 01:22:01,888][344387] Updated weights for policy 0, policy_version 37328 (0.0005) +[2026-06-07 01:22:03,097][344387] Updated weights for policy 0, policy_version 37338 (0.0005) +[2026-06-07 01:22:03,900][344387] Updated weights for policy 0, policy_version 37349 (0.0005) +[2026-06-07 01:22:05,045][344387] Updated weights for policy 0, policy_version 37360 (0.0005) +[2026-06-07 01:22:05,258][343476] Fps is (10 sec: 5119.7, 60 sec: 5085.8, 300 sec: 6026.0). Total num frames: 19128320. Throughput: 0: 5170.7. Samples: 19131756. Policy #0 lag: (min: 10.0, avg: 22.5, max: 42.0) +[2026-06-07 01:22:05,261][343476] Avg episode reward: [(0, '1635.091')] +[2026-06-07 01:22:06,118][344387] Updated weights for policy 0, policy_version 37370 (0.0005) +[2026-06-07 01:22:06,854][344387] Updated weights for policy 0, policy_version 37380 (0.0005) +[2026-06-07 01:22:08,046][344387] Updated weights for policy 0, policy_version 37390 (0.0005) +[2026-06-07 01:22:08,985][344387] Updated weights for policy 0, policy_version 37400 (0.0005) +[2026-06-07 01:22:09,718][344387] Updated weights for policy 0, policy_version 37410 (0.0005) +[2026-06-07 01:22:10,257][343476] Fps is (10 sec: 5529.8, 60 sec: 5188.3, 300 sec: 6005.2). Total num frames: 19156992. Throughput: 0: 5228.5. Samples: 19164062. Policy #0 lag: (min: 10.0, avg: 22.5, max: 42.0) +[2026-06-07 01:22:10,259][343476] Avg episode reward: [(0, '1609.185')] +[2026-06-07 01:22:10,708][344387] Updated weights for policy 0, policy_version 37420 (0.0005) +[2026-06-07 01:22:11,965][344387] Updated weights for policy 0, policy_version 37432 (0.0006) +[2026-06-07 01:22:12,718][344387] Updated weights for policy 0, policy_version 37442 (0.0006) +[2026-06-07 01:22:13,720][344387] Updated weights for policy 0, policy_version 37452 (0.0005) +[2026-06-07 01:22:14,893][344387] Updated weights for policy 0, policy_version 37464 (0.0006) +[2026-06-07 01:22:15,257][343476] Fps is (10 sec: 5529.9, 60 sec: 5222.4, 300 sec: 5977.4). Total num frames: 19183616. Throughput: 0: 5250.0. Samples: 19180264. Policy #0 lag: (min: 10.0, avg: 22.5, max: 42.0) +[2026-06-07 01:22:15,260][343476] Avg episode reward: [(0, '1666.357')] +[2026-06-07 01:22:15,764][344387] Updated weights for policy 0, policy_version 37475 (0.0005) +[2026-06-07 01:22:17,060][344387] Updated weights for policy 0, policy_version 37485 (0.0005) +[2026-06-07 01:22:17,904][344304] Signal inference workers to stop experience collection... (3700 times) +[2026-06-07 01:22:17,912][344387] Updated weights for policy 0, policy_version 37495 (0.0005) +[2026-06-07 01:22:17,921][344387] InferenceWorker_p0-w0: stopping experience collection (3700 times) +[2026-06-07 01:22:17,951][344304] Signal inference workers to resume experience collection... (3700 times) +[2026-06-07 01:22:17,951][344387] InferenceWorker_p0-w0: resuming experience collection (3700 times) +[2026-06-07 01:22:18,713][344387] Updated weights for policy 0, policy_version 37505 (0.0006) +[2026-06-07 01:22:19,653][344387] Updated weights for policy 0, policy_version 37515 (0.0005) +[2026-06-07 01:22:20,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5222.4, 300 sec: 5949.6). Total num frames: 19208192. Throughput: 0: 5293.5. Samples: 19212792. Policy #0 lag: (min: 10.0, avg: 22.5, max: 42.0) +[2026-06-07 01:22:20,260][343476] Avg episode reward: [(0, '1544.109')] +[2026-06-07 01:22:20,919][344387] Updated weights for policy 0, policy_version 37528 (0.0005) +[2026-06-07 01:22:21,740][344387] Updated weights for policy 0, policy_version 37538 (0.0005) +[2026-06-07 01:22:22,596][344387] Updated weights for policy 0, policy_version 37548 (0.0005) +[2026-06-07 01:22:23,976][344387] Updated weights for policy 0, policy_version 37561 (0.0005) +[2026-06-07 01:22:24,842][344387] Updated weights for policy 0, policy_version 37571 (0.0005) +[2026-06-07 01:22:25,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5290.7, 300 sec: 5942.7). Total num frames: 19238912. Throughput: 0: 5325.0. Samples: 19245894. Policy #0 lag: (min: 7.0, avg: 23.0, max: 39.0) +[2026-06-07 01:22:25,260][343476] Avg episode reward: [(0, '1583.816')] +[2026-06-07 01:22:26,026][344387] Updated weights for policy 0, policy_version 37581 (0.0005) +[2026-06-07 01:22:26,965][344387] Updated weights for policy 0, policy_version 37593 (0.0006) +[2026-06-07 01:22:27,975][344387] Updated weights for policy 0, policy_version 37604 (0.0006) +[2026-06-07 01:22:29,139][344387] Updated weights for policy 0, policy_version 37614 (0.0006) +[2026-06-07 01:22:30,258][344387] Updated weights for policy 0, policy_version 37628 (0.0006) +[2026-06-07 01:22:30,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5290.7, 300 sec: 5914.9). Total num frames: 19263488. Throughput: 0: 5342.5. Samples: 19263008. Policy #0 lag: (min: 7.0, avg: 23.0, max: 39.0) +[2026-06-07 01:22:30,259][343476] Avg episode reward: [(0, '1767.496')] +[2026-06-07 01:22:31,248][344387] Updated weights for policy 0, policy_version 37638 (0.0006) +[2026-06-07 01:22:32,248][344387] Updated weights for policy 0, policy_version 37650 (0.0005) +[2026-06-07 01:22:33,357][344387] Updated weights for policy 0, policy_version 37660 (0.0006) +[2026-06-07 01:22:34,286][344387] Updated weights for policy 0, policy_version 37670 (0.0005) +[2026-06-07 01:22:35,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5324.8, 300 sec: 5894.1). Total num frames: 19290112. Throughput: 0: 5324.0. Samples: 19294850. Policy #0 lag: (min: 7.0, avg: 23.0, max: 39.0) +[2026-06-07 01:22:35,259][343476] Avg episode reward: [(0, '1684.741')] +[2026-06-07 01:22:35,502][344387] Updated weights for policy 0, policy_version 37681 (0.0006) +[2026-06-07 01:22:36,669][344387] Updated weights for policy 0, policy_version 37694 (0.0005) +[2026-06-07 01:22:37,555][344387] Updated weights for policy 0, policy_version 37704 (0.0005) +[2026-06-07 01:22:38,891][344387] Updated weights for policy 0, policy_version 37717 (0.0006) +[2026-06-07 01:22:39,847][344387] Updated weights for policy 0, policy_version 37728 (0.0005) +[2026-06-07 01:22:40,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5324.8, 300 sec: 5880.2). Total num frames: 19316736. Throughput: 0: 5308.8. Samples: 19325538. Policy #0 lag: (min: 7.0, avg: 23.0, max: 39.0) +[2026-06-07 01:22:40,258][343476] Avg episode reward: [(0, '1785.066')] +[2026-06-07 01:22:41,140][344387] Updated weights for policy 0, policy_version 37738 (0.0005) +[2026-06-07 01:22:42,047][344387] Updated weights for policy 0, policy_version 37751 (0.0005) +[2026-06-07 01:22:43,309][344387] Updated weights for policy 0, policy_version 37762 (0.0005) +[2026-06-07 01:22:44,086][344387] Updated weights for policy 0, policy_version 37772 (0.0005) +[2026-06-07 01:22:45,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5324.8, 300 sec: 5873.2). Total num frames: 19345408. Throughput: 0: 5346.8. Samples: 19341612. Policy #0 lag: (min: 7.0, avg: 23.0, max: 39.0) +[2026-06-07 01:22:45,259][343476] Avg episode reward: [(0, '1852.051')] +[2026-06-07 01:22:45,594][344387] Updated weights for policy 0, policy_version 37785 (0.0005) +[2026-06-07 01:22:46,484][344387] Updated weights for policy 0, policy_version 37796 (0.0005) +[2026-06-07 01:22:47,581][344387] Updated weights for policy 0, policy_version 37806 (0.0005) +[2026-06-07 01:22:48,515][344387] Updated weights for policy 0, policy_version 37817 (0.0005) +[2026-06-07 01:22:48,703][344304] Signal inference workers to stop experience collection... (3750 times) +[2026-06-07 01:22:48,704][344304] Signal inference workers to resume experience collection... (3750 times) +[2026-06-07 01:22:48,732][344387] InferenceWorker_p0-w0: stopping experience collection (3750 times) +[2026-06-07 01:22:48,732][344387] InferenceWorker_p0-w0: resuming experience collection (3750 times) +[2026-06-07 01:22:49,384][344387] Updated weights for policy 0, policy_version 37827 (0.0005) +[2026-06-07 01:22:50,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5838.5). Total num frames: 19369984. Throughput: 0: 5394.3. Samples: 19374498. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:22:50,259][343476] Avg episode reward: [(0, '1739.910')] +[2026-06-07 01:22:50,506][344387] Updated weights for policy 0, policy_version 37838 (0.0005) +[2026-06-07 01:22:51,322][344387] Updated weights for policy 0, policy_version 37849 (0.0005) +[2026-06-07 01:22:52,354][344387] Updated weights for policy 0, policy_version 37859 (0.0005) +[2026-06-07 01:22:53,443][344387] Updated weights for policy 0, policy_version 37869 (0.0005) +[2026-06-07 01:22:54,354][344387] Updated weights for policy 0, policy_version 37881 (0.0005) +[2026-06-07 01:22:55,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5358.9, 300 sec: 5824.6). Total num frames: 19398656. Throughput: 0: 5415.3. Samples: 19407750. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:22:55,259][343476] Avg episode reward: [(0, '1668.048')] +[2026-06-07 01:22:55,299][344387] Updated weights for policy 0, policy_version 37891 (0.0005) +[2026-06-07 01:22:56,322][344387] Updated weights for policy 0, policy_version 37901 (0.0005) +[2026-06-07 01:22:57,106][344387] Updated weights for policy 0, policy_version 37912 (0.0005) +[2026-06-07 01:22:58,186][344387] Updated weights for policy 0, policy_version 37922 (0.0005) +[2026-06-07 01:22:59,093][344387] Updated weights for policy 0, policy_version 37932 (0.0005) +[2026-06-07 01:23:00,014][344387] Updated weights for policy 0, policy_version 37943 (0.0005) +[2026-06-07 01:23:00,257][343476] Fps is (10 sec: 5734.4, 60 sec: 5427.2, 300 sec: 5810.8). Total num frames: 19427328. Throughput: 0: 5426.2. Samples: 19424442. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:23:00,258][343476] Avg episode reward: [(0, '1820.173')] +[2026-06-07 01:23:01,134][344387] Updated weights for policy 0, policy_version 37953 (0.0005) +[2026-06-07 01:23:02,026][344387] Updated weights for policy 0, policy_version 37963 (0.0005) +[2026-06-07 01:23:02,999][344387] Updated weights for policy 0, policy_version 37975 (0.0005) +[2026-06-07 01:23:04,122][344387] Updated weights for policy 0, policy_version 37985 (0.0005) +[2026-06-07 01:23:05,110][344387] Updated weights for policy 0, policy_version 37995 (0.0005) +[2026-06-07 01:23:05,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5427.3, 300 sec: 5790.0). Total num frames: 19453952. Throughput: 0: 5433.5. Samples: 19457296. Policy #0 lag: (min: 3.0, avg: 21.8, max: 37.0) +[2026-06-07 01:23:05,258][343476] Avg episode reward: [(0, '1692.240')] +[2026-06-07 01:23:05,853][344387] Updated weights for policy 0, policy_version 38005 (0.0006) +[2026-06-07 01:23:06,856][344387] Updated weights for policy 0, policy_version 38015 (0.0005) +[2026-06-07 01:23:08,001][344387] Updated weights for policy 0, policy_version 38025 (0.0006) +[2026-06-07 01:23:08,713][344387] Updated weights for policy 0, policy_version 38036 (0.0006) +[2026-06-07 01:23:09,957][344387] Updated weights for policy 0, policy_version 38046 (0.0005) +[2026-06-07 01:23:10,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5393.1, 300 sec: 5769.1). Total num frames: 19480576. Throughput: 0: 5408.3. Samples: 19489268. Policy #0 lag: (min: 1.0, avg: 20.2, max: 36.0) +[2026-06-07 01:23:10,259][343476] Avg episode reward: [(0, '1720.818')] +[2026-06-07 01:23:10,927][344387] Updated weights for policy 0, policy_version 38056 (0.0005) +[2026-06-07 01:23:11,835][344387] Updated weights for policy 0, policy_version 38068 (0.0005) +[2026-06-07 01:23:13,105][344387] Updated weights for policy 0, policy_version 38078 (0.0005) +[2026-06-07 01:23:14,037][344387] Updated weights for policy 0, policy_version 38088 (0.0005) +[2026-06-07 01:23:14,957][344387] Updated weights for policy 0, policy_version 38100 (0.0006) +[2026-06-07 01:23:15,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5393.1, 300 sec: 5748.3). Total num frames: 19507200. Throughput: 0: 5382.0. Samples: 19505196. Policy #0 lag: (min: 1.0, avg: 20.2, max: 36.0) +[2026-06-07 01:23:15,259][343476] Avg episode reward: [(0, '1688.555')] +[2026-06-07 01:23:16,158][344387] Updated weights for policy 0, policy_version 38110 (0.0005) +[2026-06-07 01:23:16,874][344387] Updated weights for policy 0, policy_version 38120 (0.0005) +[2026-06-07 01:23:17,475][344304] Signal inference workers to stop experience collection... (3800 times) +[2026-06-07 01:23:17,476][344304] Signal inference workers to resume experience collection... (3800 times) +[2026-06-07 01:23:17,500][344387] InferenceWorker_p0-w0: stopping experience collection (3800 times) +[2026-06-07 01:23:17,501][344387] InferenceWorker_p0-w0: resuming experience collection (3800 times) +[2026-06-07 01:23:18,055][344387] Updated weights for policy 0, policy_version 38132 (0.0005) +[2026-06-07 01:23:19,242][344387] Updated weights for policy 0, policy_version 38142 (0.0005) +[2026-06-07 01:23:20,116][344387] Updated weights for policy 0, policy_version 38152 (0.0006) +[2026-06-07 01:23:20,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5427.2, 300 sec: 5727.5). Total num frames: 19533824. Throughput: 0: 5383.7. Samples: 19537116. Policy #0 lag: (min: 1.0, avg: 20.2, max: 36.0) +[2026-06-07 01:23:20,258][343476] Avg episode reward: [(0, '1708.353')] +[2026-06-07 01:23:21,057][344387] Updated weights for policy 0, policy_version 38163 (0.0006) +[2026-06-07 01:23:22,172][344387] Updated weights for policy 0, policy_version 38173 (0.0005) +[2026-06-07 01:23:23,191][344387] Updated weights for policy 0, policy_version 38183 (0.0005) +[2026-06-07 01:23:24,122][344387] Updated weights for policy 0, policy_version 38194 (0.0006) +[2026-06-07 01:23:24,849][344387] Updated weights for policy 0, policy_version 38204 (0.0005) +[2026-06-07 01:23:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5706.6). Total num frames: 19560448. Throughput: 0: 5406.1. Samples: 19568812. Policy #0 lag: (min: 1.0, avg: 20.2, max: 36.0) +[2026-06-07 01:23:25,259][343476] Avg episode reward: [(0, '1774.935')] +[2026-06-07 01:23:26,146][344387] Updated weights for policy 0, policy_version 38214 (0.0005) +[2026-06-07 01:23:27,083][344387] Updated weights for policy 0, policy_version 38224 (0.0006) +[2026-06-07 01:23:27,976][344387] Updated weights for policy 0, policy_version 38235 (0.0006) +[2026-06-07 01:23:29,362][344387] Updated weights for policy 0, policy_version 38245 (0.0005) +[2026-06-07 01:23:30,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5358.9, 300 sec: 5678.9). Total num frames: 19585024. Throughput: 0: 5390.5. Samples: 19584186. Policy #0 lag: (min: 1.0, avg: 20.2, max: 36.0) +[2026-06-07 01:23:30,258][343476] Avg episode reward: [(0, '1802.540')] +[2026-06-07 01:23:30,259][344387] Updated weights for policy 0, policy_version 38256 (0.0006) +[2026-06-07 01:23:31,066][344387] Updated weights for policy 0, policy_version 38267 (0.0006) +[2026-06-07 01:23:32,470][344387] Updated weights for policy 0, policy_version 38277 (0.0005) +[2026-06-07 01:23:33,411][344387] Updated weights for policy 0, policy_version 38288 (0.0006) +[2026-06-07 01:23:34,284][344387] Updated weights for policy 0, policy_version 38299 (0.0006) +[2026-06-07 01:23:35,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5358.9, 300 sec: 5651.1). Total num frames: 19611648. Throughput: 0: 5356.6. Samples: 19615546. Policy #0 lag: (min: 8.0, avg: 24.6, max: 43.0) +[2026-06-07 01:23:35,260][343476] Avg episode reward: [(0, '1737.709')] +[2026-06-07 01:23:35,593][344387] Updated weights for policy 0, policy_version 38309 (0.0005) +[2026-06-07 01:23:36,569][344387] Updated weights for policy 0, policy_version 38319 (0.0005) +[2026-06-07 01:23:37,383][344387] Updated weights for policy 0, policy_version 38329 (0.0005) +[2026-06-07 01:23:38,569][344387] Updated weights for policy 0, policy_version 38339 (0.0005) +[2026-06-07 01:23:39,707][344387] Updated weights for policy 0, policy_version 38352 (0.0006) +[2026-06-07 01:23:40,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5358.9, 300 sec: 5623.3). Total num frames: 19638272. Throughput: 0: 5309.1. Samples: 19646658. Policy #0 lag: (min: 8.0, avg: 24.6, max: 43.0) +[2026-06-07 01:23:40,258][343476] Avg episode reward: [(0, '1669.480')] +[2026-06-07 01:23:40,543][344387] Updated weights for policy 0, policy_version 38363 (0.0005) +[2026-06-07 01:23:41,849][344387] Updated weights for policy 0, policy_version 38373 (0.0005) +[2026-06-07 01:23:42,836][344387] Updated weights for policy 0, policy_version 38384 (0.0005) +[2026-06-07 01:23:43,589][344387] Updated weights for policy 0, policy_version 38394 (0.0005) +[2026-06-07 01:23:44,505][344387] Updated weights for policy 0, policy_version 38404 (0.0005) +[2026-06-07 01:23:45,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5358.9, 300 sec: 5602.5). Total num frames: 19666944. Throughput: 0: 5301.2. Samples: 19662994. Policy #0 lag: (min: 8.0, avg: 24.6, max: 43.0) +[2026-06-07 01:23:45,260][343476] Avg episode reward: [(0, '1645.473')] +[2026-06-07 01:23:45,813][344387] Updated weights for policy 0, policy_version 38414 (0.0005) +[2026-06-07 01:23:46,663][344387] Updated weights for policy 0, policy_version 38427 (0.0005) +[2026-06-07 01:23:47,958][344387] Updated weights for policy 0, policy_version 38437 (0.0005) +[2026-06-07 01:23:48,877][344387] Updated weights for policy 0, policy_version 38448 (0.0005) +[2026-06-07 01:23:49,698][344387] Updated weights for policy 0, policy_version 38458 (0.0005) +[2026-06-07 01:23:50,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5393.1, 300 sec: 5581.7). Total num frames: 19693568. Throughput: 0: 5299.3. Samples: 19695766. Policy #0 lag: (min: 8.0, avg: 24.6, max: 43.0) +[2026-06-07 01:23:50,259][343476] Avg episode reward: [(0, '1598.328')] +[2026-06-07 01:23:50,507][344387] Updated weights for policy 0, policy_version 38468 (0.0005) +[2026-06-07 01:23:51,882][344387] Updated weights for policy 0, policy_version 38478 (0.0005) +[2026-06-07 01:23:52,137][344304] Signal inference workers to stop experience collection... (3850 times) +[2026-06-07 01:23:52,151][344387] InferenceWorker_p0-w0: stopping experience collection (3850 times) +[2026-06-07 01:23:52,243][344304] Signal inference workers to resume experience collection... (3850 times) +[2026-06-07 01:23:52,243][344387] InferenceWorker_p0-w0: resuming experience collection (3850 times) +[2026-06-07 01:23:52,791][344387] Updated weights for policy 0, policy_version 38491 (0.0005) +[2026-06-07 01:23:53,995][344387] Updated weights for policy 0, policy_version 38501 (0.0005) +[2026-06-07 01:23:54,904][344387] Updated weights for policy 0, policy_version 38512 (0.0005) +[2026-06-07 01:23:55,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5560.8). Total num frames: 19720192. Throughput: 0: 5303.0. Samples: 19727902. Policy #0 lag: (min: 8.0, avg: 24.6, max: 43.0) +[2026-06-07 01:23:55,258][343476] Avg episode reward: [(0, '1778.660')] +[2026-06-07 01:23:55,899][344387] Updated weights for policy 0, policy_version 38523 (0.0005) +[2026-06-07 01:23:57,120][344387] Updated weights for policy 0, policy_version 38533 (0.0005) +[2026-06-07 01:23:57,950][344387] Updated weights for policy 0, policy_version 38544 (0.0005) +[2026-06-07 01:23:58,695][344387] Updated weights for policy 0, policy_version 38554 (0.0005) +[2026-06-07 01:23:59,802][344387] Updated weights for policy 0, policy_version 38564 (0.0005) +[2026-06-07 01:24:00,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5290.7, 300 sec: 5533.1). Total num frames: 19744768. Throughput: 0: 5302.3. Samples: 19743800. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 01:24:00,259][343476] Avg episode reward: [(0, '1608.125')] +[2026-06-07 01:24:01,146][344387] Updated weights for policy 0, policy_version 38577 (0.0006) +[2026-06-07 01:24:01,877][344387] Updated weights for policy 0, policy_version 38588 (0.0005) +[2026-06-07 01:24:03,339][344387] Updated weights for policy 0, policy_version 38598 (0.0005) +[2026-06-07 01:24:04,137][344387] Updated weights for policy 0, policy_version 38610 (0.0005) +[2026-06-07 01:24:05,222][344387] Updated weights for policy 0, policy_version 38622 (0.0005) +[2026-06-07 01:24:05,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5519.2). Total num frames: 19773440. Throughput: 0: 5319.6. Samples: 19776498. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 01:24:05,259][343476] Avg episode reward: [(0, '1752.899')] +[2026-06-07 01:24:06,580][344387] Updated weights for policy 0, policy_version 38632 (0.0005) +[2026-06-07 01:24:07,499][344387] Updated weights for policy 0, policy_version 38644 (0.0005) +[2026-06-07 01:24:08,315][344387] Updated weights for policy 0, policy_version 38656 (0.0005) +[2026-06-07 01:24:09,871][344387] Updated weights for policy 0, policy_version 38666 (0.0005) +[2026-06-07 01:24:10,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5290.7, 300 sec: 5484.5). Total num frames: 19798016. Throughput: 0: 5319.1. Samples: 19808170. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 01:24:10,260][343476] Avg episode reward: [(0, '1631.891')] +[2026-06-07 01:24:10,827][344387] Updated weights for policy 0, policy_version 38680 (0.0005) +[2026-06-07 01:24:12,069][344387] Updated weights for policy 0, policy_version 38690 (0.0005) +[2026-06-07 01:24:12,855][344387] Updated weights for policy 0, policy_version 38700 (0.0005) +[2026-06-07 01:24:13,957][344387] Updated weights for policy 0, policy_version 38712 (0.0005) +[2026-06-07 01:24:15,122][344387] Updated weights for policy 0, policy_version 38722 (0.0005) +[2026-06-07 01:24:15,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5470.6). Total num frames: 19826688. Throughput: 0: 5337.4. Samples: 19824368. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 01:24:15,258][343476] Avg episode reward: [(0, '1692.840')] +[2026-06-07 01:24:16,333][344387] Updated weights for policy 0, policy_version 38733 (0.0005) +[2026-06-07 01:24:17,223][344387] Updated weights for policy 0, policy_version 38745 (0.0005) +[2026-06-07 01:24:18,675][344387] Updated weights for policy 0, policy_version 38757 (0.0005) +[2026-06-07 01:24:19,514][344387] Updated weights for policy 0, policy_version 38767 (0.0005) +[2026-06-07 01:24:20,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5324.8, 300 sec: 5442.8). Total num frames: 19853312. Throughput: 0: 5336.8. Samples: 19855700. Policy #0 lag: (min: 3.0, avg: 21.7, max: 36.0) +[2026-06-07 01:24:20,258][343476] Avg episode reward: [(0, '1671.049')] +[2026-06-07 01:24:20,389][344387] Updated weights for policy 0, policy_version 38779 (0.0005) +[2026-06-07 01:24:20,573][344304] Signal inference workers to stop experience collection... (3900 times) +[2026-06-07 01:24:20,574][344304] Signal inference workers to resume experience collection... (3900 times) +[2026-06-07 01:24:20,598][344387] InferenceWorker_p0-w0: stopping experience collection (3900 times) +[2026-06-07 01:24:20,598][344387] InferenceWorker_p0-w0: resuming experience collection (3900 times) +[2026-06-07 01:24:21,830][344387] Updated weights for policy 0, policy_version 38791 (0.0005) +[2026-06-07 01:24:22,801][344387] Updated weights for policy 0, policy_version 38801 (0.0005) +[2026-06-07 01:24:23,498][344387] Updated weights for policy 0, policy_version 38812 (0.0005) +[2026-06-07 01:24:24,873][344387] Updated weights for policy 0, policy_version 38822 (0.0005) +[2026-06-07 01:24:25,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5290.7, 300 sec: 5415.0). Total num frames: 19877888. Throughput: 0: 5351.5. Samples: 19887478. Policy #0 lag: (min: 4.0, avg: 24.6, max: 42.0) +[2026-06-07 01:24:25,259][343476] Avg episode reward: [(0, '1753.272')] +[2026-06-07 01:24:25,832][344387] Updated weights for policy 0, policy_version 38832 (0.0005) +[2026-06-07 01:24:26,731][344387] Updated weights for policy 0, policy_version 38844 (0.0005) +[2026-06-07 01:24:27,981][344387] Updated weights for policy 0, policy_version 38854 (0.0005) +[2026-06-07 01:24:29,121][344387] Updated weights for policy 0, policy_version 38866 (0.0005) +[2026-06-07 01:24:30,079][344387] Updated weights for policy 0, policy_version 38877 (0.0005) +[2026-06-07 01:24:30,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5358.9, 300 sec: 5401.2). Total num frames: 19906560. Throughput: 0: 5342.2. Samples: 19903392. Policy #0 lag: (min: 4.0, avg: 24.6, max: 42.0) +[2026-06-07 01:24:30,259][343476] Avg episode reward: [(0, '1648.884')] +[2026-06-07 01:24:31,206][344387] Updated weights for policy 0, policy_version 38887 (0.0005) +[2026-06-07 01:24:32,245][344387] Updated weights for policy 0, policy_version 38898 (0.0005) +[2026-06-07 01:24:32,881][344387] Updated weights for policy 0, policy_version 38908 (0.0005) +[2026-06-07 01:24:34,264][344387] Updated weights for policy 0, policy_version 38918 (0.0005) +[2026-06-07 01:24:35,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5324.8, 300 sec: 5366.5). Total num frames: 19931136. Throughput: 0: 5312.8. Samples: 19934844. Policy #0 lag: (min: 4.0, avg: 24.6, max: 42.0) +[2026-06-07 01:24:35,258][343476] Avg episode reward: [(0, '1666.939')] +[2026-06-07 01:24:35,378][344387] Updated weights for policy 0, policy_version 38929 (0.0005) +[2026-06-07 01:24:36,366][344387] Updated weights for policy 0, policy_version 38941 (0.0005) +[2026-06-07 01:24:37,418][344387] Updated weights for policy 0, policy_version 38951 (0.0005) +[2026-06-07 01:24:38,555][344387] Updated weights for policy 0, policy_version 38962 (0.0005) +[2026-06-07 01:24:39,530][344387] Updated weights for policy 0, policy_version 38973 (0.0005) +[2026-06-07 01:24:40,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5324.8, 300 sec: 5345.6). Total num frames: 19957760. Throughput: 0: 5293.9. Samples: 19966126. Policy #0 lag: (min: 4.0, avg: 24.6, max: 42.0) +[2026-06-07 01:24:40,259][343476] Avg episode reward: [(0, '1639.362')] +[2026-06-07 01:24:40,561][344387] Updated weights for policy 0, policy_version 38983 (0.0005) +[2026-06-07 01:24:41,876][344387] Updated weights for policy 0, policy_version 38998 (0.0005) +[2026-06-07 01:24:42,816][344387] Updated weights for policy 0, policy_version 39008 (0.0005) +[2026-06-07 01:24:44,238][344387] Updated weights for policy 0, policy_version 39018 (0.0005) +[2026-06-07 01:24:45,100][344387] Updated weights for policy 0, policy_version 39030 (0.0005) +[2026-06-07 01:24:45,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5324.8). Total num frames: 19984384. Throughput: 0: 5287.4. Samples: 19981732. Policy #0 lag: (min: 4.0, avg: 24.6, max: 42.0) +[2026-06-07 01:24:45,259][343476] Avg episode reward: [(0, '1701.579')] +[2026-06-07 01:24:46,133][344387] Updated weights for policy 0, policy_version 39042 (0.0005) +[2026-06-07 01:24:47,782][344387] Updated weights for policy 0, policy_version 39056 (0.0005) +[2026-06-07 01:24:48,718][344387] Updated weights for policy 0, policy_version 39067 (0.0005) +[2026-06-07 01:24:50,238][344387] Updated weights for policy 0, policy_version 39077 (0.0005) +[2026-06-07 01:24:50,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5222.4, 300 sec: 5297.0). Total num frames: 20006912. Throughput: 0: 5238.5. Samples: 20012232. Policy #0 lag: (min: 3.0, avg: 25.2, max: 47.0) +[2026-06-07 01:24:50,258][343476] Avg episode reward: [(0, '1673.312')] +[2026-06-07 01:24:50,326][344304] Signal inference workers to stop experience collection... (3950 times) +[2026-06-07 01:24:50,348][344387] InferenceWorker_p0-w0: stopping experience collection (3950 times) +[2026-06-07 01:24:50,387][344304] Signal inference workers to resume experience collection... (3950 times) +[2026-06-07 01:24:50,387][344387] InferenceWorker_p0-w0: resuming experience collection (3950 times) +[2026-06-07 01:24:51,145][344387] Updated weights for policy 0, policy_version 39089 (0.0005) +[2026-06-07 01:24:52,052][344387] Updated weights for policy 0, policy_version 39101 (0.0005) +[2026-06-07 01:24:53,741][344387] Updated weights for policy 0, policy_version 39114 (0.0005) +[2026-06-07 01:24:54,692][344387] Updated weights for policy 0, policy_version 39128 (0.0005) +[2026-06-07 01:24:55,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5256.5, 300 sec: 5276.2). Total num frames: 20035584. Throughput: 0: 5233.3. Samples: 20043668. Policy #0 lag: (min: 3.0, avg: 25.2, max: 47.0) +[2026-06-07 01:24:55,258][343476] Avg episode reward: [(0, '1685.405')] +[2026-06-07 01:24:55,582][344387] Updated weights for policy 0, policy_version 39138 (0.0005) +[2026-06-07 01:24:57,285][344387] Updated weights for policy 0, policy_version 39152 (0.0005) +[2026-06-07 01:24:58,146][344387] Updated weights for policy 0, policy_version 39162 (0.0005) +[2026-06-07 01:24:58,873][344387] Updated weights for policy 0, policy_version 39172 (0.0005) +[2026-06-07 01:25:00,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5256.5, 300 sec: 5248.4). Total num frames: 20060160. Throughput: 0: 5225.3. Samples: 20059508. Policy #0 lag: (min: 3.0, avg: 25.2, max: 47.0) +[2026-06-07 01:25:00,259][343476] Avg episode reward: [(0, '1681.317')] +[2026-06-07 01:25:00,267][344387] Updated weights for policy 0, policy_version 39182 (0.0005) +[2026-06-07 01:25:01,302][344387] Updated weights for policy 0, policy_version 39196 (0.0005) +[2026-06-07 01:25:02,817][344387] Updated weights for policy 0, policy_version 39206 (0.0005) +[2026-06-07 01:25:03,721][344387] Updated weights for policy 0, policy_version 39218 (0.0005) +[2026-06-07 01:25:04,661][344387] Updated weights for policy 0, policy_version 39229 (0.0005) +[2026-06-07 01:25:05,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5256.5, 300 sec: 5234.6). Total num frames: 20088832. Throughput: 0: 5228.4. Samples: 20090980. Policy #0 lag: (min: 3.0, avg: 25.2, max: 47.0) +[2026-06-07 01:25:05,258][343476] Avg episode reward: [(0, '1738.310')] +[2026-06-07 01:25:05,859][344387] Updated weights for policy 0, policy_version 39240 (0.0005) +[2026-06-07 01:25:06,815][344387] Updated weights for policy 0, policy_version 39252 (0.0005) +[2026-06-07 01:25:07,816][344387] Updated weights for policy 0, policy_version 39262 (0.0005) +[2026-06-07 01:25:09,013][344387] Updated weights for policy 0, policy_version 39272 (0.0005) +[2026-06-07 01:25:09,885][344387] Updated weights for policy 0, policy_version 39284 (0.0005) +[2026-06-07 01:25:10,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5290.7, 300 sec: 5234.6). Total num frames: 20115456. Throughput: 0: 5228.5. Samples: 20122760. Policy #0 lag: (min: 3.0, avg: 25.2, max: 47.0) +[2026-06-07 01:25:10,259][343476] Avg episode reward: [(0, '1591.884')] +[2026-06-07 01:25:10,844][344387] Updated weights for policy 0, policy_version 39294 (0.0005) +[2026-06-07 01:25:12,082][344387] Updated weights for policy 0, policy_version 39305 (0.0005) +[2026-06-07 01:25:12,829][344387] Updated weights for policy 0, policy_version 39315 (0.0005) +[2026-06-07 01:25:13,782][344387] Updated weights for policy 0, policy_version 39325 (0.0005) +[2026-06-07 01:25:14,983][344387] Updated weights for policy 0, policy_version 39335 (0.0005) +[2026-06-07 01:25:15,258][343476] Fps is (10 sec: 5119.6, 60 sec: 5222.3, 300 sec: 5234.5). Total num frames: 20140032. Throughput: 0: 5234.0. Samples: 20138926. Policy #0 lag: (min: 1.0, avg: 19.9, max: 35.0) +[2026-06-07 01:25:15,259][343476] Avg episode reward: [(0, '1789.557')] +[2026-06-07 01:25:15,579][344304] Signal inference workers to stop experience collection... (4000 times) +[2026-06-07 01:25:15,591][344387] InferenceWorker_p0-w0: stopping experience collection (4000 times) +[2026-06-07 01:25:15,641][344304] Signal inference workers to resume experience collection... (4000 times) +[2026-06-07 01:25:15,641][344387] InferenceWorker_p0-w0: resuming experience collection (4000 times) +[2026-06-07 01:25:15,788][344387] Updated weights for policy 0, policy_version 39346 (0.0005) +[2026-06-07 01:25:16,470][344387] Updated weights for policy 0, policy_version 39356 (0.0005) +[2026-06-07 01:25:17,883][344387] Updated weights for policy 0, policy_version 39366 (0.0005) +[2026-06-07 01:25:18,840][344387] Updated weights for policy 0, policy_version 39377 (0.0006) +[2026-06-07 01:25:19,768][344387] Updated weights for policy 0, policy_version 39387 (0.0005) +[2026-06-07 01:25:20,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5256.5, 300 sec: 5241.5). Total num frames: 20168704. Throughput: 0: 5257.7. Samples: 20171440. Policy #0 lag: (min: 1.0, avg: 19.9, max: 35.0) +[2026-06-07 01:25:20,258][343476] Avg episode reward: [(0, '1773.024')] +[2026-06-07 01:25:20,804][344387] Updated weights for policy 0, policy_version 39397 (0.0006) +[2026-06-07 01:25:21,969][344387] Updated weights for policy 0, policy_version 39409 (0.0005) +[2026-06-07 01:25:23,014][344387] Updated weights for policy 0, policy_version 39420 (0.0006) +[2026-06-07 01:25:24,058][344387] Updated weights for policy 0, policy_version 39430 (0.0005) +[2026-06-07 01:25:25,201][344387] Updated weights for policy 0, policy_version 39442 (0.0006) +[2026-06-07 01:25:25,257][343476] Fps is (10 sec: 5325.1, 60 sec: 5256.5, 300 sec: 5248.4). Total num frames: 20193280. Throughput: 0: 5266.1. Samples: 20203102. Policy #0 lag: (min: 1.0, avg: 19.9, max: 35.0) +[2026-06-07 01:25:25,258][343476] Avg episode reward: [(0, '1702.808')] +[2026-06-07 01:25:26,178][344387] Updated weights for policy 0, policy_version 39453 (0.0007) +[2026-06-07 01:25:27,387][344387] Updated weights for policy 0, policy_version 39463 (0.0005) +[2026-06-07 01:25:28,201][344387] Updated weights for policy 0, policy_version 39473 (0.0005) +[2026-06-07 01:25:29,232][344387] Updated weights for policy 0, policy_version 39485 (0.0005) +[2026-06-07 01:25:30,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5222.4, 300 sec: 5248.4). Total num frames: 20219904. Throughput: 0: 5266.6. Samples: 20218730. Policy #0 lag: (min: 1.0, avg: 19.9, max: 35.0) +[2026-06-07 01:25:30,259][343476] Avg episode reward: [(0, '1660.564')] +[2026-06-07 01:25:30,461][344387] Updated weights for policy 0, policy_version 39497 (0.0005) +[2026-06-07 01:25:31,655][344387] Updated weights for policy 0, policy_version 39509 (0.0005) +[2026-06-07 01:25:32,552][344387] Updated weights for policy 0, policy_version 39520 (0.0005) +[2026-06-07 01:25:33,744][344387] Updated weights for policy 0, policy_version 39530 (0.0005) +[2026-06-07 01:25:34,751][344387] Updated weights for policy 0, policy_version 39541 (0.0005) +[2026-06-07 01:25:35,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5256.5, 300 sec: 5262.3). Total num frames: 20246528. Throughput: 0: 5291.1. Samples: 20250330. Policy #0 lag: (min: 1.0, avg: 19.9, max: 35.0) +[2026-06-07 01:25:35,258][343476] Avg episode reward: [(0, '1817.137')] +[2026-06-07 01:25:35,613][344387] Updated weights for policy 0, policy_version 39551 (0.0005) +[2026-06-07 01:25:36,662][344387] Updated weights for policy 0, policy_version 39562 (0.0005) +[2026-06-07 01:25:37,876][344387] Updated weights for policy 0, policy_version 39573 (0.0006) +[2026-06-07 01:25:38,589][344387] Updated weights for policy 0, policy_version 39583 (0.0006) +[2026-06-07 01:25:39,674][344387] Updated weights for policy 0, policy_version 39593 (0.0006) +[2026-06-07 01:25:40,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5256.5, 300 sec: 5255.4). Total num frames: 20273152. Throughput: 0: 5303.1. Samples: 20282310. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:25:40,259][343476] Avg episode reward: [(0, '1838.051')] +[2026-06-07 01:25:40,672][344387] Updated weights for policy 0, policy_version 39603 (0.0006) +[2026-06-07 01:25:41,549][344387] Updated weights for policy 0, policy_version 39613 (0.0006) +[2026-06-07 01:25:42,515][344387] Updated weights for policy 0, policy_version 39624 (0.0005) +[2026-06-07 01:25:43,648][344387] Updated weights for policy 0, policy_version 39636 (0.0005) +[2026-06-07 01:25:44,648][344387] Updated weights for policy 0, policy_version 39646 (0.0005) +[2026-06-07 01:25:45,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5256.5, 300 sec: 5269.3). Total num frames: 20299776. Throughput: 0: 5310.6. Samples: 20298486. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:25:45,259][343476] Avg episode reward: [(0, '1769.518')] +[2026-06-07 01:25:45,274][344304] Signal inference workers to stop experience collection... (4050 times) +[2026-06-07 01:25:45,290][344387] InferenceWorker_p0-w0: stopping experience collection (4050 times) +[2026-06-07 01:25:45,305][344304] Signal inference workers to resume experience collection... (4050 times) +[2026-06-07 01:25:45,305][344387] InferenceWorker_p0-w0: resuming experience collection (4050 times) +[2026-06-07 01:25:45,587][344387] Updated weights for policy 0, policy_version 39656 (0.0005) +[2026-06-07 01:25:46,699][344387] Updated weights for policy 0, policy_version 39667 (0.0005) +[2026-06-07 01:25:47,963][344387] Updated weights for policy 0, policy_version 39677 (0.0005) +[2026-06-07 01:25:48,700][344387] Updated weights for policy 0, policy_version 39688 (0.0005) +[2026-06-07 01:25:49,887][344387] Updated weights for policy 0, policy_version 39698 (0.0005) +[2026-06-07 01:25:50,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5358.9, 300 sec: 5276.2). Total num frames: 20328448. Throughput: 0: 5326.7. Samples: 20330680. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:25:50,260][343476] Avg episode reward: [(0, '1683.283')] +[2026-06-07 01:25:50,479][344387] Updated weights for policy 0, policy_version 39708 (0.0005) +[2026-06-07 01:25:51,832][344387] Updated weights for policy 0, policy_version 39720 (0.0005) +[2026-06-07 01:25:52,983][344387] Updated weights for policy 0, policy_version 39730 (0.0005) +[2026-06-07 01:25:54,201][344387] Updated weights for policy 0, policy_version 39741 (0.0005) +[2026-06-07 01:25:55,037][344387] Updated weights for policy 0, policy_version 39754 (0.0005) +[2026-06-07 01:25:55,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5324.8, 300 sec: 5276.2). Total num frames: 20355072. Throughput: 0: 5329.1. Samples: 20362568. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:25:55,260][343476] Avg episode reward: [(0, '1756.777')] +[2026-06-07 01:25:56,299][344387] Updated weights for policy 0, policy_version 39765 (0.0005) +[2026-06-07 01:25:57,387][344387] Updated weights for policy 0, policy_version 39776 (0.0005) +[2026-06-07 01:25:58,179][344387] Updated weights for policy 0, policy_version 39788 (0.0005) +[2026-06-07 01:25:59,491][344387] Updated weights for policy 0, policy_version 39800 (0.0005) +[2026-06-07 01:26:00,257][343476] Fps is (10 sec: 5119.7, 60 sec: 5324.8, 300 sec: 5276.2). Total num frames: 20379648. Throughput: 0: 5314.3. Samples: 20378066. Policy #0 lag: (min: 3.0, avg: 20.1, max: 35.0) +[2026-06-07 01:26:00,262][343476] Avg episode reward: [(0, '1728.107')] +[2026-06-07 01:26:00,801][344387] Updated weights for policy 0, policy_version 39812 (0.0005) +[2026-06-07 01:26:01,985][344387] Updated weights for policy 0, policy_version 39823 (0.0005) +[2026-06-07 01:26:02,884][344387] Updated weights for policy 0, policy_version 39833 (0.0006) +[2026-06-07 01:26:03,988][344387] Updated weights for policy 0, policy_version 39844 (0.0005) +[2026-06-07 01:26:05,201][344387] Updated weights for policy 0, policy_version 39854 (0.0005) +[2026-06-07 01:26:05,257][343476] Fps is (10 sec: 4915.3, 60 sec: 5256.5, 300 sec: 5283.1). Total num frames: 20404224. Throughput: 0: 5282.2. Samples: 20409140. Policy #0 lag: (min: 8.0, avg: 24.0, max: 43.0) +[2026-06-07 01:26:05,258][343476] Avg episode reward: [(0, '1801.349')] +[2026-06-07 01:26:06,141][344387] Updated weights for policy 0, policy_version 39866 (0.0006) +[2026-06-07 01:26:07,232][344387] Updated weights for policy 0, policy_version 39877 (0.0005) +[2026-06-07 01:26:08,459][344387] Updated weights for policy 0, policy_version 39888 (0.0005) +[2026-06-07 01:26:09,478][344387] Updated weights for policy 0, policy_version 39899 (0.0006) +[2026-06-07 01:26:10,257][343476] Fps is (10 sec: 5120.2, 60 sec: 5256.5, 300 sec: 5290.1). Total num frames: 20430848. Throughput: 0: 5262.4. Samples: 20439908. Policy #0 lag: (min: 8.0, avg: 24.0, max: 43.0) +[2026-06-07 01:26:10,259][343476] Avg episode reward: [(0, '1781.853')] +[2026-06-07 01:26:10,542][344387] Updated weights for policy 0, policy_version 39910 (0.0005) +[2026-06-07 01:26:11,586][344387] Updated weights for policy 0, policy_version 39920 (0.0005) +[2026-06-07 01:26:12,591][344387] Updated weights for policy 0, policy_version 39931 (0.0005) +[2026-06-07 01:26:13,660][344304] Signal inference workers to stop experience collection... (4100 times) +[2026-06-07 01:26:13,679][344387] InferenceWorker_p0-w0: stopping experience collection (4100 times) +[2026-06-07 01:26:13,716][344304] Signal inference workers to resume experience collection... (4100 times) +[2026-06-07 01:26:13,716][344387] InferenceWorker_p0-w0: resuming experience collection (4100 times) +[2026-06-07 01:26:13,717][344387] Updated weights for policy 0, policy_version 39944 (0.0005) +[2026-06-07 01:26:14,871][344387] Updated weights for policy 0, policy_version 39954 (0.0005) +[2026-06-07 01:26:15,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5297.0). Total num frames: 20457472. Throughput: 0: 5266.7. Samples: 20455732. Policy #0 lag: (min: 8.0, avg: 24.0, max: 43.0) +[2026-06-07 01:26:15,259][343476] Avg episode reward: [(0, '1833.619')] +[2026-06-07 01:26:15,883][344387] Updated weights for policy 0, policy_version 39965 (0.0005) +[2026-06-07 01:26:16,818][344387] Updated weights for policy 0, policy_version 39975 (0.0005) +[2026-06-07 01:26:17,873][344387] Updated weights for policy 0, policy_version 39985 (0.0005) +[2026-06-07 01:26:18,887][344387] Updated weights for policy 0, policy_version 39997 (0.0005) +[2026-06-07 01:26:19,781][344387] Updated weights for policy 0, policy_version 40008 (0.0005) +[2026-06-07 01:26:20,257][343476] Fps is (10 sec: 5529.4, 60 sec: 5290.6, 300 sec: 5304.0). Total num frames: 20486144. Throughput: 0: 5281.9. Samples: 20488018. Policy #0 lag: (min: 8.0, avg: 24.0, max: 43.0) +[2026-06-07 01:26:20,258][343476] Avg episode reward: [(0, '1703.045')] +[2026-06-07 01:26:20,946][344387] Updated weights for policy 0, policy_version 40018 (0.0007) +[2026-06-07 01:26:22,075][344387] Updated weights for policy 0, policy_version 40029 (0.0006) +[2026-06-07 01:26:23,001][344387] Updated weights for policy 0, policy_version 40040 (0.0006) +[2026-06-07 01:26:24,272][344387] Updated weights for policy 0, policy_version 40050 (0.0005) +[2026-06-07 01:26:25,224][344387] Updated weights for policy 0, policy_version 40061 (0.0005) +[2026-06-07 01:26:25,257][343476] Fps is (10 sec: 5324.6, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 20510720. Throughput: 0: 5271.4. Samples: 20519522. Policy #0 lag: (min: 8.0, avg: 24.0, max: 43.0) +[2026-06-07 01:26:25,259][343476] Avg episode reward: [(0, '1543.508')] +[2026-06-07 01:26:26,506][344387] Updated weights for policy 0, policy_version 40073 (0.0006) +[2026-06-07 01:26:27,328][344387] Updated weights for policy 0, policy_version 40083 (0.0005) +[2026-06-07 01:26:28,521][344387] Updated weights for policy 0, policy_version 40094 (0.0006) +[2026-06-07 01:26:29,705][344387] Updated weights for policy 0, policy_version 40105 (0.0005) +[2026-06-07 01:26:30,257][343476] Fps is (10 sec: 4915.3, 60 sec: 5256.5, 300 sec: 5304.0). Total num frames: 20535296. Throughput: 0: 5262.3. Samples: 20535290. Policy #0 lag: (min: 8.0, avg: 24.0, max: 43.0) +[2026-06-07 01:26:30,259][343476] Avg episode reward: [(0, '1783.934')] +[2026-06-07 01:26:30,623][344387] Updated weights for policy 0, policy_version 40115 (0.0005) +[2026-06-07 01:26:31,472][344387] Updated weights for policy 0, policy_version 40125 (0.0005) +[2026-06-07 01:26:32,227][344387] Updated weights for policy 0, policy_version 40135 (0.0005) +[2026-06-07 01:26:33,385][344387] Updated weights for policy 0, policy_version 40145 (0.0005) +[2026-06-07 01:26:34,280][344387] Updated weights for policy 0, policy_version 40155 (0.0005) +[2026-06-07 01:26:35,190][344387] Updated weights for policy 0, policy_version 40165 (0.0006) +[2026-06-07 01:26:35,257][343476] Fps is (10 sec: 5325.0, 60 sec: 5290.7, 300 sec: 5310.9). Total num frames: 20563968. Throughput: 0: 5258.3. Samples: 20567302. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:26:35,258][343476] Avg episode reward: [(0, '1682.319')] +[2026-06-07 01:26:36,151][344387] Updated weights for policy 0, policy_version 40175 (0.0005) +[2026-06-07 01:26:37,101][344387] Updated weights for policy 0, policy_version 40185 (0.0005) +[2026-06-07 01:26:38,331][344387] Updated weights for policy 0, policy_version 40198 (0.0005) +[2026-06-07 01:26:39,549][344387] Updated weights for policy 0, policy_version 40209 (0.0005) +[2026-06-07 01:26:40,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 20590592. Throughput: 0: 5254.2. Samples: 20599006. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:26:40,258][343476] Avg episode reward: [(0, '1658.304')] +[2026-06-07 01:26:40,357][344387] Updated weights for policy 0, policy_version 40219 (0.0005) +[2026-06-07 01:26:41,566][344387] Updated weights for policy 0, policy_version 40230 (0.0005) +[2026-06-07 01:26:42,691][344387] Updated weights for policy 0, policy_version 40241 (0.0005) +[2026-06-07 01:26:43,371][344387] Updated weights for policy 0, policy_version 40251 (0.0005) +[2026-06-07 01:26:44,756][344387] Updated weights for policy 0, policy_version 40265 (0.0006) +[2026-06-07 01:26:45,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 20617216. Throughput: 0: 5269.2. Samples: 20615180. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:26:45,260][343476] Avg episode reward: [(0, '1792.235')] +[2026-06-07 01:26:45,971][344387] Updated weights for policy 0, policy_version 40276 (0.0006) +[2026-06-07 01:26:47,388][344387] Updated weights for policy 0, policy_version 40288 (0.0006) +[2026-06-07 01:26:47,639][344304] Signal inference workers to stop experience collection... (4150 times) +[2026-06-07 01:26:47,652][344387] InferenceWorker_p0-w0: stopping experience collection (4150 times) +[2026-06-07 01:26:47,695][344304] Signal inference workers to resume experience collection... (4150 times) +[2026-06-07 01:26:47,695][344387] InferenceWorker_p0-w0: resuming experience collection (4150 times) +[2026-06-07 01:26:48,216][344387] Updated weights for policy 0, policy_version 40299 (0.0006) +[2026-06-07 01:26:49,320][344387] Updated weights for policy 0, policy_version 40309 (0.0006) +[2026-06-07 01:26:50,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5222.4, 300 sec: 5304.0). Total num frames: 20641792. Throughput: 0: 5270.3. Samples: 20646302. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:26:50,260][343476] Avg episode reward: [(0, '1574.583')] +[2026-06-07 01:26:50,468][344387] Updated weights for policy 0, policy_version 40321 (0.0006) +[2026-06-07 01:26:51,253][344387] Updated weights for policy 0, policy_version 40331 (0.0005) +[2026-06-07 01:26:52,434][344387] Updated weights for policy 0, policy_version 40342 (0.0006) +[2026-06-07 01:26:53,665][344387] Updated weights for policy 0, policy_version 40353 (0.0005) +[2026-06-07 01:26:54,341][344387] Updated weights for policy 0, policy_version 40363 (0.0005) +[2026-06-07 01:26:55,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5222.4, 300 sec: 5310.9). Total num frames: 20668416. Throughput: 0: 5289.8. Samples: 20677948. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:26:55,258][343476] Avg episode reward: [(0, '1550.819')] +[2026-06-07 01:26:55,422][344387] Updated weights for policy 0, policy_version 40373 (0.0005) +[2026-06-07 01:26:56,556][344387] Updated weights for policy 0, policy_version 40384 (0.0006) +[2026-06-07 01:26:57,442][344387] Updated weights for policy 0, policy_version 40394 (0.0005) +[2026-06-07 01:26:58,424][344387] Updated weights for policy 0, policy_version 40405 (0.0006) +[2026-06-07 01:26:59,471][344387] Updated weights for policy 0, policy_version 40415 (0.0005) +[2026-06-07 01:27:00,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5290.7, 300 sec: 5317.9). Total num frames: 20697088. Throughput: 0: 5298.7. Samples: 20694174. Policy #0 lag: (min: 4.0, avg: 22.5, max: 41.0) +[2026-06-07 01:27:00,259][343476] Avg episode reward: [(0, '1627.547')] +[2026-06-07 01:27:00,480][344387] Updated weights for policy 0, policy_version 40425 (0.0005) +[2026-06-07 01:27:01,355][344387] Updated weights for policy 0, policy_version 40435 (0.0005) +[2026-06-07 01:27:02,270][344387] Updated weights for policy 0, policy_version 40445 (0.0006) +[2026-06-07 01:27:03,131][344387] Updated weights for policy 0, policy_version 40455 (0.0005) +[2026-06-07 01:27:04,201][344387] Updated weights for policy 0, policy_version 40465 (0.0005) +[2026-06-07 01:27:05,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 20721664. Throughput: 0: 5307.9. Samples: 20726870. Policy #0 lag: (min: 4.0, avg: 22.5, max: 41.0) +[2026-06-07 01:27:05,260][343476] Avg episode reward: [(0, '1708.669')] +[2026-06-07 01:27:05,265][344387] Updated weights for policy 0, policy_version 40476 (0.0005) +[2026-06-07 01:27:06,153][344387] Updated weights for policy 0, policy_version 40486 (0.0005) +[2026-06-07 01:27:07,134][344387] Updated weights for policy 0, policy_version 40496 (0.0005) +[2026-06-07 01:27:08,163][344387] Updated weights for policy 0, policy_version 40506 (0.0005) +[2026-06-07 01:27:08,771][344387] Updated weights for policy 0, policy_version 40516 (0.0005) +[2026-06-07 01:27:10,043][344387] Updated weights for policy 0, policy_version 40526 (0.0005) +[2026-06-07 01:27:10,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 20750336. Throughput: 0: 5319.6. Samples: 20758900. Policy #0 lag: (min: 4.0, avg: 22.5, max: 41.0) +[2026-06-07 01:27:10,258][343476] Avg episode reward: [(0, '1729.794')] +[2026-06-07 01:27:11,236][344387] Updated weights for policy 0, policy_version 40537 (0.0005) +[2026-06-07 01:27:12,295][344387] Updated weights for policy 0, policy_version 40549 (0.0005) +[2026-06-07 01:27:13,351][344387] Updated weights for policy 0, policy_version 40560 (0.0006) +[2026-06-07 01:27:14,539][344387] Updated weights for policy 0, policy_version 40572 (0.0005) +[2026-06-07 01:27:15,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 20776960. Throughput: 0: 5308.9. Samples: 20774188. Policy #0 lag: (min: 4.0, avg: 22.5, max: 41.0) +[2026-06-07 01:27:15,259][343476] Avg episode reward: [(0, '1702.754')] +[2026-06-07 01:27:15,412][344387] Updated weights for policy 0, policy_version 40582 (0.0005) +[2026-06-07 01:27:16,445][344387] Updated weights for policy 0, policy_version 40592 (0.0005) +[2026-06-07 01:27:17,605][344387] Updated weights for policy 0, policy_version 40602 (0.0005) +[2026-06-07 01:27:18,415][344387] Updated weights for policy 0, policy_version 40613 (0.0006) +[2026-06-07 01:27:19,177][344304] Signal inference workers to stop experience collection... (4200 times) +[2026-06-07 01:27:19,178][344304] Signal inference workers to resume experience collection... (4200 times) +[2026-06-07 01:27:19,186][344387] InferenceWorker_p0-w0: stopping experience collection (4200 times) +[2026-06-07 01:27:19,186][344387] InferenceWorker_p0-w0: resuming experience collection (4200 times) +[2026-06-07 01:27:19,462][344387] Updated weights for policy 0, policy_version 40623 (0.0005) +[2026-06-07 01:27:20,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 20803584. Throughput: 0: 5298.0. Samples: 20805710. Policy #0 lag: (min: 4.0, avg: 22.5, max: 41.0) +[2026-06-07 01:27:20,259][343476] Avg episode reward: [(0, '1833.351')] +[2026-06-07 01:27:20,538][344387] Updated weights for policy 0, policy_version 40633 (0.0005) +[2026-06-07 01:27:21,393][344387] Updated weights for policy 0, policy_version 40644 (0.0006) +[2026-06-07 01:27:22,410][344387] Updated weights for policy 0, policy_version 40654 (0.0006) +[2026-06-07 01:27:23,279][344387] Updated weights for policy 0, policy_version 40664 (0.0005) +[2026-06-07 01:27:24,260][344387] Updated weights for policy 0, policy_version 40675 (0.0007) +[2026-06-07 01:27:25,257][343476] Fps is (10 sec: 5119.8, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 20828160. Throughput: 0: 5303.7. Samples: 20837674. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:27:25,260][343476] Avg episode reward: [(0, '1790.703')] +[2026-06-07 01:27:25,471][344387] Updated weights for policy 0, policy_version 40685 (0.0005) +[2026-06-07 01:27:26,483][344387] Updated weights for policy 0, policy_version 40695 (0.0005) +[2026-06-07 01:27:27,247][344387] Updated weights for policy 0, policy_version 40705 (0.0005) +[2026-06-07 01:27:28,127][344387] Updated weights for policy 0, policy_version 40715 (0.0005) +[2026-06-07 01:27:29,304][344387] Updated weights for policy 0, policy_version 40725 (0.0005) +[2026-06-07 01:27:30,027][344387] Updated weights for policy 0, policy_version 40736 (0.0005) +[2026-06-07 01:27:30,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5359.0, 300 sec: 5310.9). Total num frames: 20856832. Throughput: 0: 5304.5. Samples: 20853884. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:27:30,259][343476] Avg episode reward: [(0, '1725.167')] +[2026-06-07 01:27:30,986][344387] Updated weights for policy 0, policy_version 40746 (0.0005) +[2026-06-07 01:27:32,003][344387] Updated weights for policy 0, policy_version 40756 (0.0005) +[2026-06-07 01:27:33,052][344387] Updated weights for policy 0, policy_version 40767 (0.0005) +[2026-06-07 01:27:33,957][344387] Updated weights for policy 0, policy_version 40777 (0.0005) +[2026-06-07 01:27:35,002][344387] Updated weights for policy 0, policy_version 40787 (0.0005) +[2026-06-07 01:27:35,257][343476] Fps is (10 sec: 5529.9, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 20883456. Throughput: 0: 5337.1. Samples: 20886470. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:27:35,258][343476] Avg episode reward: [(0, '1696.455')] +[2026-06-07 01:27:36,082][344387] Updated weights for policy 0, policy_version 40798 (0.0006) +[2026-06-07 01:27:37,040][344387] Updated weights for policy 0, policy_version 40809 (0.0005) +[2026-06-07 01:27:38,123][344387] Updated weights for policy 0, policy_version 40819 (0.0005) +[2026-06-07 01:27:39,316][344387] Updated weights for policy 0, policy_version 40831 (0.0005) +[2026-06-07 01:27:40,107][344387] Updated weights for policy 0, policy_version 40841 (0.0005) +[2026-06-07 01:27:40,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5358.9, 300 sec: 5310.9). Total num frames: 20912128. Throughput: 0: 5342.7. Samples: 20918370. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:27:40,258][343476] Avg episode reward: [(0, '1625.025')] +[2026-06-07 01:27:41,325][344387] Updated weights for policy 0, policy_version 40851 (0.0005) +[2026-06-07 01:27:42,336][344387] Updated weights for policy 0, policy_version 40862 (0.0005) +[2026-06-07 01:27:43,408][344387] Updated weights for policy 0, policy_version 40873 (0.0005) +[2026-06-07 01:27:44,532][344387] Updated weights for policy 0, policy_version 40883 (0.0005) +[2026-06-07 01:27:45,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 20936704. Throughput: 0: 5335.5. Samples: 20934272. Policy #0 lag: (min: 6.0, avg: 22.1, max: 38.0) +[2026-06-07 01:27:45,260][343476] Avg episode reward: [(0, '1748.310')] +[2026-06-07 01:27:45,331][344387] Updated weights for policy 0, policy_version 40893 (0.0005) +[2026-06-07 01:27:46,072][344387] Updated weights for policy 0, policy_version 40903 (0.0005) +[2026-06-07 01:27:47,297][344387] Updated weights for policy 0, policy_version 40913 (0.0005) +[2026-06-07 01:27:48,047][344387] Updated weights for policy 0, policy_version 40923 (0.0005) +[2026-06-07 01:27:48,847][344304] Signal inference workers to stop experience collection... (4250 times) +[2026-06-07 01:27:48,869][344387] InferenceWorker_p0-w0: stopping experience collection (4250 times) +[2026-06-07 01:27:48,909][344304] Signal inference workers to resume experience collection... (4250 times) +[2026-06-07 01:27:48,909][344387] InferenceWorker_p0-w0: resuming experience collection (4250 times) +[2026-06-07 01:27:49,068][344387] Updated weights for policy 0, policy_version 40934 (0.0005) +[2026-06-07 01:27:50,025][344387] Updated weights for policy 0, policy_version 40944 (0.0005) +[2026-06-07 01:27:50,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5358.9, 300 sec: 5304.0). Total num frames: 20963328. Throughput: 0: 5326.8. Samples: 20966578. Policy #0 lag: (min: 5.0, avg: 21.2, max: 41.0) +[2026-06-07 01:27:50,259][343476] Avg episode reward: [(0, '1784.651')] +[2026-06-07 01:27:51,010][344387] Updated weights for policy 0, policy_version 40954 (0.0005) +[2026-06-07 01:27:51,817][344387] Updated weights for policy 0, policy_version 40964 (0.0005) +[2026-06-07 01:27:52,917][344387] Updated weights for policy 0, policy_version 40974 (0.0005) +[2026-06-07 01:27:53,811][344387] Updated weights for policy 0, policy_version 40984 (0.0005) +[2026-06-07 01:27:54,710][344387] Updated weights for policy 0, policy_version 40994 (0.0005) +[2026-06-07 01:27:55,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5393.1, 300 sec: 5304.0). Total num frames: 20992000. Throughput: 0: 5350.0. Samples: 20999648. Policy #0 lag: (min: 5.0, avg: 21.2, max: 41.0) +[2026-06-07 01:27:55,258][343476] Avg episode reward: [(0, '1748.266')] +[2026-06-07 01:27:55,565][344387] Updated weights for policy 0, policy_version 41004 (0.0005) +[2026-06-07 01:27:56,739][344387] Updated weights for policy 0, policy_version 41014 (0.0005) +[2026-06-07 01:27:57,684][344387] Updated weights for policy 0, policy_version 41026 (0.0005) +[2026-06-07 01:27:58,562][344387] Updated weights for policy 0, policy_version 41036 (0.0005) +[2026-06-07 01:27:59,724][344387] Updated weights for policy 0, policy_version 41046 (0.0005) +[2026-06-07 01:28:00,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5358.9, 300 sec: 5304.0). Total num frames: 21018624. Throughput: 0: 5365.6. Samples: 21015638. Policy #0 lag: (min: 5.0, avg: 21.2, max: 41.0) +[2026-06-07 01:28:00,258][343476] Avg episode reward: [(0, '1688.387')] +[2026-06-07 01:28:00,710][344387] Updated weights for policy 0, policy_version 41057 (0.0006) +[2026-06-07 01:28:01,405][344387] Updated weights for policy 0, policy_version 41067 (0.0005) +[2026-06-07 01:28:02,678][344387] Updated weights for policy 0, policy_version 41077 (0.0005) +[2026-06-07 01:28:03,435][344387] Updated weights for policy 0, policy_version 41088 (0.0005) +[2026-06-07 01:28:04,377][344387] Updated weights for policy 0, policy_version 41098 (0.0005) +[2026-06-07 01:28:05,249][344387] Updated weights for policy 0, policy_version 41108 (0.0005) +[2026-06-07 01:28:05,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5427.2, 300 sec: 5310.9). Total num frames: 21047296. Throughput: 0: 5398.0. Samples: 21048620. Policy #0 lag: (min: 5.0, avg: 21.2, max: 41.0) +[2026-06-07 01:28:05,259][343476] Avg episode reward: [(0, '1566.501')] +[2026-06-07 01:28:06,454][344387] Updated weights for policy 0, policy_version 41119 (0.0005) +[2026-06-07 01:28:07,513][344387] Updated weights for policy 0, policy_version 41130 (0.0006) +[2026-06-07 01:28:08,421][344387] Updated weights for policy 0, policy_version 41140 (0.0005) +[2026-06-07 01:28:09,637][344387] Updated weights for policy 0, policy_version 41151 (0.0005) +[2026-06-07 01:28:10,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5304.0). Total num frames: 21071872. Throughput: 0: 5410.4. Samples: 21081140. Policy #0 lag: (min: 5.0, avg: 21.2, max: 41.0) +[2026-06-07 01:28:10,258][343476] Avg episode reward: [(0, '1834.330')] +[2026-06-07 01:28:10,568][344387] Updated weights for policy 0, policy_version 41163 (0.0005) +[2026-06-07 01:28:11,772][344387] Updated weights for policy 0, policy_version 41173 (0.0005) +[2026-06-07 01:28:12,778][344387] Updated weights for policy 0, policy_version 41183 (0.0005) +[2026-06-07 01:28:13,646][344387] Updated weights for policy 0, policy_version 41194 (0.0005) +[2026-06-07 01:28:14,665][344387] Updated weights for policy 0, policy_version 41205 (0.0005) +[2026-06-07 01:28:15,257][343476] Fps is (10 sec: 5324.6, 60 sec: 5393.0, 300 sec: 5310.9). Total num frames: 21100544. Throughput: 0: 5406.8. Samples: 21097190. Policy #0 lag: (min: 3.0, avg: 22.2, max: 35.0) +[2026-06-07 01:28:15,259][343476] Avg episode reward: [(0, '1595.886')] +[2026-06-07 01:28:15,751][344387] Updated weights for policy 0, policy_version 41215 (0.0005) +[2026-06-07 01:28:16,748][344387] Updated weights for policy 0, policy_version 41227 (0.0005) +[2026-06-07 01:28:17,828][344387] Updated weights for policy 0, policy_version 41237 (0.0006) +[2026-06-07 01:28:18,928][344387] Updated weights for policy 0, policy_version 41247 (0.0005) +[2026-06-07 01:28:19,552][344304] Signal inference workers to stop experience collection... (4300 times) +[2026-06-07 01:28:19,552][344304] Signal inference workers to resume experience collection... (4300 times) +[2026-06-07 01:28:19,567][344387] InferenceWorker_p0-w0: stopping experience collection (4300 times) +[2026-06-07 01:28:19,567][344387] InferenceWorker_p0-w0: resuming experience collection (4300 times) +[2026-06-07 01:28:19,727][344387] Updated weights for policy 0, policy_version 41258 (0.0005) +[2026-06-07 01:28:20,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5358.9, 300 sec: 5304.0). Total num frames: 21125120. Throughput: 0: 5399.7. Samples: 21129454. Policy #0 lag: (min: 3.0, avg: 22.2, max: 35.0) +[2026-06-07 01:28:20,257][343476] Avg episode reward: [(0, '1684.633')] +[2026-06-07 01:28:20,829][344387] Updated weights for policy 0, policy_version 41269 (0.0005) +[2026-06-07 01:28:22,006][344387] Updated weights for policy 0, policy_version 41280 (0.0005) +[2026-06-07 01:28:22,759][344387] Updated weights for policy 0, policy_version 41290 (0.0005) +[2026-06-07 01:28:23,876][344387] Updated weights for policy 0, policy_version 41301 (0.0005) +[2026-06-07 01:28:25,062][344387] Updated weights for policy 0, policy_version 41312 (0.0005) +[2026-06-07 01:28:25,257][343476] Fps is (10 sec: 5120.2, 60 sec: 5393.1, 300 sec: 5310.9). Total num frames: 21151744. Throughput: 0: 5401.6. Samples: 21161442. Policy #0 lag: (min: 3.0, avg: 22.2, max: 35.0) +[2026-06-07 01:28:25,258][343476] Avg episode reward: [(0, '1765.086')] +[2026-06-07 01:28:25,908][344387] Updated weights for policy 0, policy_version 41324 (0.0005) +[2026-06-07 01:28:27,064][344387] Updated weights for policy 0, policy_version 41335 (0.0005) +[2026-06-07 01:28:28,226][344387] Updated weights for policy 0, policy_version 41345 (0.0005) +[2026-06-07 01:28:28,895][344387] Updated weights for policy 0, policy_version 41355 (0.0005) +[2026-06-07 01:28:29,964][344387] Updated weights for policy 0, policy_version 41365 (0.0005) +[2026-06-07 01:28:30,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5393.1, 300 sec: 5317.9). Total num frames: 21180416. Throughput: 0: 5396.1. Samples: 21177096. Policy #0 lag: (min: 3.0, avg: 22.2, max: 35.0) +[2026-06-07 01:28:30,258][343476] Avg episode reward: [(0, '1616.068')] +[2026-06-07 01:28:31,151][344387] Updated weights for policy 0, policy_version 41376 (0.0005) +[2026-06-07 01:28:32,083][344387] Updated weights for policy 0, policy_version 41386 (0.0005) +[2026-06-07 01:28:32,964][344387] Updated weights for policy 0, policy_version 41398 (0.0005) +[2026-06-07 01:28:34,084][344387] Updated weights for policy 0, policy_version 41408 (0.0005) +[2026-06-07 01:28:35,211][344387] Updated weights for policy 0, policy_version 41418 (0.0005) +[2026-06-07 01:28:35,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5310.9). Total num frames: 21204992. Throughput: 0: 5395.5. Samples: 21209374. Policy #0 lag: (min: 3.0, avg: 22.2, max: 35.0) +[2026-06-07 01:28:35,258][343476] Avg episode reward: [(0, '1678.298')] +[2026-06-07 01:28:36,048][344387] Updated weights for policy 0, policy_version 41429 (0.0005) +[2026-06-07 01:28:37,164][344387] Updated weights for policy 0, policy_version 41439 (0.0005) +[2026-06-07 01:28:38,127][344387] Updated weights for policy 0, policy_version 41449 (0.0005) +[2026-06-07 01:28:39,124][344387] Updated weights for policy 0, policy_version 41462 (0.0005) +[2026-06-07 01:28:40,162][344387] Updated weights for policy 0, policy_version 41472 (0.0005) +[2026-06-07 01:28:40,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5358.9, 300 sec: 5310.9). Total num frames: 21233664. Throughput: 0: 5371.7. Samples: 21241378. Policy #0 lag: (min: 3.0, avg: 22.2, max: 35.0) +[2026-06-07 01:28:40,259][343476] Avg episode reward: [(0, '1646.758')] +[2026-06-07 01:28:41,407][344387] Updated weights for policy 0, policy_version 41484 (0.0005) +[2026-06-07 01:28:42,360][344387] Updated weights for policy 0, policy_version 41496 (0.0005) +[2026-06-07 01:28:43,790][344387] Updated weights for policy 0, policy_version 41506 (0.0005) +[2026-06-07 01:28:44,835][344387] Updated weights for policy 0, policy_version 41518 (0.0005) +[2026-06-07 01:28:45,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5393.1, 300 sec: 5310.9). Total num frames: 21260288. Throughput: 0: 5373.1. Samples: 21257428. Policy #0 lag: (min: 7.0, avg: 20.5, max: 39.0) +[2026-06-07 01:28:45,259][343476] Avg episode reward: [(0, '1793.767')] +[2026-06-07 01:28:45,667][344387] Updated weights for policy 0, policy_version 41530 (0.0005) +[2026-06-07 01:28:46,805][344387] Updated weights for policy 0, policy_version 41540 (0.0005) +[2026-06-07 01:28:47,515][344304] Signal inference workers to stop experience collection... (4350 times) +[2026-06-07 01:28:47,527][344387] InferenceWorker_p0-w0: stopping experience collection (4350 times) +[2026-06-07 01:28:47,620][344304] Signal inference workers to resume experience collection... (4350 times) +[2026-06-07 01:28:47,621][344387] InferenceWorker_p0-w0: resuming experience collection (4350 times) +[2026-06-07 01:28:47,921][344387] Updated weights for policy 0, policy_version 41552 (0.0005) +[2026-06-07 01:28:48,859][344387] Updated weights for policy 0, policy_version 41562 (0.0005) +[2026-06-07 01:28:49,914][344387] Updated weights for policy 0, policy_version 41573 (0.0005) +[2026-06-07 01:28:50,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5393.1, 300 sec: 5310.9). Total num frames: 21286912. Throughput: 0: 5363.1. Samples: 21289960. Policy #0 lag: (min: 7.0, avg: 20.5, max: 39.0) +[2026-06-07 01:28:50,259][343476] Avg episode reward: [(0, '1514.592')] +[2026-06-07 01:28:50,966][344387] Updated weights for policy 0, policy_version 41585 (0.0005) +[2026-06-07 01:28:52,237][344387] Updated weights for policy 0, policy_version 41597 (0.0005) +[2026-06-07 01:28:53,173][344387] Updated weights for policy 0, policy_version 41607 (0.0005) +[2026-06-07 01:28:54,140][344387] Updated weights for policy 0, policy_version 41618 (0.0005) +[2026-06-07 01:28:55,119][344387] Updated weights for policy 0, policy_version 41628 (0.0005) +[2026-06-07 01:28:55,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5317.9). Total num frames: 21313536. Throughput: 0: 5372.7. Samples: 21322910. Policy #0 lag: (min: 7.0, avg: 20.5, max: 39.0) +[2026-06-07 01:28:55,258][343476] Avg episode reward: [(0, '1822.140')] +[2026-06-07 01:28:55,415][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000041632_21315584.pth... +[2026-06-07 01:28:55,455][344304] Removing results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000015444_7907328.pth +[2026-06-07 01:28:55,883][344387] Updated weights for policy 0, policy_version 41638 (0.0005) +[2026-06-07 01:28:57,180][344387] Updated weights for policy 0, policy_version 41650 (0.0005) +[2026-06-07 01:28:58,146][344387] Updated weights for policy 0, policy_version 41660 (0.0005) +[2026-06-07 01:28:58,912][344387] Updated weights for policy 0, policy_version 41670 (0.0005) +[2026-06-07 01:28:59,573][344387] Updated weights for policy 0, policy_version 41680 (0.0005) +[2026-06-07 01:29:00,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5393.1, 300 sec: 5317.9). Total num frames: 21342208. Throughput: 0: 5373.9. Samples: 21339014. Policy #0 lag: (min: 7.0, avg: 20.5, max: 39.0) +[2026-06-07 01:29:00,258][343476] Avg episode reward: [(0, '1874.152')] +[2026-06-07 01:29:00,847][344387] Updated weights for policy 0, policy_version 41690 (0.0005) +[2026-06-07 01:29:02,021][344387] Updated weights for policy 0, policy_version 41701 (0.0005) +[2026-06-07 01:29:02,714][344387] Updated weights for policy 0, policy_version 41712 (0.0005) +[2026-06-07 01:29:03,945][344387] Updated weights for policy 0, policy_version 41722 (0.0005) +[2026-06-07 01:29:05,097][344387] Updated weights for policy 0, policy_version 41733 (0.0005) +[2026-06-07 01:29:05,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5358.9, 300 sec: 5324.8). Total num frames: 21368832. Throughput: 0: 5381.9. Samples: 21371640. Policy #0 lag: (min: 7.0, avg: 20.5, max: 39.0) +[2026-06-07 01:29:05,259][343476] Avg episode reward: [(0, '1763.314')] +[2026-06-07 01:29:06,283][344387] Updated weights for policy 0, policy_version 41747 (0.0005) +[2026-06-07 01:29:07,506][344387] Updated weights for policy 0, policy_version 41757 (0.0005) +[2026-06-07 01:29:08,366][344387] Updated weights for policy 0, policy_version 41767 (0.0005) +[2026-06-07 01:29:09,240][344387] Updated weights for policy 0, policy_version 41778 (0.0005) +[2026-06-07 01:29:10,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5358.9, 300 sec: 5310.9). Total num frames: 21393408. Throughput: 0: 5366.6. Samples: 21402938. Policy #0 lag: (min: 5.0, avg: 20.2, max: 37.0) +[2026-06-07 01:29:10,258][343476] Avg episode reward: [(0, '1745.484')] +[2026-06-07 01:29:10,545][344387] Updated weights for policy 0, policy_version 41789 (0.0005) +[2026-06-07 01:29:11,580][344387] Updated weights for policy 0, policy_version 41800 (0.0005) +[2026-06-07 01:29:12,599][344387] Updated weights for policy 0, policy_version 41810 (0.0005) +[2026-06-07 01:29:13,691][344387] Updated weights for policy 0, policy_version 41821 (0.0005) +[2026-06-07 01:29:14,793][344387] Updated weights for policy 0, policy_version 41833 (0.0005) +[2026-06-07 01:29:15,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 21420032. Throughput: 0: 5365.9. Samples: 21418560. Policy #0 lag: (min: 5.0, avg: 20.2, max: 37.0) +[2026-06-07 01:29:15,258][343476] Avg episode reward: [(0, '1523.182')] +[2026-06-07 01:29:16,031][344387] Updated weights for policy 0, policy_version 41845 (0.0006) +[2026-06-07 01:29:16,972][344387] Updated weights for policy 0, policy_version 41855 (0.0005) +[2026-06-07 01:29:17,764][344304] Signal inference workers to stop experience collection... (4400 times) +[2026-06-07 01:29:17,781][344387] InferenceWorker_p0-w0: stopping experience collection (4400 times) +[2026-06-07 01:29:17,792][344304] Signal inference workers to resume experience collection... (4400 times) +[2026-06-07 01:29:17,793][344387] InferenceWorker_p0-w0: resuming experience collection (4400 times) +[2026-06-07 01:29:17,957][344387] Updated weights for policy 0, policy_version 41866 (0.0005) +[2026-06-07 01:29:18,873][344387] Updated weights for policy 0, policy_version 41876 (0.0005) +[2026-06-07 01:29:19,985][344387] Updated weights for policy 0, policy_version 41886 (0.0005) +[2026-06-07 01:29:20,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5317.9). Total num frames: 21446656. Throughput: 0: 5335.8. Samples: 21449486. Policy #0 lag: (min: 5.0, avg: 20.2, max: 37.0) +[2026-06-07 01:29:20,259][343476] Avg episode reward: [(0, '1914.653')] +[2026-06-07 01:29:20,389][344304] Saving new best policy, reward=1914.653! +[2026-06-07 01:29:20,921][344387] Updated weights for policy 0, policy_version 41897 (0.0005) +[2026-06-07 01:29:21,928][344387] Updated weights for policy 0, policy_version 41907 (0.0005) +[2026-06-07 01:29:23,016][344387] Updated weights for policy 0, policy_version 41917 (0.0005) +[2026-06-07 01:29:23,935][344387] Updated weights for policy 0, policy_version 41928 (0.0005) +[2026-06-07 01:29:24,971][344387] Updated weights for policy 0, policy_version 41938 (0.0005) +[2026-06-07 01:29:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5310.9). Total num frames: 21473280. Throughput: 0: 5341.7. Samples: 21481752. Policy #0 lag: (min: 5.0, avg: 20.2, max: 37.0) +[2026-06-07 01:29:25,258][343476] Avg episode reward: [(0, '1719.024')] +[2026-06-07 01:29:26,126][344387] Updated weights for policy 0, policy_version 41949 (0.0005) +[2026-06-07 01:29:26,751][344387] Updated weights for policy 0, policy_version 41959 (0.0005) +[2026-06-07 01:29:28,097][344387] Updated weights for policy 0, policy_version 41969 (0.0005) +[2026-06-07 01:29:29,273][344387] Updated weights for policy 0, policy_version 41983 (0.0006) +[2026-06-07 01:29:30,247][344387] Updated weights for policy 0, policy_version 41993 (0.0005) +[2026-06-07 01:29:30,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 21499904. Throughput: 0: 5352.1. Samples: 21498272. Policy #0 lag: (min: 5.0, avg: 20.2, max: 37.0) +[2026-06-07 01:29:30,260][343476] Avg episode reward: [(0, '1834.032')] +[2026-06-07 01:29:31,205][344387] Updated weights for policy 0, policy_version 42003 (0.0005) +[2026-06-07 01:29:32,251][344387] Updated weights for policy 0, policy_version 42014 (0.0005) +[2026-06-07 01:29:33,332][344387] Updated weights for policy 0, policy_version 42024 (0.0005) +[2026-06-07 01:29:34,317][344387] Updated weights for policy 0, policy_version 42034 (0.0005) +[2026-06-07 01:29:35,202][344387] Updated weights for policy 0, policy_version 42044 (0.0005) +[2026-06-07 01:29:35,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5317.9). Total num frames: 21526528. Throughput: 0: 5322.1. Samples: 21529452. Policy #0 lag: (min: 4.0, avg: 21.0, max: 36.0) +[2026-06-07 01:29:35,258][343476] Avg episode reward: [(0, '1768.687')] +[2026-06-07 01:29:36,142][344387] Updated weights for policy 0, policy_version 42055 (0.0005) +[2026-06-07 01:29:37,340][344387] Updated weights for policy 0, policy_version 42065 (0.0006) +[2026-06-07 01:29:38,318][344387] Updated weights for policy 0, policy_version 42076 (0.0006) +[2026-06-07 01:29:39,262][344387] Updated weights for policy 0, policy_version 42086 (0.0005) +[2026-06-07 01:29:40,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 21553152. Throughput: 0: 5299.3. Samples: 21561378. Policy #0 lag: (min: 4.0, avg: 21.0, max: 36.0) +[2026-06-07 01:29:40,260][343476] Avg episode reward: [(0, '1845.293')] +[2026-06-07 01:29:40,451][344387] Updated weights for policy 0, policy_version 42097 (0.0006) +[2026-06-07 01:29:41,437][344387] Updated weights for policy 0, policy_version 42107 (0.0005) +[2026-06-07 01:29:42,310][344387] Updated weights for policy 0, policy_version 42117 (0.0006) +[2026-06-07 01:29:43,568][344387] Updated weights for policy 0, policy_version 42129 (0.0006) +[2026-06-07 01:29:44,359][344387] Updated weights for policy 0, policy_version 42139 (0.0006) +[2026-06-07 01:29:45,208][344387] Updated weights for policy 0, policy_version 42149 (0.0005) +[2026-06-07 01:29:45,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5331.7). Total num frames: 21579776. Throughput: 0: 5297.9. Samples: 21577420. Policy #0 lag: (min: 4.0, avg: 21.0, max: 36.0) +[2026-06-07 01:29:45,258][343476] Avg episode reward: [(0, '1694.876')] +[2026-06-07 01:29:46,175][344387] Updated weights for policy 0, policy_version 42159 (0.0005) +[2026-06-07 01:29:47,137][344387] Updated weights for policy 0, policy_version 42169 (0.0005) +[2026-06-07 01:29:47,926][344387] Updated weights for policy 0, policy_version 42179 (0.0006) +[2026-06-07 01:29:49,135][344387] Updated weights for policy 0, policy_version 42189 (0.0005) +[2026-06-07 01:29:50,079][344387] Updated weights for policy 0, policy_version 42200 (0.0005) +[2026-06-07 01:29:50,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5324.8, 300 sec: 5324.8). Total num frames: 21606400. Throughput: 0: 5297.0. Samples: 21610002. Policy #0 lag: (min: 4.0, avg: 21.0, max: 36.0) +[2026-06-07 01:29:50,258][343476] Avg episode reward: [(0, '1724.244')] +[2026-06-07 01:29:51,029][344387] Updated weights for policy 0, policy_version 42211 (0.0006) +[2026-06-07 01:29:51,211][344304] Signal inference workers to stop experience collection... (4450 times) +[2026-06-07 01:29:51,212][344304] Signal inference workers to resume experience collection... (4450 times) +[2026-06-07 01:29:51,239][344387] InferenceWorker_p0-w0: stopping experience collection (4450 times) +[2026-06-07 01:29:51,239][344387] InferenceWorker_p0-w0: resuming experience collection (4450 times) +[2026-06-07 01:29:52,186][344387] Updated weights for policy 0, policy_version 42221 (0.0005) +[2026-06-07 01:29:53,051][344387] Updated weights for policy 0, policy_version 42232 (0.0006) +[2026-06-07 01:29:54,204][344387] Updated weights for policy 0, policy_version 42244 (0.0005) +[2026-06-07 01:29:55,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5324.8, 300 sec: 5331.7). Total num frames: 21633024. Throughput: 0: 5289.3. Samples: 21640958. Policy #0 lag: (min: 4.0, avg: 21.0, max: 36.0) +[2026-06-07 01:29:55,259][343476] Avg episode reward: [(0, '1676.003')] +[2026-06-07 01:29:55,406][344387] Updated weights for policy 0, policy_version 42254 (0.0005) +[2026-06-07 01:29:56,280][344387] Updated weights for policy 0, policy_version 42264 (0.0005) +[2026-06-07 01:29:57,420][344387] Updated weights for policy 0, policy_version 42275 (0.0006) +[2026-06-07 01:29:58,288][344387] Updated weights for policy 0, policy_version 42285 (0.0005) +[2026-06-07 01:29:59,268][344387] Updated weights for policy 0, policy_version 42296 (0.0006) +[2026-06-07 01:30:00,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5324.8). Total num frames: 21659648. Throughput: 0: 5306.7. Samples: 21657362. Policy #0 lag: (min: 4.0, avg: 21.0, max: 36.0) +[2026-06-07 01:30:00,258][343476] Avg episode reward: [(0, '1844.448')] +[2026-06-07 01:30:00,413][344387] Updated weights for policy 0, policy_version 42308 (0.0005) +[2026-06-07 01:30:01,483][344387] Updated weights for policy 0, policy_version 42318 (0.0005) +[2026-06-07 01:30:02,743][344387] Updated weights for policy 0, policy_version 42329 (0.0005) +[2026-06-07 01:30:03,625][344387] Updated weights for policy 0, policy_version 42339 (0.0005) +[2026-06-07 01:30:04,523][344387] Updated weights for policy 0, policy_version 42350 (0.0006) +[2026-06-07 01:30:05,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5290.7, 300 sec: 5324.8). Total num frames: 21686272. Throughput: 0: 5319.3. Samples: 21688852. Policy #0 lag: (min: 7.0, avg: 21.9, max: 38.0) +[2026-06-07 01:30:05,258][343476] Avg episode reward: [(0, '1628.722')] +[2026-06-07 01:30:05,821][344387] Updated weights for policy 0, policy_version 42361 (0.0006) +[2026-06-07 01:30:06,704][344387] Updated weights for policy 0, policy_version 42372 (0.0006) +[2026-06-07 01:30:07,780][344387] Updated weights for policy 0, policy_version 42383 (0.0005) +[2026-06-07 01:30:08,979][344387] Updated weights for policy 0, policy_version 42394 (0.0005) +[2026-06-07 01:30:09,948][344387] Updated weights for policy 0, policy_version 42404 (0.0005) +[2026-06-07 01:30:10,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5324.8, 300 sec: 5331.8). Total num frames: 21712896. Throughput: 0: 5312.7. Samples: 21720822. Policy #0 lag: (min: 7.0, avg: 21.9, max: 38.0) +[2026-06-07 01:30:10,258][343476] Avg episode reward: [(0, '1675.362')] +[2026-06-07 01:30:10,717][344387] Updated weights for policy 0, policy_version 42415 (0.0005) +[2026-06-07 01:30:12,082][344387] Updated weights for policy 0, policy_version 42425 (0.0005) +[2026-06-07 01:30:12,819][344387] Updated weights for policy 0, policy_version 42435 (0.0005) +[2026-06-07 01:30:13,778][344387] Updated weights for policy 0, policy_version 42446 (0.0005) +[2026-06-07 01:30:15,081][344387] Updated weights for policy 0, policy_version 42457 (0.0005) +[2026-06-07 01:30:15,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5324.8, 300 sec: 5324.8). Total num frames: 21739520. Throughput: 0: 5302.8. Samples: 21736900. Policy #0 lag: (min: 7.0, avg: 21.9, max: 38.0) +[2026-06-07 01:30:15,260][343476] Avg episode reward: [(0, '1749.151')] +[2026-06-07 01:30:15,764][344387] Updated weights for policy 0, policy_version 42468 (0.0005) +[2026-06-07 01:30:16,926][344387] Updated weights for policy 0, policy_version 42480 (0.0005) +[2026-06-07 01:30:18,265][344387] Updated weights for policy 0, policy_version 42490 (0.0005) +[2026-06-07 01:30:19,216][344387] Updated weights for policy 0, policy_version 42502 (0.0006) +[2026-06-07 01:30:19,907][344387] Updated weights for policy 0, policy_version 42512 (0.0005) +[2026-06-07 01:30:20,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5324.8, 300 sec: 5331.7). Total num frames: 21766144. Throughput: 0: 5326.0. Samples: 21769124. Policy #0 lag: (min: 7.0, avg: 21.9, max: 38.0) +[2026-06-07 01:30:20,258][343476] Avg episode reward: [(0, '1871.781')] +[2026-06-07 01:30:21,141][344387] Updated weights for policy 0, policy_version 42522 (0.0006) +[2026-06-07 01:30:22,102][344387] Updated weights for policy 0, policy_version 42532 (0.0006) +[2026-06-07 01:30:22,337][344304] Signal inference workers to stop experience collection... (4500 times) +[2026-06-07 01:30:22,352][344387] InferenceWorker_p0-w0: stopping experience collection (4500 times) +[2026-06-07 01:30:22,392][344304] Signal inference workers to resume experience collection... (4500 times) +[2026-06-07 01:30:22,392][344387] InferenceWorker_p0-w0: resuming experience collection (4500 times) +[2026-06-07 01:30:22,874][344387] Updated weights for policy 0, policy_version 42542 (0.0006) +[2026-06-07 01:30:23,833][344387] Updated weights for policy 0, policy_version 42552 (0.0005) +[2026-06-07 01:30:24,971][344387] Updated weights for policy 0, policy_version 42562 (0.0005) +[2026-06-07 01:30:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5331.7). Total num frames: 21792768. Throughput: 0: 5351.6. Samples: 21802198. Policy #0 lag: (min: 7.0, avg: 21.9, max: 38.0) +[2026-06-07 01:30:25,258][343476] Avg episode reward: [(0, '1708.194')] +[2026-06-07 01:30:26,071][344387] Updated weights for policy 0, policy_version 42574 (0.0006) +[2026-06-07 01:30:26,977][344387] Updated weights for policy 0, policy_version 42584 (0.0005) +[2026-06-07 01:30:27,930][344387] Updated weights for policy 0, policy_version 42594 (0.0005) +[2026-06-07 01:30:28,556][344387] Updated weights for policy 0, policy_version 42604 (0.0005) +[2026-06-07 01:30:30,124][344387] Updated weights for policy 0, policy_version 42615 (0.0005) +[2026-06-07 01:30:30,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5324.8, 300 sec: 5331.7). Total num frames: 21819392. Throughput: 0: 5350.9. Samples: 21818212. Policy #0 lag: (min: 7.0, avg: 23.2, max: 39.0) +[2026-06-07 01:30:30,258][343476] Avg episode reward: [(0, '1645.724')] +[2026-06-07 01:30:30,925][344387] Updated weights for policy 0, policy_version 42626 (0.0005) +[2026-06-07 01:30:31,561][344387] Updated weights for policy 0, policy_version 42636 (0.0005) +[2026-06-07 01:30:33,124][344387] Updated weights for policy 0, policy_version 42646 (0.0005) +[2026-06-07 01:30:34,163][344387] Updated weights for policy 0, policy_version 42660 (0.0005) +[2026-06-07 01:30:35,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5324.8, 300 sec: 5331.7). Total num frames: 21846016. Throughput: 0: 5328.2. Samples: 21849770. Policy #0 lag: (min: 7.0, avg: 23.2, max: 39.0) +[2026-06-07 01:30:35,259][343476] Avg episode reward: [(0, '1781.185')] +[2026-06-07 01:30:35,701][344387] Updated weights for policy 0, policy_version 42673 (0.0006) +[2026-06-07 01:30:36,694][344387] Updated weights for policy 0, policy_version 42684 (0.0006) +[2026-06-07 01:30:37,544][344387] Updated weights for policy 0, policy_version 42694 (0.0005) +[2026-06-07 01:30:38,919][344387] Updated weights for policy 0, policy_version 42705 (0.0005) +[2026-06-07 01:30:40,080][344387] Updated weights for policy 0, policy_version 42717 (0.0005) +[2026-06-07 01:30:40,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5331.7). Total num frames: 21872640. Throughput: 0: 5334.5. Samples: 21881012. Policy #0 lag: (min: 7.0, avg: 23.2, max: 39.0) +[2026-06-07 01:30:40,259][343476] Avg episode reward: [(0, '1656.049')] +[2026-06-07 01:30:40,776][344387] Updated weights for policy 0, policy_version 42728 (0.0005) +[2026-06-07 01:30:42,149][344387] Updated weights for policy 0, policy_version 42739 (0.0005) +[2026-06-07 01:30:43,520][344387] Updated weights for policy 0, policy_version 42753 (0.0005) +[2026-06-07 01:30:45,065][344387] Updated weights for policy 0, policy_version 42765 (0.0005) +[2026-06-07 01:30:45,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5290.7, 300 sec: 5317.9). Total num frames: 21897216. Throughput: 0: 5323.2. Samples: 21896904. Policy #0 lag: (min: 7.0, avg: 23.2, max: 39.0) +[2026-06-07 01:30:45,258][343476] Avg episode reward: [(0, '1705.326')] +[2026-06-07 01:30:45,992][344387] Updated weights for policy 0, policy_version 42776 (0.0005) +[2026-06-07 01:30:46,776][344387] Updated weights for policy 0, policy_version 42786 (0.0006) +[2026-06-07 01:30:47,505][344387] Updated weights for policy 0, policy_version 42796 (0.0005) +[2026-06-07 01:30:49,029][344387] Updated weights for policy 0, policy_version 42806 (0.0005) +[2026-06-07 01:30:49,972][344387] Updated weights for policy 0, policy_version 42820 (0.0005) +[2026-06-07 01:30:50,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5324.8). Total num frames: 21925888. Throughput: 0: 5306.5. Samples: 21927646. Policy #0 lag: (min: 7.0, avg: 23.2, max: 39.0) +[2026-06-07 01:30:50,258][343476] Avg episode reward: [(0, '1740.575')] +[2026-06-07 01:30:51,339][344387] Updated weights for policy 0, policy_version 42830 (0.0005) +[2026-06-07 01:30:51,427][344304] Signal inference workers to stop experience collection... (4550 times) +[2026-06-07 01:30:51,442][344387] InferenceWorker_p0-w0: stopping experience collection (4550 times) +[2026-06-07 01:30:51,453][344304] Signal inference workers to resume experience collection... (4550 times) +[2026-06-07 01:30:51,454][344387] InferenceWorker_p0-w0: resuming experience collection (4550 times) +[2026-06-07 01:30:52,234][344387] Updated weights for policy 0, policy_version 42842 (0.0005) +[2026-06-07 01:30:53,212][344387] Updated weights for policy 0, policy_version 42853 (0.0005) +[2026-06-07 01:30:54,505][344387] Updated weights for policy 0, policy_version 42863 (0.0006) +[2026-06-07 01:30:55,258][343476] Fps is (10 sec: 5119.9, 60 sec: 5256.5, 300 sec: 5317.9). Total num frames: 21948416. Throughput: 0: 5281.4. Samples: 21958488. Policy #0 lag: (min: 7.0, avg: 23.2, max: 39.0) +[2026-06-07 01:30:55,262][343476] Avg episode reward: [(0, '1749.471')] +[2026-06-07 01:30:55,760][344387] Updated weights for policy 0, policy_version 42876 (0.0005) +[2026-06-07 01:30:56,595][344387] Updated weights for policy 0, policy_version 42888 (0.0006) +[2026-06-07 01:30:57,919][344387] Updated weights for policy 0, policy_version 42899 (0.0005) +[2026-06-07 01:30:59,220][344387] Updated weights for policy 0, policy_version 42910 (0.0005) +[2026-06-07 01:31:00,072][344387] Updated weights for policy 0, policy_version 42921 (0.0005) +[2026-06-07 01:31:00,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5290.7, 300 sec: 5331.7). Total num frames: 21977088. Throughput: 0: 5276.3. Samples: 21974334. Policy #0 lag: (min: 5.0, avg: 19.5, max: 39.0) +[2026-06-07 01:31:00,258][343476] Avg episode reward: [(0, '1649.389')] +[2026-06-07 01:31:01,201][344387] Updated weights for policy 0, policy_version 42931 (0.0006) +[2026-06-07 01:31:02,439][344387] Updated weights for policy 0, policy_version 42944 (0.0006) +[2026-06-07 01:31:03,496][344387] Updated weights for policy 0, policy_version 42955 (0.0006) +[2026-06-07 01:31:04,880][344387] Updated weights for policy 0, policy_version 42966 (0.0005) +[2026-06-07 01:31:05,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5222.4, 300 sec: 5317.9). Total num frames: 21999616. Throughput: 0: 5216.1. Samples: 22003850. Policy #0 lag: (min: 5.0, avg: 19.5, max: 39.0) +[2026-06-07 01:31:05,259][343476] Avg episode reward: [(0, '1822.166')] +[2026-06-07 01:31:05,761][344387] Updated weights for policy 0, policy_version 42977 (0.0005) +[2026-06-07 01:31:07,429][344387] Updated weights for policy 0, policy_version 42989 (0.0005) +[2026-06-07 01:31:08,499][344387] Updated weights for policy 0, policy_version 43001 (0.0005) +[2026-06-07 01:31:09,475][344387] Updated weights for policy 0, policy_version 43014 (0.0005) +[2026-06-07 01:31:10,257][343476] Fps is (10 sec: 4915.1, 60 sec: 5222.4, 300 sec: 5317.9). Total num frames: 22026240. Throughput: 0: 5154.5. Samples: 22034150. Policy #0 lag: (min: 5.0, avg: 19.5, max: 39.0) +[2026-06-07 01:31:10,260][343476] Avg episode reward: [(0, '1693.065')] +[2026-06-07 01:31:10,810][344387] Updated weights for policy 0, policy_version 43025 (0.0005) +[2026-06-07 01:31:12,106][344387] Updated weights for policy 0, policy_version 43037 (0.0005) +[2026-06-07 01:31:13,024][344387] Updated weights for policy 0, policy_version 43050 (0.0006) +[2026-06-07 01:31:14,702][344387] Updated weights for policy 0, policy_version 43061 (0.0006) +[2026-06-07 01:31:15,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5188.3, 300 sec: 5304.0). Total num frames: 22050816. Throughput: 0: 5136.7. Samples: 22049364. Policy #0 lag: (min: 5.0, avg: 19.5, max: 39.0) +[2026-06-07 01:31:15,258][343476] Avg episode reward: [(0, '1694.844')] +[2026-06-07 01:31:15,768][344387] Updated weights for policy 0, policy_version 43076 (0.0006) +[2026-06-07 01:31:17,040][344387] Updated weights for policy 0, policy_version 43086 (0.0005) +[2026-06-07 01:31:18,037][344387] Updated weights for policy 0, policy_version 43096 (0.0005) +[2026-06-07 01:31:19,091][344387] Updated weights for policy 0, policy_version 43109 (0.0005) +[2026-06-07 01:31:19,147][344304] Signal inference workers to stop experience collection... (4600 times) +[2026-06-07 01:31:19,157][344387] InferenceWorker_p0-w0: stopping experience collection (4600 times) +[2026-06-07 01:31:19,199][344304] Signal inference workers to resume experience collection... (4600 times) +[2026-06-07 01:31:19,199][344387] InferenceWorker_p0-w0: resuming experience collection (4600 times) +[2026-06-07 01:31:20,227][344387] Updated weights for policy 0, policy_version 43120 (0.0005) +[2026-06-07 01:31:20,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5188.3, 300 sec: 5310.9). Total num frames: 22077440. Throughput: 0: 5131.8. Samples: 22080700. Policy #0 lag: (min: 5.0, avg: 19.5, max: 39.0) +[2026-06-07 01:31:20,258][343476] Avg episode reward: [(0, '1647.938')] +[2026-06-07 01:31:21,403][344387] Updated weights for policy 0, policy_version 43130 (0.0005) +[2026-06-07 01:31:22,243][344387] Updated weights for policy 0, policy_version 43141 (0.0005) +[2026-06-07 01:31:23,218][344387] Updated weights for policy 0, policy_version 43151 (0.0005) +[2026-06-07 01:31:24,437][344387] Updated weights for policy 0, policy_version 43162 (0.0005) +[2026-06-07 01:31:25,257][343476] Fps is (10 sec: 5325.0, 60 sec: 5188.3, 300 sec: 5317.9). Total num frames: 22104064. Throughput: 0: 5129.3. Samples: 22111828. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 01:31:25,258][343476] Avg episode reward: [(0, '1737.672')] +[2026-06-07 01:31:25,402][344387] Updated weights for policy 0, policy_version 43173 (0.0005) +[2026-06-07 01:31:26,335][344387] Updated weights for policy 0, policy_version 43183 (0.0005) +[2026-06-07 01:31:27,583][344387] Updated weights for policy 0, policy_version 43196 (0.0005) +[2026-06-07 01:31:28,593][344387] Updated weights for policy 0, policy_version 43207 (0.0005) +[2026-06-07 01:31:30,027][344387] Updated weights for policy 0, policy_version 43217 (0.0005) +[2026-06-07 01:31:30,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5154.1, 300 sec: 5304.0). Total num frames: 22128640. Throughput: 0: 5125.9. Samples: 22127570. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 01:31:30,259][343476] Avg episode reward: [(0, '1767.534')] +[2026-06-07 01:31:30,944][344387] Updated weights for policy 0, policy_version 43230 (0.0005) +[2026-06-07 01:31:31,811][344387] Updated weights for policy 0, policy_version 43240 (0.0005) +[2026-06-07 01:31:33,149][344387] Updated weights for policy 0, policy_version 43250 (0.0005) +[2026-06-07 01:31:33,968][344387] Updated weights for policy 0, policy_version 43262 (0.0005) +[2026-06-07 01:31:35,014][344387] Updated weights for policy 0, policy_version 43273 (0.0006) +[2026-06-07 01:31:35,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5188.3, 300 sec: 5310.9). Total num frames: 22157312. Throughput: 0: 5148.5. Samples: 22159326. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 01:31:35,258][343476] Avg episode reward: [(0, '1788.793')] +[2026-06-07 01:31:36,081][344387] Updated weights for policy 0, policy_version 43283 (0.0005) +[2026-06-07 01:31:36,908][344387] Updated weights for policy 0, policy_version 43294 (0.0005) +[2026-06-07 01:31:37,883][344387] Updated weights for policy 0, policy_version 43304 (0.0005) +[2026-06-07 01:31:38,896][344387] Updated weights for policy 0, policy_version 43314 (0.0005) +[2026-06-07 01:31:39,859][344387] Updated weights for policy 0, policy_version 43326 (0.0005) +[2026-06-07 01:31:40,257][343476] Fps is (10 sec: 5529.8, 60 sec: 5188.3, 300 sec: 5310.9). Total num frames: 22183936. Throughput: 0: 5193.7. Samples: 22192204. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 01:31:40,258][343476] Avg episode reward: [(0, '1695.856')] +[2026-06-07 01:31:40,651][344387] Updated weights for policy 0, policy_version 43336 (0.0005) +[2026-06-07 01:31:41,913][344387] Updated weights for policy 0, policy_version 43346 (0.0005) +[2026-06-07 01:31:42,971][344387] Updated weights for policy 0, policy_version 43357 (0.0005) +[2026-06-07 01:31:43,839][344387] Updated weights for policy 0, policy_version 43368 (0.0005) +[2026-06-07 01:31:44,959][344387] Updated weights for policy 0, policy_version 43378 (0.0005) +[2026-06-07 01:31:45,257][343476] Fps is (10 sec: 5324.6, 60 sec: 5222.4, 300 sec: 5317.9). Total num frames: 22210560. Throughput: 0: 5200.8. Samples: 22208370. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 01:31:45,258][343476] Avg episode reward: [(0, '1871.997')] +[2026-06-07 01:31:46,048][344387] Updated weights for policy 0, policy_version 43389 (0.0005) +[2026-06-07 01:31:46,875][344387] Updated weights for policy 0, policy_version 43399 (0.0005) +[2026-06-07 01:31:47,933][344387] Updated weights for policy 0, policy_version 43409 (0.0005) +[2026-06-07 01:31:48,737][344387] Updated weights for policy 0, policy_version 43419 (0.0005) +[2026-06-07 01:31:49,810][344387] Updated weights for policy 0, policy_version 43429 (0.0005) +[2026-06-07 01:31:50,257][343476] Fps is (10 sec: 5324.6, 60 sec: 5188.2, 300 sec: 5317.9). Total num frames: 22237184. Throughput: 0: 5262.8. Samples: 22240674. Policy #0 lag: (min: 3.0, avg: 21.4, max: 35.0) +[2026-06-07 01:31:50,260][343476] Avg episode reward: [(0, '1554.768')] +[2026-06-07 01:31:50,372][344304] Signal inference workers to stop experience collection... (4650 times) +[2026-06-07 01:31:50,385][344387] InferenceWorker_p0-w0: stopping experience collection (4650 times) +[2026-06-07 01:31:50,458][344304] Signal inference workers to resume experience collection... (4650 times) +[2026-06-07 01:31:50,458][344387] InferenceWorker_p0-w0: resuming experience collection (4650 times) +[2026-06-07 01:31:50,849][344387] Updated weights for policy 0, policy_version 43440 (0.0005) +[2026-06-07 01:31:51,713][344387] Updated weights for policy 0, policy_version 43451 (0.0005) +[2026-06-07 01:31:52,838][344387] Updated weights for policy 0, policy_version 43461 (0.0005) +[2026-06-07 01:31:53,804][344387] Updated weights for policy 0, policy_version 43472 (0.0005) +[2026-06-07 01:31:54,768][344387] Updated weights for policy 0, policy_version 43482 (0.0005) +[2026-06-07 01:31:55,257][343476] Fps is (10 sec: 5325.0, 60 sec: 5256.6, 300 sec: 5310.9). Total num frames: 22263808. Throughput: 0: 5312.2. Samples: 22273196. Policy #0 lag: (min: 7.0, avg: 22.4, max: 39.0) +[2026-06-07 01:31:55,258][343476] Avg episode reward: [(0, '1718.293')] +[2026-06-07 01:31:55,718][344387] Updated weights for policy 0, policy_version 43492 (0.0005) +[2026-06-07 01:31:56,718][344387] Updated weights for policy 0, policy_version 43503 (0.0005) +[2026-06-07 01:31:57,781][344387] Updated weights for policy 0, policy_version 43513 (0.0005) +[2026-06-07 01:31:58,713][344387] Updated weights for policy 0, policy_version 43523 (0.0005) +[2026-06-07 01:31:59,624][344387] Updated weights for policy 0, policy_version 43533 (0.0005) +[2026-06-07 01:32:00,257][343476] Fps is (10 sec: 5529.8, 60 sec: 5256.5, 300 sec: 5324.8). Total num frames: 22292480. Throughput: 0: 5336.8. Samples: 22289520. Policy #0 lag: (min: 7.0, avg: 22.4, max: 39.0) +[2026-06-07 01:32:00,258][343476] Avg episode reward: [(0, '1594.434')] +[2026-06-07 01:32:00,410][344387] Updated weights for policy 0, policy_version 43543 (0.0005) +[2026-06-07 01:32:01,570][344387] Updated weights for policy 0, policy_version 43555 (0.0005) +[2026-06-07 01:32:02,699][344387] Updated weights for policy 0, policy_version 43566 (0.0005) +[2026-06-07 01:32:03,438][344387] Updated weights for policy 0, policy_version 43576 (0.0005) +[2026-06-07 01:32:04,515][344387] Updated weights for policy 0, policy_version 43586 (0.0005) +[2026-06-07 01:32:05,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 22319104. Throughput: 0: 5372.0. Samples: 22322442. Policy #0 lag: (min: 7.0, avg: 22.4, max: 39.0) +[2026-06-07 01:32:05,259][343476] Avg episode reward: [(0, '1793.351')] +[2026-06-07 01:32:05,581][344387] Updated weights for policy 0, policy_version 43597 (0.0005) +[2026-06-07 01:32:06,420][344387] Updated weights for policy 0, policy_version 43607 (0.0005) +[2026-06-07 01:32:07,545][344387] Updated weights for policy 0, policy_version 43617 (0.0005) +[2026-06-07 01:32:08,526][344387] Updated weights for policy 0, policy_version 43628 (0.0006) +[2026-06-07 01:32:09,316][344387] Updated weights for policy 0, policy_version 43638 (0.0006) +[2026-06-07 01:32:10,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 22345728. Throughput: 0: 5400.3. Samples: 22354842. Policy #0 lag: (min: 7.0, avg: 22.4, max: 39.0) +[2026-06-07 01:32:10,259][343476] Avg episode reward: [(0, '1650.550')] +[2026-06-07 01:32:10,314][344387] Updated weights for policy 0, policy_version 43648 (0.0005) +[2026-06-07 01:32:11,567][344387] Updated weights for policy 0, policy_version 43658 (0.0005) +[2026-06-07 01:32:12,394][344387] Updated weights for policy 0, policy_version 43669 (0.0005) +[2026-06-07 01:32:13,285][344387] Updated weights for policy 0, policy_version 43679 (0.0005) +[2026-06-07 01:32:14,485][344387] Updated weights for policy 0, policy_version 43689 (0.0005) +[2026-06-07 01:32:15,146][344387] Updated weights for policy 0, policy_version 43699 (0.0005) +[2026-06-07 01:32:15,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5393.1, 300 sec: 5324.8). Total num frames: 22374400. Throughput: 0: 5410.8. Samples: 22371054. Policy #0 lag: (min: 7.0, avg: 22.4, max: 39.0) +[2026-06-07 01:32:15,258][343476] Avg episode reward: [(0, '1755.537')] +[2026-06-07 01:32:16,083][344387] Updated weights for policy 0, policy_version 43709 (0.0006) +[2026-06-07 01:32:17,025][344387] Updated weights for policy 0, policy_version 43719 (0.0006) +[2026-06-07 01:32:17,994][344387] Updated weights for policy 0, policy_version 43730 (0.0005) +[2026-06-07 01:32:18,995][344387] Updated weights for policy 0, policy_version 43740 (0.0005) +[2026-06-07 01:32:20,091][344387] Updated weights for policy 0, policy_version 43750 (0.0005) +[2026-06-07 01:32:20,094][344304] Signal inference workers to stop experience collection... (4700 times) +[2026-06-07 01:32:20,110][344387] InferenceWorker_p0-w0: stopping experience collection (4700 times) +[2026-06-07 01:32:20,165][344304] Signal inference workers to resume experience collection... (4700 times) +[2026-06-07 01:32:20,166][344387] InferenceWorker_p0-w0: resuming experience collection (4700 times) +[2026-06-07 01:32:20,260][343476] Fps is (10 sec: 5528.0, 60 sec: 5392.8, 300 sec: 5331.7). Total num frames: 22401024. Throughput: 0: 5444.0. Samples: 22404324. Policy #0 lag: (min: 3.0, avg: 22.1, max: 40.0) +[2026-06-07 01:32:20,262][343476] Avg episode reward: [(0, '1779.257')] +[2026-06-07 01:32:20,952][344387] Updated weights for policy 0, policy_version 43762 (0.0005) +[2026-06-07 01:32:21,913][344387] Updated weights for policy 0, policy_version 43772 (0.0005) +[2026-06-07 01:32:23,098][344387] Updated weights for policy 0, policy_version 43782 (0.0005) +[2026-06-07 01:32:23,783][344387] Updated weights for policy 0, policy_version 43792 (0.0005) +[2026-06-07 01:32:24,872][344387] Updated weights for policy 0, policy_version 43802 (0.0005) +[2026-06-07 01:32:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5393.1, 300 sec: 5324.8). Total num frames: 22427648. Throughput: 0: 5434.0. Samples: 22436736. Policy #0 lag: (min: 3.0, avg: 22.1, max: 40.0) +[2026-06-07 01:32:25,258][343476] Avg episode reward: [(0, '1787.668')] +[2026-06-07 01:32:25,851][344387] Updated weights for policy 0, policy_version 43812 (0.0005) +[2026-06-07 01:32:26,830][344387] Updated weights for policy 0, policy_version 43824 (0.0005) +[2026-06-07 01:32:27,792][344387] Updated weights for policy 0, policy_version 43834 (0.0005) +[2026-06-07 01:32:29,048][344387] Updated weights for policy 0, policy_version 43845 (0.0005) +[2026-06-07 01:32:29,913][344387] Updated weights for policy 0, policy_version 43857 (0.0005) +[2026-06-07 01:32:30,257][343476] Fps is (10 sec: 5531.3, 60 sec: 5461.4, 300 sec: 5331.7). Total num frames: 22456320. Throughput: 0: 5438.6. Samples: 22453106. Policy #0 lag: (min: 3.0, avg: 22.1, max: 40.0) +[2026-06-07 01:32:30,258][343476] Avg episode reward: [(0, '1789.905')] +[2026-06-07 01:32:30,905][344387] Updated weights for policy 0, policy_version 43867 (0.0005) +[2026-06-07 01:32:32,132][344387] Updated weights for policy 0, policy_version 43877 (0.0005) +[2026-06-07 01:32:32,908][344387] Updated weights for policy 0, policy_version 43888 (0.0005) +[2026-06-07 01:32:33,872][344387] Updated weights for policy 0, policy_version 43898 (0.0005) +[2026-06-07 01:32:35,007][344387] Updated weights for policy 0, policy_version 43908 (0.0005) +[2026-06-07 01:32:35,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5393.1, 300 sec: 5317.9). Total num frames: 22480896. Throughput: 0: 5434.4. Samples: 22485220. Policy #0 lag: (min: 3.0, avg: 22.1, max: 40.0) +[2026-06-07 01:32:35,258][343476] Avg episode reward: [(0, '1677.359')] +[2026-06-07 01:32:35,869][344387] Updated weights for policy 0, policy_version 43919 (0.0005) +[2026-06-07 01:32:36,904][344387] Updated weights for policy 0, policy_version 43929 (0.0005) +[2026-06-07 01:32:38,094][344387] Updated weights for policy 0, policy_version 43940 (0.0005) +[2026-06-07 01:32:39,266][344387] Updated weights for policy 0, policy_version 43953 (0.0005) +[2026-06-07 01:32:40,091][344387] Updated weights for policy 0, policy_version 43963 (0.0005) +[2026-06-07 01:32:40,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5427.2, 300 sec: 5331.7). Total num frames: 22509568. Throughput: 0: 5416.9. Samples: 22516956. Policy #0 lag: (min: 3.0, avg: 22.1, max: 40.0) +[2026-06-07 01:32:40,258][343476] Avg episode reward: [(0, '1844.079')] +[2026-06-07 01:32:41,380][344387] Updated weights for policy 0, policy_version 43974 (0.0005) +[2026-06-07 01:32:42,289][344387] Updated weights for policy 0, policy_version 43985 (0.0005) +[2026-06-07 01:32:43,419][344387] Updated weights for policy 0, policy_version 43995 (0.0005) +[2026-06-07 01:32:44,341][344387] Updated weights for policy 0, policy_version 44006 (0.0005) +[2026-06-07 01:32:45,045][344387] Updated weights for policy 0, policy_version 44016 (0.0005) +[2026-06-07 01:32:45,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5427.2, 300 sec: 5331.7). Total num frames: 22536192. Throughput: 0: 5410.2. Samples: 22532980. Policy #0 lag: (min: 3.0, avg: 22.1, max: 40.0) +[2026-06-07 01:32:45,259][343476] Avg episode reward: [(0, '1646.342')] +[2026-06-07 01:32:46,233][344387] Updated weights for policy 0, policy_version 44026 (0.0005) +[2026-06-07 01:32:47,192][344387] Updated weights for policy 0, policy_version 44036 (0.0005) +[2026-06-07 01:32:48,033][344387] Updated weights for policy 0, policy_version 44047 (0.0005) +[2026-06-07 01:32:49,297][344387] Updated weights for policy 0, policy_version 44058 (0.0005) +[2026-06-07 01:32:50,213][344387] Updated weights for policy 0, policy_version 44068 (0.0005) +[2026-06-07 01:32:50,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5427.2, 300 sec: 5324.8). Total num frames: 22562816. Throughput: 0: 5398.2. Samples: 22565360. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:32:50,258][343476] Avg episode reward: [(0, '1799.535')] +[2026-06-07 01:32:51,140][344387] Updated weights for policy 0, policy_version 44079 (0.0005) +[2026-06-07 01:32:52,451][344387] Updated weights for policy 0, policy_version 44091 (0.0006) +[2026-06-07 01:32:52,881][344304] Signal inference workers to stop experience collection... (4750 times) +[2026-06-07 01:32:52,882][344304] Signal inference workers to resume experience collection... (4750 times) +[2026-06-07 01:32:52,906][344387] InferenceWorker_p0-w0: stopping experience collection (4750 times) +[2026-06-07 01:32:52,906][344387] InferenceWorker_p0-w0: resuming experience collection (4750 times) +[2026-06-07 01:32:53,449][344387] Updated weights for policy 0, policy_version 44101 (0.0005) +[2026-06-07 01:32:54,386][344387] Updated weights for policy 0, policy_version 44112 (0.0005) +[2026-06-07 01:32:55,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5427.2, 300 sec: 5324.8). Total num frames: 22589440. Throughput: 0: 5400.7. Samples: 22597872. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:32:55,258][343476] Avg episode reward: [(0, '1784.858')] +[2026-06-07 01:32:55,442][344387] Updated weights for policy 0, policy_version 44122 (0.0005) +[2026-06-07 01:32:56,495][344387] Updated weights for policy 0, policy_version 44133 (0.0005) +[2026-06-07 01:32:57,586][344387] Updated weights for policy 0, policy_version 44145 (0.0005) +[2026-06-07 01:32:58,509][344387] Updated weights for policy 0, policy_version 44155 (0.0005) +[2026-06-07 01:32:59,540][344387] Updated weights for policy 0, policy_version 44165 (0.0005) +[2026-06-07 01:33:00,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5393.1, 300 sec: 5317.9). Total num frames: 22616064. Throughput: 0: 5402.5. Samples: 22614168. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:33:00,258][343476] Avg episode reward: [(0, '1678.686')] +[2026-06-07 01:33:00,455][344387] Updated weights for policy 0, policy_version 44176 (0.0005) +[2026-06-07 01:33:01,377][344387] Updated weights for policy 0, policy_version 44186 (0.0005) +[2026-06-07 01:33:02,528][344387] Updated weights for policy 0, policy_version 44197 (0.0005) +[2026-06-07 01:33:03,634][344387] Updated weights for policy 0, policy_version 44209 (0.0005) +[2026-06-07 01:33:04,845][344387] Updated weights for policy 0, policy_version 44221 (0.0005) +[2026-06-07 01:33:05,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5393.1, 300 sec: 5324.8). Total num frames: 22642688. Throughput: 0: 5375.8. Samples: 22646220. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:33:05,258][343476] Avg episode reward: [(0, '1683.861')] +[2026-06-07 01:33:06,036][344387] Updated weights for policy 0, policy_version 44233 (0.0005) +[2026-06-07 01:33:06,800][344387] Updated weights for policy 0, policy_version 44243 (0.0005) +[2026-06-07 01:33:08,114][344387] Updated weights for policy 0, policy_version 44254 (0.0005) +[2026-06-07 01:33:09,257][344387] Updated weights for policy 0, policy_version 44267 (0.0006) +[2026-06-07 01:33:10,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5393.1, 300 sec: 5317.9). Total num frames: 22669312. Throughput: 0: 5356.9. Samples: 22677796. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:33:10,258][343476] Avg episode reward: [(0, '1699.196')] +[2026-06-07 01:33:10,302][344387] Updated weights for policy 0, policy_version 44277 (0.0005) +[2026-06-07 01:33:11,104][344387] Updated weights for policy 0, policy_version 44287 (0.0005) +[2026-06-07 01:33:12,310][344387] Updated weights for policy 0, policy_version 44298 (0.0005) +[2026-06-07 01:33:12,950][344387] Updated weights for policy 0, policy_version 44308 (0.0005) +[2026-06-07 01:33:14,243][344387] Updated weights for policy 0, policy_version 44318 (0.0005) +[2026-06-07 01:33:15,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5324.8). Total num frames: 22695936. Throughput: 0: 5344.2. Samples: 22693596. Policy #0 lag: (min: 4.0, avg: 21.1, max: 39.0) +[2026-06-07 01:33:15,259][343476] Avg episode reward: [(0, '1653.463')] +[2026-06-07 01:33:15,316][344387] Updated weights for policy 0, policy_version 44330 (0.0005) +[2026-06-07 01:33:16,193][344387] Updated weights for policy 0, policy_version 44340 (0.0005) +[2026-06-07 01:33:17,279][344387] Updated weights for policy 0, policy_version 44350 (0.0005) +[2026-06-07 01:33:18,507][344387] Updated weights for policy 0, policy_version 44362 (0.0005) +[2026-06-07 01:33:19,488][344387] Updated weights for policy 0, policy_version 44373 (0.0005) +[2026-06-07 01:33:20,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5359.2, 300 sec: 5324.8). Total num frames: 22722560. Throughput: 0: 5330.0. Samples: 22725070. Policy #0 lag: (min: 4.0, avg: 21.1, max: 39.0) +[2026-06-07 01:33:20,259][343476] Avg episode reward: [(0, '1544.580')] +[2026-06-07 01:33:20,467][344387] Updated weights for policy 0, policy_version 44383 (0.0005) +[2026-06-07 01:33:21,626][344387] Updated weights for policy 0, policy_version 44394 (0.0005) +[2026-06-07 01:33:22,530][344387] Updated weights for policy 0, policy_version 44405 (0.0006) +[2026-06-07 01:33:23,455][344387] Updated weights for policy 0, policy_version 44415 (0.0005) +[2026-06-07 01:33:24,703][344387] Updated weights for policy 0, policy_version 44426 (0.0005) +[2026-06-07 01:33:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5358.9, 300 sec: 5317.9). Total num frames: 22749184. Throughput: 0: 5357.2. Samples: 22758028. Policy #0 lag: (min: 4.0, avg: 21.1, max: 39.0) +[2026-06-07 01:33:25,258][343476] Avg episode reward: [(0, '1668.887')] +[2026-06-07 01:33:25,736][344387] Updated weights for policy 0, policy_version 44437 (0.0006) +[2026-06-07 01:33:26,676][344387] Updated weights for policy 0, policy_version 44447 (0.0005) +[2026-06-07 01:33:26,750][344304] Signal inference workers to stop experience collection... (4800 times) +[2026-06-07 01:33:26,769][344304] Signal inference workers to resume experience collection... (4800 times) +[2026-06-07 01:33:26,779][344387] InferenceWorker_p0-w0: stopping experience collection (4800 times) +[2026-06-07 01:33:26,796][344387] InferenceWorker_p0-w0: resuming experience collection (4800 times) +[2026-06-07 01:33:27,914][344387] Updated weights for policy 0, policy_version 44461 (0.0005) +[2026-06-07 01:33:29,089][344387] Updated weights for policy 0, policy_version 44472 (0.0005) +[2026-06-07 01:33:30,103][344387] Updated weights for policy 0, policy_version 44482 (0.0005) +[2026-06-07 01:33:30,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5324.8, 300 sec: 5324.8). Total num frames: 22775808. Throughput: 0: 5352.2. Samples: 22773828. Policy #0 lag: (min: 4.0, avg: 21.1, max: 39.0) +[2026-06-07 01:33:30,258][343476] Avg episode reward: [(0, '1684.369')] +[2026-06-07 01:33:30,717][344387] Updated weights for policy 0, policy_version 44492 (0.0006) +[2026-06-07 01:33:32,468][344387] Updated weights for policy 0, policy_version 44504 (0.0006) +[2026-06-07 01:33:33,277][344387] Updated weights for policy 0, policy_version 44514 (0.0005) +[2026-06-07 01:33:34,181][344387] Updated weights for policy 0, policy_version 44525 (0.0005) +[2026-06-07 01:33:35,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 22800384. Throughput: 0: 5318.5. Samples: 22804692. Policy #0 lag: (min: 4.0, avg: 21.1, max: 39.0) +[2026-06-07 01:33:35,258][343476] Avg episode reward: [(0, '1652.398')] +[2026-06-07 01:33:35,478][344387] Updated weights for policy 0, policy_version 44535 (0.0005) +[2026-06-07 01:33:36,417][344387] Updated weights for policy 0, policy_version 44546 (0.0005) +[2026-06-07 01:33:37,299][344387] Updated weights for policy 0, policy_version 44557 (0.0005) +[2026-06-07 01:33:38,513][344387] Updated weights for policy 0, policy_version 44567 (0.0005) +[2026-06-07 01:33:39,359][344387] Updated weights for policy 0, policy_version 44577 (0.0005) +[2026-06-07 01:33:40,155][344387] Updated weights for policy 0, policy_version 44588 (0.0005) +[2026-06-07 01:33:40,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 22829056. Throughput: 0: 5303.0. Samples: 22836506. Policy #0 lag: (min: 4.0, avg: 21.1, max: 39.0) +[2026-06-07 01:33:40,258][343476] Avg episode reward: [(0, '1824.840')] +[2026-06-07 01:33:41,466][344387] Updated weights for policy 0, policy_version 44598 (0.0005) +[2026-06-07 01:33:42,269][344387] Updated weights for policy 0, policy_version 44608 (0.0005) +[2026-06-07 01:33:43,337][344387] Updated weights for policy 0, policy_version 44619 (0.0005) +[2026-06-07 01:33:44,475][344387] Updated weights for policy 0, policy_version 44629 (0.0005) +[2026-06-07 01:33:45,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5310.9). Total num frames: 22853632. Throughput: 0: 5291.0. Samples: 22852264. Policy #0 lag: (min: 7.0, avg: 21.6, max: 39.0) +[2026-06-07 01:33:45,259][343476] Avg episode reward: [(0, '1864.121')] +[2026-06-07 01:33:45,407][344387] Updated weights for policy 0, policy_version 44639 (0.0005) +[2026-06-07 01:33:46,214][344387] Updated weights for policy 0, policy_version 44649 (0.0005) +[2026-06-07 01:33:47,557][344387] Updated weights for policy 0, policy_version 44661 (0.0005) +[2026-06-07 01:33:48,615][344387] Updated weights for policy 0, policy_version 44672 (0.0005) +[2026-06-07 01:33:49,467][344387] Updated weights for policy 0, policy_version 44684 (0.0006) +[2026-06-07 01:33:50,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 22882304. Throughput: 0: 5292.4. Samples: 22884378. Policy #0 lag: (min: 7.0, avg: 21.6, max: 39.0) +[2026-06-07 01:33:50,258][343476] Avg episode reward: [(0, '1672.629')] +[2026-06-07 01:33:50,727][344387] Updated weights for policy 0, policy_version 44694 (0.0005) +[2026-06-07 01:33:51,967][344387] Updated weights for policy 0, policy_version 44705 (0.0005) +[2026-06-07 01:33:52,820][344387] Updated weights for policy 0, policy_version 44717 (0.0005) +[2026-06-07 01:33:53,061][344304] Signal inference workers to stop experience collection... (4850 times) +[2026-06-07 01:33:53,061][344304] Signal inference workers to resume experience collection... (4850 times) +[2026-06-07 01:33:53,083][344387] InferenceWorker_p0-w0: stopping experience collection (4850 times) +[2026-06-07 01:33:53,083][344387] InferenceWorker_p0-w0: resuming experience collection (4850 times) +[2026-06-07 01:33:53,826][344387] Updated weights for policy 0, policy_version 44727 (0.0005) +[2026-06-07 01:33:55,045][344387] Updated weights for policy 0, policy_version 44739 (0.0005) +[2026-06-07 01:33:55,258][343476] Fps is (10 sec: 5324.5, 60 sec: 5290.6, 300 sec: 5304.0). Total num frames: 22906880. Throughput: 0: 5293.7. Samples: 22916018. Policy #0 lag: (min: 7.0, avg: 21.6, max: 39.0) +[2026-06-07 01:33:55,265][343476] Avg episode reward: [(0, '1749.150')] +[2026-06-07 01:33:56,079][344387] Updated weights for policy 0, policy_version 44752 (0.0005) +[2026-06-07 01:33:57,382][344387] Updated weights for policy 0, policy_version 44762 (0.0005) +[2026-06-07 01:33:58,150][344387] Updated weights for policy 0, policy_version 44772 (0.0005) +[2026-06-07 01:33:59,193][344387] Updated weights for policy 0, policy_version 44784 (0.0005) +[2026-06-07 01:34:00,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5290.6, 300 sec: 5304.0). Total num frames: 22933504. Throughput: 0: 5288.9. Samples: 22931596. Policy #0 lag: (min: 7.0, avg: 21.6, max: 39.0) +[2026-06-07 01:34:00,260][343476] Avg episode reward: [(0, '1683.762')] +[2026-06-07 01:34:00,427][344387] Updated weights for policy 0, policy_version 44794 (0.0005) +[2026-06-07 01:34:01,586][344387] Updated weights for policy 0, policy_version 44805 (0.0005) +[2026-06-07 01:34:02,266][344387] Updated weights for policy 0, policy_version 44816 (0.0005) +[2026-06-07 01:34:03,631][344387] Updated weights for policy 0, policy_version 44826 (0.0005) +[2026-06-07 01:34:04,808][344387] Updated weights for policy 0, policy_version 44837 (0.0005) +[2026-06-07 01:34:05,258][343476] Fps is (10 sec: 5324.7, 60 sec: 5290.6, 300 sec: 5310.9). Total num frames: 22960128. Throughput: 0: 5292.6. Samples: 22963240. Policy #0 lag: (min: 7.0, avg: 21.6, max: 39.0) +[2026-06-07 01:34:05,260][343476] Avg episode reward: [(0, '1643.607')] +[2026-06-07 01:34:05,649][344387] Updated weights for policy 0, policy_version 44849 (0.0005) +[2026-06-07 01:34:06,660][344387] Updated weights for policy 0, policy_version 44859 (0.0005) +[2026-06-07 01:34:07,814][344387] Updated weights for policy 0, policy_version 44869 (0.0005) +[2026-06-07 01:34:08,698][344387] Updated weights for policy 0, policy_version 44882 (0.0005) +[2026-06-07 01:34:09,706][344387] Updated weights for policy 0, policy_version 44892 (0.0005) +[2026-06-07 01:34:10,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5290.7, 300 sec: 5310.9). Total num frames: 22986752. Throughput: 0: 5274.8. Samples: 22995396. Policy #0 lag: (min: 7.0, avg: 21.6, max: 39.0) +[2026-06-07 01:34:10,258][343476] Avg episode reward: [(0, '1947.813')] +[2026-06-07 01:34:10,306][344304] Saving new best policy, reward=1947.813! +[2026-06-07 01:34:11,219][344387] Updated weights for policy 0, policy_version 44905 (0.0005) +[2026-06-07 01:34:12,107][344387] Updated weights for policy 0, policy_version 44918 (0.0006) +[2026-06-07 01:34:13,555][344387] Updated weights for policy 0, policy_version 44930 (0.0005) +[2026-06-07 01:34:14,692][344387] Updated weights for policy 0, policy_version 44942 (0.0005) +[2026-06-07 01:34:15,257][343476] Fps is (10 sec: 5325.1, 60 sec: 5290.6, 300 sec: 5310.9). Total num frames: 23013376. Throughput: 0: 5261.3. Samples: 23010590. Policy #0 lag: (min: 1.0, avg: 18.5, max: 40.0) +[2026-06-07 01:34:15,259][343476] Avg episode reward: [(0, '1737.319')] +[2026-06-07 01:34:16,021][344387] Updated weights for policy 0, policy_version 44953 (0.0005) +[2026-06-07 01:34:16,853][344387] Updated weights for policy 0, policy_version 44964 (0.0006) +[2026-06-07 01:34:17,961][344387] Updated weights for policy 0, policy_version 44976 (0.0006) +[2026-06-07 01:34:19,127][344387] Updated weights for policy 0, policy_version 44986 (0.0005) +[2026-06-07 01:34:20,142][344387] Updated weights for policy 0, policy_version 44997 (0.0006) +[2026-06-07 01:34:20,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5310.9). Total num frames: 23040000. Throughput: 0: 5270.0. Samples: 23041840. Policy #0 lag: (min: 1.0, avg: 18.5, max: 40.0) +[2026-06-07 01:34:20,258][343476] Avg episode reward: [(0, '1792.466')] +[2026-06-07 01:34:21,046][344387] Updated weights for policy 0, policy_version 45008 (0.0005) +[2026-06-07 01:34:21,420][344304] Signal inference workers to stop experience collection... (4900 times) +[2026-06-07 01:34:21,421][344304] Signal inference workers to resume experience collection... (4900 times) +[2026-06-07 01:34:21,445][344387] InferenceWorker_p0-w0: stopping experience collection (4900 times) +[2026-06-07 01:34:21,445][344387] InferenceWorker_p0-w0: resuming experience collection (4900 times) +[2026-06-07 01:34:22,180][344387] Updated weights for policy 0, policy_version 45018 (0.0005) +[2026-06-07 01:34:23,046][344387] Updated weights for policy 0, policy_version 45028 (0.0005) +[2026-06-07 01:34:24,014][344387] Updated weights for policy 0, policy_version 45040 (0.0005) +[2026-06-07 01:34:25,167][344387] Updated weights for policy 0, policy_version 45050 (0.0005) +[2026-06-07 01:34:25,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5256.5, 300 sec: 5304.0). Total num frames: 23064576. Throughput: 0: 5279.0. Samples: 23074060. Policy #0 lag: (min: 1.0, avg: 18.5, max: 40.0) +[2026-06-07 01:34:25,259][343476] Avg episode reward: [(0, '1801.094')] +[2026-06-07 01:34:26,220][344387] Updated weights for policy 0, policy_version 45061 (0.0005) +[2026-06-07 01:34:27,112][344387] Updated weights for policy 0, policy_version 45071 (0.0005) +[2026-06-07 01:34:28,062][344387] Updated weights for policy 0, policy_version 45081 (0.0005) +[2026-06-07 01:34:28,991][344387] Updated weights for policy 0, policy_version 45091 (0.0005) +[2026-06-07 01:34:29,821][344387] Updated weights for policy 0, policy_version 45101 (0.0005) +[2026-06-07 01:34:30,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5324.8, 300 sec: 5317.9). Total num frames: 23095296. Throughput: 0: 5293.6. Samples: 23090476. Policy #0 lag: (min: 1.0, avg: 18.5, max: 40.0) +[2026-06-07 01:34:30,258][343476] Avg episode reward: [(0, '1858.893')] +[2026-06-07 01:34:30,592][344387] Updated weights for policy 0, policy_version 45112 (0.0005) +[2026-06-07 01:34:31,933][344387] Updated weights for policy 0, policy_version 45122 (0.0005) +[2026-06-07 01:34:32,788][344387] Updated weights for policy 0, policy_version 45132 (0.0006) +[2026-06-07 01:34:33,614][344387] Updated weights for policy 0, policy_version 45142 (0.0005) +[2026-06-07 01:34:34,607][344387] Updated weights for policy 0, policy_version 45152 (0.0005) +[2026-06-07 01:34:35,257][343476] Fps is (10 sec: 5529.7, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 23119872. Throughput: 0: 5306.8. Samples: 23123186. Policy #0 lag: (min: 1.0, avg: 18.5, max: 40.0) +[2026-06-07 01:34:35,258][343476] Avg episode reward: [(0, '1505.039')] +[2026-06-07 01:34:35,717][344387] Updated weights for policy 0, policy_version 45162 (0.0005) +[2026-06-07 01:34:36,549][344387] Updated weights for policy 0, policy_version 45173 (0.0005) +[2026-06-07 01:34:37,559][344387] Updated weights for policy 0, policy_version 45183 (0.0005) +[2026-06-07 01:34:38,552][344387] Updated weights for policy 0, policy_version 45194 (0.0006) +[2026-06-07 01:34:39,353][344387] Updated weights for policy 0, policy_version 45204 (0.0006) +[2026-06-07 01:34:40,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5290.6, 300 sec: 5310.9). Total num frames: 23146496. Throughput: 0: 5330.2. Samples: 23155874. Policy #0 lag: (min: 6.0, avg: 24.4, max: 42.0) +[2026-06-07 01:34:40,261][343476] Avg episode reward: [(0, '1621.579')] +[2026-06-07 01:34:40,537][344387] Updated weights for policy 0, policy_version 45214 (0.0005) +[2026-06-07 01:34:41,425][344387] Updated weights for policy 0, policy_version 45224 (0.0005) +[2026-06-07 01:34:42,256][344387] Updated weights for policy 0, policy_version 45236 (0.0005) +[2026-06-07 01:34:43,626][344387] Updated weights for policy 0, policy_version 45248 (0.0005) +[2026-06-07 01:34:44,881][344387] Updated weights for policy 0, policy_version 45258 (0.0005) +[2026-06-07 01:34:45,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 23173120. Throughput: 0: 5345.8. Samples: 23172156. Policy #0 lag: (min: 6.0, avg: 24.4, max: 42.0) +[2026-06-07 01:34:45,258][343476] Avg episode reward: [(0, '1774.971')] +[2026-06-07 01:34:45,793][344387] Updated weights for policy 0, policy_version 45269 (0.0005) +[2026-06-07 01:34:46,870][344387] Updated weights for policy 0, policy_version 45279 (0.0005) +[2026-06-07 01:34:47,889][344387] Updated weights for policy 0, policy_version 45289 (0.0005) +[2026-06-07 01:34:48,926][344387] Updated weights for policy 0, policy_version 45302 (0.0006) +[2026-06-07 01:34:49,911][344387] Updated weights for policy 0, policy_version 45312 (0.0005) +[2026-06-07 01:34:50,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.6, 300 sec: 5310.9). Total num frames: 23199744. Throughput: 0: 5338.7. Samples: 23203476. Policy #0 lag: (min: 6.0, avg: 24.4, max: 42.0) +[2026-06-07 01:34:50,259][343476] Avg episode reward: [(0, '1714.383')] +[2026-06-07 01:34:51,103][344387] Updated weights for policy 0, policy_version 45323 (0.0005) +[2026-06-07 01:34:52,039][344387] Updated weights for policy 0, policy_version 45334 (0.0005) +[2026-06-07 01:34:53,068][344387] Updated weights for policy 0, policy_version 45344 (0.0005) +[2026-06-07 01:34:53,545][344304] Signal inference workers to stop experience collection... (4950 times) +[2026-06-07 01:34:53,546][344304] Signal inference workers to resume experience collection... (4950 times) +[2026-06-07 01:34:53,568][344387] InferenceWorker_p0-w0: stopping experience collection (4950 times) +[2026-06-07 01:34:53,568][344387] InferenceWorker_p0-w0: resuming experience collection (4950 times) +[2026-06-07 01:34:54,095][344387] Updated weights for policy 0, policy_version 45354 (0.0005) +[2026-06-07 01:34:55,096][344387] Updated weights for policy 0, policy_version 45367 (0.0005) +[2026-06-07 01:34:55,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5359.0, 300 sec: 5317.9). Total num frames: 23228416. Throughput: 0: 5330.3. Samples: 23235260. Policy #0 lag: (min: 6.0, avg: 24.4, max: 42.0) +[2026-06-07 01:34:55,258][343476] Avg episode reward: [(0, '1875.258')] +[2026-06-07 01:34:56,308][344387] Updated weights for policy 0, policy_version 45377 (0.0005) +[2026-06-07 01:34:57,179][344387] Updated weights for policy 0, policy_version 45387 (0.0005) +[2026-06-07 01:34:58,076][344387] Updated weights for policy 0, policy_version 45398 (0.0005) +[2026-06-07 01:34:59,013][344387] Updated weights for policy 0, policy_version 45408 (0.0005) +[2026-06-07 01:35:00,203][344387] Updated weights for policy 0, policy_version 45418 (0.0005) +[2026-06-07 01:35:00,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 23252992. Throughput: 0: 5355.5. Samples: 23251584. Policy #0 lag: (min: 6.0, avg: 24.4, max: 42.0) +[2026-06-07 01:35:00,258][343476] Avg episode reward: [(0, '1758.486')] +[2026-06-07 01:35:01,021][344387] Updated weights for policy 0, policy_version 45429 (0.0006) +[2026-06-07 01:35:01,950][344387] Updated weights for policy 0, policy_version 45439 (0.0005) +[2026-06-07 01:35:03,231][344387] Updated weights for policy 0, policy_version 45449 (0.0005) +[2026-06-07 01:35:04,244][344387] Updated weights for policy 0, policy_version 45461 (0.0006) +[2026-06-07 01:35:05,144][344387] Updated weights for policy 0, policy_version 45471 (0.0005) +[2026-06-07 01:35:05,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5359.0, 300 sec: 5317.9). Total num frames: 23281664. Throughput: 0: 5369.2. Samples: 23283452. Policy #0 lag: (min: 6.0, avg: 24.4, max: 42.0) +[2026-06-07 01:35:05,258][343476] Avg episode reward: [(0, '1684.865')] +[2026-06-07 01:35:06,435][344387] Updated weights for policy 0, policy_version 45481 (0.0005) +[2026-06-07 01:35:07,107][344387] Updated weights for policy 0, policy_version 45492 (0.0005) +[2026-06-07 01:35:08,206][344387] Updated weights for policy 0, policy_version 45502 (0.0005) +[2026-06-07 01:35:09,498][344387] Updated weights for policy 0, policy_version 45513 (0.0005) +[2026-06-07 01:35:10,257][343476] Fps is (10 sec: 5324.6, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 23306240. Throughput: 0: 5351.8. Samples: 23314892. Policy #0 lag: (min: 4.0, avg: 23.1, max: 42.0) +[2026-06-07 01:35:10,259][343476] Avg episode reward: [(0, '1837.310')] +[2026-06-07 01:35:10,327][344387] Updated weights for policy 0, policy_version 45523 (0.0005) +[2026-06-07 01:35:11,364][344387] Updated weights for policy 0, policy_version 45533 (0.0005) +[2026-06-07 01:35:12,432][344387] Updated weights for policy 0, policy_version 45544 (0.0005) +[2026-06-07 01:35:13,401][344387] Updated weights for policy 0, policy_version 45555 (0.0005) +[2026-06-07 01:35:14,459][344387] Updated weights for policy 0, policy_version 45565 (0.0005) +[2026-06-07 01:35:15,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 23330816. Throughput: 0: 5335.0. Samples: 23330552. Policy #0 lag: (min: 4.0, avg: 23.1, max: 42.0) +[2026-06-07 01:35:15,258][343476] Avg episode reward: [(0, '1806.854')] +[2026-06-07 01:35:15,685][344387] Updated weights for policy 0, policy_version 45576 (0.0005) +[2026-06-07 01:35:16,553][344387] Updated weights for policy 0, policy_version 45586 (0.0005) +[2026-06-07 01:35:17,443][344387] Updated weights for policy 0, policy_version 45596 (0.0005) +[2026-06-07 01:35:18,775][344387] Updated weights for policy 0, policy_version 45608 (0.0005) +[2026-06-07 01:35:19,821][344387] Updated weights for policy 0, policy_version 45620 (0.0005) +[2026-06-07 01:35:20,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5324.8, 300 sec: 5310.9). Total num frames: 23359488. Throughput: 0: 5309.1. Samples: 23362098. Policy #0 lag: (min: 4.0, avg: 23.1, max: 42.0) +[2026-06-07 01:35:20,258][343476] Avg episode reward: [(0, '1738.873')] +[2026-06-07 01:35:20,807][344387] Updated weights for policy 0, policy_version 45630 (0.0005) +[2026-06-07 01:35:21,923][344387] Updated weights for policy 0, policy_version 45640 (0.0005) +[2026-06-07 01:35:22,705][344387] Updated weights for policy 0, policy_version 45652 (0.0005) +[2026-06-07 01:35:23,936][344387] Updated weights for policy 0, policy_version 45662 (0.0005) +[2026-06-07 01:35:24,987][344304] Signal inference workers to stop experience collection... (5000 times) +[2026-06-07 01:35:25,003][344387] InferenceWorker_p0-w0: stopping experience collection (5000 times) +[2026-06-07 01:35:25,019][344304] Signal inference workers to resume experience collection... (5000 times) +[2026-06-07 01:35:25,019][344387] InferenceWorker_p0-w0: resuming experience collection (5000 times) +[2026-06-07 01:35:25,201][344387] Updated weights for policy 0, policy_version 45673 (0.0005) +[2026-06-07 01:35:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5324.8, 300 sec: 5304.0). Total num frames: 23384064. Throughput: 0: 5285.3. Samples: 23393712. Policy #0 lag: (min: 4.0, avg: 23.1, max: 42.0) +[2026-06-07 01:35:25,258][343476] Avg episode reward: [(0, '1727.689')] +[2026-06-07 01:35:26,242][344387] Updated weights for policy 0, policy_version 45685 (0.0005) +[2026-06-07 01:35:27,170][344387] Updated weights for policy 0, policy_version 45695 (0.0005) +[2026-06-07 01:35:28,371][344387] Updated weights for policy 0, policy_version 45708 (0.0006) +[2026-06-07 01:35:29,568][344387] Updated weights for policy 0, policy_version 45718 (0.0005) +[2026-06-07 01:35:30,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5256.5, 300 sec: 5304.0). Total num frames: 23410688. Throughput: 0: 5281.1. Samples: 23409804. Policy #0 lag: (min: 4.0, avg: 23.1, max: 42.0) +[2026-06-07 01:35:30,258][343476] Avg episode reward: [(0, '1728.440')] +[2026-06-07 01:35:30,839][344387] Updated weights for policy 0, policy_version 45729 (0.0005) +[2026-06-07 01:35:31,713][344387] Updated weights for policy 0, policy_version 45741 (0.0005) +[2026-06-07 01:35:32,693][344387] Updated weights for policy 0, policy_version 45752 (0.0006) +[2026-06-07 01:35:34,093][344387] Updated weights for policy 0, policy_version 45764 (0.0005) +[2026-06-07 01:35:35,160][344387] Updated weights for policy 0, policy_version 45776 (0.0005) +[2026-06-07 01:35:35,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 23437312. Throughput: 0: 5271.8. Samples: 23440706. Policy #0 lag: (min: 4.0, avg: 23.1, max: 42.0) +[2026-06-07 01:35:35,258][343476] Avg episode reward: [(0, '1814.852')] +[2026-06-07 01:35:36,051][344387] Updated weights for policy 0, policy_version 45786 (0.0005) +[2026-06-07 01:35:37,528][344387] Updated weights for policy 0, policy_version 45798 (0.0005) +[2026-06-07 01:35:38,406][344387] Updated weights for policy 0, policy_version 45810 (0.0005) +[2026-06-07 01:35:39,336][344387] Updated weights for policy 0, policy_version 45820 (0.0005) +[2026-06-07 01:35:40,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5256.6, 300 sec: 5304.0). Total num frames: 23461888. Throughput: 0: 5258.0. Samples: 23471872. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:35:40,258][343476] Avg episode reward: [(0, '1732.657')] +[2026-06-07 01:35:40,473][344387] Updated weights for policy 0, policy_version 45831 (0.0005) +[2026-06-07 01:35:41,469][344387] Updated weights for policy 0, policy_version 45842 (0.0006) +[2026-06-07 01:35:42,916][344387] Updated weights for policy 0, policy_version 45853 (0.0006) +[2026-06-07 01:35:43,940][344387] Updated weights for policy 0, policy_version 45865 (0.0005) +[2026-06-07 01:35:44,741][344387] Updated weights for policy 0, policy_version 45876 (0.0005) +[2026-06-07 01:35:45,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5304.0). Total num frames: 23490560. Throughput: 0: 5237.2. Samples: 23487256. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:35:45,259][343476] Avg episode reward: [(0, '1692.915')] +[2026-06-07 01:35:46,040][344387] Updated weights for policy 0, policy_version 45886 (0.0005) +[2026-06-07 01:35:47,033][344387] Updated weights for policy 0, policy_version 45897 (0.0005) +[2026-06-07 01:35:47,695][344387] Updated weights for policy 0, policy_version 45907 (0.0005) +[2026-06-07 01:35:48,988][344387] Updated weights for policy 0, policy_version 45917 (0.0005) +[2026-06-07 01:35:49,930][344387] Updated weights for policy 0, policy_version 45929 (0.0005) +[2026-06-07 01:35:50,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5290.7, 300 sec: 5317.9). Total num frames: 23517184. Throughput: 0: 5261.0. Samples: 23520198. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:35:50,258][343476] Avg episode reward: [(0, '1795.556')] +[2026-06-07 01:35:50,714][344387] Updated weights for policy 0, policy_version 45940 (0.0005) +[2026-06-07 01:35:52,066][344387] Updated weights for policy 0, policy_version 45950 (0.0005) +[2026-06-07 01:35:52,873][344387] Updated weights for policy 0, policy_version 45961 (0.0005) +[2026-06-07 01:35:53,677][344387] Updated weights for policy 0, policy_version 45971 (0.0005) +[2026-06-07 01:35:54,951][344387] Updated weights for policy 0, policy_version 45981 (0.0005) +[2026-06-07 01:35:55,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5256.5, 300 sec: 5310.9). Total num frames: 23543808. Throughput: 0: 5297.3. Samples: 23553268. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:35:55,258][343476] Avg episode reward: [(0, '1696.895')] +[2026-06-07 01:35:55,647][344387] Updated weights for policy 0, policy_version 45991 (0.0005) +[2026-06-07 01:35:56,445][344304] Signal inference workers to stop experience collection... (5050 times) +[2026-06-07 01:35:56,445][344304] Signal inference workers to resume experience collection... (5050 times) +[2026-06-07 01:35:56,465][344387] InferenceWorker_p0-w0: stopping experience collection (5050 times) +[2026-06-07 01:35:56,465][344387] InferenceWorker_p0-w0: resuming experience collection (5050 times) +[2026-06-07 01:35:56,575][344387] Updated weights for policy 0, policy_version 46001 (0.0005) +[2026-06-07 01:35:57,440][344387] Updated weights for policy 0, policy_version 46011 (0.0005) +[2026-06-07 01:35:58,441][344387] Updated weights for policy 0, policy_version 46022 (0.0005) +[2026-06-07 01:35:59,313][344387] Updated weights for policy 0, policy_version 46032 (0.0005) +[2026-06-07 01:36:00,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5290.7, 300 sec: 5324.8). Total num frames: 23570432. Throughput: 0: 5318.4. Samples: 23569880. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:36:00,258][343476] Avg episode reward: [(0, '1706.559')] +[2026-06-07 01:36:00,475][344387] Updated weights for policy 0, policy_version 46042 (0.0005) +[2026-06-07 01:36:01,709][344387] Updated weights for policy 0, policy_version 46055 (0.0006) +[2026-06-07 01:36:02,704][344387] Updated weights for policy 0, policy_version 46065 (0.0005) +[2026-06-07 01:36:03,569][344387] Updated weights for policy 0, policy_version 46075 (0.0006) +[2026-06-07 01:36:04,706][344387] Updated weights for policy 0, policy_version 46087 (0.0006) +[2026-06-07 01:36:05,257][343476] Fps is (10 sec: 5529.5, 60 sec: 5290.7, 300 sec: 5331.7). Total num frames: 23599104. Throughput: 0: 5325.6. Samples: 23601750. Policy #0 lag: (min: 3.0, avg: 18.6, max: 35.0) +[2026-06-07 01:36:05,259][343476] Avg episode reward: [(0, '1707.506')] +[2026-06-07 01:36:05,829][344387] Updated weights for policy 0, policy_version 46097 (0.0006) +[2026-06-07 01:36:06,809][344387] Updated weights for policy 0, policy_version 46107 (0.0005) +[2026-06-07 01:36:07,992][344387] Updated weights for policy 0, policy_version 46118 (0.0006) +[2026-06-07 01:36:09,065][344387] Updated weights for policy 0, policy_version 46129 (0.0006) +[2026-06-07 01:36:10,232][344387] Updated weights for policy 0, policy_version 46139 (0.0005) +[2026-06-07 01:36:10,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5256.6, 300 sec: 5324.8). Total num frames: 23621632. Throughput: 0: 5304.1. Samples: 23632396. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:36:10,258][343476] Avg episode reward: [(0, '1742.532')] +[2026-06-07 01:36:11,387][344387] Updated weights for policy 0, policy_version 46153 (0.0005) +[2026-06-07 01:36:12,456][344387] Updated weights for policy 0, policy_version 46163 (0.0005) +[2026-06-07 01:36:14,027][344387] Updated weights for policy 0, policy_version 46176 (0.0006) +[2026-06-07 01:36:14,884][344387] Updated weights for policy 0, policy_version 46187 (0.0005) +[2026-06-07 01:36:15,257][343476] Fps is (10 sec: 4915.3, 60 sec: 5290.7, 300 sec: 5324.8). Total num frames: 23648256. Throughput: 0: 5272.0. Samples: 23647044. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:36:15,258][343476] Avg episode reward: [(0, '1732.608')] +[2026-06-07 01:36:16,105][344387] Updated weights for policy 0, policy_version 46197 (0.0005) +[2026-06-07 01:36:17,429][344387] Updated weights for policy 0, policy_version 46209 (0.0005) +[2026-06-07 01:36:18,396][344387] Updated weights for policy 0, policy_version 46221 (0.0005) +[2026-06-07 01:36:19,550][344387] Updated weights for policy 0, policy_version 46231 (0.0005) +[2026-06-07 01:36:20,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5222.4, 300 sec: 5317.9). Total num frames: 23672832. Throughput: 0: 5254.0. Samples: 23677138. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:36:20,258][343476] Avg episode reward: [(0, '1731.747')] +[2026-06-07 01:36:20,968][344387] Updated weights for policy 0, policy_version 46245 (0.0006) +[2026-06-07 01:36:21,733][344387] Updated weights for policy 0, policy_version 46255 (0.0005) +[2026-06-07 01:36:23,286][344387] Updated weights for policy 0, policy_version 46265 (0.0005) +[2026-06-07 01:36:24,160][344387] Updated weights for policy 0, policy_version 46278 (0.0005) +[2026-06-07 01:36:24,950][344387] Updated weights for policy 0, policy_version 46288 (0.0005) +[2026-06-07 01:36:25,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5256.5, 300 sec: 5324.8). Total num frames: 23699456. Throughput: 0: 5232.4. Samples: 23707332. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:36:25,258][343476] Avg episode reward: [(0, '1716.202')] +[2026-06-07 01:36:26,622][344387] Updated weights for policy 0, policy_version 46298 (0.0005) +[2026-06-07 01:36:27,468][344387] Updated weights for policy 0, policy_version 46311 (0.0006) +[2026-06-07 01:36:28,502][344387] Updated weights for policy 0, policy_version 46321 (0.0005) +[2026-06-07 01:36:29,854][344387] Updated weights for policy 0, policy_version 46331 (0.0005) +[2026-06-07 01:36:30,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5222.4, 300 sec: 5310.9). Total num frames: 23724032. Throughput: 0: 5216.8. Samples: 23722012. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:36:30,258][343476] Avg episode reward: [(0, '1698.143')] +[2026-06-07 01:36:30,735][344304] Signal inference workers to stop experience collection... (5100 times) +[2026-06-07 01:36:30,750][344387] InferenceWorker_p0-w0: stopping experience collection (5100 times) +[2026-06-07 01:36:30,751][344387] Updated weights for policy 0, policy_version 46342 (0.0006) +[2026-06-07 01:36:30,815][344304] Signal inference workers to resume experience collection... (5100 times) +[2026-06-07 01:36:30,815][344387] InferenceWorker_p0-w0: resuming experience collection (5100 times) +[2026-06-07 01:36:31,777][344387] Updated weights for policy 0, policy_version 46353 (0.0005) +[2026-06-07 01:36:33,120][344387] Updated weights for policy 0, policy_version 46364 (0.0006) +[2026-06-07 01:36:33,951][344387] Updated weights for policy 0, policy_version 46374 (0.0005) +[2026-06-07 01:36:34,902][344387] Updated weights for policy 0, policy_version 46385 (0.0005) +[2026-06-07 01:36:35,257][343476] Fps is (10 sec: 5119.8, 60 sec: 5222.4, 300 sec: 5310.9). Total num frames: 23750656. Throughput: 0: 5180.7. Samples: 23753332. Policy #0 lag: (min: 1.0, avg: 19.3, max: 37.0) +[2026-06-07 01:36:35,260][343476] Avg episode reward: [(0, '1702.534')] +[2026-06-07 01:36:36,191][344387] Updated weights for policy 0, policy_version 46396 (0.0005) +[2026-06-07 01:36:37,142][344387] Updated weights for policy 0, policy_version 46406 (0.0005) +[2026-06-07 01:36:38,003][344387] Updated weights for policy 0, policy_version 46417 (0.0006) +[2026-06-07 01:36:39,279][344387] Updated weights for policy 0, policy_version 46427 (0.0005) +[2026-06-07 01:36:40,111][344387] Updated weights for policy 0, policy_version 46438 (0.0005) +[2026-06-07 01:36:40,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5256.5, 300 sec: 5310.9). Total num frames: 23777280. Throughput: 0: 5148.1. Samples: 23784932. Policy #0 lag: (min: 6.0, avg: 23.6, max: 38.0) +[2026-06-07 01:36:40,258][343476] Avg episode reward: [(0, '1720.532')] +[2026-06-07 01:36:41,126][344387] Updated weights for policy 0, policy_version 46449 (0.0005) +[2026-06-07 01:36:42,520][344387] Updated weights for policy 0, policy_version 46461 (0.0005) +[2026-06-07 01:36:43,505][344387] Updated weights for policy 0, policy_version 46471 (0.0005) +[2026-06-07 01:36:44,413][344387] Updated weights for policy 0, policy_version 46481 (0.0005) +[2026-06-07 01:36:45,257][343476] Fps is (10 sec: 5120.2, 60 sec: 5188.3, 300 sec: 5304.0). Total num frames: 23801856. Throughput: 0: 5119.2. Samples: 23800242. Policy #0 lag: (min: 6.0, avg: 23.6, max: 38.0) +[2026-06-07 01:36:45,259][343476] Avg episode reward: [(0, '1766.309')] +[2026-06-07 01:36:45,801][344387] Updated weights for policy 0, policy_version 46491 (0.0006) +[2026-06-07 01:36:46,747][344387] Updated weights for policy 0, policy_version 46501 (0.0005) +[2026-06-07 01:36:47,427][344387] Updated weights for policy 0, policy_version 46512 (0.0005) +[2026-06-07 01:36:48,773][344387] Updated weights for policy 0, policy_version 46522 (0.0005) +[2026-06-07 01:36:49,873][344387] Updated weights for policy 0, policy_version 46534 (0.0005) +[2026-06-07 01:36:50,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5188.3, 300 sec: 5304.0). Total num frames: 23828480. Throughput: 0: 5094.8. Samples: 23831014. Policy #0 lag: (min: 6.0, avg: 23.6, max: 38.0) +[2026-06-07 01:36:50,259][343476] Avg episode reward: [(0, '1708.225')] +[2026-06-07 01:36:50,897][344387] Updated weights for policy 0, policy_version 46546 (0.0005) +[2026-06-07 01:36:52,169][344387] Updated weights for policy 0, policy_version 46557 (0.0005) +[2026-06-07 01:36:52,982][344387] Updated weights for policy 0, policy_version 46568 (0.0005) +[2026-06-07 01:36:54,058][344387] Updated weights for policy 0, policy_version 46579 (0.0005) +[2026-06-07 01:36:55,125][344387] Updated weights for policy 0, policy_version 46589 (0.0005) +[2026-06-07 01:36:55,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5154.1, 300 sec: 5290.1). Total num frames: 23853056. Throughput: 0: 5112.4. Samples: 23862454. Policy #0 lag: (min: 6.0, avg: 23.6, max: 38.0) +[2026-06-07 01:36:55,258][343476] Avg episode reward: [(0, '1718.552')] +[2026-06-07 01:36:56,139][344387] Updated weights for policy 0, policy_version 46599 (0.0005) +[2026-06-07 01:36:57,008][344387] Updated weights for policy 0, policy_version 46611 (0.0006) +[2026-06-07 01:36:58,149][344387] Updated weights for policy 0, policy_version 46621 (0.0006) +[2026-06-07 01:36:58,957][344387] Updated weights for policy 0, policy_version 46631 (0.0005) +[2026-06-07 01:37:00,082][344387] Updated weights for policy 0, policy_version 46642 (0.0005) +[2026-06-07 01:37:00,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5188.3, 300 sec: 5297.0). Total num frames: 23881728. Throughput: 0: 5140.5. Samples: 23878366. Policy #0 lag: (min: 6.0, avg: 23.6, max: 38.0) +[2026-06-07 01:37:00,258][343476] Avg episode reward: [(0, '1798.677')] +[2026-06-07 01:37:00,811][344387] Updated weights for policy 0, policy_version 46652 (0.0005) +[2026-06-07 01:37:01,406][344304] Signal inference workers to stop experience collection... (5150 times) +[2026-06-07 01:37:01,407][344304] Signal inference workers to resume experience collection... (5150 times) +[2026-06-07 01:37:01,433][344387] InferenceWorker_p0-w0: stopping experience collection (5150 times) +[2026-06-07 01:37:01,433][344387] InferenceWorker_p0-w0: resuming experience collection (5150 times) +[2026-06-07 01:37:01,945][344387] Updated weights for policy 0, policy_version 46662 (0.0005) +[2026-06-07 01:37:03,184][344387] Updated weights for policy 0, policy_version 46673 (0.0005) +[2026-06-07 01:37:04,150][344387] Updated weights for policy 0, policy_version 46684 (0.0005) +[2026-06-07 01:37:05,039][344387] Updated weights for policy 0, policy_version 46696 (0.0005) +[2026-06-07 01:37:05,257][343476] Fps is (10 sec: 5529.6, 60 sec: 5154.2, 300 sec: 5297.0). Total num frames: 23908352. Throughput: 0: 5195.3. Samples: 23910928. Policy #0 lag: (min: 6.0, avg: 23.6, max: 38.0) +[2026-06-07 01:37:05,258][343476] Avg episode reward: [(0, '1793.847')] +[2026-06-07 01:37:06,635][344387] Updated weights for policy 0, policy_version 46709 (0.0005) +[2026-06-07 01:37:07,459][344387] Updated weights for policy 0, policy_version 46719 (0.0005) +[2026-06-07 01:37:08,514][344387] Updated weights for policy 0, policy_version 46729 (0.0005) +[2026-06-07 01:37:09,727][344387] Updated weights for policy 0, policy_version 46740 (0.0005) +[2026-06-07 01:37:10,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5188.3, 300 sec: 5283.1). Total num frames: 23932928. Throughput: 0: 5233.1. Samples: 23942822. Policy #0 lag: (min: 3.0, avg: 22.4, max: 38.0) +[2026-06-07 01:37:10,258][343476] Avg episode reward: [(0, '1527.087')] +[2026-06-07 01:37:10,563][344387] Updated weights for policy 0, policy_version 46750 (0.0005) +[2026-06-07 01:37:11,262][344387] Updated weights for policy 0, policy_version 46760 (0.0005) +[2026-06-07 01:37:12,647][344387] Updated weights for policy 0, policy_version 46772 (0.0005) +[2026-06-07 01:37:13,788][344387] Updated weights for policy 0, policy_version 46784 (0.0005) +[2026-06-07 01:37:14,793][344387] Updated weights for policy 0, policy_version 46794 (0.0005) +[2026-06-07 01:37:15,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5188.3, 300 sec: 5283.2). Total num frames: 23959552. Throughput: 0: 5259.8. Samples: 23958702. Policy #0 lag: (min: 3.0, avg: 22.4, max: 38.0) +[2026-06-07 01:37:15,258][343476] Avg episode reward: [(0, '1896.197')] +[2026-06-07 01:37:15,824][344387] Updated weights for policy 0, policy_version 46804 (0.0005) +[2026-06-07 01:37:16,753][344387] Updated weights for policy 0, policy_version 46815 (0.0005) +[2026-06-07 01:37:17,955][344387] Updated weights for policy 0, policy_version 46826 (0.0005) +[2026-06-07 01:37:18,877][344387] Updated weights for policy 0, policy_version 46836 (0.0005) +[2026-06-07 01:37:19,940][344387] Updated weights for policy 0, policy_version 46849 (0.0006) +[2026-06-07 01:37:20,257][343476] Fps is (10 sec: 5529.4, 60 sec: 5256.5, 300 sec: 5290.1). Total num frames: 23988224. Throughput: 0: 5270.1. Samples: 23990486. Policy #0 lag: (min: 3.0, avg: 22.4, max: 38.0) +[2026-06-07 01:37:20,261][343476] Avg episode reward: [(0, '1819.878')] +[2026-06-07 01:37:21,219][344387] Updated weights for policy 0, policy_version 46859 (0.0005) +[2026-06-07 01:37:22,291][344387] Updated weights for policy 0, policy_version 46871 (0.0005) +[2026-06-07 01:37:23,107][344387] Updated weights for policy 0, policy_version 46881 (0.0005) +[2026-06-07 01:37:24,262][344387] Updated weights for policy 0, policy_version 46891 (0.0005) +[2026-06-07 01:37:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5222.4, 300 sec: 5276.2). Total num frames: 24012800. Throughput: 0: 5268.6. Samples: 24022018. Policy #0 lag: (min: 3.0, avg: 22.4, max: 38.0) +[2026-06-07 01:37:25,258][343476] Avg episode reward: [(0, '1902.907')] +[2026-06-07 01:37:25,415][344387] Updated weights for policy 0, policy_version 46902 (0.0005) +[2026-06-07 01:37:26,277][344387] Updated weights for policy 0, policy_version 46913 (0.0005) +[2026-06-07 01:37:27,375][344387] Updated weights for policy 0, policy_version 46923 (0.0005) +[2026-06-07 01:37:28,459][344387] Updated weights for policy 0, policy_version 46935 (0.0005) +[2026-06-07 01:37:29,232][344304] Signal inference workers to stop experience collection... (5200 times) +[2026-06-07 01:37:29,247][344387] InferenceWorker_p0-w0: stopping experience collection (5200 times) +[2026-06-07 01:37:29,316][344304] Signal inference workers to resume experience collection... (5200 times) +[2026-06-07 01:37:29,316][344387] InferenceWorker_p0-w0: resuming experience collection (5200 times) +[2026-06-07 01:37:29,477][344387] Updated weights for policy 0, policy_version 46946 (0.0005) +[2026-06-07 01:37:30,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5256.5, 300 sec: 5283.1). Total num frames: 24039424. Throughput: 0: 5273.6. Samples: 24037554. Policy #0 lag: (min: 3.0, avg: 22.4, max: 38.0) +[2026-06-07 01:37:30,258][343476] Avg episode reward: [(0, '1823.792')] +[2026-06-07 01:37:30,587][344387] Updated weights for policy 0, policy_version 46956 (0.0005) +[2026-06-07 01:37:31,672][344387] Updated weights for policy 0, policy_version 46968 (0.0006) +[2026-06-07 01:37:32,743][344387] Updated weights for policy 0, policy_version 46978 (0.0005) +[2026-06-07 01:37:34,107][344387] Updated weights for policy 0, policy_version 46989 (0.0006) +[2026-06-07 01:37:34,913][344387] Updated weights for policy 0, policy_version 47000 (0.0006) +[2026-06-07 01:37:35,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5256.6, 300 sec: 5276.2). Total num frames: 24066048. Throughput: 0: 5272.2. Samples: 24068262. Policy #0 lag: (min: 9.0, avg: 23.0, max: 43.0) +[2026-06-07 01:37:35,259][343476] Avg episode reward: [(0, '1658.837')] +[2026-06-07 01:37:35,957][344387] Updated weights for policy 0, policy_version 47010 (0.0005) +[2026-06-07 01:37:37,134][344387] Updated weights for policy 0, policy_version 47021 (0.0005) +[2026-06-07 01:37:38,248][344387] Updated weights for policy 0, policy_version 47035 (0.0005) +[2026-06-07 01:37:39,494][344387] Updated weights for policy 0, policy_version 47046 (0.0005) +[2026-06-07 01:37:40,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5222.4, 300 sec: 5269.3). Total num frames: 24090624. Throughput: 0: 5262.0. Samples: 24099244. Policy #0 lag: (min: 9.0, avg: 23.0, max: 43.0) +[2026-06-07 01:37:40,258][343476] Avg episode reward: [(0, '1814.419')] +[2026-06-07 01:37:40,467][344387] Updated weights for policy 0, policy_version 47056 (0.0005) +[2026-06-07 01:37:41,448][344387] Updated weights for policy 0, policy_version 47068 (0.0005) +[2026-06-07 01:37:42,562][344387] Updated weights for policy 0, policy_version 47079 (0.0005) +[2026-06-07 01:37:43,919][344387] Updated weights for policy 0, policy_version 47089 (0.0005) +[2026-06-07 01:37:45,061][344387] Updated weights for policy 0, policy_version 47102 (0.0006) +[2026-06-07 01:37:45,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5256.5, 300 sec: 5269.3). Total num frames: 24117248. Throughput: 0: 5255.4. Samples: 24114858. Policy #0 lag: (min: 9.0, avg: 23.0, max: 43.0) +[2026-06-07 01:37:45,259][343476] Avg episode reward: [(0, '1799.830')] +[2026-06-07 01:37:45,862][344387] Updated weights for policy 0, policy_version 47112 (0.0005) +[2026-06-07 01:37:47,077][344387] Updated weights for policy 0, policy_version 47122 (0.0005) +[2026-06-07 01:37:48,231][344387] Updated weights for policy 0, policy_version 47134 (0.0005) +[2026-06-07 01:37:49,085][344387] Updated weights for policy 0, policy_version 47144 (0.0005) +[2026-06-07 01:37:50,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5222.4, 300 sec: 5262.3). Total num frames: 24141824. Throughput: 0: 5225.9. Samples: 24146092. Policy #0 lag: (min: 9.0, avg: 23.0, max: 43.0) +[2026-06-07 01:37:50,258][343476] Avg episode reward: [(0, '1710.709')] +[2026-06-07 01:37:50,336][344387] Updated weights for policy 0, policy_version 47156 (0.0005) +[2026-06-07 01:37:51,715][344387] Updated weights for policy 0, policy_version 47169 (0.0006) +[2026-06-07 01:37:52,730][344387] Updated weights for policy 0, policy_version 47179 (0.0005) +[2026-06-07 01:37:53,912][344387] Updated weights for policy 0, policy_version 47192 (0.0006) +[2026-06-07 01:37:55,152][344387] Updated weights for policy 0, policy_version 47202 (0.0006) +[2026-06-07 01:37:55,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5256.5, 300 sec: 5262.3). Total num frames: 24168448. Throughput: 0: 5182.7. Samples: 24176042. Policy #0 lag: (min: 9.0, avg: 23.0, max: 43.0) +[2026-06-07 01:37:55,258][343476] Avg episode reward: [(0, '1674.749')] +[2026-06-07 01:37:56,190][344387] Updated weights for policy 0, policy_version 47212 (0.0007) +[2026-06-07 01:37:57,482][344387] Updated weights for policy 0, policy_version 47227 (0.0007) +[2026-06-07 01:37:59,039][344387] Updated weights for policy 0, policy_version 47237 (0.0005) +[2026-06-07 01:38:00,006][344387] Updated weights for policy 0, policy_version 47247 (0.0005) +[2026-06-07 01:38:00,257][343476] Fps is (10 sec: 4915.1, 60 sec: 5154.1, 300 sec: 5248.4). Total num frames: 24190976. Throughput: 0: 5130.3. Samples: 24189568. Policy #0 lag: (min: 9.0, avg: 23.0, max: 43.0) +[2026-06-07 01:38:00,259][343476] Avg episode reward: [(0, '1633.451')] +[2026-06-07 01:38:00,819][344387] Updated weights for policy 0, policy_version 47258 (0.0005) +[2026-06-07 01:38:01,842][344387] Updated weights for policy 0, policy_version 47268 (0.0005) +[2026-06-07 01:38:02,985][344387] Updated weights for policy 0, policy_version 47278 (0.0005) +[2026-06-07 01:38:03,600][344304] Signal inference workers to stop experience collection... (5250 times) +[2026-06-07 01:38:03,616][344387] InferenceWorker_p0-w0: stopping experience collection (5250 times) +[2026-06-07 01:38:03,684][344304] Signal inference workers to resume experience collection... (5250 times) +[2026-06-07 01:38:03,684][344387] InferenceWorker_p0-w0: resuming experience collection (5250 times) +[2026-06-07 01:38:03,882][344387] Updated weights for policy 0, policy_version 47291 (0.0006) +[2026-06-07 01:38:05,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5154.1, 300 sec: 5248.4). Total num frames: 24217600. Throughput: 0: 5121.2. Samples: 24220938. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:38:05,258][343476] Avg episode reward: [(0, '1788.740')] +[2026-06-07 01:38:05,295][344387] Updated weights for policy 0, policy_version 47301 (0.0005) +[2026-06-07 01:38:06,184][344387] Updated weights for policy 0, policy_version 47312 (0.0005) +[2026-06-07 01:38:07,051][344387] Updated weights for policy 0, policy_version 47324 (0.0005) +[2026-06-07 01:38:08,508][344387] Updated weights for policy 0, policy_version 47334 (0.0005) +[2026-06-07 01:38:09,400][344387] Updated weights for policy 0, policy_version 47344 (0.0005) +[2026-06-07 01:38:10,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5188.3, 300 sec: 5248.4). Total num frames: 24244224. Throughput: 0: 5144.5. Samples: 24253522. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:38:10,258][343476] Avg episode reward: [(0, '1806.561')] +[2026-06-07 01:38:10,313][344387] Updated weights for policy 0, policy_version 47356 (0.0005) +[2026-06-07 01:38:11,664][344387] Updated weights for policy 0, policy_version 47366 (0.0005) +[2026-06-07 01:38:12,760][344387] Updated weights for policy 0, policy_version 47378 (0.0006) +[2026-06-07 01:38:13,568][344387] Updated weights for policy 0, policy_version 47389 (0.0005) +[2026-06-07 01:38:14,828][344387] Updated weights for policy 0, policy_version 47399 (0.0005) +[2026-06-07 01:38:15,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5188.3, 300 sec: 5248.4). Total num frames: 24270848. Throughput: 0: 5141.9. Samples: 24268940. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:38:15,258][343476] Avg episode reward: [(0, '1794.298')] +[2026-06-07 01:38:15,703][344387] Updated weights for policy 0, policy_version 47409 (0.0005) +[2026-06-07 01:38:16,543][344387] Updated weights for policy 0, policy_version 47421 (0.0005) +[2026-06-07 01:38:17,924][344387] Updated weights for policy 0, policy_version 47431 (0.0005) +[2026-06-07 01:38:18,914][344387] Updated weights for policy 0, policy_version 47444 (0.0006) +[2026-06-07 01:38:19,742][344387] Updated weights for policy 0, policy_version 47455 (0.0005) +[2026-06-07 01:38:20,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5154.2, 300 sec: 5248.4). Total num frames: 24297472. Throughput: 0: 5171.6. Samples: 24300986. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:38:20,259][343476] Avg episode reward: [(0, '1819.280')] +[2026-06-07 01:38:21,324][344387] Updated weights for policy 0, policy_version 47466 (0.0005) +[2026-06-07 01:38:22,264][344387] Updated weights for policy 0, policy_version 47478 (0.0005) +[2026-06-07 01:38:23,515][344387] Updated weights for policy 0, policy_version 47489 (0.0005) +[2026-06-07 01:38:24,563][344387] Updated weights for policy 0, policy_version 47500 (0.0005) +[2026-06-07 01:38:25,257][343476] Fps is (10 sec: 5324.8, 60 sec: 5188.3, 300 sec: 5248.4). Total num frames: 24324096. Throughput: 0: 5179.4. Samples: 24332316. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:38:25,258][343476] Avg episode reward: [(0, '1839.051')] +[2026-06-07 01:38:25,555][344387] Updated weights for policy 0, policy_version 47512 (0.0005) +[2026-06-07 01:38:26,869][344387] Updated weights for policy 0, policy_version 47524 (0.0005) +[2026-06-07 01:38:27,966][344387] Updated weights for policy 0, policy_version 47536 (0.0006) +[2026-06-07 01:38:29,200][344387] Updated weights for policy 0, policy_version 47549 (0.0005) +[2026-06-07 01:38:30,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5154.1, 300 sec: 5248.4). Total num frames: 24348672. Throughput: 0: 5170.4. Samples: 24347524. Policy #0 lag: (min: 3.0, avg: 20.6, max: 35.0) +[2026-06-07 01:38:30,258][343476] Avg episode reward: [(0, '1878.952')] +[2026-06-07 01:38:30,431][344387] Updated weights for policy 0, policy_version 47559 (0.0005) +[2026-06-07 01:38:31,623][344387] Updated weights for policy 0, policy_version 47571 (0.0005) +[2026-06-07 01:38:32,706][344387] Updated weights for policy 0, policy_version 47582 (0.0005) +[2026-06-07 01:38:32,894][344304] Signal inference workers to stop experience collection... (5300 times) +[2026-06-07 01:38:32,895][344304] Signal inference workers to resume experience collection... (5300 times) +[2026-06-07 01:38:32,922][344387] InferenceWorker_p0-w0: stopping experience collection (5300 times) +[2026-06-07 01:38:32,922][344387] InferenceWorker_p0-w0: resuming experience collection (5300 times) +[2026-06-07 01:38:33,779][344387] Updated weights for policy 0, policy_version 47593 (0.0005) +[2026-06-07 01:38:34,869][344387] Updated weights for policy 0, policy_version 47605 (0.0005) +[2026-06-07 01:38:35,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5154.1, 300 sec: 5241.5). Total num frames: 24375296. Throughput: 0: 5173.4. Samples: 24378896. Policy #0 lag: (min: 7.0, avg: 23.6, max: 39.0) +[2026-06-07 01:38:35,259][343476] Avg episode reward: [(0, '1832.208')] +[2026-06-07 01:38:35,951][344387] Updated weights for policy 0, policy_version 47616 (0.0005) +[2026-06-07 01:38:37,301][344387] Updated weights for policy 0, policy_version 47629 (0.0005) +[2026-06-07 01:38:38,315][344387] Updated weights for policy 0, policy_version 47640 (0.0005) +[2026-06-07 01:38:39,435][344387] Updated weights for policy 0, policy_version 47650 (0.0005) +[2026-06-07 01:38:40,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5154.1, 300 sec: 5241.5). Total num frames: 24399872. Throughput: 0: 5198.8. Samples: 24409988. Policy #0 lag: (min: 7.0, avg: 23.6, max: 39.0) +[2026-06-07 01:38:40,258][343476] Avg episode reward: [(0, '1827.619')] +[2026-06-07 01:38:40,326][344387] Updated weights for policy 0, policy_version 47660 (0.0005) +[2026-06-07 01:38:41,288][344387] Updated weights for policy 0, policy_version 47672 (0.0005) +[2026-06-07 01:38:42,555][344387] Updated weights for policy 0, policy_version 47682 (0.0005) +[2026-06-07 01:38:43,418][344387] Updated weights for policy 0, policy_version 47692 (0.0005) +[2026-06-07 01:38:44,310][344387] Updated weights for policy 0, policy_version 47702 (0.0005) +[2026-06-07 01:38:45,108][344387] Updated weights for policy 0, policy_version 47712 (0.0005) +[2026-06-07 01:38:45,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5188.3, 300 sec: 5241.5). Total num frames: 24428544. Throughput: 0: 5245.7. Samples: 24425626. Policy #0 lag: (min: 7.0, avg: 23.6, max: 39.0) +[2026-06-07 01:38:45,258][343476] Avg episode reward: [(0, '1772.769')] +[2026-06-07 01:38:46,305][344387] Updated weights for policy 0, policy_version 47722 (0.0005) +[2026-06-07 01:38:47,405][344387] Updated weights for policy 0, policy_version 47733 (0.0005) +[2026-06-07 01:38:48,849][344387] Updated weights for policy 0, policy_version 47745 (0.0005) +[2026-06-07 01:38:49,766][344387] Updated weights for policy 0, policy_version 47755 (0.0005) +[2026-06-07 01:38:50,258][343476] Fps is (10 sec: 5324.2, 60 sec: 5188.2, 300 sec: 5241.5). Total num frames: 24453120. Throughput: 0: 5247.6. Samples: 24457086. Policy #0 lag: (min: 7.0, avg: 23.6, max: 39.0) +[2026-06-07 01:38:50,263][343476] Avg episode reward: [(0, '1891.605')] +[2026-06-07 01:38:50,692][344387] Updated weights for policy 0, policy_version 47766 (0.0006) +[2026-06-07 01:38:51,702][344387] Updated weights for policy 0, policy_version 47776 (0.0005) +[2026-06-07 01:38:53,102][344387] Updated weights for policy 0, policy_version 47786 (0.0005) +[2026-06-07 01:38:53,977][344387] Updated weights for policy 0, policy_version 47797 (0.0006) +[2026-06-07 01:38:55,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5154.1, 300 sec: 5234.6). Total num frames: 24477696. Throughput: 0: 5160.8. Samples: 24485760. Policy #0 lag: (min: 7.0, avg: 23.6, max: 39.0) +[2026-06-07 01:38:55,258][343476] Avg episode reward: [(0, '1710.462')] +[2026-06-07 01:38:55,263][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000047808_24477696.pth... +[2026-06-07 01:38:55,395][344304] Removing results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000019140_9799680.pth +[2026-06-07 01:38:55,521][344387] Updated weights for policy 0, policy_version 47809 (0.0006) +[2026-06-07 01:38:56,626][344387] Updated weights for policy 0, policy_version 47821 (0.0006) +[2026-06-07 01:38:57,531][344387] Updated weights for policy 0, policy_version 47834 (0.0006) +[2026-06-07 01:38:58,830][344387] Updated weights for policy 0, policy_version 47844 (0.0006) +[2026-06-07 01:38:59,901][344387] Updated weights for policy 0, policy_version 47854 (0.0005) +[2026-06-07 01:39:00,257][343476] Fps is (10 sec: 5120.6, 60 sec: 5222.4, 300 sec: 5234.6). Total num frames: 24504320. Throughput: 0: 5154.7. Samples: 24500902. Policy #0 lag: (min: 7.0, avg: 23.6, max: 39.0) +[2026-06-07 01:39:00,258][343476] Avg episode reward: [(0, '1802.472')] +[2026-06-07 01:39:00,685][344387] Updated weights for policy 0, policy_version 47868 (0.0005) +[2026-06-07 01:39:02,492][344387] Updated weights for policy 0, policy_version 47878 (0.0005) +[2026-06-07 01:39:03,364][344387] Updated weights for policy 0, policy_version 47889 (0.0005) +[2026-06-07 01:39:04,070][344387] Updated weights for policy 0, policy_version 47900 (0.0005) +[2026-06-07 01:39:05,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5188.3, 300 sec: 5227.6). Total num frames: 24528896. Throughput: 0: 5145.2. Samples: 24532518. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:39:05,258][343476] Avg episode reward: [(0, '1911.556')] +[2026-06-07 01:39:05,630][344387] Updated weights for policy 0, policy_version 47910 (0.0005) +[2026-06-07 01:39:06,378][344304] Signal inference workers to stop experience collection... (5350 times) +[2026-06-07 01:39:06,400][344387] InferenceWorker_p0-w0: stopping experience collection (5350 times) +[2026-06-07 01:39:06,465][344304] Signal inference workers to resume experience collection... (5350 times) +[2026-06-07 01:39:06,465][344387] InferenceWorker_p0-w0: resuming experience collection (5350 times) +[2026-06-07 01:39:06,700][344387] Updated weights for policy 0, policy_version 47922 (0.0005) +[2026-06-07 01:39:08,017][344387] Updated weights for policy 0, policy_version 47936 (0.0005) +[2026-06-07 01:39:09,176][344387] Updated weights for policy 0, policy_version 47948 (0.0005) +[2026-06-07 01:39:10,257][344387] Updated weights for policy 0, policy_version 47960 (0.0005) +[2026-06-07 01:39:10,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5188.3, 300 sec: 5227.6). Total num frames: 24555520. Throughput: 0: 5128.6. Samples: 24563102. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:39:10,258][343476] Avg episode reward: [(0, '1820.923')] +[2026-06-07 01:39:11,380][344387] Updated weights for policy 0, policy_version 47970 (0.0005) +[2026-06-07 01:39:12,354][344387] Updated weights for policy 0, policy_version 47980 (0.0005) +[2026-06-07 01:39:13,360][344387] Updated weights for policy 0, policy_version 47993 (0.0005) +[2026-06-07 01:39:14,573][344387] Updated weights for policy 0, policy_version 48004 (0.0006) +[2026-06-07 01:39:15,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5154.1, 300 sec: 5220.7). Total num frames: 24580096. Throughput: 0: 5138.7. Samples: 24578764. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:39:15,258][343476] Avg episode reward: [(0, '1703.982')] +[2026-06-07 01:39:15,850][344387] Updated weights for policy 0, policy_version 48014 (0.0005) +[2026-06-07 01:39:16,726][344387] Updated weights for policy 0, policy_version 48028 (0.0005) +[2026-06-07 01:39:18,124][344387] Updated weights for policy 0, policy_version 48038 (0.0005) +[2026-06-07 01:39:19,260][344387] Updated weights for policy 0, policy_version 48049 (0.0005) +[2026-06-07 01:39:20,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5154.1, 300 sec: 5227.6). Total num frames: 24606720. Throughput: 0: 5140.7. Samples: 24610226. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:39:20,258][343476] Avg episode reward: [(0, '1653.247')] +[2026-06-07 01:39:20,385][344387] Updated weights for policy 0, policy_version 48062 (0.0005) +[2026-06-07 01:39:21,301][344387] Updated weights for policy 0, policy_version 48072 (0.0005) +[2026-06-07 01:39:22,542][344387] Updated weights for policy 0, policy_version 48084 (0.0005) +[2026-06-07 01:39:23,793][344387] Updated weights for policy 0, policy_version 48096 (0.0005) +[2026-06-07 01:39:25,246][344387] Updated weights for policy 0, policy_version 48106 (0.0005) +[2026-06-07 01:39:25,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5085.9, 300 sec: 5199.8). Total num frames: 24629248. Throughput: 0: 5112.8. Samples: 24640062. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:39:25,258][343476] Avg episode reward: [(0, '1876.908')] +[2026-06-07 01:39:26,239][344387] Updated weights for policy 0, policy_version 48120 (0.0005) +[2026-06-07 01:39:27,578][344387] Updated weights for policy 0, policy_version 48132 (0.0006) +[2026-06-07 01:39:29,085][344387] Updated weights for policy 0, policy_version 48144 (0.0006) +[2026-06-07 01:39:29,890][344387] Updated weights for policy 0, policy_version 48156 (0.0006) +[2026-06-07 01:39:30,257][343476] Fps is (10 sec: 4915.2, 60 sec: 5120.0, 300 sec: 5206.8). Total num frames: 24655872. Throughput: 0: 5073.1. Samples: 24653914. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:39:30,258][343476] Avg episode reward: [(0, '1735.119')] +[2026-06-07 01:39:31,284][344387] Updated weights for policy 0, policy_version 48167 (0.0005) +[2026-06-07 01:39:32,635][344387] Updated weights for policy 0, policy_version 48179 (0.0005) +[2026-06-07 01:39:33,839][344387] Updated weights for policy 0, policy_version 48190 (0.0005) +[2026-06-07 01:39:34,758][344387] Updated weights for policy 0, policy_version 48200 (0.0005) +[2026-06-07 01:39:35,257][343476] Fps is (10 sec: 5119.8, 60 sec: 5085.8, 300 sec: 5199.8). Total num frames: 24680448. Throughput: 0: 5037.3. Samples: 24683760. Policy #0 lag: (min: 3.0, avg: 20.9, max: 35.0) +[2026-06-07 01:39:35,261][343476] Avg episode reward: [(0, '1807.107')] +[2026-06-07 01:39:35,784][344387] Updated weights for policy 0, policy_version 48212 (0.0005) +[2026-06-07 01:39:36,958][344304] Signal inference workers to stop experience collection... (5400 times) +[2026-06-07 01:39:36,979][344387] InferenceWorker_p0-w0: stopping experience collection (5400 times) +[2026-06-07 01:39:36,980][344387] Updated weights for policy 0, policy_version 48222 (0.0005) +[2026-06-07 01:39:37,062][344304] Signal inference workers to resume experience collection... (5400 times) +[2026-06-07 01:39:37,062][344387] InferenceWorker_p0-w0: resuming experience collection (5400 times) +[2026-06-07 01:39:38,258][344387] Updated weights for policy 0, policy_version 48233 (0.0005) +[2026-06-07 01:39:39,303][344387] Updated weights for policy 0, policy_version 48248 (0.0005) +[2026-06-07 01:39:40,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5120.0, 300 sec: 5199.8). Total num frames: 24707072. Throughput: 0: 5081.0. Samples: 24714406. Policy #0 lag: (min: 4.0, avg: 17.8, max: 37.0) +[2026-06-07 01:39:40,259][343476] Avg episode reward: [(0, '1827.756')] +[2026-06-07 01:39:40,404][344387] Updated weights for policy 0, policy_version 48258 (0.0005) +[2026-06-07 01:39:41,825][344387] Updated weights for policy 0, policy_version 48270 (0.0005) +[2026-06-07 01:39:42,681][344387] Updated weights for policy 0, policy_version 48283 (0.0005) +[2026-06-07 01:39:44,276][344387] Updated weights for policy 0, policy_version 48293 (0.0005) +[2026-06-07 01:39:45,245][344387] Updated weights for policy 0, policy_version 48306 (0.0005) +[2026-06-07 01:39:45,257][343476] Fps is (10 sec: 5120.2, 60 sec: 5051.7, 300 sec: 5192.9). Total num frames: 24731648. Throughput: 0: 5092.3. Samples: 24730058. Policy #0 lag: (min: 4.0, avg: 17.8, max: 37.0) +[2026-06-07 01:39:45,258][343476] Avg episode reward: [(0, '1620.881')] +[2026-06-07 01:39:46,430][344387] Updated weights for policy 0, policy_version 48318 (0.0005) +[2026-06-07 01:39:47,511][344387] Updated weights for policy 0, policy_version 48328 (0.0005) +[2026-06-07 01:39:48,558][344387] Updated weights for policy 0, policy_version 48340 (0.0005) +[2026-06-07 01:39:49,848][344387] Updated weights for policy 0, policy_version 48352 (0.0005) +[2026-06-07 01:39:50,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5086.0, 300 sec: 5186.0). Total num frames: 24758272. Throughput: 0: 5079.0. Samples: 24761072. Policy #0 lag: (min: 4.0, avg: 17.8, max: 37.0) +[2026-06-07 01:39:50,259][343476] Avg episode reward: [(0, '1812.917')] +[2026-06-07 01:39:50,905][344387] Updated weights for policy 0, policy_version 48362 (0.0005) +[2026-06-07 01:39:51,853][344387] Updated weights for policy 0, policy_version 48374 (0.0006) +[2026-06-07 01:39:53,019][344387] Updated weights for policy 0, policy_version 48384 (0.0005) +[2026-06-07 01:39:54,180][344387] Updated weights for policy 0, policy_version 48394 (0.0005) +[2026-06-07 01:39:55,052][344387] Updated weights for policy 0, policy_version 48405 (0.0005) +[2026-06-07 01:39:55,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5120.0, 300 sec: 5192.9). Total num frames: 24784896. Throughput: 0: 5109.0. Samples: 24793008. Policy #0 lag: (min: 4.0, avg: 17.8, max: 37.0) +[2026-06-07 01:39:55,259][343476] Avg episode reward: [(0, '1914.660')] +[2026-06-07 01:39:56,200][344387] Updated weights for policy 0, policy_version 48417 (0.0005) +[2026-06-07 01:39:57,247][344387] Updated weights for policy 0, policy_version 48427 (0.0005) +[2026-06-07 01:39:58,036][344387] Updated weights for policy 0, policy_version 48438 (0.0005) +[2026-06-07 01:39:59,023][344387] Updated weights for policy 0, policy_version 48448 (0.0005) +[2026-06-07 01:40:00,209][344387] Updated weights for policy 0, policy_version 48458 (0.0005) +[2026-06-07 01:40:00,257][343476] Fps is (10 sec: 5119.9, 60 sec: 5085.9, 300 sec: 5179.0). Total num frames: 24809472. Throughput: 0: 5125.5. Samples: 24809412. Policy #0 lag: (min: 4.0, avg: 17.8, max: 37.0) +[2026-06-07 01:40:00,262][343476] Avg episode reward: [(0, '1933.491')] +[2026-06-07 01:40:01,187][344387] Updated weights for policy 0, policy_version 48472 (0.0006) +[2026-06-07 01:40:02,521][344387] Updated weights for policy 0, policy_version 48483 (0.0005) +[2026-06-07 01:40:03,653][344387] Updated weights for policy 0, policy_version 48493 (0.0005) +[2026-06-07 01:40:04,294][344304] Signal inference workers to stop experience collection... (5450 times) +[2026-06-07 01:40:04,315][344387] InferenceWorker_p0-w0: stopping experience collection (5450 times) +[2026-06-07 01:40:04,374][344304] Signal inference workers to resume experience collection... (5450 times) +[2026-06-07 01:40:04,375][344387] InferenceWorker_p0-w0: resuming experience collection (5450 times) +[2026-06-07 01:40:04,510][344387] Updated weights for policy 0, policy_version 48506 (0.0005) +[2026-06-07 01:40:05,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5120.0, 300 sec: 5186.0). Total num frames: 24836096. Throughput: 0: 5117.8. Samples: 24840528. Policy #0 lag: (min: 4.0, avg: 17.8, max: 37.0) +[2026-06-07 01:40:05,258][343476] Avg episode reward: [(0, '1863.433')] +[2026-06-07 01:40:05,757][344387] Updated weights for policy 0, policy_version 48516 (0.0005) +[2026-06-07 01:40:06,769][344387] Updated weights for policy 0, policy_version 48526 (0.0005) +[2026-06-07 01:40:07,721][344387] Updated weights for policy 0, policy_version 48540 (0.0005) +[2026-06-07 01:40:09,112][344387] Updated weights for policy 0, policy_version 48551 (0.0005) +[2026-06-07 01:40:10,257][343476] Fps is (10 sec: 5324.9, 60 sec: 5120.0, 300 sec: 5192.9). Total num frames: 24862720. Throughput: 0: 5163.8. Samples: 24872434. Policy #0 lag: (min: 6.0, avg: 20.4, max: 38.0) +[2026-06-07 01:40:10,258][343476] Avg episode reward: [(0, '1967.617')] +[2026-06-07 01:40:10,362][344304] Saving new best policy, reward=1967.617! +[2026-06-07 01:40:10,362][344387] Updated weights for policy 0, policy_version 48564 (0.0005) +[2026-06-07 01:40:11,980][344387] Updated weights for policy 0, policy_version 48577 (0.0005) +[2026-06-07 01:40:12,969][344387] Updated weights for policy 0, policy_version 48587 (0.0005) +[2026-06-07 01:40:13,912][344387] Updated weights for policy 0, policy_version 48600 (0.0005) +[2026-06-07 01:40:15,193][344387] Updated weights for policy 0, policy_version 48610 (0.0005) +[2026-06-07 01:40:15,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5120.0, 300 sec: 5179.0). Total num frames: 24887296. Throughput: 0: 5188.5. Samples: 24887396. Policy #0 lag: (min: 6.0, avg: 20.4, max: 38.0) +[2026-06-07 01:40:15,258][343476] Avg episode reward: [(0, '1668.629')] +[2026-06-07 01:40:16,117][344387] Updated weights for policy 0, policy_version 48620 (0.0005) +[2026-06-07 01:40:17,043][344387] Updated weights for policy 0, policy_version 48630 (0.0005) +[2026-06-07 01:40:18,131][344387] Updated weights for policy 0, policy_version 48642 (0.0005) +[2026-06-07 01:40:19,333][344387] Updated weights for policy 0, policy_version 48652 (0.0005) +[2026-06-07 01:40:20,257][343476] Fps is (10 sec: 5324.6, 60 sec: 5154.1, 300 sec: 5192.9). Total num frames: 24915968. Throughput: 0: 5214.3. Samples: 24918404. Policy #0 lag: (min: 6.0, avg: 20.4, max: 38.0) +[2026-06-07 01:40:20,259][343476] Avg episode reward: [(0, '1856.162')] +[2026-06-07 01:40:20,318][344387] Updated weights for policy 0, policy_version 48665 (0.0005) +[2026-06-07 01:40:21,391][344387] Updated weights for policy 0, policy_version 48676 (0.0005) +[2026-06-07 01:40:22,783][344387] Updated weights for policy 0, policy_version 48688 (0.0005) +[2026-06-07 01:40:24,192][344387] Updated weights for policy 0, policy_version 48701 (0.0005) +[2026-06-07 01:40:25,023][344387] Updated weights for policy 0, policy_version 48712 (0.0005) +[2026-06-07 01:40:25,257][343476] Fps is (10 sec: 5324.7, 60 sec: 5188.2, 300 sec: 5185.9). Total num frames: 24940544. Throughput: 0: 5217.1. Samples: 24949174. Policy #0 lag: (min: 6.0, avg: 20.4, max: 38.0) +[2026-06-07 01:40:25,260][343476] Avg episode reward: [(0, '1812.542')] +[2026-06-07 01:40:26,225][344387] Updated weights for policy 0, policy_version 48724 (0.0005) +[2026-06-07 01:40:27,362][344387] Updated weights for policy 0, policy_version 48735 (0.0005) +[2026-06-07 01:40:28,357][344387] Updated weights for policy 0, policy_version 48745 (0.0005) +[2026-06-07 01:40:29,425][344387] Updated weights for policy 0, policy_version 48757 (0.0005) +[2026-06-07 01:40:30,257][343476] Fps is (10 sec: 5120.1, 60 sec: 5188.3, 300 sec: 5186.0). Total num frames: 24967168. Throughput: 0: 5228.5. Samples: 24965338. Policy #0 lag: (min: 6.0, avg: 20.4, max: 38.0) +[2026-06-07 01:40:30,258][343476] Avg episode reward: [(0, '1762.487')] +[2026-06-07 01:40:30,741][344387] Updated weights for policy 0, policy_version 48768 (0.0005) +[2026-06-07 01:40:31,696][344387] Updated weights for policy 0, policy_version 48778 (0.0005) +[2026-06-07 01:40:32,799][344387] Updated weights for policy 0, policy_version 48790 (0.0005) +[2026-06-07 01:40:33,827][344304] Signal inference workers to stop experience collection... (5500 times) +[2026-06-07 01:40:33,843][344387] InferenceWorker_p0-w0: stopping experience collection (5500 times) +[2026-06-07 01:40:33,926][344304] Signal inference workers to resume experience collection... (5500 times) +[2026-06-07 01:40:33,927][344387] InferenceWorker_p0-w0: resuming experience collection (5500 times) +[2026-06-07 01:40:34,092][344387] Updated weights for policy 0, policy_version 48801 (0.0005) +[2026-06-07 01:40:35,254][344387] Updated weights for policy 0, policy_version 48813 (0.0005) +[2026-06-07 01:40:35,257][343476] Fps is (10 sec: 5120.0, 60 sec: 5188.3, 300 sec: 5185.9). Total num frames: 24991744. Throughput: 0: 5226.6. Samples: 24996268. Policy #0 lag: (min: 6.0, avg: 20.4, max: 38.0) +[2026-06-07 01:40:35,260][343476] Avg episode reward: [(0, '1793.498')] +[2026-06-07 01:40:36,166][344387] Updated weights for policy 0, policy_version 48825 (0.0005) +[2026-06-07 01:40:37,332][344304] Stopping Batcher_0... +[2026-06-07 01:40:37,332][344304] Loop batcher_evt_loop terminating... +[2026-06-07 01:40:37,334][343476] Component Batcher_0 stopped! +[2026-06-07 01:40:37,395][343476] Component RolloutWorker_w15 stopped! +[2026-06-07 01:40:37,395][345415] Stopping RolloutWorker_w15... +[2026-06-07 01:40:37,396][345415] Loop rollout_proc15_evt_loop terminating... +[2026-06-07 01:40:37,397][343476] Component RolloutWorker_w26 stopped! +[2026-06-07 01:40:37,397][345463] Stopping RolloutWorker_w26... +[2026-06-07 01:40:37,397][346442] Stopping RolloutWorker_w31... +[2026-06-07 01:40:37,398][345463] Loop rollout_proc26_evt_loop terminating... +[2026-06-07 01:40:37,398][343476] Component RolloutWorker_w31 stopped! +[2026-06-07 01:40:37,398][346442] Loop rollout_proc31_evt_loop terminating... +[2026-06-07 01:40:37,397][344395] Stopping RolloutWorker_w7... +[2026-06-07 01:40:37,398][344395] Loop rollout_proc7_evt_loop terminating... +[2026-06-07 01:40:37,398][343476] Component RolloutWorker_w7 stopped! +[2026-06-07 01:40:37,399][343476] Component RolloutWorker_w29 stopped! +[2026-06-07 01:40:37,399][345556] Stopping RolloutWorker_w29... +[2026-06-07 01:40:37,400][343476] Component RolloutWorker_w11 stopped! +[2026-06-07 01:40:37,399][344400] Stopping RolloutWorker_w11... +[2026-06-07 01:40:37,400][345556] Loop rollout_proc29_evt_loop terminating... +[2026-06-07 01:40:37,399][345555] Stopping RolloutWorker_w28... +[2026-06-07 01:40:37,400][343476] Component RolloutWorker_w28 stopped! +[2026-06-07 01:40:37,399][344402] Stopping RolloutWorker_w13... +[2026-06-07 01:40:37,400][344400] Loop rollout_proc11_evt_loop terminating... +[2026-06-07 01:40:37,400][344398] Stopping RolloutWorker_w9... +[2026-06-07 01:40:37,401][345555] Loop rollout_proc28_evt_loop terminating... +[2026-06-07 01:40:37,401][344402] Loop rollout_proc13_evt_loop terminating... +[2026-06-07 01:40:37,401][343476] Component RolloutWorker_w13 stopped! +[2026-06-07 01:40:37,401][344398] Loop rollout_proc9_evt_loop terminating... +[2026-06-07 01:40:37,401][343476] Component RolloutWorker_w9 stopped! +[2026-06-07 01:40:37,402][343476] Component RolloutWorker_w4 stopped! +[2026-06-07 01:40:37,403][343476] Component RolloutWorker_w20 stopped! +[2026-06-07 01:40:37,402][344397] Stopping RolloutWorker_w4... +[2026-06-07 01:40:37,402][345421] Stopping RolloutWorker_w20... +[2026-06-07 01:40:37,404][345421] Loop rollout_proc20_evt_loop terminating... +[2026-06-07 01:40:37,404][344397] Loop rollout_proc4_evt_loop terminating... +[2026-06-07 01:40:37,405][343476] Component RolloutWorker_w30 stopped! +[2026-06-07 01:40:37,405][343476] Component RolloutWorker_w17 stopped! +[2026-06-07 01:40:37,405][345557] Stopping RolloutWorker_w30... +[2026-06-07 01:40:37,406][345557] Loop rollout_proc30_evt_loop terminating... +[2026-06-07 01:40:37,405][344401] Stopping RolloutWorker_w14... +[2026-06-07 01:40:37,406][343476] Component RolloutWorker_w14 stopped! +[2026-06-07 01:40:37,405][344388] Stopping RolloutWorker_w1... +[2026-06-07 01:40:37,405][345418] Stopping RolloutWorker_w17... +[2026-06-07 01:40:37,405][344392] Stopping RolloutWorker_w8... +[2026-06-07 01:40:37,406][344401] Loop rollout_proc14_evt_loop terminating... +[2026-06-07 01:40:37,406][344388] Loop rollout_proc1_evt_loop terminating... +[2026-06-07 01:40:37,406][343476] Component RolloutWorker_w8 stopped! +[2026-06-07 01:40:37,406][345418] Loop rollout_proc17_evt_loop terminating... +[2026-06-07 01:40:37,406][344392] Loop rollout_proc8_evt_loop terminating... +[2026-06-07 01:40:37,407][343476] Component RolloutWorker_w1 stopped! +[2026-06-07 01:40:37,407][343476] Component RolloutWorker_w23 stopped! +[2026-06-07 01:40:37,407][345424] Stopping RolloutWorker_w23... +[2026-06-07 01:40:37,408][343476] Component RolloutWorker_w12 stopped! +[2026-06-07 01:40:37,408][345424] Loop rollout_proc23_evt_loop terminating... +[2026-06-07 01:40:37,409][343476] Component RolloutWorker_w27 stopped! +[2026-06-07 01:40:37,408][344403] Stopping RolloutWorker_w12... +[2026-06-07 01:40:37,410][344403] Loop rollout_proc12_evt_loop terminating... +[2026-06-07 01:40:37,410][343476] Component RolloutWorker_w10 stopped! +[2026-06-07 01:40:37,409][345554] Stopping RolloutWorker_w27... +[2026-06-07 01:40:37,411][343476] Component RolloutWorker_w25 stopped! +[2026-06-07 01:40:37,410][344399] Stopping RolloutWorker_w10... +[2026-06-07 01:40:37,411][345554] Loop rollout_proc27_evt_loop terminating... +[2026-06-07 01:40:37,411][344389] Stopping RolloutWorker_w0... +[2026-06-07 01:40:37,411][344399] Loop rollout_proc10_evt_loop terminating... +[2026-06-07 01:40:37,411][343476] Component RolloutWorker_w0 stopped! +[2026-06-07 01:40:37,411][344389] Loop rollout_proc0_evt_loop terminating... +[2026-06-07 01:40:37,410][345426] Stopping RolloutWorker_w25... +[2026-06-07 01:40:37,411][345425] Stopping RolloutWorker_w24... +[2026-06-07 01:40:37,412][343476] Component RolloutWorker_w24 stopped! +[2026-06-07 01:40:37,412][345425] Loop rollout_proc24_evt_loop terminating... +[2026-06-07 01:40:37,412][345426] Loop rollout_proc25_evt_loop terminating... +[2026-06-07 01:40:37,412][343476] Component RolloutWorker_w22 stopped! +[2026-06-07 01:40:37,412][345423] Stopping RolloutWorker_w22... +[2026-06-07 01:40:37,413][345423] Loop rollout_proc22_evt_loop terminating... +[2026-06-07 01:40:37,413][343476] Component RolloutWorker_w6 stopped! +[2026-06-07 01:40:37,412][344396] Stopping RolloutWorker_w6... +[2026-06-07 01:40:37,412][344393] Stopping RolloutWorker_w3... +[2026-06-07 01:40:37,413][344390] Stopping RolloutWorker_w2... +[2026-06-07 01:40:37,413][344396] Loop rollout_proc6_evt_loop terminating... +[2026-06-07 01:40:37,413][344393] Loop rollout_proc3_evt_loop terminating... +[2026-06-07 01:40:37,413][343476] Component RolloutWorker_w3 stopped! +[2026-06-07 01:40:37,413][344390] Loop rollout_proc2_evt_loop terminating... +[2026-06-07 01:40:37,414][343476] Component RolloutWorker_w16 stopped! +[2026-06-07 01:40:37,413][345416] Stopping RolloutWorker_w16... +[2026-06-07 01:40:37,413][345420] Stopping RolloutWorker_w19... +[2026-06-07 01:40:37,413][345419] Stopping RolloutWorker_w18... +[2026-06-07 01:40:37,414][345416] Loop rollout_proc16_evt_loop terminating... +[2026-06-07 01:40:37,414][343476] Component RolloutWorker_w2 stopped! +[2026-06-07 01:40:37,414][345420] Loop rollout_proc19_evt_loop terminating... +[2026-06-07 01:40:37,414][345419] Loop rollout_proc18_evt_loop terminating... +[2026-06-07 01:40:37,414][343476] Component RolloutWorker_w19 stopped! +[2026-06-07 01:40:37,415][343476] Component RolloutWorker_w18 stopped! +[2026-06-07 01:40:37,416][343476] Component RolloutWorker_w5 stopped! +[2026-06-07 01:40:37,416][344394] Stopping RolloutWorker_w5... +[2026-06-07 01:40:37,417][344394] Loop rollout_proc5_evt_loop terminating... +[2026-06-07 01:40:37,418][343476] Component RolloutWorker_w21 stopped! +[2026-06-07 01:40:37,418][345422] Stopping RolloutWorker_w21... +[2026-06-07 01:40:37,419][345422] Loop rollout_proc21_evt_loop terminating... +[2026-06-07 01:40:37,432][344387] Weights refcount: 2 0 +[2026-06-07 01:40:37,433][344387] Stopping InferenceWorker_p0-w0... +[2026-06-07 01:40:37,433][344387] Loop inference_proc0-0_evt_loop terminating... +[2026-06-07 01:40:37,433][343476] Component InferenceWorker_p0-w0 stopped! +[2026-06-07 01:40:37,568][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000048840_25006080.pth... +[2026-06-07 01:40:37,607][344304] Removing results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000023420_11991040.pth +[2026-06-07 01:40:37,614][344304] Saving results/checkpoints_factor_sweeps/deadly_corridor/context_window/deadly_corridor_frame_stack_uniform_u2_6_fs16_seed14/checkpoint_p0/checkpoint_000048840_25006080.pth... +[2026-06-07 01:40:37,656][344304] Stopping LearnerWorker_p0... +[2026-06-07 01:40:37,656][344304] Loop learner_proc0_evt_loop terminating... +[2026-06-07 01:40:37,656][343476] Component LearnerWorker_p0 stopped! +[2026-06-07 01:40:37,657][343476] Waiting for process learner_proc0 to stop... +[2026-06-07 01:40:48,310][343476] Waiting for process inference_proc0-0 to join... +[2026-06-07 01:40:48,311][343476] Waiting for process rollout_proc0 to join... +[2026-06-07 01:40:48,312][343476] Waiting for process rollout_proc1 to join... +[2026-06-07 01:40:48,313][343476] Waiting for process rollout_proc2 to join... +[2026-06-07 01:40:48,313][343476] Waiting for process rollout_proc3 to join... +[2026-06-07 01:40:48,314][343476] Waiting for process rollout_proc4 to join... +[2026-06-07 01:40:48,314][343476] Waiting for process rollout_proc5 to join... +[2026-06-07 01:40:48,315][343476] Waiting for process rollout_proc6 to join... +[2026-06-07 01:40:48,315][343476] Waiting for process rollout_proc7 to join... +[2026-06-07 01:40:48,316][343476] Waiting for process rollout_proc8 to join... +[2026-06-07 01:40:48,317][343476] Waiting for process rollout_proc9 to join... +[2026-06-07 01:40:48,317][343476] Waiting for process rollout_proc10 to join... +[2026-06-07 01:40:48,318][343476] Waiting for process rollout_proc11 to join... +[2026-06-07 01:40:48,319][343476] Waiting for process rollout_proc12 to join... +[2026-06-07 01:40:48,319][343476] Waiting for process rollout_proc13 to join... +[2026-06-07 01:40:48,320][343476] Waiting for process rollout_proc14 to join... +[2026-06-07 01:40:48,321][343476] Waiting for process rollout_proc15 to join... +[2026-06-07 01:40:48,321][343476] Waiting for process rollout_proc16 to join... +[2026-06-07 01:40:48,322][343476] Waiting for process rollout_proc17 to join... +[2026-06-07 01:40:48,323][343476] Waiting for process rollout_proc18 to join... +[2026-06-07 01:40:48,323][343476] Waiting for process rollout_proc19 to join... +[2026-06-07 01:40:48,324][343476] Waiting for process rollout_proc20 to join... +[2026-06-07 01:40:48,325][343476] Waiting for process rollout_proc21 to join... +[2026-06-07 01:40:48,326][343476] Waiting for process rollout_proc22 to join... +[2026-06-07 01:40:48,326][343476] Waiting for process rollout_proc23 to join... +[2026-06-07 01:40:48,327][343476] Waiting for process rollout_proc24 to join... +[2026-06-07 01:40:48,328][343476] Waiting for process rollout_proc25 to join... +[2026-06-07 01:40:48,329][343476] Waiting for process rollout_proc26 to join... +[2026-06-07 01:40:48,330][343476] Waiting for process rollout_proc27 to join... +[2026-06-07 01:40:48,331][343476] Waiting for process rollout_proc28 to join... +[2026-06-07 01:40:48,331][343476] Waiting for process rollout_proc29 to join... +[2026-06-07 01:40:48,332][343476] Waiting for process rollout_proc30 to join... +[2026-06-07 01:40:48,333][343476] Waiting for process rollout_proc31 to join... +[2026-06-07 01:40:48,334][343476] Batcher 0 profile tree view: +batching: 2033.9392, releasing_batches: 328.4710 +[2026-06-07 01:40:48,334][343476] InferenceWorker_p0-w0 profile tree view: +wait_policy: 0.0051 + wait_policy_total: 64.8005 +update_model: 48.3091 + weight_update: 0.0005 +one_step: 0.0286 + handle_policy_step: 5684.7250 + deserialize: 2321.7505, stack: 11.0210, obs_to_device_normalize: 1738.4958, forward: 790.1089, send_messages: 188.8688 + prepare_outputs: 576.7811 + to_cpu: 474.6202 +[2026-06-07 01:40:48,335][343476] Learner 0 profile tree view: +misc: 0.1014, prepare_batch: 798.4110 +train: 2389.8524 + epoch_init: 0.3693, minibatch_init: 6.4921, losses_postprocess: 115.1301, kl_divergence: 144.9159, after_optimizer: 242.6571 + calculate_losses: 1182.8398 + losses_init: 0.2074, forward_head: 76.2172, bptt_initial: 760.9753, tail: 58.1175, advantages_returns: 12.0003, losses: 113.0760 + bptt: 153.4952 + bptt_forward_core: 149.7822 + update: 686.0269 + clip: 43.8315 +[2026-06-07 01:40:48,335][343476] RolloutWorker_w0 profile tree view: +wait_for_trajectories: 0.3371, enqueue_policy_requests: 120.9136, env_step: 3219.5347, overhead: 52.7835, complete_rollouts: 0.8857 +save_policy_outputs: 76.9762 + split_output_tensors: 26.1120 +[2026-06-07 01:40:48,336][343476] RolloutWorker_w31 profile tree view: +wait_for_trajectories: 0.3379, enqueue_policy_requests: 120.6858, env_step: 3237.2810, overhead: 49.6332, complete_rollouts: 0.9041 +save_policy_outputs: 80.0545 + split_output_tensors: 26.9113 +[2026-06-07 01:40:48,337][343476] Loop Runner_EvtLoop terminating... +[2026-06-07 01:40:48,338][343476] Runner profile tree view: +main_loop: 6101.4315 +[2026-06-07 01:40:48,339][343476] Collected {0: 25006080}, FPS: 4098.4