<?xml version="1.0" encoding="UTF-8"?><urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9" xmlns:news="http://www.google.com/schemas/sitemap-news/0.9" xmlns:xhtml="http://www.w3.org/1999/xhtml" xmlns:image="http://www.google.com/schemas/sitemap-image/1.1" xmlns:video="http://www.google.com/schemas/sitemap-video/1.1"><url><loc>https://rl-wiki.pages.dev/</loc></url><url><loc>https://rl-wiki.pages.dev/applications/</loc></url><url><loc>https://rl-wiki.pages.dev/applications/01-domains/combinatorial-optimization/</loc></url><url><loc>https://rl-wiki.pages.dev/applications/01-domains/finance-trading/</loc></url><url><loc>https://rl-wiki.pages.dev/applications/01-domains/recommendation-ads/</loc></url><url><loc>https://rl-wiki.pages.dev/applications/01-domains/robotics/</loc></url><url><loc>https://rl-wiki.pages.dev/applications/02-alphago-legacy/milestones/</loc></url><url><loc>https://rl-wiki.pages.dev/exploration/</loc></url><url><loc>https://rl-wiki.pages.dev/exploration/01-intrinsic/count-based/</loc></url><url><loc>https://rl-wiki.pages.dev/exploration/01-intrinsic/curiosity-icm-rnd/</loc></url><url><loc>https://rl-wiki.pages.dev/exploration/01-intrinsic/information-gain/</loc></url><url><loc>https://rl-wiki.pages.dev/exploration/02-structured/go-explore/</loc></url><url><loc>https://rl-wiki.pages.dev/exploration/02-structured/goal-directed-exploration/</loc></url><url><loc>https://rl-wiki.pages.dev/foundations/</loc></url><url><loc>https://rl-wiki.pages.dev/foundations/01-mdp/exploration-exploitation/</loc></url><url><loc>https://rl-wiki.pages.dev/foundations/01-mdp/mdp/</loc></url><url><loc>https://rl-wiki.pages.dev/foundations/01-mdp/value-functions-bellman/</loc></url><url><loc>https://rl-wiki.pages.dev/foundations/02-methodology/evaluation-reproducibility/</loc></url><url><loc>https://rl-wiki.pages.dev/foundations/02-methodology/taxonomy/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/advantage/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/bellman-equation/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/deadly-triad/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/experience-replay/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/exploitability/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/grpo/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/her/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/kl-penalty/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/mdp/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/on-off-policy/</loc></url><url><loc>https://rl-wiki.pages.dev/glossary/reward-hacking/</loc></url><url><loc>https://rl-wiki.pages.dev/hierarchical-meta/</loc></url><url><loc>https://rl-wiki.pages.dev/hierarchical-meta/01-hierarchical/goal-conditioned-her/</loc></url><url><loc>https://rl-wiki.pages.dev/hierarchical-meta/01-hierarchical/options-framework/</loc></url><url><loc>https://rl-wiki.pages.dev/hierarchical-meta/02-meta-generalization/generalization-sim2real/</loc></url><url><loc>https://rl-wiki.pages.dev/hierarchical-meta/02-meta-generalization/meta-rl/</loc></url><url><loc>https://rl-wiki.pages.dev/model-based/</loc></url><url><loc>https://rl-wiki.pages.dev/model-based/01-planning/dyna-mpc/</loc></url><url><loc>https://rl-wiki.pages.dev/model-based/01-planning/mcts-alphazero/</loc></url><url><loc>https://rl-wiki.pages.dev/model-based/02-world-models/dreamer/</loc></url><url><loc>https://rl-wiki.pages.dev/model-based/02-world-models/model-error/</loc></url><url><loc>https://rl-wiki.pages.dev/model-based/02-world-models/muzero/</loc></url><url><loc>https://rl-wiki.pages.dev/multi-agent/</loc></url><url><loc>https://rl-wiki.pages.dev/multi-agent/01-marl/communication-cooperation/</loc></url><url><loc>https://rl-wiki.pages.dev/multi-agent/01-marl/marl-basics-ctde/</loc></url><url><loc>https://rl-wiki.pages.dev/multi-agent/02-games/equilibria/</loc></url><url><loc>https://rl-wiki.pages.dev/multi-agent/02-games/self-play-psro/</loc></url><url><loc>https://rl-wiki.pages.dev/offline-imitation/</loc></url><url><loc>https://rl-wiki.pages.dev/offline-imitation/01-imitation/behavior-cloning-dagger/</loc></url><url><loc>https://rl-wiki.pages.dev/offline-imitation/01-imitation/inverse-rl-gail/</loc></url><url><loc>https://rl-wiki.pages.dev/offline-imitation/02-offline-rl/cql-iql/</loc></url><url><loc>https://rl-wiki.pages.dev/offline-imitation/02-offline-rl/decision-transformer/</loc></url><url><loc>https://rl-wiki.pages.dev/offline-imitation/02-offline-rl/offline-benchmarks/</loc></url><url><loc>https://rl-wiki.pages.dev/policy-gradient/</loc></url><url><loc>https://rl-wiki.pages.dev/policy-gradient/01-on-policy/actor-critic-gae/</loc></url><url><loc>https://rl-wiki.pages.dev/policy-gradient/01-on-policy/reinforce-baseline/</loc></url><url><loc>https://rl-wiki.pages.dev/policy-gradient/01-on-policy/trpo-ppo/</loc></url><url><loc>https://rl-wiki.pages.dev/policy-gradient/02-continuous/ddpg-td3-sac/</loc></url><url><loc>https://rl-wiki.pages.dev/policy-gradient/02-continuous/pg-theory/</loc></url><url><loc>https://rl-wiki.pages.dev/references/</loc></url><url><loc>https://rl-wiki.pages.dev/references/01-books-courses/courses/</loc></url><url><loc>https://rl-wiki.pages.dev/references/01-books-courses/textbooks/</loc></url><url><loc>https://rl-wiki.pages.dev/references/02-papers-code/blogs-code/</loc></url><url><loc>https://rl-wiki.pages.dev/references/02-papers-code/papers-core/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-llm/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-llm/01-rlhf/ppo-for-llm/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-llm/01-rlhf/reward-modeling/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-llm/01-rlhf/rlhf-pipeline/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-llm/02-beyond-ppo/dpo-family/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-llm/02-beyond-ppo/grpo-rlvr/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-llm/02-beyond-ppo/reward-hacking/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-systems/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-systems/01-infrastructure/environments/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-systems/01-infrastructure/vectorized-distributed/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-systems/02-practice/debugging-checklist/</loc></url><url><loc>https://rl-wiki.pages.dev/rl-systems/02-practice/libraries/</loc></url><url><loc>https://rl-wiki.pages.dev/tabular-dp/</loc></url><url><loc>https://rl-wiki.pages.dev/tabular-dp/01-dp/policy-value-iteration/</loc></url><url><loc>https://rl-wiki.pages.dev/tabular-dp/02-model-free/bandits/</loc></url><url><loc>https://rl-wiki.pages.dev/tabular-dp/02-model-free/monte-carlo/</loc></url><url><loc>https://rl-wiki.pages.dev/tabular-dp/02-model-free/td-learning/</loc></url><url><loc>https://rl-wiki.pages.dev/value-based/</loc></url><url><loc>https://rl-wiki.pages.dev/value-based/01-dqn/distributional-rl/</loc></url><url><loc>https://rl-wiki.pages.dev/value-based/01-dqn/dqn-family/</loc></url><url><loc>https://rl-wiki.pages.dev/value-based/02-theory/continuous-actions-value/</loc></url><url><loc>https://rl-wiki.pages.dev/value-based/02-theory/deadly-triad/</loc></url></urlset>