Corruption Robustness in RL (MiniGrid)

Research question

How does PPO performance on MiniGrid-LavaGapS7 degrade under observation corruption, and does corruption-trained robustness transfer to held-out corruption families?

Methodology

Seeded, reproducible PPO (CleanRL-style, 64x64 MLP actor-critic) on MiniGrid-LavaGapS7 under symbolic observation corruption (mask / noise / shuffle at controlled probabilities), measuring degradation curves and seen-vs-held-out transfer for clean- and corruption-trained policies. Every run records a full research.v1 step trace and a provenance manifest; instrumentation is proven observationally inert by automated tests.

Published experiments

TraceVox Research home · Public Research Library · Documentation · llms.txt