research Expected Return Causes Outcome-Level Mode Collapse in Reinforcement Learning Explaining outcome-level mode collapse and correcting it with inverse probability scaling. Density-Aware Reward Scaling: A Reinforcement Learning Framework for Reward-Proportional Sampling A critic-free method for scaling rewards by local outcome density. How Does My Model Fail? Automatic Identification and Interpretation of Physical Plausibility Failure Modes with Matryoshka Transcoders Hierarchical sparse features for interpreting physical-plausibility failures in generative models. Editing Discrete Latent Variables with Reinforcement Learning Controlled and interpretable generation through minimal edits to discrete VQ-VAE codes. Brain-Inspired Attention Model for Object Counting Sequential visual attention and reinforcement learning for accurate object counting.