Advantage Scale Calibration Imbalance in Group-Relative Optimization under Low-Variance Rewards: Diagnosis and Bounded RecoveryResearchSep 18, 2026
Dual-Axis Policy Optimization for LLM Agents: Bayesian Feedback Attribution and Trajectory Mass NormalizationResearchSep 18, 2026
For Your Eyes Only: Evaluating Coordination Between Isolated Language Model InstancesResearchSep 18, 2026
Compositional Policy Violations: When Step-Level Compliance Fails In Agentic AI WorkflowsResearchSep 18, 2026