
Scoring Higher, Answering Worse: Mitigating Reward Hacking in Rubric-Based RL via Protocol-Level Rubrics
Research
New papers, breakthroughs and academic AI research

Research

Research

Research

Research

Research

Research

Research

Research

Research

Research

Research

Research