Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling

Item #:
085713-3323

Details

Description

 

Members/Attendees

 

Tab 4