Research2026-04-28

Reinforcement Learning with Backtracking Feedback

arXiv:2602.08377v2 Announce Type: replace-cross Abstract: Addressing the critical need for robust safety in Large Language Models (LLMs), particularly against adversarial attacks and in-distribution errors, we introduce Reinforcement Learning with Backtracking Feedback (RLBF). This framework...

Read Original Article on Arxiv CS.AI

arxivpapersrl