kapynResearch

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

GRPO Beyond English is a large-scale study evaluating Group Relative Policy Optimization across multilingual settings. Researchers investigate how native-language reasoning rewards impact pretrained language models compared to traditional English-centric training. The findings reveal that training models to reason in their native language achieves performance comparable to English reasoning, offering key insights for global LLM alignment.

Apple ML Research·Aug 18, 2026

Opening Kapyn…