Budget Alignment: Making Models Reason in the User's Language
Harvard University · ETH Zürich University of Groningen · Department of Computer Science · University of Groningen · University of Amsterdam
PDF 由论文原始站点提供,PaperCompass 不保存论文文件。
摘要
LLMs often reason internally in English even for non-English queries, limiting faithfulness and weakening human oversight in multilingual settings. We study budget alignment: lightweight methods to align a model’s reasoning language with the user’s language under modest data and compute. Using a 7B model, we evaluate multilingual SFT, RL for accuracy recovery, and model merging. Across Japanese, French, and Spanish tasks, these approaches markedly increase language-consistent reasoning while preserving strong accuracy, showing that faithful and interpretable multilingual reasoning can be achieved with low-cost alignment.