Direct Preference Optimization: Your Language Model is Secretly a Reward ModelR. Rafailov et al. · NeurIPS 2023
機械学習

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

R. Rafailov et al. · NeurIPS 2023

原典: R. Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model”, NeurIPS 2023 (arXiv:2305.18290, 原典の PDF) · ライセンス: CC BY 4.0

訳文は Re:Babel による機械翻訳です(Balanced、2026-10-10)。原文を日本語に翻訳したもので、手を加えていません。誤りを含むことがあります。

機械学習

Direct Preference Optimization: あなたの言語モデルは密かに報酬モデルである

R. Rafailov et al. · NeurIPS 2023

原典: R. Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model”, NeurIPS 2023 (arXiv:2305.18290, 原典の PDF) · ライセンス: CC BY 4.0

訳文は Re:Babel による機械翻訳です(Balanced、2026-10-10)。原文を日本語に翻訳したもので、手を加えていません。誤りを含むことがあります。