Direct Preference Optimization: Your Language Model is Secretly a Reward Model
R. Rafailov et al. · NeurIPS 2023
原典: R. Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model”, NeurIPS 2023 (arXiv:2305.18290, 原典の PDF) · ライセンス: CC BY 4.0
訳文は Re:Babel による機械翻訳です(Balanced、2026-10-10)。原文を日本語に翻訳したもので、手を加えていません。誤りを含むことがあります。
R. Rafailov et al. · NeurIPS 2023
原典: R. Rafailov et al., “Direct Preference Optimization: Your Language Model is Secretly a Reward Model”, NeurIPS 2023 (arXiv:2305.18290, 原典の PDF) · ライセンス: CC BY 4.0
訳文は Re:Babel による機械翻訳です(Balanced、2026-10-10)。原文を日本語に翻訳したもので、手を加えていません。誤りを含むことがあります。