Author
Rafayel Latif
Recent research
- AI & ComputingOpen access
Cross model transfer of Direct Preference Optimization
Since direct preference optimization (DPO) was introduced in 2023, it has become a widely used preference optimization strategy for post-training large language models (LLMs). DPO's implicit reward formulation is coupled to its reference policy, and its theoretical guarantees ass...
- AI & ComputingOpen access
Cross model transfer of Direct Preference Optimization
Since direct preference optimization (DPO) was introduced in 2023, it has become a widely used preference optimization strategy for post-training large language models (LLMs). DPO's implicit reward formulation is coupled to its reference policy, and its theoretical guarantees ass...
- AI & ComputingOpen access
Cross model Direct Preference Optimization
Since direct preference optimization (DPO) was introduced in 2023, it has become a widely used preference optimization strategy for post-training large language models (LLMs). DPO's implicit reward formulation is coupled to its reference policy, and its theoretical guarantees ass...