Author

Rafayel Latif

0 works0 citationsORCID

Recent research

  • AI & ComputingOpen access

    Cross model transfer of Direct Preference Optimization

    Since direct preference optimization (DPO) was introduced in 2023, it has become a widely used preference optimization strategy for post-training large language models (LLMs). DPO's implicit reward formulation is coupled to its reference policy, and its theoretical guarantees ass...

    Zenodo (CERN European Organization for Nuclear Research)2026-08-090 citationsDOI
  • AI & ComputingOpen access

    Cross model transfer of Direct Preference Optimization

    Since direct preference optimization (DPO) was introduced in 2023, it has become a widely used preference optimization strategy for post-training large language models (LLMs). DPO's implicit reward formulation is coupled to its reference policy, and its theoretical guarantees ass...

    Zenodo (CERN European Organization for Nuclear Research)2026-08-090 citationsDOI
  • AI & ComputingOpen access

    Cross model Direct Preference Optimization

    Since direct preference optimization (DPO) was introduced in 2023, it has become a widely used preference optimization strategy for post-training large language models (LLMs). DPO's implicit reward formulation is coupled to its reference policy, and its theoretical guarantees ass...

    Zenodo (CERN European Organization for Nuclear Research)2026-08-090 citationsDOI