hendrydong
/

Mistral-RM-for-RAFT-GSHF-v0

Text Classification

text-generation-inference

Model card Files Files and versions Community

hendrydong commited on Mar 22, 2024

Commit

d6f5e57

·

verified ·

1 Parent(s): 0713a9f

Update README.md

Files changed (1) hide show

README.md +4 -1

README.md CHANGED Viewed

@@ -1,14 +1,17 @@
 The reward model may be used for iterative SFT/DPO
 @article{dong2023raft,
   title={Raft: Reward ranked finetuning for generative foundation model alignment},
   author={Dong, Hanze and Xiong, Wei and Goyal, Deepanshu and Pan, Rui and Diao, Shizhe and Zhang, Jipeng and Shum, Kashun and Zhang, Tong},
   journal={arXiv preprint arXiv:2304.06767},
   year={2023}
 }
 @article{xiong2023gibbs,
   title={Gibbs sampling from human feedback: A provable kl-constrained framework for rlhf},
   author={Xiong, Wei and Dong, Hanze and Ye, Chenlu and Zhong, Han and Jiang, Nan and Zhang, Tong},
   journal={arXiv preprint arXiv:2312.11456},
   year={2023}
-}

 The reward model may be used for iterative SFT/DPO
+```
 @article{dong2023raft,
   title={Raft: Reward ranked finetuning for generative foundation model alignment},
   author={Dong, Hanze and Xiong, Wei and Goyal, Deepanshu and Pan, Rui and Diao, Shizhe and Zhang, Jipeng and Shum, Kashun and Zhang, Tong},
   journal={arXiv preprint arXiv:2304.06767},
   year={2023}
 }
 @article{xiong2023gibbs,
   title={Gibbs sampling from human feedback: A provable kl-constrained framework for rlhf},
   author={Xiong, Wei and Dong, Hanze and Ye, Chenlu and Zhong, Han and Jiang, Nan and Zhang, Tong},
   journal={arXiv preprint arXiv:2312.11456},
   year={2023}
+}
+```