Pretrain / fine-tune / RLHF
Ham bir dil modeli ile sohbet edebileceğin bir asistan arasındaki fark. Ve bu farkın ne kadar ince olduğu.
2 adım
110 XP
Ücretsiz hesap gerekiyor
Derse başla →
Kaynaklar
- Ouyang, L. ve ark. 2022 · Training Language Models to Follow Instructions with Human Feedback (InstructGPT) · NeurIPS 2022
- Rafailov, R. ve ark. 2023 · Direct Preference Optimization (DPO) · NeurIPS 2023
- Zhou, C. ve ark. 2023 · LIMA: Less Is More for Alignment · NeurIPS 2023
- Bai, Y. ve ark. 2022 · Constitutional AI: Harmlessness from AI Feedback · arXiv:2212.08073
ML Academy · tarayıcıda çalışan interaktif makine öğrenmesi kursu ·
Bütün dersler