Eval seti kurmak
Prompt'unu iyileştirdiğini nereden biliyorsun? Ölçmüyorsan bilmiyorsun. Ve 10 örnekle ölçmek, ölçmemekten çok da iyi değil.
2 adım
120 XP
Kayıt olmadan açık
Derse başla →
Kaynaklar
- Wilson, E. B. 1927 · Probable Inference, the Law of Succession, and Statistical Inference · JASA, 22(158)
- Liang, P. ve ark. 2023 · Holistic Evaluation of Language Models (HELM) · TMLR
- Zheng, L. ve ark. 2023 · Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena · NeurIPS 2023
- Alpaydın, E. 1999 · Combined 5×2cv F Test for Comparing Supervised Classification Learning Algorithms · Neural Computation, 11(8)
ML Academy · tarayıcıda çalışan interaktif makine öğrenmesi kursu ·
Bütün dersler