LLM-as-judge
Cevap kalitesini otomatik puanlamanın tek pratik yolu. Ama judge'ı doğrulamadan kullanmak, bozuk bir terazi ile tartmaktır.
1 adım
60 XP
Ücretsiz hesap gerekiyor
Derse başla →
Kaynaklar
- Zheng, L. ve ark. 2023 · Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena · NeurIPS 2023
- Wang, P. ve ark. 2023 · Large Language Models are not Fair Evaluators (konum yanlılığı) · ACL 2024
- Panickssery, A. ve ark. 2024 · LLM Evaluators Recognize and Favor Their Own Generations · NeurIPS 2024
- Cohen, J. 1960 · A Coefficient of Agreement for Nominal Scales (kappa) · Educational and Psychological Measurement, 20(1)
ML Academy · tarayıcıda çalışan interaktif makine öğrenmesi kursu ·
Bütün dersler