Kuantizasyon: modeli küçültmenin bedeli
Ağırlıkları daha az bitle saklamak belleği katlarca düşürüyor. Bedelin ne zaman kabul edilebilir, ne zaman felaket olduğunu ölçeceksin.
4 adım
225 XP
Ücretsiz hesap gerekiyor
Derse başla →
Kaynaklar
- Jacob, B. ve ark. 2018 · Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference · CVPR 2018
- Dettmers, T. ve ark. 2022 · LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale · NeurIPS 2022
- Frantar, E. ve ark. 2023 · GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers · ICLR 2023
- Dettmers, T. ve ark. 2023 · QLoRA: Efficient Finetuning of Quantized LLMs · NeurIPS 2023
ML Academy · tarayıcıda çalışan interaktif makine öğrenmesi kursu ·
Bütün dersler