Class Imbalance
A situation where one class in a dataset contains significantly more samples than another, making model training and evaluation more challenging.
What is Class Imbalance?
Class imbalance is common in classification problems where one outcome naturally occurs less frequently than another. For example, fraudulent transactions may represent only a small percentage of all transactions. A model trained on such data may become biased toward the majority class and perform poorly at identifying less common but important cases. Techniques such as resampling, class weighting, and synthetic data generation can help address this imbalance.
Why is Class Imbalance Important?
Class imbalance can make metrics such as overall accuracy misleading. A model may appear accurate while consistently missing the minority class. Addressing imbalance helps improve detection performance and enables more meaningful evaluation using metrics such as precision, recall, and F1 score.
Common use cases
Class imbalance is commonly encountered in fraud detection, cybersecurity, medical diagnosis, fault detection, spam filtering, and rare-event prediction.