A 4.2.1 / A 4.2.2 Data cleaning and feature selection
A4.2.1 emphasises data cleaning, as data quality directly impacts model performance. Techniques include handling outliers, removing duplicates, correcting/filtering data, transforming formats, and managing missing values via imputation/deletion/predictive modelling. A4.2.2 focuses on feature selection to identify and retain the most informative data attributes, using strategies like filter, wrapper, and embedded...