A machine learning project for predicting credit risk using the German Credit and Loan Approval datasets. The project compares multiple classification models, performs exploratory data analysis (EDA), applies feature engineering, and evaluates model performance.
- Logistic Regression, Random Forest, and Gradient Boosting
- Exploratory data analysis and visualizations
- Feature engineering
- Model comparison using Accuracy, Precision, Recall, F1 Score, and ROC-AUC
- Feature importance analysis
- 5-fold cross validation
- JSON report generation
- Saved trained models
git clone https://github.com/yourusername/credit-risk-analysis.git
cd credit-risk-analysis
pip install pandas numpy matplotlib seaborn scikit-learnpython credit_risk_analysis.pyThe script will:
- Load the datasets
- Perform EDA
- Train and evaluate models
- Generate visualizations
- Save the best models and report
credit-risk-analysis/
├── credit_risk_analysis.py
├── README.md
├── data/
└── output/
German Credit Dataset
- 1,000 samples
- 17 features
- Predicts loan default
Loan Approval Dataset
- 600+ samples
- 12 features
- Predicts loan approval
- Logistic Regression
- Random Forest
- Gradient Boosting
- EDA visualizations
- Model comparison plots
- ROC curves
- Confusion matrices
- Feature importance plots
- JSON report
- Trained model files (.pkl)
- Andy Zhu (AZ455)
- Jacob Cheng (JC3045)
Course: CS 439: Introduction to Data Science
MIT License