Skip to content

Repository files navigation

📊 Exploratory Data Analysis (EDA) Projects

This repository contains Exploratory Data Analysis (EDA) workflows for three datasets: Ford Used Cars, Heart Disease Diagnostic Data, and Medical Insurance Charges.

🛠️ Environment & Prerequisites

  • Python Version: Python 3.14+
  • Environment: Jupyter Notebook / VS Code

Installed Libraries (requirements.txt)

  • pandas - Data manipulation and analysis
  • numpy - Numerical computing
  • matplotlib - Static visualizations
  • seaborn - Statistical data visualization
  • scikit-learn - Machine learning preprocessing & baseline modeling
  • jupyter - Interactive notebook interface

🔬 Exploratory Data Analysis Workflow Steps

Across all three notebooks, the EDA follows a standardized 6-step workflow:

  1. Data Ingestion & Initial Inspection (.head(), .info(), .describe())

    • Loaded raw CSV files into Pandas DataFrames.
    • Examined data types, dataset shapes, and summary statistics.
  2. Data Cleaning & Preprocessing

    • Handled missing/null values and identified duplicate records.
    • Fixed column typos and ensured appropriate datatypes for features.
  3. Univariate Analysis

    • Plotted feature distributions using histograms, box plots, and count plots.
    • Identified and managed extreme outliers in numerical columns.
  4. Bivariate & Multivariate Analysis

    • Created heatmaps to observe correlation matrices between target and independent variables.
    • Generated pair plots and scatter plots to inspect feature interactions.
  5. Categorical Feature Encoding

    • Processed categorical variables using One-Hot and Label Encoding techniques for model readiness.
  6. Insights & Feature Summary

    • Extracted key business and clinical takeaways for reporting and future predictive modeling.

📂 Notebook Summaries

🚗 ford_car_datasate.ipynb

  • Dataset: ford.csv
  • Focus: Analyzed mileage, registration year, engine size, and fuel type correlations against car resale values.

❤️ heart EDA .ipynb

  • Dataset: heart.csv
  • Focus: Evaluated heart disease risk factors such as maximum heart rate, chest pain type, blood pressure, and age distributions.

🛡️ insurance EDA & Machin learning practice .ipynb

  • Dataset: insurance.csv
  • Focus: Examined primary drivers of medical costs (notably smoking status and BMI interactions) and built initial ML regression pipelines.

About

Python-based EDA portfolio showcasing data cleaning, feature analysis, statistical visualizations, and insight generation across multiple real-world datasets.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages