Synthetic Stroke Prediction Dataset

Name: Synthetic Stroke Prediction Dataset
Creator: Mohammed Borhan Uddin
Published: 2025-05-02T09:39:38.951Z
Keywords: Machine Learning, Stroke, High Risk Behavior in Healthcare, Association Rule Learning, Binary Classification

Uddin, Mohammed Borhan

doi:10.17632/s2nh6fm925.1

Synthetic Stroke Prediction Dataset

Published: 2 May 2025| Version 1 | DOI: 10.17632/s2nh6fm925.1

Contributor:

Mohammed Borhan Uddin

Description

This dataset is a synthetic version inspired by the original "Stroke Prediction Dataset" on Kaggle. It contains anonymized, artificially generated data intended for research and model training on healthcare-related stroke prediction. The dataset generated using GPT-4o contains 50,000 records and 12 features. The target variable is stroke, a binary classification where 1 represents stroke occurrence and 0 represents no stroke. The dataset includes both numerical and categorical features, requiring preprocessing steps before analysis. A small portion of the entries includes intentionally introduced missing values to allow users to practice various data preprocessing techniques such as imputation, missing data analysis, and cleaning. The dataset is suitable for educational and research purposes, particularly in machine learning tasks related to classification, healthcare analytics, and data cleaning. No real-world patient information was used in creating this dataset.

Files

Institutions

Chittagong University of Engineering and Technology

Synthetic Stroke Prediction Dataset

Description

Files

Institutions

Categories

Related Links

Licence