Swahili Corpus

Published: 27 December 2023| Version 1 | DOI: 10.17632/d4yhn5b9n6.1
Contributors:
Noel Masasi,

Description

The repository contains several text files each corresponding to categories of Swahili textual contents. The categories are Health (AFYA), Education (ELIMU), Government (SERIKALI), Parliament (BUNGE), Religion (DINI), Non-Governmental Organizations (NGOs) (MASHIRIKA YA KIRAIA), Social Media (MITANDAO YA KIJAMII), and Politics (SIASA).

Files

Steps to reproduce

1. Identification of Categories 2. Data Collection from Official Sources 3. Download PDF and DOCX Documents 4. Python Script for Merging Documents 5. Cleaning Script 6. Generate output category statistics

Categories

Natural Language Processing, Machine Learning, Swahili Language, Text Processing, Corpus Analysis

Licence