Swahili Corpus
Published: 27 December 2023| Version 1 | DOI: 10.17632/d4yhn5b9n6.1
Contributors:
Noel Masasi, Description
The repository contains several text files each corresponding to categories of Swahili textual contents. The categories are Health (AFYA), Education (ELIMU), Government (SERIKALI), Parliament (BUNGE), Religion (DINI), Non-Governmental Organizations (NGOs) (MASHIRIKA YA KIRAIA), Social Media (MITANDAO YA KIJAMII), and Politics (SIASA).
Files
Steps to reproduce
1. Identification of Categories 2. Data Collection from Official Sources 3. Download PDF and DOCX Documents 4. Python Script for Merging Documents 5. Cleaning Script 6. Generate output category statistics
Categories
Natural Language Processing, Machine Learning, Swahili Language, Text Processing, Corpus Analysis