A Benchmark Dataset for Printed Meitei/Meetei Script Character Recognition

Name: A Benchmark Dataset for Printed Meitei/Meetei Script Character Recognition
Creator: Yanglem KHUMAN
Published: 2022-04-29T10:29:15.262Z
Keywords: Optical Character Recognition, Document Imaging, Natural Language Processing, Text Processing

KHUMAN, Yanglem; Devi, Salam Dickeeta; Devi, H Mamata; Singh, N Ajith; Ponykumar Singh, Chingakham

doi:10.17632/rw4b2zdk95.2

A Benchmark Dataset for Printed Meitei/Meetei Script Character Recognition

Published: 29 April 2022| Version 2 | DOI: 10.17632/rw4b2zdk95.2

Contributors:

Yanglem KHUMAN, Salam Dickeeta Devi, H Mamata Devi, N Ajith Singh, Chingakham Ponykumar Singh

Description

The Manipuri language is the official language of the Indian state of Manipur. The language belongs to the Tibeto-Burman family of languages. The dataset contains scanned 824 pages of printed documents, along with binarized images, text files, and XML files for each raw image. It also includes 51,460 isolated character samples, composed of 27 consonants, 7 half-consonants, 8 vowels, and 10 numerical. This dataset could be used not only for optical character recognition (OCR) research but also in the different research areas of natural language processing (NLP).

Files

Institutions

Manipur University

A Benchmark Dataset for Printed Meitei/Meetei Script Character Recognition

Description

Files

Institutions

Categories

Related Links

Licence