African Language Technologies
Most AI language models are trained predominantly on English and European languages. African languages remain severely underrepresented in AI research and deployment. KoralyxAI is building datasets, models, and evaluation benchmarks for African languages — starting with the languages of the DRC.
Priority Languages
Lingala
Region: DRC, Congo
Speakers: ~10M
Kikongo
Region: DRC, Angola
Speakers: ~8M
Tshiluba
Region: DRC
Speakers: ~8M
Congolese Swahili
Region: DRC, Uganda, Rwanda
Speakers: ~15M
French
Region: DRC, Africa-wide
Speakers:
Research Areas
Natural Language Processing
- • Language modeling
- • Text classification
- • Sentiment analysis
- • Named entity recognition
- • Tokenization
- • Embeddings
Speech AI
- • Automatic speech recognition
- • Text-to-speech synthesis
- • Speech datasets
- • Accent and dialect recognition
- • Speaker identification
Translation & Multilingualism
- • Machine translation
- • Code-switching
- • Multilingual models
- • Language transfer learning
- • Low-resource NLP techniques
Datasets & Benchmarks
- • Language corpora
- • Annotated datasets
- • Benchmark suites
- • Evaluation metrics
- • Open release on Hugging Face
Coming Soon
We are currently building our initial datasets, recruiting student researchers, and establishing partnerships. Check back for:
- • Lingala speech and text corpora
- • Kikongo language benchmarks
- • First language models trained on African data
- • Published research on low-resource NLP for African languages